学径XUEJING · 个人学习平台通知设置

课程库 AI 主线 pandas 数据处理 › 第 1

Jupyter/Colab 工作流 —— 数据人的工作台

普通课45 分钟

本课导读

从本单元起,你正式踏进数据处理的地界——这是 AI 工作的日常底座(喂给模型的永远是处理过的数据)。开工前先认识数据人的工作台:Notebook(笔记本)——一种"代码 + 结果 + 笔记"混排的工作方式,数据分析领域的事实标准。本课把本地 Jupyter 和云端 Colab 都配好,理解"单元格"工作流,为接下来七课的 pandas 之旅备好战场。预计 45 分钟。

为什么数据活儿不用普通脚本

.py 脚本的节奏是"写完 → 整体运行 → 看结果"。但数据分析是探索式的:读进一份表 → 看两眼 → 咦这列有脏数据 → 清一下再看 → 换个角度汇总看看……每一步都依赖上一步的结果,来回试错。要是每改一行都重跑整个脚本(重新读一遍大文件),人会疯。

Notebook 的解法:把代码切成一格一格的"单元格"(cell)——每格独立运行、结果就地显示、变量全程保留。读数据的那格跑一次就够,后面随便折腾。

提示

类比记忆:脚本像录播——一气呵成从头放到尾;Notebook 像直播做菜——切好的菜(变量)就在台面上,下一步随时取用,哪步咸了单独重做哪步。数据分析师和 AI 研究员的日常,几乎都住在 Notebook 里。

两个工作台:云端 Colab 与本地 Jupyter

Colab(云端)Jupyter(本地)
是什么Google 的免费在线 Notebook装在你电脑上的 Notebook
优点零配置、自带 pandas 全家桶、送免费 GPU数据不出门、无网可用、和本地文件无缝
缺点要外网、数据得上传要自己装
定位阶段 0 就认识的"大练习本"本单元起的主力工作台

阶段 4 训练模型时 Colab 的免费 GPU 会派上大用场;日常数据练习,本地更顺手。两个都备着。

分步配置本地工作台

分步操作

Notebook 的一个大坑:运行顺序

单元格可以乱序运行——这是灵活性,也是坑:

  • 你从上到下写了 5 格,但手动只运行了 1、3、5 → 第 3 格用到第 2 格的变量时报 NameError
  • 更阴险的反面:变量被后面的格子改了,回头重跑前面的格子,结果对不上

职业习惯两条:① 感觉状态乱了,就用"重启内核并全部运行"(Restart & Run All)从头来一遍——能干净跑通才算数;② 单元格顺序保持从上到下的逻辑流,别东一格西一格。

说明

双轨说明(本单元起生效):课程页面的代码块照常可以直接运行(pandas 首次加载约 10-20 秒,之后流畅),跟读课文用它最快;练习和折腾建议在本地 Notebook 里做——把课里的代码粘进单元格,边改边看。两边的代码一字不差通用。

随堂测验

随堂测验0 / 5 题正确

1. Notebook 相比普通 .py 脚本,最适合数据分析的原因是?

2. Shift + Enter 在 Notebook 里的作用是?

3. 第三格能直接用第二格定义的变量,说明?

4. Notebook 状态乱了(结果诡异、变量对不上),最干净的自救是?

5. Colab 和本地 Jupyter 的分工,课程的建议是?

本课小结

  • Notebook = 单元格化的探索式工作台:独立运行、结果就地显示、变量跨格共享;数据领域事实标准
  • 配齐三件:pip install pandas matplotlib jupyter + VS Code Jupyter 扩展 + 第一个 .ipynb
  • 两个高频动作:Shift+Enter 逐格推进;状态乱了 Restart & Run All
  • 双轨约定生效:页面代码块跟读,本地 Notebook 练习,代码通用

下一课主角登场:DataFrame——那张"会呼吸的 Excel 表",pandas 世界的中心。

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…