课程库 › AI 主线 › pandas 数据处理 › 第 1 课
Jupyter/Colab 工作流 —— 数据人的工作台
普通课约 45 分钟
本课导读
从本单元起,你正式踏进数据处理的地界——这是 AI 工作的日常底座(喂给模型的永远是处理过的数据)。开工前先认识数据人的工作台:Notebook(笔记本)——一种"代码 + 结果 + 笔记"混排的工作方式,数据分析领域的事实标准。本课把本地 Jupyter 和云端 Colab 都配好,理解"单元格"工作流,为接下来七课的 pandas 之旅备好战场。预计 45 分钟。
为什么数据活儿不用普通脚本
写 .py 脚本的节奏是"写完 → 整体运行 → 看结果"。但数据分析是探索式的:读进一份表 → 看两眼 → 咦这列有脏数据 → 清一下再看 → 换个角度汇总看看……每一步都依赖上一步的结果,来回试错。要是每改一行都重跑整个脚本(重新读一遍大文件),人会疯。
Notebook 的解法:把代码切成一格一格的"单元格"(cell)——每格独立运行、结果就地显示、变量全程保留。读数据的那格跑一次就够,后面随便折腾。
提示
类比记忆:脚本像录播——一气呵成从头放到尾;Notebook 像直播做菜——切好的菜(变量)就在台面上,下一步随时取用,哪步咸了单独重做哪步。数据分析师和 AI 研究员的日常,几乎都住在 Notebook 里。
两个工作台:云端 Colab 与本地 Jupyter
| Colab(云端) | Jupyter(本地) | |
|---|---|---|
| 是什么 | Google 的免费在线 Notebook | 装在你电脑上的 Notebook |
| 优点 | 零配置、自带 pandas 全家桶、送免费 GPU | 数据不出门、无网可用、和本地文件无缝 |
| 缺点 | 要外网、数据得上传 | 要自己装 |
| 定位 | 阶段 0 就认识的"大练习本" | 本单元起的主力工作台 |
阶段 4 训练模型时 Colab 的免费 GPU 会派上大用场;日常数据练习,本地更顺手。两个都备着。
分步配置本地工作台
Notebook 的一个大坑:运行顺序
单元格可以乱序运行——这是灵活性,也是坑:
- 你从上到下写了 5 格,但手动只运行了 1、3、5 → 第 3 格用到第 2 格的变量时报 NameError
- 更阴险的反面:变量被后面的格子改了,回头重跑前面的格子,结果对不上
职业习惯两条:① 感觉状态乱了,就用"重启内核并全部运行"(Restart & Run All)从头来一遍——能干净跑通才算数;② 单元格顺序保持从上到下的逻辑流,别东一格西一格。
说明
双轨说明(本单元起生效):课程页面的代码块照常可以直接运行(pandas 首次加载约 10-20 秒,之后流畅),跟读课文用它最快;练习和折腾建议在本地 Notebook 里做——把课里的代码粘进单元格,边改边看。两边的代码一字不差通用。
随堂测验
1. Notebook 相比普通 .py 脚本,最适合数据分析的原因是?
2. Shift + Enter 在 Notebook 里的作用是?
3. 第三格能直接用第二格定义的变量,说明?
4. Notebook 状态乱了(结果诡异、变量对不上),最干净的自救是?
5. Colab 和本地 Jupyter 的分工,课程的建议是?
本课小结
- Notebook = 单元格化的探索式工作台:独立运行、结果就地显示、变量跨格共享;数据领域事实标准
- 配齐三件:
pip install pandas matplotlib jupyter+ VS Code Jupyter 扩展 + 第一个 .ipynb - 两个高频动作:Shift+Enter 逐格推进;状态乱了 Restart & Run All
- 双轨约定生效:页面代码块跟读,本地 Notebook 练习,代码通用
下一课主角登场:DataFrame——那张"会呼吸的 Excel 表",pandas 世界的中心。
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…