学径XUEJING · 个人学习平台通知设置

课程库 AI 主线 AI 全景认知 › 第 2

神经网络的直觉 —— 它到底在"学"什么

普通课55 分钟

本课导读

上一课说深度学习用"多层神经网络"学习。这一课我们钻进网络内部,回答那个最根本的问题:机器"学习"的那一刻,到底发生了什么?学完本课,"训练"对你来说不再是黑话,而是一个你能向别人比划着讲清楚的具体过程。

3Blue1Brown《深度学习》第 1 集:神经网络的结构(官方双语)

观看要点

  • 每个神经元里住着一个 0-1 之间的数(激活值)——和讲义「神经元装着数字」是同一件事
  • 看 784 个像素如何排成第一层:机器眼中的手写数字,正是下文那个 28×28 的例子
  • 层与层之间的每根连线都是一个权重(旋钮)——留意视频里数出来的参数总量
  • 视频结尾留下的悬念「网络怎么学习」,正是本课后半部分损失与梯度下降的内容

看不了视频?文字讲义已覆盖全部内容,直接往下读即可。

说明

本课配套全网最好的神经网络可视化视频(上方位置嵌入)。文字讲义是完整独立的:先读文字再看视频、只读文字不看视频,都完全可以。视频的价值是把下面的文字"动"起来。

从一个具体问题开始:认出手写数字

神经网络最经典的入门例子:让机器认出手写的 0-9。这事对人毫不费力,但你试着写规则就会崩溃——每个人的"7"都长得不一样,有人带横杠,有人不带。

机器看到的是什么?一张 28×28 像素的灰度图,在机器眼里就是 784 个数字(每个像素一个亮度值,0 是黑,1 是白)。问题变成了:

输入 784 个数字 → ??? → 输出"这是 7"

神经网络就是中间那个"???"。

网络里有什么:神经元、层、权重

神经元:别被名字吓到,它就是一个装着数字的小格子(数字在 0 到 1 之间,代表这个神经元的"激活程度"——亮还是不亮)。

:神经元排成一列列。第一层就是输入本身(784 个格子);最后一层是 10 个格子,对应 0-9 十个数字,哪个格子最亮,网络就认为是哪个数字;中间的层负责加工。

权重相邻两层的神经元之间有连线,每根连线上有一个数字,叫权重。它决定上一层的亮暗对下一层影响多大——可以想成每根线上有个音量旋钮:拧大,前面的信号就传得响;拧到负数,前面越亮反而抑制后面。

信息就这样从左往右流:784 个像素值,经过一层层"加权汇总",最后汇成 10 个格子的亮度。整个网络的全部本事,都存在这些旋钮的读数里——上一课说的"参数",主要就是这些权重。一个认数字的小网络有约 1.3 万个旋钮,大语言模型有几千亿个。

关键问题:几万个旋钮,怎么调?

刚出厂的网络,旋钮全是随机值,输出纯属瞎猜。"学习"就是把这些旋钮调到正确位置的过程。但几万个旋钮,总不能靠人手拧吧?

分两步走。

第一步:先能打分。 拿一张标好答案的图("这是 7")给网络看。网络输出 10 个亮度,理想情况应该是"7 号格子全亮、其他全暗"。把实际输出和理想输出的差距算出来,得到一个数——损失(loss)。损失越大,错得越离谱。这下"学得好不好"从一句空话变成了一个可测量的数字。

第二步:往损失变小的方向拧。 这里有一个数学上的妙招:对每一个旋钮,都可以算出"往哪边拧一点点,损失会下降"(这就是你以后会听到的梯度)。于是每看一批例子,就把所有旋钮都往各自"让损失变小"的方向微调一格。这个过程叫梯度下降

下山的类比最贴切:你在浓雾弥漫的山上(损失就是海拔),看不见山谷在哪,但脚底能感觉出哪边是下坡。每一步都朝脚下最陡的下坡方向迈一小步,重复几百万次,就走到了谷底——损失很低,网络很准。

提示

一句话版本,讲给别人听:"训练神经网络 = 定义一个衡量错误程度的分数,然后用数学方法反复微调几万个旋钮,让这个分数一路下降。" 所谓"学习",就是这场大规模的自动调参。

它到底在"学"什么?

调完旋钮的网络,内部长出了什么?这是最迷人的部分。

理想化地讲:中间层的神经元各自变成了模式检测器。比如某个神经元学会了"看到左上角有一道横杠就亮",另一个学会了"看到一个圈就亮"。靠前的层检测简单模式(边缘、笔画),靠后的层把简单模式组合成复杂概念("一个圈+一条竖线 = 9")。

重点是:没有人设计这些检测器。没人告诉网络"要先找横杠"——这套分工是梯度下降在几百万次微调中自己"长"出来的,因为这样分工恰好能让损失最低。

所以回答本课标题的问题:神经网络学的不是"记住每张图",而是从数据里自己长出一套逐层提取特征的流程。这也解释了它为什么能认出从没见过的"7"——它认的是模式,不是原图。

注意

诚实的补充:真实网络内部远没有这么整齐,很多神经元检测的模式人类根本看不懂。"理解网络内部到底学了什么"(可解释性)至今仍是前沿研究领域。你只需要建立方向正确的直觉:分层提取模式,模式自己长成

连回大局

把这课和前面接上:

  • 上一课说"训练 = 用数据调整参数"——现在你知道参数主要是权重,调整的方法是梯度下降,指挥调整的是损失
  • 大语言模型也是同一套逻辑:只是网络大到几千亿个旋钮,"认数字"换成了"猜下一个词",损失衡量的是"猜得准不准"
  • 下一课就去看这场超大规模训练的全过程:大模型是怎么炼成的

随堂测验

随堂测验0 / 5 题正确

1. 神经网络中的“权重”,最贴切的比喻是?

2. 训练中的“损失”(loss)是什么?

3. “梯度下降”在下山类比里,对应的是哪个动作?

4. 训练完成后,网络中间层的神经元大致在做什么?

5. 关于“这些模式检测器是谁设计的”,正确的说法是?

延伸阅读(可选,跳过不影响主线)

  • 3Blue1Brown《深度学习》第 2 集:梯度下降(B 站官方双语 / YouTube)——把本课"下山"的类比展开成完整的可视化。

本课小结

  • 神经元 = 装数字的格子;权重 = 连线上的旋钮;网络的知识全在旋钮里
  • 训练两步走:损失给当前表现打分,梯度下降朝损失变小的方向微调所有旋钮
  • 网络学到的是"逐层的模式检测器",而且是自己长出来的
  • 大语言模型 = 同一套逻辑 × 几千亿旋钮 × "猜下一个词"的任务——下一课细讲

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…