学径XUEJING · 个人学习平台通知设置

课程库 AI 主线 AI 全景认知 › 第 1

AI、机器学习、深度学习、LLM —— 一张图理清四个套娃概念

普通课50 分钟

本课导读

AI、机器学习、深度学习、大语言模型——这四个词你肯定都见过,也大概率被它们绕晕过。学完本课,你能把四者的关系画成一张图讲给别人听,并且能一眼识破"AI 就是 ChatGPT"这类常见的说法错在哪。这是后面所有课程的地基。

先看图:一组套娃

这四个概念不是四个并列的东西,而是一层套一层的关系,像套娃:

人工智能(AI)

让机器做"需要智能的事"——一个大目标

机器学习(ML)

实现 AI 的主流方法:从数据里学规律

深度学习(DL)

用"多层神经网络"来学的机器学习

大语言模型(LLM)

用深度学习在海量文本上炼成的超大模型

从外到内:AI 是目标,机器学习是方法,深度学习是方法中的一支,大语言模型是这一支结出的一个果实(ChatGPT 背后就是它)。

下面一层层拆开看。

第一层:人工智能(AI)——一个目标

人工智能(Artificial Intelligence,AI)是最外面的大圈,它其实不是某项具体技术,而是一个目标:让机器去做那些"通常需要人类智能才能完成"的事——认出照片里的人、听懂一句话、下赢一盘棋、规划一条路线。

打个比方:「让家里人吃上晚饭」是一个目标。实现它的方式有很多——自己做、点外卖、下馆子。AI 就是"让机器变聪明"这个目标本身,至于怎么实现,圈里有不同的路线。

早期的主流路线是规则系统:程序员把人的知识写成一条条"如果…就…"的规则。比如早年的垃圾邮件过滤:"如果邮件里出现'中奖'两个字,就扔进垃圾箱"。这条路线的问题你可以想象——世界太复杂,规则永远写不完,而且垃圾邮件的发送者换个词就绕过去了。

说明

所以"AI"这个词涵盖的范围很广:几十年前的规则系统是 AI,今天的 ChatGPT 也是 AI。这也是为什么单说"我在用 AI"信息量很低——就像只说"我解决了晚饭问题",没说是做的还是点的。

第二层:机器学习(ML)——换一种思路的方法

机器学习(Machine Learning,ML)是 AI 圈里如今的主流路线。它的核心思想只有一句话:

别再逐条教机器规则了,给它看大量例子,让它自己总结规律。

想想你怎么教一个小孩认识"狗"。你不会给他念定义——"四足哺乳动物,犬科,有毛……"——你只是在路上见到狗就指给他看:"这是狗。"见过几十只之后,他自己就总结出了"狗长什么样",连没见过的品种也认得出。

机器学习就是这个过程的工程版:

  • 例子(数据):几万封已经标好"垃圾/正常"的邮件
  • 自己总结(训练):算法反复看这些邮件,调整内部的判断依据
  • 总结出的规律(模型):一个能给新邮件打分的程序——"这封 92% 像垃圾邮件"

这里出现了两个你以后天天会见到的词:训练(用数据调教的过程)和模型(调教出来的成品)。模型本质上是一个"输入 → 输出"的函数:进一封邮件,出一个判断。

传统编程和机器学习的区别,可以这样记:

传统编程机器学习
人提供什么规则例子(数据)
机器做什么按规则执行从例子里总结规律
适合的问题规则说得清(算工资、算税)规则说不清(认人脸、听语音)

"规则说不清"是关键。你能写出"怎么算个人所得税"的完整规则,但你写不出"怎么认出一张脸"的规则——你自己会认脸,却说不清是怎么认的。凡是"人会做但说不清怎么做"的事,就是机器学习的主场。

第三层:深度学习(DL)——用"深"网络学习

机器学习圈里又有很多种具体的学法(后面阶段 2 会正式认识几种)。其中一支从 2012 年起一骑绝尘,几乎以一己之力带来了这波 AI 浪潮——它就是深度学习(Deep Learning,DL)。

深度学习的特点是用神经网络来学习——一种受大脑神经元启发的计算结构。而"深度"指的是这个网络层数多

层数多有什么用?想想一道菜的加工链:洗菜 → 切菜 → 腌制 → 下锅 → 调味。每道工序都在前一道的基础上加工,越往后越接近成品。深层神经网络也是这样逐层加工信息的。以认照片为例,大致是:

  1. 前面的层识别最基础的东西:边缘、亮暗
  2. 中间的层把边缘拼成形状:圆形、条纹
  3. 更深的层把形状拼成部件:眼睛、耳朵、轮子
  4. 最后的层给出结论:"这是一只猫"

没有任何人告诉网络"要先找边缘再找眼睛"——这套流水线是它在训练中自己长出来的。这正是深度学习强大的原因:连"该提取什么特征"都不用人教。

提示

记住这个对应关系:深度学习一定是机器学习(它是机器学习的一种),但机器学习不一定是深度学习(还有很多不用神经网络的学法)。下一课我们会钻进神经网络内部,看看"学习"在数学上到底发生了什么。

第四层:大语言模型(LLM)——这波浪潮的主角

大语言模型(Large Language Model,LLM)是深度学习家族里专攻语言的一类模型,也是你这两年感受到的 AI 巨变的直接来源。

拆开这个名字:

  • 语言模型:它学习的材料是文字。训练目标简单到令人意外——猜下一个词。给它"今天天气真",它要猜出"好"。就靠这一个朴素的游戏,在读过互联网规模的文本后,它硬是学出了语法、知识、推理甚至写代码的能力。
  • :大在两处。一是参数多——参数是模型内部可调节的"旋钮",训练调的就是它们,主流 LLM 的参数以千亿计;二是训练数据多——几乎读遍了公开互联网的文本。

注意

注意区分模型产品:GPT、Claude 这类是模型(引擎),ChatGPT 是把模型包装成对话应用的产品(整车)。就像发动机和汽车的关系——日常口语里常混着说,但你既然要转行进这个行业,从今天起就把它们分开。

另外你还会常听到一个词:生成式 AI(Generative AI)——所有"能产出新内容"的 AI 的统称,产文字的 LLM、产图片的绘画模型都算。它和这组套娃是交叉关系,不在主线上,知道即可。

回到那张图

现在可以把套娃图收进一句话里:

AI 是目标,机器学习是实现它的主流方法,深度学习是机器学习中最能打的一支,大语言模型是深度学习在语言上炼出的超大模型。

以后再有人把这四个词混着用,你脑子里会自动浮现四个套娃——这就是"建立了概念框架"的感觉。整个阶段 0 到阶段 2,我们都会在这张图上逐步填入细节。

随堂测验

随堂测验0 / 5 题正确

1. 四个概念按范围从大到小排列,正确的是?

2. 机器学习和传统编程最本质的区别是什么?

3. 深度学习里的“深”指的是什么?

4. ChatGPT 和大语言模型(LLM)的关系,下面哪个说法最准确?

5. 下面哪句话是正确的?

延伸阅读(可选,跳过不影响主线)

  • 吴恩达《AI for Everyone》第一周(Coursera,可免费旁听,有中文字幕)——面向非技术人的 AI 全景,和本课视角互补。

划选正文任意文字可高亮、批注或加入复习卡

讨论

载入中…