幻觉、能力边界与正确预期 —— 什么该信、什么要验证
普通课约 50 分钟
本课导读
AI 会一本正经地编造不存在的东西——这个现象叫幻觉,它是你使用 AI 的最大风险,也是外行和高手的分水岭。学完本课,你能解释幻觉的根源(不是 bug,是天性)、判断哪类任务幻觉风险高,并掌握一套实用的验证策略。
先看看幻觉长什么样
真实世界里反复发生的场景:
- 让 AI 推荐参考文献,它给出标题、作者、年份俱全的论文——去查,根本不存在
- 问它某个法条的内容,它引用得有模有样——条款号是编的
- 问一个冷门 API 的用法,它写出流畅的示例代码——那个函数不存在
注意共同点:编造的内容格式完美、语气笃定。它不是支支吾吾地猜,而是自信满满地错——这正是幻觉危险的地方。
为什么会幻觉:回到"猜下一个词"
想理解幻觉,把前几课的知识串起来就够了。
模型的本质是猜下一个 Token 的概率引擎。它被训练去生成"看起来最像会出现在这里的文字"。注意这个目标——是"像真的",不是"是真的"。
当你问它一篇冷门领域的论文时,它的训练数据里有几百万条"论文引用长什么样"的模式:作者名、年份、期刊名的组合规律它烂熟于心。于是它流畅地按模式生成了一条完美的引用——每个零件都真实可信,组合出来的整体却从未存在。
类比:一个考试从不留空的学生。不会的题,他也能按"标准答案的样子"写出一段有模有样的内容——格式满分,内容是编的。模型没有"我不知道"的本能,因为训练目标从来不是"诚实地承认无知",而是"接出最像样的下文"。
说明
所以幻觉不是偶发故障,而是这套机制的固有属性。RLHF 等技术在努力让模型更多说"我不确定",新一代模型的幻觉率也确实在降,但只要底层还是概率引擎,幻觉就不会归零。你的应对方案不是等一个"不幻觉的模型",而是学会分场景使用与验证。
风险地图:哪里高发,哪里安全
幻觉率不是均匀分布的。判断标准一句话:任务越依赖"精确的事实",风险越高;越依赖"语言能力本身",风险越低。
| 风险 | 任务类型 | 例子 |
|---|---|---|
| 🟢 低 | 改写、润色、翻译 | "把这段话改得更简洁" |
| 🟢 低 | 头脑风暴、起草 | "给活动策划出 10 个点子" |
| 🟢 低 | 解释通用概念 | "用类比解释什么是利率" |
| 🟡 中 | 总结你提供的材料 | 偶尔夹带原文没有的内容 |
| 🔴 高 | 具体事实、数据、日期 | "某公司去年的营收是多少" |
| 🔴 高 | 引用与出处 | 论文、法条、名人名言 |
| 🔴 高 | 冷门领域细节 | 小众工具的配置参数 |
| 🔴 高 | 最新事件 | 训练截止日期之后的一切 |
绿区任务里,素材是你给的,它只是加工语言——这是它的绝对主场。红区任务里,它在凭"印象"复述世界,就要当心了。
边界还有两条:知识截止与算术
除幻觉外,还有两条固定边界要知道:
- 知识截止日期:训练数据收集到某个时间点为止,之后的世界它一无所知(除非产品接了搜索)。问它"今年"的事之前,先想想它的"今年"是哪年。
- 算术与计数:上一课已经看到它连字母都数不清。多位数乘法、精确统计同理——它在"猜答案长什么样",不是在计算。靠谱的做法是让它写代码算(阶段 3 会学工具调用,就是系统化地解决这类问题)。
验证策略:高手的四个习惯
- 要出处,并且真去点:让它给来源链接,然后亲自打开验证。给不出或者链接失效,就当它是编的。
- 高风险内容交叉验证:涉及决策的事实(数字、法律、医疗、金钱),用搜索引擎或权威来源二次确认。原则:AI 负责起草,你负责事实。
- 给它开"允许不知道"的口子:提问时加一句"不确定就直说,不要编"。这不能根治幻觉,但能显著降低硬编的概率。
- 用对产品:查最新信息时,用带联网搜索的 AI 产品(它会先搜再答,且给出链接)——这比逼一个离线模型回忆要靠谱得多。
注意
一条铁律:AI 输出的任何将要进入你正式工作成果的事实,必须经过人工验证。 把它当"极其博学但偶尔自信说错话的顾问":顾问的分析和草稿价值巨大,但签字画押之前,数字你得自己核。
正确预期:既不神化,也不弃用
两种极端都会让你吃亏:因为它编过一次参考文献就宣布"AI 不可信,再也不用",和把它的每句话当百科全书,同样错误。
成熟的用法是按风险分区:绿区大胆用(它比你写得快、想得广),红区谨慎用(它起草、你验证)。这套判断力,就是从今天起你比大多数 AI 用户领先的地方。
随堂测验
1. AI 幻觉的根本原因是什么?
2. 下面哪类任务的幻觉风险最低?
3. 为什么让模型直接做多位数乘法不可靠?
4. AI 给了你一条论文引用,作者、年份、期刊俱全。正确的处理方式是?
5. 对 AI 的“正确预期”,最贴切的比喻是?
本课小结
- 幻觉 = 概率引擎的天性:目标是"像真的",不是"是真的";格式完美 ≠ 内容真实
- 风险地图:语言加工是绿区,精确事实是红区;另有知识截止与算术两条硬边界
- 四个习惯:要出处、交叉验证、允许说不知道、用带搜索的产品
- 铁律:AI 起草,你验证——进正式成果的事实必须人工核对
下一课把视角反过来:既然它有这些脾气,高手是怎么把它用出十倍价值的。
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…