M1-L1 · AI 是什么:预测,不是检索
适合谁读这节课
适合:用过 ChatGPT、Claude、Kimi 等 AI 工具,但不理解它为什么"有时候一本正经地胡说八道",或者觉得 AI 就是"高级搜索引擎"的人。
不适合:已经了解 LLM 原理、知道 Transformer 是什么的人——直接跳 M2。
读完这节课你能做到什么:用一句话解释 AI 为什么会产生幻觉,知道什么时候可以信 AI、什么时候必须核查。
先破一个误区:AI 不是百度
很多人用 AI 的方式就像用百度——问一个问题,期待 AI 翻出标准答案。
这个理解是错的,而且这个误区会让你反复对 AI 失望。
AI 不是在"检索",它在"预测"。
一个字的差别,是你理解 AI 所有行为(包括所有奇怪行为)的基础。
AI 真正在做的事:一场超级文字接龙
大语言模型(LLM——就是 ChatGPT、Claude、DeepSeek 背后的技术)在做什么?
一句话:根据你说的上文,预测下一个最可能出现的词。
就像一场文字接龙:
你说:"白日依山" → 模型算了一下,"尽"字出现的概率是 99% → 所以它接上:"尽"
你可能会问:就这?这也叫智能?
是的,就这。
但请注意这件事:当"接龙"的能力被推到极致——训练数据达到千亿级别——外在表现出来的,就是我们看到的"智能"。
它能接代码、接法律条文、接心理咨询对话、接哲学讨论——这一切,都来自同一个机制:预测下一个词。
AI 为什么会"一本正经地胡说八道"
理解了"预测下一个词",幻觉问题就有了解释:
- AI 的目标是预测"最可能出现的下一个词"
- "最可能出现" ≠ "客观正确"
- 当它不确定答案时,它输出的是**"最像答案的文字"**,不是"正确的事实"
所以它不会说"我不知道"——它会自信地说一个听起来很像正确答案的东西。
这叫幻觉(Hallucination),不是 bug,是这个架构设计的必然结果。
类比:就像一个博览群书但从不核查的人——他能说出有条有理的话,措辞精确,来源像真的,但内容可能是拼凑的或者错的。而且越流畅,越容易让你以为是真的。
AI 的三段进化史(3 分钟版)
理解为什么今天的 AI 跟以前的 AI 完全不同,比理解 AI 本身更重要。
1964:Eliza——套公式的"心理医生"
人类最早的聊天机器人 Eliza,由 MIT 于 1964 年开发,扮演一个心理医生。
你:我很难过。
它:请告诉我你为什么难过?
你:因为我失恋了。
它:听到你失恋了,我很有兴趣。
看起来挺像回事?其实它只是在套公式:如果用户说"I am X",就回复"Why are you X?"
本质是 If/Else 规则树。一旦你说复杂一点,它就露馅了。
2011:Siri——查表的"助手"
Siri 时代,AI 开始用统计学——它不理解你说什么,但统计过:当你说"明天天气",90% 的情况是想看天气预报。
它在"查表",不在"思考"。所以老版 Siri 经常"听不懂人话"——它只能在预设的框架里回答。
2018 至今:GPT——"大力出奇迹"
从 GPT 开始,规则没了,统计没了,只有一件事:在海量数据上做文字接龙,做到极致。
效果是:当接龙能力强到一定程度,AI 不需要任何规则,自然就会推理、写代码、分析情感。
这被称为涌现(Emergence)——能力不是设计出来的,是规模堆出来的。
3 个你必须知道的技术词(说人话版)
Token:AI 看到的最小单位
AI 不认识"字",它认识 Token(词素)。
Token 是分词器切出来的片段,不是固定的"一个字":
- 英文:
"Hello, world!"≈ 4 个 Token(Hello / , / world / !) - 中文:大多数情况接近 1 汉字 = 1 Token,但数字、英文混排时不同
为什么重要:AI 按 Token 计费,理解 Token 帮你估算成本。
一个惊人的数字:现在顶级模型的上下文窗口(一次能"看到"多少)已达到 10M Token(Llama 4 Scout,2025年)。10M Token 大概是多少?相当于《红楼梦》原文 × 60 倍。
温度(Temperature):AI 的性格开关
调用 AI 时,有个参数叫温度,控制它选词时有多"随机":
| 温度 | AI 的状态 | 适合的任务 |
|---|---|---|
| 0 | 严谨的理工男,每次选概率最高的词,绝对可预期 | 写代码、做数学题、结构化输出 |
| 0.7–1.0 | 均衡状态(大多数应用的默认值) | 通用对话、文案写作 |
| 1.0 以上 | 天马行空的艺术家,选更新奇的词,但不稳定 | 写诗、创意脑洞、灵感发散 |
你不知道但应该知道的:你用 ChatGPT 聊天时,温度通常默认在 0.7–1.0——这是刻意调过的值,让它听起来既不像机器人,也不像疯子。
幻觉(Hallucination):AI 最重要的弱点
幻觉的表现:AI 说的话听起来正确、来源看起来真实,但事实上不存在或是错误的。
幻觉的触发条件:
- 训练数据里没有这个信息(比如最新事件、小众专业知识)
- 问的问题有歧义,AI"猜"了一个
- 让它给具体数字、具体引用时(它不查,它推断)
核查原则:任何你要引用的具体数字、人名、事件细节,都要去原始来源验证。AI 给你的只是"大概率正确的猜测"。
一个让人意外的事实
今天(2026年)的小模型,已经超过了 2023 年的 GPT-4。
Phi-4、Gemma 3、Qwen3-small 这些模型,在大量任务上已经超越了当年让全世界震惊的 GPT-4。
这意味着:
- AI 的进化速度比你想象中快
- 今天的顶级工具,两年后可能不再是最好的选择
- 所以这门课教的不是工具,是理解——理解 AI 能做什么、不能做什么,这个理解是不会过时的
引导练习
任务:不看课文,用自己的话回答两个问题(写在纸上或笔记里):
-
如果 AI 是在"预测下一个词",它为什么有时候能给出很准确的专业知识? (想一想:它预测的数据来自哪里?为什么有些话出现的概率就是高?)
-
上一次你发现 AI 给了你错误信息,是什么情况?按照"预测机制",分析为什么会发生那次错误。
独立挑战
关掉课文,独立完成。
任务:打开任意 AI 工具,做这个测试:
- 问它一个你熟悉的领域的具体数据问题(你的行业、你的专业)
- 让它给出 3 个具体的数据点或引用来源
- 逐一去搜索引擎核查这 3 个数据点
记录:命中几个?哪些是幻觉?幻觉的"外表"有什么特征(听起来为什么像真的)?
这个测试建立你对 AI 的校准感:知道什么时候可以信它,什么时候必须自己查。
量规
通过条件:
- 你能不看课文,解释"预测"和"检索"的区别(用自己的例子说明)
- 你能解释 AI 为什么会产生幻觉(说出机制,不是只说"AI 会犯错")
- 你做了独立挑战,有记录结果(多少个命中,多少个幻觉)
不通过:只是读完了,没有做测试——理解 AI 边界必须亲自验证,不能只读。
迁移挑战
场景:你的同事把一段 AI 生成的内容发给你,里面引用了 3 个数据,每个都有具体年份和来源,非常像模像样。他问你:"这些数据可以直接用吗?"
用这节课学到的知识,告诉他:
- 判断标准是什么(什么情况下相对可信,什么情况下必须核查)
- 10 分钟内的快速核查方法
思考题(没有标准答案)
如果 AI 只是在做"概率预测",它真的有"自我意识"吗?
还是说,我们的"自我意识",本质上也是一种极其复杂的、生物学层面的"概率预测"?
这个问题目前没有科学定论,只有哲学争论。但这不妨碍你有自己的答案。
下一节预告
M1-L2 · AI 的能力边界:5 条你需要亲眼见过的鸿沟
AI 能做什么,大家都在讨论。但 AI 什么时候会彻底失效——这才是真正影响你用 AI 决策的知识。下一节把这个说清楚,包括一个让大多数人惊讶的发现:有时候,再好的提示词也救不了你,你需要完全换另一个方案。