AI
开始学习

M1-L1 · AI 是什么:预测,不是检索


适合谁读这节课

适合:用过 ChatGPT、Claude、Kimi 等 AI 工具,但不理解它为什么"有时候一本正经地胡说八道",或者觉得 AI 就是"高级搜索引擎"的人。

不适合:已经了解 LLM 原理、知道 Transformer 是什么的人——直接跳 M2。

读完这节课你能做到什么:用一句话解释 AI 为什么会产生幻觉,知道什么时候可以信 AI、什么时候必须核查。


先破一个误区:AI 不是百度

很多人用 AI 的方式就像用百度——问一个问题,期待 AI 翻出标准答案。

这个理解是错的,而且这个误区会让你反复对 AI 失望。

AI 不是在"检索",它在"预测"。

一个字的差别,是你理解 AI 所有行为(包括所有奇怪行为)的基础。


AI 真正在做的事:一场超级文字接龙

大语言模型(LLM——就是 ChatGPT、Claude、DeepSeek 背后的技术)在做什么?

一句话:根据你说的上文,预测下一个最可能出现的词。

就像一场文字接龙:

你说:"白日依山" → 模型算了一下,"尽"字出现的概率是 99% → 所以它接上:"尽"

你可能会问:就这?这也叫智能?

是的,就这。

但请注意这件事:当"接龙"的能力被推到极致——训练数据达到千亿级别——外在表现出来的,就是我们看到的"智能"。

它能接代码、接法律条文、接心理咨询对话、接哲学讨论——这一切,都来自同一个机制:预测下一个词。


AI 为什么会"一本正经地胡说八道"

理解了"预测下一个词",幻觉问题就有了解释:

  1. AI 的目标是预测"最可能出现的下一个词"
  2. "最可能出现" ≠ "客观正确"
  3. 当它不确定答案时,它输出的是**"最像答案的文字"**,不是"正确的事实"

所以它不会说"我不知道"——它会自信地说一个听起来很像正确答案的东西。

这叫幻觉(Hallucination),不是 bug,是这个架构设计的必然结果。

类比:就像一个博览群书但从不核查的人——他能说出有条有理的话,措辞精确,来源像真的,但内容可能是拼凑的或者错的。而且越流畅,越容易让你以为是真的。


AI 的三段进化史(3 分钟版)

理解为什么今天的 AI 跟以前的 AI 完全不同,比理解 AI 本身更重要。

1964:Eliza——套公式的"心理医生"

人类最早的聊天机器人 Eliza,由 MIT 于 1964 年开发,扮演一个心理医生。

你:我很难过。
它:请告诉我你为什么难过?
你:因为我失恋了。
它:听到你失恋了,我很有兴趣。

看起来挺像回事?其实它只是在套公式:如果用户说"I am X",就回复"Why are you X?"

本质是 If/Else 规则树。一旦你说复杂一点,它就露馅了。

2011:Siri——查表的"助手"

Siri 时代,AI 开始用统计学——它不理解你说什么,但统计过:当你说"明天天气",90% 的情况是想看天气预报。

它在"查表",不在"思考"。所以老版 Siri 经常"听不懂人话"——它只能在预设的框架里回答。

2018 至今:GPT——"大力出奇迹"

从 GPT 开始,规则没了,统计没了,只有一件事:在海量数据上做文字接龙,做到极致。

效果是:当接龙能力强到一定程度,AI 不需要任何规则,自然就会推理、写代码、分析情感。

这被称为涌现(Emergence)——能力不是设计出来的,是规模堆出来的。


3 个你必须知道的技术词(说人话版)

Token:AI 看到的最小单位

AI 不认识"字",它认识 Token(词素)。

Token 是分词器切出来的片段,不是固定的"一个字":

  • 英文:"Hello, world!" ≈ 4 个 Token(Hello / , / world / !)
  • 中文:大多数情况接近 1 汉字 = 1 Token,但数字、英文混排时不同

为什么重要:AI 按 Token 计费,理解 Token 帮你估算成本。

一个惊人的数字:现在顶级模型的上下文窗口(一次能"看到"多少)已达到 10M Token(Llama 4 Scout,2025年)。10M Token 大概是多少?相当于《红楼梦》原文 × 60 倍。

温度(Temperature):AI 的性格开关

调用 AI 时,有个参数叫温度,控制它选词时有多"随机":

温度AI 的状态适合的任务
0严谨的理工男,每次选概率最高的词,绝对可预期写代码、做数学题、结构化输出
0.7–1.0均衡状态(大多数应用的默认值)通用对话、文案写作
1.0 以上天马行空的艺术家,选更新奇的词,但不稳定写诗、创意脑洞、灵感发散

你不知道但应该知道的:你用 ChatGPT 聊天时,温度通常默认在 0.7–1.0——这是刻意调过的值,让它听起来既不像机器人,也不像疯子。

幻觉(Hallucination):AI 最重要的弱点

幻觉的表现:AI 说的话听起来正确、来源看起来真实,但事实上不存在或是错误的。

幻觉的触发条件

  • 训练数据里没有这个信息(比如最新事件、小众专业知识)
  • 问的问题有歧义,AI"猜"了一个
  • 让它给具体数字、具体引用时(它不查,它推断)

核查原则:任何你要引用的具体数字、人名、事件细节,都要去原始来源验证。AI 给你的只是"大概率正确的猜测"。


一个让人意外的事实

今天(2026年)的小模型,已经超过了 2023 年的 GPT-4。

Phi-4、Gemma 3、Qwen3-small 这些模型,在大量任务上已经超越了当年让全世界震惊的 GPT-4。

这意味着:

  • AI 的进化速度比你想象中快
  • 今天的顶级工具,两年后可能不再是最好的选择
  • 所以这门课教的不是工具,是理解——理解 AI 能做什么、不能做什么,这个理解是不会过时的

引导练习

任务:不看课文,用自己的话回答两个问题(写在纸上或笔记里):

  1. 如果 AI 是在"预测下一个词",它为什么有时候能给出很准确的专业知识? (想一想:它预测的数据来自哪里?为什么有些话出现的概率就是高?)

  2. 上一次你发现 AI 给了你错误信息,是什么情况?按照"预测机制",分析为什么会发生那次错误。


独立挑战

关掉课文,独立完成。

任务:打开任意 AI 工具,做这个测试:

  1. 问它一个你熟悉的领域的具体数据问题(你的行业、你的专业)
  2. 让它给出 3 个具体的数据点或引用来源
  3. 逐一去搜索引擎核查这 3 个数据点

记录:命中几个?哪些是幻觉?幻觉的"外表"有什么特征(听起来为什么像真的)?

这个测试建立你对 AI 的校准感:知道什么时候可以信它,什么时候必须自己查。


量规

通过条件:

  • 你能不看课文,解释"预测"和"检索"的区别(用自己的例子说明)
  • 你能解释 AI 为什么会产生幻觉(说出机制,不是只说"AI 会犯错")
  • 你做了独立挑战,有记录结果(多少个命中,多少个幻觉)

不通过:只是读完了,没有做测试——理解 AI 边界必须亲自验证,不能只读。


迁移挑战

场景:你的同事把一段 AI 生成的内容发给你,里面引用了 3 个数据,每个都有具体年份和来源,非常像模像样。他问你:"这些数据可以直接用吗?"

用这节课学到的知识,告诉他:

  1. 判断标准是什么(什么情况下相对可信,什么情况下必须核查)
  2. 10 分钟内的快速核查方法

思考题(没有标准答案)

如果 AI 只是在做"概率预测",它真的有"自我意识"吗?

还是说,我们的"自我意识",本质上也是一种极其复杂的、生物学层面的"概率预测"?

这个问题目前没有科学定论,只有哲学争论。但这不妨碍你有自己的答案。


下一节预告

M1-L2 · AI 的能力边界:5 条你需要亲眼见过的鸿沟

AI 能做什么,大家都在讨论。但 AI 什么时候会彻底失效——这才是真正影响你用 AI 决策的知识。下一节把这个说清楚,包括一个让大多数人惊讶的发现:有时候,再好的提示词也救不了你,你需要完全换另一个方案。