AI
开始学习

M1-L2 · AI 的五条能力边界:改再多提示词也没用的那些情况


适合谁读这节课

适合:已完成 M1-L1,理解了"AI 是预测而非检索",现在想知道"那什么时候用 AI 是在帮忙、什么时候是在浪费时间"的人。

不适合:希望学提示词技巧的人——那是模块 2 的内容。这节课先搞清楚提示词能解决什么、解决不了什么。

读完这节课你能做到什么:遇到一个任务,30 秒内判断适合用提示词解决、还是需要换方案(RAG / 微调 / 换工具)——这个判断能力,比任何提示词技巧都值钱。


先打碎一个幻觉

很多人用 AI 遇到问题,第一反应是"提示词没写好,换一种写法试试"。

改 5 次,改 10 次,改 20 次……结果还是不对。

这时候问题不在提示词。

有 5 类失效,是 AI 架构本身决定的,不是提示词写法的问题。认识这 5 类,能帮你在"改了 50 次还没效果"之前,提前判断出"这件事应该换方案了"。


五条能力边界

第一条:知识边界

表现:你问 AI 最新发生的事,或者问一个高度专业、小众领域的知识,它给你一本正经的错误信息。

根本原因:AI 的训练数据有截止日期。截止之后的事,它不知道。截止之前但覆盖极少的领域(小语种法律、本地政策、企业内部文档),它也可能完全空白。

提示词能解决吗? 不能。再好的提示词,也提取不出它没有的知识。

怎么解决:把信息先给它(直接粘贴相关文档、数据进对话),或者用搜索增强工具(Perplexity、秘塔 AI)让它"先查再答"。

一句话理解:你能要求厨师做得更好,但你不能要求他用厨房里没有的食材做菜。


第二条:推理极限

表现:你让 AI 解复杂数学题、做多步逻辑推理,它给出的答案看起来很像对的,但错了。

根本原因:标准的 LLM 做的是文字预测,不是符号推理。遇到需要精确计算、严密逻辑链条的题目,它会预测出"最像正确答案形式的文字",但不保证结果正确。

不是所有 AI 都一样:推理模型(o1、DeepSeek R1、Claude Extended Thinking)专门针对这类问题做了训练——它们在生成答案之前会先"慢慢想",推理能力比普通模型强很多。

提示词能解决吗? 部分——让它"一步一步思考"(Chain of Thought)对复杂推理有帮助,后面会专门讲。但对需要精确计算的数学题,最好配合代码执行工具(让它用 Python 算,而不是用语言预测)。

一个被忽视的事实:推理模型的计费和普通模型不同。你看不见的"思考过程"也在消耗 token(reasoning token),所以用推理模型处理简单任务,既贵又慢,完全没必要。


第三条:对齐冲突

表现:你想让 AI 做某件事,它拒绝了,或者给出一个高度过滤、过于保守的答案。

根本原因:AI 在训练时被植入了价值对齐(Alignment)——它被教导不去做某些事情,不是因为技术上做不到,而是因为被设定了边界。这叫对齐冲突:你的需求和 AI 的对齐设定之间产生了冲突。

提示词能解决吗? 合法合规的需求——换个措辞、提供上下文通常能解决(比如"我是医生写病例"、"我是安全研究员测试")。但如果是真正的对齐限制,改提示词没用。

一个不太被讨论的方面:对齐设定也会导致过度限制。完全合理的请求(涉及法律、医疗、金融话题)有时也会被拒绝。这时候换一家模型(不同家公司的对齐策略不同),或者提供更多背景说明,往往有效。


第四条:多模态盲区

表现:你给 AI 看一张图片,问它图里某个文字,或者让它做复杂视觉比对,结果不稳定。

根本原因:多模态 AI(能看图的那种)虽然能理解图片的大意,但对某类视觉任务处理能力很弱:

  • 图片中的细小文字(特别是手写)
  • 需要像素级精准的图像比对
  • 截图里的表格数据识别

提示词能解决吗? 极其有限。视觉处理能力是模型架构决定的,不是说话方式决定的。

怎么解决:把图片里的文字手动复制出来粘贴进去;用专门的 OCR 工具(而不是通用 AI)做表格提取。


第五条:涌现的不可预测性

表现:你在某个任务上用 AI,效果很好;换一个类似任务,突然效果很差。不知道为什么,换提示词也没用,换模型才解决。

根本原因:AI 的很多能力是"涌现"出来的——随着模型规模提升,某些能力突然出现,不是线性增长,也不是开发者有意设计的。这意味着:涌现能力在某些任务上有,在某些任务上没有,边界不规则,很难提前预测。

实际影响:不同模型在同一任务上的表现差距可能是 10 倍,而不是 10%。所以"换一个模型"有时候是最有效的解决方案,不是最后的手段。


四种常见失败模式

除了五条边界,还有 4 种日常使用的失败模式,见过一次就会对号入座:

失败模式表现本质原因
幻觉说了一个听起来对的、但不存在或错误的事实预测机制:最像答案的话 ≠ 正确的话(M1-L1 已讲)
越狱用迂回方式绕过了 AI 的限制,得到了原本会被拒绝的内容对齐是训练出来的,不是防火墙,有漏洞
背景假设冲突AI 的答案在某个它默认的前提下是对的,但和你的情况不符它在猜你的上下文,猜错了
格式混乱你要 JSON,它给了带说明的 JSON;你要列表,它给了大段落格式需要明确说,不能靠它默认选

核心决策表:用提示词,还是换方案?

这是这节课最重要的内容。

你的问题最适合的方案原因
AI 知识截止,不知道最新信息RAG / 搜索增强(给它文档,或用联网工具)补充它没有的知识
需要精确计算 / 严密逻辑推理推理模型(o1、DeepSeek R1 等)+ 代码执行语言预测不等于数学计算
需要它持续了解你的业务/风格微调(Fine-tuning)写 100 次"按我公司语气"不如直接训练一个版本
需要它做固定动作(查数据库、调 API)Function Calling / 工具调用让它"调用工具"而不是"预测答案"
提示词调了 50 次还没效果诊断是哪条边界,再选上面的方案不是提示词问题,是任务类型匹配问题
写作 / 改写 / 理解 / 总结 / 翻译直接用提示词这正是 LLM 最擅长的领域

RAG 的正确理解:RAG(检索增强生成)不是"让 AI 更聪明",是给 AI 接了一个搜索引擎——它还是那个 AI,只是现在可以先查到相关信息再回答,而不是完全靠训练数据猜。很多人以为上了 RAG 就解决了幻觉问题,这是误解——RAG 只解决了知识边界问题,不解决推理极限、对齐冲突等。


一个心理预期的校正

你不需要"治好"AI 的每个缺点。

每条边界都有对应的工程解法。你需要做的是:

  1. 认出这是哪条边界在起作用
  2. 判断这个场景值不值得用更重的方案
  3. 如果值得,换方案;如果不值得,接受局限,手动补足

判断"值不值得"的标准很简单

  • 这件事是偶尔做一次?→ 手动补足
  • 这件事是每天/每周反复发生?→ 值得上更完善的方案

引导练习

准备:你最近一次对 AI 感到失望的经历(AI 给了错误的、无用的、或者拒绝了的结果)。

任务

  1. 描述那次失败:你问了什么,AI 给了什么,哪里不对
  2. 对照五条边界:那次失败,最可能属于哪条?(知识边界 / 推理极限 / 对齐冲突 / 多模态盲区 / 涌现不可预测)
  3. 对照决策表:如果当时知道这个框架,你会怎么处理?

不是要你解决那个问题,是练习"诊断 AI 失效原因"这个动作——这个动作,是用好 AI 的底层能力。


独立挑战

关掉讲义,独立完成。

场景:你是内容团队负责人,同事跟你说了三件事:

  1. "我让 AI 帮我写了一段关于我们公司 Q3 业绩的分析,写得头头是道,但数据全是它自己编的。"
  2. "我让 AI 帮我把文章翻译成越南语,翻出来感觉哪里不对,但我不懂越南语,没法验证。"
  3. "我让 AI 帮我做一个竞争对手分析,它拒绝了,说这涉及竞争情报不能提供。"

用这节课的框架,分别告诉他:这是哪条边界在起作用,建议怎么处理。(三个场景各 2–3 句话就够)


量规

通过条件:

  • 你能说出五条边界的名字,并用自己的例子说明其中两条
  • 你能用决策表判断:一个具体任务应该用提示词、还是 RAG、还是推理模型
  • 你做了独立挑战,三个场景都给出了边界诊断和处理建议

不通过:只读完了但说不出某次 AI 失效属于哪条边界——这节课的核心是诊断能力,不是知识清单。


迁移挑战

场景:你要向不懂 AI 的老板解释:"为什么我们需要花时间搭建一个 RAG 系统,而不是直接用 ChatGPT 回答客户问题"。

用不超过 200 字,用这节课的框架解释:直接用 ChatGPT 的根本局限在哪里,RAG 解决了什么问题,还有什么问题 RAG 解决不了。


下一节预告

M1-L3 · 2026 年的 AI 工具地图:一次选定,不再纠结

现在 AI 工具已经不只是"ChatGPT 或者其他"——DeepSeek、Claude、Kimi 各有各的"个性"和擅长场景。下节课给你一个能用三年的选工具框架,不是评测排行,是决策逻辑。