本页目录

机器 II · 预测等于理解吗

对标:Searle 1980、Bender & Koller 2020、Mitchell & Krakauer 2023《The debate over understanding》、Mahowald 等 2024(形式 vs 功能语言能力)、McCoy 等(分布外泛化)| 前置:mean-03(接地三层)、ai-01(世界模型)| 证据地位分层后可判【实/前沿】笼统的"懂不懂"【争/思】——本页教你为什么这个问题必须先拆再答。 轴 III 的正面决战。"LLM 懂不懂?"是过去几年吵得最凶、也最混乱的问题。本页的立场很明确:笼统地问"懂不懂"注定无解,因为吵架双方用着不同的"懂"。 用 mean-03 的三层接地把"理解"切开,一半的争论当场蒸发,剩下的一半才是真问题。

1. 为什么"懂不懂"是个坏问题

正方举证:LLM 能翻译、能解题、能通过专业考试、内部有世界模型(Othello-GPT,ai-01)——这不叫懂叫什么? 反方举证:它会一本正经胡说(幻觉)、在分布外脆断、被无关扰动骗、没有身体没有指涉——这明明是高级鹦鹉。

两边都有真证据,却吵不出结果——这是"问题问错了"的典型信号。根源:"理解"是个未拆解的合成词,双方各抓住它的一层,用同一个字互相否定。解法不是选边,是拆词。

2. 用三层接地拆"理解"(承 mean-03 §5)

把"LLM 理解 X"翻译成三个分别可判的命题:

"理解" = LLM 现状 裁判 分档
功能理解 能可靠地用 X 完成预测与任务 相当强(且随 scaling 升) 行为/基准 【实】
指涉理解 内部表征对应真实世界状态/结构 部分有(Othello-GPT、探针、机制可解释) probing / 干预 【实/前沿】
现象理解 对模型而言"有意义"、有体验 无判据 —— 【思】

一拆就清楚了

3. 章鱼与中文房间,重审

有了实证,回看 mean-03 的两个思想实验,它们依然有力,但边界更清楚了

净结论:两个经典论证没有过时,但它们证明的是"现象/强指涉理解不能从纯形式白拿",不是"LLM 什么都不懂"。把它们的射程精确划定,是本页的一大产出。

4. 真问题:形式能力 vs 功能能力的分裂

拆掉伪问题后,浮现出一个问题(Mahowald & Fedorenko 2024,接回 mind-02):LLM 展示了强大的形式语言能力(合语法、流畅、通语用),但其功能语言能力(用语言去可靠推理、规划、维持世界一致性)参差不齐——

这惊人地呼应人脑(mind-02):Fedorenko 的语言网络管形式,多需求网络管功能推理,两者分离。LLM 把两者塞进一个网络,于是形式能力先饱和、功能能力拖后腿——这也许正是"一个网络硬扛两种能力"的代价。核心张力在这里得到一个可检验的新形态:能否在 LLM 内部分离出"形式子回路"与"功能子回路"?若能,人机就在更深的层次上对应了(ai-03、机制可解释性)。

5. 泛化:理解的试金石

区分"懂"与"记/拟合"的最实用判据是分布外泛化(OOD generalization)

对你研究的价值:OOD 泛化是"预测=理解"最可操作的裁判。设计一个组合结构可控的任务,测模型外推到未见组合的能力——你就把轴 III 的哲学问题,做成了一条泛化曲线(labs L5 可扩展)。

6. 要点与思考

思考 1(本页最该带走的) "AI 懂不懂"——永远先反问"你说哪一层的懂"。功能层:懂(【实】)。指涉层:部分懂,正在验(【前沿】)。现象层:无法判定(【思】)。掌握这三层,你就免疫于这个领域一半的口水仗,也能一眼看出哪些"惊人论断"是层次混淆的产物。

思考 2(形式/功能分裂是金矿) LLM"形式强、功能弱"与人脑"语言网络 ⊥ 推理网络"的呼应,是全课最值得深挖的一条线。它把玄乎的"理解"落成一个可探测的架构问题:两种能力能否在机器内部分离?分离边界像不像人脑?——这是你够得着、又直击核心的研究方向。

思考 3(别双向神化) 两个陷阱等距:把 LLM 神化为"已经理解"(无视现象层无裁判、功能层的脆断),或贬低为"只是鹦鹉"(无视世界模型、指涉接地的实证)。清醒的位置在中间且分层:功能上强、指涉上部分、现象上未知。守住这个位置,你就既不被炒作裹挟,也不被犬儒蒙蔽。\(\blacksquare\)


下一页:机器 III——LLM 作为语言理论的实验室。线六收官,也是全课的会师:把前五线的每一个争论(先天/涌现、接地、语言/思维、理解)都当成一个可在 LLM 上做的实验。LLM 不只是研究对象,它是检验语言理论的模式生物。