本页目录
机器 II · 预测等于理解吗
对标:Searle 1980、Bender & Koller 2020、Mitchell & Krakauer 2023《The debate over understanding》、Mahowald 等 2024(形式 vs 功能语言能力)、McCoy 等(分布外泛化)| 前置:mean-03(接地三层)、ai-01(世界模型)| 证据地位:分层后可判【实/前沿】;笼统的"懂不懂"【争/思】——本页教你为什么这个问题必须先拆再答。 轴 III 的正面决战。"LLM 懂不懂?"是过去几年吵得最凶、也最混乱的问题。本页的立场很明确:笼统地问"懂不懂"注定无解,因为吵架双方用着不同的"懂"。 用 mean-03 的三层接地把"理解"切开,一半的争论当场蒸发,剩下的一半才是真问题。
1. 为什么"懂不懂"是个坏问题
正方举证:LLM 能翻译、能解题、能通过专业考试、内部有世界模型(Othello-GPT,ai-01)——这不叫懂叫什么? 反方举证:它会一本正经胡说(幻觉)、在分布外脆断、被无关扰动骗、没有身体没有指涉——这明明是高级鹦鹉。
两边都有真证据,却吵不出结果——这是"问题问错了"的典型信号。根源:"理解"是个未拆解的合成词,双方各抓住它的一层,用同一个字互相否定。解法不是选边,是拆词。
2. 用三层接地拆"理解"(承 mean-03 §5)
把"LLM 理解 X"翻译成三个分别可判的命题:
| 层 | "理解" = | LLM 现状 | 裁判 | 分档 |
|---|---|---|---|---|
| 功能理解 | 能可靠地用 X 完成预测与任务 | 相当强(且随 scaling 升) | 行为/基准 | 【实】 |
| 指涉理解 | 内部表征对应真实世界状态/结构 | 部分有(Othello-GPT、探针、机制可解释) | probing / 干预 | 【实/前沿】 |
| 现象理解 | 对模型而言"有意义"、有体验 | 无判据 | —— | 【思】 |
一拆就清楚了:
- 正方的证据主要落在功能层(会用、会做)——这里 LLM 确实"懂",【实】,无需争。
- 反方的攻击主要瞄准现象层与强指涉层(没身体、没体验、不真正"关于"世界)——现象层【思】无裁判,强指涉层是【前沿】正在验。
- 双方其实没在同一层交锋。承认这一点,"世纪之争"的一大半是术语误会。
3. 章鱼与中文房间,重审
有了实证,回看 mean-03 的两个思想实验,它们依然有力,但边界更清楚了:
- 章鱼/Bender–Koller(form ≠ meaning):正确地指出纯文本训练不保证指涉接地。但 ai-01 的世界模型证据表明:文本统计里泄漏的世界结构,比章鱼论证假设的多——模型能反解出部分指涉(棋盘、空间、颜色)。所以章鱼论证的正确版本是量的:"文本泄漏了多少世界结构、够支撑哪些任务",不是"零"。
- 中文房间/Searle(句法 ≠ 语义):正确地指出行为通过测试 ≠ 现象理解。但它对功能和指涉理解无杀伤力——一个系统完全可以既是"按规则动符号",又恰恰因此在内部建起了因果有效的世界模型。Searle 攻的是现象层,赢的也只在现象层。
净结论:两个经典论证没有过时,但它们证明的是"现象/强指涉理解不能从纯形式白拿",不是"LLM 什么都不懂"。把它们的射程精确划定,是本页的一大产出。
4. 真问题:形式能力 vs 功能能力的分裂
拆掉伪问题后,浮现出一个真问题(Mahowald & Fedorenko 2024,接回 mind-02):LLM 展示了强大的形式语言能力(合语法、流畅、通语用),但其功能语言能力(用语言去可靠推理、规划、维持世界一致性)参差不齐——
- 会写完美的证明格式,却在中间步骤算错;
- 语法完美,却在需要稳健世界模型处产生幻觉;
- 形式(form)已近乎解决,功能(function)远未。
这惊人地呼应人脑(mind-02):Fedorenko 的语言网络管形式,多需求网络管功能推理,两者分离。LLM 把两者塞进一个网络,于是形式能力先饱和、功能能力拖后腿——这也许正是"一个网络硬扛两种能力"的代价。核心张力在这里得到一个可检验的新形态:能否在 LLM 内部分离出"形式子回路"与"功能子回路"?若能,人机就在更深的层次上对应了(ai-03、机制可解释性)。
5. 泛化:理解的试金石
区分"懂"与"记/拟合"的最实用判据是分布外泛化(OOD generalization):
- 真理解应支持系统性组合(承 ling-02):懂了"A 及物化"和"B 名词",就该懂新组合。
- LLM 在分布内近乎完美,分布外则时好时坏——有真组合泛化的迹象,也有"表面启发式"(McCoy:模型常学到 shortcut 而非规则)的暴露。
- 这把"理解"变成可测曲线:不是是非题,而是"在多远的分布外、多大的组合空间上还稳"。
对你研究的价值:OOD 泛化是"预测=理解"最可操作的裁判。设计一个组合结构可控的任务,测模型外推到未见组合的能力——你就把轴 III 的哲学问题,做成了一条泛化曲线(labs L5 可扩展)。
6. 要点与思考
思考 1(本页最该带走的) "AI 懂不懂"——永远先反问"你说哪一层的懂"。功能层:懂(【实】)。指涉层:部分懂,正在验(【前沿】)。现象层:无法判定(【思】)。掌握这三层,你就免疫于这个领域一半的口水仗,也能一眼看出哪些"惊人论断"是层次混淆的产物。
思考 2(形式/功能分裂是金矿) LLM"形式强、功能弱"与人脑"语言网络 ⊥ 推理网络"的呼应,是全课最值得深挖的一条线。它把玄乎的"理解"落成一个可探测的架构问题:两种能力能否在机器内部分离?分离边界像不像人脑?——这是你够得着、又直击核心的研究方向。
思考 3(别双向神化) 两个陷阱等距:把 LLM 神化为"已经理解"(无视现象层无裁判、功能层的脆断),或贬低为"只是鹦鹉"(无视世界模型、指涉接地的实证)。清醒的位置在中间且分层:功能上强、指涉上部分、现象上未知。守住这个位置,你就既不被炒作裹挟,也不被犬儒蒙蔽。\(\blacksquare\)
下一页:机器 III——LLM 作为语言理论的实验室。线六收官,也是全课的会师:把前五线的每一个争论(先天/涌现、接地、语言/思维、理解)都当成一个可在 LLM 上做的实验。LLM 不只是研究对象,它是检验语言理论的模式生物。