本页目录

定位、三术语与裁判地图

第七站,一门研究型 seminar,不是一门定论课。它围绕一个问题:符号系统如何产生智能与文明? 前六站(AI 棕金 :8080 / AIGC 墨绿 :8081 / 数学 靛蓝 :8082 / 研究生数学 深紫 :8083 / 物理 深红 :8084 / 计算机 钢蓝 :8085)是可对标教材的知识体系;这一站不同——它的核心对象"意义"目前无法完全形式化,所以它教的不是答案,而是判断力:在这个问题上,哪里已经有科学,哪里仍然是哲学。 青碧主题,:8086。

0. 这门课为什么特殊

它既不是传统文科(它需要信息论、神经科学、AI),也不是传统理科(它的核心对象"意义"还没有统一理论)。它更像二十世纪初、量子力学之前的物理学:大量现象已被观察,但统一理论尚不存在。

对这种领域,唯一诚实的教法是全程标注每个论断的证据地位。本课的三档裁判标记,贯穿始终:

你学这门课最该带走的能力,就是自己给一个论断贴上【实/争/思】的标签。 这比记住任何一派的观点都值钱。

1. 广义的"语言"

日常"语言"指自然语言(汉语、英语)。本课用更广的定义:语言 = 一个用离散符号组合表达无穷意义的系统,它至少有

  1. 符号(离散、可组合的单位),
  2. 组合规则(有限规则生成无穷表达——递归/生成性),
  3. 约定(符号—意义的映射由群体共享,非天然)。

按这个定义,自然语言是原型,但数学记号、编程语言、DNA 密码、乐谱、货币、法律条文都部分具备语言性。这个广义定义让我们能问一个更大的问题:"用离散符号压缩并传递经验"这件事,本身是不是智能与文明的引擎?

2. 三个必须钉死的术语

本课最大的思维陷阱是把三个词当同义词用。它们不是一回事,任何时候看到有人从一个滑到另一个,就要警觉:

术语 定义 谁拥有 证据地位
智能(intelligence) 解决问题、达成目标的能力 人、动物、AI 都可能有 【实】可测量
语言能力(linguistic competence) 符号操作、生成合法表达的能力 人有;LLM 有相当程度 【实/争】可测量,"是否真懂"有争议
意识(consciousness) 主观体验、"感觉像某样东西" 人有;其余未知 【思】无客观判据

最常见的逻辑跳跃:\ "语言 → 智能,所以语言 → 意识。" ——这是三级跳,每一跳都要单独论证。 智能不蕴含意识(一个能解方程的系统未必有体验),语言能力不蕴含智能(能生成合法句子未必能解决问题)。本课把它们分开处理。

3. 三个因果问题(甲 / 乙 / 丙)

"语言产生智能"这个大问题,拆成三个不同的命题,全课按它们织:

4. 三条正交的争议轴

比"分甲乙丙"更细的一层:这个领域有至少三条互相独立的辩论轴。把它们讲成正交,是防止"语言中心主义"最有力的办法——混淆这三条轴,是本领域最常见的糊涂。

注意:轴 I(结构来源)和轴 II(语言—思想方向)是两回事,经常被搅在一起——一个人可以是先天论者又认为思想先于语言。保持它们独立。

5. 全课地图(导论 + 6 线 + 实验 + 收官)

线 主题 服务哪问
一 · 语言是什么 结构主义 / 生成 / 功能主义 / 认知语言学四传统 打地基
二 · 信息论(数学核心) 熵·Zipf / surprisal / 效率 / 三种压缩
三 · 从语料到意义 分布假说 / 可学习性 / 接地问题 / 三轴对峙 甲·乙
四 · 从个体到文明 文化演化 / 识字性 / 分布式认知 丙(文明)
五 · 预测的心智 预测脑 / 语言与思维 / 意识·自由能 乙·丙
六 · 机器里的语言与智能 涌现·世界模型 / 理解 / LLM 当语言理论实验室 甲前沿

实验双轨:代码实验(Zipf、word2vec、surprisal、世界模型探针)+ 思想实验(无语言者、给黑猩猩形式语言、只有视觉的 AI、失去文字的文明)——后者是"不可形式化部分"的实验。收官是你自己写的一份《语言—智能理论草案》立场论文。

6. 前置与互链

本课站在六站肩上:信息论(🔗 数学站/grad-math)、λ 演算与类型论(🔗 cs 站 pl 线、形式语义直接用)、统计学习理论(🔗 grad-math slt)、Scaling Laws 与 Transformer(🔗 ai 站 06/07)、乔姆斯基层级(🔗 cs 站 toc-01)。🔗 标记跨站/跨线引用。

7. 边界声明(一次说清)


下一页:线一——语言是什么。从索绪尔的符号开始:意义为什么是"差异"而不是"实体"。