本页目录
定位、三术语与裁判地图
第七站,一门研究型 seminar,不是一门定论课。它围绕一个问题:符号系统如何产生智能与文明? 前六站(AI 棕金 :8080 / AIGC 墨绿 :8081 / 数学 靛蓝 :8082 / 研究生数学 深紫 :8083 / 物理 深红 :8084 / 计算机 钢蓝 :8085)是可对标教材的知识体系;这一站不同——它的核心对象"意义"目前无法完全形式化,所以它教的不是答案,而是判断力:在这个问题上,哪里已经有科学,哪里仍然是哲学。 青碧主题,:8086。
0. 这门课为什么特殊
它既不是传统文科(它需要信息论、神经科学、AI),也不是传统理科(它的核心对象"意义"还没有统一理论)。它更像二十世纪初、量子力学之前的物理学:大量现象已被观察,但统一理论尚不存在。
对这种领域,唯一诚实的教法是全程标注每个论断的证据地位。本课的三档裁判标记,贯穿始终:
- 【实】 有裁判——可形式证明 / 信息论可算 / 可实验验证。这里我能教到扎实、可对标教材。
- 【争】 活跃争议——有证据但无定论。我摆各派立场与证据,不替你下结论。
- 【思】 思辨/前沿未定——迷人但没有"编译器",明确标出,绝不冒充科学结论。
你学这门课最该带走的能力,就是自己给一个论断贴上【实/争/思】的标签。 这比记住任何一派的观点都值钱。
1. 广义的"语言"
日常"语言"指自然语言(汉语、英语)。本课用更广的定义:语言 = 一个用离散符号组合表达无穷意义的系统,它至少有
- 符号(离散、可组合的单位),
- 组合规则(有限规则生成无穷表达——递归/生成性),
- 约定(符号—意义的映射由群体共享,非天然)。
按这个定义,自然语言是原型,但数学记号、编程语言、DNA 密码、乐谱、货币、法律条文都部分具备语言性。这个广义定义让我们能问一个更大的问题:"用离散符号压缩并传递经验"这件事,本身是不是智能与文明的引擎?
2. 三个必须钉死的术语
本课最大的思维陷阱是把三个词当同义词用。它们不是一回事,任何时候看到有人从一个滑到另一个,就要警觉:
| 术语 | 定义 | 谁拥有 | 证据地位 |
|---|---|---|---|
| 智能(intelligence) | 解决问题、达成目标的能力 | 人、动物、AI 都可能有 | 【实】可测量 |
| 语言能力(linguistic competence) | 符号操作、生成合法表达的能力 | 人有;LLM 有相当程度 | 【实/争】可测量,"是否真懂"有争议 |
| 意识(consciousness) | 主观体验、"感觉像某样东西" | 人有;其余未知 | 【思】无客观判据 |
最常见的逻辑跳跃:\ "语言 → 智能,所以语言 → 意识。" ——这是三级跳,每一跳都要单独论证。 智能不蕴含意识(一个能解方程的系统未必有体验),语言能力不蕴含智能(能生成合法句子未必能解决问题)。本课把它们分开处理。
3. 三个因果问题(甲 / 乙 / 丙)
"语言产生智能"这个大问题,拆成三个不同的命题,全课按它们织:
- (甲) 工程 / 认识论:为什么"预测下一个符号"在大语料上能长出广谱能力?——最可解,有实证。(线二、线六)
- (乙) 认知:人类智能是否源于语言,还是语言只是叠在非语言认知之上的工具?——存疑,证据两边拉扯。(线五)
- (丙) 现象 / 文明:语言是否使意识、以及使集体文明成为可能?——思辨(意识)与可考据(文明)并存。(线四、线五)
4. 三条正交的争议轴
比"分甲乙丙"更细的一层:这个领域有至少三条互相独立的辩论轴。把它们讲成正交,是防止"语言中心主义"最有力的办法——混淆这三条轴,是本领域最常见的糊涂。
- 轴 I · 结构从哪来:语言结构是先天的(Chomsky 普遍语法)还是从数据涌现的(连接主义/用进派)?→ 线一、线三
- 轴 II · 语言与思想的方向:语言塑造思想(Whorf、Vygotsky、认知语言学)/思想先于语言(Piaget、Tomasello)/二者共同演化(反馈回路,本课认为最可信)?→ 线四、线五
- 轴 III · 预测等于理解吗:统计预测能否产生真正的理解与规则(中文房间 ↔ 世界模型)?→ 线六
注意:轴 I(结构来源)和轴 II(语言—思想方向)是两回事,经常被搅在一起——一个人可以是先天论者又认为思想先于语言。保持它们独立。
5. 全课地图(导论 + 6 线 + 实验 + 收官)
| 线 | 主题 | 服务哪问 |
|---|---|---|
| 一 · 语言是什么 | 结构主义 / 生成 / 功能主义 / 认知语言学四传统 | 打地基 |
| 二 · 信息论(数学核心) | 熵·Zipf / surprisal / 效率 / 三种压缩 | 甲 |
| 三 · 从语料到意义 | 分布假说 / 可学习性 / 接地问题 / 三轴对峙 | 甲·乙 |
| 四 · 从个体到文明 | 文化演化 / 识字性 / 分布式认知 | 丙(文明) |
| 五 · 预测的心智 | 预测脑 / 语言与思维 / 意识·自由能 | 乙·丙 |
| 六 · 机器里的语言与智能 | 涌现·世界模型 / 理解 / LLM 当语言理论实验室 | 甲前沿 |
实验双轨:代码实验(Zipf、word2vec、surprisal、世界模型探针)+ 思想实验(无语言者、给黑猩猩形式语言、只有视觉的 AI、失去文字的文明)——后者是"不可形式化部分"的实验。收官是你自己写的一份《语言—智能理论草案》立场论文。
6. 前置与互链
本课站在六站肩上:信息论(🔗 数学站/grad-math)、λ 演算与类型论(🔗 cs 站 pl 线、形式语义直接用)、统计学习理论(🔗 grad-math slt)、Scaling Laws 与 Transformer(🔗 ai 站 06/07)、乔姆斯基层级(🔗 cs 站 toc-01)。🔗 标记跨站/跨线引用。
7. 边界声明(一次说清)
- 本课提供工具 + 立场地图 + 帮你把大问题磨成可做问题;不产出原创研究结论——这不是一套已有定论的方法论。
- 意识(丙)线是思辨,全程标【思】,不冒充科学。
- 知识截止 2026-01,LLM 与可解释性前沿变化极快,需你自己持续追踪。
- 语言学与神经科学的实验我只能讲方法与结果,不能替你做。
下一页:线一——语言是什么。从索绪尔的符号开始:意义为什么是"差异"而不是"实体"。