本页目录
语言 II · 生成语法:递归与普遍语法
对标:Chomsky《句法结构》(1957)、《The Minimalist Program》(1995) / Adger《Core Syntax》 | 前置:ling-01、🔗 cs 站 toc-01 乔姆斯基层级 | 证据地位:形式部分【实】(递归、层级是数学事实),核心主张(先天论)【争】——它正压在你研究问题的断层线上。 读这一页要做到"分层":把 Chomsky 的形式贡献(无可争议、极深刻)和他的经验主张(强先天论、刺激贫乏)分开评价。前者是地基,后者是本课全程要审的对象(轴 I)。
1. 一个观察:语言是无穷的
Chomsky 的起点极简:人能理解从未听过的、任意长的句子。"猫在垫子上"→"我知道猫在垫子上"→"你以为我知道猫在垫子上"……可以无限嵌套。有限的大脑、有限的经验,却能处理无穷多的句子。
结论:语言能力不可能是"记住见过的句子",必然是一套有限的规则生成无穷的表达——这就是生成(generative)的含义,也是生成性/创造性(creativity)。索绪尔看到系统,Chomsky 看到系统里的引擎。
2. 核心武器:递归
无穷从哪来?——递归(recursion):一个规则的输出可以再喂给自己。 $\(S \to \text{NP} \; \text{VP}, \qquad \text{VP} \to V \; S\)$ VP 里含 S,S 里含 VP,可以无限展开。有限规则 + 递归 = 无穷语言。 这是本页最硬的一块【实】——它是数学事实,不是主张。
递归让语言有层级结构(hierarchy)而非线性串。"[老人 [喜欢的] 猫] 跑了"——"跑"的主语是"猫"不是"老人",靠的是树形结构里的支配关系,不是词的前后顺序。句法是树,不是链——这个洞见后来直接影响了句法分析、编译原理(🔗 cs comp-01 的语法树)。
3. 乔姆斯基层级(形式语言的标尺)
Chomsky 把"生成能力"做成一把标尺(🔗 cs toc-01 讲透):
| 层级 | 文法 | 识别机器 | 例 |
|---|---|---|---|
| 3 正则 | 正则文法 | 有限自动机 | \(a^*b^*\) |
| 2 上下文无关 CFG | CFG | 下推自动机 | \(a^n b^n\)、括号匹配 |
| 1 上下文相关 CSG | CSG | 线性有界自动机 | \(a^n b^n c^n\) |
| 0 递归可枚举 | 无限制 | 图灵机 | 任意可计算 |
自然语言在哪? 经典结论:超过 CFG(瑞士德语的交叉依存 \(a^n b^m c^n d^m\) 无法用 CFG 生成,Shieber 1985),但远不到 CSG 的全部威力——落在中间一个窄带:轻度上下文相关(mildly context-sensitive,如 TAG/MCSG)。
这条【实】结论极重要:自然语言的计算复杂度是被约束的——不是任意可计算,而是一个特定的窄类。"为什么偏偏是这一类"本身就是研究问题,也是"结构从哪来"(轴 I)的一个可量化切入点。
4. 生成句法的演化:从规则到 Merge
Chomsky 的理论 60 年里自我革命了几次,方向是越来越简:
- 1957 短语结构规则 + 转换:一堆改写规则(\(S\to NP\,VP\)…)+ 转换(主动↔被动)。
- 1980s 原则与参数(P&P):不是每条规则,而是普遍原则 + 有限参数开关(如"中心语在前/在后"——英语动词在宾语前,日语在后,就是一个开关)。习得 = 设参数。
- 1995 最简方案(Minimalist Program):把一切句法操作归约为一个原子操作 Merge——取两个单位合成一个更大单位,递归应用即生成全部结构。语言 = Merge + 词库 + 接口条件。
Merge 的哲学野心:如果整个句法真能压到"二元合并 + 递归"这么小,那递归也许就是人类语言的本质特征(Hauser–Chomsky–Fitch 2002 的著名主张:递归可能是人类独有、语言官能狭义核心的唯一成分)。——注意这是【争】,Everett 对 Pirahã 语的"无递归"报告曾激烈挑战它(本身也有争议)。
5. 断层线:先天论与刺激贫乏(本课要审的核心【争】)
Chomsky 的经验主张,不是形式贡献,是本课全程的审视对象:
- 普遍语法(UG):人天生带一套语言蓝图;后天只是"设参数/填词汇"。
- 刺激贫乏(poverty of the stimulus):儿童接触的语料太少、太乱、几乎没有负面证据(没人系统告诉他哪些句子错),却能在几年内掌握复杂语法——所以正确规则不可能纯从数据归纳,必有先天偏置。经典案例:疑问句主谓倒装靠结构(移动主句助动词)而非线性(移动第一个助动词)——孩子从不犯线性错误,尽管数据不足以排除线性假设。
- 强主张:"语言不是从统计学来的。"
为什么这是你研究的断层线:你想解释"智能从语料涌现"。强先天论说核心结构不来自语料。这两者正面冲突——
- 如果强先天论对:LLM 从语料学会语法,只说明语法可被统计逼近,不说明人是这么学的。
- 如果涌现派对:刺激贫乏被高估,足够的数据 + 合适的归纳偏置就能长出结构——LLM 是活证据。
本课不替你选边(线三 mean-02 会把这场对峙摆到实证台面:统计学习、样本复杂度、归纳偏置到底能走多远)。但你必须知道自己的问题活在这里。
6. competence / performance(一个方法论争点)
Chomsky 区分语言能力(competence,理想化的内在知识)与语言运用(performance,实际带口误、记忆限制的产出),主张语言学研究前者。——这是索绪尔 langue/parole 的继承(ling-01 §3)。
它的代价(功能派会攻击,ling-03):把"使用"扫进 performance 一笔勾销,等于先验假设结构独立于使用——而这恰是争点本身。研究方法上,它也让生成派长期轻视语料统计,与你的信息论进路(线二)南辕北辙。记住:一个理论选择研究什么,往往已经预设了结论。
7. 要点与思考
思考 1(分层评价) 请把下面各条各自贴上【实】或【争】:(a) 语言有递归层级结构;(b) 自然语言超过 CFG;(c) 人类有先天普遍语法;(d) 语言不从统计学来。——(a)(b) 是【实】(数学/语言事实),(c)(d) 是【争】(经验主张)。能利落分层,你就抓住了这一页的核心。
思考 2(Merge 与 Transformer) Transformer 没有内建的树结构,却能处理嵌套依存——它是"用注意力软性地重建了层级",还是"证明层级不必显式内建"?(🔗 线六 ai-03 会问:LLM 学到的句法表征长什么样,probing 能读出树吗。)
思考 3(先天的另一种可能) "先天偏置"不必是"语言专用蓝图"。也许先天的是通用的序列学习/递归能力/社会认知,语言结构从这些非语言先天能力 + 数据里涌现。这是涌现派的核心让步与反击——"要不要先天"和"先天的是不是语言专用"是两个问题(线三、线四继续)。\(\blacksquare\)
下一页:语言 III——功能主义。如果说 Chomsky 把语言当自足的形式系统,功能派反过来问:语法会不会本就是"使用磨出来的沉积"?这是轴 I 涌现端的第一块阵地。