本页目录
高代 IV · 线性空间与线性映射
本页是高等代数的观念顶点:把"向量"公理化(不再只是数组——多项式、函数、矩阵都是向量),把"矩阵"重新定义为线性映射在选定基下的照片。想通"换基 = 换照片角度、相似 = 同一映射的不同照片",高代 V 的标准形理论就有了灵魂。
学习层:先认出向量,再相信坐标
先修与去向:回看行列式与方程组的秩与自由变量,以及矩阵的核像、左右乘和换基还原;本页把这些计算抽象为定义和定理。下一步是特征值与不变子空间。
1. 一个具体的生成问题
在 \(\mathbb{R}^2\) 中取
当 \(t=2\) 时,\(v=2u\),两支箭头只走在一条直线上;当 \(t\ne2\) 时,它们张成整个平面。这里的 \(u,v\) 是向量对象,\((1,1),(2,t)\) 是在标准基下的坐标记录。若把同一个抽象向量放进另一组基 \(B=(b_1,b_2)\),向量没有变,变的是记录它所需的两个数。
2. 先预测:生成、独立、基与维数
打开实验台前,先写下三个预测:
- \(u=(1,1),v=(2,2)\) 能否生成 \(\mathbb{R}^2\)?它们是否线性无关?
- 三个向量若能生成二维空间,是否必然线性无关,因而是一个基?
- 换基以后,同一个抽象向量的几何对象会不会改变;改变的究竟是向量还是坐标列?
提交预测后,实验台会揭示秩、零空间关系、生成空间维数和一组坐标换算。完整的列关系计算可以严格证明这些向量是否生成指定的有限维空间;这与只抽查某些函数、却声称它们生成整个无限维函数空间,是不同的推理。
3. 正式桥:从行列式到坐标化
令 \(A=[u\ v]\)。在二维情形,
所以 \(t\ne2\) 时 \(\operatorname{rank}A=2\),两列线性无关,且它们构成 \(\mathbb{R}^2\) 的基;\(t=2\) 时秩为 \(1\),生成空间是一条直线。一般地,
若 \(B=[b_1\ b_2]\) 可逆,同一个抽象向量 \(p\) 的标准坐标 \(p_{\mathrm{std}}\) 与 \(B\)-坐标 \(p_B\) 满足
为什么坐标唯一?生成性先保证至少有一组系数;若两组系数表示同一向量,相减得到一个零向量的线性组合,独立性迫使系数差全为零。两项条件缺一不可。
有解和唯一是两道关。 实验中的列矩阵 \(A:\mathbb R^m\to\mathbb R^2\) 把系数列映成向量,\(m\) 是列数。目标 \(p\) 能否表示,就是 \(Ac=p\) 是否有解;有解后,全部系数是 \(c_0+\ker A\)。
- 参数族在 \(t=2\) 时,\(c_1u+c_2v=(c_1+2c_2)(1,1)\)。若 \(p_x\ne p_y\),无解;若 \(p=(a,a)\),全部系数为 \((a,0)+\lambda(-2,1)\)。
- 三列 \(e_1,e_2,w=(t,1)\) 总能生成 \(\mathbb R^2\),但必然相关,因为 \(-te_1-e_2+w=0\)。对任意 \(p=(p_x,p_y)\),全部表示为 \((p_x,p_y,0)+\lambda(-t,-1,1)\)。只选前两列得到唯一的标准坐标,不等于整组三列表示唯一。
- 三列 \(u,2u,tu\) 的秩为一,关系空间维数为二,一组关系基是 \((-2,1,0)\)、\((-t,0,1)\)。目标在线上才有解,有解时可独立加入这两个关系方向。
这些关系本身就是可代入验证的证书。对于 \(t\ne2\) 的参数族,唯一坐标是
当 \(t\) 很接近二、\(p_y-p_x\ne0\) 时,系数可能很大并互相抵消。数学上仍是基,浮点计算却可能敏感,所以实验同时给出前两列基的条件数与重新合成残差。它不会把“接近退化”直接当作“已经退化”。
这就是“坐标是相对于基的系数”:对象、坐标和表示的唯一性要分开读。
JavaScript 失效时的静态 fallback:取 \(u=(1,1)\)、\(v=(2,t)\),并把 \(p=(3,2)\) 当作标准坐标。下表只对列出的有限向量作判断:
| 参数 \(t\) | \(\det[u\ v]\) | 生成空间维数 | 线性无关 | 是否为 \(\mathbb{R}^2\) 的基 |
|---|---|---|---|---|
| \(0\) | \(-2\) | \(2\) | 是 | 是 |
| \(2\) | \(0\) | \(1\) | 否 | 否 |
| \(3\) | \(1\) | \(2\) | 是 | 是 |
| 三向量 \(e_1,e_2,e_1+e_2\) | 不适用 | \(2\) | 否 | 否:生成但冗余 |
当 \(t=0\) 时,\(B=[(1,1),(2,0)]\) 可逆,\(p_B=B^{-1}(3,2)^\mathsf{T}=(2,1/2)^\mathsf{T}\)。这说明坐标列会变,抽象向量 \(p\) 不变。若只抽查有限个函数或多项式的坐标,不能由此断言整个 \(C[a,b]\) 或 \(P[x]\) 的维数、生成性或线性无关性。
4. 定理级结论与失败边界
- 定理级:列秩等于列空间维数;在有限维同一空间中,\(n\) 个向量生成 \(n\) 维空间,当且仅当它们线性无关,当且仅当它们构成一个基。基给出的坐标表示存在且唯一。
- 有限证据:实验台处理 \(\mathbb R^2\) 中的两列或三列;它完整计算这些列的关系,可判定它们是否生成整个指定的 \(\mathbb R^2\)。有限列结论不能被偷换成另一无限维空间的结论。
- 抽象与坐标边界:换基改变的是坐标表示和矩阵照片,不是抽象向量;把坐标等同于向量会混淆对象、基和记录方式。
- 退化边界:若列向量不足以生成目标空间,或矩阵秩下降,不能把“生成一个子空间”说成“生成整个空间”;本参数族用精确条件 \(t=2\) 判断退化,数值条件数则回答坐标计算是否敏感;两者不混为同一阈值。
5. 迁移:生成性、坐标与抽象对象
- 令 \(t=2\),分别表示目标 \((3,3)\) 和 \((3,2)\)。若改用三列 \(e_1,e_2,(2,1)\),这两个目标的结论怎样改变?
- 在 \(t=0\) 的基 \(B=((1,1),(2,0))\) 中表示 \(p=(3,2)\)。若第二个基向量加倍成 \((4,0)\),新坐标是多少?画图中的 \(p\) 是否移动?
- 在 \(\mathbb R[x]_3=\operatorname{span}\{1,x,x^2\}\) 上,取新基 \(1,x,x^2/2\),求导映射的矩阵是什么?解释为什么它是幂零的,但不是零映射。
展开三道迁移题答案
- 两列族中,\((3,3)\) 的全部系数为 \((3,0)+\lambda(-2,1)\);\((3,2)\) 不在直线 \(x=y\) 上,无解。三列族中两者都能表示,全部系数分别为 \((3,3,0)+\lambda(-2,-1,1)\) 与 \((3,2,0)+\lambda(-2,-1,1)\)。生成整个平面不意味着三列独立。
- \(p=2(1,1)+\tfrac12(2,0)\),所以坐标 \((2,1/2)\)。第二基向量加倍后,系数减半,变成 \((2,1/4)\);\(2(1,1)+\tfrac14(4,0)\) 仍为同一个 \((3,2)\)。一般换基可以混合全部坐标,不只是逐项缩放。
- 求导依次把三个基向量送到 \(0,1,x\),所以矩阵为 \(\begin{pmatrix}0&1&0\\0&0&1\\0&0&0\end{pmatrix}\)。其三次方为零,而一次作用在 \(x\) 上得到一,故本身非零。过渡矩阵 \(T=\operatorname{diag}(1,1,1/2)\),可直接核对 \(T^{-1}AT\)。
实验目标坐标限定在 \([-8,8]\),参数 \(t\in[-2,4]\)。前两列的坐标只在它们构成基时给出;其他情况会明确区分无解与无穷多解,并列出关系基和全部表示的构造。
1. 线性空间
定义 数域 \(P\) 上的线性空间 \(V\):配备加法与数乘、满足八条公理(加法交换结合、有零元负元、数乘结合分配、\(1\cdot v = v\))的集合。
例子清单(体会公理化的威力):\(P^n\);\(m\times n\) 矩阵全体;次数 \(<n\) 的多项式与零多项式组成 \(P[x]_n\)(\(n\ge1\));非退化区间 \(a<b\) 上的连续函数 \(C[a,b]\)(无限维);齐次方程组解集。
为什么 \(C[a,b]\) 在 \(a<b\) 时无限维?对任意 \(N\),函数 \(1,x,\ldots,x^N\) 都线性无关:若线性组合在整个区间为零,对应多项式有无限多个根,故所有系数为零。可以找到任意长的独立列表,所以不存在有限基。这个论证用到了多项式根数上界,并非从几个抽样点猜维数。
子空间:对加法数乘封闭的非空子集。判定只需验封闭性。重要构造:生成子空间 \(\mathrm{span}(\alpha_1,\dots,\alpha_s)\);和 \(V_1 + V_2 = \{v_1 + v_2\}\) 与交 \(V_1 \cap V_2\)(并集一般不是子空间!)。
定理(有限维子空间的维数公式)
证明骨架:取交的基 \(u_1,\ldots,u_k\),分别补上 \(v_1,\ldots,v_r\) 与 \(w_1,\ldots,w_s\) 成为两子空间的基。合并后显然生成和空间;若有零线性组合,把 \(w\) 项移到另一侧,它同时属于 \(V_1\) 与 \(V_2\),因而属于交。用 \(V_2\) 的基独立性先消去全部 \(w\) 系数,再用 \(V_1\) 的基独立性消去其余系数。因此合并列表是基,数个数得公式。
直和 \(V_1 \oplus V_2\):\(V_1 \cap V_2 = \{0\}\),等价于和空间内每个向量分解唯一;有限维时还等价于维数相加。若写 \(V=V_1\oplus V_2\),还须两者之和等于 \(V\)。无限维的基数加法不能反推直和。空间按直和拆解 = 问题按分量拆解——高代 V 特征子空间分解、Jordan 理论的组织原则。
2. 基、维数与坐标
基:线性无关的生成组;这里每个向量都用有限项线性组合表示。有限维时,维数 = 基的元素个数(与基的选取无关——需证任意两基等长,替换定理)。基选定后每个向量有唯一坐标:\(v = \sum x_i \varepsilon_i \mapsto x = (x_1,\dots,x_n)^\top\)——任何 \(n\) 维空间坐标化后就是 \(P^n\)(同构),抽象向量从此可以用数组计算。
基变换与坐标变换:新基 \((\eta_1,\dots,\eta_n) = (\varepsilon_1,\dots,\varepsilon_n)\,T\)(\(T\) 为过渡矩阵,可逆),则同一向量的坐标变换为
(方向容易记反:基"正着"变,坐标"反着"变——基向量变大,坐标数值变小,协变/逆变的第一次照面。)
3. 线性映射与线性变换
定义 \(\mathcal{A}: V \to W\) 满足 \(\mathcal{A}(k\alpha + l\beta) = k\mathcal{A}\alpha + l\mathcal{A}\beta\)。\(V = W\) 时称线性变换。
核与像:\(\ker\mathcal{A} = \{v: \mathcal{A}v = 0\}\)(子空间,衡量"压缩掉多少");\(\mathrm{Im}\,\mathcal{A} = \mathcal{A}(V)\)(子空间,衡量"到达多少")。单射 \(\iff \ker = \{0\}\)。
定理(有限维定义域的秩–零度定理)
思路:取 \(\ker\) 的基扩充为 \(V\) 的基,证扩充部分的像是 \(\mathrm{Im}\) 的基。读法:定义域的维数守恒——压缩掉的 + 幸存的 = 全部。方程组语言的重述:\(n - \mathrm{rank}A\) 个自由变量(高代 II 基础解系的个数)正是 \(\dim\ker\)。当定义域与陪域同为有限维且维数相同时,单 \(\iff\) 满 \(\iff\) 可逆。无限维不成立:在 \(\mathbb R[x]\) 上,乘以 \(x\) 单射但不是满射(常数一没有原像);求导满射但不单射(常数都在核里)。
4. 线性映射的矩阵表示(本页顶点)
取定 \(V\) 的基 \(\{\varepsilon_i\}\),线性变换 \(\mathcal{A}\) 由它在基上的作用完全决定:
\(A\) 的第 \(j\) 列 = \(\mathcal{A}\varepsilon_j\) 的坐标。于是映射的复合 ↔ 矩阵乘法、映射求逆 ↔ 矩阵求逆(高代 III"乘法为什么那样定义"在此兑现);坐标层面 \(y = Ax\)。
一般映射 \(F:V\to W\) 的矩阵可能为矩形:若 \(\dim V=n,\dim W=m\),分别选两端的基,则第 \(j\) 列是 \(F\varepsilon_j\) 在输出基下的 \(m\) 个坐标。若输入过渡矩阵为 \(T\)、输出过渡矩阵为 \(S\),由 \(x_{\rm old}=Tx_{\rm new}\)、\(y_{\rm old}=Sy_{\rm new}\) 得
只有同一空间的线性变换、两端采用同一组新基时,才取 \(S=T\) 得到相似变换。
换基后矩阵怎么变:基经 \(T\) 变换,则同一变换 \(\mathcal{A}\) 在新基下的矩阵为
定义(相似) \(B \sim A \iff \exists\) 可逆 \(T:\ B = T^{-1}AT\)。——相似矩阵是同一线性变换在不同基下的照片。整个高代 V 的问题由此成立:给一个变换,找一组基让它的照片(矩阵)最简单——那就是对角化与 Jordan 标准形。
相似不变量(换照片角度不变的本质属性):行列式、秩、迹 \(\mathrm{tr}A = \sum a_{ii}\)(\(\mathrm{tr}(AB) = \mathrm{tr}(BA)\) ⇒ 相似不变)、特征多项式(高代 V)。
不变子空间:\(\mathcal{A}W \subseteq W\)。若 \(V\) 可分解为不变子空间直和,矩阵呈分块对角——"找不变子空间 = 把变换拆成小块",标准形理论的战略。
🔗 AI 衔接:神经网络的每一线性层就是一个线性映射,只有在线性可逆变换的情境下,“换一组好基”才是严格描述。一般表示学习可以非线性、改变维数或丢失信息;语义向量类比只是经验现象,不由线性空间公理保证。
5. 对偶空间一瞥
\(V\) 上全体线性函数 \(f:V\to P\) 构成代数对偶空间 \(V^*\)。当 \(V\) 有限维时,\(\dim V^*=\dim V\),且基 \(\{\varepsilon_j\}\) 有对偶基 \(f_i(\varepsilon_j)=\delta_{ij}\)。无限维时,代数对偶通常严格更大,不能照搬等维结论;泛函分析还会按拓扑筛出连续对偶。例如在 \(\mathbb R[x]_3\) 的基 \(1,x,x^2\) 下,对偶基是 \(f_0(p)=p(0)\)、\(f_1(p)=p'(0)\)、\(f_2(p)=p''(0)/2\),它们分别读出三个系数。方向导数先是线性泛函;把它表示成梯度向量,还要指定内积,不能把对偶向量与普通向量无条件等同。
6. 典型例题
例 1(维数公式) \(V_1, V_2 \subset \mathbb{R}^{10}\),\(\dim V_1 = 6, \dim V_2 = 7\),求 \(\dim(V_1 \cap V_2)\) 的范围。 解:\(\dim(V_1 + V_2) \leq 10\) ⇒ 交 \(\geq 6 + 7 - 10 = 3\);交 \(\leq \min = 6\)。可能值为整数 \(3,4,5,6\)。每个都可实现:取 \(V_1=\operatorname{span}(e_1,\ldots,e_6)\),对 \(k\in\{3,4,5,6\}\) 取 \(V_2=\operatorname{span}(e_1,\ldots,e_k,e_7,\ldots,e_{13-k})\),其维数七,交维数恰为 \(k\)。
例 2(求变换矩阵与换基) \(\mathbb{R}[x]_3\) 上求导变换 \(D\),基 \(\{1, x, x^2\}\):\(D1 = 0, Dx = 1, Dx^2 = 2x\),故 \(A = \begin{pmatrix} 0&1&0\\0&0&2\\0&0&0 \end{pmatrix}\)(幂零——求导三次归零的矩阵表述)。换基 \(\{1,x,x^2/2\}\) 后得到两个超对角元都为一的幂零矩阵,完整计算见迁移题三。
例 3(秩–零度应用) 线性变换 \(\mathcal{A}^2 = \mathcal{A}\)(幂等/投影),证明 \(V = \ker\mathcal{A} \oplus \mathrm{Im}\mathcal{A}\)。 解:任意 \(v = (v - \mathcal{A}v) + \mathcal{A}v\),前者在核(验 \(\mathcal{A}(v - \mathcal{A}v) = 0\))后者在像;交为零:\(w \in\) 两者 ⇒ \(w = \mathcal{A}u\) 且 \(\mathcal{A}w = 0\) ⇒ \(w = \mathcal{A}^2 u = \mathcal{A}w = 0\)。投影把空间干净地劈成"压掉的"与"留下的"。\(\blacksquare\)
7. 原始资料与继续阅读
- MIT 18.06:Linear Algebra,从矩阵计算连接列空间、零空间、基与坐标变换的课程资料。
下一页:为每个线性变换寻找"最能暴露其本性的基"——特征值、对角化与 Jordan 标准形。
基础衔接与计算验收
迁移到整数系数时,基、维数和补空间不能全部原样照搬。继续做模、商与不分裂的短正合列中的核、像和整数消元练习。