线性代数
Linear algebra
线性代数(linear algebra)研究向量空间、线性映射及其坐标表示,核心问题包括线性方程是否有解、解是否唯一、哪些方向被变换保留或消去,以及怎样用较少的独立信息表示对象。矩阵是选定基以后记录线性映射的工具。线性代数中的“线性”指保持线性组合,既不限于二维直线,也不限于求解几个一次方程。
一条共同主线:保持叠加
若同一过程把输入 变成 ,把输入 变成 ,线性要求叠加和缩放可以穿过这个过程: 标量 来自同一个指定数域。这个规则称为保持线性组合;它意味着知道一组基的输出,就知道所有输入的输出,因为任意输入都能由基线性组合而成。线性因此是一种可传递计算的结构,而不是仅凭图像形状判断的外观。
例如 是线性的。函数 虽然图像是直线,却不是线性映射,因为它把零送到一。它属于仿射映射。平方函数也不线性,因为一般有 。判断时先检查零点是一个快速排除方法,但通过零点仍不足以证明线性。
求导算子在合适的函数空间上是线性的;定积分把函数送到一个数,也保留线性组合。这里输入已经不是单个数字,而是整个函数。这些例子解释了为什么线性代数的语言会进入微积分和微分方程。实际系统只有在一定范围内近似满足叠加时,才能用线性模型;模型外推是否合理仍是独立问题。
本文沿一条主线展开:把方程读成列向量的组合,使用消元判断可解性,再用核与像解释全部解,最后把无精确解的问题转成投影,并用特征方向理解重复变换。这条路线把计算方法与结构结论接起来;矩阵运算的逐项规则可参阅矩阵。
方程组的行观点与列观点
对于 矩阵 ,方程 可以从两侧阅读。每一行给出输入坐标必须满足的一条约束;每一列给出一个单位输入所产生的输出。列观点下,求解是在寻找系数,使这些列的线性组合正好等于目标 。因此有解当且仅当目标属于列空间。
考虑 第二个方程减第一个的两倍,得到 ;第三个减第一个,同样得到 。所以第三条没有提供新的独立约束。令 ,回代得到 、,全部解为 把这个表达式分别代入三条原方程,左端恒为四、九、五。自由参数不是计算中遗漏的未知量,而是问题本身没有约束住的方向。
把第三个方程右端从五改为六,消元会同时要求 和 ,从而无解。同一个系数矩阵,有些右端可达、有些不可达。若删去冗余约束并另加 ,自由方向被固定,解变成 。解的三种状态由约束独立性与相容性共同决定,而不是只由方程数决定。
初等行变换之所以合法,是它们具有逆操作:交换两行可交换回来,乘非零数可除回来,加上另一行的倍数可减回来。因此它们不改变解集。消元时必须对右端同步操作。用近似小数计算还需选取合适的主元,以免除以很小的数而放大舍入误差;精确代数中的合法步骤并不自动是良好的数值步骤。
核与像把全部解写成一个整体
线性映射的核是所有映到零的输入,像是所有能出现的输出;二者都是子空间,因为线性组合可以通过映射。若 是 的一个特解,任何齐次解 都给出另一个解 。反过来,任意两解之差满足 。因此 在方程相容时成立。这个表达式不只给出某个答案,还描述全部答案之间的关系。
齐次解集通过原点,是向量子空间;非齐次解集通常是它的平移,是仿射空间。前面的三元方程中,核由 张成,特解选成 。特解并不唯一,换一个特解只是换了同一条解直线的起点,整条解集不变。
设定义域为有限维空间 ,线性映射为 。秩—零度定理说 它不要求映射是方阵,也不要求满射。右侧分别统计被消去的独立输入方向和实际产生的独立输出方向。对矩阵,像的维数就是秩。
证明。 先选核的一组基 ,再把它扩充成定义域的基 。任意输入都能按这些向量展开;应用 后,前一部分消失,所以 张成像。若这些像的某个线性组合为零,原向量对应的组合便属于核,因而能写成各个 的组合。移到一侧后得到完整基的一个零组合,其所有系数都必须为零。因此这些像也线性无关,像的维数是 ,而定义域维数是 ,定理得证。
证明中特意扩充的是核的基,而不是任意挑一些输出。被消去的方向先分出来,剩余基向量的像才保证无关。这一步使“维数守恒”的直觉变成完整论证。它也立即说明同维有限维空间之间,单射与满射等价;在不同维度或无限维情形下,不能直接照搬这个结论。
四个基本子空间让可解性更透明
对于实矩阵,列空间在输出空间中,核在输入空间中;转置矩阵则给出另外两个空间:行空间和左零空间。左零空间由满足 的输出空间向量构成。这里“左”只是因为也可写成 ,并不是在矩阵图上截取左边几列。
若 ,输入向量与矩阵每一行的点积都为零,因此核与行空间正交。类似地,左零空间与列空间正交。结合维数计数,可以得到它们分别是完整的正交补。于是一个目标位于列空间,等价于它与所有左零空间向量正交。这给出比反复求解更直接的相容性检验。
例如 的列空间由 张成,核由 张成。向量 与 构成左零空间的一组基。因此目标 可达,当且仅当 且 。这两个关系正好描述一条直线。
行变换保持行空间与核,但通常改变列空间及左零空间所在的具体方向。若消元后的矩阵出现底部零行,不能据此声称原矩阵的列也在对应坐标处为零。正确做法是利用消元找独立列的位置,再回到原矩阵取列。这一区分见 Strang 对四个子空间的讨论。
不相容的方程怎样变成投影
测量数据可能不落在模型允许的列空间中。这时不存在精确解,却可以在允许的输出中找距离目标最近的点,即使 最小。这里使用标准欧氏长度;若不同观测的单位或精度不同,应先说明归一化或加权方式,否则“距离最小”可能没有合适的统计含义。
设候选最佳输出为 ,残差为 。若残差与列空间正交,对任何扰动 ,勾股关系给出 因此正交性足以保证最优。反过来,沿任何列空间方向略微移动,平方距离的一次项必须为零,否则选适当方向就能降低距离;这迫使残差与该空间正交。写成矩阵就是正规方程 这不是假设数据突然精确满足原方程,而是表达最佳近似所满足的条件。
完整例子是用直线拟合三个点 。令拟合形式为 ,使用中心化后的自变量有助于把两列正交分开。设计矩阵两列是 与 ,点积为零。正规方程因此直接给出 和 ,即 。
三个拟合值依次为 ,残差为 。残差之和为零,与中心化时间列的点积也为零,独立验证了正交条件。平方误差总和为 。还原成常见形式,拟合直线是 。算例中的数据是用于解释方法的给定数值,不是经验规律。
最佳输出作为到子空间的正交投影是唯一的,但拟合系数未必唯一。若设计矩阵有两列完全相同,两组不同系数可以产生同一个输出;只有列满秩时系数才唯一。数值求解通常使用 QR 分解或奇异值分解,而不是直接形成正规方程,因为后者会加重某些条件敏感性。方法的几何推导与具体计算实现需要区分。
特征方向解释重复作用
对线性算子 ,非零向量 若满足 ,就是特征向量, 为对应特征值。它描述的是变换后仍在同一直线上的方向;负特征值会反转方向,所以不能简单说成“方向完全不变”。零向量被排除,是为了避免任意标量都满足该等式。
取 。直接计算 ,。任意输入可以拆成这两个独立方向。例如 ,所以 这避免了反复展开大乘积,也说明重复作用时不同方向可能以不同速率增长。
并非所有矩阵都有足够多的特征向量。非平凡剪切矩阵 只有一条特征方向,无法用两个独立特征向量作为平面的基。实平面旋转九十度更没有实特征向量;扩充到复数域后才有特征值 。因此使用对角化必须检查数域与是否有完整的特征向量组。
实对称矩阵则有一组正交归一的特征向量基,这就是有限维实谱定理。不同特征值对应的特征向量正交,可以直接证明:对称性使 ,代入特征关系得 ,特征值不同便迫使点积为零。完整存在性证明还需要进一步论证,本条不把这一简短计算误当成整个谱定理的证明。
分解、坐标与问题本身的区别
换基把同一线性算子表示成不同矩阵。若新基在旧坐标中的列矩阵为 ,新表示是 。对角化的目的,是寻找使变换分成独立缩放方向的基;QR 分解的目的则是用正交方向稳定处理列空间。它们解决不同问题,不是都在寻找同一种“最好矩阵”。
奇异值分解适用于矩形矩阵,并分别选择输入、输出的正交坐标,使映射可以看成正交变换之间夹着各方向的缩放。奇异值描述这些缩放量,零奇异值对应丢失的方向。与特征值不同,奇异值不要求输入与输出是同一个空间。在数据压缩中舍弃很小的奇异方向,是近似建模步骤,不能说成原数据本来就没有那些成分。
实务中还有稀疏性:大量元素为零,意味着许多变量之间没有直接耦合。选择算法时保留稀疏结构,可能比套用一个通用求逆公式更重要。网络的关联矩阵、局部差分方程和分块模型都可能产生这类结构。数学上的同构忽略某些表示差异,计算工作量却可能很依赖所选表示。
从线性结构读懂三个进一步问题
两个状态之间的重复迁移
考虑一个简化的两状态过程。每步开始时第一状态的八成留在原处、两成转到第二状态;第二状态的三成转到第一状态、七成留在原处。若列向量记录两个状态的比例,一步迁移矩阵为 每列之和为一,保证总比例保持一;各项非负,保证比例不变成负数。这里采用列向量约定,有些教材采用行向量并把矩阵转置,两种表示不能交叉混用。
求满足 且总和为一的状态,得到 。另一个方向 的特征值为二分之一。从全部处于第一状态开始,初始向量可分解成稳定部分加偏离部分,因此 一步后为八成与两成,两步后为七成与三成,与直接矩阵乘法一致。偏离部分逐步缩小,所以比例趋近六成与四成。这个结论依赖本例的矩阵与特征值,不能推断任意迁移系统都具有相同的唯一稳定状态或相同收敛速度。
这一例子把特征值一解释为被保留的整体比例,把绝对值小于一的特征值解释为逐渐衰减的偏离方向。若某种系统还含有绝对值等于一的其他方向,就可能保留振荡;若模型允许增长,总量约束也可能不再成立。结构计算提供的是在所列假设下的结论,迁移比例来自何种数据仍需独立估计。
线性函数把向量变成可比较的数
测量总成本、求某方向上的分量、读取多项式某项系数,都可能是把向量送到标量的线性映射,称为线性泛函。例如把两个投入量送到总价,价格系数固定时,总价保持投入的叠加与数乘。定义在同一空间上的全部线性泛函又组成一个向量空间,称为对偶空间。
选定基以后,一个线性泛函可以写成行向量乘坐标列,因此方程组的每一行也可以理解成一种线性测量。一个未知向量被若干测量限定,而核记录所有测量都看不见的方向。这个观点把“线性方程的约束”与“信息能否识别未知量”接在一起,特别适合解释为什么重复测量同一方向并不会增加独立信息。
不过把泛函自然地认成一个普通向量,需要额外选择内积来建立对应;不能因为欧氏坐标中常用点积表示,就认为抽象空间中的向量与测量规则本来就是同一种对象。坐标与对偶坐标在换基时采用相配的变换,目的是保持实际测量值不变。这是同一对象可以有不同表示的又一个例子。
二次型连接几何与优化
线性代数还研究由对称矩阵生成的二次表达式。例如 平方和表达式说明它对非零输入严格为正,而只有零输入取零。这种正定性决定相应等值线的几何,也保证把该二次项用作误差代价时不会沿某个非零方向降低到负值。配方在这里等价于换一种方式辨认独立的平方贡献。
若改成 ,原点虽使两个一阶偏导数都为零,却沿横轴向上、沿纵轴向下,因此不是最小值。这解释了优化中为什么驻点条件只是必要检查之一:还要查看二次结构在各个方向的符号。实对称矩阵的谱定理把这种符号判断转成特征值判断,但只有在适用的对称条件与数域明确时才能使用。
哪些结论不能越过前提
“方程有解”与“模型正确”不同。即使线性方程精确求解,输入数据、变量单位、边界条件或者线性假设仍可能不适合现实问题。残差小表明模型输出贴近给定数据,但不能证明模型可以可靠预测范围以外的情况。数学建模与最小二乘法需要另行讨论检验与误差。
“近似相关”也与“精确线性相关”不同。测量误差会使原本相关的列看起来略微独立,浮点软件必须用容差判断有效秩。容差过大会丢掉真实信息,过小则把噪声当成独立方向。因此实际报告中的秩最好附上尺度或容差说明。精确数学提供对象定义,数值分析解释计算结果怎样接近这些对象。
有限维中很多结论依靠基数有限。无限维空间里的线性映射可以单射而不满射,例如把多项式乘以自变量:结果为零只可能原多项式为零,但常数一不在像中。无限维分析还涉及算子是否连续、值域是否闭合等额外问题。把有限矩阵结论未经条件检查推广到函数空间,会漏掉这些实质差异。
从消元算法到抽象学科
线性方程求解有很长历史。《九章算术》第八章“方程”把实际问题排列成系数阵列,通过消去求出未知量;这是早于现代矩阵符号的计算传统。MAA 关于《九章算术》内容的研究说明了方程章及其问题类型。把这一路线写成“高斯一个人发明了消元”并不准确。
十九世纪的矩阵运算与抽象线性空间研究,使算法对象被放进统一理论。Cayley 的矩阵工作、Grassmann 的扩张理论以及 Peano 的线性空间公理化属于不同但相互关联的贡献。现代线性代数因此没有一个涵盖全部内容的单一“发现者”。MacTutor 的抽象线性空间史提供了后一路线的背景。
今日课程同时教授消元、空间、正交和特征结构,是对长期积累的重新组织。历史上用于算实际问题的方法,往往早于完整定义;理论成熟后,定义又使结果能跨越原有模型。区分算法历史与概念历史,有助于理解“谁做了什么”,也避免把后来的统一语言错误地投射到古代文献上。
English overview
Linear algebra studies vector spaces and maps that preserve linear combinations. A matrix records such a map after bases have been selected. The subject connects systems of equations, geometry, approximation, and the behavior of repeated transformations.
A system Ax = b is solvable exactly when b belongs to the column space of A. When one solution exists, every solution is that particular solution plus an element of the null space. The rank–nullity theorem explains how input dimensions divide between directions that disappear and independent directions that reach the output. Its proof uses a basis of the kernel extended to a basis of the domain.
When measured data do not admit an exact solution, least squares replaces equality with the closest output in the column space. The residual is perpendicular to that space. A worked three point fit verifies both the coefficients and this orthogonality. Eigenvectors provide directions on which a square linear map acts by scaling, but diagonalization is not always possible. Numerical stability, units, and model assumptions remain essential: a mathematically valid calculation is not by itself evidence that a physical or statistical model is appropriate.
编者评注(AI 辅助)
本条把同一个方程问题沿“消元—核与像—投影”推进,避免把线性代数写成互不相连的术语表。维数定理给出完整证明,谱定理则明确区分已证的正交性与未展开的存在性。算例保留残差和回代检查,是为了让计算可以复算。内容由 AI 辅助整理;编者认为结构理解应与数值边界同时呈现,但这种教学安排不代替实际建模中的数据检验。
参考资料与后续阅读
- MIT OpenCourseWare,Gilbert Strang,18.06 Linear Algebra:消元、空间、最小二乘和特征值课程。
- MIT 18.06SC,The Four Fundamental Subspaces:四个基本子空间的课程单元。
- Strang,《Introduction to Linear Algebra》第 3.5 节:行空间与列空间在消元下的不同变化。
- 前置可读矩阵与向量空间;继续阅读最小二乘法、优化、微分方程、数学建模。