最小二乘法
最小二乘法通过最小化残差平方和,从一族候选模型中选择与观测数据相配的参数。线性最小二乘可以解释为把观测向量正交投影到矩阵的列空间。求解这一优化问题本身不要求误差服从正态分布;无偏性、方差和置信区间等统计结论需要另加假设。
英文名称:Least squares。
English overview
Least squares chooses model parameters by minimizing the sum of squared residuals. In a linear model, the predicted observations lie in the column space of a design matrix. The best fitted vector is the orthogonal projection of the data onto that space, which explains the normal equations and the geometry of residuals. The fitted vector is unique, although the parameter vector need not be unique when columns are linearly dependent.
This article derives the normal equations both by differentiation and by a direct squared-norm identity. A complete straight-line fit uses synthetic water-level data, reports every residual, and separates training error from held-out prediction error. Further examples illustrate rank deficiency, weighted least squares, and the sensitivity of squared loss to an outlying observation. QR factorization is explained as a numerically preferable route to solving many full-rank problems, while explicitly forming an inverse is discouraged as a computational recipe. Statistical interpretation is kept separate from algebra: zero-mean errors, covariance assumptions, and distributional assumptions support different claims. Historical notes distinguish Legendre's published 1805 method from Gauss's later publication and earlier-use claims. The final sections connect least squares to projection, optimization, model selection, and reproducible scientific computation.
为什么平方残差可以作为目标
设观测为 yᵢ,模型预测为 ŷᵢ,残差采用“观测减预测”约定 。直接加残差会让正负误差抵消;取绝对值或平方可以避免抵消。平方损失可微,具有清楚的代数与几何结构,因此广泛使用,但它不是唯一合理的误差度量。对异常值敏感、对大残差惩罚更重,也是这一选择的直接后果。
“线性最小二乘”的线性是指参数以线性方式进入预测。例如 对 t 是二次曲线,却对三个参数仍是线性的,可用设计矩阵处理; 对 b 非线性,不能直接用同一套线性正规方程求 a、b。通过取对数变换会改变残差的度量与误差模型,不能声称是在无条件求原平方损失的同一解。
矩阵表示和符号
有 m 个观测、n 个待估参数时,用设计矩阵 、参数向量 和观测向量 写成 矩阵每行描述一个观测对参数的依赖,每列对应一个模型项。含截距的直线拟合通常把第一列设为全一、第二列设为时间 t,所以参数顺序为 (b,a)。若交换列顺序,参数向量也必须一起交换,不能拿一个公式的系数顺序套到另一个矩阵上。
即使方程 Xβ=y 没有精确解,平方误差仍可取到最小值,因为是在有限维闭子空间中寻找最近向量。若 X 的列线性无关,即满列秩,参数解唯一;若列相关,多个参数向量可能给出同一个预测 Xβ。预测唯一与参数唯一是不同命题,下面会用具体例子说明。
正规方程的推导与充分性
展开目标函数:。对 β 求梯度并令其为零,得到 这称为正规方程。它等价于 ,即残差向量与 X 的每一列正交,因而与整个列空间正交。注意正交是样本空间中的向量关系,不是说每一个残差都为零,也不是说残差在统计上独立。
还需证明满足正规方程确实是全局最小。对任意扰动 d,有 因为交叉项 为零。右侧不小于原目标,所以这是全局最优的充分证明。若满列秩,d≠0 时 Xd≠0,目标严格增大,因此解唯一;若存在非零 d 使 Xd=0,沿这个方向改变参数不会改变拟合。
满列秩还保证 正定,因为对非零 d 有 。所以逆矩阵形式 在理论上成立。但它表达一个解,并不意味着实际计算应该先显式求逆;数值实现通常使用分解算法更合适。
完整算例一:四个水位点拟合直线
采用数学建模中的合成教学数据,时间 t=(0,1,2,3) 分钟,水位 h=(1,2,2,4) 厘米。选模型 ,则 正规方程为 与 。消去 b 得 5a=4.5,因此 a=0.9、b=0.9。预测值依次为 0.9、1.8、2.7、3.6,残差为 0.1、0.2、−0.7、0.4,平方和为 。
可以独立检查 与 ,它们正是正规方程。训练均方根误差为 厘米。两点留出数据 t=4、5,水位 4.6、5.8,对应预测 4.5、5.4,误差平方和 0.17,留出 RMSE 约 0.2915 厘米。两点不足以评价普遍预测能力,且训练误差与未来误差没有必然的逐次大小关系。
同一计算也可用中心化公式:,,b=平均水位−a×平均时间。这表明含截距拟合线经过样本重心,但“经过重心”只是必要结构,并不足以单独确定正确斜率。
完整算例二:参数不唯一的模型
设只有两次观测,模型在两个时刻都预测 β₁+β₂,故 ,数据 y=(2,4)。令 s=β₁+β₂,目标为 。最小值为二,条件是 s=3,所以 (β₁,β₂)=(0,3)、(1,2)、(1.5,1.5) 都是参数解。
所有这些解都给出同一个拟合向量 (3,3),残差 (−1,1) 与列 (1,1) 正交。若另外要求在所有最小二乘参数中选择欧氏范数最小者,会得到 (1.5,1.5),但这是增加了一个选择规则,不能声称数据已经分别识别了两个参数。奇异值分解与广义逆可以表达这个最小范数解,理解其含义比机械套工具更重要。
权重怎样改变拟合目标
若不同观测精度不同,可采用正权重 wᵢ,最小化 。写成对角矩阵 W 后,正规方程变成 。它也等价于先把第 i 行数据和设计行都乘以 ,再做普通最小二乘。
例如只拟合一个常数 c,观测为零与十,权重分别九与一,目标是 ,导数为 20c−20,故最优 c=1;若等权,则 c=5。权重表达了数据或目标中的相对重要性,不是让计算更漂亮的任意装饰。在独立、零均值、已知不同误差方差的模型里,常用方差倒数作为权重;若误差相关,需要使用完整协方差结构,而非仅对角权重。
数值稳定性与 QR 分解
形成 可能放大病态性:在满列秩的二范数条件数意义下,其条件数是 X 的条件数平方。若列几乎相关,正规方程的显式形成和求解可能损失精度。用薄 QR 分解 ,其中 Q 的列正交归一,即 ,R 为可逆上三角矩阵,可把问题转为解 。
其理由是把 y 分成列空间投影 与正交补部分,后者无法由 Xβ 改变;前者在正交坐标中最小化 。解三角系统即可,不需要显式求逆。QR 改善数值求解过程,但不能消除原始问题本身因近相关列而具有的参数敏感性。
在同一组水位数据上手算薄 QR
前面的设计矩阵第一列长度为二,归一化得到 。时间列在这个方向上的投影系数为三,减去投影后剩下 ,其长度为 。因此可取 两个单位列向量点积为零,且直接相乘可恢复原设计矩阵。对观测向量,有 。先解第二行得斜率 ,再解第一行得截距 。这里没有形成正规方程中的平方条件数矩阵,却得到相同的精确数学解。
这个小例子用投影逐列构造正交基,是为了展示几何含义。大规模浮点计算中,朴素的经典 Gram–Schmidt 过程可能失去正交性,常用 Householder 反射、改进正交化或相应数值库;不能把“采用 QR”理解成任何写法都同样稳定。FNC:The QR factorization;Computing QR factorizations
变量缩放、中心化和选择合理的模型阶数也有帮助。若把分钟换成秒,斜率数值会变化,而物理预测在单位一致时应保持不变。添加高次项通常不会增加训练残差平方和,因为原模型的预测集合被包含在新模型内;却可能使参数不稳定、验证误差变大,所以训练误差下降本身不能作为模型更好的充分理由。
满秩仍可能敏感:一个可算出的近秩亏例子
令 ,其中 很小,观测为 。矩阵仍满秩,精确参数为 。如果只把第二个观测增加 ,新的精确参数就变为 取 、,观测只变化百万分之一,两个参数却变成零和二。预测对观测的匹配可以仍然精确,参数解释却非常不稳定。任何正确求解器都会受到这种数据敏感性影响,QR 不能把本来不可可靠分离的两列变成信息充分的列。
若采用奇异值分解来识别有效秩,还需要选定与噪声和单位尺度相符的阈值。把很小的奇异值直接设为零,等于决定不再估计相应方向;加入参数平方惩罚则改变了目标,获得的是正则化解。两种做法都可能有意义,但应说明新增了怎样的选择规则,而不能把软件稳定输出当成数据已确定每个参数的证据。
异常值与统计解释
只拟合常数时,数据 (0,0,0,10) 的平方损失由均值 2.5 最小化,而绝对损失由中位数零最小化。把最后一项从十改成一百,均值变成二十五,中位数仍为零。这个对比揭示平方损失对大残差的敏感性;选择稳健方法时也要说明所优化的目标已经改变,不能把所有拟合方法都称为相同的最小二乘。
在模型 中,若 X 固定且满列秩、误差期望为零,则估计量无偏。若进一步 ,其协方差为 ;正态性还可以支持相应精确分布与区间推断。每多一层结论,都有相应假设,不能因为代数解存在就同时宣布独立、同方差与正态成立。
残差平方和除以 m 是训练均方误差;在标准满列秩同方差线性模型中,估计误差方差时常除以 m−n,前提包括 m>n。二者目的不同,不能混用符号与解释。若数据采用合成教学设置,应明确标注,计算结果不应被包装为实际实验发现。
相关误差与加权推断的前提
若误差协方差为已知正定矩阵 ,可最小化 ,得到广义最小二乘。将 分解为 后,用三角求解形成 与 ,问题就变为变换后的普通最小二乘。这一“白化”同时处理不同方差与观测间相关性;仅把各点除以标准差,通常不能消去相关性。
固定、满列秩的设计矩阵与零均值误差保证相应线性估计无偏;正确的协方差权重支持最优线性无偏性的比较,额外正态假设则用于精确正态或 t 分布推断。所谓“最佳”限定在相应假设和线性无偏估计类内,并不意味着对任意异常值或错误模型都最佳。
现实中权重往往由有限重复测量估计,而不是已知常数。权重本身的不确定性应进入分析,不能把估计出来的方差倒数当成精确已知后无条件沿用全部理想结论。NIST 的说明特别讨论了少量重复观测造成的不稳定权重。NIST:Weighted Least Squares Regression 若权重依赖同一批响应数据,连原先的线性固定权重结构也会变化,需要单独评估偏差与区间覆盖率。
残差自由度为什么是观测数减参数数
在固定满列秩设计、零均值且协方差为 的正确线性模型中,令投影矩阵 。残差为 ,其中 对称且满足 ,秩为参数数目 。因此 这里的迹等于对角元素之和,也等于投影所保留维数。拟合消耗了列空间中的自由变化,只剩正交补中的残差维数;这就是除数不能直接沿用观测数的原因,而不是人为纠正一个小样本比例。
只要 ,残差平方和除以 因而是误差方差的无偏估计,这一期待值结论不需要正态性。若模型漏掉系统结构,残差就不再只是投影后的噪声;若 且设计矩阵可逆,所有观测可以被完全插值,零训练残差也不能据此断言观测没有噪声。预测质量仍需外部信息检验。
历史、复现与编者评注(AI 辅助)
Legendre 在 1805 年发表最小二乘法,Gauss 在 1809 年的著作中发表相关方法,并主张自己更早已使用。发表记录与更早使用的主张是不同类型的历史证据,MacTutor 的 Legendre 传记介绍了这一背景。将方法简单归为单一人物的瞬间发现,会忽略天文观测、误差分析与后续理论的发展。
本条水位数据的可复现包见数学建模的下载说明,包含 CSV、标准库 Python 代码与预期结果。读者可修改一个训练点,检查参数变化、残差正交与留出误差是否仍相符。复现应同时核查输入、参数顺序、残差符号与单位,不只是比较最后一位小数。
参考来源与延伸阅读
- Boyd 与 Vandenberghe:Introduction to Applied Linear Algebra,最小二乘、QR、模型拟合。
- Driscoll 与 Braun:The QR factorization、Computing QR factorizations:薄 QR 与稳定实现。
- NIST:Weighted Least Squares Regression:权重估计与统计条件。
- MacTutor:Legendre,最小二乘发表与优先权背景。
- 先修:矩阵、向量空间、导数;相关:优化、统计推断、数学建模。