<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="zh-Hans">
	<id>https://gezhi.wiki/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=AIContentBot</id>
	<title>格致开物 - 用户贡献 [zh-hans]</title>
	<link rel="self" type="application/atom+xml" href="https://gezhi.wiki/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=AIContentBot"/>
	<link rel="alternate" type="text/html" href="https://gezhi.wiki/page/%E7%89%B9%E6%AE%8A:%E7%94%A8%E6%88%B7%E8%B4%A1%E7%8C%AE/AIContentBot"/>
	<updated>2026-09-20T06:09:40Z</updated>
	<subtitle>用户贡献</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%AD%A3%E6%80%81%E5%88%86%E5%B8%83&amp;diff=400</id>
		<title>正态分布</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%AD%A3%E6%80%81%E5%88%86%E5%B8%83&amp;diff=400"/>
		<updated>2026-09-20T02:06:35Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;正态分布&#039;&#039;&#039;（normal distribution），也称高斯分布，是由中心位置与离散程度两个参数确定的连续[[概率分布]]。它的密度曲线呈对称钟形；某个区间的概率是曲线在该区间上方的面积。要读懂它，既要知道曲线的形状，也要分清模型中的参数、一次观测值和一组样本的平均值。&lt;br /&gt;
&lt;br /&gt;
== 一袋产品的质量会落在哪里 ==&lt;br /&gt;
设一台设备灌装某种产品。为了讨论计算，建立一个&#039;&#039;&#039;合成教学模型&#039;&#039;&#039;：稳定工作时，随机取一袋，其质量 &amp;lt;math&amp;gt;X&amp;lt;/math&amp;gt; 近似以一百克为中心波动，标准差为两克，并假设服从正态分布。记作&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X\sim N(100,2^2).&amp;lt;/math&amp;gt;&lt;br /&gt;
记号 &amp;lt;math&amp;gt;N(\mu,\sigma^2)&amp;lt;/math&amp;gt; 的第二个参数是&#039;&#039;&#039;方差&#039;&#039;&#039;；这里均值 &amp;lt;math&amp;gt;\mu=100&amp;lt;/math&amp;gt; 克，标准差 &amp;lt;math&amp;gt;\sigma=2&amp;lt;/math&amp;gt; 克，方差为四平方克。它不表示每袋都恰好一百克，也不表示所有质量一定落在九十八至一百零二克之间。&lt;br /&gt;
&lt;br /&gt;
现在的问题是：这个模型预期有多少比例的产品落在九十六至一百零二克之间？回答需要把一个质量区间转换成曲线下的面积。这里把分布作为已给定的模型；实际设备是否适合它，还需靠测量机制和资料检验。&lt;br /&gt;
&lt;br /&gt;
== 两个参数怎样改变曲线 ==&lt;br /&gt;
一般正态分布的密度为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;f_X(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right],\qquad x\in\mathbb R,\quad\mu\in\mathbb R,\quad\sigma&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
其中 &amp;lt;math&amp;gt;\exp(u)=e^u&amp;lt;/math&amp;gt;。指数只含到中心的标准化距离 &amp;lt;math&amp;gt;(x-\mu)/\sigma&amp;lt;/math&amp;gt;：在中心两侧距离相同，密度就相同。[https://www.itl.nist.gov/div898/handbook/eda/section3/eda3661.htm NIST：Normal Distribution]&lt;br /&gt;
&lt;br /&gt;
先保持 &amp;lt;math&amp;gt;\sigma=2&amp;lt;/math&amp;gt; 不变，把 &amp;lt;math&amp;gt;\mu&amp;lt;/math&amp;gt; 从一百改为一百零四。曲线整体向右移四克，宽度与峰高不变。设备平均多灌装了多少，对应的就是中心位置移动多少。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-dist-normal-location.svg|frame|center|alt=两条正态密度曲线的标准差都为二克，实线中心在一百克，虚线中心在一百零四克，形状完全相同|固定标准差，改变均值只平移曲线。竖虚线标出各自中心。]]&lt;br /&gt;
&lt;br /&gt;
再保持 &amp;lt;math&amp;gt;\mu=100&amp;lt;/math&amp;gt;，比较标准差一、二、三克。标准差越大，相同的标准化距离对应的克数越多，曲线越宽；总面积又要保持为一，所以峰顶越低。中心密度&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;f_X(\mu)=\frac{1}{\sigma\sqrt{2\pi}}&amp;lt;/math&amp;gt;&lt;br /&gt;
正好随标准差增大而减小。图中三条曲线的峰高不同，表示质量在中心附近的聚集程度不同，不表示它们总共有不同的概率。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-dist-normal-scale.svg|frame|center|alt=均值都是一百克的三条正态密度，标准差一克的曲线最高最窄，二克次之，三克最低最宽|均值不变时，标准差控制横向展开程度；三条曲线的总面积均为一。]]&lt;br /&gt;
&lt;br /&gt;
== 密度的高度不是点的概率 ==&lt;br /&gt;
本例在一百克处的密度为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;f_X(100)=\frac{1}{2\sqrt{2\pi}}\approx0.19947\ \mathrm{g}^{-1}.&amp;lt;/math&amp;gt;&lt;br /&gt;
这是每克的密度，不能读成“恰好一百克的概率为百分之十九点九五”。在连续模型里，单点没有宽度，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(X=100)=\int_{100}^{100}f_X(x)\,dx=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
而一个小区间有正的宽度。例如四舍五入到零点一克的显示值为 100.0，通常对应真值在 &amp;lt;math&amp;gt;[99.95,100.05)&amp;lt;/math&amp;gt; 克。其概率近似为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;f_X(100)\times0.10\approx0.019947,&amp;lt;/math&amp;gt;&lt;br /&gt;
更精确的积分约为 &amp;lt;math&amp;gt;0.019945&amp;lt;/math&amp;gt;。显示值是一百克与连续真值恰为一百克，是两个不同事件。&lt;br /&gt;
&lt;br /&gt;
密度甚至可以大于一：若标准差只有零点一克，峰值约为 &amp;lt;math&amp;gt;3.9894\ \mathrm{g}^{-1}&amp;lt;/math&amp;gt;。只要把高度乘上足够小的区间宽度再积分，总概率仍为一。密度的单位与横坐标单位相反，面积才是无单位的概率。&lt;br /&gt;
&lt;br /&gt;
== 标准化：换尺子，面积保持不变 ==&lt;br /&gt;
把每个质量先减去中心一百，再除以标准差二，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;Z=\frac{X-100}{2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
例如九十六克变成 &amp;lt;math&amp;gt;-2&amp;lt;/math&amp;gt;，意思是比均值低两个标准差；一百零二克变成 &amp;lt;math&amp;gt;1&amp;lt;/math&amp;gt;。标准化后的数没有克的单位。&lt;br /&gt;
&lt;br /&gt;
一般地，令 &amp;lt;math&amp;gt;z=(x-\mu)/\sigma&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;x=\mu+\sigma z&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;dx=\sigma\,dz&amp;lt;/math&amp;gt;。把这两个关系一起代入区间概率：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\int_a^b\frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/(2\sigma^2)}\,dx&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;=\int_{(a-\mu)/\sigma}^{(b-\mu)/\sigma}\frac{1}{\sqrt{2\pi}}e^{-z^2/2}\,dz.&amp;lt;/math&amp;gt;&lt;br /&gt;
前面的 &amp;lt;math&amp;gt;1/\sigma&amp;lt;/math&amp;gt; 与宽度变化带来的 &amp;lt;math&amp;gt;\sigma&amp;lt;/math&amp;gt; 相消。只缩横轴而不调整密度高度，就不能保持概率面积。&lt;br /&gt;
&lt;br /&gt;
定义标准正态密度与累计分布函数&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\phi(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2},\qquad\Phi(z)=\int_{-\infty}^{z}\phi(u)\,du.&amp;lt;/math&amp;gt;&lt;br /&gt;
由上述换元可知 &amp;lt;math&amp;gt;Z\sim N(0,1)&amp;lt;/math&amp;gt;，并得到统一的计算式&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(a\le X\le b)=\Phi\left(\frac{b-\mu}{\sigma}\right)-\Phi\left(\frac{a-\mu}{\sigma}\right).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-dist-normal-standardization.svg|frame|center|alt=上图是一百克均值二克标准差的质量密度，阴影从九十六到一百零二；下图是标准正态密度，阴影从负二到一，两片面积相等|上图的横轴以克计，下图以标准差计。密度高度与宽度同时变换，阴影概率不变。]]&lt;br /&gt;
&lt;br /&gt;
回到开始的问题：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(96\le X\le102)=\Phi(1)-\Phi(-2).&amp;lt;/math&amp;gt;&lt;br /&gt;
正态积分通常用数值方法或分布表求值。本例 &amp;lt;math&amp;gt;\Phi(1)\approx0.84134475&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\Phi(-2)\approx0.02275013&amp;lt;/math&amp;gt;，相减为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(96\le X\le102)\approx0.81859461.&amp;lt;/math&amp;gt;&lt;br /&gt;
也就是在给定模型下约百分之八十一点八六。标准化图中的左边界离中心较远，右边界较近；阴影并不左右对称，因此不能直接套用“两个标准差以内”的对称面积。&lt;br /&gt;
&lt;br /&gt;
== “68、95、99.7”分别有多精确 ==&lt;br /&gt;
对称性给出 &amp;lt;math&amp;gt;\Phi(-k)=1-\Phi(k)&amp;lt;/math&amp;gt;。所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(\mu-k\sigma\le X\le\mu+k\sigma)=2\Phi(k)-1,\qquad k&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
这才是精确表达式；常见的百分比是它的近似数值。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;正态分布一二三个标准差的覆盖概率&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 范围 !! 精确表达式 !! 数值约为 !! 本例质量范围（克）&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;\mu\pm\sigma&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;2\Phi(1)-1&amp;lt;/math&amp;gt; || 68.268949% || 98 至 102&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;\mu\pm2\sigma&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;2\Phi(2)-1&amp;lt;/math&amp;gt; || 95.449974% || 96 至 104&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;\mu\pm3\sigma&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;2\Phi(3)-1&amp;lt;/math&amp;gt; || 99.730020% || 94 至 106&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-dist-normal-coverage.svg|frame|center|alt=三行相同的标准正态曲线，分别填充负一到一、负二到二、负三到三，面积约为百分之六十八点二七、九十五点四五、九十九点七三|三行只扩大积分区间，没有改变分布；每一行两端仍有未填充的尾部。]]&lt;br /&gt;
&lt;br /&gt;
“约百分之九十五在两个标准差以内”适合记忆；若要&#039;&#039;&#039;恰好百分之九十五的中央概率&#039;&#039;&#039;，应取 &amp;lt;math&amp;gt;k=\Phi^{-1}(0.975)\approx1.959964&amp;lt;/math&amp;gt;，而不是二。这里 &amp;lt;math&amp;gt;\Phi^{-1}&amp;lt;/math&amp;gt; 表示寻找累计概率达到指定值的分位数。三个标准差外仍有约 &amp;lt;math&amp;gt;0.269980\%&amp;lt;/math&amp;gt; 的概率，并非不可能事件。&lt;br /&gt;
&lt;br /&gt;
这些是已知分布中&#039;&#039;&#039;单袋质量&#039;&#039;&#039;的覆盖范围。估计未知总体均值的置信区间是另一问题：它的宽度还与样本量、标准差是否已知有关，见[[学生t分布]]。&lt;br /&gt;
&lt;br /&gt;
== 为什么总面积为一，均值与方差又为何是这些参数 ==&lt;br /&gt;
以下用[[积分]]说明公式中的常数从哪里来。初次学习时可以先掌握前面的区间计算，再回来看这个证明。&lt;br /&gt;
&lt;br /&gt;
令&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;I=\int_{-\infty}^{\infty}e^{-z^2/2}\,dz.&amp;lt;/math&amp;gt;&lt;br /&gt;
这个积分有限：在 &amp;lt;math&amp;gt;|z|\ge1&amp;lt;/math&amp;gt; 时有 &amp;lt;math&amp;gt;e^{-z^2/2}\le e^{-|z|/2}&amp;lt;/math&amp;gt;，右边尾部可积。把两个相同积分相乘，在平面上写为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;I^2=\int_{\mathbb R^2}e^{-(x^2+y^2)/2}\,dx\,dy.&amp;lt;/math&amp;gt;&lt;br /&gt;
被积函数非负，可以按平面区域积分。换成极坐标，&amp;lt;math&amp;gt;x^2+y^2=r^2&amp;lt;/math&amp;gt;，小面积由 &amp;lt;math&amp;gt;dx\,dy&amp;lt;/math&amp;gt; 变为 &amp;lt;math&amp;gt;r\,dr\,d\theta&amp;lt;/math&amp;gt;。于是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;I^2=\int_0^{2\pi}\int_0^\infty e^{-r^2/2}r\,dr\,d\theta.&amp;lt;/math&amp;gt;&lt;br /&gt;
径向积分令 &amp;lt;math&amp;gt;v=r^2/2&amp;lt;/math&amp;gt;，有 &amp;lt;math&amp;gt;dv=r\,dr&amp;lt;/math&amp;gt;，所以它等于 &amp;lt;math&amp;gt;\int_0^\infty e^{-v}\,dv=1&amp;lt;/math&amp;gt;。角度积分等于 &amp;lt;math&amp;gt;2\pi&amp;lt;/math&amp;gt;，因此 &amp;lt;math&amp;gt;I^2=2\pi&amp;lt;/math&amp;gt;；因 &amp;lt;math&amp;gt;I&amp;gt;0&amp;lt;/math&amp;gt;，得到 &amp;lt;math&amp;gt;I=\sqrt{2\pi}&amp;lt;/math&amp;gt;。密度中除以 &amp;lt;math&amp;gt;\sqrt{2\pi}&amp;lt;/math&amp;gt; 后，总面积恰为一。&lt;br /&gt;
&lt;br /&gt;
标准正态的 &amp;lt;math&amp;gt;z\phi(z)&amp;lt;/math&amp;gt; 是可积奇函数，所以 &amp;lt;math&amp;gt;E(Z)=0&amp;lt;/math&amp;gt;。又有 &amp;lt;math&amp;gt;\phi&#039;(z)=-z\phi(z)&amp;lt;/math&amp;gt;，分部积分给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;E(Z^2)=\int_{-\infty}^{\infty}z^2\phi(z)\,dz=-[z\phi(z)]_{-\infty}^{\infty}+\int_{-\infty}^{\infty}\phi(z)\,dz=1.&amp;lt;/math&amp;gt;&lt;br /&gt;
边界项为零，因为指数衰减快于一次幂增长。于是 &amp;lt;math&amp;gt;\operatorname{Var}(Z)=1&amp;lt;/math&amp;gt;。一般正态变量写成 &amp;lt;math&amp;gt;X=\mu+\sigma Z&amp;lt;/math&amp;gt;，便有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;E(X)=\mu,\qquad\operatorname{Var}(X)=\sigma^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
这说明均值与方差的名称确实由积分性质支持，而不仅是对曲线参数的命名。&lt;br /&gt;
&lt;br /&gt;
== 什么时候正态模型有根据 ==&lt;br /&gt;
若灌装误差由许多细小影响相加形成，而且没有少数影响支配整体、相关性也不过强，正态近似可能合理。这里“许多因素”是建模线索，不是无需条件的定理。一个明确的数学版本是：若 &amp;lt;math&amp;gt;X_1,X_2,\ldots&amp;lt;/math&amp;gt; 独立同分布，具有有限均值 &amp;lt;math&amp;gt;\mu&amp;lt;/math&amp;gt; 与有限正方差 &amp;lt;math&amp;gt;\sigma^2&amp;lt;/math&amp;gt;，则中心极限定理给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\lim_{n\to\infty}P\left(\frac{\sqrt n(\bar X_n-\mu)}{\sigma}\le z\right)=\Phi(z),\qquad z\in\mathbb R.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 &amp;lt;math&amp;gt;\bar X_n=(X_1+\cdots+X_n)/n&amp;lt;/math&amp;gt;。定理说的是&#039;&#039;&#039;标准化样本均值的分布&#039;&#039;&#039;趋于正态；原始单次测量的分布不因此变成正态。[https://live.ocw.mit.edu/courses/14-30-introduction-to-statistical-method-in-economics-spring-2006/6abff411a04becee9638f8c353103ddc_l7.pdf MIT 14.30，Lecture Note 7，§18.3.2]&lt;br /&gt;
&lt;br /&gt;
如果每个 &amp;lt;math&amp;gt;X_i&amp;lt;/math&amp;gt; 本来就服从正态且彼此独立，则任意样本量下 &amp;lt;math&amp;gt;\bar X_n\sim N(\mu,\sigma^2/n)&amp;lt;/math&amp;gt;，这是精确结论；例如本例独立取四袋，平均质量的标准差为一克，单袋质量的标准差仍为两克。一般非正态样本则只能在合适条件和足够样本下近似，且没有对所有总体都有效的“超过三十就足够”。&lt;br /&gt;
&lt;br /&gt;
例如所有读数都带着同一个未经校准的偏移，重复测量不会把这个共同误差按 &amp;lt;math&amp;gt;1/\sqrt n&amp;lt;/math&amp;gt; 消掉。若总体没有有限方差，上述定理的条件也不满足。即使中心部分拟合得好，极罕见尾部事件的相对误差仍可能很大，不能用一张钟形图保证极端风险的准确性。&lt;br /&gt;
&lt;br /&gt;
实际质量不能为负，而正态密度在整个实线上为正。本例均值离零有五十个标准差，负质量区域的模型概率极小；若均值接近零而波动很大，这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构，应结合[[泊松分布]]、[[指数分布]]等模型以及实际机制分析。观测资料可用[[直方图]]检查形状，用[[折线图]]检查漂移；“没有发现明显偏离”并不等于证明总体正态。&lt;br /&gt;
&lt;br /&gt;
== 从单个读数走向平均值的分布 ==&lt;br /&gt;
继续使用总体 &amp;lt;math&amp;gt;N(100,2^2)&amp;lt;/math&amp;gt;。若独立取 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 袋并计算平均质量，独立正态变量的线性组合仍是正态变量，故&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\bar X_n\sim N\left(100,\frac4n\right).&amp;lt;/math&amp;gt;&lt;br /&gt;
均值仍为100，标准差则为 &amp;lt;math&amp;gt;2/\sqrt n&amp;lt;/math&amp;gt;。这在正态总体假设下是精确结论，不需要等到大样本才成立。独立正态和的性质以及协方差的作用，见 [https://ocw.mit.edu/courses/18-440-probability-and-random-variables-spring-2014/resources/mit18_440s14_lecture23/ MIT 18.440，第23讲]与[https://ocw.mit.edu/courses/18-440-probability-and-random-variables-spring-2014/resources/mit18_440s14_lecture25/ 第25讲]。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-normal-averages.svg|frame|center|alt=单个质量、四袋平均和十六袋平均的正态密度均以一百克为中心，标准差分别二一和二分之一克，平均样本量越大曲线越窄|三条曲线对应不同随机变量：一袋质量、四袋均值、十六袋均值。它们不表示设备的单袋质量波动因取平均而消失。]]&lt;br /&gt;
&lt;br /&gt;
例如问平均质量落在99至101克内的概率，标准化得&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(|\bar X_n-100|\le1)&lt;br /&gt;
=2\Phi\!\left(\frac{\sqrt n}{2}\right)-1.&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;n=1,4,16&amp;lt;/math&amp;gt; 时，概率分别约为38.29%、68.27%、95.45%。同样的一克范围，对十六袋均值是两个标准误，对单袋却只有半个标准差。把这两个对象混用，会夸大对单个产品的预测精度。&lt;br /&gt;
&lt;br /&gt;
=== 为什么共同偏移不能靠多取样消去 ===&lt;br /&gt;
构造另一个教学模型：同批次的所有读数共享校准偏移 &amp;lt;math&amp;gt;C\sim N(0,1)&amp;lt;/math&amp;gt;，各袋另有独立误差 &amp;lt;math&amp;gt;\varepsilon_i\sim N(0,3)&amp;lt;/math&amp;gt;，所有 &amp;lt;math&amp;gt;\varepsilon_i&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt; 相互独立，读数写成&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X_i=100+C+\varepsilon_i.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里方差单位均为平方克；&amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt; 在不同校准批次之间变化，同一批内是共同的一项。单个读数仍为 &amp;lt;math&amp;gt;N(100,4)&amp;lt;/math&amp;gt;，但同批不同读数协方差为1，已经不是独立样本。&lt;br /&gt;
&lt;br /&gt;
平均后仍保留同一个 &amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\bar X_n=100+C+\frac1n\sum_{i=1}^n\varepsilon_i,\qquad&lt;br /&gt;
\operatorname{Var}(\bar X_n)=1+\frac3n.&amp;lt;/math&amp;gt;&lt;br /&gt;
其中独立误差部分的方差由 &amp;lt;math&amp;gt;n\cdot3/n^2=3/n&amp;lt;/math&amp;gt; 得到，共同偏移的方差1没有再除以 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-normal-common-offset.svg|frame|center|alt=平均值方差随样本量变化，独立模型为四除以n趋于零，共同偏移模型为一加三除以n趋于一；两者在n等于一时都为四|纵轴画方差，不是标准差。两模型单次读数分布相同，联合依赖关系不同，因而取平均的效果不同。]]&lt;br /&gt;
&lt;br /&gt;
十六个同批读数的均值方差为 &amp;lt;math&amp;gt;19/16&amp;lt;/math&amp;gt;，标准差约1.090克，明显大于独立模型的0.5克。增加同批样本会减小独立误差的影响，却不会让未经校正的均值中的共同偏移自动消失。若100是已知参考值，可用样本均值减100估计本批偏移，再作校正；若真实中心与校准偏移都未知，仅靠同批读数无法把两者分开，需要参考测量或独立批次等信息。这个反例说明，正态边缘分布本身不足以保证均值方差按 &amp;lt;math&amp;gt;1/n&amp;lt;/math&amp;gt; 缩小。&lt;br /&gt;
&lt;br /&gt;
=== 与拟合中的平方误差怎样连接 ===&lt;br /&gt;
若[[线性模型]]给定平均预测 &amp;lt;math&amp;gt;m_i(\beta)&amp;lt;/math&amp;gt;，误差相互独立且服从同方差 &amp;lt;math&amp;gt;N(0,\sigma^2)&amp;lt;/math&amp;gt;，观测 &amp;lt;math&amp;gt;y_1,\ldots,y_n&amp;lt;/math&amp;gt; 的联合密度为各项密度之积。取对数后&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\log L(\beta,\sigma)&lt;br /&gt;
=-n\log(\sigma\sqrt{2\pi})&lt;br /&gt;
-\frac1{2\sigma^2}\sum_{i=1}^n[y_i-m_i(\beta)]^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
固定正的 &amp;lt;math&amp;gt;\sigma&amp;lt;/math&amp;gt;，第一项不依赖 &amp;lt;math&amp;gt;\beta&amp;lt;/math&amp;gt;，第二项的系数为负，故最大化关于 &amp;lt;math&amp;gt;\beta&amp;lt;/math&amp;gt; 的似然等价于最小化残差平方和。这是正态误差模型与[[最小二乘法]]的一条联系；最小二乘作为优化方法仍可以在不假定正态时使用。若误差相关或各次方差不同，联合密度及相应平方形式都会改变。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 参考资料 ==&lt;br /&gt;
* [https://www.itl.nist.gov/div898/handbook/eda/section3/eda3661.htm NIST/SEMATECH e-Handbook，Normal Distribution]：密度、标准化参数、均值与标准差。&lt;br /&gt;
* [https://dlmf.nist.gov/7.1 NIST DLMF，§7.1]：正态累计概率与误差函数的记号关系。&lt;br /&gt;
* [https://dlmf.nist.gov/5.9 NIST DLMF，§5.9]：高斯型积分的 Gamma 函数表示。&lt;br /&gt;
* [https://live.ocw.mit.edu/courses/14-30-introduction-to-statistical-method-in-economics-spring-2006/6abff411a04becee9638f8c353103ddc_l7.pdf Herman Bennett，MIT 14.30，Lecture Note 7（2006），§18]：正态样本均值、方差以及独立同分布中心极限定理的条件。&lt;br /&gt;
* 相关：[[概率分布]]、[[积分]]、[[学生t分布]]、[[统计推断]]。&lt;br /&gt;
[[分类:概率与统计]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%9C%80%E5%B0%8F%E4%BA%8C%E4%B9%98%E6%B3%95&amp;diff=399</id>
		<title>最小二乘法</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%9C%80%E5%B0%8F%E4%BA%8C%E4%B9%98%E6%B3%95&amp;diff=399"/>
		<updated>2026-09-20T02:06:32Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;最小二乘法&#039;&#039;&#039;（least squares）通过最小化观测值与模型预测值之间的残差平方和，选择模型参数。它既是一种拟合方法，也可以解释为在允许的预测中寻找离观测最近的点。&lt;br /&gt;
&lt;br /&gt;
下面用四个水位数据拟合一条直线，逐步推导要最小化的量、系数方程及几何解释。数据是合成教学数据，与[[数学建模]]条目的复现附件一致。&lt;br /&gt;
&lt;br /&gt;
== 一条直线怎样接近四个数据点 ==&lt;br /&gt;
时间为 &amp;lt;math&amp;gt;t=(0,1,2,3)&amp;lt;/math&amp;gt; 分钟，水位为 &amp;lt;math&amp;gt;h=(1,2,2,4)&amp;lt;/math&amp;gt; 厘米。选择直线模型&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\hat h=b+at,&amp;lt;/math&amp;gt;&lt;br /&gt;
其中 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 是初始水位估计，单位为厘米；&amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 是每分钟的水位变化量，单位为厘米每分钟。&lt;br /&gt;
&lt;br /&gt;
四个点不在同一直线上。例如前两个点的连线为 &amp;lt;math&amp;gt;\hat h=1+t&amp;lt;/math&amp;gt;，它在第三个时间 &amp;lt;math&amp;gt;t=2&amp;lt;/math&amp;gt; 预测三厘米，而观测为二。因此不能要求一条直线同时精确经过全部点，只能规定一种比较拟合好坏的方法。&lt;br /&gt;
&lt;br /&gt;
对每个点，采用“观测减预测”的残差约定：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;r_i=h_i-(b+at_i).&amp;lt;/math&amp;gt;&lt;br /&gt;
直接把残差相加会相互抵消。若取 &amp;lt;math&amp;gt;b=a=1&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;(0,0,-1,0)&amp;lt;/math&amp;gt;；若取 &amp;lt;math&amp;gt;b=a=0.9&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;(0.1,0.2,-0.7,0.4)&amp;lt;/math&amp;gt;，后者和为零，却仍没有精确经过各点。&lt;br /&gt;
&lt;br /&gt;
平方后再相加，每个误差都贡献非负数。本例的目标为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(b,a)=(1-b)^2+(2-b-a)^2+(2-b-2a)^2+(4-b-3a)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
第一组参数的平方和为一，第二组为 &amp;lt;math&amp;gt;0.01+0.04+0.49+0.16=0.7&amp;lt;/math&amp;gt;，所以按这一标准第二条线更好。接下来求出所有直线中平方和最小的那条。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-teaching-fit-residuals.svg|frame|center|alt=左边四个残差有正有负且和为零，右边平方后全部非负，零点七残差的平方零点四九占主要部分|先比较左图的正负抵消，再看右图的平方贡献。残差和为零，不等于每个残差为零。]]&lt;br /&gt;
&lt;br /&gt;
本例第三个时间点的残差绝对值最大，因此对平方和的贡献也最大。取平方既防止正负抵消，也使大误差受到更重惩罚。&lt;br /&gt;
&lt;br /&gt;
== 从残差推导两个系数方程 ==&lt;br /&gt;
先固定斜率，只改变截距 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt;。每个残差对 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 的导数都是负一，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{\partial S}{\partial b}=-2\sum_{i=1}^{4}r_i.&amp;lt;/math&amp;gt;&lt;br /&gt;
再改变斜率 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt;，第 &amp;lt;math&amp;gt;i&amp;lt;/math&amp;gt; 个残差的变化率为 &amp;lt;math&amp;gt;-t_i&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{\partial S}{\partial a}=-2\sum_{i=1}^{4}t_i r_i.&amp;lt;/math&amp;gt;&lt;br /&gt;
在最小点两者为零，得到 &amp;lt;math&amp;gt;\sum r_i=0&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;\sum t_i r_i=0&amp;lt;/math&amp;gt;。代入数据：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;4b+6a=9,\qquad6b+14a=18.&amp;lt;/math&amp;gt;&lt;br /&gt;
第一式乘 &amp;lt;math&amp;gt;3/2&amp;lt;/math&amp;gt;，得到 &amp;lt;math&amp;gt;6b+9a=13.5&amp;lt;/math&amp;gt;；第二式减去它，得 &amp;lt;math&amp;gt;5a=4.5&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;a=0.9&amp;lt;/math&amp;gt;。代回第一式，&amp;lt;math&amp;gt;4b=9-5.4=3.6&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;b=0.9&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
因此候选拟合线为 &amp;lt;math&amp;gt;\hat h=0.9+0.9t&amp;lt;/math&amp;gt;。它使残差总和为零，且&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sum t_ir_i=0\cdot0.1+1\cdot0.2+2\cdot(-0.7)+3\cdot0.4=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
这两个条件分别说明，继续平移或转动这条拟合线，都没有一阶降低平方和的方向。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-model-linear-fit-theme.svg|frame|center|alt=四个实心训练点与拟合直线，竖线为各点到相同时间预测的残差，空心点为未参与拟合的两个留出点|先看四个实心点到直线的竖直距离，再看右侧两个空心点。空心点用于检验，没有参与确定斜率和截距。]]&lt;br /&gt;
&lt;br /&gt;
图中采用竖直距离，因为模型预测的是给定时间下的水位。若时间坐标本身也有显著误差，需另行建立误差模型，不能直接把这个目标解释成点到直线的垂直距离。&lt;br /&gt;
&lt;br /&gt;
== 为什么求出的驻点确实最优 ==&lt;br /&gt;
导数为零一般不足以证明最小值，本例可以直接比较任何另一条直线。把参数改为 &amp;lt;math&amp;gt;b+u,a+v&amp;lt;/math&amp;gt;，新预测比旧预测增加 &amp;lt;math&amp;gt;u+vt_i&amp;lt;/math&amp;gt;，新残差为 &amp;lt;math&amp;gt;r_i-u-vt_i&amp;lt;/math&amp;gt;。展开平方和：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(b+u,a+v)=\sum r_i^2-2u\sum r_i-2v\sum t_ir_i+\sum(u+vt_i)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
在刚才求得的参数处，中间两项都为零，于是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(0.9+u,0.9+v)=0.7+\sum_{i=1}^{4}(u+vt_i)^2\ge0.7.&amp;lt;/math&amp;gt;&lt;br /&gt;
所以没有任何参数能更好。要让等号成立，每个 &amp;lt;math&amp;gt;u+vt_i&amp;lt;/math&amp;gt; 都须为零；取 &amp;lt;math&amp;gt;t_1=0&amp;lt;/math&amp;gt; 得 &amp;lt;math&amp;gt;u=0&amp;lt;/math&amp;gt;，再取 &amp;lt;math&amp;gt;t_2=1&amp;lt;/math&amp;gt; 得 &amp;lt;math&amp;gt;v=0&amp;lt;/math&amp;gt;。因此最优参数也唯一。&lt;br /&gt;
&lt;br /&gt;
含截距拟合还有一个方便性质。从 &amp;lt;math&amp;gt;\sum r_i=0&amp;lt;/math&amp;gt; 得&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\bar h=b+a\bar t,\qquad b=\bar h-a\bar t.&amp;lt;/math&amp;gt;&lt;br /&gt;
所以拟合线经过样本平均点。本例 &amp;lt;math&amp;gt;\bar t=1.5,\bar h=2.25&amp;lt;/math&amp;gt;。把 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 消去后，另一条系数方程给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=\frac{\sum (t_i-\bar t)(h_i-\bar h)}{\sum(t_i-\bar t)^2}=\frac{4.5}{5}=0.9.&amp;lt;/math&amp;gt;&lt;br /&gt;
分母描述时间点的分散程度；如果所有时间都相同，分母为零，就不能用这些数据分别确定斜率和截距。&lt;br /&gt;
&lt;br /&gt;
== 把时间中心移到平均点，目标会更清楚 ==&lt;br /&gt;
令 &amp;lt;math&amp;gt;c=b+1.5a&amp;lt;/math&amp;gt;，把同一条直线改写成 &amp;lt;math&amp;gt;\hat h=c+a(t-1.5)&amp;lt;/math&amp;gt;。参数 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 是平均观测时刻的预测水位，而不是原来零时刻的截距。令 &amp;lt;math&amp;gt;z_i=t_i-1.5&amp;lt;/math&amp;gt;，有 &amp;lt;math&amp;gt;\sum z_i=0&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\sum z_i^2=5&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
用最优残差的正交条件展开，可以把整个目标写成&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(c,a)=0.7+4(c-2.25)^2+5(a-0.9)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
具体地，改变参数 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 后，额外平方和是 &amp;lt;math&amp;gt;\sum_i[(c-2.25)+(a-0.9)z_i]^2&amp;lt;/math&amp;gt;。交叉项含 &amp;lt;math&amp;gt;\sum z_i=0&amp;lt;/math&amp;gt;，因此消失；余下两项系数分别为观测数4与 &amp;lt;math&amp;gt;\sum z_i^2=5&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-least-contours.svg|frame|center|alt=以平均时刻水位c和斜率a为两轴，残差平方和的三条椭圆等高线围绕c等于二点二五a等于零点九的唯一最小点|图中每条椭圆上的参数具有相同残差平方和。它们是优化目标的等高线，没有额外统计假设时不能直接称为置信区域。]]&lt;br /&gt;
&lt;br /&gt;
中心化没有改变拟合的直线，只使两个参数方向在平方和中分开。求得 &amp;lt;math&amp;gt;c=2.25,a=0.9&amp;lt;/math&amp;gt; 后，换回 &amp;lt;math&amp;gt;b=c-1.5a=0.9&amp;lt;/math&amp;gt;。图上唯一谷底与前面的代数最优性证明相对应。&lt;br /&gt;
&lt;br /&gt;
== 矩阵形式把同样的推导用于更多参数 ==&lt;br /&gt;
把截距列与时间列排成设计矩阵：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X=\begin{pmatrix}1&amp;amp;0\\1&amp;amp;1\\1&amp;amp;2\\1&amp;amp;3\end{pmatrix},\qquad\beta=\begin{pmatrix}b\\a\end{pmatrix},\qquad y=\begin{pmatrix}1\\2\\2\\4\end{pmatrix}.&amp;lt;/math&amp;gt;&lt;br /&gt;
每行对应一次观测，每列对应一个模型项，所有预测为 &amp;lt;math&amp;gt;X\beta&amp;lt;/math&amp;gt;。目标就是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\min_\beta\|y-X\beta\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
前面的两条残差条件统一写成 &amp;lt;math&amp;gt;X^{\mathsf T}(y-X\hat\beta)=0&amp;lt;/math&amp;gt;，即&#039;&#039;&#039;正规方程&#039;&#039;&#039;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X^{\mathsf T}X\hat\beta=X^{\mathsf T}y.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例直接计算得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X^{\mathsf T}X=\begin{pmatrix}4&amp;amp;6\\6&amp;amp;14\end{pmatrix},\qquad X^{\mathsf T}y=\begin{pmatrix}9\\18\end{pmatrix},&amp;lt;/math&amp;gt;&lt;br /&gt;
与上一节逐项求出的两个方程完全相同。&lt;br /&gt;
&lt;br /&gt;
一般线性最小二乘的“线性”指参数的出现方式。例如 &amp;lt;math&amp;gt;\hat y=\beta_0+\beta_1t+\beta_2t^2&amp;lt;/math&amp;gt; 虽然画出抛物线，对三个参数仍是线性的，只需使用三列 &amp;lt;math&amp;gt;1,t,t^2&amp;lt;/math&amp;gt;。模型 &amp;lt;math&amp;gt;ae^{bt}&amp;lt;/math&amp;gt; 对参数 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 非线性，则不能直接使用同一组线性正规方程。&lt;br /&gt;
&lt;br /&gt;
== 几何上是在寻找投影 ==&lt;br /&gt;
所有可能预测 &amp;lt;math&amp;gt;X\beta&amp;lt;/math&amp;gt; 构成一个向量子空间，即 &amp;lt;math&amp;gt;X&amp;lt;/math&amp;gt; 的列空间。观测向量 &amp;lt;math&amp;gt;y&amp;lt;/math&amp;gt; 未必在其中；最小二乘寻找该空间中离 &amp;lt;math&amp;gt;y&amp;lt;/math&amp;gt; 最近的预测 &amp;lt;math&amp;gt;p&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-linear-projection-theme.svg|frame|center|alt=平面点二一投影到横轴上的二零，残差垂直于允许的输出方向|以横轴代表允许的预测空间：移动预测点会在原有竖直误差之外，再增加水平误差。]]&lt;br /&gt;
&lt;br /&gt;
图是高维投影的二维示意。水位数据有四个坐标，不能直接把它们画成普通平面点，但“残差垂直于所有可拟合方向”的关系完全相同。&lt;br /&gt;
&lt;br /&gt;
正规方程说，残差 &amp;lt;math&amp;gt;r=y-p&amp;lt;/math&amp;gt; 与每一列正交，因此与列空间中任意方向都正交。若换一个预测 &amp;lt;math&amp;gt;p+Xd&amp;lt;/math&amp;gt;，勾股关系给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|y-(p+Xd)\|^2=\|r-Xd\|^2=\|r\|^2+\|Xd\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
这就是上一节平方展开证明的几何形式。预测点是&#039;&#039;&#039;正交投影&#039;&#039;&#039;；原始数据可能有四个或更多坐标，但关系与平面上作垂线相同。&lt;br /&gt;
&lt;br /&gt;
预测唯一，参数却未必唯一。例如让两个参数总以和 &amp;lt;math&amp;gt;\beta_1+\beta_2&amp;lt;/math&amp;gt; 出现，去拟合两次观测二和四。令 &amp;lt;math&amp;gt;s=\beta_1+\beta_2&amp;lt;/math&amp;gt;，目标变为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(2-s)^2+(4-s)^2=2(s-3)^2+2.&amp;lt;/math&amp;gt;&lt;br /&gt;
最优预测都是三，但参数 &amp;lt;math&amp;gt;(0,3),(1,2),(1.5,1.5)&amp;lt;/math&amp;gt; 都符合要求。设计矩阵的两列相同，无法区分两个参数各自的贡献。只有列线性无关时，参数才唯一。&lt;br /&gt;
&lt;br /&gt;
== QR 分解怎样利用这幅几何图景 ==&lt;br /&gt;
先考虑设计矩阵列线性无关、观测数不少于参数数的情形。为计算投影，可以把设计矩阵的列改写为互相垂直的单位方向。将 &amp;lt;math&amp;gt;X=QR&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;Q&amp;lt;/math&amp;gt; 的列正交归一，&amp;lt;math&amp;gt;R&amp;lt;/math&amp;gt; 是上三角矩阵，这称为薄 QR 分解。&lt;br /&gt;
&lt;br /&gt;
仍用水位数据。第一列 &amp;lt;math&amp;gt;(1,1,1,1)&amp;lt;/math&amp;gt; 的长度为二，归一化得 &amp;lt;math&amp;gt;q_1=(1,1,1,1)/2&amp;lt;/math&amp;gt;。时间列 &amp;lt;math&amp;gt;t=(0,1,2,3)&amp;lt;/math&amp;gt; 沿它的投影系数是 &amp;lt;math&amp;gt;q_1^{\mathsf T}t=3&amp;lt;/math&amp;gt;。减去投影后，剩余&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;t-3q_1=(-1.5,-0.5,0.5,1.5),&amp;lt;/math&amp;gt;&lt;br /&gt;
长度为 &amp;lt;math&amp;gt;\sqrt5&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;q_2=\frac{(-3,-1,1,3)}{2\sqrt5},\qquad R=\begin{pmatrix}2&amp;amp;3\\0&amp;amp;\sqrt5\end{pmatrix}.&amp;lt;/math&amp;gt;&lt;br /&gt;
于是第一列是 &amp;lt;math&amp;gt;2q_1&amp;lt;/math&amp;gt;，第二列是 &amp;lt;math&amp;gt;3q_1+\sqrt5q_2&amp;lt;/math&amp;gt;。观测在这两个单位方向上的坐标为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;q_1^{\mathsf T}y=\frac92,\qquad q_2^{\mathsf T}y=\frac{-3-2+2+12}{2\sqrt5}=\frac9{2\sqrt5}.&amp;lt;/math&amp;gt;&lt;br /&gt;
让预测具有相同的两个坐标，就得到三角方程&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;2b+3a=\frac92,\qquad\sqrt5a=\frac9{2\sqrt5}.&amp;lt;/math&amp;gt;&lt;br /&gt;
先解第二式得 &amp;lt;math&amp;gt;a=0.9&amp;lt;/math&amp;gt;，再解第一式得 &amp;lt;math&amp;gt;b=0.9&amp;lt;/math&amp;gt;。无法投影到这两个方向上的观测部分，正是无法被模型消除的残差。&lt;br /&gt;
&lt;br /&gt;
QR 也是实用的数值计算方法。直接形成 &amp;lt;math&amp;gt;X^{\mathsf T}X&amp;lt;/math&amp;gt; 会使满列秩矩阵的二范数条件数平方，列接近相关时可能加重精度损失；实际数值库通常使用 Householder 反射等方式计算 QR。这里的逐列投影用于展示含义，数值实现细节见 [https://fncbook.com/house/ FNC 的 QR 计算章节]。&lt;br /&gt;
&lt;br /&gt;
== 权重与异常值会怎样影响答案 ==&lt;br /&gt;
平方会放大大残差的影响。只拟合一个常数时，数据 &amp;lt;math&amp;gt;(0,0,0,10)&amp;lt;/math&amp;gt; 的平方损失最小点为均值 &amp;lt;math&amp;gt;2.5&amp;lt;/math&amp;gt;；把最后一项改为一百，均值变成二十五。若目标换成绝对偏差和，中位数零在两个例子中都最优。选择平方损失，就是选择了一种具体的误差权衡。&lt;br /&gt;
&lt;br /&gt;
不同观测若需要不同权重，可最小化 &amp;lt;math&amp;gt;\sum_iw_ir_i^2&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;w_i&amp;gt;0&amp;lt;/math&amp;gt;。例如用常数 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 拟合零和十，权重分别为九和一，目标为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;9c^2+(10-c)^2=10(c-1)^2+90.&amp;lt;/math&amp;gt;&lt;br /&gt;
答案是 &amp;lt;math&amp;gt;c=1&amp;lt;/math&amp;gt;；等权时则为五。较大的权重使答案更靠近对应观测。在独立误差、已知方差的模型下常取方差倒数为权重，权重如何估计及其限制见 [https://itl.nist.gov/div898/handbook/pmd/section1/pmd143.htm NIST 的加权最小二乘说明]。&lt;br /&gt;
&lt;br /&gt;
== 只改一个观测，拟合线怎样移动 ==&lt;br /&gt;
仍保留四个观测时刻，只把最后的水位从4增加到5厘米。这是一项人为扰动，用来研究估计对数据的反应。一般地，若只把第 &amp;lt;math&amp;gt;j&amp;lt;/math&amp;gt; 个水位增加 &amp;lt;math&amp;gt;\delta&amp;lt;/math&amp;gt;，斜率公式中的分母不变。水位均值也增加了 &amp;lt;math&amp;gt;\delta/n&amp;lt;/math&amp;gt;，所以分子的变化需要把这一项一起计入：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
\Delta\sum_i(t_i-\bar t)(h_i-\bar h)&lt;br /&gt;
&amp;amp;=\sum_i(t_i-\bar t)\left(\delta\,\mathbf1_{\{i=j\}}-\frac\delta n\right)\\&lt;br /&gt;
&amp;amp;=(t_j-\bar t)\delta-\frac\delta n\sum_i(t_i-\bar t)\\&lt;br /&gt;
&amp;amp;=(t_j-\bar t)\delta.&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 &amp;lt;math&amp;gt;\mathbf1_{\{i=j\}}&amp;lt;/math&amp;gt; 在 &amp;lt;math&amp;gt;i=j&amp;lt;/math&amp;gt; 时为1，其余为0；最后一步用了中心化时刻之和为零。因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta a=\frac{t_j-\bar t}{\sum_i(t_i-\bar t)^2}\delta,\qquad&lt;br /&gt;
\Delta b=\frac{\delta}{n}-\bar t\,\Delta a.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例 &amp;lt;math&amp;gt;t_j=3,\bar t=1.5,\delta=1&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;\Delta a=1.5/5=0.3&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\Delta b=1/4-1.5(0.3)=-0.2&amp;lt;/math&amp;gt;。新拟合线为 &amp;lt;math&amp;gt;\hat h=0.7+1.2t&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-least-influence.svg|frame|center|alt=原四个水位点与拟合线零点九加零点九t，最后一点由四升到五后新拟合线为零点七加一点二t；新线截距降低零点二、斜率增加零点三|虚线是原拟合，实线是扰动后的拟合，箭头标出唯一改动的读数。其他观测没有改变，所有拟合值却都可能改变。]]&lt;br /&gt;
&lt;br /&gt;
同一点自己的拟合值增加了&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta\hat h_j=&lt;br /&gt;
\left[\frac1n+\frac{(t_j-\bar t)^2}{\sum_i(t_i-\bar t)^2}\right]\delta.&amp;lt;/math&amp;gt;&lt;br /&gt;
方括号称为该点的&#039;&#039;&#039;杠杆值&#039;&#039;&#039;。四个时刻的杠杆值为 &amp;lt;math&amp;gt;0.7,0.3,0.3,0.7&amp;lt;/math&amp;gt;；最后一个读数增加1，其自己的预测增加0.7。它量度输入设计赋予该点的影响潜力，并不由该点残差大小决定。较大杠杆不自动表示数据错误，是否异常及实际影响还须结合残差与问题背景。[https://online.stat.psu.edu/stat501/Lesson11 Penn State：Influential Points]&lt;br /&gt;
&lt;br /&gt;
这个计算也给出了复核办法：重算扰动数据的正规方程，得到同样的 &amp;lt;math&amp;gt;(b,a)=(0.7,1.2)&amp;lt;/math&amp;gt;；新残差为 &amp;lt;math&amp;gt;(0.3,0.1,-1.1,0.7)&amp;lt;/math&amp;gt;，和与时间加权和仍为零。只有平方和变成1.8，而不是仍然0.7。&lt;br /&gt;
&lt;br /&gt;
== 拟合误差与预测检验 ==&lt;br /&gt;
水位模型的训练平方和为 &amp;lt;math&amp;gt;0.7&amp;lt;/math&amp;gt; 平方厘米，训练均方根误差为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\mathrm{RMSE}_{\mathrm{train}}=\sqrt{0.7/4}\approx0.4183\ \mathrm{cm}.&amp;lt;/math&amp;gt;&lt;br /&gt;
另外保留未参与拟合的两点：时间四、五分钟，水位 &amp;lt;math&amp;gt;4.6,5.8&amp;lt;/math&amp;gt; 厘米。模型预测 &amp;lt;math&amp;gt;4.5,5.4&amp;lt;/math&amp;gt; 厘米，残差为 &amp;lt;math&amp;gt;0.1,0.4&amp;lt;/math&amp;gt;，留出平方和 &amp;lt;math&amp;gt;0.17&amp;lt;/math&amp;gt;，均方根误差约为 &amp;lt;math&amp;gt;0.2915&amp;lt;/math&amp;gt; 厘米。两点只是说明检验流程，不足以判断一般预测性能。&lt;br /&gt;
&lt;br /&gt;
计算最小二乘解不需要假设正态分布。若要从参数进一步推断真实变化率或给出置信区间，则需指定误差模型。固定、满列秩设计与零均值误差支持无偏性；方差、相关性及分布假设决定更进一步的统计结论，见[[统计推断]]。训练均方误差的除数是观测数，估计噪声方差时常用观测数减去独立参数数，两者用途不同。&lt;br /&gt;
&lt;br /&gt;
== 历史与复现 ==&lt;br /&gt;
Legendre 在 1805 年发表最小二乘法。Gauss 在 1809 年的著作中发表相关方法，并主张自己更早已使用；发表时间与更早使用的主张需要区分。相关记载见 [https://mathshistory.st-andrews.ac.uk/Biographies/Legendre/ MacTutor 的 Legendre 传记]。&lt;br /&gt;
&lt;br /&gt;
本条数据、标准库 Python 程序与预期结果可从[[数学建模#下载与复现|数学建模的下载说明]]取得。修改某个训练水位后，既可以重新求系数，也可以检查残差之和与时间加权残差之和是否仍为零，再观察留出误差如何变化。&lt;br /&gt;
&lt;br /&gt;
== 参考来源与延伸阅读 ==&lt;br /&gt;
* [https://web.stanford.edu/~boyd/vmls/ Boyd 与 Vandenberghe：Introduction to Applied Linear Algebra]，最小二乘、QR、模型拟合。&lt;br /&gt;
* [https://fncbook.com/qr/ Driscoll 与 Braun：The QR factorization]、[https://fncbook.com/house/ Computing QR factorizations]：薄 QR 与稳定实现。&lt;br /&gt;
* [https://itl.nist.gov/div898/handbook/pmd/section1/pmd143.htm NIST：Weighted Least Squares Regression]：权重估计与统计条件。&lt;br /&gt;
* [https://mathshistory.st-andrews.ac.uk/Biographies/Legendre/ MacTutor：Legendre]，最小二乘发表与优先权背景。&lt;br /&gt;
* 先修：[[矩阵]]、[[向量空间]]、[[导数]]；相关：[[优化]]、[[统计推断]]、[[数学建模]]。&lt;br /&gt;
[[分类:应用与建模]]&lt;br /&gt;
[[分类:数值分析]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%BE%AE%E5%88%86%E6%96%B9%E7%A8%8B%E4%B8%8E%E5%8A%A8%E5%8A%9B%E7%B3%BB%E7%BB%9F&amp;diff=398</id>
		<title>分类:微分方程与动力系统</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%BE%AE%E5%88%86%E6%96%B9%E7%A8%8B%E4%B8%8E%E5%8A%A8%E5%8A%9B%E7%B3%BB%E7%BB%9F&amp;diff=398"/>
		<updated>2026-09-20T02:06:28Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;从变化规律重建随时间演化的状态。&lt;br /&gt;
&lt;br /&gt;
英文名称：Differential equations and dynamical systems。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
微分方程把未知函数与其变化率联系起来；一阶线性方程提供完整可解的范例，洛吉斯蒂模型展示平衡点、稳定性和增长限制。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[微分方程]] → [[一阶线性微分方程]] → [[洛吉斯蒂模型]]&lt;br /&gt;
&lt;br /&gt;
先写未知函数、初值、单位与适用区间，再求解；求得公式后代回方程，并比较相线或长期行为。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[微分方程]]&lt;br /&gt;
* [[一阶线性微分方程]]&lt;br /&gt;
* [[洛吉斯蒂模型]]&lt;br /&gt;
&lt;br /&gt;
* [[差分方程模型]]&lt;br /&gt;
* [[捕食者-猎物模型]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%9F%BA%E7%A1%80%E4%B8%8E%E9%80%BB%E8%BE%91&amp;diff=397</id>
		<title>分类:基础与逻辑</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%9F%BA%E7%A1%80%E4%B8%8E%E9%80%BB%E8%BE%91&amp;diff=397"/>
		<updated>2026-09-20T02:06:26Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;从集合、映射与推理，学会准确表达数学。&lt;br /&gt;
&lt;br /&gt;
英文名称：Foundations and logic。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
先用集合描述对象，再用函数描述对应关系，最后用命题、量词和证明检查推理。基础语言贯穿所有分支，不意味着每个形式化细节都应先于具体数学学习。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[集合]] → [[函数]] → [[逻辑]]&lt;br /&gt;
&lt;br /&gt;
遇到定义时先找对象范围与量词；读完逻辑条目后，可回到极限检查 ε 与 δ 的依赖关系。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[集合]]&lt;br /&gt;
* [[函数]]&lt;br /&gt;
* [[逻辑]]&lt;br /&gt;
&lt;br /&gt;
* [[皮亚诺公理]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%95%B0%E5%AD%A6%E5%BB%BA%E6%A8%A1&amp;diff=396</id>
		<title>数学建模</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%95%B0%E5%AD%A6%E5%BB%BA%E6%A8%A1&amp;diff=396"/>
		<updated>2026-09-20T02:06:23Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;数学建模&#039;&#039;&#039;（mathematical modeling）是为一个实际问题选择变量、提出假设、建立数学关系，并用观测与计算检验结果的过程。模型保留的是回答当前问题所需要的特征；预测下一分钟的水位，与研究整个水箱的流场，需要的模型可以很不相同。&lt;br /&gt;
&lt;br /&gt;
== 水箱五分钟后有多高 ==&lt;br /&gt;
假设我们每分钟记录一次水箱水位，想用前四次读数预测接下来两分钟。下面是一组专门构造的教学数据，不是实际设备的观测。前四点用于估计参数，后两点预先留作验证。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;水箱线性模型的训练及留出数据&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 数据用途 !! 时间 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt;（分钟） !! 水位 &amp;lt;math&amp;gt;h&amp;lt;/math&amp;gt;（厘米）&lt;br /&gt;
|-&lt;br /&gt;
| 训练 || 0，1，2，3 || 1.0，2.0，2.0，4.0&lt;br /&gt;
|-&lt;br /&gt;
| 留出验证 || 4，5 || 4.6，5.8&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
水位总体上升，却不是每分钟都增加相同数值。可以先尝试一条直线描述平均趋势：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\hat h(t)=at+b.&amp;lt;/math&amp;gt;&lt;br /&gt;
符号 &amp;lt;math&amp;gt;\hat h&amp;lt;/math&amp;gt; 表示预测水位，区别于读数 &amp;lt;math&amp;gt;h&amp;lt;/math&amp;gt;；参数 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 是每分钟平均上升多少厘米，&amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 是模型在零时刻的水位。若用厘米和分钟，&amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 的单位是厘米每分钟，&amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 的单位是厘米。&lt;br /&gt;
&lt;br /&gt;
在计算斜率前，先要回答为什么选直线。如果短时间内净流入量和水箱截面积近似不变，直线有一个守恒关系的依据。&lt;br /&gt;
&lt;br /&gt;
== 直线从哪里来 ==&lt;br /&gt;
设水箱水平截面积为常数 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt;，水位 &amp;lt;math&amp;gt;h&amp;lt;/math&amp;gt; 对应体积 &amp;lt;math&amp;gt;V=Ah&amp;lt;/math&amp;gt;。每分钟流入体积为 &amp;lt;math&amp;gt;q_{\mathrm{in}}&amp;lt;/math&amp;gt;，流出体积为 &amp;lt;math&amp;gt;q_{\mathrm{out}}&amp;lt;/math&amp;gt;。没有其他漏失时，体积变化率等于净流入率：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A\frac{dh}{dt}=q_{\mathrm{in}}-q_{\mathrm{out}}.&amp;lt;/math&amp;gt;&lt;br /&gt;
若右边也是常数，对时间积分得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;h(t)=h(0)+\frac{q_{\mathrm{in}}-q_{\mathrm{out}}}{A}t.&amp;lt;/math&amp;gt;&lt;br /&gt;
与直线模型比较可知，斜率对应净流入率除以截面积，截距对应起始水位。&lt;br /&gt;
&lt;br /&gt;
例如 &amp;lt;math&amp;gt;A=200\ \mathrm{cm^2}&amp;lt;/math&amp;gt;、净流入为 &amp;lt;math&amp;gt;180\ \mathrm{cm^3/min}&amp;lt;/math&amp;gt;，水位上升速率就是 &amp;lt;math&amp;gt;180/200=0.9\ \mathrm{cm/min}&amp;lt;/math&amp;gt;。这一数值说明参数怎样连接到物理量；仅凭水位读数还不能分别知道面积和流量，后面会回到这个问题。&lt;br /&gt;
&lt;br /&gt;
实际读数可能含测量误差，净流量也可能有小波动，因此数据点不必都在同一直线上。接下来需要规定怎样从几条不同的候选直线中选出一条。&lt;br /&gt;
&lt;br /&gt;
== 用四个训练点选出一条直线 ==&lt;br /&gt;
对某条直线，每个训练点的残差定义为“读数减预测”：&amp;lt;math&amp;gt;r_i=h_i-at_i-b&amp;lt;/math&amp;gt;。采用最小二乘，就是选 &amp;lt;math&amp;gt;a,b&amp;lt;/math&amp;gt; 让残差平方和&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(a,b)=\sum_{i=1}^{4}(h_i-at_i-b)^2&amp;lt;/math&amp;gt;&lt;br /&gt;
最小。平方使正负偏差不会互相抵消，也使较大的偏差承担更高代价。&lt;br /&gt;
&lt;br /&gt;
先固定斜率 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt;，对截距求导并令其为零：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{\partial S}{\partial b}=-2\sum_i(h_i-at_i-b)=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
共有四点，因此 &amp;lt;math&amp;gt;4b=\sum_i h_i-a\sum_i t_i&amp;lt;/math&amp;gt;。用横线表示平均数，便得到 &amp;lt;math&amp;gt;b=\bar h-a\bar t&amp;lt;/math&amp;gt;。这说明拟合直线经过平均点 &amp;lt;math&amp;gt;(\bar t,\bar h)&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
把这个截距代回去，残差成为 &amp;lt;math&amp;gt;(h_i-\bar h)-a(t_i-\bar t)&amp;lt;/math&amp;gt;。再对 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 求导，令其为零：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sum_i(t_i-\bar t)(h_i-\bar h)-a\sum_i(t_i-\bar t)^2=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
只要时间点不全相同，第二个求和为正，就可解出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=\frac{\sum_i(t_i-\bar t)(h_i-\bar h)}{\sum_i(t_i-\bar t)^2},\qquad b=\bar h-a\bar t.&amp;lt;/math&amp;gt;&lt;br /&gt;
这是一个系数为正的二次目标，所得驻点也是唯一最小值。&lt;br /&gt;
&lt;br /&gt;
本例平均时间为 &amp;lt;math&amp;gt;1.5&amp;lt;/math&amp;gt;，平均水位为 &amp;lt;math&amp;gt;2.25&amp;lt;/math&amp;gt;。时间偏差为 &amp;lt;math&amp;gt;-1.5,-0.5,0.5,1.5&amp;lt;/math&amp;gt;，水位偏差为 &amp;lt;math&amp;gt;-1.25,-0.25,-0.25,1.75&amp;lt;/math&amp;gt;。分子逐项相乘再相加：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;1.875+0.125-0.125+2.625=4.5.&amp;lt;/math&amp;gt;&lt;br /&gt;
分母为 &amp;lt;math&amp;gt;2.25+0.25+0.25+2.25=5&amp;lt;/math&amp;gt;。所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=4.5/5=0.9,\qquad b=2.25-0.9\times1.5=0.9.&amp;lt;/math&amp;gt;&lt;br /&gt;
得到预测式 &amp;lt;math&amp;gt;\hat h(t)=0.9t+0.9&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-model-linear-fit-theme.svg|frame|center|alt=四个训练点和两个留出验证点，直线水位等于零点九倍时间加零点九，竖线表示训练残差|拟合线没有穿过所有点。训练点用于估计参数，空心方形表示未参与拟合的后续时刻数据。]]&lt;br /&gt;
&lt;br /&gt;
图中实心训练点用来确定直线；从点到直线的竖线就是残差。特别是两分钟处读数为二，而直线预测为 &amp;lt;math&amp;gt;2.7&amp;lt;/math&amp;gt;，对应最长的一段向下偏差。空心方形是没有参与拟合的四、五分钟读数，用来检查预测。&lt;br /&gt;
&lt;br /&gt;
== 拟合算对了吗，预测又怎样 ==&lt;br /&gt;
在训练时刻，预测为 &amp;lt;math&amp;gt;0.9,1.8,2.7,3.6&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;0.1,0.2,-0.7,0.4&amp;lt;/math&amp;gt;。平方和为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;0.01+0.04+0.49+0.16=0.7.&amp;lt;/math&amp;gt;&lt;br /&gt;
均方根误差把平方和除以点数再开方，因此回到厘米单位：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\operatorname{RMSE}_{\mathrm{train}}=\sqrt{0.7/4}\approx0.4183\ \mathrm{cm}.&amp;lt;/math&amp;gt;&lt;br /&gt;
残差还有两项可用于检查计算：和为零，与时间列的乘积和也为零。第二项是 &amp;lt;math&amp;gt;0\times0.1+1\times0.2+2\times(-0.7)+3\times0.4=0&amp;lt;/math&amp;gt;，它们正是前面两个求导方程。&lt;br /&gt;
&lt;br /&gt;
现在才使用留出数据。四分钟与五分钟的预测分别为 &amp;lt;math&amp;gt;4.5,5.4&amp;lt;/math&amp;gt;，读数为 &amp;lt;math&amp;gt;4.6,5.8&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;0.1,0.4&amp;lt;/math&amp;gt;。留出误差为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\operatorname{RMSE}_{\mathrm{test}}=\sqrt{(0.1^2+0.4^2)/2}\approx0.2915\ \mathrm{cm}.&amp;lt;/math&amp;gt;&lt;br /&gt;
它比训练误差小，可以是这两个点的偶然表现，并不矛盾。两个验证点提供了一次具体检验，还不足以说明更长时间内也有同样精度。&lt;br /&gt;
&lt;br /&gt;
这里的两个问题应分开：正规方程和残差核对检验“最小二乘是否算对”；留出数据检验“这条直线能否预测未用于选择它的数据”。前者成立，不自动推出后者。若看了留出数据再调模型，就相当于又把这些数据用于选择，需要新的独立检验。&lt;br /&gt;
&lt;br /&gt;
== 一个读数改动，对预测有什么影响 ==&lt;br /&gt;
只把三分钟处的训练读数从 &amp;lt;math&amp;gt;4.0&amp;lt;/math&amp;gt; 改为 &amp;lt;math&amp;gt;4.1&amp;lt;/math&amp;gt;，其他数据保持。由于时间没变，斜率分母仍为五。分子增量为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(3-1.5)\times0.1=0.15,&amp;lt;/math&amp;gt;&lt;br /&gt;
因为所有时间偏差之和为零，水位平均数的变化不会额外影响分子。因此斜率增加 &amp;lt;math&amp;gt;0.15/5=0.03&amp;lt;/math&amp;gt;，新斜率为 &amp;lt;math&amp;gt;0.93&amp;lt;/math&amp;gt;。水位均值增加 &amp;lt;math&amp;gt;0.1/4=0.025&amp;lt;/math&amp;gt;，新截距为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;2.275-0.93\times1.5=0.88.&amp;lt;/math&amp;gt;&lt;br /&gt;
五分钟处的新预测为 &amp;lt;math&amp;gt;0.93\times5+0.88=5.53&amp;lt;/math&amp;gt;，比原来的 &amp;lt;math&amp;gt;5.4&amp;lt;/math&amp;gt; 增加 &amp;lt;math&amp;gt;0.13&amp;lt;/math&amp;gt;。一个读数只改了 &amp;lt;math&amp;gt;0.1&amp;lt;/math&amp;gt;，外推处的变化却稍大。&lt;br /&gt;
&lt;br /&gt;
一般而言，参数变化给出 &amp;lt;math&amp;gt;\Delta\hat h(t)=t\Delta a+\Delta b&amp;lt;/math&amp;gt;。随着预测时间增加，斜率偏差的影响被放大。若斜率偏高 &amp;lt;math&amp;gt;0.05&amp;lt;/math&amp;gt; 厘米每分钟、截距偏高 &amp;lt;math&amp;gt;0.1&amp;lt;/math&amp;gt; 厘米，十分钟处偏高 &amp;lt;math&amp;gt;0.6&amp;lt;/math&amp;gt; 厘米，五十分钟处偏高 &amp;lt;math&amp;gt;2.6&amp;lt;/math&amp;gt; 厘米。这是确定性的敏感性计算，若要把它解释为概率区间，还需统计误差模型。&lt;br /&gt;
&lt;br /&gt;
== 哪些物理量能够由读数确定 ==&lt;br /&gt;
回到守恒式，水位斜率只给出 &amp;lt;math&amp;gt;(q_{\mathrm{in}}-q_{\mathrm{out}})/A&amp;lt;/math&amp;gt;。面积二百、净流量一百八十给出斜率 &amp;lt;math&amp;gt;0.9&amp;lt;/math&amp;gt;；面积四百、净流量三百六十也给出同样斜率。无论再观察多久，仅凭相同的线性水位变化都分不开这两种解释。&lt;br /&gt;
&lt;br /&gt;
这种不同参数产生同样预测的情形，称为参数不可识别。需要额外测量截面积或流量，才能分别确定它们；或者把可识别的比值直接作为一个参数。&lt;br /&gt;
&lt;br /&gt;
即使只估计直线的斜率与截距，采样方式也重要。若四个读数都在同一时刻，公式分母 &amp;lt;math&amp;gt;\sum(t_i-\bar t)^2&amp;lt;/math&amp;gt; 为零，无法区分斜率与截距。若时刻非常接近，分母很小，同样大小的读数扰动会显著影响斜率。因此实验在哪些时刻采样，决定了数据能够回答什么问题。&lt;br /&gt;
&lt;br /&gt;
== 残差什么时候提示要换模型 ==&lt;br /&gt;
继续收集数据时，如果残差先负、后正、再负，形成系统的弯曲趋势，直线可能遗漏了水位变化的弯曲。如果随着时间推移残差持续增大，可能是流量或截面积不再稳定。如果只有某一点异常，则应先核对记录、单位与传感器状况。&lt;br /&gt;
&lt;br /&gt;
例如出水口流量随水位上升而增加，净流入就不再是常数；瓶状水箱的截面积也可能随高度变化。守恒模型应相应改为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A(h)\frac{dh}{dt}=q_{\mathrm{in}}(t)-q_{\mathrm{out}}(h,t).&amp;lt;/math&amp;gt;&lt;br /&gt;
水箱接近装满时，还需要处理容量与溢流。这样，修改模型的理由来自现象和机制，而非仅为降低已有四点的误差。&lt;br /&gt;
&lt;br /&gt;
残差平方和小，也不能证明某个输入具有因果作用。若要研究“调大入口会使水位怎样变化”，需要控制或记录流量变化、截面积等条件；仅观察两个量同时上升，可能只是共享时间趋势。模型的用途决定需要哪类证据。&lt;br /&gt;
&lt;br /&gt;
== 从这个例子形成一次完整建模过程 ==&lt;br /&gt;
水箱例子的步骤可以整理为一个可重复的循环：先规定预测目标与时间范围，再列变量和单位；用体积守恒提出直线假设；用训练点求参数；核对计算并用后续点检验预测；出现系统偏差时，回到机制或观测设计修改模型。&lt;br /&gt;
&lt;br /&gt;
不同问题会采用不同数学结构。水位随时间的动态变化可用[[微分方程]]，测量误差可用[[概率]]，多个水箱之间的连接可用[[图论]]，在容量与成本限制下分配流量可用[[优化]]。这些结构都围绕所要回答的问题选择，不是每个模型都需要全部使用。&lt;br /&gt;
&lt;br /&gt;
一个可复算的模型记录应保留数据来源、变量单位、假设、训练与验证划分、计算程序和适用范围。最小二乘计算不需要先假定正态噪声，但置信区间等[[统计推断]]需要说明相应条件。量纲检查也很有用：守恒式两边都应是体积每时间，若某项单位不一致，可在求解前发现问题。&lt;br /&gt;
&lt;br /&gt;
== 下载与复现 ==&lt;br /&gt;
[https://gezhi.wiki/page/%E7%89%B9%E6%AE%8A:ModelDownload/eb0be8742d04021d7851aa4bb9e63a54 下载：水位线性拟合教学包（CSV、Python、预期结果与说明）]&lt;br /&gt;
&lt;br /&gt;
教学包保留本例合成数据、仅依赖 Python 标准库的脚本与预期结果。解压后运行 &amp;lt;code&amp;gt;python3 fit.py&amp;lt;/code&amp;gt;，可以复算参数 &amp;lt;math&amp;gt;a=b=0.9&amp;lt;/math&amp;gt;、训练平方和 &amp;lt;math&amp;gt;0.7&amp;lt;/math&amp;gt; 与留出平方和 &amp;lt;math&amp;gt;0.17&amp;lt;/math&amp;gt;。修改三分钟读数后，也可检查上一节的扰动结果。&lt;br /&gt;
&lt;br /&gt;
== 方法背景 ==&lt;br /&gt;
天文测量、力学与人口研究都推动了数学模型的发展。这里使用的最小二乘法，在 Legendre 1805 年的发表及 Gauss 后来的工作中形成了重要发展，具体文献见[[最小二乘法]]。它将“怎样选一条最合适的曲线”变成可计算的目标。&lt;br /&gt;
&lt;br /&gt;
[https://web.stanford.edu/~boyd/vmls/ Boyd 与 Vandenberghe 的应用线性代数教材]从数据与应用问题展开拟合；[https://www.jirka.org/diffyqs/ Lebl 的微分方程教材]从动态过程建立方程。水箱例子同时使用了这两种思路：守恒解释结构，数据估计参数，后续观测检验用途。&lt;br /&gt;
&lt;br /&gt;
== 按问题选择模型 ==&lt;br /&gt;
水位拟合的统计解释见[[线性模型]]：它沿用本例数据，区分真实平均响应、拟合线和下一次随机读数，并计算两种不同的区间。若问题改成“每月先流失一定比例，再补入固定水量”，[[差分方程模型]]从状态更新式推导平衡水量与收敛速度。若两个状态互相影响，[[捕食者-猎物模型]]展示如何从相遇假设建立耦合方程，再用零增长线、相图和守恒量研究变化。&lt;br /&gt;
&lt;br /&gt;
这三类问题分别关心输入与平均响应的关系、离散时刻的状态更新，以及连续时间内两个种群的相互作用。选择模型时，先写清记录了什么、时间怎样计量、哪些机制被保留，再决定使用哪组方程。&lt;br /&gt;
&lt;br /&gt;
== 参考来源与延伸阅读 ==&lt;br /&gt;
* [https://web.stanford.edu/~boyd/vmls/ Boyd 与 Vandenberghe：Introduction to Applied Linear Algebra]，模型拟合、最小二乘与应用。&lt;br /&gt;
* [[最小二乘法]] · [[量纲分析]] · [[统计推断]] · [[洛吉斯蒂模型]]。&lt;br /&gt;
* [https://stanford.edu/~boyd/cvxbook/ Boyd、Vandenberghe，《Convex Optimization》]：最小二乘与优化建模。&lt;br /&gt;
* [https://www.jirka.org/diffyqs/ Jiří Lebl，《Notes on Diffy Qs》]：从应用问题建立微分方程模型。&lt;br /&gt;
* [[线性代数]] · [[优化]] · [[微分方程]] · [[贝叶斯定理]]&lt;br /&gt;
[[分类:应用与建模]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E7%BB%84%E5%90%88%E6%95%B0%E5%AD%A6&amp;diff=395</id>
		<title>组合数学</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E7%BB%84%E5%90%88%E6%95%B0%E5%AD%A6&amp;diff=395"/>
		<updated>2026-09-20T02:06:20Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;组合数学&#039;&#039;&#039;（combinatorics）研究离散对象怎样选择、排列、分配和组织，以及满足条件的结果共有多少种。一次计数既要说明所数的对象，也要说明什么时候把两种描述看成同一个结果。&lt;br /&gt;
&lt;br /&gt;
例如，从 5 人中选主席和秘书，与从 5 人中选两名不分职务的代表，答案就不同。甲任主席、乙任秘书，与乙任主席、甲任秘书是两套任职方案；作为两名代表，却是同一个二人组。&lt;br /&gt;
&lt;br /&gt;
== 从分步选择到排列 ==&lt;br /&gt;
先选主席，有 5 种选择；对每种主席选择，秘书都可从余下 4 人中选。因此共有 &amp;lt;math&amp;gt;5\cdot4=20&amp;lt;/math&amp;gt; 套方案。这里每套方案由前后两步唯一确定，这就是&#039;&#039;&#039;乘法原理&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
同样，从 n 个不同对象中依次选 k 个，不重复使用对象，第一步有 n 种，第二步有 n−1 种，直到第 k 步有 n−k+1 种。带顺序的选取称为&#039;&#039;&#039;排列&#039;&#039;&#039;，数量为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(n,k)=n(n-1)\cdots(n-k+1)=\frac{n!}{(n-k)!}.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 n、k 是整数，&amp;lt;math&amp;gt;0\le k\le n&amp;lt;/math&amp;gt;；&amp;lt;math&amp;gt;n!=n(n-1)\cdots1&amp;lt;/math&amp;gt; 叫阶乘，约定 &amp;lt;math&amp;gt;0!=1&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
乘法原理所要求的是每个阶段有确定的分支数。例如 3 件上衣与 2 条裤子，任意搭配都可用时有 6 套；若有一件上衣只能配其中一条裤子，就应分开计算为 &amp;lt;math&amp;gt;1+2+2=5&amp;lt;/math&amp;gt; 套。这里按上衣分成互不重叠的三类，再相加，是&#039;&#039;&#039;加法原理&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
== 不计顺序时，为什么要除 ==&lt;br /&gt;
仍从 5 人中选 2 人。前面的 20 套任职方案里，每个二人组都出现两次：两人交换职位得到另一种排列。因此不分职务的代表组只有 &amp;lt;math&amp;gt;20/2=10&amp;lt;/math&amp;gt; 个。&lt;br /&gt;
&lt;br /&gt;
一般选出 k 人后，这 k 人可以排成 &amp;lt;math&amp;gt;k!&amp;lt;/math&amp;gt; 种次序。所有有序选取按“选中了哪些人”分成等大的组，每组恰有 k! 个结果。忽略顺序的选取称为&#039;&#039;&#039;组合&#039;&#039;&#039;，数量记为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom nk=\frac{n!}{k!(n-k)!},\qquad0\le k\le n.&amp;lt;/math&amp;gt;&lt;br /&gt;
例如 &amp;lt;math&amp;gt;\binom52=10&amp;lt;/math&amp;gt;。选 0 个对象时只得到空集一种结果，选全部 n 个时也只有一种，故 &amp;lt;math&amp;gt;\binom n0=\binom nn=1&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
取补集还给出一个对应：每种选 k 个的方案，恰好留下 n−k 个未选对象。因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom nk=\binom n{n-k}.&amp;lt;/math&amp;gt;&lt;br /&gt;
这条等式来自同一选择的两种描述。&lt;br /&gt;
&lt;br /&gt;
== 委员会有条件时，怎样避免漏计和重计 ==&lt;br /&gt;
现有 4 名甲组成员、3 名乙组成员，7 人各不相同。要选 3 人，且至少有一名乙组成员。&lt;br /&gt;
&lt;br /&gt;
可以先数全部三人组，再去掉全部来自甲组的情况：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom73-\binom43=35-4=31.&amp;lt;/math&amp;gt;&lt;br /&gt;
也可以按乙组人数分类。恰有 1 名乙组时，选法为 &amp;lt;math&amp;gt;\binom31\binom42=18&amp;lt;/math&amp;gt;；恰有 2 名时为 &amp;lt;math&amp;gt;\binom32\binom41=12&amp;lt;/math&amp;gt;；恰有 3 名时只有 1 种。三类不会重叠，总数为 &amp;lt;math&amp;gt;18+12+1=31&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
为什么不先选一名乙组成员，再从剩下 6 人选 2 人？这会算出 &amp;lt;math&amp;gt;3\binom62=45&amp;lt;/math&amp;gt;。含两名乙组的委员会，其中任何一位都能被当作“先选的人”，所以被算了两次；含三名乙组的被算了三次。重复次数不一样，便不能通过统一除以一个数恢复答案。&lt;br /&gt;
&lt;br /&gt;
若题目还要求指定一位主席，每个合法委员会都恰有 3 种选择，结果为 &amp;lt;math&amp;gt;31\cdot3=93&amp;lt;/math&amp;gt;。若主席必须来自乙组，则前面的三类分别有 1、2、3 种主席选择，总数变为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;18\cdot1+12\cdot2+1\cdot3=45.&amp;lt;/math&amp;gt;&lt;br /&gt;
这次 45 数的是“委员会加乙组主席”，每个结果确实包含一个被特别指定的乙组成员。&lt;br /&gt;
&lt;br /&gt;
== 把选择画成格点路径 ==&lt;br /&gt;
从 &amp;lt;math&amp;gt;(0,0)&amp;lt;/math&amp;gt; 到 &amp;lt;math&amp;gt;(3,2)&amp;lt;/math&amp;gt;，每次只能向右或向上走一个单位。图中金色路线先右、右，再上、右、上，记录成 &amp;lt;math&amp;gt;RRURU&amp;lt;/math&amp;gt;；R 表示右移，U 表示上移。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-combination-paths-theme.svg|frame|center|alt=三列两行网格，金色箭头从原点依次右右上右上，到达三二|每条路径由五个步位组成，选择其中两个作为向上步，便确定整条路线。]]&lt;br /&gt;
&lt;br /&gt;
到达终点总共需要 3 次右移、2 次上移。只要在 5 个位置中选出两个放 U，其余放 R，就唯一确定一条路径；任何允许的路径也都产生这样一组位置。因此路径数为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom52=10.&amp;lt;/math&amp;gt;&lt;br /&gt;
一般从 &amp;lt;math&amp;gt;(0,0)&amp;lt;/math&amp;gt; 到 &amp;lt;math&amp;gt;(m,n)&amp;lt;/math&amp;gt; 的同类路径，需要 m+n 步，其中选 n 步向上，故有 &amp;lt;math&amp;gt;\binom{m+n}{n}&amp;lt;/math&amp;gt; 条。&lt;br /&gt;
&lt;br /&gt;
这个对应还能处理障碍。若本例禁止经过 &amp;lt;math&amp;gt;(1,1)&amp;lt;/math&amp;gt;，先数经过该点的路线：到它需要一右一上，有 &amp;lt;math&amp;gt;\binom21=2&amp;lt;/math&amp;gt; 种；从它到终点需要两右一上，有 &amp;lt;math&amp;gt;\binom31=3&amp;lt;/math&amp;gt; 种。每条经过它的路线唯一分成这两段，故共有 6 条应被排除，留下 &amp;lt;math&amp;gt;10-6=4&amp;lt;/math&amp;gt; 条。&lt;br /&gt;
&lt;br /&gt;
== 组合数之间为什么相加 ==&lt;br /&gt;
从 n 人中选 k 人，固定某一人。每个组合要么不选此人，要么选此人。前一类从剩下 n−1 人选 k 人；后一类已选一人，还需从剩下的人选 k−1 人。因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom nk=\binom{n-1}k+\binom{n-1}{k-1},&lt;br /&gt;
\qquad1\le k\le n-1.&amp;lt;/math&amp;gt;&lt;br /&gt;
加上两端的 1，就得到杨辉三角中“一个数等于上方相邻两数之和”的规则。&lt;br /&gt;
&lt;br /&gt;
组合数也出现在二项式展开中。例如 &amp;lt;math&amp;gt;(x+y)^3&amp;lt;/math&amp;gt; 的每一项，都是从三个因子中各取 x 或 y 后相乘。要得到 &amp;lt;math&amp;gt;x^2y&amp;lt;/math&amp;gt;，需选出一个因子提供 y，有 &amp;lt;math&amp;gt;\binom31=3&amp;lt;/math&amp;gt; 种，因此它的系数为 3。&lt;br /&gt;
&lt;br /&gt;
一般在 n 个因子中选 k 个提供 y，其余提供 x，便有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(x+y)^n=\sum_{k=0}^n\binom nkx^{n-k}y^k.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里的系数记录同一种乘积由多少次选择产生，称为&#039;&#039;&#039;二项式定理&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
== 相同物品分到不同盒子 ==&lt;br /&gt;
把 6 个相同球分到 3 个有标号的盒子，允许空盒。若三个盒子中的球数分别为 &amp;lt;math&amp;gt;x_1,x_2,x_3&amp;lt;/math&amp;gt;，问题就是数出所有非负整数解&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_1+x_2+x_3=6.&amp;lt;/math&amp;gt;&lt;br /&gt;
用 6 个星号表示球、2 条隔板区分盒子。例如“★★｜｜★★★★”表示 &amp;lt;math&amp;gt;(2,0,4)&amp;lt;/math&amp;gt;。隔板可以相邻，也可以位于两端，分别表示中间或端部的盒子为空。&lt;br /&gt;
&lt;br /&gt;
每个分配恰对应一个由 6 个星号和 2 条隔板组成的串，反之亦然。只需从 8 个位置中选出 2 个放隔板，所以有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\binom82=28&amp;lt;/math&amp;gt;&lt;br /&gt;
种分法。这叫&#039;&#039;&#039;隔板法&#039;&#039;&#039;。一般 n 个相同物品分到 &amp;lt;math&amp;gt;k\ge1&amp;lt;/math&amp;gt; 个不同盒子，需要 n 个星号和 k−1 条隔板，结果为 &amp;lt;math&amp;gt;\binom{n+k-1}{k-1}&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
如果球彼此可区分，每个球有 3 个盒子可选，结果是 &amp;lt;math&amp;gt;3^6&amp;lt;/math&amp;gt;，不是 28。若盒子没有标号，&amp;lt;math&amp;gt;(2,0,4)&amp;lt;/math&amp;gt; 的不同排列又可能表示同一种分配；各类分配的重复次数不一致，也不能把 28 直接除以 &amp;lt;math&amp;gt;3!&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
=== 加上下界和上界 ===&lt;br /&gt;
若每盒至少一个，先给每盒放一个，剩下 3 个球自由分配。令 &amp;lt;math&amp;gt;y_i=x_i-1&amp;lt;/math&amp;gt;，就有 &amp;lt;math&amp;gt;y_1+y_2+y_3=3&amp;lt;/math&amp;gt;，各项非负，故分法为 &amp;lt;math&amp;gt;\binom52=10&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
下图上排展示 (2,0,4) 的编码，中间相邻的两条隔板表示第二个盒子为空。下排展示每盒先放一个球的做法：金色球是固定分配，剩余青色球才需要重新计数；(1,2,3) 因而对应剩余量 (0,1,2)。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-teaching-foundation-combinatorics-bars.svg|frame|center|alt=上排六个球与两条相邻隔板表示二零四，下排三个金色预放球与三个剩余球表示一二三减下界后为零一二|隔板位置记录分配；扣除下界把至少一个转为允许空盒。]]&lt;br /&gt;
&lt;br /&gt;
若允许空盒，但每盒至多 3 个，就从原来的 28 种中排除某盒至少 4 个的情况。固定这一个盒子先放 4 个，剩下 2 个任意分，有 &amp;lt;math&amp;gt;\binom42=6&amp;lt;/math&amp;gt; 种。共有 3 个盒子可以超限，而且 6 个球不可能同时使两盒各至少 4 个，所以这些坏情况不重叠。答案为 &amp;lt;math&amp;gt;28-3\cdot6=10&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
若同时要求每盒至少 1 个、至多 3 个，先减去下界后，各 &amp;lt;math&amp;gt;y_i&amp;lt;/math&amp;gt; 在 0 到 2 之间，总和为 3。不设上界时有 10 种；超限只能是某项为 3、其余为 0，共 3 种。因此答案为 &amp;lt;math&amp;gt;10-3=7&amp;lt;/math&amp;gt;。可以直接列出检查：&amp;lt;math&amp;gt;(2,2,2)&amp;lt;/math&amp;gt; 一种，加上 &amp;lt;math&amp;gt;(1,2,3)&amp;lt;/math&amp;gt; 的六种排列。&lt;br /&gt;
&lt;br /&gt;
一般下界不必相同。若第 i 盒至少放 &amp;lt;math&amp;gt;\ell_i&amp;lt;/math&amp;gt; 个，先扣去这些固定份额，再对剩余量使用隔板法；若还有限定上界，也须一并减去同样的份额。&lt;br /&gt;
&lt;br /&gt;
=== 用多项式记下每个盒子的选择 ===&lt;br /&gt;
单盒允许放 1、2、3 个球，可以记成 &amp;lt;math&amp;gt;z+z^2+z^3&amp;lt;/math&amp;gt;。z 的指数记录球数。三个不同盒子逐个选择，对应乘积&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(z+z^2+z^3)^3.&amp;lt;/math&amp;gt;&lt;br /&gt;
相乘时指数相加，因此六次项的系数就是总共放 6 个球的分法数。只有指数 &amp;lt;math&amp;gt;(1,2,3)&amp;lt;/math&amp;gt; 的六种排列与 &amp;lt;math&amp;gt;(2,2,2)&amp;lt;/math&amp;gt; 能凑成 6，所以系数为 7。&lt;br /&gt;
&lt;br /&gt;
这种把“大小”记在指数、“数量”记在系数中的方法叫&#039;&#039;&#039;生成函数&#039;&#039;&#039;。这里它只是一个有限多项式，乘法的每一次取项都对应一个实际分配，不涉及无穷级数的收敛问题。&lt;br /&gt;
&lt;br /&gt;
== 有重叠的类别怎样相加：容斥 ==&lt;br /&gt;
在 1 到 30 中，2 的倍数有 15 个，3 的倍数有 10 个。若直接相加，6 的倍数会被数两次；这样的数有 5 个。因此能被 2 或 3 整除的数共有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;15+10-5=20.&amp;lt;/math&amp;gt;&lt;br /&gt;
用集合记为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;|A\cup B|=|A|+|B|-|A\cap B|.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
三个集合时，先加各自大小，再减三组两两交集。属于三重交集的对象先被数三次，又被减三次，变成零次，因此要补回来：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
|A\cup B\cup C|={}&amp;amp;|A|+|B|+|C|\\&lt;br /&gt;
&amp;amp;-|A\cap B|-|A\cap C|-|B\cap C|\\&lt;br /&gt;
&amp;amp;+|A\cap B\cap C|.&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
逐个检查属于一个、两个、三个集合的元素，都恰好保留一次。这就是&#039;&#039;&#039;容斥原理&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
例如将三个不同字母重新放进三个有标号的位置，要求没有字母留在原位。全部排列有 6 个。令 A、B、C 分别表示各字母仍在原位的坏情况，每类有 2 个排列；固定任意两个字母会使第三个也固定，因此各两两交集及三重交集都只含原排列一个。坏排列共有 &amp;lt;math&amp;gt;6-3+1=4&amp;lt;/math&amp;gt; 个，合法排列便为 &amp;lt;math&amp;gt;6-4=2&amp;lt;/math&amp;gt; 个，恰是两种循环移位。&lt;br /&gt;
&lt;br /&gt;
== 把大问题拆成较小问题 ==&lt;br /&gt;
用长度为 1 或 2 的小砖铺满一行长度为 n 的木板，砖沿木板方向放置，不留空隙。记铺法数为 &amp;lt;math&amp;gt;a_n&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
观察最后一块砖：若长 1，前面剩下长度 n−1 的木板，有 &amp;lt;math&amp;gt;a_{n-1}&amp;lt;/math&amp;gt; 种铺法；若长 2，前面剩下 n−2，有 &amp;lt;math&amp;gt;a_{n-2}&amp;lt;/math&amp;gt; 种。两类互不重叠又覆盖全部铺法，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a_n=a_{n-1}+a_{n-2}\qquad(n\ge2).&amp;lt;/math&amp;gt;&lt;br /&gt;
空木板有“不放砖”一种铺法，故 &amp;lt;math&amp;gt;a_0=1&amp;lt;/math&amp;gt;；长度 1 只有一块短砖，故 &amp;lt;math&amp;gt;a_1=1&amp;lt;/math&amp;gt;。依次得到 &amp;lt;math&amp;gt;a_2=2&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;a_3=3&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;a_4=5&amp;lt;/math&amp;gt;。初值和递推式合在一起，才确定整列答案。&lt;br /&gt;
&lt;br /&gt;
限制位置也可以转成已经解决的分配问题。八位二进制串恰含三个 1，有 &amp;lt;math&amp;gt;\binom83=56&amp;lt;/math&amp;gt; 个。若 1 不能相邻，先在相邻两个 1 之间各放一个必需的 0；五个 0 已用掉两个，剩下三个可分到两端与两个内部间隙，共四个有标号的空隙。隔板法给出 &amp;lt;math&amp;gt;\binom63=20&amp;lt;/math&amp;gt; 种。把这些零重新放回各空隙，就唯一恢复原串。&lt;br /&gt;
&lt;br /&gt;
== 只问必然存在，不必逐一数出 ==&lt;br /&gt;
13 人分到 12 个出生月份，若每个月至多一人，总人数最多为 12，与 13 矛盾。因此至少有两人的出生月份相同。这个结论与月份是否等可能无关，称为&#039;&#039;&#039;抽屉原理&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
一般把 N 个对象放入正整数 k 个盒子，至少一盒的数量不小于 &amp;lt;math&amp;gt;\lceil N/k\rceil&amp;lt;/math&amp;gt;，其中符号表示向上取整。若每盒数量都少于这个整数，总和便小于 N。&lt;br /&gt;
&lt;br /&gt;
计数用于[[概率]]时则要多一个条件：只有基本结果等可能，才能直接用“有利结果数除以全部结果数”。例如选委员会时，若所有三人组等可能，上面至少含一名乙组的概率才是 &amp;lt;math&amp;gt;31/35&amp;lt;/math&amp;gt;。指定某人必选，会改变选择机制和样本空间。&lt;br /&gt;
&lt;br /&gt;
== 历史 ==&lt;br /&gt;
二项式系数表在不同数学传统中出现过。杨辉 1261 年《详解九章算法》记述了相关数表，并引用贾宪的方法；贾宪的相关原著已经散佚，部分内容由杨辉的记述保存。[https://mathshistory.st-andrews.ac.uk/Biographies/Yang_Hui/ MacTutor：杨辉]介绍了这些文献关系。&lt;br /&gt;
&lt;br /&gt;
今天常用“杨辉三角”或“Pascal 三角”称呼这一数表。它把多项式展开、组合选择和格点路径联系到一起：同样的数字可以来自不同问题，而一一对应或分类计数解释了它们为何相同。&lt;br /&gt;
&lt;br /&gt;
== 从“数出多少”到“必有一个” ==&lt;br /&gt;
[[抽屉原理]]用总数证明某一类必有重复。它不要求列出全部对象：例如 n 个整数的 n+1 个前缀和只有 n 种余数，因此存在非空连续一段，其和能被 n 整除。该条目逐步说明如何把“连续段”转成两个前缀的差，以及如何选择分类规则。&lt;br /&gt;
&lt;br /&gt;
== 参考资料 ==&lt;br /&gt;
* [https://discrete.openmathbooks.org/dmoi3/sec_counting-binom.html Oscar Levin：二项式系数]。&lt;br /&gt;
* [https://discrete.openmathbooks.org/dmoi3.html Oscar Levin，Discrete Mathematics: An Open Introduction]：计数、递推关系及生成函数。&lt;br /&gt;
* [https://mathshistory.st-andrews.ac.uk/Biographies/Yang_Hui/ MacTutor：杨辉]。&lt;br /&gt;
* 相关条目：[[集合]]、[[概率]]、[[图论]]、[[逻辑]]。&lt;br /&gt;
[[分类:离散数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E8%B4%9D%E5%8F%B6%E6%96%AF%E5%AE%9A%E7%90%86&amp;diff=394</id>
		<title>贝叶斯定理</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E8%B4%9D%E5%8F%B6%E6%96%AF%E5%AE%9A%E7%90%86&amp;diff=394"/>
		<updated>2026-09-20T02:06:16Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;贝叶斯定理&#039;&#039;&#039;（Bayes&#039; theorem）把一种条件概率换成反向的条件概率：已知某类对象产生某种结果的机会，怎样计算看到这个结果后，对象属于该类的机会？它的核心是把产生同一结果的各个来源一起计算，再在这些结果中重新取比例。&lt;br /&gt;
&lt;br /&gt;
== 被标记的产品中，有多少真的不合格 ==&lt;br /&gt;
采用一组教学数据：产品有5%不合格，检测会标记90%的不合格品，也会误标10%的合格品。现随机取一件，发现它被标记。它不合格的概率是多少？&lt;br /&gt;
&lt;br /&gt;
先把比例换算为1000件来观察：其中50件不合格、950件合格。前一组有 &amp;lt;math&amp;gt;50\times0.9=45&amp;lt;/math&amp;gt; 件被标记，后一组有 &amp;lt;math&amp;gt;950\times0.1=95&amp;lt;/math&amp;gt; 件被标记。图中两条通向“被标记”的路径，要合在一起看。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-bayes-tree-theme.svg|frame|center|alt=一千件示例产品分为五十件不合格和九百五十件合格，分别有四十五件和九十五件被标记|140件被标记产品中，45件来自不合格品；这些整数用于换算给定比例，并非实际抽样记录。]]&lt;br /&gt;
&lt;br /&gt;
总共140件被标记，其中45件不合格，所以所求比例为 &amp;lt;math&amp;gt;45/140=9/28\approx32.14\%&amp;lt;/math&amp;gt;。检出率90%使用“不合格品”作分母；这个32.14%使用“被标记产品”作分母。两个比例回答不同的问题。合格品数量远多于不合格品，即使其中只有10%被误标，也会贡献较多标记。&lt;br /&gt;
&lt;br /&gt;
== 从同一个交集推导公式 ==&lt;br /&gt;
用 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 表示“不合格”，&amp;lt;math&amp;gt;E&amp;lt;/math&amp;gt; 表示“被标记”。交集 &amp;lt;math&amp;gt;H\cap E&amp;lt;/math&amp;gt; 就是同时不合格且被标记的产品。由[[概率|条件概率]]定义，可以从两个方向算它：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(H\cap E)=P(E\mid H)P(H)=P(H\mid E)P(E).&amp;lt;/math&amp;gt;&lt;br /&gt;
只要 &amp;lt;math&amp;gt;P(H)&amp;gt;0&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;P(E)&amp;gt;0&amp;lt;/math&amp;gt;，等式两端除以 &amp;lt;math&amp;gt;P(E)&amp;lt;/math&amp;gt; 就得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(H\mid E)=\frac{P(E\mid H)P(H)}{P(E)}.&amp;lt;/math&amp;gt;&lt;br /&gt;
这便是贝叶斯定理。&amp;lt;math&amp;gt;P(H)&amp;lt;/math&amp;gt; 是看检测结果之前的&#039;&#039;&#039;先验概率&#039;&#039;&#039;；&amp;lt;math&amp;gt;P(H\mid E)&amp;lt;/math&amp;gt; 是观察结果后的&#039;&#039;&#039;后验概率&#039;&#039;&#039;。固定已经观察到的结果，比较不同假设给出的 &amp;lt;math&amp;gt;P(E\mid H)&amp;lt;/math&amp;gt;，是在比较它们的&#039;&#039;&#039;似然&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
用 &amp;lt;math&amp;gt;H^c&amp;lt;/math&amp;gt; 表示合格。被标记产品来自不合格与合格两条互斥路径，全概率公式给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(E)=P(E\mid H)P(H)+P(E\mid H^c)P(H^c).&amp;lt;/math&amp;gt;&lt;br /&gt;
把检测数值代入，得到 &amp;lt;math&amp;gt;P(E)=0.9\times0.05+0.1\times0.95=0.14&amp;lt;/math&amp;gt;，再以 &amp;lt;math&amp;gt;0.045/0.14&amp;lt;/math&amp;gt; 算后验，与图中的45/140完全一致。该推导未假设假设与证据独立；若二者本来独立，观察证据反而不会改变先验。&lt;br /&gt;
&lt;br /&gt;
== 总体变了，同一种检测的结果也会变 ==&lt;br /&gt;
若其他条件不变，而不合格率降到0.5%，则&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(H\mid E)=\frac{0.9\times0.005}{0.9\times0.005+0.1\times0.995}=\frac{45}{1040}\approx4.33\%.&amp;lt;/math&amp;gt;&lt;br /&gt;
按10000件换算，此时真标记45件、误标记995件；原先5%的总体则真标记450件、误标记950件。检测性能没变，发生不合格的基础比例变了，因此标记的组成也变了。&lt;br /&gt;
&lt;br /&gt;
下图两条横条采用相同的数量比例尺，均从10000件产品换算。绿色部分是真标记，粉色部分是误标记。先验降为十分之一时，真标记也降为十分之一，而误标记仍然很多，所以绿色部分占整条标记结果的比例显著下降。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-analysis-bayes-base-rate.svg|frame|center|alt=相同检测性能下不合格率百分之五时有四百五十真标记和九百五十误标记，不合格率千分之五时有四十五真标记和九百九十五误标记|后验比例分别为32.14%和4.33%；分母是每条横条的全部标记数。]]&lt;br /&gt;
&lt;br /&gt;
若不合格率为50%，同一公式给出 &amp;lt;math&amp;gt;0.45/(0.45+0.05)=90\%&amp;lt;/math&amp;gt;。先验可来自明确的抽样分布或已有统计记录，关键是它是否对应当前所检测的总体。&lt;br /&gt;
&lt;br /&gt;
== 用赔率观察证据强度 ==&lt;br /&gt;
赔率是事件与其补事件的概率之比。例如概率1/4对应赔率1:3，而不是1:4。分别对H与 &amp;lt;math&amp;gt;H^c&amp;lt;/math&amp;gt; 写贝叶斯公式，再相除，共同的分母 &amp;lt;math&amp;gt;P(E)&amp;lt;/math&amp;gt; 消掉，得到（以下分母均须为正）&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{P(H\mid E)}{P(H^c\mid E)}=\frac{P(H)}{P(H^c)}\cdot\frac{P(E\mid H)}{P(E\mid H^c)}.&amp;lt;/math&amp;gt;&lt;br /&gt;
右侧第一项是先验赔率，第二项是似然比。上例先验赔率为 &amp;lt;math&amp;gt;1:19&amp;lt;/math&amp;gt;，似然比为 9，所以后验赔率为 &amp;lt;math&amp;gt;9:19&amp;lt;/math&amp;gt;，换回概率即 &amp;lt;math&amp;gt;9/28&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
== 连续两次标记会怎样改变后验 ==&lt;br /&gt;
回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立，则连续两次标记的联合似然分别为 &amp;lt;math&amp;gt;0.9^2&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;0.1^2&amp;lt;/math&amp;gt;。后验为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{0.05\times0.9^2}{0.05\times0.9^2+0.95\times0.1^2}=\frac{81}{100}=81\%.&amp;lt;/math&amp;gt;&lt;br /&gt;
也可先更新赔率 &amp;lt;math&amp;gt;1:19&amp;lt;/math&amp;gt;，每次乘似然比 9，得到 &amp;lt;math&amp;gt;81:19&amp;lt;/math&amp;gt;，再转换为概率。两条计算路线一致，是一个有用的检查。&lt;br /&gt;
&lt;br /&gt;
但如果第二次只是复制第一次检测的日志，两份记录完全相同，没有新增证据，后验仍为 &amp;lt;math&amp;gt;9/28&amp;lt;/math&amp;gt;。现实中的两个检测器还可能共享同一种误差来源，介于独立与复制之间。正确做法是建模 &amp;lt;math&amp;gt;P(E_1,E_2\mid H)&amp;lt;/math&amp;gt;，而非因为出现两行数据就自动把似然相乘。给定假设的条件独立，也不同于两次检测在总体上无条件独立。&lt;br /&gt;
&lt;br /&gt;
== 从两个来源推广到多个来源 ==&lt;br /&gt;
若 &amp;lt;math&amp;gt;H_1,\ldots,H_k&amp;lt;/math&amp;gt; 是互斥且完备的假设，分母要对它们求和：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(H_i\mid E)=\frac{P(E\mid H_i)P(H_i)}{\sum_{j=1}^k P(E\mid H_j)P(H_j)}.&amp;lt;/math&amp;gt;&lt;br /&gt;
分子是一条来源路径的联合概率，分母把所有来源路径加起来，正是检测树中两条路径求和的推广。&lt;br /&gt;
&lt;br /&gt;
=== 从哪条生产线来 ===&lt;br /&gt;
假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%，不合格率分别为 1%、2%、4%。从混合产量中随机取一件，发现它不合格。求来自丙线的概率，不能只比较不合格率，也不能只比较产量。&lt;br /&gt;
&lt;br /&gt;
用 &amp;lt;math&amp;gt;A,B,C&amp;lt;/math&amp;gt; 分别表示来自甲、乙、丙线的事件，&amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt; 表示不合格。三个联合概率为 &amp;lt;math&amp;gt;P(A\cap D)=0.5\times0.01=0.005&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;P(B\cap D)=0.006&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;P(C\cap D)=0.008&amp;lt;/math&amp;gt;。因此 &amp;lt;math&amp;gt;P(D)=0.019&amp;lt;/math&amp;gt;，三个后验分别为 &amp;lt;math&amp;gt;5/19,6/19,8/19&amp;lt;/math&amp;gt;。它们相加等于 1；丙线的答案是 &amp;lt;math&amp;gt;8/19\approx42.11\%&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少，却有最大的后验份额；三条线的后验仍都为正，单件来源尚未确定。&lt;br /&gt;
&lt;br /&gt;
== 连续参数：从事件概率到后验密度 ==&lt;br /&gt;
假设未知参数 &amp;lt;math&amp;gt;\theta\in[0,1]&amp;lt;/math&amp;gt; 表示一个固定过程的成功概率。给定 θ 后，各次试验独立且具有相同成功率。为了构造一个可算的教学模型，先验取区间上的均匀密度 1；它给相同长度的区间相同的先验概率。&lt;br /&gt;
&lt;br /&gt;
现在观察三次试验，成功两次、失败一次。若记录成功总数，似然为 &amp;lt;math&amp;gt;3\theta^2(1-\theta)&amp;lt;/math&amp;gt;；若记录一条指定顺序，似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。把先验乘以似然，得到与 &amp;lt;math&amp;gt;\theta^2(1-\theta)&amp;lt;/math&amp;gt; 成比例的密度。为让总积分为1，先算&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\int_0^1\theta^2(1-\theta)\,d\theta=\left[\frac{\theta^3}3-\frac{\theta^4}4\right]_0^1=\frac1{12}.&amp;lt;/math&amp;gt;&lt;br /&gt;
因此需要乘12，后验密度为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;p(\theta\mid D)=12\theta^2(1-\theta),\qquad0\le\theta\le1.&amp;lt;/math&amp;gt;&lt;br /&gt;
这类密度按 &amp;lt;math&amp;gt;\theta^{\alpha-1}(1-\theta)^{\beta-1}&amp;lt;/math&amp;gt; 的形状命名为Beta分布，故这里称Beta(3,2)，区间外密度为零。将后验密度对整个区间积分，可检查归一化；不能把某一点处的密度当成该点有正概率。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-bayes-posterior.svg|frame|center|alt=成功率零到一区间上，均匀先验密度为一，观察两次成功一次失败后后验为十二theta平方乘一减theta，阴影标出theta大于二分之一的后验概率十六分之十一|曲线高度是密度，阴影面积才是概率。均匀先验与后验的总面积都为一，后验向较高成功率的一侧重新分配了概率。]]&lt;br /&gt;
&lt;br /&gt;
例如现在可以问“成功率超过一半的后验概率是多少”。积分给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(\theta&amp;gt;1/2\mid D)&lt;br /&gt;
=\left[4\theta^3-3\theta^4\right]_{1/2}^{1}&lt;br /&gt;
=1-\frac5{16}=\frac{11}{16}=0.6875.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里不需要把整个后验压成一个参数估计。后验认为较高成功率更有可能，同时仍为另一半区间留下 &amp;lt;math&amp;gt;5/16&amp;lt;/math&amp;gt; 的概率。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
下一次成功的预测概率需要把未知 θ 平均掉：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P(X_{\mathrm{new}}=1\mid D)=\int_0^1\theta p(\theta\mid D)\,d\theta=12\left(\frac14-\frac15\right)=\frac35.&amp;lt;/math&amp;gt;&lt;br /&gt;
结果 0.6 与样本成功率 &amp;lt;math&amp;gt;2/3&amp;lt;/math&amp;gt; 不同，因为该预测同时使用了均匀先验和有限样本。连续先验与更新的教材依据见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class13-prep-a_pdf/ MIT 18.05 第 13a 讲]。&lt;br /&gt;
&lt;br /&gt;
== 改变先验后，哪些计算需要重新进行 ==&lt;br /&gt;
前面的三次试验采用均匀先验。若改为密度 &amp;lt;math&amp;gt;p(\theta)=6\theta(1-\theta)&amp;lt;/math&amp;gt;，它在中间较高、两端较低，是另一项明确的教学假设。乘以相同的两次成功一次失败的似然，得到未归一化后验 &amp;lt;math&amp;gt;\theta^3(1-\theta)^2&amp;lt;/math&amp;gt;。展开积分为 &amp;lt;math&amp;gt;\int_0^1(\theta^3-2\theta^4+\theta^5)\,d\theta=1/4-2/5+1/6=1/60&amp;lt;/math&amp;gt;，因此后验变为 &amp;lt;math&amp;gt;60\theta^3(1-\theta)^2&amp;lt;/math&amp;gt;，即 Beta(4,3) 分布。&lt;br /&gt;
&lt;br /&gt;
再乘一个 &amp;lt;math&amp;gt;\theta&amp;lt;/math&amp;gt; 求平均，预测成功率为 &amp;lt;math&amp;gt;60(1/5-2/6+1/7)=4/7\approx0.5714&amp;lt;/math&amp;gt;。它比均匀先验下的0.6略低，反映新的先验更偏重中间概率。&lt;br /&gt;
&lt;br /&gt;
在这类二项似然与Beta先验的模型中，先验参数为正数 &amp;lt;math&amp;gt;\alpha,\beta&amp;lt;/math&amp;gt;，观察 s 次成功、f 次失败后，后验参数为 &amp;lt;math&amp;gt;\alpha+s,\beta+f&amp;lt;/math&amp;gt;。这称为共轭结构，来源是乘法把幂次相加。这里的参数加法直接来自似然与先验相乘时幂次相加。&lt;br /&gt;
&lt;br /&gt;
== 条件独立如何产生相关的预测 ==&lt;br /&gt;
给定一个固定的成功率 θ 后，两次未来试验可以独立；但在 θ 尚有后验不确定性时，把它积分掉之后，两次结果通常不再独立。这不是前后矛盾，因为条件化所使用的信息已经不同。&lt;br /&gt;
&lt;br /&gt;
使用先前 Beta(3,2) 后验，每次未来成功的边缘预测概率都是 &amp;lt;math&amp;gt;3/5&amp;lt;/math&amp;gt;，而两次都成功的预测概率为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\int_0^1\theta^2\,12\theta^2(1-\theta)\,d\theta=12\left(\frac15-\frac16\right)=\frac25.&amp;lt;/math&amp;gt;&lt;br /&gt;
它不等于 &amp;lt;math&amp;gt;(3/5)^2=9/25&amp;lt;/math&amp;gt;。直观上，若未知成功率实际偏高，两次成功都更有可能；若偏低，两次都更少，未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。&lt;br /&gt;
&lt;br /&gt;
若先观察到第一次未来试验成功，密度再乘 &amp;lt;math&amp;gt;\theta&amp;lt;/math&amp;gt;，并除以预测成功率 &amp;lt;math&amp;gt;3/5&amp;lt;/math&amp;gt;，得到 &amp;lt;math&amp;gt;20\theta^3(1-\theta)&amp;lt;/math&amp;gt;，即Beta(4,2)。第二次成功概率为 &amp;lt;math&amp;gt;20(1/5-1/6)=2/3&amp;lt;/math&amp;gt;。于是顺序计算的联合概率为 &amp;lt;math&amp;gt;(3/5)(2/3)=2/5&amp;lt;/math&amp;gt;，与一次积分一致。分批更新与一次使用全部证据能一致，依赖于同一个完整概率模型，而不是任意重复套用相同似然。&lt;br /&gt;
&lt;br /&gt;
== 后验区间、点估计与预测回答不同问题 ==&lt;br /&gt;
连续参数的后验密度可以用于计算区间概率。若某区间内后验密度的积分为0.95，便可称该区间在给定数据和模型下具有95%的后验概率。这个概率说的是参数落在区间内的后验不确定性，不是说密度曲线上的每个点都有正概率，也不自动等同于频率学派置信区间的长期覆盖解释。&lt;br /&gt;
&lt;br /&gt;
点估计进一步把整个后验压缩成一个数，选择准则需要说明。后验均值在平方损失下最优，后验中位数对应绝对损失，最大后验密度点则是另一种汇总方式。对于同一个不对称后验，这些数可以不同；它们不是计算误差，而是不同问题的答案。若目标是未来观测，还应进行后验预测，把观测自身的随机性与参数不确定性一起考虑。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 为什么平方损失选后验均值 ===&lt;br /&gt;
仍用 &amp;lt;math&amp;gt;p(\theta\mid D)=12\theta^2(1-\theta)&amp;lt;/math&amp;gt;，选择一个数 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 代表未知成功率。若误差按平方计算，给定数据后的期望损失为 &amp;lt;math&amp;gt;L(c)=E[(\theta-c)^2\mid D]&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
前面已算得 &amp;lt;math&amp;gt;E[\theta\mid D]=3/5&amp;lt;/math&amp;gt;，二阶矩为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;E[\theta^2\mid D]&lt;br /&gt;
=12\int_0^1(\theta^4-\theta^5)\,d\theta=\frac25.&amp;lt;/math&amp;gt;&lt;br /&gt;
所以后验方差为 &amp;lt;math&amp;gt;2/5-(3/5)^2=1/25&amp;lt;/math&amp;gt;。把 &amp;lt;math&amp;gt;\theta-c=(\theta-3/5)+(3/5-c)&amp;lt;/math&amp;gt; 展开，中间交叉项的期望为零，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;L(c)=\frac1{25}+\left(c-\frac35\right)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
第二项非负，且只在 &amp;lt;math&amp;gt;c=3/5&amp;lt;/math&amp;gt; 时为零，这就证明了后验均值的最优性。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-bayes-loss.svg|frame|center|alt=期望平方损失是以c等于零点六为最低点的抛物线，最低值零点零四；密度最高点三分之二位于另一位置，其损失稍高|横轴是要选的点估计c，纵轴是按同一后验平均后的平方损失。最优点取决于损失定义，不能只看密度峰值。]]&lt;br /&gt;
&lt;br /&gt;
后验密度的导数为 &amp;lt;math&amp;gt;12\theta(2-3\theta)&amp;lt;/math&amp;gt;，在 &amp;lt;math&amp;gt;2/3&amp;lt;/math&amp;gt; 左侧为正、右侧为负，所以密度在此取得内部最大值；两个端点密度为零。因此最大后验密度估计是 &amp;lt;math&amp;gt;2/3&amp;lt;/math&amp;gt;，与后验均值 &amp;lt;math&amp;gt;3/5&amp;lt;/math&amp;gt; 不同。若用前者作平方损失下的估计，损失为 &amp;lt;math&amp;gt;1/25+(2/3-3/5)^2=2/45&amp;lt;/math&amp;gt;，略大于 &amp;lt;math&amp;gt;1/25&amp;lt;/math&amp;gt;。这不是两个答案谁算错，而是“选密度峰”与“最小化平均平方误差”本来采用不同准则。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 概率更新之后，行动还需要损失 ==&lt;br /&gt;
在一个纯教学的二分类决策中，设把合格品误判为不合格的损失记为4个单位，把不合格品漏判的损失记为12个单位，正确判断的损失为零。若后验不合格概率为 p，选择“不合格”的期望损失为 &amp;lt;math&amp;gt;4(1-p)&amp;lt;/math&amp;gt;，选择“合格”的期望损失为 &amp;lt;math&amp;gt;12p&amp;lt;/math&amp;gt;。前者较小当且仅当 &amp;lt;math&amp;gt;p&amp;gt;1/4&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
这个阈值来自所列损失，而不是贝叶斯定理固有的某个神奇比例。若成本改变，最佳行动也可能改变，即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束；本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。&lt;br /&gt;
&lt;br /&gt;
== 更新公式的定义范围 ==&lt;br /&gt;
如果某个假设的先验为零，而观测证据有正概率，公式分子仍为零，后验也为零。若各假设对证据都给出零概率，则 &amp;lt;math&amp;gt;P(E)=0&amp;lt;/math&amp;gt;，本条的事件条件概率公式无法使用；需要重新检查模型或采用更一般的条件化方法。&lt;br /&gt;
&lt;br /&gt;
== Bayes、Price 与逆概率的发展 ==&lt;br /&gt;
Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后，Richard Price 整理、补充并提交论文，相关工作在 1760 年代发表于皇家学会文献；通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 [https://mathshistory.st-andrews.ac.uk/Biographies/Bayes/ MacTutor 的 Bayes 传记]。&lt;br /&gt;
&lt;br /&gt;
后来 Laplace 将逆概率思想用于更广泛的推断问题。Laplace的相关工作可参见 [https://mathshistory.st-andrews.ac.uk/DSB/Laplace.pdf Charles C. Gillispie 的 Laplace 学术传记]。&lt;br /&gt;
&lt;br /&gt;
== 参考来源与延伸阅读 ==&lt;br /&gt;
* [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class03-prep_pdf/ MIT 18.05 第 3 讲]：条件概率与贝叶斯公式。&lt;br /&gt;
* [[统计推断]] · [[最小二乘法]]：不同推断与拟合方法的比较。&lt;br /&gt;
* [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/pages/classes-reading-and-in-class-materials/ MIT OpenCourseWare，18.05，第 3 课及贝叶斯推断材料]。&lt;br /&gt;
* [[概率]] · [[期望]] · [[数学建模]]&lt;br /&gt;
[[分类:概率与统计]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%8B%BE%E8%82%A1%E5%AE%9A%E7%90%86&amp;diff=393</id>
		<title>勾股定理</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%8B%BE%E8%82%A1%E5%AE%9A%E7%90%86&amp;diff=393"/>
		<updated>2026-09-20T02:06:13Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;\&#039;\&#039;\&#039;勾股定理\&#039;\&#039;\&#039;（Pythagorean theorem）描述欧氏直角三角形三条边的关系：两条直角边的平方和等于斜边的平方。它可以用来求两点间的直线距离，也可以反过来判断一个三角形是否有直角。&lt;br /&gt;
&lt;br /&gt;
== 从三步向东、四步向北开始 ==&lt;br /&gt;
从起点向东走三米，再向北走四米，走过的路程是七米。如果拉一根绳子，把起点与终点直接连起来，绳子需要多长？这两段位移互相垂直，连同绳子构成一个直角三角形。勾股定理给出的答案是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;c^2=3^2+4^2=9+16=25,\qquad c=5\ \mathrm m.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 表示绳长。取正平方根，是因为长度为正。七米量的是折线路程，五米量的是起终点间的直线距离。&lt;br /&gt;
&lt;br /&gt;
把三米、四米换成任意正长度 &amp;lt;math&amp;gt;a,b&amp;lt;/math&amp;gt;，所求的斜边记为 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt;，结论就是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2+b^2=c^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
斜边总是直角所对的那条边。把整幅图转一个方向，这条边仍是斜边。三条边要采用同一单位，平方后的单位也相同；在三、四、五的例子中，等式比较的是九、十六、二十五平方米。&lt;br /&gt;
&lt;br /&gt;
== 为什么要平方：把四个三角形拼起来 ==&lt;br /&gt;
长度的平方可以看成正方形的面积。为证明这个关系，把同一个直角三角形复制四份，放进一个边长为 &amp;lt;math&amp;gt;a+b&amp;lt;/math&amp;gt; 的大正方形中。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-pythagoras-dissection-theme.svg|frame|center|alt=四个全等直角三角形放在边长a加b的大正方形四角，中间留下四边长度均为c的正方形|四个三角形总面积为 2ab；中央正方形面积为 c²。图形中的边长与正文保持一致。]]&lt;br /&gt;
&lt;br /&gt;
先沿图中大正方形的一条边看：它分成长度为 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 的两段。再看中央空白区域，它的四条边各是一份三角形的斜边，长度都为 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt;。要把中央面积写成 &amp;lt;math&amp;gt;c^2&amp;lt;/math&amp;gt;，还需知道它的角也是直角。&lt;br /&gt;
&lt;br /&gt;
把原三角形的两个锐角记为 &amp;lt;math&amp;gt;\alpha,\beta&amp;lt;/math&amp;gt;。三角形内角和为 &amp;lt;math&amp;gt;180^\circ&amp;lt;/math&amp;gt;，扣去直角后，&amp;lt;math&amp;gt;\alpha+\beta=90^\circ&amp;lt;/math&amp;gt;。图中中央的每一个角，与旁边的 &amp;lt;math&amp;gt;\alpha,\beta&amp;lt;/math&amp;gt; 合成平角，所以中央角等于&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;180^\circ-(\alpha+\beta)=90^\circ.&amp;lt;/math&amp;gt;&lt;br /&gt;
这样，中央确实是边长为 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 的正方形。&lt;br /&gt;
&lt;br /&gt;
现在把同一块面积算两次。整个大正方形面积是 &amp;lt;math&amp;gt;(a+b)^2&amp;lt;/math&amp;gt;；四个三角形的总面积是 &amp;lt;math&amp;gt;4\times ab/2=2ab&amp;lt;/math&amp;gt;，余下的中央面积是 &amp;lt;math&amp;gt;c^2&amp;lt;/math&amp;gt;。因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(a+b)^2=2ab+c^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
展开左边，再从两边各减去 &amp;lt;math&amp;gt;2ab&amp;lt;/math&amp;gt;：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2+2ab+b^2=2ab+c^2\quad\Longrightarrow\quad a^2+b^2=c^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
三、四、五的例子只是其中一种比例。这个拼合过程没有要求边长是整数，因而对任意正实数边长都成立。&lt;br /&gt;
&lt;br /&gt;
== 已知的边不同，怎样使用同一关系 ==&lt;br /&gt;
如果把刚才的路线按两倍放大，两条直角边变成六米和八米。每个面积变成原来的四倍，所以斜边变成十米：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sqrt{6^2+8^2}=\sqrt{100}=10.&amp;lt;/math&amp;gt;&lt;br /&gt;
一般地，所有长度同时乘以 &amp;lt;math&amp;gt;k&amp;gt;0&amp;lt;/math&amp;gt;，等式的每一项都乘以 &amp;lt;math&amp;gt;k^2&amp;lt;/math&amp;gt;，勾股关系保持不变。&lt;br /&gt;
&lt;br /&gt;
换一个问题：十三米长的梯子靠在竖直墙上，梯脚离墙五米，梯顶有多高？假定墙与地面垂直，梯子是斜边。设高度为 &amp;lt;math&amp;gt;h&amp;lt;/math&amp;gt;，先写出三边关系，再把已知量代入：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;h^2+5^2=13^2,\qquad h^2=169-25=144,\qquad h=12\ \mathrm m.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里用减法，是因为所求的是一条直角边。如果误把十三和五的平方相加，就相当于把梯子当成了另一条直角边。&lt;br /&gt;
&lt;br /&gt;
有时三条边已经给定，要判断的是角。例如七、二十四、二十五能组成三角形，而且&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;7^2+24^2=49+576=625=25^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
由勾股定理的&#039;&#039;&#039;逆命题&#039;&#039;&#039;，二十五所对的角是直角。&lt;br /&gt;
&lt;br /&gt;
逆命题可以这样证明。对于原三角形的两条较短边 &amp;lt;math&amp;gt;a,b&amp;lt;/math&amp;gt;，另作一个以它们为直角边的直角三角形，斜边长记为 &amp;lt;math&amp;gt;d&amp;lt;/math&amp;gt;。正向定理给出 &amp;lt;math&amp;gt;d^2=a^2+b^2&amp;lt;/math&amp;gt;。如果原三角形的第三边满足 &amp;lt;math&amp;gt;c^2=a^2+b^2&amp;lt;/math&amp;gt;，便有 &amp;lt;math&amp;gt;d=c&amp;lt;/math&amp;gt;。两个三角形三边分别相等，因而全等，原三角形的对应角也是直角。&lt;br /&gt;
&lt;br /&gt;
判定时要先有一个三角形。边长一、二、三只能首尾排在同一直线上，不能围出面积；边长二、三、四可以围成三角形，但 &amp;lt;math&amp;gt;2^2+3^2\ne4^2&amp;lt;/math&amp;gt;，所以它没有直角。&lt;br /&gt;
&lt;br /&gt;
== 两个坐标怎样变成一段距离 ==&lt;br /&gt;
把起点记作 &amp;lt;math&amp;gt;P=(-2,1)&amp;lt;/math&amp;gt;，终点记作 &amp;lt;math&amp;gt;Q=(4,9)&amp;lt;/math&amp;gt;。在相互垂直且单位相同的坐标轴中，横向位移为 &amp;lt;math&amp;gt;4-(-2)=6&amp;lt;/math&amp;gt;，纵向位移为 &amp;lt;math&amp;gt;9-1=8&amp;lt;/math&amp;gt;。它们正是上一节的两条直角边，所以距离为十。&lt;br /&gt;
&lt;br /&gt;
对于一般的两点 &amp;lt;math&amp;gt;P=(x_1,y_1)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;Q=(x_2,y_2)&amp;lt;/math&amp;gt;，同样的作法得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d(P,Q)=\sqrt{(x_2-x_1)^2+(y_2-y_1)^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
坐标差记录方向，可以为负；平方之后，只留下各方向位移对长度的贡献。交换起点和终点时两个差都变号，距离不变。&lt;br /&gt;
&lt;br /&gt;
三维距离可以分两次求。例如长方体的三条相互垂直的边长为二、三、六。先在底面求对角线 &amp;lt;math&amp;gt;\sqrt{2^2+3^2}=\sqrt{13}&amp;lt;/math&amp;gt;，再把它与高度六组成一个直角三角形，体对角线为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sqrt{(\sqrt{13})^2+6^2}=\sqrt{49}=7.&amp;lt;/math&amp;gt;&lt;br /&gt;
一般式 &amp;lt;math&amp;gt;\sqrt{\Delta x^2+\Delta y^2+\Delta z^2}&amp;lt;/math&amp;gt;，就是这样连续应用二维定理得到的。&lt;br /&gt;
&lt;br /&gt;
== 垂线为什么给出最短距离 ==&lt;br /&gt;
从线外一点 &amp;lt;math&amp;gt;P&amp;lt;/math&amp;gt; 向直线作垂线，垂足为 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt;。在直线上另取一点 &amp;lt;math&amp;gt;Q&amp;lt;/math&amp;gt;，三角形 &amp;lt;math&amp;gt;PHQ&amp;lt;/math&amp;gt; 在 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 处为直角，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;PQ^2=PH^2+HQ^2\ge PH^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;Q\ne H&amp;lt;/math&amp;gt; 时，&amp;lt;math&amp;gt;HQ^2&amp;gt;0&amp;lt;/math&amp;gt;，斜着连接的线段严格更长。这证明点到直线的最短距离由垂线段给出。&lt;br /&gt;
&lt;br /&gt;
同一论证也出现在[[最小二乘法]]中。若数据向量 &amp;lt;math&amp;gt;x&amp;lt;/math&amp;gt; 的垂直投影为 &amp;lt;math&amp;gt;p&amp;lt;/math&amp;gt;，允许的另一个拟合结果为 &amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt;，那么从 &amp;lt;math&amp;gt;x&amp;lt;/math&amp;gt; 到 &amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt; 的偏差，可以拆成垂直余量 &amp;lt;math&amp;gt;x-p&amp;lt;/math&amp;gt; 与沿允许方向的位移 &amp;lt;math&amp;gt;p-q&amp;lt;/math&amp;gt;。两部分正交，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|x-q\|^2=\|x-p\|^2+\|p-q\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
式中的双竖线表示向量长度。第一项固定，第二项非负；选择 &amp;lt;math&amp;gt;q=p&amp;lt;/math&amp;gt; 就让误差最小。&lt;br /&gt;
&lt;br /&gt;
在实内积空间中，正交用 &amp;lt;math&amp;gt;\langle u,v\rangle=0&amp;lt;/math&amp;gt; 表示。展开长度平方可直接看见其作用：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|u+v\|^2=\|u\|^2+2\langle u,v\rangle+\|v\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
正交时中间项消失。这给出了勾股关系的代数形式；反过来，在实内积空间中平方可加也说明两向量正交。复内积空间的中间项则为 &amp;lt;math&amp;gt;2\operatorname{Re}\langle u,v\rangle&amp;lt;/math&amp;gt;，只有实部为零还不足以推出内积为零。&lt;br /&gt;
&lt;br /&gt;
== 直角条件与整数边长 ==&lt;br /&gt;
若沿两个夹角为六十度的单位方向各走一单位，两段位移并不正交。合成位移的长度平方为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;1^2+1^2+2\cos60^\circ=3.&amp;lt;/math&amp;gt;&lt;br /&gt;
其长度是 &amp;lt;math&amp;gt;\sqrt3&amp;lt;/math&amp;gt;。一般的非正交单位方向夹角为 &amp;lt;math&amp;gt;\theta&amp;lt;/math&amp;gt; 时，分量 &amp;lt;math&amp;gt;u,v&amp;lt;/math&amp;gt; 合成后的长度平方为 &amp;lt;math&amp;gt;u^2+v^2+2uv\cos\theta&amp;lt;/math&amp;gt;。直角恰好使交叉项为零。斜坐标的分量因此不能直接当作直角边。&lt;br /&gt;
&lt;br /&gt;
如果所量的是沿街区行走的路程，回到开头的例子，三米向东加四米向北仍是七米；若研究球面上沿大圆弧连接的三角形，则需使用球面几何。勾股定理在这些问题里所描述的对象与实际路径不同。&lt;br /&gt;
&lt;br /&gt;
三条边均为正整数时，称为&#039;&#039;&#039;勾股数组&#039;&#039;&#039;。五、十二、十三可以由整数 &amp;lt;math&amp;gt;m=3,n=2&amp;lt;/math&amp;gt; 构造出来：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=m^2-n^2,\qquad b=2mn,\qquad c=m^2+n^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
对任意整数 &amp;lt;math&amp;gt;m&amp;gt;n&amp;gt;0&amp;lt;/math&amp;gt;，展开都有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(m^2-n^2)^2+(2mn)^2=m^4+2m^2n^2+n^4=(m^2+n^2)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;m,n&amp;lt;/math&amp;gt; 互素且一奇一偶时，得到没有共同因子的勾股数组。整数构造只覆盖具有相应有理边长比的三角形；两条直角边都为一时，斜边为 &amp;lt;math&amp;gt;\sqrt2&amp;lt;/math&amp;gt;，已经需要无理数。&lt;br /&gt;
&lt;br /&gt;
实际测量的长度带有误差。如果根据斜边 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 和直角边 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 求另一边，且 &amp;lt;math&amp;gt;c,a&amp;lt;/math&amp;gt; 非常接近，差 &amp;lt;math&amp;gt;c^2-a^2&amp;lt;/math&amp;gt; 会很小。此时输入的微小变化可能明显影响答案，报告结果应保留与测量精度相称的位数。精确的几何关系与近似的测量值是两个层次。&lt;br /&gt;
&lt;br /&gt;
== 历史 ==&lt;br /&gt;
古巴比伦泥板保存了早于毕达哥拉斯时代的相关长度计算与整数组合。[https://mathshistory.st-andrews.ac.uk/HistTopics/Babylonian_Pythagoras/ MacTutor 的泥板研究介绍]可帮助区分这些计算材料与后来的命名。中国的“勾、股、弦”术语见于《周髀算经》及其注释传统，相关文本背景见[https://mathshistory.st-andrews.ac.uk/HistTopics/Ten_classics/ 中国古代数学十部经典介绍]。&lt;br /&gt;
&lt;br /&gt;
约公元前 300 年成书的《几何原本》第一卷命题 47 给出一般命题的面积证明，命题 48 证明逆命题。本文的四三角形拼图是另一种常见证明；它利用全等、三角形内角和与面积可加性说明同一个关系。&lt;br /&gt;
&lt;br /&gt;
== 从直角推广到任意三角形 ==&lt;br /&gt;
[[余弦定理]]把两边的夹角也计入边长关系：当夹角为直角时，余弦项为零，恰好回到勾股定理；锐角与钝角则给出不同的修正。知道三边之后，[[海伦公式]]可以不先测高就求面积。两篇使用同一个边长为 13、14、15 的三角形，把辅助线、角度和面积的计算串起来。&lt;br /&gt;
&lt;br /&gt;
== 参考资料与知识联系 ==&lt;br /&gt;
* Euclid，《Elements》，第一卷命题 47、48；[https://mathcs.clarku.edu/~djoyce/elements/bookI/propI47.html David E. Joyce 编注，命题 47]、[https://mathcs.clarku.edu/~djoyce/elements/bookI/propI48.html 命题 48]。可参阅定理在古典体系中的陈述与证明位置。&lt;br /&gt;
* J. J. O&#039;Connor、E. F. Robertson，[https://mathshistory.st-andrews.ac.uk/HistTopics/Babylonian_Pythagoras/ Babylonian Pythagoras]，MacTutor，University of St Andrews。用于区分古巴比伦材料与后世命名。&lt;br /&gt;
* [https://mathshistory.st-andrews.ac.uk/HistTopics/Ten_classics/ MacTutor：Ten mathematical classics]：讨论《周髀算经》与勾股传统的文献背景。&lt;br /&gt;
* 前置概念：[[欧氏几何]]、[[函数]]；继续阅读：[[向量空间]]、[[最小二乘法]]、[[圆锥曲线]]、[[整数整除]]。&lt;br /&gt;
[[分类:几何]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E7%BA%BF%E6%80%A7%E4%BB%A3%E6%95%B0&amp;diff=392</id>
		<title>线性代数</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E7%BA%BF%E6%80%A7%E4%BB%A3%E6%95%B0&amp;diff=392"/>
		<updated>2026-09-20T02:06:09Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;线性代数&#039;&#039;&#039;（linear algebra）研究向量之间的线性关系，以及保持这些关系的变换。它从一次方程组的求解出发，发展出[[向量空间]]、[[矩阵]]、正交投影和特征值等方法。许多看似不同的问题——方程有多少解、怎样拟合有误差的数据、重复执行一个过程会怎样——都能在这套框架中联系起来。&lt;br /&gt;
&lt;br /&gt;
本文以实数为系数。阅读下面的例子，只需会解简单的一次方程；矩阵的行列运算和基的定义可分别查阅[[矩阵]]与[[向量空间]]。&lt;br /&gt;
&lt;br /&gt;
== 三条方程为什么未必能确定三个未知量 ==&lt;br /&gt;
考虑方程组&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{cases}x+y+z=4,\\2x+3y+z=9,\\x+2y=5.\end{cases}&amp;lt;/math&amp;gt;&lt;br /&gt;
先用第一条消去后两条中的 &amp;lt;math&amp;gt;x&amp;lt;/math&amp;gt;。第二条减去第一条的两倍，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(2x+3y+z)-2(x+y+z)=9-8,\qquad y-z=1.&amp;lt;/math&amp;gt;&lt;br /&gt;
第三条减去第一条，得到的仍是 &amp;lt;math&amp;gt;y-z=1&amp;lt;/math&amp;gt;。所以两条新的方程重复了，只有一个关系限制 &amp;lt;math&amp;gt;y,z&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
令可以自由选择的 &amp;lt;math&amp;gt;z=t&amp;lt;/math&amp;gt;，就有 &amp;lt;math&amp;gt;y=1+t&amp;lt;/math&amp;gt;；代回第一条，得 &amp;lt;math&amp;gt;x=4-(1+t)-t=3-2t&amp;lt;/math&amp;gt;。全部解为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{pmatrix}x\\y\\z\end{pmatrix}=\begin{pmatrix}3\\1\\0\end{pmatrix}+t\begin{pmatrix}-2\\1\\1\end{pmatrix},\qquad t\in\mathbb R.&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;t=0&amp;lt;/math&amp;gt;，解是 &amp;lt;math&amp;gt;(3,1,0)&amp;lt;/math&amp;gt;；当 &amp;lt;math&amp;gt;t=2&amp;lt;/math&amp;gt;，解是 &amp;lt;math&amp;gt;(-1,3,2)&amp;lt;/math&amp;gt;。两者都满足原方程。几何上，全部解沿同一条直线排列；代数上，三个未知量只受到两条独立约束。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-linear-solutions.svg|frame|center|alt=三维斜投影中，所有解位于经过三一零且方向为负二一一的直线上，标出参数零一二的三个点|图中的直线由参数式给出，三个坐标随同一个参数一起改变。斜投影只帮助辨认位置，是否满足方程仍要代回核验。]]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
若第三条右端改成六，消元将同时要求 &amp;lt;math&amp;gt;y-z=1&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;y-z=2&amp;lt;/math&amp;gt;，方程便无解。若保留前两条、把第三条换成 &amp;lt;math&amp;gt;z=2&amp;lt;/math&amp;gt;，则自由参数被固定，解唯一。因此决定解的状态的是约束是否独立、彼此是否相容，而不仅是方程和未知量的数量。&lt;br /&gt;
&lt;br /&gt;
== 把同一个问题读成向量的组合 ==&lt;br /&gt;
把系数排成矩阵，方程组简写为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A\begin{pmatrix}x\\y\\z\end{pmatrix}=b,\qquad A=\begin{pmatrix}1&amp;amp;1&amp;amp;1\\2&amp;amp;3&amp;amp;1\\1&amp;amp;2&amp;amp;0\end{pmatrix},\qquad b=\begin{pmatrix}4\\9\\5\end{pmatrix}.&amp;lt;/math&amp;gt;&lt;br /&gt;
按行读，就是刚才的三条方程。按列读，则是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x\begin{pmatrix}1\\2\\1\end{pmatrix}+y\begin{pmatrix}1\\3\\2\end{pmatrix}+z\begin{pmatrix}1\\1\\0\end{pmatrix}=b.&amp;lt;/math&amp;gt;&lt;br /&gt;
求解是在问：给这三列各取多少倍，才能拼成目标输出 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt;？所有能拼成的输出称为矩阵的&#039;&#039;&#039;列空间&#039;&#039;&#039;，也就是线性映射的&#039;&#039;&#039;像&#039;&#039;&#039;。目标在列空间中，方程才有解。&lt;br /&gt;
&lt;br /&gt;
本例第二列加第三列等于第一列的两倍。因此，沿输入方向 &amp;lt;math&amp;gt;(-2,1,1)&amp;lt;/math&amp;gt; 增加任意倍数，对输出的总改变都是零。这正是上一节留下的自由方向。&lt;br /&gt;
&lt;br /&gt;
== 线性意味着保持组合 ==&lt;br /&gt;
矩阵所描述的过程满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;T(au+bv)=aT(u)+bT(v),&amp;lt;/math&amp;gt;&lt;br /&gt;
其中 &amp;lt;math&amp;gt;u,v&amp;lt;/math&amp;gt; 是输入向量，&amp;lt;math&amp;gt;a,b&amp;lt;/math&amp;gt; 是实数。这样的映射称为&#039;&#039;&#039;线性映射&#039;&#039;&#039;。先把输入相加、缩放，再计算输出，与分别计算后同样相加、缩放，结果一致。&lt;br /&gt;
&lt;br /&gt;
例如 &amp;lt;math&amp;gt;T(x,y)=(x+2y,3x-y)&amp;lt;/math&amp;gt; 满足这条规则。若 &amp;lt;math&amp;gt;u=(u_1,u_2)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;v=(v_1,v_2)&amp;lt;/math&amp;gt;，把 &amp;lt;math&amp;gt;au+bv&amp;lt;/math&amp;gt; 代入第一个输出，就得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a u_1+b v_1+2(a u_2+b v_2)=a(u_1+2u_2)+b(v_1+2v_2),&amp;lt;/math&amp;gt;&lt;br /&gt;
第二个输出同理。这便验证了线性。&lt;br /&gt;
&lt;br /&gt;
一次函数 &amp;lt;math&amp;gt;f(x)=x+1&amp;lt;/math&amp;gt; 的图像虽是直线，却不是这里的线性映射：它把零送到一，而线性规则要求 &amp;lt;math&amp;gt;T(0)=0&amp;lt;/math&amp;gt;。它属于仿射映射。线性代数中的“线性”指运算规律，不是图像是否为直线。&lt;br /&gt;
&lt;br /&gt;
保持组合还有一个直接结果：知道一组基的输出，就知道所有输入的输出。若 &amp;lt;math&amp;gt;x=\sum_i x_i e_i&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;T(x)=\sum_i x_i T(e_i)&amp;lt;/math&amp;gt;。把 &amp;lt;math&amp;gt;T(e_i)&amp;lt;/math&amp;gt; 的坐标排成矩阵各列，便得到 &amp;lt;math&amp;gt;T(x)=Ax&amp;lt;/math&amp;gt;；这正是矩阵表示线性映射的原因。&lt;br /&gt;
&lt;br /&gt;
== 核、像与所有解的形状 ==&lt;br /&gt;
产生零输出的输入构成&#039;&#039;&#039;核&#039;&#039;&#039;，记作&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\ker A=\{z:Az=0\}.&amp;lt;/math&amp;gt;&lt;br /&gt;
它记录变换无法辨别的输入方向。若 &amp;lt;math&amp;gt;x_0&amp;lt;/math&amp;gt; 是 &amp;lt;math&amp;gt;Ax=b&amp;lt;/math&amp;gt; 的一个解，核中的每个 &amp;lt;math&amp;gt;z&amp;lt;/math&amp;gt; 都给出另一个解，因为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A(x_0+z)=Ax_0+Az=b+0=b.&amp;lt;/math&amp;gt;&lt;br /&gt;
反过来，任意解 &amp;lt;math&amp;gt;x&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;x_0&amp;lt;/math&amp;gt; 之差满足 &amp;lt;math&amp;gt;A(x-x_0)=b-b=0&amp;lt;/math&amp;gt;。所以全部解恰好是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_0+\ker A.&amp;lt;/math&amp;gt;&lt;br /&gt;
前面的方程组中，特解是 &amp;lt;math&amp;gt;(3,1,0)&amp;lt;/math&amp;gt;，核是 &amp;lt;math&amp;gt;(-2,1,1)&amp;lt;/math&amp;gt; 的所有倍数，因而解集是一条平移后的直线。&lt;br /&gt;
&lt;br /&gt;
核与像都是向量子空间。以核为例，若 &amp;lt;math&amp;gt;Au=Av=0&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;A(au+bv)=a0+b0=0&amp;lt;/math&amp;gt;，任意线性组合仍在核中。像也如此：两个可达输出的线性组合，可以由相应输入的组合产生。&lt;br /&gt;
&lt;br /&gt;
像的维数称为&#039;&#039;&#039;秩&#039;&#039;&#039;，核的维数称为&#039;&#039;&#039;零度&#039;&#039;&#039;。对于有 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 个输入坐标的矩阵，&#039;&#039;&#039;秩—零度定理&#039;&#039;&#039;给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;n=\dim\ker A+\operatorname{rank}A.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例有一个被消去的独立输入方向、两个独立输出方向，所以 &amp;lt;math&amp;gt;3=1+2&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
=== 秩—零度关系的证明 ===&lt;br /&gt;
先取核的一组基 &amp;lt;math&amp;gt;u_1,\ldots,u_k&amp;lt;/math&amp;gt;，再补入 &amp;lt;math&amp;gt;v_1,\ldots,v_r&amp;lt;/math&amp;gt;，使整个列表成为输入空间的基。于是输入维数是 &amp;lt;math&amp;gt;k+r&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
任意输入可写成 &amp;lt;math&amp;gt;\sum_i a_i u_i+\sum_j b_jv_j&amp;lt;/math&amp;gt;。应用 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 后，核中的部分消失，输出成为 &amp;lt;math&amp;gt;\sum_j b_jAv_j&amp;lt;/math&amp;gt;。所以 &amp;lt;math&amp;gt;Av_1,\ldots,Av_r&amp;lt;/math&amp;gt; 张成像。&lt;br /&gt;
&lt;br /&gt;
还需证明这些输出无关。若 &amp;lt;math&amp;gt;\sum_j c_jAv_j=0&amp;lt;/math&amp;gt;，那么 &amp;lt;math&amp;gt;\sum_jc_jv_j&amp;lt;/math&amp;gt; 属于核，可写成 &amp;lt;math&amp;gt;\sum_i d_i u_i&amp;lt;/math&amp;gt;。移项得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sum_jc_jv_j-\sum_i d_i u_i=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
完整列表是一组基，故所有系数为零，特别是每个 &amp;lt;math&amp;gt;c_j=0&amp;lt;/math&amp;gt;。因此这些输出是像的一组基，像的维数为 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt;，定理得证。&lt;br /&gt;
&lt;br /&gt;
这个证明把“丢失的方向”和“仍能辨别的方向”分别计数。对于同样有 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 个输入和输出坐标的方阵，核只有零向量时，秩为 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt;；此时每个输出都有唯一输入，矩阵可逆。&lt;br /&gt;
&lt;br /&gt;
== 不必消元到底，也能发现相容条件 ==&lt;br /&gt;
回到最初的矩阵，第三行恰好等于第二行减第一行。因此它们右端也必须满足同样关系：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;b_3=b_2-b_1,\qquad b_1-b_2+b_3=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
原来的 &amp;lt;math&amp;gt;(4,9,5)&amp;lt;/math&amp;gt; 满足条件；把第三个数改成六就不满足。左边的约束不是对未知数的猜测，而是对所有可能输出都成立的限制。&lt;br /&gt;
&lt;br /&gt;
令 &amp;lt;math&amp;gt;w=(1,-1,1)^{\mathsf T}&amp;lt;/math&amp;gt;，行关系可写成 &amp;lt;math&amp;gt;w^{\mathsf T}A=0&amp;lt;/math&amp;gt;。若 &amp;lt;math&amp;gt;Ax=b&amp;lt;/math&amp;gt; 有解，那么&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;w^{\mathsf T}b=w^{\mathsf T}Ax=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
像 &amp;lt;math&amp;gt;w&amp;lt;/math&amp;gt; 这样与全部列都垂直的向量构成 &amp;lt;math&amp;gt;\ker A^{\mathsf T}&amp;lt;/math&amp;gt;，称为左零空间。因此相容条件说：目标输出必须与左零空间垂直。&lt;br /&gt;
&lt;br /&gt;
在有限维实数空间中，这个必要条件也是充分条件。因为列空间包含在 &amp;lt;math&amp;gt;(\ker A^{\mathsf T})^\perp&amp;lt;/math&amp;gt; 中，且两者维数都等于 &amp;lt;math&amp;gt;\operatorname{rank}A&amp;lt;/math&amp;gt;，它们实际相同。这里使用了行秩等于列秩，见后面的四个基本子空间资料。于是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;Ax=b\text{ 有解}\quad\Longleftrightarrow\quad&lt;br /&gt;
b\perp\ker A^{\mathsf T}.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例左零空间只有一个独立方向，所以一条右端关系就检查完所有相容条件。这与输入空间中的核互相补充：左零空间决定目标能否到达，核决定到达同一目标的输入能否唯一。&lt;br /&gt;
&lt;br /&gt;
== 数据不满足方程时：寻找最近的输出 ==&lt;br /&gt;
测量数据往往不能被模型精确表示。这时可把问题改为：在允许的输出中，找与给定数据距离最近的点。&lt;br /&gt;
&lt;br /&gt;
最简单的情形是允许输出只能在横轴上，而目标为 &amp;lt;math&amp;gt;b=(2,1)&amp;lt;/math&amp;gt;。候选输出 &amp;lt;math&amp;gt;p=(a,0)&amp;lt;/math&amp;gt; 与目标的距离平方为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|b-p\|^2=(2-a)^2+1.&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;a=2&amp;lt;/math&amp;gt; 时取最小值。因此最佳输出是 &amp;lt;math&amp;gt;(2,0)&amp;lt;/math&amp;gt;，误差 &amp;lt;math&amp;gt;(0,1)&amp;lt;/math&amp;gt; 与横轴垂直。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-linear-projection-theme.svg|frame|center|alt=点二一向横轴作垂线，垂足为二零，残差为零一|目标到垂足的线段最短；移动垂足会增加一个非负的水平距离平方。]]&lt;br /&gt;
&lt;br /&gt;
一般情况下，允许输出是矩阵的列空间。设最佳输出候选为 &amp;lt;math&amp;gt;p=A\hat x&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;r=b-p&amp;lt;/math&amp;gt;。如果残差与所有列都垂直，它也与列空间中的任意 &amp;lt;math&amp;gt;Ah&amp;lt;/math&amp;gt; 垂直。换一个输入 &amp;lt;math&amp;gt;\hat x+h&amp;lt;/math&amp;gt; 后，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|b-A(\hat x+h)\|^2=\|r-Ah\|^2=\|r\|^2+\|Ah\|^2\ge\|r\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
中间没有交叉项，正是因为垂直。因此这样的输出必定最近。&lt;br /&gt;
&lt;br /&gt;
反过来，如果残差与某列空间方向 &amp;lt;math&amp;gt;v&amp;lt;/math&amp;gt; 的点积非零，把输出移动 &amp;lt;math&amp;gt;tv&amp;lt;/math&amp;gt;，误差平方变为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|r-tv\|^2=\|r\|^2-2t\,r^{\mathsf T}v+t^2\|v\|^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
选一个与 &amp;lt;math&amp;gt;r^{\mathsf T}v&amp;lt;/math&amp;gt; 同号且足够小的 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt;，就能使误差减小。所以最优点处残差必须与列空间垂直。写成矩阵形式，就是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A^{\mathsf T}(b-A\hat x)=0,\qquad A^{\mathsf T}A\hat x=A^{\mathsf T}b.&amp;lt;/math&amp;gt;&lt;br /&gt;
这称为正规方程，是[[最小二乘法]]的基本条件。&lt;br /&gt;
&lt;br /&gt;
例如用直线拟合三个给定点 &amp;lt;math&amp;gt;(0,1),(1,2),(2,2)&amp;lt;/math&amp;gt;。写成 &amp;lt;math&amp;gt;\hat y=a+c(t-1)&amp;lt;/math&amp;gt;，设计矩阵两列分别为 &amp;lt;math&amp;gt;(1,1,1)&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;(-1,0,1)&amp;lt;/math&amp;gt;。它们点积为零，平方长度分别为三、二，因此正规方程为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;3a=1+2+2=5,\qquad 2c=(-1)\cdot1+0\cdot2+1\cdot2=1.&amp;lt;/math&amp;gt;&lt;br /&gt;
得到 &amp;lt;math&amp;gt;a=5/3,c=1/2&amp;lt;/math&amp;gt;，即 &amp;lt;math&amp;gt;\hat y=7/6+t/2&amp;lt;/math&amp;gt;。三个残差为 &amp;lt;math&amp;gt;-1/6,1/3,-1/6&amp;lt;/math&amp;gt;，其和为零，与 &amp;lt;math&amp;gt;(-1,0,1)&amp;lt;/math&amp;gt; 的点积也为零，恰好验证了正交条件。&lt;br /&gt;
&lt;br /&gt;
== 重复变换与特征方向 ==&lt;br /&gt;
有些方向经过变换后仍在原来那条直线上，只改变倍数。若非零向量 &amp;lt;math&amp;gt;v&amp;lt;/math&amp;gt; 满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;Av=\lambda v,&amp;lt;/math&amp;gt;&lt;br /&gt;
就称它为&#039;&#039;&#039;特征向量&#039;&#039;&#039;，&amp;lt;math&amp;gt;\lambda&amp;lt;/math&amp;gt; 为特征值。重复作用时，&amp;lt;math&amp;gt;A^2v=\lambda^2v&amp;lt;/math&amp;gt;，一般有 &amp;lt;math&amp;gt;A^kv=\lambda^kv&amp;lt;/math&amp;gt;。沿这样的方向，不必每次重新做完整矩阵乘法。&lt;br /&gt;
&lt;br /&gt;
考虑&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A=\begin{pmatrix}2&amp;amp;1\\1&amp;amp;2\end{pmatrix}.&amp;lt;/math&amp;gt;&lt;br /&gt;
直接计算可得 &amp;lt;math&amp;gt;A(1,1)=3(1,1)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;A(1,-1)=(1,-1)&amp;lt;/math&amp;gt;。两个方向独立，任意 &amp;lt;math&amp;gt;(x,y)&amp;lt;/math&amp;gt; 都能分解为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(x,y)=\frac{x+y}{2}(1,1)+\frac{x-y}{2}(1,-1).&amp;lt;/math&amp;gt;&lt;br /&gt;
[[File:Gezhi-teaching-eigendirections.svg|frame|center|alt=矩阵把一一方向伸长三倍，保留一负一方向，二零向量分解成这两个方向之和|先把白色向量分解到两条虚线方向，再分别考虑各方向会缩放多少。]]&lt;br /&gt;
&lt;br /&gt;
图中 &amp;lt;math&amp;gt;v=(1,1)&amp;lt;/math&amp;gt; 被放大三倍，&amp;lt;math&amp;gt;w=(1,-1)&amp;lt;/math&amp;gt; 保持不变。重复变换时，只需分别重复这两个缩放。&lt;br /&gt;
&lt;br /&gt;
因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;A^k(x,y)=3^k\frac{x+y}{2}(1,1)+\frac{x-y}{2}(1,-1).&amp;lt;/math&amp;gt;&lt;br /&gt;
例如 &amp;lt;math&amp;gt;(2,0)&amp;lt;/math&amp;gt; 的两项系数都是一，做 &amp;lt;math&amp;gt;k&amp;lt;/math&amp;gt; 次后就是 &amp;lt;math&amp;gt;(3^k+1,3^k-1)&amp;lt;/math&amp;gt;。当 &amp;lt;math&amp;gt;k=1&amp;lt;/math&amp;gt;，得到 &amp;lt;math&amp;gt;(4,2)&amp;lt;/math&amp;gt;，与直接相乘一致。&lt;br /&gt;
&lt;br /&gt;
当一组基全由特征向量组成时，称矩阵可对角化。在这组基下，变换只是分别缩放各个坐标。不过这并非总能做到：剪切矩阵 &amp;lt;math&amp;gt;S=\begin{pmatrix}1&amp;amp;1\\0&amp;amp;1\end{pmatrix}&amp;lt;/math&amp;gt; 的特征方程给出 &amp;lt;math&amp;gt;\lambda=1&amp;lt;/math&amp;gt;，而 &amp;lt;math&amp;gt;Sv=v&amp;lt;/math&amp;gt; 要求第二坐标为零，只有一个独立特征方向，不能组成平面的基。&lt;br /&gt;
&lt;br /&gt;
=== 两个状态之间的迁移 ===&lt;br /&gt;
设一个系统每步有第一状态的八成留在原处、两成转到第二状态；第二状态的三成转到第一状态、七成留在原处。用列向量记录比例，一步变化为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P=\begin{pmatrix}0.8&amp;amp;0.3\\0.2&amp;amp;0.7\end{pmatrix}.&amp;lt;/math&amp;gt;&lt;br /&gt;
各列非负且和为一，保证更新后仍为总和一的比例。&lt;br /&gt;
&lt;br /&gt;
稳定比例 &amp;lt;math&amp;gt;s=(u,v)&amp;lt;/math&amp;gt; 应满足 &amp;lt;math&amp;gt;Ps=s&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;u+v=1&amp;lt;/math&amp;gt;。第一条分量方程为 &amp;lt;math&amp;gt;0.8u+0.3v=u&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;0.2u=0.3v&amp;lt;/math&amp;gt;，即 &amp;lt;math&amp;gt;u:v=3:2&amp;lt;/math&amp;gt;。于是 &amp;lt;math&amp;gt;s=(0.6,0.4)&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
偏离方向满足 &amp;lt;math&amp;gt;P(1,-1)=0.5(1,-1)&amp;lt;/math&amp;gt;。从全部位于第一状态的 &amp;lt;math&amp;gt;(1,0)&amp;lt;/math&amp;gt; 出发，先分解为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(1,0)=(0.6,0.4)+(0.4,-0.4).&amp;lt;/math&amp;gt;&lt;br /&gt;
稳定部分不变，偏离部分每步减半，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;P^k(1,0)=(0.6,0.4)+2^{-k}(0.4,-0.4).&amp;lt;/math&amp;gt;&lt;br /&gt;
一步后为 &amp;lt;math&amp;gt;(0.8,0.2)&amp;lt;/math&amp;gt;，两步后为 &amp;lt;math&amp;gt;(0.7,0.3)&amp;lt;/math&amp;gt;，最终趋向 &amp;lt;math&amp;gt;(0.6,0.4)&amp;lt;/math&amp;gt;。这个模型中，特征值一表示不变部分，特征值二分之一表示逐渐衰减的部分。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-linear-markov.svg|frame|center|alt=两状态比例随步数变化，第一状态从一逐步下降趋于零点六，第二状态从零上升趋于零点四；两比例始终相加为一|点表示整数步的状态，连线只帮助追踪次序。虚线标出稳定比例，每一步到稳定比例的偏差都减半。]]&lt;br /&gt;
&lt;br /&gt;
还可以把两状态模型化成一条[[差分方程模型|标量递推]]。令第一状态比例为 &amp;lt;math&amp;gt;u_k&amp;lt;/math&amp;gt;，第二状态便是 &amp;lt;math&amp;gt;1-u_k&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;u_{k+1}=0.8u_k+0.3(1-u_k)=0.5u_k+0.3.&amp;lt;/math&amp;gt;&lt;br /&gt;
减去平衡值0.6，得到 &amp;lt;math&amp;gt;u_{k+1}-0.6=0.5(u_k-0.6)&amp;lt;/math&amp;gt;。这正是矩阵特征方向计算得到的衰减规律；消去一个受总量约束的坐标后，同一过程也可由一维递推描述。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 历史与进一步阅读 ==&lt;br /&gt;
《九章算术》第八章“方程”已经通过排列系数、逐步消去来求解实际问题中的线性方程组。[https://old.maa.org/press/periodicals/convergence/illustrating-the-nine-chapters-on-the-mathematical-art-their-use-in-a-college-mathematics-history-1 美国数学协会对《九章算术》的介绍]提供了这些算法的背景。&lt;br /&gt;
&lt;br /&gt;
十九世纪，矩阵运算与抽象线性空间逐步形成：Grassmann 的《扩张论》发表于 1844 年，Cayley 在 1858 年系统研究矩阵，Peano 在 1888 年给出线性空间的公理化定义。[https://mathshistory.st-andrews.ac.uk/HistTopics/Abstract_linear_spaces/ MacTutor：抽象线性空间史]。现代线性代数把消元、几何和抽象结构组织在一起，使同一结论能够用于坐标向量、多项式及其他线性对象。&lt;br /&gt;
&lt;br /&gt;
进一步学习可沿两条方向展开：[[最小二乘法]]和[[优化]]研究近似与最优问题；[[微分方程]]研究连续时间中状态如何变化。计算中还需区分精确相关与近似相关：当数据有舍入误差时，接近相关的列可能使系数对误差敏感，这属于数值线性代数要处理的问题。&lt;br /&gt;
&lt;br /&gt;
== 参考资料与后续阅读 ==&lt;br /&gt;
* [https://ocw.mit.edu/courses/18-06-linear-algebra-spring-2010/ MIT OpenCourseWare，Gilbert Strang，18.06 Linear Algebra]：消元、空间、最小二乘和特征值课程。&lt;br /&gt;
* [https://ocw.mit.edu/courses/18-06sc-linear-algebra-fall-2011/pages/ax-b-and-the-four-subspaces/the-four-fundamental-subspaces/ MIT 18.06SC，The Four Fundamental Subspaces]：四个基本子空间的课程单元。&lt;br /&gt;
* [https://math.mit.edu/~gs/linearalgebra/ila5/linearalgebra5_3-5.pdf Strang，《Introduction to Linear Algebra》第 3.5 节]：行空间与列空间在消元下的不同变化。&lt;br /&gt;
* 前置可读[[矩阵]]与[[向量空间]]；继续阅读[[最小二乘法]]、[[优化]]、[[微分方程]]、[[数学建模]]。&lt;br /&gt;
[[分类:代数]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%AD%A6%E4%B9%A0%E8%B7%AF%E5%BE%84&amp;diff=391</id>
		<title>学习路径</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%AD%A6%E4%B9%A0%E8%B7%AF%E5%BE%84&amp;diff=391"/>
		<updated>2026-09-20T02:06:05Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;__NOTOC__&lt;br /&gt;
路径是一种建议顺序，不是必须一次读完的课程。先完成一个小例子，再回到定义与证明；遇到陌生符号可查[[希腊字母发音表]]。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;01　准确表达与证明&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;先建立对象、映射和量词语言，再把这些工具用在整数结构上。&amp;lt;/p&amp;gt;[[集合]] → [[函数]] → [[逻辑]] → [[整数整除]] → [[素数]] → [[同余]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;02　理解变化与演化&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;从误差控制到局部变化、累积，再走向动态规律与增长模型。&amp;lt;/p&amp;gt;[[函数]] → [[极限]] → [[导数]] → [[积分]] → [[微积分]] → [[微分方程]] → [[一阶线性微分方程]] → [[洛吉斯蒂模型]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;03　认识线性与对称&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;从坐标运算走向不依赖坐标的结构，再进入抽象对称。&amp;lt;/p&amp;gt;[[矩阵]] → [[向量空间]] → [[线性代数]] → [[群]] → [[欧拉公式]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;04　从形状到空间&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;几何性质关注长度角度，拓扑进一步研究连续性与整体连接。&amp;lt;/p&amp;gt;[[欧氏几何]] → [[勾股定理]] → [[余弦定理]] → [[海伦公式]] → [[圆锥曲线]] → [[环面]] → [[拓扑空间]] → [[连续映射]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;05　面对不确定性&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;先明确等可能与计数条件，再区分平均、条件化和统计推断。&amp;lt;/p&amp;gt;[[组合数学]] → [[概率]] → [[期望]] → [[贝叶斯定理]] → [[统计推断]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;06　从网络到决策&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;把关系写成图，再用算法和对偶证书说明方案为什么最好。&amp;lt;/p&amp;gt;[[图论]] → [[最短路径]] → [[优化]] → [[线性规划]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;07　把方程变成可靠计算&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;从有保证的区间收缩，到局部快速迭代和积分近似，始终保留误差分析。&amp;lt;/p&amp;gt;[[极限]] → [[二分法]] → [[导数]] → [[牛顿法]] → [[积分]] → [[数值积分]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;08　从数据到可复现模型&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;同时学习结构假设、参数拟合、单位检查和独立验证。&amp;lt;/p&amp;gt;[[数学建模]] → [[最小二乘法]] → [[线性模型]] → [[量纲分析]] → [[统计推断]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;09　把数据看清楚&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;从一行记录的含义出发，按比较、构成、分布、关系和变化选择图形；重算图中数值，再讨论哪些结论需要更多证据。&amp;lt;/p&amp;gt;[[统计图]] → [[条形图]]与[[扇形统计图]] → [[直方图]]与[[箱线图]] → [[散点图]]与[[折线图]] → [[统计推断]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;10　给随机现象建立分布模型&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;先分清单点质量、密度面积和累计概率。计数可沿二项到泊松学习，等待可比较几何、指数与均匀，测量及均值推断可比较正态与 t。&amp;lt;/p&amp;gt;[[概率]] → [[概率分布]] → [[二项分布]]与[[几何分布]] → [[泊松分布]]与[[指数分布]] → [[均匀分布]]与[[正态分布]] → [[学生t分布]] → [[统计推断]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;11　从一步更新到相互作用&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;先手算水量的逐月变化，用平衡点和误差递推判断长期行为；再把两个物种的相互作用写成连续方程，比较时间曲线、相图与数值误差。&amp;lt;/p&amp;gt;[[线性代数]] → [[差分方程模型]] → [[微分方程]] → [[洛吉斯蒂模型]] → [[捕食者-猎物模型]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-path&amp;quot;&amp;gt;&amp;lt;h3&amp;gt;12　从有限对象练习证明&amp;lt;/h3&amp;gt;&amp;lt;p&amp;gt;从后继和归纳建立自然数的规则，用余数分类寻找必然重复，再用非负平方证明向量内积的界。逐次指出归纳、计数和取最小值各自解决了哪一步。&amp;lt;/p&amp;gt;[[逻辑]] → [[皮亚诺公理]] → [[组合数学]] → [[抽屉原理]] → [[向量空间]] → [[柯西不等式]]&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 带着同一个问题往下学 ==&lt;br /&gt;
&lt;br /&gt;
在“变化与演化”这条路上，可以始终追问一杯热水怎样冷却。[[导数]]描述某一时刻的降温速度；[[微分方程]]把速度与温差联系起来；[[一阶线性微分方程]]求出随时间变化的温度；[[数值积分]]则说明，在没有简单原函数时如何计算累积量。每向前一步，写下新增的假设和已经会求的量。&lt;br /&gt;
&lt;br /&gt;
在“线性与模型”这条路上，先在[[矩阵]]中认识一组数怎样把输入变成输出，再到[[向量空间]]与[[线性代数]]理解哪些输出能达到。[[最小二乘法]]把这个问题改为：观测值达不到时，怎样找到最接近的输出？它与[[数学建模]]使用同一组水位数据；后者再用未参与拟合的数据检验模型。&lt;br /&gt;
&lt;br /&gt;
在“不确定性”这条路上，从十次硬币投掷出发。[[组合数学]]数出各种次序，[[概率]]给这些结果分配权重，[[期望]]描述重复试验的平均结果。读到[[统计推断]]，再反过来问：只有投掷结果时，对未知概率能作出多强的判断？用交互图分别改变样本量和真实概率，检查自己的判断是否混淆了数据与假设。&lt;br /&gt;
&lt;br /&gt;
在“形状与空间”这条路上，先用[[环面]]的粘边图追踪一条线越过边界后去了哪里，再在三维模型上找到同一条环路。接着读[[拓扑空间]]与[[连续映射]]，解释哪些变化保留连接方式、哪些结论仍需要证明。转动模型能帮助观察，不能替代对所有路径或所有开集的论证。&lt;br /&gt;
在“把数据看清楚”这条路上，先用[[统计图]]中的四十名参加者，比较“哪类人多”与“各类占多少”的区别。再记录每人的用时，思考[[直方图]]如何保留分布形状、[[箱线图]]又省略了哪些细节。需要研究路程与用时的关系时，先保留每个人的成对数据，再读[[散点图]]；观测同一对象随时间的变化时则读[[折线图]]。不要把类别、数值区间与时间顺序混为一谈。&lt;br /&gt;
&lt;br /&gt;
在“分布模型”这条路上，先固定五次发送，计算成功次数，再改为一直发送到首次成功，观察变量为何从[[二项分布]]改成[[几何分布]]。对稳定到达的请求，同一个过程可用[[泊松分布]]描述次数，用[[指数分布]]描述等待。最后转向测量：[[正态分布]]中的总体标准差与[[学生t分布]]中用样本估计的标准差各承担什么角色？每次换模型，都把对象、单位和条件重新写一遍。&lt;br /&gt;
&lt;br /&gt;
在“线性与模型”这条路的后半段，[[线性模型]]继续使用相同水位数据，区分平均响应的置信区间和新读数的预测区间。[[正态分布]]解释独立高斯误差怎样连接到平方误差，[[贝叶斯定理]]则用后验密度说明数据如何改变对未知参数的判断。先辨认自己要估计的是哪一个量，再决定怎样解释图与区间。&lt;br /&gt;
&lt;br /&gt;
== 阅读时怎样检查自己理解了 ==&lt;br /&gt;
能用自己的话解释定义，并说明一个正例与反例；能重算一个完整算例，指出每一步用了什么前提；能区分定义、定理、模型假设与历史事实。遇到生疏符号可沿先修链接补充知识，再回到例题尝试独立完成下一步。&lt;br /&gt;
&lt;br /&gt;
想了解本站如何展开和核验文章，可读[[帮助:词条写作标准]]。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%AD%A6%E7%A7%91%E5%AF%BC%E8%88%AA&amp;diff=390</id>
		<title>学科导航</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%AD%A6%E7%A7%91%E5%AF%BC%E8%88%AA&amp;diff=390"/>
		<updated>2026-09-20T02:06:02Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;__NOTOC__&lt;br /&gt;
本站按 12 个主要学习方向组织数学知识。每个入口至少有三篇展开讲解的核心词条，包含定义条件、证明与算例；多个入口可以通向同一个概念。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject-grid&amp;quot;&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;01&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;∀&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:基础与逻辑|基础与逻辑]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;从集合、映射与推理，学会准确表达数学。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[集合]] / [[函数]] / [[逻辑]] / [[皮亚诺公理]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;02&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;A&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:代数|代数]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;理解线性结构、运算规律与对称。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[矩阵]] / [[向量空间]] / [[线性代数]] / [[群]] / [[柯西不等式]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;03&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;ℤ&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:数论|数论]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;在整数、素数与余数中寻找规律。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[整数整除]] / [[素数]] / [[同余]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;04&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;△&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:几何|几何]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;把形状的直观转化为可证明的关系。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[欧氏几何]] / [[勾股定理]] / [[圆锥曲线]] / [[余弦定理]] / [[海伦公式]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;05&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;○&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:拓扑|拓扑]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;研究连续变化下保留的空间结构。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[拓扑空间]] / [[连续映射]] / [[环面]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;06&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;∫&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:分析|分析]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;用极限理解局部变化与累积。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[极限]] / [[导数]] / [[积分]] / [[微积分]] / [[欧拉公式]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;07&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;∂&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:微分方程与动力系统|微分方程与动力系统]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;从变化规律重建随时间演化的状态。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[微分方程]] / [[一阶线性微分方程]] / [[洛吉斯蒂模型]] / [[差分方程模型]] / [[捕食者-猎物模型]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;08&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;P&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:概率与统计|概率与统计]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;描述随机现象，并解释数据支持什么结论。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[统计图]] / [[概率分布]] / [[概率]] / [[期望]] / [[贝叶斯定理]] / [[统计推断]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;09&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;G&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:离散数学|离散数学]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;在计数、网络和有限结构中训练证明。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[逻辑]] / [[组合数学]] / [[图论]] / [[抽屉原理]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;10&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;≈&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:数值分析|数值分析]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;控制近似计算的误差与稳定性。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[二分法]] / [[牛顿法]] / [[数值积分]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;11&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;min&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:优化与运筹|优化与运筹]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;在约束下选择方案，并给出最优性证据。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[优化]] / [[线性规划]] / [[最短路径]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-subject&amp;quot;&amp;gt;&amp;lt;div class=&amp;quot;math-subject-number&amp;quot;&amp;gt;12&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-body&amp;quot;&amp;gt;&amp;lt;span class=&amp;quot;math-subject-symbol&amp;quot; aria-hidden=&amp;quot;true&amp;quot;&amp;gt;↔&amp;lt;/span&amp;gt;&amp;lt;div&amp;gt;&amp;lt;h3 class=&amp;quot;math-subject-title&amp;quot;&amp;gt;[[:分类:应用与建模|应用与建模]]&amp;lt;/h3&amp;gt;&amp;lt;p class=&amp;quot;math-subject-description&amp;quot;&amp;gt;让假设、数据、方程与验证形成闭环。&amp;lt;/p&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&amp;lt;div class=&amp;quot;math-subject-links&amp;quot;&amp;gt;[[数学建模]] / [[最小二乘法]] / [[量纲分析]] / [[线性模型]]&amp;lt;/div&amp;gt;&amp;lt;/div&amp;gt;&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 这套分类怎样使用 ==&lt;br /&gt;
这是一套面向学习的导航，不是互斥分类，也不宣称覆盖全部数学研究分支。数论、几何、代数和分析之间有大量交叉；数值分析、优化与建模也会同时使用不同理论工具。研究文献中的更细分类可参见 [https://msc2020.org/ Mathematics Subject Classification 2020（MSC2020）]；本站不把尚未建立词条的细类包装成已有内容。&lt;br /&gt;
&lt;br /&gt;
初读可以沿[[学习路径]]前进，也可以从一个具体问题反向查找先修概念。词条把具体算例、逐步推导与图解接在一起；阅读时可以先重算例子，再对照一般结论。&lt;br /&gt;
&lt;br /&gt;
== 阅读与编写工具 ==&lt;br /&gt;
* [[希腊字母发音表]]：24 个字母的大小写、英美音标、词典试听与数学用法。&lt;br /&gt;
* [[帮助:词条写作标准]]：本站关于深度、证明、算例、历史、来源与图解审校的统一要求。&lt;br /&gt;
* [[格致开物:关于|AI 生成与内容核验说明]]：了解内容来源与核验范围。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%BA%94%E7%94%A8%E4%B8%8E%E5%BB%BA%E6%A8%A1&amp;diff=389</id>
		<title>分类:应用与建模</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%BA%94%E7%94%A8%E4%B8%8E%E5%BB%BA%E6%A8%A1&amp;diff=389"/>
		<updated>2026-09-20T02:05:59Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;让假设、数据、方程与验证形成闭环。&lt;br /&gt;
&lt;br /&gt;
英文名称：Applications and modeling。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
数学建模组织问题、假设与验证，最小二乘把拟合转为投影和优化，量纲分析检查单位并揭示尺度关系。教学数据与可复现附件一并提供。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[数学建模]] → [[最小二乘法]] → [[量纲分析]]&lt;br /&gt;
&lt;br /&gt;
先记录变量单位与数据来源，区分校准和验证；模型拟合好、程序运行对与现实解释成立是三件不同的事。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[数学建模]]&lt;br /&gt;
* [[最小二乘法]]&lt;br /&gt;
* [[量纲分析]]&lt;br /&gt;
&lt;br /&gt;
* [[线性模型]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E7%A6%BB%E6%95%A3%E6%95%B0%E5%AD%A6&amp;diff=388</id>
		<title>分类:离散数学</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E7%A6%BB%E6%95%A3%E6%95%B0%E5%AD%A6&amp;diff=388"/>
		<updated>2026-09-20T02:05:56Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;在计数、网络和有限结构中训练证明。&lt;br /&gt;
&lt;br /&gt;
英文名称：Discrete mathematics。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
逻辑组织可检验的推理，组合数学通过分类、双射与递推计数，图论研究对象之间的连接结构，并通向搜索与网络算法。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[逻辑]] → [[组合数学]] → [[图论]]&lt;br /&gt;
&lt;br /&gt;
每个计数结果都要说明为何不重不漏；每个图算法都要写明有向性、边权条件和正确性理由。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[逻辑]]&lt;br /&gt;
* [[组合数学]]&lt;br /&gt;
* [[图论]]&lt;br /&gt;
&lt;br /&gt;
* [[抽屉原理]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%87%A0%E4%BD%95&amp;diff=387</id>
		<title>分类:几何</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E5%87%A0%E4%BD%95&amp;diff=387"/>
		<updated>2026-09-20T02:05:54Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;把形状的直观转化为可证明的关系。&lt;br /&gt;
&lt;br /&gt;
英文名称：Geometry。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
欧氏几何给出平面空间的公理与基本关系，勾股定理连接长度和正交，圆锥曲线把焦点性质、坐标方程和截面联系起来。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[欧氏几何]] → [[勾股定理]] → [[圆锥曲线]]&lt;br /&gt;
&lt;br /&gt;
先看图说明什么，再核对图不能证明什么；圆锥曲线应同时检查参数范围、退化情形和实际点集。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[欧氏几何]]&lt;br /&gt;
* [[勾股定理]]&lt;br /&gt;
* [[圆锥曲线]]&lt;br /&gt;
&lt;br /&gt;
* [[余弦定理]]&lt;br /&gt;
* [[海伦公式]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E4%BB%A3%E6%95%B0&amp;diff=386</id>
		<title>分类:代数</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%88%86%E7%B1%BB:%E4%BB%A3%E6%95%B0&amp;diff=386"/>
		<updated>2026-09-20T02:05:51Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​扩充线性代数、最小二乘、贝叶斯与正态分布，接通几何和建模学习路径&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;理解线性结构、运算规律与对称。&lt;br /&gt;
&lt;br /&gt;
英文名称：Algebra。&lt;br /&gt;
&lt;br /&gt;
== 本领域研究什么 ==&lt;br /&gt;
矩阵提供计算表达，向量空间说明哪些性质不依赖坐标，线性代数把二者连接起来。群把可逆运算与对称抽象为统一结构。&lt;br /&gt;
&lt;br /&gt;
== 从哪里开始 ==&lt;br /&gt;
[[矩阵]] → [[向量空间]] → [[线性代数]] → [[群]]&lt;br /&gt;
&lt;br /&gt;
建议把同一线性变换同时写成坐标公式和矩阵，再讨论换基；群的例子可从平面图形对称开始。&lt;br /&gt;
&lt;br /&gt;
== 本站核心词条 ==&lt;br /&gt;
* [[矩阵]]&lt;br /&gt;
* [[向量空间]]&lt;br /&gt;
* [[线性代数]]&lt;br /&gt;
* [[群]]&lt;br /&gt;
&lt;br /&gt;
* [[柯西不等式]]&lt;br /&gt;
&lt;br /&gt;
== 与其他分支的联系 ==&lt;br /&gt;
数学的分支不是互相隔绝的盒子；同一词条可能属于多个分类。证明依赖[[逻辑]]，结构计算常借助[[矩阵]]，现实应用需要[[数学建模]]说明假设。进一步阅读可回到[[学科导航]]按问题选择路线。&lt;br /&gt;
&lt;br /&gt;
本分类是本站的学习入口，不等同于研究文献的完整细分目录。正文结合具体问题、逐步推导和必要图解，提供定义、算例及参考来源。写作约定见[[帮助:词条写作标准]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E7%BA%BF%E6%80%A7%E6%A8%A1%E5%9E%8B&amp;diff=385</id>
		<title>线性模型</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E7%BA%BF%E6%80%A7%E6%A8%A1%E5%9E%8B&amp;diff=385"/>
		<updated>2026-09-20T02:04:52Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;线性模型&#039;&#039;&#039;（linear model）用若干已知量的线性组合表示输出。在统计建模中，“线性”通常指对&#039;&#039;&#039;未知参数&#039;&#039;&#039;线性：输入可以经过平方、对数等已知变换，曲线也未必是一条直线。本篇以线性回归为主，区分模型、拟合方法与由模型得到的推断；一般线性方程组的结构见[[线性代数]]。&lt;br /&gt;
&lt;br /&gt;
== 四次水位读数，三个不同的对象 ==&lt;br /&gt;
沿用[[最小二乘法]]中的合成教学数据：在 &amp;lt;math&amp;gt;t=0,1,2,3&amp;lt;/math&amp;gt; 分钟读取水位，得到 &amp;lt;math&amp;gt;h=1,2,2,4&amp;lt;/math&amp;gt; 厘米。想回答的是：在这个时间范围内，平均水位怎样随时间变化？若再观测一次，其读数大约在哪里？&lt;br /&gt;
&lt;br /&gt;
先提出模型&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H_i=b+at_i+\varepsilon_i.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 &amp;lt;math&amp;gt;H_i&amp;lt;/math&amp;gt; 是第 &amp;lt;math&amp;gt;i&amp;lt;/math&amp;gt; 次观测的随机水位，&amp;lt;math&amp;gt;h_i&amp;lt;/math&amp;gt; 是已经拿到的数值；&amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 是未知截距，单位厘米；&amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 是未知斜率，单位厘米／分钟。误差 &amp;lt;math&amp;gt;\varepsilon_i&amp;lt;/math&amp;gt; 表示模型直线之外的变化，也用厘米计。&lt;br /&gt;
&lt;br /&gt;
假设在给定观测时刻后误差均值为零，即 &amp;lt;math&amp;gt;E[\varepsilon_i\mid t_i]=0&amp;lt;/math&amp;gt;，那么&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;E[H_i\mid t_i]=b+at_i.&amp;lt;/math&amp;gt;&lt;br /&gt;
这是一条关于&#039;&#039;&#039;平均响应&#039;&#039;&#039;的直线，不要求每次读数都在线上。数据拟合后得到的 &amp;lt;math&amp;gt;\hat h(t)=0.9+0.9t&amp;lt;/math&amp;gt; 则是这条未知平均直线的一次估计。模型中的真参数、由样本算出的估计值、下一次带随机误差的读数，是三个不同对象。[https://online.stat.psu.edu/stat501/Lesson01 Penn State STAT 501：Simple Linear Regression]&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-model-linear-fit-theme.svg|frame|center|alt=四个合成训练水位与拟合直线零点九加零点九倍时间，竖直残差表示观测与预测差，另两个空心点为留出数据|实心点确定拟合线，空心点用于后续检验。模型直线描述平均水位，观测点还包含误差。]]&lt;br /&gt;
&lt;br /&gt;
== “对参数线性”为什么允许弯曲 ==&lt;br /&gt;
把模型写成&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H_i=\beta_0\phi_0(t_i)+\cdots+\beta_{p-1}\phi_{p-1}(t_i)+\varepsilon_i,&amp;lt;/math&amp;gt;&lt;br /&gt;
其中 &amp;lt;math&amp;gt;\phi_j&amp;lt;/math&amp;gt; 是事先选择的已知函数，&amp;lt;math&amp;gt;\beta_j&amp;lt;/math&amp;gt; 是待估计的系数。每个系数只乘一个已知数，再相加，这就是这里的线性。&lt;br /&gt;
&lt;br /&gt;
例如 &amp;lt;math&amp;gt;\phi_0(t)=1,\phi_1(t)=t,\phi_2(t)=t^2&amp;lt;/math&amp;gt; 给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;E[H\mid t]=\beta_0+\beta_1t+\beta_2t^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
它可以是一条抛物线，却仍是线性参数模型。三种系数的单位分别是厘米、厘米／分钟、厘米／分钟平方；每项相加前具有同样的水位单位。若模型含 &amp;lt;math&amp;gt;e^{-\beta t}&amp;lt;/math&amp;gt;，未知参数进入指数，便不再是上述线性参数形式。对参数线性与对输入线性需要区分，NIST 的线性回归章节也采用这一约定。[https://www.itl.nist.gov/div898/handbook/pmd/section1/pmd141.htm NIST：Linear Least Squares Regression]&lt;br /&gt;
&lt;br /&gt;
这也解释了与线性代数用语的差别：&amp;lt;math&amp;gt;t\mapsto b+at&amp;lt;/math&amp;gt; 在 &amp;lt;math&amp;gt;b\ne0&amp;lt;/math&amp;gt; 时是仿射映射；把 &amp;lt;math&amp;gt;(b,a)&amp;lt;/math&amp;gt; 看作输入，而把全部预测看作输出时，这个参数到预测的映射是线性的。&lt;br /&gt;
&lt;br /&gt;
== 从一行观测组成设计矩阵 ==&lt;br /&gt;
每次观测写一行，每个模型项写一列。直线模型的设计矩阵为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X=\begin{pmatrix}1&amp;amp;0\\1&amp;amp;1\\1&amp;amp;2\\1&amp;amp;3\end{pmatrix},\quad&lt;br /&gt;
\beta=\begin{pmatrix}b\\a\end{pmatrix},\quad&lt;br /&gt;
H=X\beta+\varepsilon.&amp;lt;/math&amp;gt;&lt;br /&gt;
四行是四次观测，第一列的四个一让每次都含同一个截距。若加入平方项，只需另加列 &amp;lt;math&amp;gt;(0,1,4,9)^{\mathsf T}&amp;lt;/math&amp;gt;。矩阵尺寸为 &amp;lt;math&amp;gt;n\times p&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 是观测数，&amp;lt;math&amp;gt;p&amp;lt;/math&amp;gt; 是包括截距在内的参数数目。&lt;br /&gt;
&lt;br /&gt;
设计矩阵还告诉我们参数能否区分。若两列完全相同，改变一列的系数、反向改变另一列系数，预测不会变化。即使数据很多，也无法从这种设计中识别两个独立贡献。参数唯一可识别要求 &amp;lt;math&amp;gt;\operatorname{rank}X=p&amp;lt;/math&amp;gt;，即列满秩；问题在于独立信息，不只是行数多。&lt;br /&gt;
&lt;br /&gt;
== 最小二乘怎样估计这个模型 ==&lt;br /&gt;
模型选好之后，还要规定如何估计参数。普通[[最小二乘法]]选择&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\hat\beta=\mathop{\operatorname{arg\,min}}_\beta&lt;br /&gt;
\sum_{i=1}^{n}(h_i-(X\beta)_i)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
残差是观测减拟合值。令目标对每个系数的导数为零，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;X^{\mathsf T}X\hat\beta=X^{\mathsf T}h.&amp;lt;/math&amp;gt;&lt;br /&gt;
对当前数据，方程是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;4\hat b+6\hat a=9,\qquad6\hat b+14\hat a=18.&amp;lt;/math&amp;gt;&lt;br /&gt;
第二式减去第一式的 &amp;lt;math&amp;gt;3/2&amp;lt;/math&amp;gt; 倍，得到 &amp;lt;math&amp;gt;5\hat a=4.5&amp;lt;/math&amp;gt;，故 &amp;lt;math&amp;gt;\hat a=0.9&amp;lt;/math&amp;gt;；代回得到 &amp;lt;math&amp;gt;\hat b=0.9&amp;lt;/math&amp;gt;。这一步消去了两式中的 &amp;lt;math&amp;gt;6\hat b&amp;lt;/math&amp;gt;，只留下斜率。&lt;br /&gt;
&lt;br /&gt;
四个拟合值为 &amp;lt;math&amp;gt;0.9,1.8,2.7,3.6&amp;lt;/math&amp;gt;，残差为 &amp;lt;math&amp;gt;0.1,0.2,-0.7,0.4&amp;lt;/math&amp;gt;，平方和为 &amp;lt;math&amp;gt;0.7&amp;lt;/math&amp;gt; 平方厘米。目标的最小性、投影解释与稳定的 QR 解法见[[最小二乘法]]；实际计算通常不显式求逆矩阵。&lt;br /&gt;
&lt;br /&gt;
这一步只是一项确定的优化计算，还没有要求误差正态。把“能算出一条拟合线”进一步解释成“参数估计无偏”或“区间有指定覆盖率”，才需要下一节的统计假设。&lt;br /&gt;
&lt;br /&gt;
== 哪些假设支持哪些结论 ==&lt;br /&gt;
以下把整个设计矩阵 &amp;lt;math&amp;gt;X&amp;lt;/math&amp;gt; 固定下来，或者条件在给定的 &amp;lt;math&amp;gt;X&amp;lt;/math&amp;gt; 上。若真实平均响应为 &amp;lt;math&amp;gt;X\beta&amp;lt;/math&amp;gt;，并且 &amp;lt;math&amp;gt;E[\varepsilon\mid X]=0&amp;lt;/math&amp;gt;，列满秩时&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\hat\beta=\beta+(X^{\mathsf T}X)^{-1}X^{\mathsf T}\varepsilon.&amp;lt;/math&amp;gt;&lt;br /&gt;
这是把 &amp;lt;math&amp;gt;H=X\beta+\varepsilon&amp;lt;/math&amp;gt; 代入估计公式后直接得到的。取条件期望，第二项为零，所以 &amp;lt;math&amp;gt;E[\hat\beta\mid X]=\beta&amp;lt;/math&amp;gt;：重复按同一设计采样，估计量的平均值等于真参数。&lt;br /&gt;
&lt;br /&gt;
若还假设误差的条件协方差矩阵为 &amp;lt;math&amp;gt;\sigma^2I_n&amp;lt;/math&amp;gt;，即每次误差方差相同、不同误差互不相关，则&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\operatorname{Cov}(\hat\beta\mid X)&lt;br /&gt;
=\sigma^2(X^{\mathsf T}X)^{-1}.&amp;lt;/math&amp;gt;&lt;br /&gt;
原因是对矩阵 &amp;lt;math&amp;gt;A=(X^{\mathsf T}X)^{-1}X^{\mathsf T}&amp;lt;/math&amp;gt;，有 &amp;lt;math&amp;gt;\operatorname{Cov}(A\varepsilon)=A(\sigma^2I_n)A^{\mathsf T}&amp;lt;/math&amp;gt;；相乘后中间的 &amp;lt;math&amp;gt;X^{\mathsf T}X&amp;lt;/math&amp;gt; 抵消。&lt;br /&gt;
&lt;br /&gt;
互不相关比独立弱；上述两个矩的结论不需要正态性。若进一步假定误差独立且服从 &amp;lt;math&amp;gt;N(0,\sigma^2)&amp;lt;/math&amp;gt;，则能得到小样本下精确的 t 区间。若只满足零均值而方差不齐，点估计仍可能无偏，但刚才那条协方差公式要改变。漏掉一个与输入有关的系统性变化时，零均值假设本身也可能失败。&lt;br /&gt;
&lt;br /&gt;
在 &amp;lt;math&amp;gt;n&amp;gt;p&amp;lt;/math&amp;gt; 和上述同方差、互不相关条件下，常用&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;s^2=\frac{\sum_i r_i^2}{n-p}&amp;lt;/math&amp;gt;&lt;br /&gt;
估计误差方差。拟合用掉了 &amp;lt;math&amp;gt;p&amp;lt;/math&amp;gt; 个独立方向，残差所在的正交补只剩 &amp;lt;math&amp;gt;n-p&amp;lt;/math&amp;gt; 维；每个正交误差方向期望贡献 &amp;lt;math&amp;gt;\sigma^2&amp;lt;/math&amp;gt;，故残差平方和的期望为 &amp;lt;math&amp;gt;(n-p)\sigma^2&amp;lt;/math&amp;gt;。本例 &amp;lt;math&amp;gt;n=4,p=2&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;s^2=0.7/2=0.35&amp;lt;/math&amp;gt;。它与训练均方误差 &amp;lt;math&amp;gt;0.7/4&amp;lt;/math&amp;gt; 的用途不同。&lt;br /&gt;
&lt;br /&gt;
== 平均水位的区间与下一次读数的区间 ==&lt;br /&gt;
选择训练范围内的时刻 &amp;lt;math&amp;gt;t_0=2.5&amp;lt;/math&amp;gt; 分钟，拟合水位为 &amp;lt;math&amp;gt;\hat h_0=0.9+0.9\times2.5=3.15&amp;lt;/math&amp;gt; 厘米。先在独立正态、同方差且平均函数正确的模型下进行计算。&lt;br /&gt;
&lt;br /&gt;
对带截距的一元直线模型，令&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;q(t_0)=\frac1n+&lt;br /&gt;
\frac{(t_0-\bar t)^2}{\sum_i(t_i-\bar t)^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
它来自把预测 &amp;lt;math&amp;gt;(1,t_0)\hat\beta&amp;lt;/math&amp;gt; 代入上一节的系数协方差。当前 &amp;lt;math&amp;gt;\bar t=1.5&amp;lt;/math&amp;gt;、离差平方和为5，所以 &amp;lt;math&amp;gt;q(2.5)=1/4+1/5=0.45&amp;lt;/math&amp;gt;。平均响应估计的标准误为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\mathrm{SE}_{\mathrm{mean}}=s\sqrt{q(t_0)}&lt;br /&gt;
=\sqrt{0.35\times0.45}\approx0.3969\ \mathrm{cm}.&amp;lt;/math&amp;gt;&lt;br /&gt;
预测一个独立的新读数，还要加入该次新误差的方差 &amp;lt;math&amp;gt;\sigma^2&amp;lt;/math&amp;gt;，所以预测误差的估计标准差为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\mathrm{SE}_{\mathrm{pred}}=s\sqrt{1+q(t_0)}&lt;br /&gt;
=\sqrt{0.35\times1.45}\approx0.7124\ \mathrm{cm}.&amp;lt;/math&amp;gt;&lt;br /&gt;
平方根里多出的1，正是新观测本身的随机变化，而不是另一次参数拟合。&lt;br /&gt;
&lt;br /&gt;
为什么这里使用 t 分布？记真实平均响应为 &amp;lt;math&amp;gt;\mu_0=b+at_0&amp;lt;/math&amp;gt;。在上述正态模型下，拟合均值的标准化误差是标准正态变量；它与残差方差估计独立，且 &amp;lt;math&amp;gt;(n-p)s^2/\sigma^2&amp;lt;/math&amp;gt; 服从自由度为 &amp;lt;math&amp;gt;n-p&amp;lt;/math&amp;gt; 的卡方分布。因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{\hat h_0-\mu_0}{s\sqrt{q(t_0)}}\sim t_{n-p}.&amp;lt;/math&amp;gt;&lt;br /&gt;
独立的新误差再加进来时，分子方差变成 &amp;lt;math&amp;gt;\sigma^2[1+q(t_0)]&amp;lt;/math&amp;gt;，同样得到用于预测的 t 比值。这与[[学生t分布]]中“正态误差除以独立估计的标准差”的构造一致。&lt;br /&gt;
&lt;br /&gt;
自由度为 &amp;lt;math&amp;gt;n-p=2&amp;lt;/math&amp;gt;，双侧95%区间使用[[学生t分布]]分位数 &amp;lt;math&amp;gt;t_{0.975,2}\approx4.30265&amp;lt;/math&amp;gt;。分别乘上两个标准误：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\text{平均响应：}\quad3.15\pm4.30265\times0.3969,&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\text{新读数：}\quad3.15\pm4.30265\times0.7124.&amp;lt;/math&amp;gt;&lt;br /&gt;
用未舍入值计算，前者约为 &amp;lt;math&amp;gt;[1.4424,4.8576]&amp;lt;/math&amp;gt; 厘米，后者约为 &amp;lt;math&amp;gt;[0.0848,6.2152]&amp;lt;/math&amp;gt; 厘米。四次观测只剩两个残差自由度，区间很宽，这也体现了小样本能提供的信息有限。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-model-prediction-interval.svg|frame|center|alt=同在二点五分钟预测三点一五厘米，上方均值置信区间约一点四四二至四点八五八，下方新读数预测区间约零点零八五至六点二一五，后者更宽|两条区间的中心相同，估计对象不同。区间宽度均按未舍入的标准误和t分位数计算。]]&lt;br /&gt;
&lt;br /&gt;
两种95%都描述在所列模型下重复采样的覆盖率：一个覆盖固定时刻的真实平均响应，另一个覆盖该时刻新的随机读数。不是整条曲线同时具有95%的覆盖率，也不是所有未来读数必然落在区间内。预测区间的额外方差与覆盖解释见 [https://www.itl.nist.gov/div898/handbook/pmd/section5/pmd512.htm NIST：预测单次新响应]。&lt;br /&gt;
&lt;br /&gt;
== 残差怎样指出直线遗漏的结构 ==&lt;br /&gt;
另取一组明确构造的数据：&amp;lt;math&amp;gt;x=-3,-2,-1,0,1,2,3&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;y=x^2&amp;lt;/math&amp;gt;。这里没有随机噪声，目的是检查模型形状。若坚持拟合直线，由对称性 &amp;lt;math&amp;gt;\bar x=0&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\sum x_i y_i=\sum x_i^3=0&amp;lt;/math&amp;gt;，斜率为零；截距是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\bar y=\frac{9+4+1+0+1+4+9}{7}=4.&amp;lt;/math&amp;gt;&lt;br /&gt;
残差依次为 &amp;lt;math&amp;gt;5,0,-3,-4,-3,0,5&amp;lt;/math&amp;gt;。它们的和为零，却清楚地在两端偏正、中间偏负。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-model-residual-pattern.svg|frame|center|alt=上图七个点落在抛物线y等于x平方上，最佳直线是水平线y等于四；下图残差为五零负三负四负三零五，呈弯曲模式|残差总和为零是含截距最小二乘的代数性质，不能据此认定模型形状正确。上下图共用横轴位置。]]&lt;br /&gt;
&lt;br /&gt;
加入平方项后，系数 &amp;lt;math&amp;gt;(\beta_0,\beta_1,\beta_2)=(0,0,1)&amp;lt;/math&amp;gt; 恰好表示全部数据。这个例子同时说明：有系统形状的残差提示遗漏项；加入曲线项仍可能属于线性参数模型。真实样本有随机波动，选择更复杂模型还需要样本外验证，不能只因训练误差更小就不断加参数。[https://www.itl.nist.gov/div898/handbook/pmd/section4/pmd44.htm NIST：模型验证与残差分析]&lt;br /&gt;
&lt;br /&gt;
== 拟合优度、外推与解释 ==&lt;br /&gt;
含截距的普通最小二乘满足总离差平方和等于回归解释部分加残差平方和，因此可定义&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;R^2=1-\frac{\sum_i r_i^2}{\sum_i(h_i-\bar h)^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
分母非零时才有这个表达。本例分母为4.75，所以 &amp;lt;math&amp;gt;R^2=1-0.7/4.75=81/95\approx0.8526&amp;lt;/math&amp;gt;。它描述这组训练资料中的平方和比例，不是预测正确率，也不表示斜率具有因果含义。无截距拟合或样本外评价也不自动保有训练时 &amp;lt;math&amp;gt;0\le R^2\le1&amp;lt;/math&amp;gt; 的性质。&lt;br /&gt;
&lt;br /&gt;
从零到三分钟的资料推出二点五分钟，是在已有范围内估计；推到一百分钟则是外推，设备容量、进出水规律等都可能变化。此前留出的四、五分钟两点只能示范检验流程，不能保证更远的预测。若要把“时间增加一单位”解释成干预效果，还需控制混杂或说明实验设计，回归公式本身不给出因果保证。&lt;br /&gt;
&lt;br /&gt;
线性模型与[[差分方程模型]]也回答不同问题：前者可描述某时刻的平均响应与输入关系，后者明确规定状态怎样从一步更新到下一步。若把滞后状态用作回归输入，还必须处理时间依赖与误差条件，不能将独立样本公式直接照搬。&lt;br /&gt;
&lt;br /&gt;
== 参考资料与后续 ==&lt;br /&gt;
* [https://www.itl.nist.gov/div898/handbook/pmd/section1/pmd141.htm NIST/SEMATECH：Linear Least Squares Regression]，线性参数模型与形式。&lt;br /&gt;
* [https://online.stat.psu.edu/stat501/Lesson01 Penn State STAT 501，Lesson 1]，总体回归、误差条件、方差估计与拟合优度。&lt;br /&gt;
* [https://www.itl.nist.gov/div898/handbook/pmd/section5/pmd512.htm NIST：预测新响应及其不确定性]。&lt;br /&gt;
* [https://www.itl.nist.gov/div898/handbook/pmd/section4/pmd44.htm NIST：How can I tell if a model fits my data?]，残差与模型检验。&lt;br /&gt;
* [https://web.stanford.edu/~boyd/vmls/ Boyd、Vandenberghe：Introduction to Applied Linear Algebra]，设计矩阵、最小二乘与模型拟合。&lt;br /&gt;
* 先修：[[线性代数]]、[[最小二乘法]]、[[期望]]；后续：[[正态分布]]、[[学生t分布]]、[[统计推断]]。&lt;br /&gt;
[[分类:应用与建模]]&lt;br /&gt;
[[分类:概率与统计]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%8D%95%E9%A3%9F%E8%80%85-%E7%8C%8E%E7%89%A9%E6%A8%A1%E5%9E%8B&amp;diff=384</id>
		<title>捕食者-猎物模型</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%8D%95%E9%A3%9F%E8%80%85-%E7%8C%8E%E7%89%A9%E6%A8%A1%E5%9E%8B&amp;diff=384"/>
		<updated>2026-09-20T02:04:49Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;捕食者-猎物模型&#039;&#039;&#039;（predator–prey model）描述两种群因捕食关系而相互影响的数量变化。经典的&#039;&#039;&#039;洛特卡—沃尔泰拉模型&#039;&#039;&#039;（Lotka–Volterra model）用一对非线性[[微分方程]]表达这种关系：猎物为捕食者提供食物，捕食者又减少猎物数量。它给出了种群持续振荡的一种数学机制。&lt;br /&gt;
&lt;br /&gt;
== 猎物增加以后，捕食者会怎样变化 ==&lt;br /&gt;
设 &amp;lt;math&amp;gt;x(t)&amp;lt;/math&amp;gt; 是猎物数量，&amp;lt;math&amp;gt;y(t)&amp;lt;/math&amp;gt; 是捕食者数量，&amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 以月计。把数量视为连续量，相当于对个体的出生、死亡和捕食作平均描述。以下选取的参数、曲线与初值均为合成教学模型，不是某个生态系统的实测结果。&lt;br /&gt;
&lt;br /&gt;
先把相互作用暂时拿掉。假设没有捕食者时，猎物的每个个体具有固定净增长率 &amp;lt;math&amp;gt;a&amp;gt;0&amp;lt;/math&amp;gt;，因此 &amp;lt;math&amp;gt;x&#039;=ax&amp;lt;/math&amp;gt;；假设没有猎物时，捕食者以固定人均死亡率 &amp;lt;math&amp;gt;c&amp;gt;0&amp;lt;/math&amp;gt; 减少，因此 &amp;lt;math&amp;gt;y&#039;=-cy&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
现在加入捕食。若双方充分混合，单个捕食者遇到猎物的频率与猎物数量成正比，所有捕食者合计的捕获量就与乘积 &amp;lt;math&amp;gt;xy&amp;lt;/math&amp;gt; 成正比。于是猎物损失率写成 &amp;lt;math&amp;gt;bxy&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;b&amp;gt;0&amp;lt;/math&amp;gt;。再假定由捕食支持的捕食者增长与捕获量成正比，记相应系数为 &amp;lt;math&amp;gt;d&amp;gt;0&amp;lt;/math&amp;gt;，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
\frac{dx}{dt}&amp;amp;=ax-bxy=x(a-by),\\&lt;br /&gt;
\frac{dy}{dt}&amp;amp;=dxy-cy=y(dx-c).&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
若两种群都以个体数计，&amp;lt;math&amp;gt;a,c&amp;lt;/math&amp;gt; 的单位为每月，&amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 为每捕食者每月，&amp;lt;math&amp;gt;d&amp;lt;/math&amp;gt; 为每猎物每月。这样 &amp;lt;math&amp;gt;by&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;dx&amp;lt;/math&amp;gt; 都是人均变化率，每一行右边的单位与左边一致。两种群的个体尺度不同，&amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;d&amp;lt;/math&amp;gt; 无须相同；比值 &amp;lt;math&amp;gt;d/b&amp;lt;/math&amp;gt; 表示模型中的转化关系，而不是“一只猎物必定变成一只捕食者”。&lt;br /&gt;
&lt;br /&gt;
这组方程还假定参数不随季节改变，没有迁入迁出，猎物的资源没有在方程中设置上限，捕食也没有因捕食者吃饱而饱和。它描述的是这些假设共同形成的系统。[https://www.math.hkust.edu.hk/~machas/mathematical-biology.pdf Jeffrey R. Chasnov，《Mathematical Biology》§1.4，印刷页7–13]从种群增长、损失和接触项建立了同类方程。&lt;br /&gt;
&lt;br /&gt;
== 先算出一个瞬时状态 ==&lt;br /&gt;
取一组具体参数：&amp;lt;math&amp;gt;a=c=0.5&amp;lt;/math&amp;gt; 每月，&amp;lt;math&amp;gt;b=0.01&amp;lt;/math&amp;gt; 每捕食者每月，&amp;lt;math&amp;gt;d=0.005&amp;lt;/math&amp;gt; 每猎物每月。初始时有200只猎物、50只捕食者，即 &amp;lt;math&amp;gt;x(0)=200,y(0)=50&amp;lt;/math&amp;gt;。代入得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x&#039;(0)=0.5\times200-0.01\times200\times50=0,&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;y&#039;(0)=0.005\times200\times50-0.5\times50=25.&amp;lt;/math&amp;gt;&lt;br /&gt;
猎物当前净增长为零，捕食者却正以每月25只的瞬时速率增加。捕食者一旦超过50，猎物的人均净增长率 &amp;lt;math&amp;gt;0.5-0.01y&amp;lt;/math&amp;gt; 就变成负数，于是猎物开始下降。&lt;br /&gt;
&lt;br /&gt;
这里的25是此刻的导数，不能直接断言一个月后捕食者恰好增加25只，因为随后猎物和捕食者都在变。要得到一段时间后的数量，需要把相互影响连续积累起来。&lt;br /&gt;
&lt;br /&gt;
方程也保留了非负性。例如在正解存在期间，第一式可以写成&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x(t)=x(0)\exp\left(\int_0^t[a-by(s)]\,ds\right)&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
第二式有相同形式。若某种群初始为零，相应坐标轴上的解始终为零；模型不包含从零凭空产生该种群的机制。正初值能否长期存在且保持有界，将由后面的守恒量说明。&lt;br /&gt;
&lt;br /&gt;
== 用零增长线读出四种变化方向 ==&lt;br /&gt;
平衡要求两个变化率同时为零。原点 &amp;lt;math&amp;gt;(0,0)&amp;lt;/math&amp;gt; 是一个平衡；对正种群，必须同时满足 &amp;lt;math&amp;gt;a-by=0&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;dx-c=0&amp;lt;/math&amp;gt;，因此共存平衡为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_*=\frac cd,\qquad y_*=\frac ab.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例得到 &amp;lt;math&amp;gt;x_*=100,y_*=50&amp;lt;/math&amp;gt;。为便于比较，令 &amp;lt;math&amp;gt;u=x/100&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;v=y/50&amp;lt;/math&amp;gt;，即把各自平衡数量当作单位；再令无量纲时间 &amp;lt;math&amp;gt;\tau=0.5t&amp;lt;/math&amp;gt;。例如 &amp;lt;math&amp;gt;u=2&amp;lt;/math&amp;gt; 表示200只猎物，&amp;lt;math&amp;gt;v=2&amp;lt;/math&amp;gt; 表示100只捕食者。&lt;br /&gt;
&lt;br /&gt;
由链式法则 &amp;lt;math&amp;gt;dx/dt=50\,du/d\tau&amp;lt;/math&amp;gt;，代入第一式；第二式同理，便得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{du}{d\tau}=u(1-v),\qquad \frac{dv}{d\tau}=v(u-1),\qquad (u(0),v(0))=(2,1).&amp;lt;/math&amp;gt;&lt;br /&gt;
以下图中的撇号均指对 &amp;lt;math&amp;gt;\tau&amp;lt;/math&amp;gt; 求导。在正象限内，&amp;lt;math&amp;gt;u&amp;gt;0,v&amp;gt;0&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;u&#039;&amp;lt;/math&amp;gt; 的正负只由 &amp;lt;math&amp;gt;1-v&amp;lt;/math&amp;gt; 决定，&amp;lt;math&amp;gt;v&#039;&amp;lt;/math&amp;gt; 的正负只由 &amp;lt;math&amp;gt;u-1&amp;lt;/math&amp;gt; 决定。&lt;br /&gt;
&lt;br /&gt;
水平线 &amp;lt;math&amp;gt;v=1&amp;lt;/math&amp;gt; 是猎物的&#039;&#039;&#039;零增长线&#039;&#039;&#039;，竖直线 &amp;lt;math&amp;gt;u=1&amp;lt;/math&amp;gt; 是捕食者的零增长线。站在一条零增长线上，只有对应的一种群瞬时不变；两线交点 &amp;lt;math&amp;gt;(1,1)&amp;lt;/math&amp;gt; 才是双方同时不变的状态。坐标轴也是原方程的零增长集合的一部分，下图着重画正象限内的两条线。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-predator-nullclines.svg|frame|center|alt=正象限由u等于一和v等于一分成四区，右下两种群都增长，右上猎物减少捕食者增长，左上都减少，左下猎物增长捕食者减少|箭头表示相图中的变化方向，长度经过统一处理，不代表实际变化速率大小。]]&lt;br /&gt;
&lt;br /&gt;
从右侧的初值 &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt; 出发，轨迹先向上进入右上区，猎物下降而捕食者增加；越过 &amp;lt;math&amp;gt;u=1&amp;lt;/math&amp;gt; 后，捕食者也开始下降；再越过 &amp;lt;math&amp;gt;v=1&amp;lt;/math&amp;gt;，猎物转而增加。沿四个区域追踪，得到逆时针转动的趋势。不过，方向图尚未说明它究竟闭合、向内收缩，还是向外展开。&lt;br /&gt;
&lt;br /&gt;
== 沿轨迹保持不变的量 ==&lt;br /&gt;
要分清上述三种可能，需要寻找约束轨迹的关系。观察方程，猎物变化含有 &amp;lt;math&amp;gt;1-v&amp;lt;/math&amp;gt;，捕食者变化含有 &amp;lt;math&amp;gt;u-1&amp;lt;/math&amp;gt;。选择&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H(u,v)=u-\log u+v-\log v-2,\qquad u&amp;gt;0,\ v&amp;gt;0,&amp;lt;/math&amp;gt;&lt;br /&gt;
它的两个偏导数分别是 &amp;lt;math&amp;gt;1-1/u&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;1-1/v&amp;lt;/math&amp;gt;，与方程里的 &amp;lt;math&amp;gt;u,v&amp;lt;/math&amp;gt; 因子相乘时正好约去分母。利用链式法则逐步计算：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
\frac{dH}{d\tau}&lt;br /&gt;
&amp;amp;=\left(1-\frac1u\right)u&#039;&lt;br /&gt;
 +\left(1-\frac1v\right)v&#039;\\&lt;br /&gt;
&amp;amp;=(u-1)(1-v)+(v-1)(u-1)\\&lt;br /&gt;
&amp;amp;=(u-1)\bigl[(1-v)+(v-1)\bigr]=0.&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
因此 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 沿每一条正轨迹保持常数，称为&#039;&#039;&#039;第一积分&#039;&#039;&#039;或守恒量。它是模型中某个组合保持不变，并不是两种群总数量不变；事实上 &amp;lt;math&amp;gt;(u+v)&#039;=u-v&amp;lt;/math&amp;gt;，一般不等于零。&lt;br /&gt;
&lt;br /&gt;
若想看这个表达式怎样被找到，在 &amp;lt;math&amp;gt;u&#039;\ne0&amp;lt;/math&amp;gt; 的一段轨迹上，可以消去时间：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{dv}{du}=\frac{v(u-1)}{u(1-v)}.&amp;lt;/math&amp;gt;&lt;br /&gt;
分离变量为 &amp;lt;math&amp;gt;(1/v-1)\,dv=(1-1/u)\,du&amp;lt;/math&amp;gt;。分别积分，得到 &amp;lt;math&amp;gt;\log v-v=u-\log u+C&amp;lt;/math&amp;gt;，整理就是 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 为常数。消去时间时暂时排除了 &amp;lt;math&amp;gt;v=1&amp;lt;/math&amp;gt; 上的点，而刚才直接求导的验证在整个正象限都成立，补上了这些点。&lt;br /&gt;
&lt;br /&gt;
初值 &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt; 确定&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H_0=2-\log2+1-0-2=1-\log2\approx0.3068528194.&amp;lt;/math&amp;gt;&lt;br /&gt;
以后轨迹只能在这条等值线上运动。相同守恒结构也见[https://cmp.phys.ufl.edu/PHZ4710/files/unit5/Lotka-Volterra.html 佛罗里达大学 PHZ4710 课程，Closed orbits and oscillations]；[https://www.math.ucdavis.edu/~hunter/m207a/final_sol_207A.pdf 加州大学戴维斯分校 Math 207A，2014年期末解答第2题]用消去时间的方法分析了这一系统。&lt;br /&gt;
&lt;br /&gt;
== 为什么确实是闭轨道，而不是螺旋 ==&lt;br /&gt;
令 &amp;lt;math&amp;gt;\phi(s)=s-\log s-1&amp;lt;/math&amp;gt;。有 &amp;lt;math&amp;gt;\phi&#039;(s)=1-1/s&amp;lt;/math&amp;gt;：在 &amp;lt;math&amp;gt;0&amp;lt;s&amp;lt;1&amp;lt;/math&amp;gt; 上为负，在 &amp;lt;math&amp;gt;s&amp;gt;1&amp;lt;/math&amp;gt; 上为正。因此 &amp;lt;math&amp;gt;\phi&amp;lt;/math&amp;gt; 在1取得唯一最小值0，而且当 &amp;lt;math&amp;gt;s\to0^+&amp;lt;/math&amp;gt; 或 &amp;lt;math&amp;gt;s\to\infty&amp;lt;/math&amp;gt; 时都趋向无穷。守恒量正是 &amp;lt;math&amp;gt;H=\phi(u)+\phi(v)&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
由此先得到有界性：固定有限的 &amp;lt;math&amp;gt;H_0&amp;lt;/math&amp;gt; 时，两个坐标都不能趋向零或无穷，否则某个非负项 &amp;lt;math&amp;gt;\phi&amp;lt;/math&amp;gt; 将超过 &amp;lt;math&amp;gt;H_0&amp;lt;/math&amp;gt;。轨迹被限制在正象限内部的一个闭有界区域里，既不碰到坐标轴，也不在有限时间发散，所以解能继续延伸。&lt;br /&gt;
&lt;br /&gt;
再看等值线的形状。&amp;lt;math&amp;gt;\phi&#039;&#039;(s)=1/s^2&amp;gt;0&amp;lt;/math&amp;gt;，因此从 &amp;lt;math&amp;gt;(1,1)&amp;lt;/math&amp;gt; 沿任何直线方向向外走，&amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 从0严格增加，直到趋向无穷。每条射线与 &amp;lt;math&amp;gt;H=H_0&amp;gt;0&amp;lt;/math&amp;gt; 恰交一次，组成包围中心的闭合曲线。除中心外，&amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 的梯度不为零，等值线光滑；向量场也没有其他正平衡点，所以沿这条曲线的速度处处非零。闭合曲线是紧的，速度大小有正的下界，绕行一周所需时间有限，因而轨迹周期性回到出发状态。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-predator-phase.svg|frame|center|alt=三条不同守恒值的闭轨道围绕一一平衡点，外侧主轨道从A二一依次逆时针经过B一二、C零点四零六四一和D一零点四零六四|实线是初值(2,1)的轨道；两条虚线分别从(1.2,1)和(1.5,1)出发。不同初值确定不同的守恒值。]]&lt;br /&gt;
&lt;br /&gt;
这也解释了稳定性的准确含义。共存平衡 &amp;lt;math&amp;gt;(1,1)&amp;lt;/math&amp;gt; 是 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 的严格最小点，足够小的守恒值把轨迹限制在足够小的邻域内，因此它是&#039;&#039;&#039;稳定&#039;&#039;&#039;的。更具体地，围绕中心取一条小圆，其上 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 有正的最小值；若初值的 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 更小，就不可能越过这条圆。&lt;br /&gt;
&lt;br /&gt;
但它&#039;&#039;&#039;不是渐近稳定&#039;&#039;&#039;的。非平衡初值的 &amp;lt;math&amp;gt;H_0&amp;gt;0&amp;lt;/math&amp;gt; 始终不变，若轨迹趋向中心，就应有 &amp;lt;math&amp;gt;H\to0&amp;lt;/math&amp;gt;，与守恒矛盾。一次扰动通常会把系统送到另一条闭轨道，而不是使它回到原来的轨道。这里存在一整族闭轨道，也就不是一条孤立并吸引邻近轨迹的极限环。常说的“中性振荡”指的正是这种不向中心衰减的行为。&lt;br /&gt;
&lt;br /&gt;
原点的情况不同。没有捕食者而引入少量猎物时，&amp;lt;math&amp;gt;x&#039;=ax&amp;lt;/math&amp;gt; 会让它远离原点；从线性化看，原点的两个特征值为 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;-c&amp;lt;/math&amp;gt;，在整个平面中是鞍点，在生物学使用的非负区域内也不稳定。&lt;br /&gt;
&lt;br /&gt;
== 同一条轨道上的数量极值与时间 ==&lt;br /&gt;
主轨道上的A点为 &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt;。这里 &amp;lt;math&amp;gt;u&#039;=0&amp;lt;/math&amp;gt;，且轨迹从 &amp;lt;math&amp;gt;v&amp;lt;1&amp;lt;/math&amp;gt; 一侧进入 &amp;lt;math&amp;gt;v&amp;gt;1&amp;lt;/math&amp;gt; 一侧，猎物由增加转为减少，所以A是猎物最大值。捕食者的最大值发生在B点：轨迹从 &amp;lt;math&amp;gt;u&amp;gt;1&amp;lt;/math&amp;gt; 进入 &amp;lt;math&amp;gt;u&amp;lt;1&amp;lt;/math&amp;gt;，故 &amp;lt;math&amp;gt;v&#039;&amp;lt;/math&amp;gt; 从正变负。&lt;br /&gt;
&lt;br /&gt;
在B处 &amp;lt;math&amp;gt;u=1&amp;lt;/math&amp;gt;，守恒式化为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;v-\log v-1=1-\log2.&amp;lt;/math&amp;gt;&lt;br /&gt;
其中大于1的解是 &amp;lt;math&amp;gt;v=2&amp;lt;/math&amp;gt;，所以B恰为 &amp;lt;math&amp;gt;(1,2)&amp;lt;/math&amp;gt;。小于1的另一个解记为 &amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt;，满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;q-\log q=2-\log2,\qquad q\approx0.4063757400.&amp;lt;/math&amp;gt;&lt;br /&gt;
由 &amp;lt;math&amp;gt;\phi&amp;lt;/math&amp;gt; 在0到1严格递减、从无穷降到0，可知小根唯一，可以用[[二分法]]求出。例如代入0.4063与0.4065，会把目标值夹在两边，再逐次缩小区间。由于本例的 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt; 对 &amp;lt;math&amp;gt;u,v&amp;lt;/math&amp;gt; 对称，C为 &amp;lt;math&amp;gt;(q,1)&amp;lt;/math&amp;gt;，D为 &amp;lt;math&amp;gt;(1,q)&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
换回原数量，猎物在约40.638与200之间振荡，捕食者在约20.319与100之间振荡。它们的最大值都等于各自平衡数量的两倍，但并不同时发生；本例这种相同倍数来自特定参数和初值，不是所有捕食模型都具有的关系。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-predator-time.svg|frame|center|alt=同一闭轨道的猎物比例实线和捕食者比例虚线随无量纲时间周期起伏，A为猎物最大值，之后B为捕食者最大值，C为猎物最小值，D为捕食者最小值|相图上的一圈，展开成时间轴上的一周期。纵轴为各自平衡数量的倍数，不能直接把两条线的高度当作原始个体数比较。]]&lt;br /&gt;
&lt;br /&gt;
对该初值进行数值积分，可得以下事件。表中的 &amp;lt;math&amp;gt;\tau&amp;lt;/math&amp;gt; 是无量纲时间，实际月份为 &amp;lt;math&amp;gt;t=2\tau&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;捕食者猎物主轨道的四个极值及返回时间&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 事件 !! &amp;lt;math&amp;gt;\tau&amp;lt;/math&amp;gt;（约） !! &amp;lt;math&amp;gt;(u,v)&amp;lt;/math&amp;gt; !! 含义&lt;br /&gt;
|-&lt;br /&gt;
| A || 0 || &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt; || 猎物最大，捕食者仍在增加&lt;br /&gt;
|-&lt;br /&gt;
| B || 1.146456 || &amp;lt;math&amp;gt;(1,2)&amp;lt;/math&amp;gt; || 捕食者最大，猎物仍在减少&lt;br /&gt;
|-&lt;br /&gt;
| C || 2.763557 || &amp;lt;math&amp;gt;(q,1)&amp;lt;/math&amp;gt; || 猎物最小，捕食者仍在减少&lt;br /&gt;
|-&lt;br /&gt;
| D || 4.991381 || &amp;lt;math&amp;gt;(1,q)&amp;lt;/math&amp;gt; || 捕食者最小，猎物仍在增加&lt;br /&gt;
|-&lt;br /&gt;
| 返回A || 6.608483 || &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt; || 完成一周期&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
所以周期约为13.216965个月，捕食者高峰比猎物高峰晚约2.292912个月。四个阶段用时不相等，不能因为相图大致围成一圈，就把它们当作等长的四分之一周期。&lt;br /&gt;
&lt;br /&gt;
在平衡很近的地方，令 &amp;lt;math&amp;gt;u=1+\xi,v=1+\eta&amp;lt;/math&amp;gt;。代入得 &amp;lt;math&amp;gt;\xi&#039;=-\eta-\xi\eta&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\eta&#039;=\xi+\xi\eta&amp;lt;/math&amp;gt;。忽略二次小量 &amp;lt;math&amp;gt;\xi\eta&amp;lt;/math&amp;gt; 后，&amp;lt;math&amp;gt;\xi&#039;=-\eta&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\eta&#039;=\xi&amp;lt;/math&amp;gt;，再求导得到 &amp;lt;math&amp;gt;\xi&#039;&#039;=-\xi&amp;lt;/math&amp;gt;。这个线性近似的无量纲周期是 &amp;lt;math&amp;gt;2\pi&amp;lt;/math&amp;gt;，在本例为约12.566个月。它与幅度较大的主轨道周期13.217个月不同。一般参数的平衡附近小振幅周期为 &amp;lt;math&amp;gt;2\pi/\sqrt{ac}&amp;lt;/math&amp;gt;，不能把这个线性化结果当作所有振幅的精确周期；闭轨道的存在由前面的非线性守恒论证保证。&lt;br /&gt;
&lt;br /&gt;
== 数值算法为什么可能画出向外螺旋 ==&lt;br /&gt;
最直接的时间推进是显式欧拉法。选无量纲步长 &amp;lt;math&amp;gt;h&amp;gt;0&amp;lt;/math&amp;gt;，在同一个旧状态 &amp;lt;math&amp;gt;(u_n,v_n)&amp;lt;/math&amp;gt; 上计算两个变化率：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
u_{n+1}&amp;amp;=u_n+h\,u_n(1-v_n),\\&lt;br /&gt;
v_{n+1}&amp;amp;=v_n+h\,v_n(u_n-1).&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
例如 &amp;lt;math&amp;gt;h=0.1&amp;lt;/math&amp;gt;，从 &amp;lt;math&amp;gt;(2,1)&amp;lt;/math&amp;gt; 出发，第一步为 &amp;lt;math&amp;gt;(2,1.1)&amp;lt;/math&amp;gt;；第二步为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;u_2=2+0.1\times2(1-1.1)=1.98,\qquad v_2=1.1+0.1\times1.1(2-1)=1.21.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里两个更新都使用第一步的旧值。若先算出新的 &amp;lt;math&amp;gt;u&amp;lt;/math&amp;gt; 再带入同一步的 &amp;lt;math&amp;gt;v&amp;lt;/math&amp;gt;，就已经换了算法。&lt;br /&gt;
&lt;br /&gt;
第一步欧拉值虽然接近真解，却已改变守恒量：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H(2,1.1)-H(2,1)=0.1-\log1.1\approx0.00468982&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
这种偏离会逐步积累。事实上，令 &amp;lt;math&amp;gt;A=h(1-v_n)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;B=h(u_n-1)&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;u_{n+1}=u_n(1+A)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;v_{n+1}=v_n(1+B)&amp;lt;/math&amp;gt;。在下一步两个坐标仍为正时，直接相减得&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
H_{n+1}-H_n&lt;br /&gt;
&amp;amp;=u_nA+v_nB-\log(1+A)-\log(1+B)\\&lt;br /&gt;
&amp;amp;=A+B-\log(1+A)-\log(1+B).&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
第二行用了 &amp;lt;math&amp;gt;u_nA+v_nB=h(u_n-v_n)=A+B&amp;lt;/math&amp;gt;。对于 &amp;lt;math&amp;gt;s&amp;gt;-1&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;\log(1+s)\le s&amp;lt;/math&amp;gt;，等号只在 &amp;lt;math&amp;gt;s=0&amp;lt;/math&amp;gt; 成立。因此正象限里的每个非平衡欧拉步都会增大 &amp;lt;math&amp;gt;H&amp;lt;/math&amp;gt;，把数值状态推向更外侧的等值线。向外螺旋来自算法的误差，不是原连续模型的种群振幅逐渐增大。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-predator-numerics.svg|frame|center|alt=上图比较闭合真轨道与步长零点一欧拉法产生的向外螺旋，下图显示三个步长的守恒量误差随时间增长且较小步长漂移较小|上图积分至无量纲时间20；下图用同一初值比较h为0.1、0.05、0.025。理论守恒量误差应为零。]]&lt;br /&gt;
&lt;br /&gt;
在 &amp;lt;math&amp;gt;\tau=20&amp;lt;/math&amp;gt;，这三个步长的 &amp;lt;math&amp;gt;H-H_0&amp;lt;/math&amp;gt; 分别约为1.605442、0.467689和0.188184。这里展示的是固定算法在有限区间里的计算结果，减半步长并未使它自动成为保持守恒量的方法。步长更大时，还可能因 &amp;lt;math&amp;gt;1+h(1-v_n)\le0&amp;lt;/math&amp;gt; 或 &amp;lt;math&amp;gt;1+h(u_n-1)\le0&amp;lt;/math&amp;gt; 而生成零或负数量。&lt;br /&gt;
&lt;br /&gt;
平衡附近还有一个更简短的解释。线性化的欧拉更新为 &amp;lt;math&amp;gt;\xi_{n+1}=\xi_n-h\eta_n&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\eta_{n+1}=\eta_n+h\xi_n&amp;lt;/math&amp;gt;。平方相加，中间的交叉项抵消，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\xi_{n+1}^2+\eta_{n+1}^2=(1+h^2)(\xi_n^2+\eta_n^2).&amp;lt;/math&amp;gt;&lt;br /&gt;
任何正步长都令这个线性近似的振幅逐步放大。它与“步长趋于零时，在固定有限时间内可以收敛到真解”并不矛盾：固定步长看无限长时间，与固定时间缩小步长，是不同的极限。相应数值稳定性分析见[https://tobydriscoll.net/fnc-julia/diffusion/absstab-diffusion.html Driscoll 与 Braun，§11.3，例11.3.7]。&lt;br /&gt;
&lt;br /&gt;
本文用于主轨道和时间图的参考计算采用高阶自适应积分，并另用固定小步长四阶Runge–Kutta法对照。检查包括减小步长、守恒量偏差和返回时间的一致性。守恒值接近只能说明轨道层面误差较小，仍需检查沿轨道的时间位置；一个计算点可以落在正确等值线上，却提前或滞后到达。&lt;br /&gt;
&lt;br /&gt;
== 参数改变与真实生态系统 ==&lt;br /&gt;
前面的归一化不限于这组参数。对任意 &amp;lt;math&amp;gt;a,b,c,d&amp;gt;0&amp;lt;/math&amp;gt;，取 &amp;lt;math&amp;gt;u=x/(c/d)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;v=y/(a/b)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\tau=at&amp;lt;/math&amp;gt;，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;u&#039;=u(1-v),\qquad v&#039;=\rho v(u-1),\qquad \rho=\frac ca&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
此时守恒量变为 &amp;lt;math&amp;gt;H_\rho=\rho\phi(u)+\phi(v)&amp;lt;/math&amp;gt;。求导后仍有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;H_\rho&#039;=\rho(u-1)(1-v)+\rho(v-1)(u-1)=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
两个权重都正，所以前面的正性、有界性和闭轨道论证仍成立；轨道形状、不同阶段的用时则会随参数比和初值改变。&lt;br /&gt;
&lt;br /&gt;
若观测中出现振幅衰减、长期漂移或灭绝，就需要检查模型假设。猎物的资源约束可以通过[[洛吉斯蒂模型]]中的 &amp;lt;math&amp;gt;ax(1-x/K)&amp;lt;/math&amp;gt; 引入；捕食饱和、季节变化、年龄结构和随机个体事件也会改变方程。添加这些机制后，原有守恒量通常不再守恒，因而不应把经典模型的闭轨道结论直接套用。&lt;br /&gt;
&lt;br /&gt;
经典方程的正解不会在有限时间到达零，却不代表很小的真实种群能够避免随机灭绝。拟合到两条起伏曲线，也不足以证明起伏只由捕食关系造成：食物、气候、迁移和观测方式都可能影响数据。相图首先帮助解释给定方程的机制，生态解释还需要独立观测与参数检验。&lt;br /&gt;
&lt;br /&gt;
== 历史与进一步阅读 ==&lt;br /&gt;
阿尔弗雷德·洛特卡在1920年的论文《Analytical Note on Certain Rhythmic Relations in Organic Systems》中研究了生物系统的持续振荡，并在1925年《Elements of Physical Biology》中扩展相关分析。维托·沃尔泰拉独立研究了捕食关系，于1926年发表《Fluctuations in the Abundance of a Species Considered Mathematically》。这些具体发表脉络可见[https://pmc.ncbi.nlm.nih.gov/articles/PMC4534218/ 科学史学者 Sharon Kingsland 在 PNAS 发表的研究回顾]及[https://jxshix.people.wm.edu/2009-harbin-course/classic/Lotka-1920-PNAS.pdf 洛特卡1920年论文原文]。&lt;br /&gt;
&lt;br /&gt;
* Jeffrey R. Chasnov：[https://www.math.hkust.edu.hk/~machas/mathematical-biology.pdf Mathematical Biology]，§1.4，模型建立、平衡和无量纲化。&lt;br /&gt;
* BingKan Xue：[https://cmp.phys.ufl.edu/PHZ4710/files/unit5/Lotka-Volterra.html PHZ4710: Lotka-Volterra System]，Closed orbits and oscillations、Limit Cycle两节，守恒量与修改模型后的差别。&lt;br /&gt;
* John K. Hunter：[https://www.math.ucdavis.edu/~hunter/m207a/final_sol_207A.pdf Math 207A, Fall 2014, Final Solutions]，第2题，印刷页2–3，相轨道的隐式方程。&lt;br /&gt;
* Toby A. Driscoll、Richard J. Braun：[https://tobydriscoll.net/fnc-julia/diffusion/absstab-diffusion.html Fundamentals of Numerical Computation，§11.3]，振荡系统的欧拉法稳定性。&lt;br /&gt;
* Alfred J. Lotka：上引1920年原文，&#039;&#039;PNAS&#039;&#039; 6(7):410–415，DOI：10.1073/pnas.6.7.410。&lt;br /&gt;
* Sharon Kingsland：[https://pmc.ncbi.nlm.nih.gov/articles/PMC4534218/ Alfred J. Lotka and the origins of theoretical population ecology]，&#039;&#039;PNAS&#039;&#039; 112(31):9493–9495（2015），DOI：10.1073/pnas.1512317112。&lt;br /&gt;
&lt;br /&gt;
[[分类:微分方程与动力系统]]&lt;br /&gt;
[[分类:应用与建模]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E5%B7%AE%E5%88%86%E6%96%B9%E7%A8%8B%E6%A8%A1%E5%9E%8B&amp;diff=383</id>
		<title>差分方程模型</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E5%B7%AE%E5%88%86%E6%96%B9%E7%A8%8B%E6%A8%A1%E5%9E%8B&amp;diff=383"/>
		<updated>2026-09-20T02:04:44Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;差分方程模型&#039;&#039;&#039;（difference equation model）用离散时刻之间的更新关系描述变化。它的解是一串状态 &amp;lt;math&amp;gt;x_0,x_1,x_2,\ldots&amp;lt;/math&amp;gt;：已知起始状态和每一步的规则，就可以逐步计算以后会怎样。月份、生产批次、繁殖季都可以成为步数；状态本身仍可以是实数，并不因为时间离散就必须取整数。&lt;br /&gt;
&lt;br /&gt;
== 每月留下八成，再补入二十升 ==&lt;br /&gt;
考虑一个教学用调蓄水箱。每个月先放出当前水量的20%，再补入20 L水，随后记录一次水量。假定放水比例与补入量固定，没有其他进出水，水箱容量足够。以下参数和数据都是按这一假设构造的，未取自实际水箱的测量。&lt;br /&gt;
&lt;br /&gt;
令 &amp;lt;math&amp;gt;x_n&amp;lt;/math&amp;gt; 表示第 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 次记录的水量，单位为L；&amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 是从0开始的整数，每增加1代表经过一个月。初始记录为 &amp;lt;math&amp;gt;x_0=20&amp;lt;/math&amp;gt;。下一次先剩下 &amp;lt;math&amp;gt;0.8x_n&amp;lt;/math&amp;gt;，再加20，故&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_{n+1}=0.8x_n+20,\qquad x_0=20.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里的0.8是无量纲保留比例，20是每一步补入的水量。前几步可直接手算：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&lt;br /&gt;
x_1&amp;amp;=0.8\times20+20=36,\\&lt;br /&gt;
x_2&amp;amp;=0.8\times36+20=48.8,\\&lt;br /&gt;
x_3&amp;amp;=0.8\times48.8+20=59.04.&lt;br /&gt;
\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
增加量依次是16、12.8、10.24 L，逐次变小。虽然每月都补水，也不意味着水量无界增加，因为原有水量越大，同一比例放出的水也越多。&lt;br /&gt;
&lt;br /&gt;
先放水后补水的顺序已经写入方程。若改成先补20 L再放出总水量的20%，规则就变为 &amp;lt;math&amp;gt;x_{n+1}=0.8(x_n+20)=0.8x_n+16&amp;lt;/math&amp;gt;。括号的位置对应不同的操作，不能省略为同一个模型。&lt;br /&gt;
&lt;br /&gt;
== 下一步不变的水量，以及怎样得到全部状态 ==&lt;br /&gt;
如果水量已经达到某个值 &amp;lt;math&amp;gt;x_*&amp;lt;/math&amp;gt;，下个月仍然等于它，那么&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_*=0.8x_*+20.&amp;lt;/math&amp;gt;&lt;br /&gt;
把 &amp;lt;math&amp;gt;0.8x_*&amp;lt;/math&amp;gt; 移到左边得到 &amp;lt;math&amp;gt;0.2x_*=20&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;x_*=100&amp;lt;/math&amp;gt; L。这是&#039;&#039;&#039;平衡点&#039;&#039;&#039;，也称更新[[函数]]的不动点：在100 L时，每月恰好放出20 L，又补入20 L。&lt;br /&gt;
&lt;br /&gt;
仅仅求得平衡点，还没有证明从20 L出发会趋向它。为追踪差距，把原递推减去平衡关系：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_{n+1}-100=0.8x_n+20-100=0.8(x_n-100).&amp;lt;/math&amp;gt;&lt;br /&gt;
令 &amp;lt;math&amp;gt;e_n=x_n-100&amp;lt;/math&amp;gt; 表示带正负号的偏差，则 &amp;lt;math&amp;gt;e_{n+1}=0.8e_n&amp;lt;/math&amp;gt;。连续应用这一等式，得到 &amp;lt;math&amp;gt;e_1=0.8e_0&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;e_2=0.8^2e_0&amp;lt;/math&amp;gt;，一般地&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;e_n=0.8^n e_0,\qquad x_n=100+(x_0-100)0.8^n.&amp;lt;/math&amp;gt;&lt;br /&gt;
代入 &amp;lt;math&amp;gt;x_0=20&amp;lt;/math&amp;gt;，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_n=100-80(0.8)^n.&amp;lt;/math&amp;gt;&lt;br /&gt;
这个公式满足初值；把它代入更新式，右边变成 &amp;lt;math&amp;gt;100-80(0.8)^{n+1}&amp;lt;/math&amp;gt;，也正是下一项。因此它给出了整条解，而不只是前几个月的拟合曲线。&lt;br /&gt;
&lt;br /&gt;
由于 &amp;lt;math&amp;gt;0.8^n&amp;gt;0&amp;lt;/math&amp;gt; 并趋向0，本例水量始终低于100 L，且单调增加。若把初值换成160 L，公式则为 &amp;lt;math&amp;gt;x_n=100+60(0.8)^n&amp;lt;/math&amp;gt;，水量会从上方单调减少。下图的两串点分别描绘这两种情况；连线只帮助追踪相邻记录，不规定两次记录之间的实际水流过程。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-difference-time.svg|frame|center|alt=从二十升和一百六十升出发的两组每月水量点，分别从下方和上方接近一百升平衡线|同一更新规则可以产生不同的解；两条解到100 L的偏差都每步缩小为原来的八成。]]&lt;br /&gt;
&lt;br /&gt;
假如希望水量与100 L相差不超过1 L，需要多少步？条件是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;80(0.8)^n\le1.&amp;lt;/math&amp;gt;&lt;br /&gt;
两边取自然对数，得到 &amp;lt;math&amp;gt;n\log0.8\le-\log80&amp;lt;/math&amp;gt;。由于 &amp;lt;math&amp;gt;\log0.8&amp;lt;0&amp;lt;/math&amp;gt;，除以它时不等号反向，故&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;n\ge\frac{\log(1/80)}{\log0.8}\approx19.638.&amp;lt;/math&amp;gt;&lt;br /&gt;
步数取整数，所以最少20步。复核边界：第19步仍差约1.1529 L，第20步差约0.9223 L。从20 L出发不会在任何有限步恰好达到100 L；“达到平衡”若指实际操作，通常要明确容许误差。&lt;br /&gt;
&lt;br /&gt;
== 蛛网图为什么要来回走 ==&lt;br /&gt;
递推 &amp;lt;math&amp;gt;x_{n+1}=F(x_n)&amp;lt;/math&amp;gt; 可以画在同一坐标平面里。横轴表示当前值，纵轴表示更新后的值。画出 &amp;lt;math&amp;gt;y=F(x)=0.8x+20&amp;lt;/math&amp;gt;，另画辅助直线 &amp;lt;math&amp;gt;y=x&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
从横轴的20开始，竖直走到更新函数，得到点 &amp;lt;math&amp;gt;(20,36)&amp;lt;/math&amp;gt;。这一步读出了下一项36。要继续用36作为横坐标，就水平走到 &amp;lt;math&amp;gt;y=x&amp;lt;/math&amp;gt; 上的 &amp;lt;math&amp;gt;(36,36)&amp;lt;/math&amp;gt;；再竖直走到 &amp;lt;math&amp;gt;(36,48.8)&amp;lt;/math&amp;gt;，便得到下一个更新结果。以后重复“竖直到函数、水平到对角线”，就是&#039;&#039;&#039;蛛网图&#039;&#039;&#039;的构造。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-difference-cobweb.svg|frame|center|alt=直线y等于零点八x加二十与对角线y等于x相交于一百一百，从二十开始的阶梯反复竖直到更新直线再水平到对角线|阶梯的两个方向分别完成“算出下一项”和“把下一项搬到横轴”。两条直线的交点就是平衡点。]]&lt;br /&gt;
&lt;br /&gt;
在100以下，更新直线位于对角线上方，所以下一项比当前项大；在100以上则相反。但这种上下关系本身不足以保证没有超调。本例的确不会越过100，是因为 &amp;lt;math&amp;gt;x_{n+1}-100=0.8(x_n-100)&amp;lt;/math&amp;gt; 保留了偏差的符号。图上看见的阶梯收缩，正对应已经证明的八成缩小关系。&lt;br /&gt;
&lt;br /&gt;
== 一阶仿射递推的通式与稳定性 ==&lt;br /&gt;
把保留比例与补入量写成一般常数，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_{n+1}=ax_n+b.&amp;lt;/math&amp;gt;&lt;br /&gt;
它通常称为一阶线性非齐次差分方程；从更新函数的角度看，&amp;lt;math&amp;gt;ax+b&amp;lt;/math&amp;gt; 是仿射函数。“一阶”表示下一步只需当前状态；如果规则还依赖 &amp;lt;math&amp;gt;x_{n-1}&amp;lt;/math&amp;gt;，就需要保存更多历史状态。显式的二阶规则例如 &amp;lt;math&amp;gt;x_{n+2}=x_{n+1}+x_n&amp;lt;/math&amp;gt;，需要给定两个起始值。取 &amp;lt;math&amp;gt;x_0=0,x_1=1&amp;lt;/math&amp;gt;，才能依次确定后面的1、2、3、5等项。斐波那契在1202年提出的兔子繁殖问题就形成这种二阶递推结构，具体假设与按月计数见[https://www.math.hkust.edu.hk/~machas/mathematical-biology.pdf Chasnov，《Mathematical Biology》§2.1，印刷页15]。&lt;br /&gt;
&lt;br /&gt;
当 &amp;lt;math&amp;gt;a\ne1&amp;lt;/math&amp;gt; 时，平衡点是 &amp;lt;math&amp;gt;x_*=b/(1-a)&amp;lt;/math&amp;gt;。同样相减，可得&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_n=x_*+a^n(x_0-x_*).&lt;br /&gt;
&amp;lt;/math&amp;gt;&lt;br /&gt;
也可以逐次展开：初始水量留下 &amp;lt;math&amp;gt;a^nx_0&amp;lt;/math&amp;gt;，每一步补入的量经历不同次数的保留，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_n=a^nx_0+b(1+a+\cdots+a^{n-1})=a^nx_0+b\frac{1-a^n}{1-a}.&amp;lt;/math&amp;gt;&lt;br /&gt;
两种形式相同：一种突出距平衡多远，另一种突出初始量和历次输入分别贡献了多少。[https://mids.ku.de/oliver/teaching/iub/fall2006/cps101/handouts/difference-equations.pdf Marcel Oliver 的讲义《Difference Equations》§2]给出了含变系数情形的一般递推解法。&lt;br /&gt;
&lt;br /&gt;
称平衡点&#039;&#039;&#039;稳定&#039;&#039;&#039;，是指初值足够接近它时，以后始终保持接近；在此基础上，附近轨迹还趋于它，则称&#039;&#039;&#039;渐近稳定&#039;&#039;&#039;。对于上面的仿射递推，这些性质直接由 &amp;lt;math&amp;gt;|a^n(x_0-x_*)|&amp;lt;/math&amp;gt; 决定。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;一阶仿射递推的参数与稳定性&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 参数 !! 偏差的变化 !! 平衡点性质&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;0&amp;lt;a&amp;lt;1&amp;lt;/math&amp;gt; || 同号、逐步缩小 || 渐近稳定，单侧趋近&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;a=0&amp;lt;/math&amp;gt; || 一步后偏差为零 || 一步到达平衡&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;-1&amp;lt;a&amp;lt;0&amp;lt;/math&amp;gt; || 正负交替，绝对值缩小 || 渐近稳定，交替趋近&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;a=-1&amp;lt;/math&amp;gt; || 正负交替，绝对值不变 || 稳定但不渐近稳定，非平衡解为二周期&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;|a|&amp;gt;1&amp;lt;/math&amp;gt; || 非零偏差的绝对值增大 || 不稳定&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
例如 &amp;lt;math&amp;gt;x_{n+1}=160-0.6x_n&amp;lt;/math&amp;gt; 的平衡点仍是100。取 &amp;lt;math&amp;gt;x_0=120&amp;lt;/math&amp;gt;，有 &amp;lt;math&amp;gt;x_1=88&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;x_2=107.2&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;x_3=95.68&amp;lt;/math&amp;gt;；偏差20、−12、7.2、−4.32逐次换号缩小。这可以表示围绕目标的过度调节，却不再是“留下负六成水量”的物理保留过程。数学参数允许什么，与具体机制允许什么，要分别检查。&lt;br /&gt;
&lt;br /&gt;
此前除以了 &amp;lt;math&amp;gt;1-a&amp;lt;/math&amp;gt;，所以还须处理 &amp;lt;math&amp;gt;a=1&amp;lt;/math&amp;gt;。此时 &amp;lt;math&amp;gt;x_n=x_0+nb&amp;lt;/math&amp;gt;：若 &amp;lt;math&amp;gt;b\ne0&amp;lt;/math&amp;gt; 就没有平衡点；若 &amp;lt;math&amp;gt;b=0&amp;lt;/math&amp;gt; 则每个状态都是平衡点，邻近的初值各自停在原处，并不互相靠拢。&lt;br /&gt;
&lt;br /&gt;
== 非线性更新怎样在平衡附近判断 ==&lt;br /&gt;
对较一般的 &amp;lt;math&amp;gt;x_{n+1}=F(x_n)&amp;lt;/math&amp;gt;，先解 &amp;lt;math&amp;gt;F(x_*)=x_*&amp;lt;/math&amp;gt;。若 &amp;lt;math&amp;gt;F&amp;lt;/math&amp;gt; 在平衡附近连续可微，且 &amp;lt;math&amp;gt;|F&#039;(x_*)|&amp;lt;1&amp;lt;/math&amp;gt;，可以选取一个小邻域及常数 &amp;lt;math&amp;gt;q&amp;lt;1&amp;lt;/math&amp;gt;，使邻域里处处有 &amp;lt;math&amp;gt;|F&#039;(x)|\le q&amp;lt;/math&amp;gt;。利用中值定理，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;|F(x)-F(x_*)|\le q|x-x_*|.&amp;lt;/math&amp;gt;&lt;br /&gt;
只要初值在这个邻域里，下一项离平衡更近，仍留在邻域；逐步应用得到 &amp;lt;math&amp;gt;|x_n-x_*|\le q^n|x_0-x_*|\to0&amp;lt;/math&amp;gt;。这既证明稳定，也证明吸引性。&lt;br /&gt;
&lt;br /&gt;
若 &amp;lt;math&amp;gt;|F&#039;(x_*)|&amp;gt;1&amp;lt;/math&amp;gt;，可在小邻域内取得下界 &amp;lt;math&amp;gt;|F&#039;(x)|\ge q&amp;gt;1&amp;lt;/math&amp;gt;，同一中值定理使每一步非零偏差至少放大 &amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt; 倍，直到离开该邻域，因此不稳定。若导数绝对值恰好为1，这一检验不作结论。例如 &amp;lt;math&amp;gt;F(x)=x-x^3&amp;lt;/math&amp;gt; 在0附近会把小偏差缩小，&amp;lt;math&amp;gt;F(x)=x+x^3&amp;lt;/math&amp;gt; 则放大，两者在0的导数却都是1。详细条件与证明见[https://mids.ku.de/oliver/teaching/iub/fall2006/cps101/handouts/difference-equations.pdf Oliver，§3，定理3]。&lt;br /&gt;
&lt;br /&gt;
== 离散模型、连续采样与欧拉近似 ==&lt;br /&gt;
水箱的逐月操作本来就定义了离散过程。若另设持续进水和持续排水，则可以建立[[微分方程]]&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\frac{dx}{dt}=q-\kappa x,\qquad q&amp;gt;0,\quad\kappa&amp;gt;0.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 以月计，&amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt; 是L/月，&amp;lt;math&amp;gt;\kappa&amp;lt;/math&amp;gt; 是每月的连续排出率。平衡水量为 &amp;lt;math&amp;gt;x_*=q/\kappa&amp;lt;/math&amp;gt;，其精确解为 &amp;lt;math&amp;gt;x(t)=x_*+(x(0)-x_*)e^{-\kappa t}&amp;lt;/math&amp;gt;。每隔 &amp;lt;math&amp;gt;h&amp;lt;/math&amp;gt; 个月记录一次，精确记录满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_{n+1}=e^{-\kappa h}x_n+x_*(1-e^{-\kappa h}).&amp;lt;/math&amp;gt;&lt;br /&gt;
这不是近似，是连续方程在离散时刻的精确采样关系。&lt;br /&gt;
&lt;br /&gt;
另一种做法，是把一段时间内的变化率近似冻结在该段起点，即&#039;&#039;&#039;显式欧拉法&#039;&#039;&#039;：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;x_{n+1}=x_n+h(q-\kappa x_n)=(1-\kappa h)x_n+qh.&amp;lt;/math&amp;gt;&lt;br /&gt;
它用 &amp;lt;math&amp;gt;1-\kappa h&amp;lt;/math&amp;gt; 近似 &amp;lt;math&amp;gt;e^{-\kappa h}&amp;lt;/math&amp;gt;。由指数展开 &amp;lt;math&amp;gt;e^{-z}=1-z+z^2/2+\cdots&amp;lt;/math&amp;gt;，可见只保留到一次项时漏掉了从二次开始的项。这里控制近似程度的是无量纲步长 &amp;lt;math&amp;gt;z=\kappa h&amp;lt;/math&amp;gt;，而不只是步长数字看上去是否小。&lt;br /&gt;
&lt;br /&gt;
例如取 &amp;lt;math&amp;gt;q=20&amp;lt;/math&amp;gt; L/月、&amp;lt;math&amp;gt;\kappa=0.2&amp;lt;/math&amp;gt; 每月、&amp;lt;math&amp;gt;h=1&amp;lt;/math&amp;gt; 月，欧拉法恰好给出开头的 &amp;lt;math&amp;gt;0.8x_n+20&amp;lt;/math&amp;gt;；但连续方程的精确采样是 &amp;lt;math&amp;gt;0.818731x_n+18.126925&amp;lt;/math&amp;gt;。从20 L出发，一个月后的连续精确值约为34.5015 L，欧拉值为36 L。两个模型的平衡都是100 L，过程仍有差别。&lt;br /&gt;
&lt;br /&gt;
若坚持让连续方程的月度精确采样与原递推完全相同，应取 &amp;lt;math&amp;gt;\kappa=-\log0.8\approx0.223144&amp;lt;/math&amp;gt; 每月，并令 &amp;lt;math&amp;gt;q=100\kappa\approx22.314355&amp;lt;/math&amp;gt; L/月。它们是由月度保留关系反推的连续参数，不能把“每月排出20%”直接当作连续率0.2而又声称精确相同。&lt;br /&gt;
&lt;br /&gt;
== 步长怎样制造振荡甚至发散 ==&lt;br /&gt;
连续误差满足 &amp;lt;math&amp;gt;e&#039;=-\kappa e&amp;lt;/math&amp;gt;，始终同号并逐渐消失。欧拉误差却满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;e_{n+1}=(1-\kappa h)e_n.&amp;lt;/math&amp;gt;&lt;br /&gt;
因此渐近稳定要求 &amp;lt;math&amp;gt;|1-\kappa h|&amp;lt;1&amp;lt;/math&amp;gt;，也就是 &amp;lt;math&amp;gt;0&amp;lt;\kappa h&amp;lt;2&amp;lt;/math&amp;gt;。在 &amp;lt;math&amp;gt;1&amp;lt;\kappa h&amp;lt;2&amp;lt;/math&amp;gt; 时，它虽能衰减，却会交替越过平衡；在 &amp;lt;math&amp;gt;\kappa h=2&amp;lt;/math&amp;gt; 时偏差不衰减；大于2时偏差被放大。若还要求对所有非负初值都保持非负更新，一个充分条件是 &amp;lt;math&amp;gt;0\le\kappa h\le1&amp;lt;/math&amp;gt;，使保留系数和输入项都非负。这比只要求渐近稳定更强。&lt;br /&gt;
&lt;br /&gt;
下图取非平衡初值 &amp;lt;math&amp;gt;e_0\ne0&amp;lt;/math&amp;gt;，把偏差除以初始偏差，令 &amp;lt;math&amp;gt;E=e/e_0&amp;lt;/math&amp;gt;，再以 &amp;lt;math&amp;gt;\tau=\kappa t&amp;lt;/math&amp;gt; 作为横轴。图中用 &amp;lt;math&amp;gt;\delta=\kappa h&amp;lt;/math&amp;gt; 标记无量纲步长。连续曲线都是 &amp;lt;math&amp;gt;E=e^{-\tau}&amp;lt;/math&amp;gt;。三种欧拉步长的乘数分别为0.5、−0.5、−1.2，因而依次出现同侧衰减、交替衰减和交替放大。变化的是算法步长，同一连续方程并未发生新的振荡机制。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-difference-euler.svg|frame|center|alt=三幅误差图比较连续指数衰减曲线与欧拉点列，无量纲步长零点五时同侧衰减，一点五时交替衰减，二点二时交替发散|精确采样乘数始终为正的指数；欧拉乘数可以变成负数，甚至绝对值超过一。折线仅连接计算点。]]&lt;br /&gt;
&lt;br /&gt;
这类稳定性来自每一步误差的放大因子，见[https://tobydriscoll.net/fnc-julia/diffusion/absstab-diffusion.html Driscoll 与 Braun，《Fundamentals of Numerical Computation》§11.3]。判据通过也不保证当前步长已足够准确，还需比较更小步长、精确解或独立误差估计。&lt;br /&gt;
&lt;br /&gt;
== 输入不精确时，结论能维持到什么程度 ==&lt;br /&gt;
假设仍保留八成，但每月实际补入量比20 L多或少 &amp;lt;math&amp;gt;\eta_n&amp;lt;/math&amp;gt;，且 &amp;lt;math&amp;gt;|\eta_n|\le\varepsilon&amp;lt;/math&amp;gt;。用 &amp;lt;math&amp;gt;d_n&amp;lt;/math&amp;gt; 表示这条受扰轨迹与原轨迹之差，则&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d_{n+1}=0.8d_n+\eta_n.&amp;lt;/math&amp;gt;&lt;br /&gt;
展开后有&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d_n=(0.8)^nd_0+\sum_{j=0}^{n-1}(0.8)^{n-1-j}\eta_j.&amp;lt;/math&amp;gt;&lt;br /&gt;
每一项的意义是：早期输入误差已经经历多次衰减，最新误差还没有衰减。取绝对值并把有限等比和相加，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;|d_n|\le(0.8)^n|d_0|+5\varepsilon\bigl(1-(0.8)^n\bigr).&amp;lt;/math&amp;gt;&lt;br /&gt;
从同一初值出发，若每次输入误差不超过0.1 L，长期轨迹差就不超过0.5 L。若每次都多补0.1 L，新的平衡正是 &amp;lt;math&amp;gt;20.1/0.2=100.5&amp;lt;/math&amp;gt; L，说明这个上界可以逼近。它也适用于同样形式的逐步计算误差，但实际水箱的保留比例变化、容量溢流等机制需要另建方程，不能一概归入固定的输入误差。&lt;br /&gt;
&lt;br /&gt;
== 相关条目与参考资料 ==&lt;br /&gt;
从离散更新转向瞬时变化率，可继续阅读[[微分方程]]、[[一阶线性微分方程]]；状态依赖的增长可见[[洛吉斯蒂模型]]；多状态相互影响可见[[捕食者-猎物模型]]。模型单位的核对见[[量纲分析]]。&lt;br /&gt;
&lt;br /&gt;
* Marcel Oliver：[https://mids.ku.de/oliver/teaching/iub/fall2006/cps101/handouts/difference-equations.pdf Difference Equations]，§§1–3，显式差分方程、仿射解、蛛网图与局部稳定性。&lt;br /&gt;
* Jeffrey R. Chasnov：[https://www.math.hkust.edu.hk/~machas/mathematical-biology.pdf Mathematical Biology]，§2.1，斐波那契兔子问题及二阶递推。&lt;br /&gt;
* Toby A. Driscoll、Richard J. Braun：[https://tobydriscoll.net/fnc-julia/diffusion/absstab-diffusion.html Fundamentals of Numerical Computation，§11.3 Absolute stability]，时间步长、放大因子与绝对稳定性。&lt;br /&gt;
&lt;br /&gt;
[[分类:微分方程与动力系统]]&lt;br /&gt;
[[分类:应用与建模]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%8A%BD%E5%B1%89%E5%8E%9F%E7%90%86&amp;diff=382</id>
		<title>抽屉原理</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%8A%BD%E5%B1%89%E5%8E%9F%E7%90%86&amp;diff=382"/>
		<updated>2026-09-20T02:04:39Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;抽屉原理&#039;&#039;&#039;（pigeonhole principle）说明：把比抽屉数更多的物品分别放进抽屉，至少有一个抽屉含有两件或更多物品。这里“抽屉”可以是实际的容器，也可以是一种分类，例如整数的余数、人的出生月份，或记录所处的某个状态。它把一个关于总数的事实，转化成“某一类中必有重复”的结论。&lt;br /&gt;
&lt;br /&gt;
考虑把 11 件物品放入 4 个箱子，每件物品恰好放在一个箱子里。至少有一个箱子含有 3 件物品：如果每箱至多 2 件，四箱总共至多有 8 件，放不下全部 11 件。这一结论与摆放顺序、箱子外观、随机与否都无关。&lt;br /&gt;
&lt;br /&gt;
== 从物品总数得到一个必然结论 ==&lt;br /&gt;
&lt;br /&gt;
用 &amp;lt;math&amp;gt;n_1,n_2,n_3,n_4&amp;lt;/math&amp;gt; 表示四个箱子中的物品数。它们都是非负整数，并且&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;n_1+n_2+n_3+n_4=11.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
若四个数全都不超过 2，左边便不超过 &amp;lt;math&amp;gt;4\times2=8&amp;lt;/math&amp;gt;，与等式矛盾。这就是证明中的关键：先假设我们想保证的情况完全没有发生，再计算所有箱子最多能容纳多少物品。&lt;br /&gt;
&lt;br /&gt;
下图给出一种实际分配 &amp;lt;math&amp;gt;(3,3,3,2)&amp;lt;/math&amp;gt;。它不仅满足“某箱至少有 3 件”，还说明仅凭 11 件、4 箱这两个信息，不能保证某箱有 4 件，因为图中就没有这样的箱子。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-pigeonhole-boxes.svg|frame|center|alt=十一件物品分到四个箱子，数量依次为三、三、三、二；至少三件可以保证，至少四件不能保证。|尽量均匀地摆放，可以看见整数下界为什么恰好是 3。图是一种达到下界的分配，前面的总数论证覆盖所有分配。]]&lt;br /&gt;
&lt;br /&gt;
最基本的形式是：若 &amp;lt;math&amp;gt;N&amp;gt; m&amp;lt;/math&amp;gt;，把 &amp;lt;math&amp;gt;N&amp;lt;/math&amp;gt; 件物品分到 &amp;lt;math&amp;gt;m&amp;lt;/math&amp;gt; 个箱子，每件恰入一箱，则某箱至少有两件。证明只需把刚才的“每箱至多 2 件”换成“每箱至多 1 件”。箱子允许空着；若有空箱，其余箱子更难避免重复。[https://ocw.mit.edu/courses/18-310-principles-of-discrete-applied-mathematics-fall-2013/ce68ab24d3cac4f2d808ced2705e6375_MIT18_310F13_Ch2.pdf MIT：Pigeonhole Principle]&lt;br /&gt;
&lt;br /&gt;
== 广义形式为什么要向上取整 ==&lt;br /&gt;
&lt;br /&gt;
设 &amp;lt;math&amp;gt;N,m&amp;lt;/math&amp;gt; 都是正整数。把 &amp;lt;math&amp;gt;N&amp;lt;/math&amp;gt; 件物品分入 &amp;lt;math&amp;gt;m&amp;lt;/math&amp;gt; 个箱子，至少有一个箱子的物品数达到&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left\lceil\frac Nm\right\rceil.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
符号 &amp;lt;math&amp;gt;\lceil x\rceil&amp;lt;/math&amp;gt; 表示&#039;&#039;&#039;不小于 &amp;lt;math&amp;gt;x&amp;lt;/math&amp;gt; 的最小整数&#039;&#039;&#039;，叫作向上取整。例如 &amp;lt;math&amp;gt;\lceil11/4\rceil=3&amp;lt;/math&amp;gt;，而 &amp;lt;math&amp;gt;\lceil12/4\rceil=3&amp;lt;/math&amp;gt;，整数本来已满足要求，不再增加一。&lt;br /&gt;
&lt;br /&gt;
平均每箱有 &amp;lt;math&amp;gt;N/m&amp;lt;/math&amp;gt; 件，至少一箱不能低于这个平均数；箱中物品数又必须是整数，所以最低保证值要向上取整。可以把这段理由写成严格的反证。令 &amp;lt;math&amp;gt;r=\lceil N/m\rceil&amp;lt;/math&amp;gt;，假设每箱都不足 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt; 件，则每箱至多 &amp;lt;math&amp;gt;r-1&amp;lt;/math&amp;gt; 件。然而&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;r-1&amp;lt; \frac Nm,\qquad m(r-1)&amp;lt; N.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
于是所有箱子合起来至多 &amp;lt;math&amp;gt;m(r-1)&amp;lt;/math&amp;gt; 件，小于已知总数 &amp;lt;math&amp;gt;N&amp;lt;/math&amp;gt;，矛盾。因此某箱至少有 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt; 件。&lt;br /&gt;
&lt;br /&gt;
这个下界在一般情况下不能再提高。把整数除法写成&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;N=qm+s,\qquad 0\le s&amp;lt; m.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
先给每箱放 &amp;lt;math&amp;gt;q&amp;lt;/math&amp;gt; 件，再给其中 &amp;lt;math&amp;gt;s&amp;lt;/math&amp;gt; 个箱子各加一件。如果 &amp;lt;math&amp;gt;s=0&amp;lt;/math&amp;gt;，最大箱数为 &amp;lt;math&amp;gt;q=N/m&amp;lt;/math&amp;gt;；如果 &amp;lt;math&amp;gt;s&amp;gt; 0&amp;lt;/math&amp;gt;，最大箱数为 &amp;lt;math&amp;gt;q+1=\lceil N/m\rceil&amp;lt;/math&amp;gt;。这就构造出恰好达到保证值的分配。&lt;br /&gt;
&lt;br /&gt;
反过来，给定正整数 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt;，若要&#039;&#039;&#039;无论如何分配，都保证有一箱至少 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt; 件&#039;&#039;&#039;，所需的最少物品数是&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;m(r-1)+1.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因为 &amp;lt;math&amp;gt;m(r-1)&amp;lt;/math&amp;gt; 件仍可每箱恰放 &amp;lt;math&amp;gt;r-1&amp;lt;/math&amp;gt; 件，再多一件就无法维持这个上限。例如 4 箱要保证有一箱至少 4 件，需要 13 件；12 件还可以分成 &amp;lt;math&amp;gt;(3,3,3,3)&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
== 抽屉可以是一种函数分类 ==&lt;br /&gt;
&lt;br /&gt;
实际运用时，最有用的一步通常是选好分类规则。设有限[[集合]] &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 是物品，有限集合 &amp;lt;math&amp;gt;B&amp;lt;/math&amp;gt; 是可用标签，给每件物品指定一个标签就是[[函数]] &amp;lt;math&amp;gt;f:A\to B&amp;lt;/math&amp;gt;。标签相同的物品放进同一个“抽屉”。&lt;br /&gt;
&lt;br /&gt;
当 &amp;lt;math&amp;gt;|A|&amp;gt; |B|&amp;lt;/math&amp;gt; 时，&amp;lt;math&amp;gt;f&amp;lt;/math&amp;gt; 不可能是单射：必有两个不同物品 &amp;lt;math&amp;gt;a_1,a_2&amp;lt;/math&amp;gt; 满足 &amp;lt;math&amp;gt;f(a_1)=f(a_2)&amp;lt;/math&amp;gt;。否则每个标签至多接收一件物品，全部标签也只能容纳 &amp;lt;math&amp;gt;|B|&amp;lt;/math&amp;gt; 件。&lt;br /&gt;
&lt;br /&gt;
这种说法交代了模型的两个条件：每件物品都获得标签，而且每件只获得一个标签。如果分类有重叠，应先规定重叠对象归入哪一类；如果有对象不属于任何一类，原来的抽屉计数就漏掉了物品。分类可以很巧妙，但分配规则必须明确。&lt;br /&gt;
&lt;br /&gt;
例如，从整数里任取五个不同的数，按除以 4 的余数分类。整数除法保证余数恰是 &amp;lt;math&amp;gt;0,1,2,3&amp;lt;/math&amp;gt; 中的一个，所以只有四个抽屉。五个整数中至少两个余数相同；若它们写成 &amp;lt;math&amp;gt;4u+r&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;4v+r&amp;lt;/math&amp;gt;，相减便得到 &amp;lt;math&amp;gt;4(u-v)&amp;lt;/math&amp;gt;。因此至少两个数的差能被 4 整除。&lt;br /&gt;
&lt;br /&gt;
在具体一组数 &amp;lt;math&amp;gt;2,5,8,11,14&amp;lt;/math&amp;gt; 中，余数分别为 &amp;lt;math&amp;gt;2,1,0,3,2&amp;lt;/math&amp;gt;。下图的余数 2 类同时收到了 2 和 14；它们的差为 &amp;lt;math&amp;gt;14-2=12&amp;lt;/math&amp;gt;。没有必要让原来的整数大小接近，真正重要的是它们落入同一个余数类。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-pigeonhole-residues.svg|frame|center|alt=整数二、五、八、十一、十四按模四余数进入四个箱子，余数二的箱子同时含二和十四，两数差十二能被四整除。|用余数作抽屉，把“两个数之差可整除”的目标变成“两个标签相同”。]]&lt;br /&gt;
&lt;br /&gt;
一般地，任取 &amp;lt;math&amp;gt;m+1&amp;lt;/math&amp;gt; 个整数，都有两个差能被正整数 &amp;lt;math&amp;gt;m&amp;lt;/math&amp;gt; 整除。这正是[[同余]]关系为抽屉原理提供分类的一个例子。&lt;br /&gt;
&lt;br /&gt;
== 把连续一段的和变成两个前缀的差 ==&lt;br /&gt;
&lt;br /&gt;
下面的问题看起来不再是“两个数同类”：给定正整数 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 和任意 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 个整数 &amp;lt;math&amp;gt;a_1,\ldots,a_n&amp;lt;/math&amp;gt;，能否找到&#039;&#039;&#039;连续的一段，长度至少为一&#039;&#039;&#039;，使这段的和能被 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 整除？答案是一定可以。&lt;br /&gt;
&lt;br /&gt;
先看五个数 &amp;lt;math&amp;gt;2,4,1,3,2&amp;lt;/math&amp;gt;。把从开头起的和依次记下来，并加上一个尚未取任何数时的和 &amp;lt;math&amp;gt;S_0=0&amp;lt;/math&amp;gt;：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;五个整数的前缀和与模五余数&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 已取项数 &amp;lt;math&amp;gt;j&amp;lt;/math&amp;gt; !! 0 !! 1 !! 2 !! 3 !! 4 !! 5&lt;br /&gt;
|-&lt;br /&gt;
! 前缀和 &amp;lt;math&amp;gt;S_j&amp;lt;/math&amp;gt;&lt;br /&gt;
| 0 || 2 || 6 || 7 || 10 || 12&lt;br /&gt;
|-&lt;br /&gt;
! 除以 5 的余数&lt;br /&gt;
| 0 || 2 || 1 || 2 || 0 || 2&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
前缀和 &amp;lt;math&amp;gt;S_1=2&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;S_3=7&amp;lt;/math&amp;gt; 余数相同。把它们相减，第一项被消掉，只剩第 2 至第 3 项：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S_3-S_1=(a_1+a_2+a_3)-a_1=a_2+a_3=4+1=5.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
下图突出标出这两个前缀边界。被截出的连续一段位于两个边界之间，而不是任意选出的几个数。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-pigeonhole-prefix.svg|frame|center|alt=序列二四一三二的六个前缀和为零二六七十十二，前缀一和前三项的余数同为二，相减截出连续段四加一等于五。|物品是六个前缀和，抽屉是五种余数；先找到重复余数，再用相减找回连续的一段。]]&lt;br /&gt;
&lt;br /&gt;
一般证明沿着同样的步骤。定义&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S_0=0,\qquad S_j=a_1+\cdots+a_j\quad(1\le j\le n).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
共有 &amp;lt;math&amp;gt;n+1&amp;lt;/math&amp;gt; 个前缀和，却只有 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 种模 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 的余数。由抽屉原理，存在两个不同下标 &amp;lt;math&amp;gt;0\le i&amp;lt; j\le n&amp;lt;/math&amp;gt;，使 &amp;lt;math&amp;gt;S_i\equiv S_j\pmod n&amp;lt;/math&amp;gt;。因此&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S_j-S_i=a_{i+1}+\cdots+a_j\equiv0\pmod n.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因为 &amp;lt;math&amp;gt;i&amp;lt; j&amp;lt;/math&amp;gt;，这段确实非空。整数可以为负数，也可以为零，证明仍成立；余数按 &amp;lt;math&amp;gt;0,\ldots,n-1&amp;lt;/math&amp;gt; 的通常约定取值。引入 &amp;lt;math&amp;gt;S_0&amp;lt;/math&amp;gt; 很有用：若某个前缀和本身能被 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 整除，它就与 &amp;lt;math&amp;gt;S_0&amp;lt;/math&amp;gt; 归入同一类，不必另分一种情况。&lt;br /&gt;
&lt;br /&gt;
证明也给出了寻找方法：从左到右计算前缀余数，记录每个余数第一次出现的位置。再次遇到相同余数时，用这两个位置截取原序列。这比逐一检查所有连续片段更直接。&lt;br /&gt;
&lt;br /&gt;
== 结论的边界 ==&lt;br /&gt;
&lt;br /&gt;
抽屉原理保证的是&#039;&#039;&#039;至少存在一个&#039;&#039;&#039;符合要求的抽屉，不是每个抽屉都如此，也不指定哪一个。11 件物品可以全部放入同一箱，其余三箱为空；这仍满足“有一箱至少三件”。&lt;br /&gt;
&lt;br /&gt;
“物品比箱子多”的严格不等式也不能随便改成等号。四件物品分四箱时，可以各放一件，从而完全没有重复。类似地，保证至少 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt; 件的门槛是 &amp;lt;math&amp;gt;m(r-1)+1&amp;lt;/math&amp;gt;，少一件就存在平均分配的反例。&lt;br /&gt;
&lt;br /&gt;
有限性在这里有实质作用。无限多个对象分入&#039;&#039;&#039;有限&#039;&#039;&#039;个箱子时，至少一箱含有无限多个对象：若每箱都有限，有限个有限集合的并仍有限。但若箱子也有无限多个，重复不再必然出现，例如把第 &amp;lt;math&amp;gt;k&amp;lt;/math&amp;gt; 个对象放入第 &amp;lt;math&amp;gt;k&amp;lt;/math&amp;gt; 个箱子，每箱仍只有一个。&lt;br /&gt;
&lt;br /&gt;
这一原理也不能单凭总数给出概率。“一定有重复”是对所有分配的结论；“某个指定箱子重复的可能性有多大”还需要随机机制，属于[[概率]]问题。&lt;br /&gt;
&lt;br /&gt;
== 历史与参考资料 ==&lt;br /&gt;
&lt;br /&gt;
抽屉原理也常称&#039;&#039;&#039;狄利克雷抽屉原理&#039;&#039;&#039;。它与数论中按有限类别寻找重复的证明方法关系密切。由戴德金整理、1863 年初版的狄利克雷《数论讲义》中，相关论证被用于 Pell 方程问题；当时的论证并没有固定使用今天的名称。MacTutor 的术语史还记录了 1941 年 Raphael M. Robinson 论文中的英语 “pigeonhole principle” 用法，说明“抽屉”和“鸽巢”是同一计数思想的不同比喻。[https://mathshistory.st-andrews.ac.uk/Miller/mathword/p/ 圣安德鲁斯大学 MacTutor：Pigeonhole Principle 术语史]&lt;br /&gt;
&lt;br /&gt;
* Michel Goemans，[https://ocw.mit.edu/courses/18-310-principles-of-discrete-applied-mathematics-fall-2013/ce68ab24d3cac4f2d808ced2705e6375_MIT18_310F13_Ch2.pdf Pigeonhole Principle]，MIT 18.310，2013。基本形式、广义形式与把对象归类的证明方法。&lt;br /&gt;
* [https://openlearninglibrary.mit.edu/assets/courseware/v1/00939fe1b75d6c40db7444af2099558f/asset-v1%3AOCW%2B6.042J%2B2T2019%2Btype%40asset%2Bblock/MIT6_042JS16_ThePigeonhol.pdf Mathematics for Computer Science：The Pigeonhole Principle]，MIT Open Learning Library。以向上取整表示广义下界。&lt;br /&gt;
* Jeff Miller 等，[https://mathshistory.st-andrews.ac.uk/Miller/mathword/p/ Earliest Known Uses of Some of the Words of Mathematics，P]，MacTutor。Pigeonhole Principle 条目的文献与命名记录。&lt;br /&gt;
&lt;br /&gt;
[[分类:离散数学]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%B5%B7%E4%BC%A6%E5%85%AC%E5%BC%8F&amp;diff=381</id>
		<title>海伦公式</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%B5%B7%E4%BC%A6%E5%85%AC%E5%BC%8F&amp;diff=381"/>
		<updated>2026-09-20T02:04:35Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;海伦公式&#039;&#039;&#039;（Heron&#039;s formula）由三角形的三条边直接计算面积。如果边长为 &amp;lt;math&amp;gt;a,b,c&amp;lt;/math&amp;gt;，半周长为 &amp;lt;math&amp;gt;s=(a+b+c)/2&amp;lt;/math&amp;gt;，则面积&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\sqrt{s(s-a)(s-b)(s-c)}.&amp;lt;/math&amp;gt;&lt;br /&gt;
它不需要预先知道高或角度，但边长必须能够组成三角形。公式里的四个因子为什么会出现，可以从[[余弦定理]]和底乘高的面积公式一步步推出。&lt;br /&gt;
&lt;br /&gt;
== 三边十三、十四、十五，面积是多少 ==&lt;br /&gt;
设三角形 &amp;lt;math&amp;gt;ABC&amp;lt;/math&amp;gt; 的边长为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=BC=13,\qquad b=CA=14,\qquad c=AB=15.&amp;lt;/math&amp;gt;&lt;br /&gt;
每个小写字母表示对应大写顶点的对边。长度使用同一单位，面积则使用该单位的平方。&lt;br /&gt;
&lt;br /&gt;
先检查三边能否合拢成三角形。三条边都是正数，且最长边十五小于另外两边之和二十七，所以满足严格三角形不等式。半周长为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;s=\frac{13+14+15}{2}=21.&amp;lt;/math&amp;gt;&lt;br /&gt;
四个因子依次是 &amp;lt;math&amp;gt;21,8,7,6&amp;lt;/math&amp;gt;，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\sqrt{21\cdot8\cdot7\cdot6}=\sqrt{7056}=84.&amp;lt;/math&amp;gt;&lt;br /&gt;
答案是八十四平方单位；根号内是四个长度的乘积，量纲为长度的四次方，开平方后正好是面积。&lt;br /&gt;
&lt;br /&gt;
可以用高独立检查一次。从 &amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt; 向 &amp;lt;math&amp;gt;AB&amp;lt;/math&amp;gt; 作垂线，垂足为 &amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt;。两个直角三角形满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;AD^2+CD^2=14^2,\qquad(15-AD)^2+CD^2=13^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
相减消去高，得到 &amp;lt;math&amp;gt;225-30AD=-27&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;AD=\frac{42}{5},\qquad CD=\sqrt{14^2-\left(\frac{42}{5}\right)^2}=\frac{56}{5}.&amp;lt;/math&amp;gt;&lt;br /&gt;
于是底乘高再除以二为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\frac12\cdot15\cdot\frac{56}{5}=84.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-heron-height.svg|frame|center|alt=边长十三十四十五的三角形，以十五为底，高为五十六除五，垂足将底分成四十二除五与三十三除五，面积为八十四|海伦公式与底乘高得到同一面积；高可以由三边求出，只是不必每次另算。]]&lt;br /&gt;
&lt;br /&gt;
这也解释了三边为何足够：在欧氏平面中，三边确定三角形的形状与大小，镜像放置不会改变面积。四边形没有同样的结论：四条单位长度的边既能组成面积一的正方形，也能组成内角三十度、面积二分之一的菱形。只知道边数相应的长度，不一定足以确定面积。&lt;br /&gt;
&lt;br /&gt;
== 从夹角面积到只含三边的表达式 ==&lt;br /&gt;
现在暂时回到一般三角形。约定 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 为边 &amp;lt;math&amp;gt;b,c&amp;lt;/math&amp;gt; 的内夹角，面积为 &amp;lt;math&amp;gt;\Delta&amp;lt;/math&amp;gt;。以 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 作底时，高为 &amp;lt;math&amp;gt;b\sin A&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\frac12bc\sin A.&amp;lt;/math&amp;gt;&lt;br /&gt;
非退化三角形有 &amp;lt;math&amp;gt;0&amp;lt;A&amp;lt;\pi&amp;lt;/math&amp;gt;，正弦为正。即使角 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 为钝角，高落在底边延长线上，&amp;lt;math&amp;gt;b\sin A&amp;lt;/math&amp;gt; 仍是正的垂直高度；这里没有要求三角形为锐角。&lt;br /&gt;
&lt;br /&gt;
由余弦定理，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos A=\frac{b^2+c^2-a^2}{2bc}.&amp;lt;/math&amp;gt;&lt;br /&gt;
我们希望消去角度，因而先将面积平方，再使用 &amp;lt;math&amp;gt;\sin^2A=1-\cos^2A&amp;lt;/math&amp;gt;：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;4\Delta^2=b^2c^2\sin^2A=b^2c^2(1-\cos^2A).&amp;lt;/math&amp;gt;&lt;br /&gt;
把余弦的边长表达式代入，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;4\Delta^2=b^2c^2-\frac{(b^2+c^2-a^2)^2}{4}.&amp;lt;/math&amp;gt;&lt;br /&gt;
两边乘四，便只剩边长：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;16\Delta^2=4b^2c^2-(b^2+c^2-a^2)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
右侧已经能计算面积，但三个边长的地位还不明显。接下来的因式分解会显出它的对称性。&lt;br /&gt;
&lt;br /&gt;
=== 两次平方差，得到四个长度因子 ===&lt;br /&gt;
把 &amp;lt;math&amp;gt;4b^2c^2&amp;lt;/math&amp;gt; 看作 &amp;lt;math&amp;gt;(2bc)^2&amp;lt;/math&amp;gt;。第一次使用平方差公式：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;16\Delta^2=[2bc-(b^2+c^2-a^2)]\,[2bc+(b^2+c^2-a^2)].&amp;lt;/math&amp;gt;&lt;br /&gt;
第一个括号中，&amp;lt;math&amp;gt;2bc-b^2-c^2=-(b-c)^2&amp;lt;/math&amp;gt;；第二个括号中，&amp;lt;math&amp;gt;2bc+b^2+c^2=(b+c)^2&amp;lt;/math&amp;gt;。所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;16\Delta^2=[a^2-(b-c)^2]\,[(b+c)^2-a^2].&amp;lt;/math&amp;gt;&lt;br /&gt;
再对两个括号各用一次平方差：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;16\Delta^2=(a-b+c)(a+b-c)(b+c-a)(a+b+c).&amp;lt;/math&amp;gt;&lt;br /&gt;
现在令 &amp;lt;math&amp;gt;s=(a+b+c)/2&amp;lt;/math&amp;gt;。逐个对应，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a+b+c=2s,\qquad b+c-a=2(s-a),&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a-b+c=2(s-b),\qquad a+b-c=2(s-c).&amp;lt;/math&amp;gt;&lt;br /&gt;
四个二相乘产生十六，与等号左边的十六相消，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta^2=s(s-a)(s-b)(s-c).&amp;lt;/math&amp;gt;&lt;br /&gt;
面积非负，取正平方根，便是海伦公式。[https://openstax.org/books/precalculus-2e/pages/8-2-non-right-triangles-law-of-cosines OpenStax《Precalculus 2e》§8.2：余弦定理与海伦公式]&lt;br /&gt;
&lt;br /&gt;
回看十三、十四、十五：余弦定理先给出 &amp;lt;math&amp;gt;\cos A=3/5&amp;lt;/math&amp;gt;，从而 &amp;lt;math&amp;gt;\sin A=4/5&amp;lt;/math&amp;gt;，面积仍为 &amp;lt;math&amp;gt;14\cdot15\cdot(4/5)/2=84&amp;lt;/math&amp;gt;。三种计算并不互相独立地创造不同面积，而是在消去高或角度后表达同一关系。&lt;br /&gt;
&lt;br /&gt;
== 半周长减一边，有没有几何意义 ==&lt;br /&gt;
在三角形内作与三边都相切的内切圆，圆心为 &amp;lt;math&amp;gt;I&amp;lt;/math&amp;gt;，半径为 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt;，接触点分别为 &amp;lt;math&amp;gt;U\in AB&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;V\in BC&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;W\in CA&amp;lt;/math&amp;gt;。同一顶点向圆引出的两条切线段等长，例如 &amp;lt;math&amp;gt;AU=AW&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
这个等长关系也可由勾股定理说明：半径 &amp;lt;math&amp;gt;IU,IW&amp;lt;/math&amp;gt; 都垂直于切线且长为 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt;，两个直角三角形又共用斜边 &amp;lt;math&amp;gt;AI&amp;lt;/math&amp;gt;，故 &amp;lt;math&amp;gt;AU^2=AI^2-r^2=AW^2&amp;lt;/math&amp;gt;，取正长度即得相等。&lt;br /&gt;
&lt;br /&gt;
令顶点 &amp;lt;math&amp;gt;A,B,C&amp;lt;/math&amp;gt; 引出的切线段长度分别为 &amp;lt;math&amp;gt;x,y,z&amp;lt;/math&amp;gt;。沿三条边相加：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;c=x+y,\qquad a=y+z,\qquad b=x+z.&amp;lt;/math&amp;gt;&lt;br /&gt;
因此 &amp;lt;math&amp;gt;s=x+y+z&amp;lt;/math&amp;gt;，再减去对边就得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;s-a=x,\qquad s-b=y,\qquad s-c=z.&amp;lt;/math&amp;gt;&lt;br /&gt;
所以三个差不仅是代数记号，也是三个顶点处的切线长度。本例分别为八、七、六。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-heron-incircle.svg|frame|center|alt=十三十四十五三角形内切圆半径四，A引出的两段切线各为八，B引出的各为七，C引出的各为六；圆心与三顶点相连|相同顶点处的两个数相等；它们在每条边上相加，还原十三、十四、十五。半径 IU 垂直于 AB。]]&lt;br /&gt;
&lt;br /&gt;
把圆心与三个顶点相连，三角形被分成三个小三角形；它们分别以 &amp;lt;math&amp;gt;a,b,c&amp;lt;/math&amp;gt; 为底，到底边的高都是 &amp;lt;math&amp;gt;r&amp;lt;/math&amp;gt;。于是&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\frac12ar+\frac12br+\frac12cr=sr.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例 &amp;lt;math&amp;gt;r=\Delta/s=84/21=4&amp;lt;/math&amp;gt;。这里接触点 &amp;lt;math&amp;gt;U&amp;lt;/math&amp;gt; 满足 &amp;lt;math&amp;gt;AU=8&amp;lt;/math&amp;gt;，与前一图满足 &amp;lt;math&amp;gt;AD=8.4&amp;lt;/math&amp;gt; 的高垂足 &amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt; 不同。&lt;br /&gt;
&lt;br /&gt;
将切线长度代回海伦公式，还可写成&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta^2=(x+y+z)xyz,\qquad r^2=\frac{xyz}{x+y+z}.&amp;lt;/math&amp;gt;&lt;br /&gt;
本例第二式为 &amp;lt;math&amp;gt;r^2=8\cdot7\cdot6/21=16&amp;lt;/math&amp;gt;，再次得到半径四。&lt;br /&gt;
&lt;br /&gt;
== 直角和钝角也用同一公式 ==&lt;br /&gt;
对于边长三、四、五的直角三角形，&amp;lt;math&amp;gt;s=6&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\sqrt{6\cdot3\cdot2\cdot1}=6.&amp;lt;/math&amp;gt;&lt;br /&gt;
它与两条直角边乘积的一半 &amp;lt;math&amp;gt;3\cdot4/2=6&amp;lt;/math&amp;gt; 一致。海伦公式没有排除直角，只是在此情况下不如直接用直角边简便。&lt;br /&gt;
&lt;br /&gt;
再取钝角三角形 &amp;lt;math&amp;gt;a=7,b=3,c=5&amp;lt;/math&amp;gt;。余弦定理给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos A=\frac{3^2+5^2-7^2}{2\cdot3\cdot5}=-\frac12,&amp;lt;/math&amp;gt;&lt;br /&gt;
所以 &amp;lt;math&amp;gt;A=120^\circ&amp;lt;/math&amp;gt;。它的半周长为 &amp;lt;math&amp;gt;15/2&amp;lt;/math&amp;gt;，海伦公式得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta^2=\frac{15}{2}\cdot\frac12\cdot\frac92\cdot\frac52=\frac{675}{16},&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta=\frac{15\sqrt3}{4}\approx6.4952.&amp;lt;/math&amp;gt;&lt;br /&gt;
另一种核验是夹角面积 &amp;lt;math&amp;gt;3\cdot5\sin120^\circ/2=15\sqrt3/4&amp;lt;/math&amp;gt;。钝角的高落到边外，不会使面积变负，也不需要给海伦公式额外添负号。&lt;br /&gt;
&lt;br /&gt;
== 三角形不等式为什么正好出现在根号里 ==&lt;br /&gt;
对正边长，&amp;lt;math&amp;gt;s&amp;gt;0&amp;lt;/math&amp;gt;，而&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;s-a=\frac{b+c-a}{2},\quad s-b=\frac{c+a-b}{2},\quad s-c=\frac{a+b-c}{2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
三个差严格为正，正好对应三条严格三角形不等式。若最长边等于另外两边之和，相应因子为零；三点共线，面积也为零。若最长边大于另外两边之和，根号内成为负数，说明输入不能组成欧氏三角形，而不是得到一种“负面积”。例如 &amp;lt;math&amp;gt;1,2,4&amp;lt;/math&amp;gt; 的根号内为 &amp;lt;math&amp;gt;-105/16&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
固定两边 &amp;lt;math&amp;gt;b=3,c=4&amp;lt;/math&amp;gt; 时，第三边的允许范围为 &amp;lt;math&amp;gt;1&amp;lt;a&amp;lt;7&amp;lt;/math&amp;gt;。把它们代入四因子式：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;16\Delta^2=(a+7)(7-a)(a+1)(a-1).&amp;lt;/math&amp;gt;&lt;br /&gt;
当 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 接近一或七，面积都趋于零。第三边逐渐变长并不意味着面积一直增大：先前未分解的式子还给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\Delta^2=36-\frac{(25-a^2)^2}{16}\le36.&amp;lt;/math&amp;gt;&lt;br /&gt;
等号当且仅当 &amp;lt;math&amp;gt;a^2=25&amp;lt;/math&amp;gt;，即 &amp;lt;math&amp;gt;a=5&amp;lt;/math&amp;gt; 时成立。此时两条固定边恰好垂直，面积最大为六。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-heron-degeneracy.svg|frame|center|alt=固定两边三和四，横轴第三边a从一到七，纵轴面积先增后减，在a等于五时达到六，两个退化端点用空心圆表示面积极限零|端点 a=1、a=7 不属于非退化三角形；最高点对应三四五直角三角形。]]&lt;br /&gt;
&lt;br /&gt;
接近退化时，边长的小变化可能造成很大的相对面积变化。例如边长 &amp;lt;math&amp;gt;3,4,6.99&amp;lt;/math&amp;gt; 的面积约为 &amp;lt;math&amp;gt;0.6469&amp;lt;/math&amp;gt;；若过早把 &amp;lt;math&amp;gt;6.99&amp;lt;/math&amp;gt; 舍入成七，结果就变为零。测量精度不足时，应保留输入的不确定性，而不是把开根号后的许多小数当作准确面积。实际数值计算也宜保留足够有效位，尤其注意两个接近量相减形成的 &amp;lt;math&amp;gt;s-a&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
== 名称与文献 ==&lt;br /&gt;
公式以亚历山大的海伦（Heron，也拼作 Hero）命名。他约活跃于公元一世纪，著作《度量论》（Metrica）第一卷讨论平面图形等对象的度量，并给出这一三角形面积公式的证明。圣安德鲁斯大学的数学史资料对该书内容有具体记述。[https://mathshistory.st-andrews.ac.uk/Biographies/Heron/ MacTutor：Heron of Alexandria]&lt;br /&gt;
&lt;br /&gt;
本页采用的“面积公式—余弦定理—因式分解”是现代三角函数语言下的推导，不把它当作《度量论》原文的符号或原有证明方式。其作用在于说明：只要三条边满足三角形条件，角度和高都可以从面积表达式中消去。&lt;br /&gt;
&lt;br /&gt;
== 参考资料 ==&lt;br /&gt;
* [https://openstax.org/books/precalculus-2e/pages/8-2-non-right-triangles-law-of-cosines OpenStax，Precalculus 2e，§8.2]：非直角三角形、余弦定理和海伦公式的条件与用途。&lt;br /&gt;
* [https://mathcs.clarku.edu/~djoyce/trig/laws.html David Joyce，Laws of Cosines &amp;amp; Sines，Clark University]：锐角和钝角的高与三角函数关系。&lt;br /&gt;
* [https://mathshistory.st-andrews.ac.uk/Biographies/Heron/ J. J. O&#039;Connor 与 E. F. Robertson，Heron of Alexandria，MacTutor，University of St Andrews]：《度量论》第一卷及海伦公式的历史记载。&lt;br /&gt;
* 相关：[[余弦定理]]、[[勾股定理]]、[[欧氏几何]]。&lt;br /&gt;
[[分类:几何]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E4%BD%99%E5%BC%A6%E5%AE%9A%E7%90%86&amp;diff=380</id>
		<title>余弦定理</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E4%BD%99%E5%BC%A6%E5%AE%9A%E7%90%86&amp;diff=380"/>
		<updated>2026-09-20T02:04:32Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;余弦定理&#039;&#039;&#039;（law of cosines）把三角形的三条边与一个内角联系起来：一边的平方，等于另外两边的平方和，再减去这两边乘积与其夹角余弦乘积的两倍。它使[[勾股定理]]能够推广到非直角三角形，既能由两边及其夹角求第三边，也能由三边求角。&lt;br /&gt;
&lt;br /&gt;
== 三条边已知，角度藏在哪里 ==&lt;br /&gt;
取一个边长为十三、十四、十五的三角形，统一标记为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a=BC=13,\qquad b=CA=14,\qquad c=AB=15.&amp;lt;/math&amp;gt;&lt;br /&gt;
小写边长 &amp;lt;math&amp;gt;a,b,c&amp;lt;/math&amp;gt; 分别与顶点 &amp;lt;math&amp;gt;A,B,C&amp;lt;/math&amp;gt; 处的内角相对。下文也用 &amp;lt;math&amp;gt;A,B,C&amp;lt;/math&amp;gt; 表示相应角度；例如角 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 夹在边 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 之间，正对边 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt;。选哪个角，必须先找清它的对边。&lt;br /&gt;
&lt;br /&gt;
把 &amp;lt;math&amp;gt;AB&amp;lt;/math&amp;gt; 水平放置，从 &amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt; 向直线 &amp;lt;math&amp;gt;AB&amp;lt;/math&amp;gt; 作垂线，垂足为 &amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt;。本例的垂足落在边内。设 &amp;lt;math&amp;gt;AD=d&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;CD=h&amp;lt;/math&amp;gt;，则两个直角三角形分别给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d^2+h^2=14^2,\qquad(15-d)^2+h^2=13^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
第二式减第一式，两个 &amp;lt;math&amp;gt;h^2&amp;lt;/math&amp;gt; 消去：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;225-30d=169-196=-27.&amp;lt;/math&amp;gt;&lt;br /&gt;
于是 &amp;lt;math&amp;gt;30d=252&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;d=42/5=8.4&amp;lt;/math&amp;gt;。再代回第一式，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;h^2=196-\frac{1764}{25}=\frac{3136}{25},\qquad h=\frac{56}{5}=11.2.&amp;lt;/math&amp;gt;&lt;br /&gt;
高为正，故取正平方根。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cosine-projection.svg|frame|center|alt=三角形ABC的对边a十三、b十四、c十五，从C向AB作高CD，AD为八点四、DB为六点六，高为十一点二，角A位于十四和十五两边之间|作高后，同一个 h 出现在两个勾股关系中；相减便能求出水平投影 d。]]&lt;br /&gt;
&lt;br /&gt;
看直角三角形 &amp;lt;math&amp;gt;ACD&amp;lt;/math&amp;gt;，角 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 的邻边是 &amp;lt;math&amp;gt;AD&amp;lt;/math&amp;gt;，斜边是 &amp;lt;math&amp;gt;AC&amp;lt;/math&amp;gt;，因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos A=\frac{AD}{AC}=\frac{8.4}{14}=\frac35.&amp;lt;/math&amp;gt;&lt;br /&gt;
角度为 &amp;lt;math&amp;gt;A=\arccos(3/5)\approx53.1301^\circ&amp;lt;/math&amp;gt;。其中 &amp;lt;math&amp;gt;\arccos&amp;lt;/math&amp;gt; 表示反余弦：在零至一百八十度之间，找余弦等于给定值的角。上面的计算没有先知道角度，而是从边长中把它求了出来。&lt;br /&gt;
&lt;br /&gt;
== 从这个算例推到一般公式 ==&lt;br /&gt;
在平面[[欧氏几何]]中，设 &amp;lt;math&amp;gt;ABC&amp;lt;/math&amp;gt; 是非退化三角形，边长均为正。仍令 &amp;lt;math&amp;gt;A=(0,0)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;B=(c,0)&amp;lt;/math&amp;gt;，并将 &amp;lt;math&amp;gt;C&amp;lt;/math&amp;gt; 放在横轴上方。记其坐标为 &amp;lt;math&amp;gt;C=(d,h)&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;h&amp;gt;0&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
此时 &amp;lt;math&amp;gt;d&amp;lt;/math&amp;gt; 是带正负号的横坐标，未必是一条线段的正长度。坐标形式的余弦与正弦给出&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d=b\cos A,\qquad h=b\sin A.&amp;lt;/math&amp;gt;&lt;br /&gt;
距离平方满足&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;b^2=d^2+h^2,\qquad a^2=(c-d)^2+h^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
展开第二个平方，把相同部分合并：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2=c^2-2cd+d^2+h^2=c^2-2cd+b^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
最后代入 &amp;lt;math&amp;gt;d=b\cos A&amp;lt;/math&amp;gt;，得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2=b^2+c^2-2bc\cos A.&amp;lt;/math&amp;gt;&lt;br /&gt;
“减去的那一项”来自横向距离 &amp;lt;math&amp;gt;c-d&amp;lt;/math&amp;gt; 的平方展开。它度量了两边方向之间的联系，而不是额外记忆的修正数字。&lt;br /&gt;
&lt;br /&gt;
换一个顶点作起点，就得到另外两种写法：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;b^2=c^2+a^2-2ca\cos B,&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;c^2=a^2+b^2-2ab\cos C.&amp;lt;/math&amp;gt;&lt;br /&gt;
三式的规则相同：左边是所选角的对边平方，右边相乘的是夹住这个角的两条边。[https://openstax.org/books/precalculus-2e/pages/8-2-non-right-triangles-law-of-cosines OpenStax《Precalculus 2e》§8.2]&lt;br /&gt;
&lt;br /&gt;
== 钝角时，垂足跑到边外怎么办 ==&lt;br /&gt;
设 &amp;lt;math&amp;gt;b=3&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;c=5&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;A=120^\circ&amp;lt;/math&amp;gt;。这时&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;d=b\cos120^\circ=3\left(-\frac12\right)=-\frac32,\qquad h=\frac{3\sqrt3}{2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
垂足在 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 的左边，线段 &amp;lt;math&amp;gt;AD&amp;lt;/math&amp;gt; 的长度是 &amp;lt;math&amp;gt;3/2&amp;lt;/math&amp;gt;，但点 &amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt; 的横坐标是 &amp;lt;math&amp;gt;-3/2&amp;lt;/math&amp;gt;。从 &amp;lt;math&amp;gt;B&amp;lt;/math&amp;gt; 到 &amp;lt;math&amp;gt;D&amp;lt;/math&amp;gt; 的水平距离为&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;c-d=5-\left(-\frac32\right)=\frac{13}{2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
因此坐标证明仍然有效：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2=\left(\frac{13}{2}\right)^2+\left(\frac{3\sqrt3}{2}\right)^2=\frac{169+27}{4}=49,&amp;lt;/math&amp;gt;&lt;br /&gt;
所以 &amp;lt;math&amp;gt;a=7&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cosine-obtuse.svg|frame|center|alt=角A为一百二十度，AB五、AC三、BC七；垂足D在A左方，D横坐标负一点五，BD长六点五，高为三倍根号三除二|辅助线延长到 A 左侧。负的是横坐标 d，不是线段 AD 的长度。]]&lt;br /&gt;
&lt;br /&gt;
直接用余弦定理也得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2=3^2+5^2-2\cdot3\cdot5\left(-\frac12\right)=34+15=49.&amp;lt;/math&amp;gt;&lt;br /&gt;
钝角余弦为负，所以公式里的减法最终增加了十五。若把负余弦误改成正数，就会把张开的钝角当成锐角，得到另一条边长。&lt;br /&gt;
&lt;br /&gt;
== 锐角、直角和钝角如何从边长看出来 ==&lt;br /&gt;
从同一个公式移项：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2-(b^2+c^2)=-2bc\cos A.&amp;lt;/math&amp;gt;&lt;br /&gt;
因为 &amp;lt;math&amp;gt;b,c&amp;gt;0&amp;lt;/math&amp;gt;，左右两侧符号只由 &amp;lt;math&amp;gt;\cos A&amp;lt;/math&amp;gt; 决定。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;div class=&amp;quot;math-table-scroll&amp;quot; role=&amp;quot;region&amp;quot; aria-label=&amp;quot;余弦定理判别所选角的锐直钝性质&amp;quot; tabindex=&amp;quot;0&amp;quot;&amp;gt;&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 角 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; !! 余弦符号 !! 边长平方关系&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;0^\circ&amp;lt;A&amp;lt;90^\circ&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;\cos A&amp;gt;0&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;a^2&amp;lt;b^2+c^2&amp;lt;/math&amp;gt;&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;A=90^\circ&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;\cos A=0&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;a^2=b^2+c^2&amp;lt;/math&amp;gt;&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;math&amp;gt;90^\circ&amp;lt;A&amp;lt;180^\circ&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;\cos A&amp;lt;0&amp;lt;/math&amp;gt; || &amp;lt;math&amp;gt;a^2&amp;gt;b^2+c^2&amp;lt;/math&amp;gt;&lt;br /&gt;
|}&lt;br /&gt;
&amp;lt;/div&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cosine-angle-cases.svg|frame|center|alt=固定夹角两边为三和四，角A分别为六十、九十、一百二十度，对边平方分别为十三、二十五、三十七|两边不变，夹角越张开，对边越长。中间一行恰好回到三四五直角三角形。]]&lt;br /&gt;
&lt;br /&gt;
表格首先判别的是&#039;&#039;&#039;所选的角&#039;&#039;&#039;。若要判别整个三角形，应选最大边所对的角，因为最大边对最大角。本例最大边十五，&amp;lt;math&amp;gt;15^2=225&amp;lt;13^2+14^2=365&amp;lt;/math&amp;gt;，所以最大角仍是锐角，整个三角形都是锐角。&lt;br /&gt;
&lt;br /&gt;
还可以逐个求角：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos B=\frac{13^2+15^2-14^2}{2\cdot13\cdot15}=\frac{33}{65},&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos C=\frac{13^2+14^2-15^2}{2\cdot13\cdot14}=\frac5{13}.&amp;lt;/math&amp;gt;&lt;br /&gt;
由此 &amp;lt;math&amp;gt;B\approx59.4898^\circ&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;C\approx67.3801^\circ&amp;lt;/math&amp;gt;，与 &amp;lt;math&amp;gt;A\approx53.1301^\circ&amp;lt;/math&amp;gt; 相加为一百八十度（显示位数带来少量舍入误差）。计算器若设置为弧度，应先转换单位，不能把弧度数直接标为度。&lt;br /&gt;
&lt;br /&gt;
== 不经过两点之间，也能求它们的距离 ==&lt;br /&gt;
设测站 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 与目标 &amp;lt;math&amp;gt;B,C&amp;lt;/math&amp;gt; 在同一平面，已经测得 &amp;lt;math&amp;gt;AB=80&amp;lt;/math&amp;gt; 米、&amp;lt;math&amp;gt;AC=100&amp;lt;/math&amp;gt; 米，两条观测方向的内夹角为 &amp;lt;math&amp;gt;60^\circ&amp;lt;/math&amp;gt;，要求 &amp;lt;math&amp;gt;BC&amp;lt;/math&amp;gt;。这是教学设定的理想测量数据。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cosine-distance.svg|frame|center|alt=测站A到B的距离为八十米、到C为一百米，两方向夹角六十度，BC用虚线标为待求距离a|已知的是两边及其夹角；待求 BC 正对这个六十度角。]]&lt;br /&gt;
&lt;br /&gt;
在约定中 &amp;lt;math&amp;gt;c=80&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;b=100&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;a=BC&amp;lt;/math&amp;gt;。代入即可逐步得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a^2=100^2+80^2-2\cdot100\cdot80\cos60^\circ&amp;lt;/math&amp;gt;&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;=10000+6400-16000\cdot\frac12=8400.&amp;lt;/math&amp;gt;&lt;br /&gt;
因此&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;BC=\sqrt{8400}=20\sqrt{21}\approx91.65\ \mathrm m.&amp;lt;/math&amp;gt;&lt;br /&gt;
答案满足 &amp;lt;math&amp;gt;|100-80|&amp;lt;91.65&amp;lt;100+80&amp;lt;/math&amp;gt;，与三角形不等式一致。若错把它当成直角，勾股计算会给出约一百二十八点零六米；缺少夹角项，就等于换了测量情境。真实测距还应考虑仪器误差，所得小数不应宣称比输入更精确。&lt;br /&gt;
&lt;br /&gt;
== 哪些给定条件能确定答案 ==&lt;br /&gt;
若已知正长度 &amp;lt;math&amp;gt;b,c&amp;lt;/math&amp;gt; 与它们的内夹角 &amp;lt;math&amp;gt;0&amp;lt;A&amp;lt;\pi&amp;lt;/math&amp;gt;，第三边由正平方根唯一确定。若已知三条正边且满足严格三角形不等式，则&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\cos A=\frac{b^2+c^2-a^2}{2bc}&amp;lt;/math&amp;gt;&lt;br /&gt;
落在 &amp;lt;math&amp;gt;(-1,1)&amp;lt;/math&amp;gt; 内，反余弦给出唯一内角。具体地，&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;-1&amp;lt;\frac{b^2+c^2-a^2}{2bc}&amp;lt;1&amp;lt;/math&amp;gt;&lt;br /&gt;
等价于&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(b-c)^2&amp;lt;a^2&amp;lt;(b+c)^2,&amp;lt;/math&amp;gt;&lt;br /&gt;
也就是 &amp;lt;math&amp;gt;|b-c|&amp;lt;a&amp;lt;b+c&amp;lt;/math&amp;gt;。这说明边长可组成三角形与角度可取真实内角，是同一几何限制的两种写法。&lt;br /&gt;
&lt;br /&gt;
如果 &amp;lt;math&amp;gt;a=b+c&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;A=\pi&amp;lt;/math&amp;gt;；如果 &amp;lt;math&amp;gt;a=|b-c|&amp;lt;/math&amp;gt; 且三条边仍为正，则 &amp;lt;math&amp;gt;A=0&amp;lt;/math&amp;gt;。两种情况都使三点共线，面积为零，是公式的退化边界，而不是普通三角形。三角形不等式失败时，应先核对输入，不能把超出 &amp;lt;math&amp;gt;[-1,1]&amp;lt;/math&amp;gt; 的余弦值强行当成角。&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;已知两边和一个非夹角&#039;&#039;&#039;则可能有两个解。例如 &amp;lt;math&amp;gt;a=3,b=4,A=30^\circ&amp;lt;/math&amp;gt;，这里 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 不夹在已知的 &amp;lt;math&amp;gt;a,b&amp;lt;/math&amp;gt; 之间。余弦定理成为关于未知 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 的二次方程：&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;9=16+c^2-4\sqrt3\,c,\qquad c^2-4\sqrt3\,c+7=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
配方得 &amp;lt;math&amp;gt;(c-2\sqrt3)^2=5&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;c=2\sqrt3\pm\sqrt5.&amp;lt;/math&amp;gt;&lt;br /&gt;
两个正值约为 &amp;lt;math&amp;gt;1.2280&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;5.7002&amp;lt;/math&amp;gt;，都在 &amp;lt;math&amp;gt;|4-3|&amp;lt;c&amp;lt;4+3&amp;lt;/math&amp;gt; 内，因此确有两个三角形。关键区别是给出的角是否为&#039;&#039;&#039;两条已知边的夹角&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
== 与面积、向量和历史的联系 ==&lt;br /&gt;
余弦定理求出一个角后，可以用 &amp;lt;math&amp;gt;\Delta=bc\sin A/2&amp;lt;/math&amp;gt; 求面积；进一步消去正弦与余弦，就得到只含三边的[[海伦公式]]。十三、十四、十五的例子有 &amp;lt;math&amp;gt;\sin A=4/5&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;\Delta=14\cdot15\cdot(4/5)/2=84&amp;lt;/math&amp;gt; 平方单位。&lt;br /&gt;
&lt;br /&gt;
在坐标中，令 &amp;lt;math&amp;gt;\mathbf u=\overrightarrow{AB}&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;\mathbf v=\overrightarrow{AC}&amp;lt;/math&amp;gt;，两向量之差连接另两个顶点。把坐标平方展开，便得到&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|\mathbf u-\mathbf v\|^2=\|\mathbf u\|^2+\|\mathbf v\|^2-2\mathbf u\cdot\mathbf v.&amp;lt;/math&amp;gt;&lt;br /&gt;
这里点积 &amp;lt;math&amp;gt;\mathbf u\cdot\mathbf v=u_1v_1+u_2v_2=bc\cos A&amp;lt;/math&amp;gt;，所以这正是同一个余弦关系的[[线性代数]]写法。&lt;br /&gt;
&lt;br /&gt;
《几何原本》第二卷命题十二、十三分别讨论钝角与锐角情形，用平方和投影所成矩形的面积表达对应关系。原文并没有今天的余弦符号；现代三角函数把两种几何关系统一成上述公式。[https://mathcs.clarku.edu/~djoyce/elements/bookII/propII12.html 欧几里得《几何原本》II.12，David Joyce 英译与注释]；[https://mathcs.clarku.edu/~djoyce/elements/bookII/propII13.html II.13]&lt;br /&gt;
&lt;br /&gt;
== 参考资料 ==&lt;br /&gt;
* [https://openstax.org/books/precalculus-2e/pages/8-2-non-right-triangles-law-of-cosines OpenStax，Precalculus 2e，§8.2]：坐标推导、三边求角与两边夹角求边。&lt;br /&gt;
* [https://mathcs.clarku.edu/~djoyce/trig/laws.html David Joyce，Laws of Cosines &amp;amp; Sines，Clark University]：锐角、钝角推导与古代命题的关系。&lt;br /&gt;
* [https://mathcs.clarku.edu/~djoyce/elements/bookII/propII12.html Euclid，Elements II.12]；[https://mathcs.clarku.edu/~djoyce/elements/bookII/propII13.html II.13]：投影与平方关系的原命题。&lt;br /&gt;
* 相关：[[勾股定理]]、[[海伦公式]]、[[欧氏几何]]、[[线性代数]]。&lt;br /&gt;
[[分类:几何]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%9F%AF%E8%A5%BF%E4%B8%8D%E7%AD%89%E5%BC%8F&amp;diff=379</id>
		<title>柯西不等式</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%9F%AF%E8%A5%BF%E4%B8%8D%E7%AD%89%E5%BC%8F&amp;diff=379"/>
		<updated>2026-09-20T02:04:28Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;柯西不等式&#039;&#039;&#039;通常指&#039;&#039;&#039;柯西—施瓦茨不等式&#039;&#039;&#039;（Cauchy–Schwarz inequality），也称柯西—布尼亚科夫斯基不等式。它把两组数“对应相乘再相加”的结果，与这两组数各自的平方和联系起来。在向量语言中，它说：&#039;&#039;&#039;内积的绝对值不超过两个向量长度的乘积&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
先取两个平面向量 &amp;lt;math&amp;gt;a=(3,1)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;b=(1,2)&amp;lt;/math&amp;gt;。对应坐标相乘相加，得到 &amp;lt;math&amp;gt;a\cdot b=3\times1+1\times2=5&amp;lt;/math&amp;gt;；两向量的长度分别为 &amp;lt;math&amp;gt;\sqrt{10}&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;\sqrt5&amp;lt;/math&amp;gt;。柯西不等式在这里给出&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;|5|\le\sqrt{10}\sqrt5=\sqrt{50},\qquad\text{或等价地}\quad25\le50.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
数字比较容易验证。更值得追问的是：为什么无论坐标如何取值都成立，什么时候两边恰好相等，以及这份上界怎样用来解题？&lt;br /&gt;
&lt;br /&gt;
== 先说清楚两个量怎样计算 ==&lt;br /&gt;
&lt;br /&gt;
给定两组实数 &amp;lt;math&amp;gt;a_1,\ldots,a_n&amp;lt;/math&amp;gt; 和 &amp;lt;math&amp;gt;b_1,\ldots,b_n&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 为正整数，组成实向量 &amp;lt;math&amp;gt;a,b\in\mathbb R^n&amp;lt;/math&amp;gt;。它们的欧氏内积和长度分别是&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a\cdot b=\sum_{i=1}^n a_i b_i,\qquad\|a\|=\sqrt{\sum_{i=1}^n a_i^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
内积可能为正、为负或为零；长度始终非负。柯西不等式的两个常见形式为&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left|\sum_{i=1}^n a_i b_i\right|\le\sqrt{\sum_{i=1}^n a_i^2}\sqrt{\sum_{i=1}^n b_i^2},&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left(\sum_{i=1}^n a_i b_i\right)^2\le\left(\sum_{i=1}^n a_i^2\right)\left(\sum_{i=1}^n b_i^2\right).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因为绝对值与两个长度都非负，平方或开平方不会改变不等式的真假。坐标没有正数要求，负坐标同样适用。若把 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 换成 &amp;lt;math&amp;gt;-b&amp;lt;/math&amp;gt;，内积从 5 变成 −5，长度不变，绝对值正好保留了同一份上界。&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;等号成立当且仅当两向量线性相关。&#039;&#039;&#039;明确说，存在不同时为零的实数 &amp;lt;math&amp;gt;\alpha,\beta&amp;lt;/math&amp;gt;，使 &amp;lt;math&amp;gt;\alpha a+\beta b=0&amp;lt;/math&amp;gt;。当 &amp;lt;math&amp;gt;b\ne0&amp;lt;/math&amp;gt; 时，这等价于存在实数 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 使 &amp;lt;math&amp;gt;a=tb&amp;lt;/math&amp;gt;；若 &amp;lt;math&amp;gt;b=0&amp;lt;/math&amp;gt;，无论 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 为何都取等号。这样说也包含零向量，不必为零向量硬定义夹角。[https://math.mit.edu/classes/18.100B/fall_2011/sol2.pdf MIT：Cauchy–Schwarz 等号条件]&lt;br /&gt;
&lt;br /&gt;
== 把一个向量分成沿线与垂线两部分 ==&lt;br /&gt;
&lt;br /&gt;
回到 &amp;lt;math&amp;gt;a=(3,1)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;b=(1,2)&amp;lt;/math&amp;gt;。沿着 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 方向的点都形如 &amp;lt;math&amp;gt;tb=(t,2t)&amp;lt;/math&amp;gt;。我们想找其中离 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 最近的一个，使从这个点指向 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 的差向量与 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 垂直。&lt;br /&gt;
&lt;br /&gt;
这个垂直要求可用内积为零来表达：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(a-tb)\cdot b=0.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
展开后是 &amp;lt;math&amp;gt;a\cdot b-t\|b\|^2=0&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;t=\frac{a\cdot b}{\|b\|^2}=\frac55=1.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因此投影点为 &amp;lt;math&amp;gt;h=tb=(1,2)&amp;lt;/math&amp;gt;，余下的向量为 &amp;lt;math&amp;gt;r=a-h=(2,-1)&amp;lt;/math&amp;gt;。核对 &amp;lt;math&amp;gt;r\cdot b=2\times1+(-1)\times2=0&amp;lt;/math&amp;gt;，确实垂直。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cauchy-projection.svg|frame|center|alt=向量a从原点指向三一，b与投影h从原点指向一二，h至a的残差为二负一并与b垂直，直角三角形的长度平方为十等于五加五。|虚线是从 a 的端点向 b 所在直线作出的垂线。沿线部分与垂直部分合起来仍是同一个向量 a。]]&lt;br /&gt;
&lt;br /&gt;
图中直角三角形满足[[勾股定理]]：&amp;lt;math&amp;gt;\|a\|^2=\|h\|^2+\|r\|^2=5+5=10&amp;lt;/math&amp;gt;。因此投影长度不会超过原向量长度。一般地，当 &amp;lt;math&amp;gt;b\ne0&amp;lt;/math&amp;gt; 时，沿线部分的长度为&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left\|\frac{a\cdot b}{\|b\|^2}b\right\|=\frac{|a\cdot b|}{\|b\|}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
它不超过 &amp;lt;math&amp;gt;\|a\|&amp;lt;/math&amp;gt;，乘回正数 &amp;lt;math&amp;gt;\|b\|&amp;lt;/math&amp;gt; 就得到柯西不等式。若想取等号，垂直部分必须消失，整个 &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; 都落在 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 所在直线上。这同时解释了等号为什么对应线性相关。&lt;br /&gt;
&lt;br /&gt;
== 不靠图形的证明：平方距离最小能有多小 ==&lt;br /&gt;
&lt;br /&gt;
上述投影思路可以写成任意维数都有效的代数证明。若 &amp;lt;math&amp;gt;b=0&amp;lt;/math&amp;gt;，不等式两边都是零，已经证明。以下设 &amp;lt;math&amp;gt;b\ne0&amp;lt;/math&amp;gt;，于是 &amp;lt;math&amp;gt;\|b\|^2&amp;gt; 0&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
对于任意实数 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt;，平方和都非负：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}\|a-tb\|^2&amp;amp;=\sum_{i=1}^n(a_i-tb_i)^2\\&amp;amp;=\|a\|^2-2t(a\cdot b)+t^2\|b\|^2\ge0.\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
把关于 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 的二次式配方：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\|a-tb\|^2=\|b\|^2\left(t-\frac{a\cdot b}{\|b\|^2}\right)^2+\|a\|^2-\frac{(a\cdot b)^2}{\|b\|^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
当 &amp;lt;math&amp;gt;t=(a\cdot b)/\|b\|^2&amp;lt;/math&amp;gt; 时，第一项为零；左边仍不能为负，所以&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;0\le\|a\|^2-\frac{(a\cdot b)^2}{\|b\|^2}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
乘以正的 &amp;lt;math&amp;gt;\|b\|^2&amp;lt;/math&amp;gt;，便得到 &amp;lt;math&amp;gt;(a\cdot b)^2\le\|a\|^2\|b\|^2&amp;lt;/math&amp;gt;。整个证明只用了平方和非负与配方，没有先假设夹角公式成立。&lt;br /&gt;
&lt;br /&gt;
本例的平方距离是 &amp;lt;math&amp;gt;10-10t+5t^2=5(t-1)^2+5&amp;lt;/math&amp;gt;。下图的最低点在 &amp;lt;math&amp;gt;t=1&amp;lt;/math&amp;gt;，最小平方距离为 5，与上一图的残差长度平方完全一致。&amp;lt;math&amp;gt;t=0&amp;lt;/math&amp;gt; 对应原点，平方距离为 10；&amp;lt;math&amp;gt;t=2&amp;lt;/math&amp;gt; 对应 &amp;lt;math&amp;gt;2b=(2,4)&amp;lt;/math&amp;gt;，平方距离也为 10。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cauchy-distance.svg|frame|center|alt=平方距离函数五乘t减一的平方加五是一条开口向上的抛物线，最低点一五，t等于零和二时函数值均为十。|沿 b 所在直线移动，最近点由最低的平方距离确定；非负性给出了内积上界。]]&lt;br /&gt;
&lt;br /&gt;
等号条件也可以从证明直接读出。取上述最优 &amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 后，等号成立当且仅当 &amp;lt;math&amp;gt;\|a-tb\|^2=0&amp;lt;/math&amp;gt;。平方和为零意味着每一项都为零，即每个坐标满足 &amp;lt;math&amp;gt;a_i=tb_i&amp;lt;/math&amp;gt;。反过来，若 &amp;lt;math&amp;gt;a=tb&amp;lt;/math&amp;gt;，代入立即得到等号，&amp;lt;math&amp;gt;t&amp;lt;/math&amp;gt; 可以为正、负或零。&lt;br /&gt;
&lt;br /&gt;
== 平方和恒等式给出的另一种解释 ==&lt;br /&gt;
&lt;br /&gt;
在二维中，把两边的差展开，会得到一个完整的平方：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}&amp;amp;(a_1^2+a_2^2)(b_1^2+b_2^2)-(a_1b_1+a_2b_2)^2\\&amp;amp;=a_1^2b_2^2+a_2^2b_1^2-2a_1a_2b_1b_2\\&amp;amp;=(a_1b_2-a_2b_1)^2\ge0.\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
本例右边为 &amp;lt;math&amp;gt;(3\times2-1\times1)^2=25&amp;lt;/math&amp;gt;，左边为 &amp;lt;math&amp;gt;10\times5-5^2=25&amp;lt;/math&amp;gt;，两种计算一致。量 &amp;lt;math&amp;gt;a_1b_2-a_2b_1&amp;lt;/math&amp;gt; 也是二维[[矩阵]]行列式；它的绝对值是两个向量张成的平行四边形面积。若两向量落在同一直线上，面积为零，正好取等号。&lt;br /&gt;
&lt;br /&gt;
在更高维，把展开式中对角项 &amp;lt;math&amp;gt;a_i^2b_i^2&amp;lt;/math&amp;gt; 抵消，再将下标 &amp;lt;math&amp;gt;(i,j)&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;(j,i)&amp;lt;/math&amp;gt; 成对整理，就得到&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left(\sum_i a_i^2\right)\left(\sum_i b_i^2\right)-\left(\sum_i a_ib_i\right)^2=\sum_{i&amp;lt; j}(a_ib_j-a_jb_i)^2.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
右边每一对贡献 &amp;lt;math&amp;gt;a_i^2b_j^2+a_j^2b_i^2-2a_ia_jb_ib_j&amp;lt;/math&amp;gt;，恰好补齐左边所有未抵消的项。这是拉格朗日恒等式，也直接证明了不等式。它说明两边的差由各对坐标偏离比例关系的程度组成。&lt;br /&gt;
&lt;br /&gt;
== 用等号条件求一个真正能达到的上界 ==&lt;br /&gt;
&lt;br /&gt;
若实数 &amp;lt;math&amp;gt;x,y&amp;lt;/math&amp;gt; 满足 &amp;lt;math&amp;gt;x^2+y^2=1&amp;lt;/math&amp;gt;，求 &amp;lt;math&amp;gt;3x+y&amp;lt;/math&amp;gt; 的最大值。把目标看成 &amp;lt;math&amp;gt;(3,1)&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;(x,y)&amp;lt;/math&amp;gt; 的内积，就有&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;|3x+y|\le\sqrt{3^2+1^2}\sqrt{x^2+y^2}=\sqrt{10}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因此 &amp;lt;math&amp;gt;3x+y\le\sqrt{10}&amp;lt;/math&amp;gt;。但一个上界不一定真的能够取到，还必须检查等号。要让内积达到&#039;&#039;&#039;正的&#039;&#039;&#039;最大值，应取与 &amp;lt;math&amp;gt;(3,1)&amp;lt;/math&amp;gt; 同向的单位向量：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(x,y)=\left(\frac3{\sqrt{10}},\frac1{\sqrt{10}}\right).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
此时 &amp;lt;math&amp;gt;x^2+y^2=1&amp;lt;/math&amp;gt;，并且 &amp;lt;math&amp;gt;3x+y=10/\sqrt{10}=\sqrt{10}&amp;lt;/math&amp;gt;，所以上界确实是最大值。反向单位向量给出最小值 &amp;lt;math&amp;gt;-\sqrt{10}&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-cauchy-maximum.svg|frame|center|alt=单位圆上沿三一方向的点为三除以根号十、一除以根号十，直线三x加y等于根号十在该点与圆相切，反向点给出负根号十。|目标函数相同的点排成直线；向外平移至刚好碰到圆的位置，得到可达到的最大值。]]&lt;br /&gt;
&lt;br /&gt;
另一个常见应用是估计平方和。对实数 &amp;lt;math&amp;gt;x_1,\ldots,x_n&amp;lt;/math&amp;gt;，把另一组数取成全一，得到&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;(x_1+\cdots+x_n)^2\le n(x_1^2+\cdots+x_n^2).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
若三数之和固定为 6，则平方和至少为 &amp;lt;math&amp;gt;6^2/3=12&amp;lt;/math&amp;gt;。等号要求 &amp;lt;math&amp;gt;(x_1,x_2,x_3)&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;(1,1,1)&amp;lt;/math&amp;gt; 成比例，结合总和条件只能是 &amp;lt;math&amp;gt;(2,2,2)&amp;lt;/math&amp;gt;。例如 &amp;lt;math&amp;gt;(1,2,3)&amp;lt;/math&amp;gt; 的平方和为 14，大于这个下界。这也解释了为什么在总和固定时，数值越均匀，平方和可以越小。&lt;br /&gt;
&lt;br /&gt;
== 分式形式与正权重 ==&lt;br /&gt;
&lt;br /&gt;
对于实数 &amp;lt;math&amp;gt;x_i&amp;lt;/math&amp;gt; 和严格正数 &amp;lt;math&amp;gt;u_i&amp;lt;/math&amp;gt;，可以选择&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a_i=\frac{x_i}{\sqrt{u_i}},\qquad b_i=\sqrt{u_i}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
把它们代入柯西不等式，内积变为 &amp;lt;math&amp;gt;\sum_i x_i&amp;lt;/math&amp;gt;，两个平方和分别变为 &amp;lt;math&amp;gt;\sum_i x_i^2/u_i&amp;lt;/math&amp;gt; 与 &amp;lt;math&amp;gt;\sum_i u_i&amp;lt;/math&amp;gt;。因为后一个和为正，可以除过去，得到&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\sum_{i=1}^n\frac{x_i^2}{u_i}\ge\frac{(\sum_i x_i)^2}{\sum_i u_i}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
等号要求 &amp;lt;math&amp;gt;x_i/\sqrt{u_i}=t\sqrt{u_i}&amp;lt;/math&amp;gt;，即所有 &amp;lt;math&amp;gt;x_i/u_i&amp;lt;/math&amp;gt; 相同。正权重是这一步代入和除法的条件。允许负权重后，即使权重之和仍为正，结论也可能失败：取 &amp;lt;math&amp;gt;x_1=1,x_2=0&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;u_1=-1,u_2=2&amp;lt;/math&amp;gt;，左边为 −1，右边为 1，原来的“左边大于等于右边”便不成立。&lt;br /&gt;
&lt;br /&gt;
== 向量夹角、函数和随机变量中的同一结构 ==&lt;br /&gt;
&lt;br /&gt;
对于非零实向量，柯西不等式保证&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;-1\le\frac{a\cdot b}{\|a\|\|b\|}\le1.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
因此可以用这个比值定义夹角的余弦。平面与三维空间里，它与通常的几何夹角一致；更高维也能沿用。零向量虽然满足不等式，却不能代入这个夹角公式，因为分母为零。反向向量同样使绝对值形式取等号；如果讨论没有绝对值的上界 &amp;lt;math&amp;gt;a\cdot b\le\|a\|\|b\|&amp;lt;/math&amp;gt;，非零反向向量取得的是下界而非上界。&lt;br /&gt;
&lt;br /&gt;
在一般内积[[向量空间]]中，公式写成 &amp;lt;math&amp;gt;|\langle a,b\rangle|\le\|a\|\|b\|&amp;lt;/math&amp;gt;。复向量的内积要对其中一组坐标取共轭，长度平方使用 &amp;lt;math&amp;gt;\sum|a_i|^2&amp;lt;/math&amp;gt;，不能把实数公式中的平方不加改变地照抄。例如 &amp;lt;math&amp;gt;(1,i)&amp;lt;/math&amp;gt; 的长度平方是 2，而 &amp;lt;math&amp;gt;1^2+i^2=0&amp;lt;/math&amp;gt; 并不是它的长度平方。&lt;br /&gt;
&lt;br /&gt;
把有限求和换成[[积分]]，在实函数 &amp;lt;math&amp;gt;f,g&amp;lt;/math&amp;gt; 平方可积的条件下，可得到&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\left|\int f g\right|^2\le\left(\int f^2\right)\left(\int g^2\right).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
各积分在同一测度空间上进行。其证明仍然来自 &amp;lt;math&amp;gt;\int(f-tg)^2\ge0&amp;lt;/math&amp;gt;；等号对应函数作为平方可积空间中的元素线性相关。若其中一个函数几乎处处为零，自动取等号；否则等号要求两函数几乎处处成固定比例，“几乎处处”表示允许在测度为零的集合上例外。类似地，对于二阶矩有限的随机变量 &amp;lt;math&amp;gt;X,Y&amp;lt;/math&amp;gt;，有 &amp;lt;math&amp;gt;|E(XY)|^2\le E(X^2)E(Y^2)&amp;lt;/math&amp;gt;；将两者减去均值后，就能得到协方差绝对值不超过两个标准差乘积的结论。这些推广都保留了“平方所定义的长度限制内积”这一结构。&lt;br /&gt;
&lt;br /&gt;
== 历史与参考资料 ==&lt;br /&gt;
&lt;br /&gt;
柯西在 1821 年的 &#039;&#039;Cours d’Analyse&#039;&#039; 中发表了有限和形式的不等式。布尼亚科夫斯基在 1859 年发表其积分对应式；施瓦茨后来在极小曲面的研究中需要并发展了积分形式。这段从有限坐标到函数的历史，也反映在今天并存的“柯西—施瓦茨”“柯西—布尼亚科夫斯基”等名称中。[https://assets.cambridge.org/97805218/37750/excerpt/9780521837750_excerpt.pdf J. Michael Steele：Starting with Cauchy，历史说明]&lt;br /&gt;
&lt;br /&gt;
* J. Michael Steele，[https://assets.cambridge.org/97805218/37750/excerpt/9780521837750_excerpt.pdf &#039;&#039;The Cauchy–Schwarz Master Class&#039;&#039;，第 1 章 Starting with Cauchy]，Cambridge University Press，2004。有限和不等式、证明思路、积分推广及其历史。&lt;br /&gt;
* Michael Andrews，[https://math.mit.edu/classes/18.100B/fall_2011/sol2.pdf MIT 18.100B/C Problem Set 2 Solutions]，2011，第 1 题。包括零向量在内的等号条件，以及复向量情形。&lt;br /&gt;
* [https://math.mit.edu/classes/proofsiap/notes/InClass-day10.pdf MIT Introduction to Proofs：Inequalities]。不等式的证明与代入应用。&lt;br /&gt;
* 相关：[[线性代数]]、[[最小二乘法]]、[[优化]]、[[期望]]。&lt;br /&gt;
&lt;br /&gt;
[[分类:代数]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E7%9A%AE%E4%BA%9A%E8%AF%BA%E5%85%AC%E7%90%86&amp;diff=378</id>
		<title>皮亚诺公理</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E7%9A%AE%E4%BA%9A%E8%AF%BA%E5%85%AC%E7%90%86&amp;diff=378"/>
		<updated>2026-09-20T02:04:25Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​补全数学基础、几何定理与模型讲解：完整推导、算例及透明SVG过程图&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;皮亚诺公理&#039;&#039;&#039;（Peano axioms）用一个起点和“取下一个数”的规则来刻画自然数。它回答的不是“怎样更快地计算”，而是“自然数及其运算最基本的规则是什么”。数学归纳法之所以能够从起点与一步推导覆盖所有自然数，就与这套公理中的归纳原则有关。&lt;br /&gt;
&lt;br /&gt;
本文把自然数记为 &amp;lt;math&amp;gt;0,1,2,3,\ldots&amp;lt;/math&amp;gt;，从零开始。有的教材从一开始，使用 &amp;lt;math&amp;gt;1,2,3,\ldots&amp;lt;/math&amp;gt;；两种约定的起点不同，阅读时应先确认。下文先用集合语言介绍公理的结构，再说明它与一阶皮亚诺算术的区别。&lt;br /&gt;
&lt;br /&gt;
== 先有“下一个”，再给数取名字 ==&lt;br /&gt;
&lt;br /&gt;
设 &amp;lt;math&amp;gt;N&amp;lt;/math&amp;gt; 是准备作为自然数的集合，里面有一个指定元素 &amp;lt;math&amp;gt;0&amp;lt;/math&amp;gt;。用[[函数]] &amp;lt;math&amp;gt;S:N\to N&amp;lt;/math&amp;gt; 表示&#039;&#039;&#039;后继&#039;&#039;&#039;：给定一个数，&amp;lt;math&amp;gt;S&amp;lt;/math&amp;gt; 指定它的下一个数。&lt;br /&gt;
&lt;br /&gt;
暂时不用加法来定义后继，而是反过来把&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;1=S(0),\quad2=S(S(0)),\quad3=S(S(S(0)))&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
作为数字的简写。这样，“加一”的含义以后可以由后继来解释，不会一边用加法定义自然数，一边又用自然数解释加法。&lt;br /&gt;
&lt;br /&gt;
下图中的每个箭头都是同一个操作 &amp;lt;math&amp;gt;S&amp;lt;/math&amp;gt;。图只画出有限几个位置；公理所要求的是整个集合中的后继规则，而不是一幅画到某处就停止的图。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-peano-successor.svg|frame|center|alt=从零起的后继链零、一、二、三、四向右延伸，每个箭头标记S，一二三分别是对零施加一次两次三次后继的简称。|数字是位置的名称；后继操作规定怎样从一个位置走到下一个位置。]]&lt;br /&gt;
&lt;br /&gt;
== 用集合表述的公理 ==&lt;br /&gt;
&lt;br /&gt;
在已经指定集合 &amp;lt;math&amp;gt;N&amp;lt;/math&amp;gt;、元素 &amp;lt;math&amp;gt;0\in N&amp;lt;/math&amp;gt; 和函数 &amp;lt;math&amp;gt;S:N\to N&amp;lt;/math&amp;gt; 后，再要求：&lt;br /&gt;
&lt;br /&gt;
# &#039;&#039;&#039;零不是任何数的后继。&#039;&#039;&#039;对所有 &amp;lt;math&amp;gt;n\in N&amp;lt;/math&amp;gt;，都有 &amp;lt;math&amp;gt;S(n)\ne0&amp;lt;/math&amp;gt;。&lt;br /&gt;
# &#039;&#039;&#039;相同后继来自相同的数。&#039;&#039;&#039;对所有 &amp;lt;math&amp;gt;m,n\in N&amp;lt;/math&amp;gt;，若 &amp;lt;math&amp;gt;S(m)=S(n)&amp;lt;/math&amp;gt;，则 &amp;lt;math&amp;gt;m=n&amp;lt;/math&amp;gt;。也就是说，&amp;lt;math&amp;gt;S&amp;lt;/math&amp;gt; 是单射。&lt;br /&gt;
# &#039;&#039;&#039;归纳原则。&#039;&#039;&#039;如果子集 &amp;lt;math&amp;gt;A\subseteq N&amp;lt;/math&amp;gt; 含有零，并且每当 &amp;lt;math&amp;gt;n\in A&amp;lt;/math&amp;gt; 时都有 &amp;lt;math&amp;gt;S(n)\in A&amp;lt;/math&amp;gt;，那么 &amp;lt;math&amp;gt;A=N&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
连同“零属于集合”“每个数都有属于集合的后继”这两条起始约定，常见教材也把它们排成五条。因此看到三条、五条或更多条的列表时，应比较具体内容，而不是只比较条数；等号的逻辑规则是否另列，也会改变表面形式。[https://plato.stanford.edu/entries/logic-higher-order/ Stanford Encyclopedia of Philosophy：后继与归纳对自然数的刻画]&lt;br /&gt;
&lt;br /&gt;
第一条使零成为起点。例如若把三个位置接成 &amp;lt;math&amp;gt;0\to1\to2\to0&amp;lt;/math&amp;gt; 的循环，就违反 &amp;lt;math&amp;gt;S(2)\ne0&amp;lt;/math&amp;gt;。第二条防止两条后继路径合并：若把不同的 &amp;lt;math&amp;gt;u,v&amp;lt;/math&amp;gt; 都接到同一个 &amp;lt;math&amp;gt;w&amp;lt;/math&amp;gt;，就有 &amp;lt;math&amp;gt;S(u)=S(v)&amp;lt;/math&amp;gt; 而 &amp;lt;math&amp;gt;u\ne v&amp;lt;/math&amp;gt;，违反单射。&lt;br /&gt;
&lt;br /&gt;
这两条还说明从零出发不会在某一步回到以前的位置。若 &amp;lt;math&amp;gt;S^i(0)=S^j(0)&amp;lt;/math&amp;gt; 且 &amp;lt;math&amp;gt;i&amp;lt; j&amp;lt;/math&amp;gt;，利用单射连续消去两边最外层的 &amp;lt;math&amp;gt;S&amp;lt;/math&amp;gt; 共 &amp;lt;math&amp;gt;i&amp;lt;/math&amp;gt; 次，会得到 &amp;lt;math&amp;gt;0=S^{j-i}(0)&amp;lt;/math&amp;gt;。右边至少施加了一次后继，与零不是后继矛盾。因此从零反复出发得到的各个位置互不相同。&lt;br /&gt;
&lt;br /&gt;
== 归纳公理排除了哪种多余结构 ==&lt;br /&gt;
&lt;br /&gt;
只有起点与单射后继，还不足以排除完全游离在起点之外的元素。考虑一个更大的集合：一部分是普通的链 &amp;lt;math&amp;gt;0,1,2,\ldots&amp;lt;/math&amp;gt;；另一部分是带不同名称的元素 &amp;lt;math&amp;gt;u_k&amp;lt;/math&amp;gt;，其中 &amp;lt;math&amp;gt;k&amp;lt;/math&amp;gt; 遍历全部整数。规定&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;S(n)=n+1,\qquad S(u_k)=u_{k+1}.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
第二部分与第一部分互不相交，&amp;lt;math&amp;gt;u_0&amp;lt;/math&amp;gt; 尤其不等于自然数零。这个结构中，每个元素都有后继，后继函数是单射，零也不是任何后继，但还多出了一整条双向延伸的链。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-peano-extra-chain.svg|frame|center|alt=上排是从零开始的自然数后继链，下排是互不相交的u下标整数链并向左右延伸；上排包含零且对后继封闭，却不包含下排，因而违背全子集归纳。|归纳原则不是只检查相邻箭头；它还要求包含起点且对后继封闭的子集已经是整个集合。]]&lt;br /&gt;
&lt;br /&gt;
现在取 &amp;lt;math&amp;gt;A=\{0,1,2,\ldots\}&amp;lt;/math&amp;gt;，即只取上排。它含有零，对后继也封闭，却没有包含任何 &amp;lt;math&amp;gt;u_k&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 不是整个集合。这恰好违反第三条归纳原则。图中的额外链是说明“缺少归纳时会出现什么”的反例，只涉及后继结构，并不是一个已经满足完整皮亚诺算术的模型。&lt;br /&gt;
&lt;br /&gt;
对于任意性质 &amp;lt;math&amp;gt;P(n)&amp;lt;/math&amp;gt;，可以把满足该性质的数收集成 &amp;lt;math&amp;gt;A=\{n\in N:P(n)\}&amp;lt;/math&amp;gt;。要证明 &amp;lt;math&amp;gt;A=N&amp;lt;/math&amp;gt;，便分成两件事：证明 &amp;lt;math&amp;gt;P(0)&amp;lt;/math&amp;gt;，以及证明对任意 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt;，由 &amp;lt;math&amp;gt;P(n)&amp;lt;/math&amp;gt; 可推出 &amp;lt;math&amp;gt;P(S(n))&amp;lt;/math&amp;gt;。这就是数学归纳法的起始步骤与归纳步骤。&lt;br /&gt;
&lt;br /&gt;
起始步骤不能省略。例如性质“&amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 是正数”具有“若成立，则后继处仍成立”的特点，但在零处为假，所以不能推出所有自然数都为正数。只验算 &amp;lt;math&amp;gt;0,1,2&amp;lt;/math&amp;gt; 等若干项也不能代替一般的归纳步骤。&lt;br /&gt;
&lt;br /&gt;
== 用后继逐步建立加法和乘法 ==&lt;br /&gt;
&lt;br /&gt;
有了后继，可以在通常自然数结构上递归定义运算。加法按第二个变量给出两条规则：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a+0=a,\qquad a+S(b)=S(a+b).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
第一条说没有增加任何次；第二条说，在已有 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 次的结果上再取一次后继。自然数的递归定理保证这些逐步规则确定唯一的运算；这里先看规则怎样进行一次具体计算。&lt;br /&gt;
&lt;br /&gt;
因为 &amp;lt;math&amp;gt;3=S(2)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;2=S(1)&amp;lt;/math&amp;gt;、&amp;lt;math&amp;gt;1=S(0)&amp;lt;/math&amp;gt;，所以&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\begin{aligned}2+3&amp;amp;=S(2+2)\\&amp;amp;=S(S(2+1))\\&amp;amp;=S(S(S(2+0)))\\&amp;amp;=S(S(S(2)))=5.\end{aligned}&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
下图把计算分成两行。上行记录第二个参数 &amp;lt;math&amp;gt;b&amp;lt;/math&amp;gt; 的变化，下行记录对应结果 &amp;lt;math&amp;gt;2+b&amp;lt;/math&amp;gt;：上面每多走一步，下面也必须多走一步。运算结果不是由数字外观猜来的，而是由起点 &amp;lt;math&amp;gt;2+0=2&amp;lt;/math&amp;gt; 和递推规则共同决定。&lt;br /&gt;
&lt;br /&gt;
[[File:Gezhi-expand-peano-addition.svg|frame|center|alt=上排参数b从零经后继走到一二三，下排二加b从二同步走到三四五，每列用对应线连接。|固定第一个数 2；加上 3，就是从 2 连续取三次后继。]]&lt;br /&gt;
&lt;br /&gt;
乘法再由加法递归定义：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;a\cdot0=0,\qquad a\cdot S(b)=a\cdot b+a.&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
于是 &amp;lt;math&amp;gt;2\cdot1=0+2=2&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;2\cdot2=2+2=4&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;2\cdot3=4+2=6&amp;lt;/math&amp;gt;。这里每增加一次第二个因子，就多加一份第一个因子；它与加法中每步多取一次后继相呼应。&lt;br /&gt;
&lt;br /&gt;
递归规则并没有把所有熟悉的代数规律都预先列出来。例如 &amp;lt;math&amp;gt;a+0=a&amp;lt;/math&amp;gt; 是定义中的规则，但 &amp;lt;math&amp;gt;0+a=a&amp;lt;/math&amp;gt; 还需要证明，不能在证明交换律之前直接交换两个加数。&lt;br /&gt;
&lt;br /&gt;
== 一次完整的归纳证明：零加在左边 ==&lt;br /&gt;
&lt;br /&gt;
证明对每个自然数 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt;，都有 &amp;lt;math&amp;gt;0+n=n&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;起始步骤。&#039;&#039;&#039;当 &amp;lt;math&amp;gt;n=0&amp;lt;/math&amp;gt; 时，按规则 &amp;lt;math&amp;gt;a+0=a&amp;lt;/math&amp;gt;，取 &amp;lt;math&amp;gt;a=0&amp;lt;/math&amp;gt; 得 &amp;lt;math&amp;gt;0+0=0&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;归纳步骤。&#039;&#039;&#039;假设某个任意自然数 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 满足 &amp;lt;math&amp;gt;0+n=n&amp;lt;/math&amp;gt;。对于它的后继，先用加法的递归规则，再用这个假设：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;0+S(n)=S(0+n)=S(n).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
所以性质从 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 传递到 &amp;lt;math&amp;gt;S(n)&amp;lt;/math&amp;gt;。由归纳原则，它对所有自然数成立。这个证明中的假设只用于“若第 &amp;lt;math&amp;gt;n&amp;lt;/math&amp;gt; 步成立，则下一步成立”的条件推导，并没有先假设结论对所有数成立。[https://ocw.mit.edu/courses/24-242-logic-ii-spring-2004/2ba966be09dd1301d41d98be9276f3d1_peano_arithmetic.pdf MIT：Peano Arithmetic，命题 2]&lt;br /&gt;
&lt;br /&gt;
同样的办法可以逐步证明加法交换律、结合律，以及乘法的相应规律。每个证明应说明使用的是哪条递归规则和哪一个归纳假设。&lt;br /&gt;
&lt;br /&gt;
== 一阶皮亚诺算术：一个公理模式 ==&lt;br /&gt;
&lt;br /&gt;
在形式[[逻辑]]中，需要说明“对所有性质”怎样表达。&#039;&#039;&#039;一阶&#039;&#039;&#039;语言的变量只遍历结构中的数，不直接遍历数的所有子集。通常的一阶皮亚诺算术，简称 &#039;&#039;&#039;PA&#039;&#039;&#039;，使用常量 &amp;lt;math&amp;gt;0&amp;lt;/math&amp;gt;、后继 &amp;lt;math&amp;gt;S&amp;lt;/math&amp;gt;、加法 &amp;lt;math&amp;gt;+&amp;lt;/math&amp;gt;、乘法 &amp;lt;math&amp;gt;\cdot&amp;lt;/math&amp;gt; 与等号。后继的非零性、单射性和上面的四条运算递归等式作为公理；归纳部分则是一个&#039;&#039;&#039;公理模式&#039;&#039;&#039;。&lt;br /&gt;
&lt;br /&gt;
具体地，对这套语言里的每一个公式 &amp;lt;math&amp;gt;\varphi(n,\bar y)&amp;lt;/math&amp;gt;，都取下面这个句子作为归纳公理：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\forall\bar y\,\Bigl[\bigl(\varphi(0,\bar y)\land\forall n(\varphi(n,\bar y)\Rightarrow\varphi(S(n),\bar y))\bigr)\Rightarrow\forall n\,\varphi(n,\bar y)\Bigr].&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
这里 &amp;lt;math&amp;gt;\bar y&amp;lt;/math&amp;gt; 表示公式中可能出现的一组额外数值参数。选定参数后，它们在归纳过程中保持不变；最外层的全称量词使这条公理对所有参数值都适用。刚才证明 &amp;lt;math&amp;gt;0+n=n&amp;lt;/math&amp;gt;，便对应没有额外参数的公式 &amp;lt;math&amp;gt;\varphi(n):0+n=n&amp;lt;/math&amp;gt;。&lt;br /&gt;
&lt;br /&gt;
“模式”不是把字母 &amp;lt;math&amp;gt;\varphi&amp;lt;/math&amp;gt; 当作一个可量化的数值变量，而是在理论外规定：每一个合适的公式都贡献一条公理。因此它包含无限多条公理，每一条仍然只在一阶语言中量化数。它保证所有&#039;&#039;&#039;用公式及参数可定义的性质&#039;&#039;&#039;满足归纳，但没有直接量化结构的全部子集。[https://ocw.mit.edu/courses/24-242-logic-ii-spring-2004/resources/peano_arithmetic/ MIT Logic II：归纳模式与全体子集的区别]&lt;br /&gt;
&lt;br /&gt;
== 二阶归纳与“只有一种自然数结构” ==&lt;br /&gt;
&lt;br /&gt;
若允许变量 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt; 直接遍历子集，就能用一个二阶句子表达开头的归纳原则：&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;\forall A\,\Bigl[\bigl(0\in A\land\forall n(n\in A\Rightarrow S(n)\in A)\bigr)\Rightarrow\forall n(n\in A)\Bigr].&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
在&#039;&#039;&#039;完全语义&#039;&#039;&#039;下，“对所有 &amp;lt;math&amp;gt;A&amp;lt;/math&amp;gt;”指的是结构底集的所有子集，而不只是可用一阶公式写出的那些子集。这个解释与后继公理一起，使自然数结构&#039;&#039;&#039;在同构意义下唯一&#039;&#039;&#039;，也称具有范畴性。所谓同构，是存在一个一一对应，保持起点与后继；元素可以换名字，但生成结构相同。[https://plato.stanford.edu/entries/logic-higher-order/ Stanford Encyclopedia of Philosophy：归纳、完全语义与范畴性]&lt;br /&gt;
&lt;br /&gt;
证明的核心可以直接看出来。取一个满足这些二阶条件的结构 &amp;lt;math&amp;gt;M&amp;lt;/math&amp;gt;，从通常自然数向它定义&lt;br /&gt;
&lt;br /&gt;
&amp;lt;math display=&amp;quot;block&amp;quot;&amp;gt;f(k)=S_M^k(0_M).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
第一步映到它的起点，每向前一步就映到后继，因此 &amp;lt;math&amp;gt;f(0)=0_M&amp;lt;/math&amp;gt;，&amp;lt;math&amp;gt;f(k+1)=S_M(f(k))&amp;lt;/math&amp;gt;。前面已证明从起点重复取后继不会碰到旧位置，所以 &amp;lt;math&amp;gt;f&amp;lt;/math&amp;gt; 单射。它的像集含有 &amp;lt;math&amp;gt;0_M&amp;lt;/math&amp;gt;，又对 &amp;lt;math&amp;gt;S_M&amp;lt;/math&amp;gt; 封闭；&#039;&#039;&#039;全子集&#039;&#039;&#039;归纳可以应用到这个像集，推出像集就是整个 &amp;lt;math&amp;gt;M&amp;lt;/math&amp;gt;，所以 &amp;lt;math&amp;gt;f&amp;lt;/math&amp;gt; 也满射。这就建立了保持后继的一一对应。若加法、乘法按上述递归规则给出，它们也随起点与后继一起被保持。&lt;br /&gt;
&lt;br /&gt;
一阶 PA 的情况不同：它存在与通常自然数不同构的&#039;&#039;&#039;非标准模型&#039;&#039;&#039;。说明其存在的一种方法是在 PA 的语言里增加一个常量 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt;，再要求 &amp;lt;math&amp;gt;c&amp;gt; 0,c&amp;gt; 1,c&amp;gt; 2,\ldots&amp;lt;/math&amp;gt;。这里可以用加法定义严格次序：&amp;lt;math&amp;gt;x&amp;gt; y&amp;lt;/math&amp;gt; 表示存在 &amp;lt;math&amp;gt;z&amp;lt;/math&amp;gt;，使 &amp;lt;math&amp;gt;x=y+S(z)&amp;lt;/math&amp;gt;，也就是比 &amp;lt;math&amp;gt;y&amp;lt;/math&amp;gt; 多一个正数。任何有限多条要求都能在通常自然数中满足，只需把 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 取成一个足够大的数；一阶逻辑的紧致性定理因而给出满足全部要求的模型，其中 &amp;lt;math&amp;gt;c&amp;lt;/math&amp;gt; 大于每个标准数词。这里用了紧致性这一逻辑定理，并不是凭图画构造出了非标准模型。&lt;br /&gt;
&lt;br /&gt;
这不意味着一阶归纳失效：模型满足每一个归纳公式。问题在于，外部所见的“从零走标准有限步得到的元素”在非标准模型中不能由一个带参数的一阶公式定义。否则，它含零又对后继封闭，归纳模式便会迫使它包含整个模型，与非标准元素的存在矛盾。因此不能直接拿这个外部子集代入一阶模式，当作对全部子集的量化。[https://ocw.mit.edu/courses/24-242-logic-ii-spring-2004/2ba966be09dd1301d41d98be9276f3d1_peano_arithmetic.pdf MIT：非标准模型与归纳模式]&lt;br /&gt;
&lt;br /&gt;
若二阶变量也只遍历指定的一族子集，即采用一般语义或 Henkin 语义，就不能照搬完全语义下的范畴性结论。区分一阶、二阶及其语义，是在讨论公理到底刻画了什么，而不是改变日常自然数的计算结果。&lt;br /&gt;
&lt;br /&gt;
== 零起点与一起点怎样对应 ==&lt;br /&gt;
&lt;br /&gt;
把“起点”为零换成一，后继链仍然具有同样的形状。只看起点与后继时，映射 &amp;lt;math&amp;gt;k\mapsto k+1&amp;lt;/math&amp;gt; 把零起点的链一一对应到一起点的链，并保持后继。&lt;br /&gt;
&lt;br /&gt;
不过，这不表示普通加法也在这个平移下自动保持。例如 &amp;lt;math&amp;gt;f(0+0)=1&amp;lt;/math&amp;gt;，而 &amp;lt;math&amp;gt;f(0)+f(0)=2&amp;lt;/math&amp;gt;。若要把整个算术结构也一并搬过去，需要相应搬运运算的定义；不能一面平移起点，一面原封不动地把加法单位元仍当作同一个标签。通常教材只是分别声明自然数是否包含零，并在各自范围中使用熟悉的运算。&lt;br /&gt;
&lt;br /&gt;
== 历史与参考资料 ==&lt;br /&gt;
&lt;br /&gt;
朱塞佩·皮亚诺（Giuseppe Peano，1858—1932）在 1889 年的拉丁文著作 &#039;&#039;Arithmetices principia, nova methodo exposita&#039;&#039; 中发表了著名的算术公理。它将自然数的基本关系用符号明确列出，是数学基础与符号逻辑发展中的重要工作。[https://mathshistory.st-andrews.ac.uk/Biographies/Peano/ 圣安德鲁斯大学 MacTutor：Giuseppe Peano]&lt;br /&gt;
&lt;br /&gt;
自然数的结构刻画也与戴德金的工作紧密相关；MIT 的算术讲义将任意两个满足完整归纳原则的算术结构同构这一结果归于戴德金。因此文献中也会出现“戴德金—皮亚诺公理”的称呼。现代一阶 PA 的归纳模式、非标准模型以及完全二阶语义，是进一步澄清这些原始结构思想后形成的逻辑区分。&lt;br /&gt;
&lt;br /&gt;
* Vann McGee，[https://ocw.mit.edu/courses/24-242-logic-ii-spring-2004/2ba966be09dd1301d41d98be9276f3d1_peano_arithmetic.pdf Peano Arithmetic]，MIT 24.242 Logic II，2004。运算递归、公理模式、归纳证明与模型的区别。&lt;br /&gt;
* Jouko Väänänen，[https://plato.stanford.edu/entries/logic-higher-order/ Second-order and Higher-order Logic]，&#039;&#039;Stanford Encyclopedia of Philosophy&#039;&#039;。后继公理、二阶归纳、完全语义、一般语义与范畴性。&lt;br /&gt;
* J. J. O&#039;Connor、E. F. Robertson，[https://mathshistory.st-andrews.ac.uk/Biographies/Peano/ Giuseppe Peano]，MacTutor。1889 年著作及历史背景。&lt;br /&gt;
&lt;br /&gt;
[[分类:基础与逻辑]]&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-time.svg&amp;diff=377</id>
		<title>文件:Gezhi-expand-predator-time.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-time.svg&amp;diff=377"/>
		<updated>2026-09-20T02:03:31Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-phase.svg&amp;diff=376</id>
		<title>文件:Gezhi-expand-predator-phase.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-phase.svg&amp;diff=376"/>
		<updated>2026-09-20T02:03:26Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-numerics.svg&amp;diff=375</id>
		<title>文件:Gezhi-expand-predator-numerics.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-numerics.svg&amp;diff=375"/>
		<updated>2026-09-20T02:03:23Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-nullclines.svg&amp;diff=374</id>
		<title>文件:Gezhi-expand-predator-nullclines.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-predator-nullclines.svg&amp;diff=374"/>
		<updated>2026-09-20T02:03:19Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-residues.svg&amp;diff=373</id>
		<title>文件:Gezhi-expand-pigeonhole-residues.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-residues.svg&amp;diff=373"/>
		<updated>2026-09-20T02:03:17Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-prefix.svg&amp;diff=372</id>
		<title>文件:Gezhi-expand-pigeonhole-prefix.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-prefix.svg&amp;diff=372"/>
		<updated>2026-09-20T02:03:14Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-boxes.svg&amp;diff=371</id>
		<title>文件:Gezhi-expand-pigeonhole-boxes.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-pigeonhole-boxes.svg&amp;diff=371"/>
		<updated>2026-09-20T02:03:12Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-successor.svg&amp;diff=370</id>
		<title>文件:Gezhi-expand-peano-successor.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-successor.svg&amp;diff=370"/>
		<updated>2026-09-20T02:03:07Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-extra-chain.svg&amp;diff=369</id>
		<title>文件:Gezhi-expand-peano-extra-chain.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-extra-chain.svg&amp;diff=369"/>
		<updated>2026-09-20T02:03:04Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-addition.svg&amp;diff=368</id>
		<title>文件:Gezhi-expand-peano-addition.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-peano-addition.svg&amp;diff=368"/>
		<updated>2026-09-20T02:03:02Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-normal-common-offset.svg&amp;diff=367</id>
		<title>文件:Gezhi-expand-normal-common-offset.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-normal-common-offset.svg&amp;diff=367"/>
		<updated>2026-09-20T02:02:59Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-normal-averages.svg&amp;diff=366</id>
		<title>文件:Gezhi-expand-normal-averages.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-normal-averages.svg&amp;diff=366"/>
		<updated>2026-09-20T02:02:56Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-model-residual-pattern.svg&amp;diff=365</id>
		<title>文件:Gezhi-expand-model-residual-pattern.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-model-residual-pattern.svg&amp;diff=365"/>
		<updated>2026-09-20T02:02:53Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-model-prediction-interval.svg&amp;diff=364</id>
		<title>文件:Gezhi-expand-model-prediction-interval.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-model-prediction-interval.svg&amp;diff=364"/>
		<updated>2026-09-20T02:02:51Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-linear-solutions.svg&amp;diff=363</id>
		<title>文件:Gezhi-expand-linear-solutions.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-linear-solutions.svg&amp;diff=363"/>
		<updated>2026-09-20T02:02:49Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-linear-markov.svg&amp;diff=362</id>
		<title>文件:Gezhi-expand-linear-markov.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-linear-markov.svg&amp;diff=362"/>
		<updated>2026-09-20T02:02:46Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-least-influence.svg&amp;diff=361</id>
		<title>文件:Gezhi-expand-least-influence.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-least-influence.svg&amp;diff=361"/>
		<updated>2026-09-20T02:02:44Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-least-contours.svg&amp;diff=360</id>
		<title>文件:Gezhi-expand-least-contours.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-least-contours.svg&amp;diff=360"/>
		<updated>2026-09-20T02:02:41Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-incircle.svg&amp;diff=359</id>
		<title>文件:Gezhi-expand-heron-incircle.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-incircle.svg&amp;diff=359"/>
		<updated>2026-09-20T02:02:35Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-height.svg&amp;diff=358</id>
		<title>文件:Gezhi-expand-heron-height.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-height.svg&amp;diff=358"/>
		<updated>2026-09-20T02:02:32Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-degeneracy.svg&amp;diff=357</id>
		<title>文件:Gezhi-expand-heron-degeneracy.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-heron-degeneracy.svg&amp;diff=357"/>
		<updated>2026-09-20T02:02:30Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-time.svg&amp;diff=356</id>
		<title>文件:Gezhi-expand-difference-time.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-time.svg&amp;diff=356"/>
		<updated>2026-09-20T02:02:28Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-euler.svg&amp;diff=355</id>
		<title>文件:Gezhi-expand-difference-euler.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-euler.svg&amp;diff=355"/>
		<updated>2026-09-20T02:02:25Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-cobweb.svg&amp;diff=354</id>
		<title>文件:Gezhi-expand-difference-cobweb.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-difference-cobweb.svg&amp;diff=354"/>
		<updated>2026-09-20T02:02:23Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-projection.svg&amp;diff=353</id>
		<title>文件:Gezhi-expand-cosine-projection.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-projection.svg&amp;diff=353"/>
		<updated>2026-09-20T02:02:20Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-obtuse.svg&amp;diff=352</id>
		<title>文件:Gezhi-expand-cosine-obtuse.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-obtuse.svg&amp;diff=352"/>
		<updated>2026-09-20T02:02:18Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
	<entry>
		<id>https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-distance.svg&amp;diff=351</id>
		<title>文件:Gezhi-expand-cosine-distance.svg</title>
		<link rel="alternate" type="text/html" href="https://gezhi.wiki/index.php?title=%E6%96%87%E4%BB%B6:Gezhi-expand-cosine-distance.svg&amp;diff=351"/>
		<updated>2026-09-20T02:02:15Z</updated>

		<summary type="html">&lt;p&gt;AIContentBot：​AI 内容流程上传站内图片&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本站数学条目配图。&lt;/div&gt;</summary>
		<author><name>AIContentBot</name></author>
	</entry>
</feed>