跳到正文
格致开物MATHWIKI

概率:修订间差异

AIContentBot留言 | 贡献
扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航
AIContentBot留言 | 贡献
串联统计图与概率分布的学习路径和分类导航
 
(未显示同一用户的1个中间版本)
第1行: 第1行:
'''概率'''(probability)是对随机事件赋予数值的一套数学规则,用来描述在给定模型下事件发生的不确定性。事件的概率介于 0 与 1 之间。概率值来自对样本空间及其分布的建模,不能仅凭“可能发生”就认定各结果等可能。
'''概率'''(probability)用0到1之间的数描述事件在一个随机模型中发生的可能程度。0表示概率为零,1表示概率为一。怎样给事件分配数值,可以先从两枚骰子的点数看起。
 
 
== English overview ==
<div lang="en" class="math-english-summary">
Probability assigns numerical weights to events within an explicitly chosen model. A sample space describes possible outcomes, a collection of measurable events specifies which questions can be asked, and a probability measure satisfies non-negativity, normalization, and countable additivity. Equal likelihood is an additional assumption, not a consequence of listing a finite number of possibilities.
 
This article develops probability from dice and sampling examples before introducing conditional probability and independence. The distinction between mutually exclusive events and independent events is essential: two events of positive probability cannot have both properties. Conditional probability changes the reference population, whereas a random variable transforms outcomes into numerical observations. Continuous models assign probabilities to intervals through integration; a density value is not itself a probability. We derive the addition rule, the law of total probability, and a simple concentration bound to show how the axioms support calculation. Historical discussion separates seventeenth-century problems of fair division from the measure-theoretic formulation established in the twentieth century. Applications require checking whether the chosen outcomes, independence assumptions, and parameter values describe the actual process.
</div>
 
== 样本空间、事件与三条公理 ==
样本空间 <math>\Omega</math> 是所有可能结果的集合,事件是其中可赋予概率的子集。在一般概率论中,这些事件组成一个 σ 代数;有限样本空间通常取全部子集作为事件。
 
概率函数 <math>P</math> 满足非负性、<math>P(\Omega)=1</math>,以及对两两互斥事件的可列可加性:
<math display="block">P\left(\bigcup_{n=1}^{\infty}A_n\right)=\sum_{n=1}^{\infty}P(A_n).</math>
由此可推出补事件公式 <math>P(A^c)=1-P(A)</math>,以及加法公式
<math display="block">P(A\cup B)=P(A)+P(B)-P(A\cap B).</math>
最后一项用于扣除重复计数的交集。


== 两枚骰子为什么有 36 种等可能结果 ==
== 两枚骰子为什么有 36 种等可能结果 ==
假设两枚公平六面骰独立投掷,用有序对 <math>(i,j)</math> 记录结果。共有 <math>6\times6=36</math> 个等可能结果,而不是把和为 2 到 12 的 11 个数看成等可能。
假设两枚公平六面骰独立投掷,用有序对 <math>(i,j)</math> 记录结果。第一枚的六种结果各对应第二枚的六种结果,因此有 <math>6\times6=36</math> 个等可能的有序对。图中横、纵坐标分别记录两枚点数,每个格子概率都是 <math>1/36</math>。


[[File:Gezhi-probability-dice.svg|frame|center|alt=六乘六的骰子结果网格,反对角线的六个格子标出两数之和为七的结果|有序对等可能,但它们的和不等可能;和为 7 有 6 种结果,和为 2 只有一种。]]
[[File:Gezhi-probability-dice-theme.svg|frame|center|alt=六乘六的骰子结果网格,反对角线的六个格子标出两数之和为七的结果|有序对等可能,但它们的和不等可能;和为 7 有 6 种结果,和为 2 只有一种。]]
和为 7 的结果为 <math>(1,6),(2,5),\ldots,(6,1)</math>,故概率为 <math>6/36=1/6</math>。至少一枚为 6 的概率则为
和为 7 的结果为 <math>(1,6),(2,5),\ldots,(6,1)</math>,故概率为 <math>6/36=1/6</math>。至少一枚为 6 的概率则为
<math display="block">\frac16+\frac16-\frac1{36}=\frac{11}{36}.</math>
<math display="block">\frac16+\frac16-\frac1{36}=\frac{11}{36}.</math>
减去的 <math>1/36</math> 是两枚都为 6 的情形。也可以取补事件:<math>1-(5/6)^2=11/36</math>。
减去的 <math>1/36</math> 是两枚都为 6 的情形。也可以取补事件:<math>1-(5/6)^2=11/36</math>。


== 条件概率:已知信息改变了范围 ==
== 结果、事件与随机变量 ==
<math>P(B)>0</math> 时,定义
把刚才的36个有序对放在一起,便得到样本空间,通常记作 <math>\Omega</math>。其中“和为7”的六个格子组成一个事件。投两枚骰子可以记录有序点数、点数和,也可以只记录“是否相等”。这三种记录方式的信息量不同,不能把它们当成同一个样本空间再套用相同的均匀分布。
<math display="block">P(A\mid B)=\frac{P(A\cap B)}{P(B)}.</math>
假设已知第一枚骰子为 6,此时两枚之和为 7 的概率是 <math>1/6</math>;如果已知至少一枚为 6,则剩余 11 个等可能结果中只有 <math>(1,6)</math>、<math>(6,1)</math> 的和为 7,概率变为 <math>2/11</math>。信息的措辞决定条件事件,不能省略。


== 独立与互斥是不同概念 ==
设原始结果为 <math>\omega=(i,j)</math>,定义随机变量 <math>S(\omega)=i+j</math>。和为 7 的事件就是 <math>\{\omega:S(\omega)=7\}</math>。从结果转为数值,是一个[[函数]];这个函数通常把多个原始结果映射到同一个数。因此,原始结果等可能并不能推出函数值等可能。这一层区分也适用于“抽到哪件产品”和“抽到的产品是否合格”。
事件独立意味着 <math>P(A\cap B)=P(A)P(B)</math>;互斥意味着 <math>A\cap B=\varnothing</math>。两个概率都为正的互斥事件不独立,因为其中一个发生就排除了另一个。


单枚骰子的“结果为偶数”与“结果为 6”并不独立;两枚独立骰子各自“为偶数”的事件则独立。独立性是模型条件,需要由过程或数据支持,不能把乘法当作默认规则。
== 样本空间、事件与三条公理 ==
在有限样本空间中,每个子集都可作为事件。概率函数 <math>P</math> 为事件赋值。骰子模型中,一个事件包含多少格子,其概率就是格子数除以36;更一般的模型不要求结果等可能,但遵守以下规则。


== 概率、频率与概率为零 ==
每个事件的概率非负;整个样本空间的概率为1;若一列事件 <math>A_1,A_2,\ldots</math> 两两不重叠,则它们“至少一个发生”的概率是各自概率之和,即可列可加性:
重复独立且同分布的试验中,大数定律说明事件频率会以适当的概率意义接近其概率。它不保证短期结果均衡,也不意味着前面连续出现某结果后,下一次必须“补偿”。
<math display="block">P\left(\bigcup_{n=1}^{\infty}A_n\right)=\sum_{n=1}^{\infty}P(A_n).</math>
 
符号 <math>\bigcup</math> 表示取并集。一般无限空间只对一族指定的事件使用这些规则;这族事件须包含全集,并对补集和可数并封闭。
连续分布还存在概率为零但并非空集的事件。例如在 <math>[0,1]</math> 均匀取数,恰好取到 <math>1/2</math> 的概率为零。连续模型使用区间概率与密度,不能把“每个点概率为零”理解为“没有任何值能出现”。
 
== 把一次随机试验描述完整 ==
“随机”并不是说事件没有原因,而是说当前描述没有把结果当作已经确定的已知量。建模的第一步是约定究竟记录什么。投两枚骰子可以记录有序点数、点数和,也可以只记录“是否相等”。这三种记录方式的信息量不同,不能把它们当成同一个样本空间再套用相同的均匀分布。
 
设原始结果为 <math>\omega=(i,j)</math>,定义随机变量 <math>S(\omega)=i+j</math>。和为 7 的事件就是 <math>\{\omega:S(\omega)=7\}</math>。从结果转为数值,是一个[[函数]];这个函数通常把多个原始结果映射到同一个数。因此,原始结果等可能并不能推出函数值等可能。这一层区分也适用于“抽到哪件产品”和“抽到的产品是否合格”。
 
事件集合为什么还需要封闭性?如果能够询问 A 是否发生,也应能够询问 A 不发生、A 与 B 至少一个发生。σ 代数包含全集,对补集和可数并封闭,从而也对可数交封闭。在有限例子中直接取所有子集就足够;在连续空间中,这一限制保证积分和概率运算协调。入门阶段不必构造不可测集,但不能把一般概率论说成“对任意集合随便分配一个数”。


== 从公理推导加法公式 ==
== 从公理推导加法公式 ==
先由 <math>\Omega=\Omega\cup\varnothing</math> 的不交并得到 <math>P(\varnothing)=0</math>。再把全集分成 A 与补集,便有 <math>P(A)+P(A^c)=1</math>。若 <math>A\subseteq B</math>,则 B 是 A 与 <math>B\setminus A</math> 的不交并,非负性给出 <math>P(A)\le P(B)</math>。所以概率具有单调性,不是额外记忆的一条经验规律。
空集 <math>\varnothing</math> 表示不含任何结果的事件。由 <math>\Omega=\Omega\cup\varnothing</math> 的不交并得到 <math>P(\varnothing)=0</math>。再把全集分成 A 与补集,便有 <math>P(A)+P(A^c)=1</math>。若 <math>A\subseteq B</math>,则 B 是 A 与 <math>B\setminus A</math> 的不交并,非负性给出 <math>P(A)\le P(B)</math>。所以概率具有单调性,不是额外记忆的一条经验规律。


对于可能重叠的 A、B,先拆成三个互斥区域:只属于 A、两者共同部分、只属于 B。把 <math>P(A)+P(B)</math> 展开,交集被算了两次;并集只应算一次,因而必须减去一个交集概率。这一推导说明公式为什么成立,也指出“直接相加”只适用于交集概率为零的情形。互斥当然能保证这一点,但连续模型中交集非空却概率为零也可能出现。
用 <math>A\cup B</math> 表示至少一个发生,<math>A\cap B</math> 表示两者都发生。对于可能重叠的A、B,先拆成三个互斥区域:只属于 A、两者共同部分、只属于 B。把 <math>P(A)+P(B)</math> 展开,交集被算了两次;并集只应算一次,因此
<math display="block">P(A\cup B)=P(A)+P(B)-P(A\cap B).</math>
回到“至少一枚为6”:各枚为6的概率都是1/6,两枚都为6的格子被算两次,要减去1/36,正好得到11/36。这一推导说明公式为什么成立,也指出“直接相加”只适用于交集概率为零的情形。互斥当然能保证这一点,但连续模型中交集非空却概率为零也可能出现。


更一般地,将样本空间分割为有限个互斥事件 <math>B_1,\ldots,B_m</math>,且每个 <math>P(B_i)>0</math>,则
更一般地,将样本空间分割为有限个互斥事件 <math>B_1,\ldots,B_m</math>,且每个 <math>P(B_i)>0</math>,则
第57行: 第32行:
第一步使用事件分割,第二步使用条件概率定义。这就是全概率公式,其实质是按来源分组加权;不能把组内概率直接做无权平均。相关定义与推导可参见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class03-prep_pdf/ MIT 18.05 第 3 讲]。
第一步使用事件分割,第二步使用条件概率定义。这就是全概率公式,其实质是按来源分组加权;不能把组内概率直接做无权平均。相关定义与推导可参见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class03-prep_pdf/ MIT 18.05 第 3 讲]。


== 不放回抽样怎样改变第二步 ==
== 条件概率:已知信息改变了范围 ==
袋中有 3 个红球、2 个蓝球,球除颜色外可区分且每次从剩余球中等可能抽取。连续抽两球且不放回。第一球为红的概率是 <math>3/5</math>;已知第一球红,第二球红的概率是 <math>2/4</math>,故两球都红的概率为 <math>(3/5)(2/4)=3/10</math>。这里的乘法用的是条件概率,绝不是假设两次抽取独立。
先看一枚公平骰子。设 <math>A</math> 为点数等于6,<math>B</math> 为点数是偶数。未得到信息时,A占六个结果中的一个,概率为 <math>1/6</math>;已知B以后,候选只剩2、4、6,A占三个中的一个,条件概率为 <math>1/3</math>。
 
下图上排保留全部六个等可能结果,下排划去奇数。剩余的2、4、6重新分配总概率1,各占 <math>1/3</math>;金框始终指同一个结果6,改变的是作为分母的参照范围。


恰好一个红球有两条互斥路径:先红后蓝与先蓝后红。因此其概率为 <math>(3/5)(2/4)+(2/5)(3/4)=3/5</math>。两球都蓝的概率为 <math>(2/5)(1/4)=1/10</math>。三类结果之和为 1,这是检查计算的一种方式。也可以用无序组合验证:红蓝组合有 <math>3\times2=6</math> 个,所有两球组合有 <math>\binom52=10</math> 个,答案仍为 <math>6/10</math>。
[[File:Gezhi-analysis-probability-condition.svg|frame|center|alt=上排骰子一到六每个概率六分之一,下排已知偶数后只保留二四六且每个概率三分之一,结果六始终用金色框标出|条件概率在保留的样本范围内重新归一化。]]


若改成每次抽完放回,第二次红球的比例保持 <math>3/5</math>,两红概率变为 <math>9/25</math>。只改变“放回”这一条规则,答案就不同。一个概率问题缺少抽样协议时,往往不是计算困难,而是尚未定义唯一的问题。
一般地,保留B中的结果,给它们重新归一化。落在A中的保留部分是 <math>A\cap B</math>,所以当 <math>P(B)>0</math> 时,定义
<math display="block">P(A\mid B)=\frac{P(A\cap B)}{P(B)}.</math>
假设已知第一枚骰子为 6,此时两枚之和为 7 的概率是 <math>1/6</math>;如果已知至少一枚为 6,则剩余 11 个等可能结果中只有 <math>(1,6)</math>、<math>(6,1)</math> 的和为 7,概率变为 <math>2/11</math>。信息的措辞决定条件事件,不能省略。


== 密度的高度与区间的概率 ==
== 独立与互斥是不同概念 ==
在区间 <math>[0,2]</math> 上均匀取一个实数 X,密度为 <math>f(x)=1/2</math>,区间外为零。于是 <math>P(0.5\le X\le1.5)=\int_{0.5}^{1.5}(1/2)\,dx=1/2</math>。区间越短,概率越小;单点的积分为零,但 X 总要取区间中的某个值。可列可加性只允许可数个互斥事件直接求和,不能把不可数多个零概率单点像有限求和一样合并。
事件独立意味着 <math>P(A\cap B)=P(A)P(B)</math>;互斥意味着 <math>A\cap B=\varnothing</math>。两个概率都为正的互斥事件不独立,因为其中一个发生就排除了另一个。


密度甚至可以大于 1。例如在 <math>[0,0.1]</math> 均匀分布时,密度为 10,总面积仍为 1。若 X 带时间单位,密度就具有时间单位的倒数,而区间概率没有单位。把密度值误当概率,不仅数值会出错,量纲也对不上。
刚才一枚骰子的两个事件不独立,因为 <math>P(A\mid B)=1/3</math> 改变了原概率1/6。两枚独立骰子各自为偶数则不同:九个格子满足两者,概率 <math>9/36=(1/2)(1/2)</math>。知道第一枚是偶数,没有改变第二枚为偶数的概率。


随机变量的分布函数 <math>F(x)=P(X\le x)</math> 同时适用于离散、连续和混合情形。它非递减,取值在 0 与 1 之间,且在正无穷趋于 1、负无穷趋于 0。离散分布中跳跃的大小等于该点概率;有密度的分布则通过积分积累概率。由此可见,“随机变量必须有概率密度”不是正确命题。
== 不放回抽样怎样改变第二步 ==
袋中有 3 个红球、2 个蓝球,球除颜色外可区分且每次从剩余球中等可能抽取。连续抽两球且不放回。第一球为红的概率是 <math>3/5</math>;已知第一球红,第二球红的概率是 <math>2/4</math>,故两球都红的概率为 <math>(3/5)(2/4)=3/10</math>。这里的乘法用的是条件概率,绝不是假设两次抽取独立。


== 大数定律究竟保证什么 ==
恰好一个红球有两条互斥路径:先红后蓝与先蓝后红。因此其概率为 <math>(3/5)(2/4)+(2/5)(3/4)=3/5</math>。两球都蓝的概率为 <math>(2/5)(1/4)=1/10</math>。三类结果之和为 1,这是检查计算的一种方式。也可以用无序组合验证:红蓝组合有 <math>3\times2=6</math> 个,所有两球组合有 <math>\binom52=10</math> 个,答案仍为 <math>6/10</math>。
<math>X_1,\ldots,X_n</math> 为独立同分布的 0–1 指示变量,成功概率为 p。频率为 <math>\bar X_n=n^{-1}\sum_iX_i</math>。由[[期望]]的线性性及独立性给出的方差可加性,得到 <math>\mathbb E[\bar X_n]=p</math><math>\operatorname{Var}(\bar X_n)=p(1-p)/n</math>。


对任意 <math>\varepsilon>0</math>,在事件 <math>|\bar X_n-p|\ge\varepsilon</math> 上,平方偏差至少为 <math>\varepsilon^2</math>。将该事件内外分开取期望,就得到
若改成每次抽完放回,第二次红球的比例保持 <math>3/5</math>,两红概率变为 <math>9/25</math>。只改变“放回”这一条规则,答案就不同。一个概率问题缺少抽样协议时,往往不是计算困难,而是尚未定义唯一的问题。
<math display="block">P(|\bar X_n-p|\ge\varepsilon)\le\frac{p(1-p)}{n\varepsilon^2}\le\frac1{4n\varepsilon^2}.</math>
右端随 n 增大而趋于零,这给出了一个弱大数定律的直接证明,也给出了可核验但通常偏保守的误差界。它并不声称每条样本路径的误差逐步减小;也不声称出现连续五次失败后,第六次成功概率会被“补回来”。独立试验没有这种记账机制。


== 两两独立为什么还不够 ==
== 两两独立为什么还不够 ==
第83行: 第60行:
但是三者同时发生只能是两枚都正面,概率仍为 <math>1/4</math>,并不等于 <math>(1/2)^3=1/8</math>。事实上,知道前两个事件是否发生,就完全确定了第三个事件。相互独立要求每一个有限子组的交集概率都等于该组各概率的乘积,不能仅检验所有二元关系。这也是为什么多次试验的独立假设需要针对完整生成机制,而不是只观察两列数据似乎没有关系。
但是三者同时发生只能是两枚都正面,概率仍为 <math>1/4</math>,并不等于 <math>(1/2)^3=1/8</math>。事实上,知道前两个事件是否发生,就完全确定了第三个事件。相互独立要求每一个有限子组的交集概率都等于该组各概率的乘积,不能仅检验所有二元关系。这也是为什么多次试验的独立假设需要针对完整生成机制,而不是只观察两列数据似乎没有关系。


相关性为零又是另一个层次的概念,涉及随机变量的协方差;它通常比独立性更弱。对称分布的变量与它的平方可以有零协方差,却存在明确的函数关系。独立、无相关和互斥各自有定义,不能只凭“不影响”“没关系”等日常措辞互换。


== 很多小机会合在一起,可以不再小 ==
== 很多小机会合在一起,可以不再小 ==
第95行: 第71行:


23人之间有253对,远不只是23次机会。并集上界给出 <math>253/365\approx0.6932</math>,虽然不精确,却已提示总体事件不能按单对的 <math>1/365</math> 理解。这个例子所揭示的是模型内的组合效应,不能当成真实人口生日分布的精确统计结论。
23人之间有253对,远不只是23次机会。并集上界给出 <math>253/365\approx0.6932</math>,虽然不精确,却已提示总体事件不能按单对的 <math>1/365</math> 理解。这个例子所揭示的是模型内的组合效应,不能当成真实人口生日分布的精确统计结论。
== 密度的高度与区间的概率 ==
在区间 <math>[0,2]</math> 上均匀取一个实数 X,密度为 <math>f(x)=1/2</math>,区间外为零。于是 <math>P(0.5\le X\le1.5)=\int_{0.5}^{1.5}(1/2)\,dx=1/2</math>。区间越短,概率越小;单点的积分为零,但 X 总要取区间中的某个值。可列可加性只允许可数个互斥事件直接求和,不能把不可数多个零概率单点像有限求和一样合并。
密度甚至可以大于 1。例如在 <math>[0,0.1]</math> 均匀分布时,密度为 10,总面积仍为 1。若 X 带时间单位,密度就具有时间单位的倒数,而区间概率没有单位。把密度值误当概率,不仅数值会出错,量纲也对不上。
随机变量的分布函数 <math>F(x)=P(X\le x)</math> 同时适用于离散、连续和混合情形。它非递减,取值在 0 与 1 之间,且在正无穷趋于 1、负无穷趋于 0。离散分布中跳跃的大小等于该点概率;有密度的分布则通过积分积累概率。由此可见,“随机变量必须有概率密度”不是正确命题。
== 大数定律究竟保证什么 ==
设 <math>X_1,\ldots,X_n</math> 为独立同分布的 0–1 指示变量,成功概率为 p。频率为 <math>\bar X_n=n^{-1}\sum_iX_i</math>。由[[期望]]的线性性及独立性给出的方差可加性,得到 <math>\mathbb E[\bar X_n]=p</math>、<math>\operatorname{Var}(\bar X_n)=p(1-p)/n</math>。
对任意 <math>\varepsilon>0</math>,在事件 <math>|\bar X_n-p|\ge\varepsilon</math> 上,平方偏差至少为 <math>\varepsilon^2</math>。将该事件内外分开取期望,就得到
<math display="block">P(|\bar X_n-p|\ge\varepsilon)\le\frac{p(1-p)}{n\varepsilon^2}\le\frac1{4n\varepsilon^2}.</math>
右端随 n 增大而趋于零,这给出了一个弱大数定律的直接证明,也给出了可核验但通常偏保守的误差界。它并不声称每条样本路径的误差逐步减小;也不声称出现连续五次失败后,第六次成功概率会被“补回来”。独立试验没有这种记账机制。


== 概率界与样本保证如何区别 ==
== 概率界与样本保证如何区别 ==
第103行: 第93行:
概率模型与[[统计推断]]的分工也由此清楚:前者通常在已指定分布下求事件概率,后者还要用样本研究未知分布或参数,并说明不确定性。一个数值看起来精确,并不代表抽样与模型假设也被精确满足。
概率模型与[[统计推断]]的分工也由此清楚:前者通常在已指定分布下求事件概率,后者还要用样本研究未知分布或参数,并说明不确定性。一个数值看起来精确,并不代表抽样与模型假设也被精确满足。


条件信息的取得方式也是抽样协议的一部分。“随机选出的家庭有一个女孩”与“随机选一个孩子,发现她是女孩,再看其家庭”未必对应同一个条件事件。后一种程序更容易选中包含更多女孩的家庭,形成由抽取机会带来的权重。若只保留一句模糊的口头信息而省略选择过程,不同的合理模型可能产生不同答案。


同样,检测结果只有在某类产品上被记录、缺失数据与结果本身有关、或人们只上报异常值,都可能改变所看到的样本分布。这不要求放弃概率计算,而是要求把记录和筛选机制也放进样本空间。判断一个答案是否合理,应同时检查事件定义、采样流程和算术,而不是只比较最后的分数。


== 从分赌注问题到现代概率空间 ==
== 从分赌注问题到现代概率空间 ==
概率思想没有一个脱离背景的单一发现时刻。17 世纪关于赌博公平分配的讨论推动了有限概率计算,1654 年 Pascal 与 Fermat 的通信是经常引用的节点;Huygens 在 1657 年出版概率论著,把机会与公平价值联系起来。这些事实可查 [https://mathshistory.st-andrews.ac.uk/Miller/mathword/p/ MacTutor 的概率术语史] 与 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ Huygens 传记]。更早的赌博实践不等于已经建立现代公理体系。
17 世纪关于赌博公平分配的讨论推动了有限概率计算,1654 年 Pascal 与 Fermat 的通信是经常引用的节点;Huygens 在 1657 年出版概率论著,把机会与公平价值联系起来。这些事实可查 [https://mathshistory.st-andrews.ac.uk/Miller/mathword/p/ MacTutor 的概率术语史] 与 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ Huygens 传记]


1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记]。这不意味着后来的一切随机理论都已完成,也不意味着公理本身决定了一个现实系统该赋什么概率;公理控制推理的一致性,具体分布仍需模型假设与证据。
1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记]。公理给出统一运算规则,具体分布仍由所研究的随机过程确定。


== 编者评注(AI 辅助) ==
== 从概率走向分布模型 ==
本条把“记录对象”和“抽样协议”放在公式前,是因为许多概率错误实际发生在模型建立阶段。建议先列出一个小规模样本空间,再检查哪些结果确实等可能,最后才计算。条件概率也应先说清信息如何获得。同一个数值答案若来自不合理的独立性或等可能假设,并不会因算术正确而成为可靠结论。
前面为事件分配概率;若把注意力集中在一个随机变量上,就得到它的[[概率分布]]。固定试验次数的成功计数可学习[[二项分布]],等待首次成功可学习[[几何分布]];稳定事件过程的次数与间隔分别连接[[泊松分布]]和[[指数分布]]。连续测量的例子可从[[均匀分布]]和[[正态分布]]开始。各篇都先明确模型条件,再推导公式和区间概率。


== 参考来源与延伸阅读 ==
== 参考来源与延伸阅读 ==

2026年9月20日 (日) 09:22的最新版本

概率(probability)用0到1之间的数描述事件在一个随机模型中发生的可能程度。0表示概率为零,1表示概率为一。怎样给事件分配数值,可以先从两枚骰子的点数看起。

两枚骰子为什么有 36 种等可能结果

假设两枚公平六面骰独立投掷,用有序对 (i,j) 记录结果。第一枚的六种结果各对应第二枚的六种结果,因此有 6×6=36 个等可能的有序对。图中横、纵坐标分别记录两枚点数,每个格子概率都是 1/36

六乘六的骰子结果网格,反对角线的六个格子标出两数之和为七的结果
有序对等可能,但它们的和不等可能;和为 7 有 6 种结果,和为 2 只有一种。

和为 7 的结果为 (1,6),(2,5),,(6,1),故概率为 6/36=1/6。至少一枚为 6 的概率则为 16+16136=1136. 减去的 1/36 是两枚都为 6 的情形。也可以取补事件:1(5/6)2=11/36

结果、事件与随机变量

把刚才的36个有序对放在一起,便得到样本空间,通常记作 Ω。其中“和为7”的六个格子组成一个事件。投两枚骰子可以记录有序点数、点数和,也可以只记录“是否相等”。这三种记录方式的信息量不同,不能把它们当成同一个样本空间再套用相同的均匀分布。

设原始结果为 ω=(i,j),定义随机变量 S(ω)=i+j。和为 7 的事件就是 {ω:S(ω)=7}。从结果转为数值,是一个函数;这个函数通常把多个原始结果映射到同一个数。因此,原始结果等可能并不能推出函数值等可能。这一层区分也适用于“抽到哪件产品”和“抽到的产品是否合格”。

样本空间、事件与三条公理

在有限样本空间中,每个子集都可作为事件。概率函数 P 为事件赋值。骰子模型中,一个事件包含多少格子,其概率就是格子数除以36;更一般的模型不要求结果等可能,但遵守以下规则。

每个事件的概率非负;整个样本空间的概率为1;若一列事件 A1,A2, 两两不重叠,则它们“至少一个发生”的概率是各自概率之和,即可列可加性: P(n=1An)=n=1P(An). 符号 表示取并集。一般无限空间只对一族指定的事件使用这些规则;这族事件须包含全集,并对补集和可数并封闭。

从公理推导加法公式

空集 表示不含任何结果的事件。由 Ω=Ω 的不交并得到 P()=0。再把全集分成 A 与补集,便有 P(A)+P(Ac)=1。若 AB,则 B 是 A 与 BA 的不交并,非负性给出 P(A)P(B)。所以概率具有单调性,不是额外记忆的一条经验规律。

AB 表示至少一个发生,AB 表示两者都发生。对于可能重叠的A、B,先拆成三个互斥区域:只属于 A、两者共同部分、只属于 B。把 P(A)+P(B) 展开,交集被算了两次;并集只应算一次,因此 P(AB)=P(A)+P(B)P(AB). 回到“至少一枚为6”:各枚为6的概率都是1/6,两枚都为6的格子被算两次,要减去1/36,正好得到11/36。这一推导说明公式为什么成立,也指出“直接相加”只适用于交集概率为零的情形。互斥当然能保证这一点,但连续模型中交集非空却概率为零也可能出现。

更一般地,将样本空间分割为有限个互斥事件 B1,,Bm,且每个 P(Bi)>0,则 P(A)=i=1mP(ABi)=i=1mP(ABi)P(Bi). 第一步使用事件分割,第二步使用条件概率定义。这就是全概率公式,其实质是按来源分组加权;不能把组内概率直接做无权平均。相关定义与推导可参见 MIT 18.05 第 3 讲

条件概率:已知信息改变了范围

先看一枚公平骰子。设 A 为点数等于6,B 为点数是偶数。未得到信息时,A占六个结果中的一个,概率为 1/6;已知B以后,候选只剩2、4、6,A占三个中的一个,条件概率为 1/3

下图上排保留全部六个等可能结果,下排划去奇数。剩余的2、4、6重新分配总概率1,各占 1/3;金框始终指同一个结果6,改变的是作为分母的参照范围。

上排骰子一到六每个概率六分之一,下排已知偶数后只保留二四六且每个概率三分之一,结果六始终用金色框标出
条件概率在保留的样本范围内重新归一化。

一般地,保留B中的结果,给它们重新归一化。落在A中的保留部分是 AB,所以当 P(B)>0 时,定义 P(AB)=P(AB)P(B). 假设已知第一枚骰子为 6,此时两枚之和为 7 的概率是 1/6;如果已知至少一枚为 6,则剩余 11 个等可能结果中只有 (1,6)(6,1) 的和为 7,概率变为 2/11。信息的措辞决定条件事件,不能省略。

独立与互斥是不同概念

事件独立意味着 P(AB)=P(A)P(B);互斥意味着 AB=。两个概率都为正的互斥事件不独立,因为其中一个发生就排除了另一个。

刚才一枚骰子的两个事件不独立,因为 P(AB)=1/3 改变了原概率1/6。两枚独立骰子各自为偶数则不同:九个格子满足两者,概率 9/36=(1/2)(1/2)。知道第一枚是偶数,没有改变第二枚为偶数的概率。

不放回抽样怎样改变第二步

袋中有 3 个红球、2 个蓝球,球除颜色外可区分且每次从剩余球中等可能抽取。连续抽两球且不放回。第一球为红的概率是 3/5;已知第一球红,第二球红的概率是 2/4,故两球都红的概率为 (3/5)(2/4)=3/10。这里的乘法用的是条件概率,绝不是假设两次抽取独立。

恰好一个红球有两条互斥路径:先红后蓝与先蓝后红。因此其概率为 (3/5)(2/4)+(2/5)(3/4)=3/5。两球都蓝的概率为 (2/5)(1/4)=1/10。三类结果之和为 1,这是检查计算的一种方式。也可以用无序组合验证:红蓝组合有 3×2=6 个,所有两球组合有 (52)=10 个,答案仍为 6/10

若改成每次抽完放回,第二次红球的比例保持 3/5,两红概率变为 9/25。只改变“放回”这一条规则,答案就不同。一个概率问题缺少抽样协议时,往往不是计算困难,而是尚未定义唯一的问题。

两两独立为什么还不够

对于三个或更多事件,逐对检查独立并不足以得到整体独立。考虑两枚独立公平硬币,四个有序结果等可能。令 A 为第一枚正面,B 为第二枚正面,C 为两枚相同。三个事件概率均为 1/2;任意一对的交集都只有一个结果,概率为 1/4,所以它们两两独立。

但是三者同时发生只能是两枚都正面,概率仍为 1/4,并不等于 (1/2)3=1/8。事实上,知道前两个事件是否发生,就完全确定了第三个事件。相互独立要求每一个有限子组的交集概率都等于该组各概率的乘积,不能仅检验所有二元关系。这也是为什么多次试验的独立假设需要针对完整生成机制,而不是只观察两列数据似乎没有关系。


很多小机会合在一起,可以不再小

对任意有限个事件,反复使用加法公式并去掉非负的交集项,可得并集上界 P(i=1mAi)i=1mP(Ai). 它不需要独立性,因而常用于给“至少出现一次异常”作保守估计。但右端可能超过 1,也可能明显高估;概率上界不是精确答案。事件之间高度重叠时,重复累计尤其明显。

生日问题展示了比较次数的作用。采用纯教学模型:一年固定365天,各人的生日彼此独立且均匀,不讨论闰日和实际季节差异。23人的生日全部不同的概率为 j=022365j365, 因为依次选人,第一个没有限制,第二个需要避开已有一天,第三个需避开已有两天,依此类推。取补事件后,至少一对生日相同的概率约为0.5073。这里没有要求每一对相同事件相互独立;直接把各对“不相同”的概率相乘会使用不成立的独立性。

23人之间有253对,远不只是23次机会。并集上界给出 253/3650.6932,虽然不精确,却已提示总体事件不能按单对的 1/365 理解。这个例子所揭示的是模型内的组合效应,不能当成真实人口生日分布的精确统计结论。

密度的高度与区间的概率

在区间 [0,2] 上均匀取一个实数 X,密度为 f(x)=1/2,区间外为零。于是 P(0.5X1.5)=0.51.5(1/2)dx=1/2。区间越短,概率越小;单点的积分为零,但 X 总要取区间中的某个值。可列可加性只允许可数个互斥事件直接求和,不能把不可数多个零概率单点像有限求和一样合并。

密度甚至可以大于 1。例如在 [0,0.1] 均匀分布时,密度为 10,总面积仍为 1。若 X 带时间单位,密度就具有时间单位的倒数,而区间概率没有单位。把密度值误当概率,不仅数值会出错,量纲也对不上。

随机变量的分布函数 F(x)=P(Xx) 同时适用于离散、连续和混合情形。它非递减,取值在 0 与 1 之间,且在正无穷趋于 1、负无穷趋于 0。离散分布中跳跃的大小等于该点概率;有密度的分布则通过积分积累概率。由此可见,“随机变量必须有概率密度”不是正确命题。

大数定律究竟保证什么

X1,,Xn 为独立同分布的 0–1 指示变量,成功概率为 p。频率为 X¯n=n1iXi。由期望的线性性及独立性给出的方差可加性,得到 𝔼[X¯n]=pVar(X¯n)=p(1p)/n

对任意 ε>0,在事件 |X¯np|ε 上,平方偏差至少为 ε2。将该事件内外分开取期望,就得到 P(|X¯np|ε)p(1p)nε214nε2. 右端随 n 增大而趋于零,这给出了一个弱大数定律的直接证明,也给出了可核验但通常偏保守的误差界。它并不声称每条样本路径的误差逐步减小;也不声称出现连续五次失败后,第六次成功概率会被“补回来”。独立试验没有这种记账机制。

概率界与样本保证如何区别

前文的频率误差界可以转为有限样本的设计要求。若希望独立同分布的0–1试验中,频率偏离真实概率至少0.05的机会不超过0.01,使用不依赖未知成功率的保守上界,取 n10000 即可。因为 1/(4n×0.052)0.01。这给出一个足够样本量,而非最小或最有效样本量。

该结论仍是概率性的:它允许小概率出现超过容限的误差,不能改写成“做满一万次就绝不偏差超过5%”。如果试验有共同环境导致的相关性,原方差计算还可能不再适用;如果抽样只覆盖某个偏离目标总体的群体,增加样本量可能只是更稳定地估计错误总体的概率。

概率模型与统计推断的分工也由此清楚:前者通常在已指定分布下求事件概率,后者还要用样本研究未知分布或参数,并说明不确定性。一个数值看起来精确,并不代表抽样与模型假设也被精确满足。


从分赌注问题到现代概率空间

17 世纪关于赌博公平分配的讨论推动了有限概率计算,1654 年 Pascal 与 Fermat 的通信是经常引用的节点;Huygens 在 1657 年出版概率论著,把机会与公平价值联系起来。这些事实可查 MacTutor 的概率术语史Huygens 传记

1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 Kolmogorov 传记。公理给出统一运算规则,具体分布仍由所研究的随机过程确定。

从概率走向分布模型

前面为事件分配概率;若把注意力集中在一个随机变量上,就得到它的概率分布。固定试验次数的成功计数可学习二项分布,等待首次成功可学习几何分布;稳定事件过程的次数与间隔分别连接泊松分布指数分布。连续测量的例子可从均匀分布正态分布开始。各篇都先明确模型条件,再推导公式和区间概率。

参考来源与延伸阅读