概率:修订间差异
AIContentBot(留言 | 贡献) 重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范 |
AIContentBot(留言 | 贡献) 串联统计图与概率分布的学习路径和分类导航 |
||
| 第99行: | 第99行: | ||
1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记]。公理给出统一运算规则,具体分布仍由所研究的随机过程确定。 | 1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记]。公理给出统一运算规则,具体分布仍由所研究的随机过程确定。 | ||
== 从概率走向分布模型 == | |||
前面为事件分配概率;若把注意力集中在一个随机变量上,就得到它的[[概率分布]]。固定试验次数的成功计数可学习[[二项分布]],等待首次成功可学习[[几何分布]];稳定事件过程的次数与间隔分别连接[[泊松分布]]和[[指数分布]]。连续测量的例子可从[[均匀分布]]和[[正态分布]]开始。各篇都先明确模型条件,再推导公式和区间概率。 | |||
== 参考来源与延伸阅读 == | == 参考来源与延伸阅读 == | ||
2026年9月20日 (日) 09:22的最新版本
概率(probability)用0到1之间的数描述事件在一个随机模型中发生的可能程度。0表示概率为零,1表示概率为一。怎样给事件分配数值,可以先从两枚骰子的点数看起。
两枚骰子为什么有 36 种等可能结果
假设两枚公平六面骰独立投掷,用有序对 记录结果。第一枚的六种结果各对应第二枚的六种结果,因此有 个等可能的有序对。图中横、纵坐标分别记录两枚点数,每个格子概率都是 。
和为 7 的结果为 ,故概率为 。至少一枚为 6 的概率则为 减去的 是两枚都为 6 的情形。也可以取补事件:。
结果、事件与随机变量
把刚才的36个有序对放在一起,便得到样本空间,通常记作 。其中“和为7”的六个格子组成一个事件。投两枚骰子可以记录有序点数、点数和,也可以只记录“是否相等”。这三种记录方式的信息量不同,不能把它们当成同一个样本空间再套用相同的均匀分布。
设原始结果为 ,定义随机变量 。和为 7 的事件就是 。从结果转为数值,是一个函数;这个函数通常把多个原始结果映射到同一个数。因此,原始结果等可能并不能推出函数值等可能。这一层区分也适用于“抽到哪件产品”和“抽到的产品是否合格”。
样本空间、事件与三条公理
在有限样本空间中,每个子集都可作为事件。概率函数 为事件赋值。骰子模型中,一个事件包含多少格子,其概率就是格子数除以36;更一般的模型不要求结果等可能,但遵守以下规则。
每个事件的概率非负;整个样本空间的概率为1;若一列事件 两两不重叠,则它们“至少一个发生”的概率是各自概率之和,即可列可加性: 符号 表示取并集。一般无限空间只对一族指定的事件使用这些规则;这族事件须包含全集,并对补集和可数并封闭。
从公理推导加法公式
空集 表示不含任何结果的事件。由 的不交并得到 。再把全集分成 A 与补集,便有 。若 ,则 B 是 A 与 的不交并,非负性给出 。所以概率具有单调性,不是额外记忆的一条经验规律。
用 表示至少一个发生, 表示两者都发生。对于可能重叠的A、B,先拆成三个互斥区域:只属于 A、两者共同部分、只属于 B。把 展开,交集被算了两次;并集只应算一次,因此 回到“至少一枚为6”:各枚为6的概率都是1/6,两枚都为6的格子被算两次,要减去1/36,正好得到11/36。这一推导说明公式为什么成立,也指出“直接相加”只适用于交集概率为零的情形。互斥当然能保证这一点,但连续模型中交集非空却概率为零也可能出现。
更一般地,将样本空间分割为有限个互斥事件 ,且每个 ,则 第一步使用事件分割,第二步使用条件概率定义。这就是全概率公式,其实质是按来源分组加权;不能把组内概率直接做无权平均。相关定义与推导可参见 MIT 18.05 第 3 讲。
条件概率:已知信息改变了范围
先看一枚公平骰子。设 为点数等于6, 为点数是偶数。未得到信息时,A占六个结果中的一个,概率为 ;已知B以后,候选只剩2、4、6,A占三个中的一个,条件概率为 。
下图上排保留全部六个等可能结果,下排划去奇数。剩余的2、4、6重新分配总概率1,各占 ;金框始终指同一个结果6,改变的是作为分母的参照范围。
一般地,保留B中的结果,给它们重新归一化。落在A中的保留部分是 ,所以当 时,定义 假设已知第一枚骰子为 6,此时两枚之和为 7 的概率是 ;如果已知至少一枚为 6,则剩余 11 个等可能结果中只有 、 的和为 7,概率变为 。信息的措辞决定条件事件,不能省略。
独立与互斥是不同概念
事件独立意味着 ;互斥意味着 。两个概率都为正的互斥事件不独立,因为其中一个发生就排除了另一个。
刚才一枚骰子的两个事件不独立,因为 改变了原概率1/6。两枚独立骰子各自为偶数则不同:九个格子满足两者,概率 。知道第一枚是偶数,没有改变第二枚为偶数的概率。
不放回抽样怎样改变第二步
袋中有 3 个红球、2 个蓝球,球除颜色外可区分且每次从剩余球中等可能抽取。连续抽两球且不放回。第一球为红的概率是 ;已知第一球红,第二球红的概率是 ,故两球都红的概率为 。这里的乘法用的是条件概率,绝不是假设两次抽取独立。
恰好一个红球有两条互斥路径:先红后蓝与先蓝后红。因此其概率为 。两球都蓝的概率为 。三类结果之和为 1,这是检查计算的一种方式。也可以用无序组合验证:红蓝组合有 个,所有两球组合有 个,答案仍为 。
若改成每次抽完放回,第二次红球的比例保持 ,两红概率变为 。只改变“放回”这一条规则,答案就不同。一个概率问题缺少抽样协议时,往往不是计算困难,而是尚未定义唯一的问题。
两两独立为什么还不够
对于三个或更多事件,逐对检查独立并不足以得到整体独立。考虑两枚独立公平硬币,四个有序结果等可能。令 为第一枚正面, 为第二枚正面, 为两枚相同。三个事件概率均为 ;任意一对的交集都只有一个结果,概率为 ,所以它们两两独立。
但是三者同时发生只能是两枚都正面,概率仍为 ,并不等于 。事实上,知道前两个事件是否发生,就完全确定了第三个事件。相互独立要求每一个有限子组的交集概率都等于该组各概率的乘积,不能仅检验所有二元关系。这也是为什么多次试验的独立假设需要针对完整生成机制,而不是只观察两列数据似乎没有关系。
很多小机会合在一起,可以不再小
对任意有限个事件,反复使用加法公式并去掉非负的交集项,可得并集上界 它不需要独立性,因而常用于给“至少出现一次异常”作保守估计。但右端可能超过 1,也可能明显高估;概率上界不是精确答案。事件之间高度重叠时,重复累计尤其明显。
生日问题展示了比较次数的作用。采用纯教学模型:一年固定365天,各人的生日彼此独立且均匀,不讨论闰日和实际季节差异。23人的生日全部不同的概率为 因为依次选人,第一个没有限制,第二个需要避开已有一天,第三个需避开已有两天,依此类推。取补事件后,至少一对生日相同的概率约为0.5073。这里没有要求每一对相同事件相互独立;直接把各对“不相同”的概率相乘会使用不成立的独立性。
23人之间有253对,远不只是23次机会。并集上界给出 ,虽然不精确,却已提示总体事件不能按单对的 理解。这个例子所揭示的是模型内的组合效应,不能当成真实人口生日分布的精确统计结论。
密度的高度与区间的概率
在区间 上均匀取一个实数 X,密度为 ,区间外为零。于是 。区间越短,概率越小;单点的积分为零,但 X 总要取区间中的某个值。可列可加性只允许可数个互斥事件直接求和,不能把不可数多个零概率单点像有限求和一样合并。
密度甚至可以大于 1。例如在 均匀分布时,密度为 10,总面积仍为 1。若 X 带时间单位,密度就具有时间单位的倒数,而区间概率没有单位。把密度值误当概率,不仅数值会出错,量纲也对不上。
随机变量的分布函数 同时适用于离散、连续和混合情形。它非递减,取值在 0 与 1 之间,且在正无穷趋于 1、负无穷趋于 0。离散分布中跳跃的大小等于该点概率;有密度的分布则通过积分积累概率。由此可见,“随机变量必须有概率密度”不是正确命题。
大数定律究竟保证什么
设 为独立同分布的 0–1 指示变量,成功概率为 p。频率为 。由期望的线性性及独立性给出的方差可加性,得到 、。
对任意 ,在事件 上,平方偏差至少为 。将该事件内外分开取期望,就得到 右端随 n 增大而趋于零,这给出了一个弱大数定律的直接证明,也给出了可核验但通常偏保守的误差界。它并不声称每条样本路径的误差逐步减小;也不声称出现连续五次失败后,第六次成功概率会被“补回来”。独立试验没有这种记账机制。
概率界与样本保证如何区别
前文的频率误差界可以转为有限样本的设计要求。若希望独立同分布的0–1试验中,频率偏离真实概率至少0.05的机会不超过0.01,使用不依赖未知成功率的保守上界,取 即可。因为 。这给出一个足够样本量,而非最小或最有效样本量。
该结论仍是概率性的:它允许小概率出现超过容限的误差,不能改写成“做满一万次就绝不偏差超过5%”。如果试验有共同环境导致的相关性,原方差计算还可能不再适用;如果抽样只覆盖某个偏离目标总体的群体,增加样本量可能只是更稳定地估计错误总体的概率。
概率模型与统计推断的分工也由此清楚:前者通常在已指定分布下求事件概率,后者还要用样本研究未知分布或参数,并说明不确定性。一个数值看起来精确,并不代表抽样与模型假设也被精确满足。
从分赌注问题到现代概率空间
17 世纪关于赌博公平分配的讨论推动了有限概率计算,1654 年 Pascal 与 Fermat 的通信是经常引用的节点;Huygens 在 1657 年出版概率论著,把机会与公平价值联系起来。这些事实可查 MacTutor 的概率术语史 与 Huygens 传记。
1933 年 Kolmogorov 的专著把概率置于测度论的公理框架之中,统一了离散和连续模型所需的基本语言,见 Kolmogorov 传记。公理给出统一运算规则,具体分布仍由所研究的随机过程确定。
从概率走向分布模型
前面为事件分配概率;若把注意力集中在一个随机变量上,就得到它的概率分布。固定试验次数的成功计数可学习二项分布,等待首次成功可学习几何分布;稳定事件过程的次数与间隔分别连接泊松分布和指数分布。连续测量的例子可从均匀分布和正态分布开始。各篇都先明确模型条件,再推导公式和区间概率。
参考来源与延伸阅读
- Jeremy Orloff、Jennifer French Kamrin,MIT 18.05:Conditional Probability, Independence and Bayes' Theorem。
- 集合 · 函数 · 统计推断:样本空间的语言、随机变量与由样本反推总体。
- MIT OpenCourseWare,18.05 阅读材料:样本空间、条件概率与独立性。
- 组合数学 · 期望 · 贝叶斯定理