跳到正文
格致开物MATHWIKI

贝叶斯定理

Bayes’ theorem

AIContentBot留言 | 贡献2026年9月20日 (日) 02:23的版本 (扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航)

贝叶斯定理(Bayes' theorem)把“某种假设下观察到证据的概率”转化为“观察到证据后该假设的条件概率”。对事件 H,E,若 P(H)>0P(E)>0,则 P(HE)=P(EH)P(H)P(E). 这里 P(H) 称为先验概率,P(HE) 称为后验概率;P(EH) 是给定假设下证据的概率。在以假设或参数为自变量时,它提供似然信息。


English overview

Bayes' theorem expresses a conditional probability in terms of the reverse conditional probability, the prior probability, and the probability of the observed evidence. It follows directly from two expressions for the same joint event. No independence between a hypothesis and its evidence is required. The denominator is a normalization term that must include every relevant way of producing the evidence.

The practical difficulty is usually specifying a credible probability model rather than manipulating the formula. A quality-control example illustrates why a high detection rate need not imply a high probability of a defect after a positive flag. A second example compares several production sources, and a continuous example updates an unknown success probability. The odds form separates prior odds from the likelihood ratio, making the strength of evidence easier to interpret. Repeated evidence may be multiplied only under the appropriate conditional independence assumptions; correlated measurements can otherwise create unjustified confidence. Historical notes distinguish Bayes' posthumous work, Price's editorial role, and Laplace's later development of inverse probability. Posterior conclusions remain conditional on the model and should be checked through sensitivity analysis and predictive comparison.

公式来自同一个交集

由条件概率定义,同一交集可以写成 P(HE)=P(HE)P(E)=P(EH)P(H). 两边除以正数 P(E) 就得到公式。因此贝叶斯定理不额外假设 HE 独立;它恰恰用于描述证据怎样改变对假设的判断。

H 与其补事件把样本空间分成两类,全概率公式给出 P(E)=P(EH)P(H)+P(EHc)P(Hc). 分母必须包含所有可能产生同一证据的来源。

一个质量检测的算例

以下是教学设定的数据。假设某类产品有 5% 不合格;检测系统会标记其中 90% 的不合格品,同时误标 10% 的合格品。用 H 表示不合格,E 表示被标记。

一千件示例产品分为五十件不合格和九百五十件合格,分别有四十五件和九十五件被标记
按 1000 件作比例换算:140 件被标记的产品中,45 件来自不合格品。整数计数用于解释给定概率,不是实际抽样结果。

于是 P(HE)=0.90×0.050.90×0.05+0.10×0.95=45140=92832.14%. “能检测出九成不合格品”不意味着“被标记的产品有九成不合格”。因为合格品基数更大,即使误标率只有 10%,误标数量仍多于正确标记数量。

若其他条件不变,而先验不合格率改为 50%,后验就变成 0.45/(0.45+0.05)=90%。同一套检测性能,在不同总体中可以产生不同的后验概率。

用赔率观察证据强度

当相关概率非零时,定理还可写为 P(HE)P(HcE)=P(H)P(Hc)P(EH)P(EHc). 右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 1:19,似然比为 9,所以后验赔率为 9:19,换回概率即 9/28

多个假设与连续参数

H1,,Hk 是互斥且完备的假设,分母要对它们求和: P(HiE)=P(EHi)P(Hi)j=1kP(EHj)P(Hj). 连续参数情形则用概率密度和积分进行归一化,不能把某个连续参数点的密度直接当成该点的概率。后验的用途包括参数估计、分类与序贯更新,但结果依赖模型及先验是否合理。

重复检测不能随意重复相乘

使用多个证据时,应更新 P(E2H,E1) 等条件概率。只有在给定假设后证据条件独立时,才能把联合似然分解成简单乘积。重复运行同一个有系统偏差的检测器,往往不能当成获得了完全独立的新证据。

把四个概率放在同一张图里

条件概率的方向不能靠中文语感猜测。P(EH) 把 H 作为参照范围,问这一范围内有多少会出现 E;P(HE) 则把参照范围改成 E,问其中有多少来自 H。二者的分子都与交集有关,分母却不同。即使 H 几乎总能产生 E,也可能存在大量非 H 的情况同样产生 E。

先验不是“不看事实的主观猜测”的同义词,它可以来自已知抽样机制、历史数据或明确的先验分布;这些来源是否适用于当前总体,仍须说明。似然把已经观察到的数据固定,比较不同假设对它的解释程度;作为参数的函数,似然不必积分为 1。后验则是在所选模型和证据条件下归一化后的概率。这几种对象承担不同任务,把它们都叫“置信度”会丢掉重要区别。

三个来源的完整归一化

假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。

A,B,C 分别表示来自甲、乙、丙线的事件,D 表示不合格。三个联合概率为 P(AD)=0.5×0.01=0.005P(BD)=0.006P(CD)=0.008。因此 P(D)=0.019,三个后验分别为 5/19,6/19,8/19。它们相加等于 1;丙线的答案是 8/1942.11%

这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;不过仍不能断言这件不合格品一定来自丙线。若生产线之间存在未记录的混料,或不合格率来自不同时间段,原来的三类模型还需重新检查。

连续参数:从事件概率到后验密度

假设未知参数 θ[0,1] 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;这是一项明确选择,不是对所有参数化方式都“绝对客观”的先验。

现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 3θ2(1θ);若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。因为 01θ2(1θ)dθ=1/12,后验密度为 p(θD)=12θ2(1θ),0θ1. 它是 Beta(3,2) 分布,区间外为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。

下一次成功的预测概率需要把未知 θ 平均掉: P(Xnew=1D)=01θp(θD)dθ=12(1415)=35. 结果 0.6 与样本成功率 2/3 不同,因为该预测同时使用了均匀先验和有限样本。这是一个演示而非默认处理所有实验的方法;连续先验与更新的教材依据见 MIT 18.05 第 13a 讲

连续两次标记会怎样改变后验

回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 0.920.12。后验为 0.05×0.920.05×0.92+0.95×0.12=81100=81%. 也可先更新赔率 1:19,每次乘似然比 9,得到 81:19,再转换为概率。两条计算路线一致,是一个有用的检查。

但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 9/28。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 P(E1,E2H),而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。

后验不是脱离模型的最终判决

如果一个假设先验为零,而其余模型正常且证据有正概率,简单的贝叶斯更新不能把它变成正概率。这个边界提醒建模者:把“现在没有观察到”直接写成“绝不可能”,可能永久排除真实解释。同样,如果所有假设都对证据给出零概率,分母为零,问题不是得到一个神秘后验,而是现有模型无法解释观测或条件化方式需要更细的理论。

后验概率高,也不自动意味着某个行动最佳。行动选择还需要损失或代价:误报与漏报的损失可以不同。数学上,应对每个行动计算后验期望损失,再进行优化。概率更新与决策评价是相邻而不同的步骤,不能用一个任意阈值掩盖成本假设。

还应区分参数不确定性与模型不确定性。即使在一个错误模型内对 θ 的后验极为集中,也不能证明模型结构正确。检查后验预测能否重现实际数据的形状,比较不同先验的敏感性,查看抽样偏差,都是必要的补充。更多数据会减少某些随机不确定性,却不会自动修复系统性偏差。

改变先验后,哪些计算需要重新进行

前面的三次试验采用均匀先验。若改为密度 p(θ)=6θ(1θ),它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 θ3(1θ)2。因为其积分为 1/60,后验变为 60θ3(1θ)2,即 Beta(4,3) 分布。

下一次成功的预测概率成为 4/70.5714,而不是原先的0.6。这两个结果没有哪一个仅凭公式就被宣布为“绝对客观”;应检查不同先验表达的信息是否适合问题,并报告结论对选择有多敏感。只给出一种先验下的小数位而不交代先验,隐藏了模型的重要输入。

在这类二项似然与Beta先验的模型中,先验参数为正数 α,β,观察 s 次成功、f 次失败后,后验参数为 α+s,β+f。这称为共轭结构,来源是乘法把幂次相加。它使计算方便,但并不意味着所有问题都必须选这个先验族,也不意味着先验一定等价于真实存在过的若干次旧试验。

条件独立如何产生相关的预测

给定一个固定的成功率 θ 后,两次未来试验可以独立;但在 θ 尚有后验不确定性时,把它积分掉之后,两次结果通常不再独立。这不是前后矛盾,因为条件化所使用的信息已经不同。

使用先前 Beta(3,2) 后验,每次未来成功的边缘预测概率都是 3/5,而两次都成功的预测概率为 01θ212θ2(1θ)dθ=12(1516)=25. 它不等于 (3/5)2=9/25。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。

若先观察到第一次未来试验成功,再更新后验为 Beta(4,2),第二次成功概率变为 2/3。于是顺序计算的联合概率为 (3/5)(2/3)=2/5,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。

后验区间、点估计与预测回答不同问题

连续参数的后验密度可以用于计算区间概率。若某区间内后验密度的积分为0.95,便可称该区间在给定数据和模型下具有95%的后验概率。这个概率说的是参数落在区间内的后验不确定性,不是说密度曲线上的每个点都有正概率,也不自动等同于频率学派置信区间的长期覆盖解释。

点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。

参数化改变时,概率密度还会带上换元因子,因此最大密度点不一定简单地按同一函数变换。区间概率则必须通过积分保持一致。把密度最高点称为“最可能的精确参数值”虽然常见,却应注意连续参数单点概率为零这一事实。

概率更新之后,行动还需要损失

在一个纯教学的二分类决策中,设把合格品误判为不合格的损失记为4个单位,把不合格品漏判的损失记为12个单位,正确判断的损失为零。若后验不合格概率为 p,选择“不合格”的期望损失为 4(1p),选择“合格”的期望损失为 12p。前者较小当且仅当 p>1/4

这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。

Bayes、Price 与逆概率的发展

Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 MacTutor 的 Bayes 传记。卷年、宣读时间与实际刊行时间在历史材料中可能不同,不能把它们当成同一事件的三个相互矛盾答案。

后来 Laplace 将逆概率思想用于更广泛的推断问题。现代通用的条件概率恒等式、具体先验的选择,以及如今的大规模贝叶斯计算,并不是 Bayes 一篇文章已经全部完成的内容。名称提供历史线索,却不能代替对贡献范围的区分;Laplace 的相关工作可参见 Charles C. Gillispie 的 Laplace 学术传记

编者评注(AI 辅助)

本条把分母的归一化、条件独立和先验敏感性作为重点。公式本身很短,但只有把所有可能来源列清、把证据生成机制写对,后验才有可解释的含义。学习时可同时用比例人数和代数公式计算同一例子;若两种方式不一致,优先检查参照总体与联合事件,而不是急于换一条公式。

参考来源与延伸阅读