跳到正文
格致开物MATHWIKI

贝叶斯定理:修订间差异

Bayes’ theorem

AIContentBot留言 | 贡献
扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航
AIContentBot留言 | 贡献
重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范
第1行: 第1行:
'''贝叶斯定理'''(Bayes' theorem)把“某种假设下观察到证据的概率”转化为“观察到证据后该假设的条件概率”。对事件 <math>H,E</math>,若 <math>P(H)>0</math> 且 <math>P(E)>0</math>,则
'''贝叶斯定理'''(Bayes' theorem)把一种条件概率换成反向的条件概率:已知某类对象产生某种结果的机会,怎样计算看到这个结果后,对象属于该类的机会?它的核心是把产生同一结果的各个来源一起计算,再在这些结果中重新取比例。
<math display="block">P(H\mid E)=\frac{P(E\mid H)P(H)}{P(E)}.</math>
 
这里 <math>P(H)</math> 称为先验概率,<math>P(H\mid E)</math> 称为后验概率;<math>P(E\mid H)</math> 是给定假设下证据的概率。在以假设或参数为自变量时,它提供似然信息。
== 被标记的产品中,有多少真的不合格 ==
采用一组教学数据:产品有5%不合格,检测会标记90%的不合格品,也会误标10%的合格品。现随机取一件,发现它被标记。它不合格的概率是多少?


先把比例换算为1000件来观察:其中50件不合格、950件合格。前一组有 <math>50\times0.9=45</math> 件被标记,后一组有 <math>950\times0.1=95</math> 件被标记。图中两条通向“被标记”的路径,要合在一起看。


== English overview ==
[[File:Gezhi-bayes-tree-theme.svg|frame|center|alt=一千件示例产品分为五十件不合格和九百五十件合格,分别有四十五件和九十五件被标记|140件被标记产品中,45件来自不合格品;这些整数用于换算给定比例,并非实际抽样记录。]]
<div lang="en" class="math-english-summary">
Bayes' theorem expresses a conditional probability in terms of the reverse conditional probability, the prior probability, and the probability of the observed evidence. It follows directly from two expressions for the same joint event. No independence between a hypothesis and its evidence is required. The denominator is a normalization term that must include every relevant way of producing the evidence.


The practical difficulty is usually specifying a credible probability model rather than manipulating the formula. A quality-control example illustrates why a high detection rate need not imply a high probability of a defect after a positive flag. A second example compares several production sources, and a continuous example updates an unknown success probability. The odds form separates prior odds from the likelihood ratio, making the strength of evidence easier to interpret. Repeated evidence may be multiplied only under the appropriate conditional independence assumptions; correlated measurements can otherwise create unjustified confidence. Historical notes distinguish Bayes' posthumous work, Price's editorial role, and Laplace's later development of inverse probability. Posterior conclusions remain conditional on the model and should be checked through sensitivity analysis and predictive comparison.
总共140件被标记,其中45件不合格,所以所求比例为 <math>45/140=9/28\approx32.14\%</math>。检出率90%使用“不合格品”作分母;这个32.14%使用“被标记产品”作分母。两个比例回答不同的问题。合格品数量远多于不合格品,即使其中只有10%被误标,也会贡献较多标记。
</div>


== 公式来自同一个交集 ==
== 从同一个交集推导公式 ==
由条件概率定义,同一交集可以写成
用 <math>H</math> 表示“不合格”,<math>E</math> 表示“被标记”。交集 <math>H\cap E</math> 就是同时不合格且被标记的产品。由[[概率|条件概率]]定义,可以从两个方向算它:
<math display="block">P(H\cap E)=P(H\mid E)P(E)=P(E\mid H)P(H).</math>
<math display="block">P(H\cap E)=P(E\mid H)P(H)=P(H\mid E)P(E).</math>
两边除以正数 <math>P(E)</math> 就得到公式。因此贝叶斯定理不额外假设 <math>H</math> <math>E</math> 独立;它恰恰用于描述证据怎样改变对假设的判断。
只要 <math>P(H)>0</math>、<math>P(E)>0</math>,等式两端除以 <math>P(E)</math> 就得到
<math display="block">P(H\mid E)=\frac{P(E\mid H)P(H)}{P(E)}.</math>
这便是贝叶斯定理。<math>P(H)</math> 是看检测结果之前的'''先验概率''';<math>P(H\mid E)</math> 是观察结果后的'''后验概率'''。固定已经观察到的结果,比较不同假设给出的 <math>P(E\mid H)</math>,是在比较它们的'''似然'''。


<math>H</math> 与其补事件把样本空间分成两类,全概率公式给出
<math>H^c</math> 表示合格。被标记产品来自不合格与合格两条互斥路径,全概率公式给出
<math display="block">P(E)=P(E\mid H)P(H)+P(E\mid H^c)P(H^c).</math>
<math display="block">P(E)=P(E\mid H)P(H)+P(E\mid H^c)P(H^c).</math>
分母必须包含所有可能产生同一证据的来源。
把检测数值代入,得到 <math>P(E)=0.9\times0.05+0.1\times0.95=0.14</math>,再以 <math>0.045/0.14</math> 算后验,与图中的45/140完全一致。该推导未假设假设与证据独立;若二者本来独立,观察证据反而不会改变先验。


== 一个质量检测的算例 ==
== 总体变了,同一种检测的结果也会变 ==
以下是教学设定的数据。假设某类产品有 5% 不合格;检测系统会标记其中 90% 的不合格品,同时误标 10% 的合格品。用 <math>H</math> 表示不合格,<math>E</math> 表示被标记。
若其他条件不变,而不合格率降到0.5%,则
<math display="block">P(H\mid E)=\frac{0.9\times0.005}{0.9\times0.005+0.1\times0.995}=\frac{45}{1040}\approx4.33\%.</math>
按10000件换算,此时真标记45件、误标记995件;原先5%的总体则真标记450件、误标记950件。检测性能没变,发生不合格的基础比例变了,因此标记的组成也变了。


[[File:Gezhi-bayes-tree.svg|frame|center|alt=一千件示例产品分为五十件不合格和九百五十件合格,分别有四十五件和九十五件被标记|按 1000 件作比例换算:140 件被标记的产品中,45 件来自不合格品。整数计数用于解释给定概率,不是实际抽样结果。]]
下图两条横条采用相同的数量比例尺,均从10000件产品换算。绿色部分是真标记,粉色部分是误标记。先验降为十分之一时,真标记也降为十分之一,而误标记仍然很多,所以绿色部分占整条标记结果的比例显著下降。
于是
<math display="block">P(H\mid E)=\frac{0.90\times0.05}{0.90\times0.05+0.10\times0.95}=\frac{45}{140}=\frac9{28}\approx32.14\%.</math>
“能检测出九成不合格品”不意味着“被标记的产品有九成不合格”。因为合格品基数更大,即使误标率只有 10%,误标数量仍多于正确标记数量。


若其他条件不变,而先验不合格率改为 50%,后验就变成 <math>0.45/(0.45+0.05)=90\%</math>。同一套检测性能,在不同总体中可以产生不同的后验概率。
[[File:Gezhi-analysis-bayes-base-rate.svg|frame|center|alt=相同检测性能下不合格率百分之五时有四百五十真标记和九百五十误标记,不合格率千分之五时有四十五真标记和九百九十五误标记|后验比例分别为32.14%和4.33%;分母是每条横条的全部标记数。]]
 
若不合格率为50%,同一公式给出 <math>0.45/(0.45+0.05)=90\%</math>。先验可来自明确的抽样分布或已有统计记录,关键是它是否对应当前所检测的总体。


== 用赔率观察证据强度 ==
== 用赔率观察证据强度 ==
当相关概率非零时,定理还可写为
赔率是事件与其补事件的概率之比。例如概率1/4对应赔率1:3,而不是1:4。分别对H与 <math>H^c</math> 写贝叶斯公式,再相除,共同的分母 <math>P(E)</math> 消掉,得到(以下分母均须为正)
<math display="block">\frac{P(H\mid E)}{P(H^c\mid E)}=\frac{P(H)}{P(H^c)}\cdot\frac{P(E\mid H)}{P(E\mid H^c)}.</math>
<math display="block">\frac{P(H\mid E)}{P(H^c\mid E)}=\frac{P(H)}{P(H^c)}\cdot\frac{P(E\mid H)}{P(E\mid H^c)}.</math>
右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 <math>1:19</math>,似然比为 9,所以后验赔率为 <math>9:19</math>,换回概率即 <math>9/28</math>。
右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 <math>1:19</math>,似然比为 9,所以后验赔率为 <math>9:19</math>,换回概率即 <math>9/28</math>。


== 多个假设与连续参数 ==
== 连续两次标记会怎样改变后验 ==
回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 <math>0.9^2</math> 与 <math>0.1^2</math>。后验为
<math display="block">\frac{0.05\times0.9^2}{0.05\times0.9^2+0.95\times0.1^2}=\frac{81}{100}=81\%.</math>
也可先更新赔率 <math>1:19</math>,每次乘似然比 9,得到 <math>81:19</math>,再转换为概率。两条计算路线一致,是一个有用的检查。
 
但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 <math>9/28</math>。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 <math>P(E_1,E_2\mid H)</math>,而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。
 
== 从两个来源推广到多个来源 ==
若 <math>H_1,\ldots,H_k</math> 是互斥且完备的假设,分母要对它们求和:
若 <math>H_1,\ldots,H_k</math> 是互斥且完备的假设,分母要对它们求和:
<math display="block">P(H_i\mid E)=\frac{P(E\mid H_i)P(H_i)}{\sum_{j=1}^k P(E\mid H_j)P(H_j)}.</math>
<math display="block">P(H_i\mid E)=\frac{P(E\mid H_i)P(H_i)}{\sum_{j=1}^k P(E\mid H_j)P(H_j)}.</math>
连续参数情形则用概率密度和积分进行归一化,不能把某个连续参数点的密度直接当成该点的概率。后验的用途包括参数估计、分类与序贯更新,但结果依赖模型及先验是否合理。
分子是一条来源路径的联合概率,分母把所有来源路径加起来,正是检测树中两条路径求和的推广。
 
== 重复检测不能随意重复相乘 ==
使用多个证据时,应更新 <math>P(E_2\mid H,E_1)</math> 等条件概率。只有在给定假设后证据条件独立时,才能把联合似然分解成简单乘积。重复运行同一个有系统偏差的检测器,往往不能当成获得了完全独立的新证据。
 
== 把四个概率放在同一张图里 ==
条件概率的方向不能靠中文语感猜测。<math>P(E\mid H)</math> 把 H 作为参照范围,问这一范围内有多少会出现 E;<math>P(H\mid E)</math> 则把参照范围改成 E,问其中有多少来自 H。二者的分子都与交集有关,分母却不同。即使 H 几乎总能产生 E,也可能存在大量非 H 的情况同样产生 E。
 
先验不是“不看事实的主观猜测”的同义词,它可以来自已知抽样机制、历史数据或明确的先验分布;这些来源是否适用于当前总体,仍须说明。似然把已经观察到的数据固定,比较不同假设对它的解释程度;作为参数的函数,似然不必积分为 1。后验则是在所选模型和证据条件下归一化后的概率。这几种对象承担不同任务,把它们都叫“置信度”会丢掉重要区别。


== 三个来源的完整归一化 ==
=== 从哪条生产线来 ===
假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。
假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。


用 <math>A,B,C</math> 分别表示来自甲、乙、丙线的事件,<math>D</math> 表示不合格。三个联合概率为 <math>P(A\cap D)=0.5\times0.01=0.005</math>、<math>P(B\cap D)=0.006</math>、<math>P(C\cap D)=0.008</math>。因此 <math>P(D)=0.019</math>,三个后验分别为 <math>5/19,6/19,8/19</math>。它们相加等于 1;丙线的答案是 <math>8/19\approx42.11\%</math>。
用 <math>A,B,C</math> 分别表示来自甲、乙、丙线的事件,<math>D</math> 表示不合格。三个联合概率为 <math>P(A\cap D)=0.5\times0.01=0.005</math>、<math>P(B\cap D)=0.006</math>、<math>P(C\cap D)=0.008</math>。因此 <math>P(D)=0.019</math>,三个后验分别为 <math>5/19,6/19,8/19</math>。它们相加等于 1;丙线的答案是 <math>8/19\approx42.11\%</math>。


这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;不过仍不能断言这件不合格品一定来自丙线。若生产线之间存在未记录的混料,或不合格率来自不同时间段,原来的三类模型还需重新检查。
这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;三条线的后验仍都为正,单件来源尚未确定。


== 连续参数:从事件概率到后验密度 ==
== 连续参数:从事件概率到后验密度 ==
假设未知参数 <math>\theta\in[0,1]</math> 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;这是一项明确选择,不是对所有参数化方式都“绝对客观”的先验。
假设未知参数 <math>\theta\in[0,1]</math> 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;它给相同长度的区间相同的先验概率。


现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 <math>3\theta^2(1-\theta)</math>;若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。因为 <math>\int_0^1\theta^2(1-\theta)\,d\theta=1/12</math>,后验密度为
现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 <math>3\theta^2(1-\theta)</math>;若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。把先验乘以似然,得到与 <math>\theta^2(1-\theta)</math> 成比例的密度。为让总积分为1,先算
<math display="block">\int_0^1\theta^2(1-\theta)\,d\theta=\left[\frac{\theta^3}3-\frac{\theta^4}4\right]_0^1=\frac1{12}.</math>
因此需要乘12,后验密度为
<math display="block">p(\theta\mid D)=12\theta^2(1-\theta),\qquad0\le\theta\le1.</math>
<math display="block">p(\theta\mid D)=12\theta^2(1-\theta),\qquad0\le\theta\le1.</math>
它是 Beta(3,2) 分布,区间外为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。
这类密度按 <math>\theta^{\alpha-1}(1-\theta)^{\beta-1}</math> 的形状命名为Beta分布,故这里称Beta(3,2),区间外密度为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。


下一次成功的预测概率需要把未知 θ 平均掉:
下一次成功的预测概率需要把未知 θ 平均掉:
<math display="block">P(X_{\mathrm{new}}=1\mid D)=\int_0^1\theta p(\theta\mid D)\,d\theta=12\left(\frac14-\frac15\right)=\frac35.</math>
<math display="block">P(X_{\mathrm{new}}=1\mid D)=\int_0^1\theta p(\theta\mid D)\,d\theta=12\left(\frac14-\frac15\right)=\frac35.</math>
结果 0.6 与样本成功率 <math>2/3</math> 不同,因为该预测同时使用了均匀先验和有限样本。这是一个演示而非默认处理所有实验的方法;连续先验与更新的教材依据见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class13-prep-a_pdf/ MIT 18.05 第 13a 讲]。
结果 0.6 与样本成功率 <math>2/3</math> 不同,因为该预测同时使用了均匀先验和有限样本。连续先验与更新的教材依据见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class13-prep-a_pdf/ MIT 18.05 第 13a 讲]。
 
== 连续两次标记会怎样改变后验 ==
回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 <math>0.9^2</math> 与 <math>0.1^2</math>。后验为
<math display="block">\frac{0.05\times0.9^2}{0.05\times0.9^2+0.95\times0.1^2}=\frac{81}{100}=81\%.</math>
也可先更新赔率 <math>1:19</math>,每次乘似然比 9,得到 <math>81:19</math>,再转换为概率。两条计算路线一致,是一个有用的检查。
 
但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 <math>9/28</math>。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 <math>P(E_1,E_2\mid H)</math>,而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。
 
== 后验不是脱离模型的最终判决 ==
如果一个假设先验为零,而其余模型正常且证据有正概率,简单的贝叶斯更新不能把它变成正概率。这个边界提醒建模者:把“现在没有观察到”直接写成“绝不可能”,可能永久排除真实解释。同样,如果所有假设都对证据给出零概率,分母为零,问题不是得到一个神秘后验,而是现有模型无法解释观测或条件化方式需要更细的理论。
 
后验概率高,也不自动意味着某个行动最佳。行动选择还需要损失或代价:误报与漏报的损失可以不同。数学上,应对每个行动计算后验期望损失,再进行[[优化]]。概率更新与决策评价是相邻而不同的步骤,不能用一个任意阈值掩盖成本假设。
 
还应区分参数不确定性与模型不确定性。即使在一个错误模型内对 θ 的后验极为集中,也不能证明模型结构正确。检查后验预测能否重现实际数据的形状,比较不同先验的敏感性,查看抽样偏差,都是必要的补充。更多数据会减少某些随机不确定性,却不会自动修复系统性偏差。


== 改变先验后,哪些计算需要重新进行 ==
== 改变先验后,哪些计算需要重新进行 ==
前面的三次试验采用均匀先验。若改为密度 <math>p(\theta)=6\theta(1-\theta)</math>,它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 <math>\theta^3(1-\theta)^2</math>。因为其积分为 <math>1/60</math>,后验变为 <math>60\theta^3(1-\theta)^2</math>,即 Beta(4,3) 分布。
前面的三次试验采用均匀先验。若改为密度 <math>p(\theta)=6\theta(1-\theta)</math>,它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 <math>\theta^3(1-\theta)^2</math>。展开积分为 <math>\int_0^1(\theta^3-2\theta^4+\theta^5)\,d\theta=1/4-2/5+1/6=1/60</math>,因此后验变为 <math>60\theta^3(1-\theta)^2</math>,即 Beta(4,3) 分布。


下一次成功的预测概率成为 <math>4/7\approx0.5714</math>,而不是原先的0.6。这两个结果没有哪一个仅凭公式就被宣布为“绝对客观”;应检查不同先验表达的信息是否适合问题,并报告结论对选择有多敏感。只给出一种先验下的小数位而不交代先验,隐藏了模型的重要输入。
再乘一个 <math>\theta</math> 求平均,预测成功率为 <math>60(1/5-2/6+1/7)=4/7\approx0.5714</math>。它比均匀先验下的0.6略低,反映新的先验更偏重中间概率。


在这类二项似然与Beta先验的模型中,先验参数为正数 <math>\alpha,\beta</math>,观察 s 次成功、f 次失败后,后验参数为 <math>\alpha+s,\beta+f</math>。这称为共轭结构,来源是乘法把幂次相加。它使计算方便,但并不意味着所有问题都必须选这个先验族,也不意味着先验一定等价于真实存在过的若干次旧试验。
在这类二项似然与Beta先验的模型中,先验参数为正数 <math>\alpha,\beta</math>,观察 s 次成功、f 次失败后,后验参数为 <math>\alpha+s,\beta+f</math>。这称为共轭结构,来源是乘法把幂次相加。这里的参数加法直接来自似然与先验相乘时幂次相加。


== 条件独立如何产生相关的预测 ==
== 条件独立如何产生相关的预测 ==
第94行: 第83行:
它不等于 <math>(3/5)^2=9/25</math>。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。
它不等于 <math>(3/5)^2=9/25</math>。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。


若先观察到第一次未来试验成功,再更新后验为 Beta(4,2),第二次成功概率变为 <math>2/3</math>。于是顺序计算的联合概率为 <math>(3/5)(2/3)=2/5</math>,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。
若先观察到第一次未来试验成功,密度再乘 <math>\theta</math>,并除以预测成功率 <math>3/5</math>,得到 <math>20\theta^3(1-\theta)</math>,即Beta(4,2)。第二次成功概率为 <math>20(1/5-1/6)=2/3</math>。于是顺序计算的联合概率为 <math>(3/5)(2/3)=2/5</math>,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。


== 后验区间、点估计与预测回答不同问题 ==
== 后验区间、点估计与预测回答不同问题 ==
第101行: 第90行:
点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。
点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。


参数化改变时,概率密度还会带上换元因子,因此最大密度点不一定简单地按同一函数变换。区间概率则必须通过积分保持一致。把密度最高点称为“最可能的精确参数值”虽然常见,却应注意连续参数单点概率为零这一事实。


== 概率更新之后,行动还需要损失 ==
== 概率更新之后,行动还需要损失 ==
第107行: 第95行:


这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。
这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。
== 更新公式的定义范围 ==
如果某个假设的先验为零,而观测证据有正概率,公式分子仍为零,后验也为零。若各假设对证据都给出零概率,则 <math>P(E)=0</math>,本条的事件条件概率公式无法使用;需要重新检查模型或采用更一般的条件化方法。


== Bayes、Price 与逆概率的发展 ==
== Bayes、Price 与逆概率的发展 ==
Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 [https://mathshistory.st-andrews.ac.uk/Biographies/Bayes/ MacTutor 的 Bayes 传记]。卷年、宣读时间与实际刊行时间在历史材料中可能不同,不能把它们当成同一事件的三个相互矛盾答案。
Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 [https://mathshistory.st-andrews.ac.uk/Biographies/Bayes/ MacTutor 的 Bayes 传记]。
 
后来 Laplace 将逆概率思想用于更广泛的推断问题。现代通用的条件概率恒等式、具体先验的选择,以及如今的大规模贝叶斯计算,并不是 Bayes 一篇文章已经全部完成的内容。名称提供历史线索,却不能代替对贡献范围的区分;Laplace 的相关工作可参见 [https://mathshistory.st-andrews.ac.uk/DSB/Laplace.pdf Charles C. Gillispie 的 Laplace 学术传记]。


== 编者评注(AI 辅助) ==
后来 Laplace 将逆概率思想用于更广泛的推断问题。Laplace的相关工作可参见 [https://mathshistory.st-andrews.ac.uk/DSB/Laplace.pdf Charles C. Gillispie 的 Laplace 学术传记]。
本条把分母的归一化、条件独立和先验敏感性作为重点。公式本身很短,但只有把所有可能来源列清、把证据生成机制写对,后验才有可解释的含义。学习时可同时用比例人数和代数公式计算同一例子;若两种方式不一致,优先检查参照总体与联合事件,而不是急于换一条公式。


== 参考来源与延伸阅读 ==
== 参考来源与延伸阅读 ==

2026年9月20日 (日) 07:16的版本

贝叶斯定理(Bayes' theorem)把一种条件概率换成反向的条件概率:已知某类对象产生某种结果的机会,怎样计算看到这个结果后,对象属于该类的机会?它的核心是把产生同一结果的各个来源一起计算,再在这些结果中重新取比例。

被标记的产品中,有多少真的不合格

采用一组教学数据:产品有5%不合格,检测会标记90%的不合格品,也会误标10%的合格品。现随机取一件,发现它被标记。它不合格的概率是多少?

先把比例换算为1000件来观察:其中50件不合格、950件合格。前一组有 50×0.9=45 件被标记,后一组有 950×0.1=95 件被标记。图中两条通向“被标记”的路径,要合在一起看。

一千件示例产品分为五十件不合格和九百五十件合格,分别有四十五件和九十五件被标记
140件被标记产品中,45件来自不合格品;这些整数用于换算给定比例,并非实际抽样记录。

总共140件被标记,其中45件不合格,所以所求比例为 45/140=9/2832.14%。检出率90%使用“不合格品”作分母;这个32.14%使用“被标记产品”作分母。两个比例回答不同的问题。合格品数量远多于不合格品,即使其中只有10%被误标,也会贡献较多标记。

从同一个交集推导公式

H 表示“不合格”,E 表示“被标记”。交集 HE 就是同时不合格且被标记的产品。由条件概率定义,可以从两个方向算它: P(HE)=P(EH)P(H)=P(HE)P(E). 只要 P(H)>0P(E)>0,等式两端除以 P(E) 就得到 P(HE)=P(EH)P(H)P(E). 这便是贝叶斯定理。P(H) 是看检测结果之前的先验概率P(HE) 是观察结果后的后验概率。固定已经观察到的结果,比较不同假设给出的 P(EH),是在比较它们的似然

Hc 表示合格。被标记产品来自不合格与合格两条互斥路径,全概率公式给出 P(E)=P(EH)P(H)+P(EHc)P(Hc). 把检测数值代入,得到 P(E)=0.9×0.05+0.1×0.95=0.14,再以 0.045/0.14 算后验,与图中的45/140完全一致。该推导未假设假设与证据独立;若二者本来独立,观察证据反而不会改变先验。

总体变了,同一种检测的结果也会变

若其他条件不变,而不合格率降到0.5%,则 P(HE)=0.9×0.0050.9×0.005+0.1×0.995=4510404.33%. 按10000件换算,此时真标记45件、误标记995件;原先5%的总体则真标记450件、误标记950件。检测性能没变,发生不合格的基础比例变了,因此标记的组成也变了。

下图两条横条采用相同的数量比例尺,均从10000件产品换算。绿色部分是真标记,粉色部分是误标记。先验降为十分之一时,真标记也降为十分之一,而误标记仍然很多,所以绿色部分占整条标记结果的比例显著下降。

相同检测性能下不合格率百分之五时有四百五十真标记和九百五十误标记,不合格率千分之五时有四十五真标记和九百九十五误标记
后验比例分别为32.14%和4.33%;分母是每条横条的全部标记数。

若不合格率为50%,同一公式给出 0.45/(0.45+0.05)=90%。先验可来自明确的抽样分布或已有统计记录,关键是它是否对应当前所检测的总体。

用赔率观察证据强度

赔率是事件与其补事件的概率之比。例如概率1/4对应赔率1:3,而不是1:4。分别对H与 Hc 写贝叶斯公式,再相除,共同的分母 P(E) 消掉,得到(以下分母均须为正) P(HE)P(HcE)=P(H)P(Hc)P(EH)P(EHc). 右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 1:19,似然比为 9,所以后验赔率为 9:19,换回概率即 9/28

连续两次标记会怎样改变后验

回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 0.920.12。后验为 0.05×0.920.05×0.92+0.95×0.12=81100=81%. 也可先更新赔率 1:19,每次乘似然比 9,得到 81:19,再转换为概率。两条计算路线一致,是一个有用的检查。

但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 9/28。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 P(E1,E2H),而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。

从两个来源推广到多个来源

H1,,Hk 是互斥且完备的假设,分母要对它们求和: P(HiE)=P(EHi)P(Hi)j=1kP(EHj)P(Hj). 分子是一条来源路径的联合概率,分母把所有来源路径加起来,正是检测树中两条路径求和的推广。

从哪条生产线来

假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。

A,B,C 分别表示来自甲、乙、丙线的事件,D 表示不合格。三个联合概率为 P(AD)=0.5×0.01=0.005P(BD)=0.006P(CD)=0.008。因此 P(D)=0.019,三个后验分别为 5/19,6/19,8/19。它们相加等于 1;丙线的答案是 8/1942.11%

这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;三条线的后验仍都为正,单件来源尚未确定。

连续参数:从事件概率到后验密度

假设未知参数 θ[0,1] 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;它给相同长度的区间相同的先验概率。

现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 3θ2(1θ);若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。把先验乘以似然,得到与 θ2(1θ) 成比例的密度。为让总积分为1,先算 01θ2(1θ)dθ=[θ33θ44]01=112. 因此需要乘12,后验密度为 p(θD)=12θ2(1θ),0θ1. 这类密度按 θα1(1θ)β1 的形状命名为Beta分布,故这里称Beta(3,2),区间外密度为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。

下一次成功的预测概率需要把未知 θ 平均掉: P(Xnew=1D)=01θp(θD)dθ=12(1415)=35. 结果 0.6 与样本成功率 2/3 不同,因为该预测同时使用了均匀先验和有限样本。连续先验与更新的教材依据见 MIT 18.05 第 13a 讲

改变先验后,哪些计算需要重新进行

前面的三次试验采用均匀先验。若改为密度 p(θ)=6θ(1θ),它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 θ3(1θ)2。展开积分为 01(θ32θ4+θ5)dθ=1/42/5+1/6=1/60,因此后验变为 60θ3(1θ)2,即 Beta(4,3) 分布。

再乘一个 θ 求平均,预测成功率为 60(1/52/6+1/7)=4/70.5714。它比均匀先验下的0.6略低,反映新的先验更偏重中间概率。

在这类二项似然与Beta先验的模型中,先验参数为正数 α,β,观察 s 次成功、f 次失败后,后验参数为 α+s,β+f。这称为共轭结构,来源是乘法把幂次相加。这里的参数加法直接来自似然与先验相乘时幂次相加。

条件独立如何产生相关的预测

给定一个固定的成功率 θ 后,两次未来试验可以独立;但在 θ 尚有后验不确定性时,把它积分掉之后,两次结果通常不再独立。这不是前后矛盾,因为条件化所使用的信息已经不同。

使用先前 Beta(3,2) 后验,每次未来成功的边缘预测概率都是 3/5,而两次都成功的预测概率为 01θ212θ2(1θ)dθ=12(1516)=25. 它不等于 (3/5)2=9/25。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。

若先观察到第一次未来试验成功,密度再乘 θ,并除以预测成功率 3/5,得到 20θ3(1θ),即Beta(4,2)。第二次成功概率为 20(1/51/6)=2/3。于是顺序计算的联合概率为 (3/5)(2/3)=2/5,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。

后验区间、点估计与预测回答不同问题

连续参数的后验密度可以用于计算区间概率。若某区间内后验密度的积分为0.95,便可称该区间在给定数据和模型下具有95%的后验概率。这个概率说的是参数落在区间内的后验不确定性,不是说密度曲线上的每个点都有正概率,也不自动等同于频率学派置信区间的长期覆盖解释。

点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。


概率更新之后,行动还需要损失

在一个纯教学的二分类决策中,设把合格品误判为不合格的损失记为4个单位,把不合格品漏判的损失记为12个单位,正确判断的损失为零。若后验不合格概率为 p,选择“不合格”的期望损失为 4(1p),选择“合格”的期望损失为 12p。前者较小当且仅当 p>1/4

这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。

更新公式的定义范围

如果某个假设的先验为零,而观测证据有正概率,公式分子仍为零,后验也为零。若各假设对证据都给出零概率,则 P(E)=0,本条的事件条件概率公式无法使用;需要重新检查模型或采用更一般的条件化方法。

Bayes、Price 与逆概率的发展

Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 MacTutor 的 Bayes 传记

后来 Laplace 将逆概率思想用于更广泛的推断问题。Laplace的相关工作可参见 Charles C. Gillispie 的 Laplace 学术传记

参考来源与延伸阅读