贝叶斯定理:修订间差异
Bayes’ theorem
AIContentBot(留言 | 贡献) 扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航 |
AIContentBot(留言 | 贡献) 扩充线性代数、最小二乘、贝叶斯与正态分布,接通几何和建模学习路径 |
||
| (未显示同一用户的1个中间版本) | |||
| 第1行: | 第1行: | ||
'''贝叶斯定理'''(Bayes' | '''贝叶斯定理'''(Bayes' theorem)把一种条件概率换成反向的条件概率:已知某类对象产生某种结果的机会,怎样计算看到这个结果后,对象属于该类的机会?它的核心是把产生同一结果的各个来源一起计算,再在这些结果中重新取比例。 | ||
== 被标记的产品中,有多少真的不合格 == | |||
采用一组教学数据:产品有5%不合格,检测会标记90%的不合格品,也会误标10%的合格品。现随机取一件,发现它被标记。它不合格的概率是多少? | |||
先把比例换算为1000件来观察:其中50件不合格、950件合格。前一组有 <math>50\times0.9=45</math> 件被标记,后一组有 <math>950\times0.1=95</math> 件被标记。图中两条通向“被标记”的路径,要合在一起看。 | |||
[[File:Gezhi-bayes-tree-theme.svg|frame|center|alt=一千件示例产品分为五十件不合格和九百五十件合格,分别有四十五件和九十五件被标记|140件被标记产品中,45件来自不合格品;这些整数用于换算给定比例,并非实际抽样记录。]] | |||
总共140件被标记,其中45件不合格,所以所求比例为 <math>45/140=9/28\approx32.14\%</math>。检出率90%使用“不合格品”作分母;这个32.14%使用“被标记产品”作分母。两个比例回答不同的问题。合格品数量远多于不合格品,即使其中只有10%被误标,也会贡献较多标记。 | |||
</ | |||
== | == 从同一个交集推导公式 == | ||
用 <math>H</math> 表示“不合格”,<math>E</math> 表示“被标记”。交集 <math>H\cap E</math> 就是同时不合格且被标记的产品。由[[概率|条件概率]]定义,可以从两个方向算它: | |||
<math display="block">P(H\cap E)=P(H\mid E)P(E)=P(E\mid H)P(H).</math> | <math display="block">P(H\cap E)=P(E\mid H)P(H)=P(H\mid E)P(E).</math> | ||
只要 <math>P(H)>0</math>、<math>P(E)>0</math>,等式两端除以 <math>P(E)</math> 就得到 | |||
<math display="block">P(H\mid E)=\frac{P(E\mid H)P(H)}{P(E)}.</math> | |||
这便是贝叶斯定理。<math>P(H)</math> 是看检测结果之前的'''先验概率''';<math>P(H\mid E)</math> 是观察结果后的'''后验概率'''。固定已经观察到的结果,比较不同假设给出的 <math>P(E\mid H)</math>,是在比较它们的'''似然'''。 | |||
用 <math>H^c</math> 表示合格。被标记产品来自不合格与合格两条互斥路径,全概率公式给出 | |||
<math display="block">P(E)=P(E\mid H)P(H)+P(E\mid H^c)P(H^c).</math> | <math display="block">P(E)=P(E\mid H)P(H)+P(E\mid H^c)P(H^c).</math> | ||
把检测数值代入,得到 <math>P(E)=0.9\times0.05+0.1\times0.95=0.14</math>,再以 <math>0.045/0.14</math> 算后验,与图中的45/140完全一致。该推导未假设假设与证据独立;若二者本来独立,观察证据反而不会改变先验。 | |||
== 总体变了,同一种检测的结果也会变 == | |||
若其他条件不变,而不合格率降到0.5%,则 | |||
<math display="block">P(H\mid E)=\frac{0.9\times0.005}{0.9\times0.005+0.1\times0.995}=\frac{45}{1040}\approx4.33\%.</math> | |||
按10000件换算,此时真标记45件、误标记995件;原先5%的总体则真标记450件、误标记950件。检测性能没变,发生不合格的基础比例变了,因此标记的组成也变了。 | |||
下图两条横条采用相同的数量比例尺,均从10000件产品换算。绿色部分是真标记,粉色部分是误标记。先验降为十分之一时,真标记也降为十分之一,而误标记仍然很多,所以绿色部分占整条标记结果的比例显著下降。 | |||
[[File:Gezhi-bayes- | [[File:Gezhi-analysis-bayes-base-rate.svg|frame|center|alt=相同检测性能下不合格率百分之五时有四百五十真标记和九百五十误标记,不合格率千分之五时有四十五真标记和九百九十五误标记|后验比例分别为32.14%和4.33%;分母是每条横条的全部标记数。]] | ||
若不合格率为50%,同一公式给出 <math>0.45/(0.45+0.05)=90\%</math>。先验可来自明确的抽样分布或已有统计记录,关键是它是否对应当前所检测的总体。 | |||
== 用赔率观察证据强度 == | == 用赔率观察证据强度 == | ||
赔率是事件与其补事件的概率之比。例如概率1/4对应赔率1:3,而不是1:4。分别对H与 <math>H^c</math> 写贝叶斯公式,再相除,共同的分母 <math>P(E)</math> 消掉,得到(以下分母均须为正) | |||
<math display="block">\frac{P(H\mid E)}{P(H^c\mid E)}=\frac{P(H)}{P(H^c)}\cdot\frac{P(E\mid H)}{P(E\mid H^c)}.</math> | <math display="block">\frac{P(H\mid E)}{P(H^c\mid E)}=\frac{P(H)}{P(H^c)}\cdot\frac{P(E\mid H)}{P(E\mid H^c)}.</math> | ||
右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 <math>1:19</math>,似然比为 9,所以后验赔率为 <math>9:19</math>,换回概率即 <math>9/28</math>。 | 右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 <math>1:19</math>,似然比为 9,所以后验赔率为 <math>9:19</math>,换回概率即 <math>9/28</math>。 | ||
== | == 连续两次标记会怎样改变后验 == | ||
回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 <math>0.9^2</math> 与 <math>0.1^2</math>。后验为 | |||
<math display="block">\frac{0.05\times0.9^2}{0.05\times0.9^2+0.95\times0.1^2}=\frac{81}{100}=81\%.</math> | |||
也可先更新赔率 <math>1:19</math>,每次乘似然比 9,得到 <math>81:19</math>,再转换为概率。两条计算路线一致,是一个有用的检查。 | |||
但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 <math>9/28</math>。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 <math>P(E_1,E_2\mid H)</math>,而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。 | |||
== 从两个来源推广到多个来源 == | |||
若 <math>H_1,\ldots,H_k</math> 是互斥且完备的假设,分母要对它们求和: | 若 <math>H_1,\ldots,H_k</math> 是互斥且完备的假设,分母要对它们求和: | ||
<math display="block">P(H_i\mid E)=\frac{P(E\mid H_i)P(H_i)}{\sum_{j=1}^k P(E\mid H_j)P(H_j)}.</math> | <math display="block">P(H_i\mid E)=\frac{P(E\mid H_i)P(H_i)}{\sum_{j=1}^k P(E\mid H_j)P(H_j)}.</math> | ||
分子是一条来源路径的联合概率,分母把所有来源路径加起来,正是检测树中两条路径求和的推广。 | |||
== | === 从哪条生产线来 === | ||
假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。 | 假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。 | ||
用 <math>A,B,C</math> 分别表示来自甲、乙、丙线的事件,<math>D</math> 表示不合格。三个联合概率为 <math>P(A\cap D)=0.5\times0.01=0.005</math>、<math>P(B\cap D)=0.006</math>、<math>P(C\cap D)=0.008</math>。因此 <math>P(D)=0.019</math>,三个后验分别为 <math>5/19,6/19,8/19</math>。它们相加等于 1;丙线的答案是 <math>8/19\approx42.11\%</math>。 | 用 <math>A,B,C</math> 分别表示来自甲、乙、丙线的事件,<math>D</math> 表示不合格。三个联合概率为 <math>P(A\cap D)=0.5\times0.01=0.005</math>、<math>P(B\cap D)=0.006</math>、<math>P(C\cap D)=0.008</math>。因此 <math>P(D)=0.019</math>,三个后验分别为 <math>5/19,6/19,8/19</math>。它们相加等于 1;丙线的答案是 <math>8/19\approx42.11\%</math>。 | ||
这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;三条线的后验仍都为正,单件来源尚未确定。 | |||
== 连续参数:从事件概率到后验密度 == | == 连续参数:从事件概率到后验密度 == | ||
假设未知参数 <math>\theta\in[0,1]</math> 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 | 假设未知参数 <math>\theta\in[0,1]</math> 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;它给相同长度的区间相同的先验概率。 | ||
现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 <math>3\theta^2(1-\theta)</math>;若记录一条指定顺序,似然少一个与 θ 无关的常数 | 现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 <math>3\theta^2(1-\theta)</math>;若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。把先验乘以似然,得到与 <math>\theta^2(1-\theta)</math> 成比例的密度。为让总积分为1,先算 | ||
<math display="block">\int_0^1\theta^2(1-\theta)\,d\theta=\left[\frac{\theta^3}3-\frac{\theta^4}4\right]_0^1=\frac1{12}.</math> | |||
因此需要乘12,后验密度为 | |||
<math display="block">p(\theta\mid D)=12\theta^2(1-\theta),\qquad0\le\theta\le1.</math> | <math display="block">p(\theta\mid D)=12\theta^2(1-\theta),\qquad0\le\theta\le1.</math> | ||
这类密度按 <math>\theta^{\alpha-1}(1-\theta)^{\beta-1}</math> 的形状命名为Beta分布,故这里称Beta(3,2),区间外密度为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。 | |||
<math | |||
[[File:Gezhi-expand-bayes-posterior.svg|frame|center|alt=成功率零到一区间上,均匀先验密度为一,观察两次成功一次失败后后验为十二theta平方乘一减theta,阴影标出theta大于二分之一的后验概率十六分之十一|曲线高度是密度,阴影面积才是概率。均匀先验与后验的总面积都为一,后验向较高成功率的一侧重新分配了概率。]] | |||
例如现在可以问“成功率超过一半的后验概率是多少”。积分给出 | |||
<math display="block">P(\theta>1/2\mid D) | |||
=\left[4\theta^3-3\theta^4\right]_{1/2}^{1} | |||
=1-\frac5{16}=\frac{11}{16}=0.6875.</math> | |||
这里不需要把整个后验压成一个参数估计。后验认为较高成功率更有可能,同时仍为另一半区间留下 <math>5/16</math> 的概率。 | |||
下一次成功的预测概率需要把未知 θ 平均掉: | |||
<math display="block">P(X_{\mathrm{new}}=1\mid D)=\int_0^1\theta p(\theta\mid D)\,d\theta=12\left(\frac14-\frac15\right)=\frac35.</math> | |||
结果 0.6 与样本成功率 <math>2/3</math> 不同,因为该预测同时使用了均匀先验和有限样本。连续先验与更新的教材依据见 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class13-prep-a_pdf/ MIT 18.05 第 13a 讲]。 | |||
== 改变先验后,哪些计算需要重新进行 == | == 改变先验后,哪些计算需要重新进行 == | ||
前面的三次试验采用均匀先验。若改为密度 <math>p(\theta)=6\theta(1-\theta)</math>,它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 <math>\theta^3(1-\theta)^2</math> | 前面的三次试验采用均匀先验。若改为密度 <math>p(\theta)=6\theta(1-\theta)</math>,它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 <math>\theta^3(1-\theta)^2</math>。展开积分为 <math>\int_0^1(\theta^3-2\theta^4+\theta^5)\,d\theta=1/4-2/5+1/6=1/60</math>,因此后验变为 <math>60\theta^3(1-\theta)^2</math>,即 Beta(4,3) 分布。 | ||
再乘一个 <math>\theta</math> 求平均,预测成功率为 <math>60(1/5-2/6+1/7)=4/7\approx0.5714</math>。它比均匀先验下的0.6略低,反映新的先验更偏重中间概率。 | |||
在这类二项似然与Beta先验的模型中,先验参数为正数 <math>\alpha,\beta</math>,观察 s 次成功、f 次失败后,后验参数为 <math>\alpha+s,\beta+f</math> | 在这类二项似然与Beta先验的模型中,先验参数为正数 <math>\alpha,\beta</math>,观察 s 次成功、f 次失败后,后验参数为 <math>\alpha+s,\beta+f</math>。这称为共轭结构,来源是乘法把幂次相加。这里的参数加法直接来自似然与先验相乘时幂次相加。 | ||
== 条件独立如何产生相关的预测 == | == 条件独立如何产生相关的预测 == | ||
| 第94行: | 第92行: | ||
它不等于 <math>(3/5)^2=9/25</math>。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。 | 它不等于 <math>(3/5)^2=9/25</math>。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。 | ||
若先观察到第一次未来试验成功,密度再乘 <math>\theta</math>,并除以预测成功率 <math>3/5</math>,得到 <math>20\theta^3(1-\theta)</math>,即Beta(4,2)。第二次成功概率为 <math>20(1/5-1/6)=2/3</math>。于是顺序计算的联合概率为 <math>(3/5)(2/3)=2/5</math>,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。 | |||
== 后验区间、点估计与预测回答不同问题 == | == 后验区间、点估计与预测回答不同问题 == | ||
| 第101行: | 第99行: | ||
点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。 | 点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。 | ||
=== 为什么平方损失选后验均值 === | |||
仍用 <math>p(\theta\mid D)=12\theta^2(1-\theta)</math>,选择一个数 <math>c</math> 代表未知成功率。若误差按平方计算,给定数据后的期望损失为 <math>L(c)=E[(\theta-c)^2\mid D]</math>。 | |||
前面已算得 <math>E[\theta\mid D]=3/5</math>,二阶矩为 | |||
<math display="block">E[\theta^2\mid D] | |||
=12\int_0^1(\theta^4-\theta^5)\,d\theta=\frac25.</math> | |||
所以后验方差为 <math>2/5-(3/5)^2=1/25</math>。把 <math>\theta-c=(\theta-3/5)+(3/5-c)</math> 展开,中间交叉项的期望为零,得到 | |||
<math display="block">L(c)=\frac1{25}+\left(c-\frac35\right)^2.</math> | |||
第二项非负,且只在 <math>c=3/5</math> 时为零,这就证明了后验均值的最优性。 | |||
[[File:Gezhi-expand-bayes-loss.svg|frame|center|alt=期望平方损失是以c等于零点六为最低点的抛物线,最低值零点零四;密度最高点三分之二位于另一位置,其损失稍高|横轴是要选的点估计c,纵轴是按同一后验平均后的平方损失。最优点取决于损失定义,不能只看密度峰值。]] | |||
后验密度的导数为 <math>12\theta(2-3\theta)</math>,在 <math>2/3</math> 左侧为正、右侧为负,所以密度在此取得内部最大值;两个端点密度为零。因此最大后验密度估计是 <math>2/3</math>,与后验均值 <math>3/5</math> 不同。若用前者作平方损失下的估计,损失为 <math>1/25+(2/3-3/5)^2=2/45</math>,略大于 <math>1/25</math>。这不是两个答案谁算错,而是“选密度峰”与“最小化平均平方误差”本来采用不同准则。 | |||
== 概率更新之后,行动还需要损失 == | == 概率更新之后,行动还需要损失 == | ||
| 第107行: | 第119行: | ||
这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。 | 这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。 | ||
== 更新公式的定义范围 == | |||
如果某个假设的先验为零,而观测证据有正概率,公式分子仍为零,后验也为零。若各假设对证据都给出零概率,则 <math>P(E)=0</math>,本条的事件条件概率公式无法使用;需要重新检查模型或采用更一般的条件化方法。 | |||
== Bayes、Price 与逆概率的发展 == | == Bayes、Price 与逆概率的发展 == | ||
Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 [https://mathshistory.st-andrews.ac.uk/Biographies/Bayes/ MacTutor 的 Bayes 传记 | Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 [https://mathshistory.st-andrews.ac.uk/Biographies/Bayes/ MacTutor 的 Bayes 传记]。 | ||
后来 Laplace 将逆概率思想用于更广泛的推断问题。Laplace的相关工作可参见 [https://mathshistory.st-andrews.ac.uk/DSB/Laplace.pdf Charles C. Gillispie 的 Laplace 学术传记]。 | |||
== 参考来源与延伸阅读 == | == 参考来源与延伸阅读 == | ||
2026年9月20日 (日) 10:06的最新版本
贝叶斯定理(Bayes' theorem)把一种条件概率换成反向的条件概率:已知某类对象产生某种结果的机会,怎样计算看到这个结果后,对象属于该类的机会?它的核心是把产生同一结果的各个来源一起计算,再在这些结果中重新取比例。
被标记的产品中,有多少真的不合格
采用一组教学数据:产品有5%不合格,检测会标记90%的不合格品,也会误标10%的合格品。现随机取一件,发现它被标记。它不合格的概率是多少?
先把比例换算为1000件来观察:其中50件不合格、950件合格。前一组有 件被标记,后一组有 件被标记。图中两条通向“被标记”的路径,要合在一起看。
总共140件被标记,其中45件不合格,所以所求比例为 。检出率90%使用“不合格品”作分母;这个32.14%使用“被标记产品”作分母。两个比例回答不同的问题。合格品数量远多于不合格品,即使其中只有10%被误标,也会贡献较多标记。
从同一个交集推导公式
用 表示“不合格”, 表示“被标记”。交集 就是同时不合格且被标记的产品。由条件概率定义,可以从两个方向算它: 只要 、,等式两端除以 就得到 这便是贝叶斯定理。 是看检测结果之前的先验概率; 是观察结果后的后验概率。固定已经观察到的结果,比较不同假设给出的 ,是在比较它们的似然。
用 表示合格。被标记产品来自不合格与合格两条互斥路径,全概率公式给出 把检测数值代入,得到 ,再以 算后验,与图中的45/140完全一致。该推导未假设假设与证据独立;若二者本来独立,观察证据反而不会改变先验。
总体变了,同一种检测的结果也会变
若其他条件不变,而不合格率降到0.5%,则 按10000件换算,此时真标记45件、误标记995件;原先5%的总体则真标记450件、误标记950件。检测性能没变,发生不合格的基础比例变了,因此标记的组成也变了。
下图两条横条采用相同的数量比例尺,均从10000件产品换算。绿色部分是真标记,粉色部分是误标记。先验降为十分之一时,真标记也降为十分之一,而误标记仍然很多,所以绿色部分占整条标记结果的比例显著下降。
若不合格率为50%,同一公式给出 。先验可来自明确的抽样分布或已有统计记录,关键是它是否对应当前所检测的总体。
用赔率观察证据强度
赔率是事件与其补事件的概率之比。例如概率1/4对应赔率1:3,而不是1:4。分别对H与 写贝叶斯公式,再相除,共同的分母 消掉,得到(以下分母均须为正) 右侧第一项是先验赔率,第二项是似然比。上例先验赔率为 ,似然比为 9,所以后验赔率为 ,换回概率即 。
连续两次标记会怎样改变后验
回到不合格率 5%、检出率 90%、误标率 10% 的例子。若两次检测在给定“是否不合格”后条件独立,则连续两次标记的联合似然分别为 与 。后验为 也可先更新赔率 ,每次乘似然比 9,得到 ,再转换为概率。两条计算路线一致,是一个有用的检查。
但如果第二次只是复制第一次检测的日志,两份记录完全相同,没有新增证据,后验仍为 。现实中的两个检测器还可能共享同一种误差来源,介于独立与复制之间。正确做法是建模 ,而非因为出现两行数据就自动把似然相乘。给定假设的条件独立,也不同于两次检测在总体上无条件独立。
从两个来源推广到多个来源
若 是互斥且完备的假设,分母要对它们求和: 分子是一条来源路径的联合概率,分母把所有来源路径加起来,正是检测树中两条路径求和的推广。
从哪条生产线来
假设教学工厂甲、乙、丙生产线分别占总产量的 50%、30%、20%,不合格率分别为 1%、2%、4%。从混合产量中随机取一件,发现它不合格。求来自丙线的概率,不能只比较不合格率,也不能只比较产量。
用 分别表示来自甲、乙、丙线的事件, 表示不合格。三个联合概率为 、、。因此 ,三个后验分别为 。它们相加等于 1;丙线的答案是 。
这个结果同时受“发生率”和“来源规模”影响。丙线占产量最少,却有最大的后验份额;三条线的后验仍都为正,单件来源尚未确定。
连续参数:从事件概率到后验密度
假设未知参数 表示一个固定过程的成功概率。给定 θ 后,各次试验独立且具有相同成功率。为了构造一个可算的教学模型,先验取区间上的均匀密度 1;它给相同长度的区间相同的先验概率。
现在观察三次试验,成功两次、失败一次。若记录成功总数,似然为 ;若记录一条指定顺序,似然少一个与 θ 无关的常数 3。这个常数在后验归一化中消掉。把先验乘以似然,得到与 成比例的密度。为让总积分为1,先算 因此需要乘12,后验密度为 这类密度按 的形状命名为Beta分布,故这里称Beta(3,2),区间外密度为零。将后验密度对整个区间积分,可检查归一化;不能把某一点处的密度当成该点有正概率。
例如现在可以问“成功率超过一半的后验概率是多少”。积分给出 这里不需要把整个后验压成一个参数估计。后验认为较高成功率更有可能,同时仍为另一半区间留下 的概率。
下一次成功的预测概率需要把未知 θ 平均掉:
结果 0.6 与样本成功率 不同,因为该预测同时使用了均匀先验和有限样本。连续先验与更新的教材依据见 MIT 18.05 第 13a 讲。
改变先验后,哪些计算需要重新进行
前面的三次试验采用均匀先验。若改为密度 ,它在中间较高、两端较低,是另一项明确的教学假设。乘以相同的两次成功一次失败的似然,得到未归一化后验 。展开积分为 ,因此后验变为 ,即 Beta(4,3) 分布。
再乘一个 求平均,预测成功率为 。它比均匀先验下的0.6略低,反映新的先验更偏重中间概率。
在这类二项似然与Beta先验的模型中,先验参数为正数 ,观察 s 次成功、f 次失败后,后验参数为 。这称为共轭结构,来源是乘法把幂次相加。这里的参数加法直接来自似然与先验相乘时幂次相加。
条件独立如何产生相关的预测
给定一个固定的成功率 θ 后,两次未来试验可以独立;但在 θ 尚有后验不确定性时,把它积分掉之后,两次结果通常不再独立。这不是前后矛盾,因为条件化所使用的信息已经不同。
使用先前 Beta(3,2) 后验,每次未来成功的边缘预测概率都是 ,而两次都成功的预测概率为 它不等于 。直观上,若未知成功率实际偏高,两次成功都更有可能;若偏低,两次都更少,未知的共同参数产生了关联。这也是重复测量模型必须说明“给定什么之后独立”的原因。
若先观察到第一次未来试验成功,密度再乘 ,并除以预测成功率 ,得到 ,即Beta(4,2)。第二次成功概率为 。于是顺序计算的联合概率为 ,与一次积分一致。分批更新与一次使用全部证据能一致,依赖于同一个完整概率模型,而不是任意重复套用相同似然。
后验区间、点估计与预测回答不同问题
连续参数的后验密度可以用于计算区间概率。若某区间内后验密度的积分为0.95,便可称该区间在给定数据和模型下具有95%的后验概率。这个概率说的是参数落在区间内的后验不确定性,不是说密度曲线上的每个点都有正概率,也不自动等同于频率学派置信区间的长期覆盖解释。
点估计进一步把整个后验压缩成一个数,选择准则需要说明。后验均值在平方损失下最优,后验中位数对应绝对损失,最大后验密度点则是另一种汇总方式。对于同一个不对称后验,这些数可以不同;它们不是计算误差,而是不同问题的答案。若目标是未来观测,还应进行后验预测,把观测自身的随机性与参数不确定性一起考虑。
为什么平方损失选后验均值
仍用 ,选择一个数 代表未知成功率。若误差按平方计算,给定数据后的期望损失为 。
前面已算得 ,二阶矩为 所以后验方差为 。把 展开,中间交叉项的期望为零,得到 第二项非负,且只在 时为零,这就证明了后验均值的最优性。
后验密度的导数为 ,在 左侧为正、右侧为负,所以密度在此取得内部最大值;两个端点密度为零。因此最大后验密度估计是 ,与后验均值 不同。若用前者作平方损失下的估计,损失为 ,略大于 。这不是两个答案谁算错,而是“选密度峰”与“最小化平均平方误差”本来采用不同准则。
概率更新之后,行动还需要损失
在一个纯教学的二分类决策中,设把合格品误判为不合格的损失记为4个单位,把不合格品漏判的损失记为12个单位,正确判断的损失为零。若后验不合格概率为 p,选择“不合格”的期望损失为 ,选择“合格”的期望损失为 。前者较小当且仅当 。
这个阈值来自所列损失,而不是贝叶斯定理固有的某个神奇比例。若成本改变,最佳行动也可能改变,即使后验概率完全相同。真实决策还可能包括复检、延迟与资源约束;本文的简单损失矩阵仅用于说明更新信念和选择行动之间缺少不了的一步。
更新公式的定义范围
如果某个假设的先验为零,而观测证据有正概率,公式分子仍为零,后验也为零。若各假设对证据都给出零概率,则 ,本条的事件条件概率公式无法使用;需要重新检查模型或采用更一般的条件化方法。
Bayes、Price 与逆概率的发展
Thomas Bayes 在世时留下了关于由观测反推未知概率的研究。其去世后,Richard Price 整理、补充并提交论文,相关工作在 1760 年代发表于皇家学会文献;通常以 1763 年卷的论文《An Essay towards Solving a Problem in the Doctrine of Chances》引用。Bayes 的原问题及 Price 的作用见 MacTutor 的 Bayes 传记。
后来 Laplace 将逆概率思想用于更广泛的推断问题。Laplace的相关工作可参见 Charles C. Gillispie 的 Laplace 学术传记。
参考来源与延伸阅读
- MIT 18.05 第 3 讲:条件概率与贝叶斯公式。
- 统计推断 · 最小二乘法:不同推断与拟合方法的比较。
- MIT OpenCourseWare,18.05,第 3 课及贝叶斯推断材料。
- 概率 · 期望 · 数学建模