超几何分布:修订间差异
AIContentBot(留言 | 贡献) 补充高中数学计数、随机变量与成对数据分析词条,配原创推导和图示 |
AIContentBot(留言 | 贡献) 拆分手机端长公式,确保分布与回归推导完整可读 |
||
| 第1行: | 第1行: | ||
'''超几何分布'''描述有限总体中'''不放回'''地抽取固定数量,数出抽中的标记对象有多少。设总体有 <math>N\ge1</math> 个互不相同的对象,其中 <math>K</math> 个标记、<math>N-K</math> 个未标记;从中等可能地选出 <math>n</math> 个,要求 <math>0\le K,n\le N</math>。令 <math>X</math> 为样本中的标记数,则 | '''超几何分布'''描述有限总体中'''不放回'''地抽取固定数量,数出抽中的标记对象有多少。设总体有 <math>N\ge1</math> 个互不相同的对象,其中 <math>K</math> 个标记、<math>N-K</math> 个未标记;从中等可能地选出 <math>n</math> 个,要求 <math>0\le K,n\le N</math>。令 <math>X</math> 为样本中的标记数,则 | ||
<math display="block">P(X=k)=\frac{\binom Kk\binom{N-K}{n-k}}{\binom Nn} | <math display="block">P(X=k)=\frac{\binom Kk\binom{N-K}{n-k}}{\binom Nn}.</math> | ||
有效的整数取值满足 | |||
\max(0,n-N+K)\le k\le\min(n,K).</math> | <math display="block">\max(0,n-N+K)\le k\le\min(n,K).</math> | ||
超出这个整数范围的概率为零。下界表示样本太大时即使尽量选未标记,也不得不选若干标记;上界既不能超过样本大小,也不能超过总体中的标记数。 | 超出这个整数范围的概率为零。下界表示样本太大时即使尽量选未标记,也不得不选若干标记;上界既不能超过样本大小,也不能超过总体中的标记数。 | ||
| 第17行: | 第17行: | ||
方差则会受到不放回的影响。对两个不同位置 <math>i,j</math>,同时抽中标记的概率为 <math>K(K-1)/[N(N-1)]</math>,所以 | 方差则会受到不放回的影响。对两个不同位置 <math>i,j</math>,同时抽中标记的概率为 <math>K(K-1)/[N(N-1)]</math>,所以 | ||
<math display="block">\operatorname{Cov}(I_i,I_j) | <math display="block">\operatorname{Cov}(I_i,I_j) | ||
=\frac{K(K-1)}{N(N-1)}-\ | =\frac{K(K-1)}{N(N-1)}-p^2.</math> | ||
代入 <math>p=K/N</math> 并通分,得到 | |||
<math display="block">\operatorname{Cov}(I_i,I_j) | |||
=-\frac{p(1-p)}{N-1}\quad(N>1).</math> | =-\frac{p(1-p)}{N-1}\quad(N>1).</math> | ||
负协方差意味着已抽中一个标记后,余下位置抽中的机会降低。把 <math>X</math> 的方差展开为 <math>n</math> 个自身方差与 <math>n(n-1)</math> 个有序交叉项,得到 | 负协方差意味着已抽中一个标记后,余下位置抽中的机会降低。把 <math>X</math> 的方差展开为 <math>n</math> 个自身方差与 <math>n(n-1)</math> 个有序交叉项,得到 | ||
2026年10月9日 (五) 12:15的最新版本
超几何分布描述有限总体中不放回地抽取固定数量,数出抽中的标记对象有多少。设总体有 个互不相同的对象,其中 个标记、 个未标记;从中等可能地选出 个,要求 。令 为样本中的标记数,则 有效的整数取值满足 超出这个整数范围的概率为零。下界表示样本太大时即使尽量选未标记,也不得不选若干标记;上界既不能超过样本大小,也不能超过总体中的标记数。
组合数逐项从哪里来
离散型随机变量的分布列里,。全部样本是 个两卡组合。恰有一张标记,须从两张标记卡中选一张、从三张未标记卡中选一张,分子 ,概率 。对 逐一计算,得到 ,其和为 1。
也可以先看事件顺序:首抽标记、次抽未标记的概率是 ;反过来先未标记、再标记也是 。相加得 6/10。这与组合算法一致,但第二次的分母已经变成 4,体现“不放回”改变了下一步的条件概率。
均值与有限总体修正
令 表示第 次抽取是否标记,。由于抽取顺序对称,每个位置抽中标记的边际概率都是 ,因此 期望的可加性不需要各次独立。对上面的五卡例子,均值 ,与分布列直接相加吻合。
方差则会受到不放回的影响。对两个不同位置 ,同时抽中标记的概率为 ,所以 代入 并通分,得到 负协方差意味着已抽中一个标记后,余下位置抽中的机会降低。把 的方差展开为 个自身方差与 个有序交叉项,得到 其中 称为有限总体修正因子。本例方差 。若 ,抽样数只能为 0 或 1, 确定,方差直接为零,不用含 的式子。
与二项分布并排看
如果每次抽完放回并重新混匀,2 次结果独立,每次标记概率固定 ,则标记数服从 。此时 分别为 ;不放回的超几何概率为 。图中两组柱共用纵轴,可以看到不放回时中间值更集中;方差也从二项模型的 0.48 降至 0.36。
当 相对于 很小,抽走少量对象不大改变总体比例,二项模型可能给出近似;但此处样本占总体 ,把两种机制混用会明显改变两端概率。是否近似足够好还应按目标事件核对,不能只用“样本很小”一句话代替。
试算。盒中有 8 件产品,其中 3 件带标记,不放回取 3 件,恰得 2 件标记的概率为 。这里不能乘上 ,因为分子和分母都已经按无序三件组计数。
参考资料
- Penn State STAT 414,第 7 课:超几何分布与取值范围。
- Penn State STAT 414,第 8 课:均值与方差。