二项分布:独立重复的那一类
固定次数、每次两种结果、每次独立且概率相同——四个条件齐了才是二项。它也是概率直觉最常翻车的地方。
8 分钟思维方法: 概率直觉
把不确定当成可以计算的对象,而不是没法算的借口
这一片为什么存在
抛 100 次硬币,正面恰好 50 次的概率是多少?很多人答“挺大的,一半左右”。真实答案约 8%——一百个人做这个实验,九十二个拿不到那个“最标准”的结果。它确实是所有结果里最大的一个,可最大不等于大。这一片要把这类数算清楚:什么时候能用这套算法,以及为什么“最可能”常常仍然很小。
内容
先看一个具体的算式。抛 5 次硬币,想要恰好 3 次正面。
一个很自然的冲动是写 0.5³。但这个数算的是另一件事:前三次是正面,后两次不管。可“不管”在概率里是要付代价的——后两次必须是反面,这才叫恰好 3 次。所以一条具体的路径,比如正正正反反,概率是 0.5³×0.5²。
第二个坑紧接着来。正正正反反只是一条路径,可正反正正反同样是恰好 3 次正面。这两条路径概率相同,但它们是不同的事件,要相加。于是问题被拆成两半:一条路径多少概率,一共多少条路径。前一半用独立性,后一半是纯粹的计数——从 5 个位置里挑 3 个放正面,C(5,3)=10 条。
答案是 10×0.5⁵=10/32,约 31%。
这个“路径概率 × 路径条数”的结构,就是二项分布的全部。它之所以能这样算,靠的是两个假设各管一半:每次概率都是 p,所以任何一条含 k 次成功的路径,概率都是同一个 p^k(1-p)^(n-k);每次互相独立,所以一条路径的概率可以直接把 n 个因子乘起来。
这也解释了四个条件为什么缺一不可。次数固定,否则“从 n 个位置里挑 k 个”无从下手。每次只有两种结果,否则一次试验的成功概率不是一个数。每次概率相同,否则不同路径的概率不再相等,不能用一个数乘条数。每次独立,否则乘法根本不成立。
不放回抽牌是最常见的反例:一副牌里抽 5 张,问几张红桃。两种结果有,次数固定也有,但抽走一张红桃后,下一张是红桃的概率就变了。后两条同时塌掉,这不是二项分布。
最后回到 100 次硬币。50 次正面确实是最高的那一根柱子,可总共有 101 根柱子来分这 1 的概率。哪怕分得极不均匀,最高的一根也只能拿到 8% 左右。“最可能的结果”这句话只在互相比较时有意义,它从来不承诺自己很大。
记 X 为 n 次试验里成功的次数。四个条件写成:试验次数 n 事先固定;每次只有成功、失败两种结果;每次成功概率都等于同一个 p;各次试验互相独立。四条齐了,就说 X 服从二项分布,记作 X ~ B(n, p)。
它的概率质量函数是
P(X = k) = C(n, k) · p^k · (1-p)^(n-k),k = 0, 1, …, n。
逐个交代符号。k 是要问的成功次数,取值 0 到 n。p^k 是那 k 次成功各自发生的概率相乘。(1-p)^(n-k) 是剩下 n-k 次全部失败的概率,这一项正是“恰好”两个字的代价。C(n, k) 读作“从 n 个里选 k 个”,等于 n!/(k!(n-k)!),它数的是哪几次成功,也就是路径条数。
两个可以自查的性质。所有 k 的概率之和为 1,因为那就是 (p + (1-p))^n 的二项展开。期望 E[X] = np,方差 Var(X) = np(1-p)。
n = 1 时 B(1, p) 退化成单次试验的成功与失败,叫伯努利分布;二项分布就是 n 个独立同分布的伯努利变量相加。
跟着做一遍
投一枚标准骰子 6 次,把“掷出 6”算作成功。先逐条验证四个条件,再算恰好 2 次成功的概率;算完顺手把 (1/6)² 也算出来,看看两者差多少。
- 检查四条:次数固定 n=6;每次结果只分“是 6”和“不是 6”;每次 p=1/6 不变,骰子没有记忆;各次互相独立。可以用 B(6, 1/6)。
- 取 k=2 套公式:P(X=2) = C(6,2) · (1/6)² · (5/6)⁴。
- 数路径条数:C(6,2) = 6×5/2 = 15。哪两次掷出 6,一共 15 种排法。
- 算一条路径的概率:(1/6)² = 1/36,(5/6)⁴ = 625/1296,相乘得 625/46656。
- 两半乘起来:15 × 625/46656 = 9375/46656 ≈ 0.201。
- 对照那个诱人的错答案:(1/6)² ≈ 0.028。它小了七倍多,因为它既没要求另外 4 次都不是 6,也只数了一条路径。
- 再算最高的那一格 k=1:C(6,1)·(1/6)·(5/6)⁵ = 18750/46656 ≈ 0.402。它是 7 个格子里最大的,也只有四成。
- 收尾自查:k 从 0 到 6 的七个值加起来应得 1;期望 np = 6×(1/6) = 1,正好落在最高的那一格上。
结果
P(X=2) ≈ 0.201,约五分之一。两个附带结论更值得记住:直接写 p^k 会把答案缩到 0.028,差掉的正是“其余各次必须失败”和“成功位置有多少种排法”这两个因子;而 k=1 这个最可能的结果也只占 0.402——最可能从不意味着很可能。