方差与标准差:离得有多散

均值说不清「散不散」。方差先量偏离的平方,标准差再把单位换回来——这才是可以和均值放在一起读的那个数。

6 分钟思维方法: 估算与放缩

不求精确值,先卡出它落在哪两个数之间

这一片为什么存在

量一组数散不散,最自然的做法是把每个数和均值的差加起来平均一下。你可以现在就试:1、5、9 的均值是 5,偏差是 −4、0、4,加起来 0。换成 4、5、6,偏差是 −1、0、1,还是 0。这个量对任何一组数都吐出 0,它什么也没测到。方差要绕开的,就是这个死局。

内容

偏差之和永远是 0,不是巧合。均值本来就是那个把偏差左右扯平的点,它的定义决定了正负必然抵消。所以要量离散,第一步是先把正负号毁掉。

有两条路:取绝对值,或者取平方。平方赢了,理由有三个。它对大偏差罚得更狠——偏 2 个单位算 4,偏 4 个单位算 16,而绝对值只算 2 和 4;它处处光滑、能求导,后面一整套统计方法都靠这一点;它还能拆成 E[X²]−(EX)²,实际计算常常更省事。

于是有了方差:偏差平方的平均值。符号问题解决了,代价却立刻显现。你的数据单位是分钟,平方之后变成「分钟平方」,这个东西没法和均值放在一起读。说「平均等待 5 分钟,波动 9 分钟平方」,没有人知道 9 是大是小。

标准差就是把这个代价还回去:对方差开平方根,单位回到分钟。现在可以说「平均 5 分钟,标准差 3 分钟」,两个数落在同一把尺子上。顺带一提,方差是一堆平方数的平均,永远大于等于 0;算术平方根又只取非负的那一支,所以标准差也永远大于等于 0。它等于 0 只有一种可能:所有数一模一样。

最后是最深的那处误解:均值相同,不等于两组数差不多。两家店的平均等待都是 5 分钟,一家标准差 1 分钟,另一家 8 分钟。前者你几乎总是等 4 到 6 分钟,后者可能立刻叫号,也可能耗掉你二十分钟。均值定的是中心,标准差定的是你实际会遇到什么,缺一个你就在瞎选。

设随机变量 X,记它的均值 μ = E[X]。这里 E 表示期望,也就是按概率加权的平均。

方差定义为 Var(X) = E[(X − μ)²]。括号里的 X − μ 是偏差,平方抹掉符号,外层的 E 再对所有可能取值按概率求平均。

标准差记作 σ(X) = √Var(X),取的是非负平方根。方差常写成 σ²,这个记号本身就在提醒你:它的单位是原单位的平方。

把括号展开可得常用计算式:Var(X) = E[X²] − μ²。它与定义式等价,但只需扫一遍数据,同时累加 x 和 x²。

对有限个等权数据 x₁,…,xₙ,期望退化为算术平均:μ = (1/n)Σxᵢ,Var = (1/n)Σ(xᵢ − μ)²。若这 n 个数是从更大总体里抽出的样本,分母要改成 n − 1,本片只谈前者。

跟着做一遍

两位同事记录了自己五天的通勤时间(分钟)。A:28、29、30、31、32。B:20、25、30、35、40。请分别算出方差与标准差,并说明这两组数据在什么意义上「一样」、在什么意义上完全不同。

  1. 先各自求均值。两组的和都是 150,除以 5,μ 都等于 30 分钟——单看均值,它们毫无区别。
  2. 算 A 的偏差:−2、−1、0、1、2。加起来是 0,正是开头那个死局。
  3. 把 A 的偏差平方后相加:4+1+0+1+4=10。除以 5 得 Var(A)=2,单位是分钟²。
  4. 开根号前先估一下:1²=1,2²=4,所以 √2 落在 1 和 2 之间,且明显偏小。得 σ(A)≈1.41 分钟。
  5. 对 B 重复:偏差是 −10、−5、0、5、10,平方和为 250,Var(B)=50 分钟²。
  6. 同样先卡范围:7²=49,8²=64,而 49<50<64,所以 √50 在 7 和 8 之间,紧贴 7。得 σ(B)≈7.07 分钟。
  7. 验算一个结构:B 的每个偏差恰好是 A 的 5 倍,那么方差应是 25 倍,标准差应是 5 倍。2×25=50 ✓,1.41×5≈7.07 ✓。

结果

两组均值同为 30 分钟,方差却是 2 与 50 分钟²,标准差是 1.41 与 7.07 分钟。A 几乎每天准点,B 可能 20 分钟就到,也可能 40 分钟才到——同一句「平均通勤 30 分钟」,对这两个人意味着完全不同的生活。顺便留意两件事:两个方差、两个标准差都是正的,平方之后再取非负根,负值根本无从产生;单位上方差挂着「分钟²」,只有标准差能和「30 分钟」写在同一行。

它在树上的位置

概念不是一篇一篇平铺的。下面两组是这一片真实的上下游:它靠着什么,又撑起了什么。

读完之后

这一页是产品里的一天。产品是那棵树:你学到哪、哪块在衰减、明天该学什么。一篇读物回答不了这三个问题,树才回答。

看看那是什么意思