从集中趋势到离散程度,从靶心弹孔到方差公式,
用可视化方式理解数据"有多散"——波动越大的数据,越不稳定。
描述数据集中趋势的三个核心指标:平均数、中位数、众数。
平均数:所有数据的"重心"
x̄ = Σxᵢ / n | 易受极端值影响,反映总体水平
中位数:排序后位于中间位置的数
n 为奇数 → 第 (n+1)/2 个数 | n 为偶数 → 中间两数平均值
众数:出现次数最多的数
一组数据可以有多个众数,也可以没有众数
当各数据的重要性(权重)不同时,用加权平均数:
例:期末成绩 = 平时成绩×30% + 期中成绩×30% + 期末成绩×40%
这里权重 w₁=0.3, w₂=0.3, w₃=0.4
调整权重,观察加权平均数的变化(成绩固定:平时80,期中85,期末90)
平均数:(78+82+85+85+88+90+92+95+95+95) / 10 = 885 / 10 = 88.5
中位数:n=10 为偶数,取第5、6个数的平均值
排序后:78, 82, 85, 85, 88, 90, 92, 95, 95, 95
中位数 = (88 + 90) / 2 = 89
众数:85 和 95(各出现3次,双众数)
平均数:(3000+3500+4000+4500+20000) / 5 = 35000 / 5 = 7000
中位数:排序后取第3个数 = 4000
平均数7000被CEO的高薪拉高,不能代表普通员工。
中位数4000更能反映"典型工资"水平。
→ 有极端值时,中位数比平均数更稳健。
x̄ = 80×0.30 + 85×0.30 + 90×0.40
= 24 + 25.5 + 36
= 85.5
若简单平均:(80+85+90)/3 = 85
加权后85.5 > 85,因为期末(权重最高)成绩最好。
两组数据的平均数相同,但数据的"分散程度"可能完全不同。
例如:甲、乙两名射手的平均成绩都是 8 环,但甲每次都在 7~9 环之间波动,乙有时 10 环有时 5 环。
谁更稳定?我们需要一个量来描述数据的"离散程度"。
想象靶心就是平均数 x̄,每一次射击结果就是数据点 xᵢ。
弹孔离靶心越远(偏离越大),说明数据越不稳定,方差越大。
求平均数:先计算数据的平均数 x̄(靶心位置)
x̄ = (x₁ + x₂ + … + xₙ) / n
算偏差:每个数据与平均数的差 (xᵢ − x̄)
注意:偏差有正有负,不能直接相加!
平方:将偏差平方 (xᵢ − x̄)²,消除正负
平方后,大偏差的惩罚更重(3²=9 比 2²=4 大很多)
求平均:将所有平方偏差求平均
s² = Σ(xᵢ − x̄)² / n — 这就是方差
■ 深红 = 大偏离(远离平均数)→ 对方差贡献大
■ 浅绿 = 小偏离(靠近平均数)→ 对方差贡献小
柱状高度 = 数据值,红线 = 平均数,连线长度 = 偏离程度
x̄ = (4+6+8+10+12) / 5 = 40 / 5 = 8
各数据偏差:
4 − 8 = −4 6 − 8 = −2 8 − 8 = 0 10 − 8 = +2 12 − 8 = +4
偏差之和:(−4) + (−2) + 0 + 2 + 4 = 0
→ 正负抵消,所以不能直接用偏差之和衡量离散程度!
① x̄ = (2+4+6+8+10) / 5 = 6
② 各偏差平方:
(2−6)² = 16 (4−6)² = 4 (6−6)² = 0 (8−6)² = 4 (10−6)² = 16
③ s² = (16+4+0+4+16) / 5 = 40 / 5 = 8
∴ 这组数据的方差为 8
A组:3, 4, 5, 6, 7 — 数据集中在 5 附近,最大偏离为 |7−5|=2
B组:1, 3, 5, 7, 9 — 数据分布更广,最大偏离为 |9−5|=4
B组的数据点离平均数更远(像靶心更分散的弹孔)。
∴ B组方差更大,数据更不稳定。
验证:s²(A) = 2,s²(B) = 8。B组方差确实是A组的4倍!
方差 s² 的单位是原数据单位的平方。比如身高数据的方差单位是 cm²,读起来很别扭。
对 variance 取算术平方根,得到的量与原数据单位一致,更直观。
标准差是方差的「平方根还原」
方差 s² 的单位是「原单位²」,标准差 s 的单位是「原单位」
与方差的关系
s² = 4 → s = 2 | s² = 9 → s = 3 | s² = 0 → s = 0
方差越大,标准差越大;方差为0,标准差也为0
谁更敏感?
方差「放大」了偏离(平方惩罚),标准差「还原」了尺度
比较稳定性时,用标准差或方差都可以,结论一致
■ 标准差小 = 数据紧密聚集在平均数附近 → 稳定可靠
■ 标准差大 = 数据分散远离平均数 → 波动剧烈
标准差越大,黄色和红色带状区域越宽,数据点分布越广
标准差 = 方差的算术平方根
s = √s² = √25 = 5
→ 如果这组数据是考试成绩,方差单位是「分²」,标准差5分的单位是「分」,可以直接理解为「成绩上下波动约5分」。
比较稳定性,看方差或标准差都可以,结论一致:
s²(甲) = 4 < s²(乙) = 16 → 甲更稳定
s(甲) = 2 < s(乙) = 4 → 甲更稳定
甲组数据偏离平均数的平均程度更小,表现更一致。
注意:方差之比是 1:4,标准差之比是 1:2。方差放大了差距。
标准差 s = 0 → 方差 s² = 0
方差为0意味着每个数据与平均数的偏差平方和为0:
Σ(xᵢ − x̄)² = 0 → 每个 (xᵢ − x̄)² = 0 → 每个 xᵢ = x̄
∴ 所有数据都相等,没有任何波动。
例如:7, 7, 7, 7, 7 — 标准差为0,像一台完美校准的机器输出。
用定义公式 s² = Σ(xᵢ − x̄)² / n 计算方差,步骤如下:
求平均数 x̄ = Σxᵢ / n
把所有数据加起来,除以个数
求偏差:每个数据减平均数 (xᵢ − x̄)
列出每个数据与平均数的差
平方:计算 (xᵢ − x̄)²
把每个偏差平方,消除正负
求平均:平方偏差之和除以 n
s² = Σ(xᵢ − x̄)² / n — 得到方差
开方:s = √s² — 得到标准差
标准差单位与原数据一致
当数据较多时,先算每个偏差再平方很麻烦。有一个简化公式:
记忆口诀:「平方的平均」减去「平均的平方」
推导:展开 Σ(xᵢ − x̄)² = Σ(xᵢ² − 2xᵢx̄ + x̄²) = Σxᵢ² − 2x̄Σxᵢ + nx̄² = Σxᵢ² − nx̄²
除以 n:s² = (Σxᵢ²)/n − x̄²
⚠ 适用场景:数据个数多、数值大时,简化公式减少中间步骤,降低计算误差。
数据:2, 4, 6, 8, 10 — 点击按钮逐步查看计算过程
① x̄ = (3+5+7+9+11) / 5 = 35 / 5 = 7
② 各偏差平方:
(3−7)² = 16 (5−7)² = 4 (7−7)² = 0 (9−7)² = 4 (11−7)² = 16
③ s² = (16+4+0+4+16) / 5 = 40 / 5 = 8
④ s = √8 = 2√2 ≈ 2.83
∴ 方差为 8,标准差约为 2.83
简化公式:s² = (Σxᵢ²)/n − x̄²
① x̄ = (1+2+3+4+5) / 5 = 3
② Σxᵢ² = 1² + 2² + 3² + 4² + 5² = 1 + 4 + 9 + 16 + 25 = 55
③ (Σxᵢ²)/n = 55 / 5 = 11
④ x̄² = 3² = 9
⑤ s² = 11 − 9 = 2
验证:用定义公式,(4+1+0+1+4)/5 = 10/5 = 2 ✓
→ 简化公式一步到位,不用逐个算偏差。
① x̄ = (10+12+14+16+18) / 5 = 70 / 5 = 14
② Σxᵢ² = 100 + 144 + 196 + 256 + 324 = 1020
③ (Σxᵢ²)/n = 1020 / 5 = 204
④ x̄² = 14² = 196
⑤ s² = 204 − 196 = 8
⑥ s = √8 = 2√2 ≈ 2.83
提示:这组数据与例1的数据(3,5,7,9,11)相比,每个数都加了7。加常数不改变方差,所以方差也是8。验证成立!
当两组数据的平均数相同或相近时,比较方差(或标准差)即可判断谁更稳定。
先看平均数 — 比「水平」
平均数高 = 总体成绩/产出更好
再比方差 — 比「稳定」
平均数相近时,s² 小者胜出;平均数差距大时,综合权衡
实际决策原则
选拔运动员:平均数高 + 方差小(高水平且稳定)
评估机器:方差小(产品质量一致)
投资策略:风险 = 收益率的标准差
在实际问题中,不能只用一个统计量:
决策口诀:「平均水平看 x̄,稳定可靠看 s²」
甲组:8, 9, 9, 9, 10(s²=0.4) | 乙组:5, 7, 9, 11, 13(s²=8)
甲:8, 9, 9, 9, 10 乙:5, 7, 9, 11, 13
① 平均数:
x̄(甲) = (8+9+9+9+10)/5 = 9 x̄(乙) = (5+7+9+11+13)/5 = 9
② 方差:
s²(甲) = [(1+0+0+0+1)]/5 = 0.4
s²(乙) = [(16+4+0+4+16)]/5 = 8
③ 结论:平均数相同,甲的方差远小于乙。
∴ 选甲 — 成绩更稳定,发挥更可靠。
乙虽然偶尔有13环的高光,但也有5环的失误,大赛不适合冒险。
A机器:100, 100, 100, 100, 100
B机器:98, 99, 100, 101, 102
① 平均数:x̄(A) = x̄(B) = 100
② 方差:
s²(A) = 0(所有数据都是100)
s²(B) = [(4+1+0+1+4)]/5 = 2
③ 结论:A机器方差为0,产品尺寸完全一致。
∴ 选A机器 — 精度更高,质量更稳定。
工业制造中,方差直接对应产品合格率,方差越小废品率越低。
① 平均数:
x̄(小华) = (85+87+88+89+91)/5 = 88
x̄(小明) = (70+80+90+95+95)/5 = 86
② 方差:
s²(小华) = [(9+1+0+1+9)]/5 = 4
s²(小明) = [(256+36+16+81+81)]/5 = 94
③ 分析:
小华平均数更高(88 > 86),且方差更小(4 << 94)。
小明虽然有两场95的高分,但也有70的失常,波动极大。
∴ 选小华 — 水平更高,发挥更稳定。
竞赛不是赌运气,稳定的高水平输出比偶尔爆发更重要。
STAT · DATA DISPERSION MONITOR
八年级下册 · 战术手册 · 数据波动监测站
Built with precision. No guesses, only math.