统计学是收集、整理、描述和分析数据的科学。在这个信息爆炸的时代,数据无处不在——从考试成绩到股市走势,从气温变化到用户行为。
本章核心任务:学会用数字说话,从原始数据中提炼出真正有价值的信息。
核心术语速查:
为了解某校800名学生的视力情况,从中抽取50名学生进行视力测试。
总体:该校800名学生的视力情况
个体:每一名学生的视力情况
样本:被抽取的50名学生的视力情况
样本容量:50
注意:样本容量是纯数字,不带单位。"50名学生"不是样本容量,"50"才是。
原始数据 → 确定组距与组数 → 列频数分布表 → 画频数分布直方图
步骤详解:
注意:频数分布直方图中小长方形的高 = 频数,宽 = 组距。所有长方形面积之和反映总频数。
某班30名学生数学测验成绩(分)如下:
78, 82, 65, 90, 88, 72, 95, 68, 85, 76, 92, 81, 73, 89, 84, 77, 91, 69, 86, 75, 94, 80, 71, 87, 83, 79, 93, 67, 74, 70
解:
极差 = 95 − 65 = 30。取组距 = 10,则组数 = 30/10 = 3组。分组:60~70, 70~80, 80~90, 90~100。
| 成绩分组 | 频数 | 频率 |
|---|---|---|
| 60 ~ 70 | 4 | 0.133 |
| 70 ~ 80 | 9 | 0.300 |
| 80 ~ 90 | 11 | 0.367 |
| 90 ~ 100 | 6 | 0.200 |
| 合计 | 30 | 1.000 |
◈ 频数分布直方图 — 交互演示 ◈
算术平均数:
x̄ = (x₁ + x₂ + ... + xₙ) / n
加权平均数:
x̄ = (w₁x₁ + w₂x₂ + ... + wₙxₙ) / (w₁ + w₂ + ... + wₙ)
其中 w₁, w₂, ..., wₙ 为各数据的权重。
简记:加权平均数 = 总和 / 总权重 = Σ(wx) / Σw
加权平均数的本质:不同数据的重要性不同,权重大的数据对结果影响更大。
小明5次数学测验成绩分别为:82, 88, 79, 91, 85。求平均分。
解:
x̄ = (82 + 88 + 79 + 91 + 85) / 5 = 425 / 5 = 85
∴ 平均分为 85 分
某学生学期成绩由平时成绩(权重30%)、期中成绩(权重30%)、期末成绩(权重40%)组成。已知平时85分、期中90分、期末88分。求学期总评。
解:
x̄ = (85×0.3 + 90×0.3 + 88×0.4) / (0.3+0.3+0.4)
= (25.5 + 27 + 35.2) / 1 = 87.7
∴ 学期总评为 87.7 分
思考:若按简单平均:(85+90+88)/3 = 87.67。加权后期末权重更大,结果略高。
某公司招聘,笔试占60%、面试占30%、实操占10%。应聘者A三项得分分别为80、90、70。求A的综合得分。
解:
x̄ = 80×0.6 + 90×0.3 + 70×0.1 = 48 + 27 + 7 = 82
∴ A 的综合得分为 82 分
对比:简单平均 = (80+90+70)/3 = 80。笔试权重高拉高了总分,这正是加权平均的意义。
中位数:将一组数据按大小顺序排列后,处于中间位置的数。
众数:一组数据中出现次数最多的数。一组数据可能没有众数,也可能有多个众数。
注意:中位数只与数据的排列位置有关,不受极端值影响。众数只与出现频率有关。
求数据 12, 15, 9, 18, 11 的中位数。
解:
先排序:9, 11, 12, 15, 18
n = 5(奇数),中位数 = 第 (5+1)/2 = 3 个数
∴ 中位数 = 12
求数据 23, 19, 28, 15, 30, 22 的中位数和众数。
解:
排序:15, 19, 22, 23, 28, 30
n = 6(偶数),中位数 = (第3个数 + 第4个数)/2 = (22 + 23)/2 = 22.5
每个数只出现1次,∴ 没有众数。
某班10名学生鞋码:38, 39, 40, 39, 38, 41, 39, 40, 39, 38。求中位数和众数。
解:
排序:38, 38, 38, 39, 39, 39, 39, 40, 40, 41
n = 10(偶数),中位数 = (39 + 39)/2 = 39
39出现4次,出现次数最多,∴ 众数 = 39
实际意义:鞋厂进货时应多进39码,因为需求量最大。
平均数、中位数描述数据的集中趋势(中心位置),而方差和标准差描述数据的离散程度(波动大小)。
方差公式:
s² = [(x₁−x̄)² + (x₂−x̄)² + ... + (xₙ−x̄)²] / n
标准差:方差的算术平方根
s = √s²
意义:方差/标准差越大,数据波动越大,越不稳定;反之越稳定。
计算数据 5, 7, 9, 11, 13 的方差和标准差。
Step 1 — 求平均数:
x̄ = (5+7+9+11+13)/5 = 45/5 = 9
Step 2 — 求各数据与平均数的差:
| xᵢ | xᵢ − x̄ |
|---|---|
| 5 | 5 − 9 = −4 |
| 7 | 7 − 9 = −2 |
| 9 | 9 − 9 = 0 |
| 11 | 11 − 9 = 2 |
| 13 | 13 − 9 = 4 |
Step 3 — 求差的平方:
| xᵢ − x̄ | (xᵢ − x̄)² |
|---|---|
| −4 | 16 |
| −2 | 4 |
| 0 | 0 |
| 2 | 4 |
| 4 | 16 |
Step 4 — 求方差(平方的平均数):
s² = (16+4+0+4+16)/5 = 40/5 = 8
Step 5 — 求标准差:
s = √8 = 2√2 ≈ 2.83
结论:这组数据的方差为 8,标准差约为 2.83。
甲乙两名射击运动员各射击5次,成绩如下:
甲:8, 9, 8, 9, 6 乙:7, 8, 7, 8, 10
谁的成绩更稳定?
解:
甲:x̄ = (8+9+8+9+6)/5 = 40/5 = 8
s²甲 = [(0)²+(1)²+(0)²+(1)²+(−2)²]/5 = (0+1+0+1+4)/5 = 6/5 = 1.2
乙:x̄ = (7+8+7+8+10)/5 = 40/5 = 8
s²乙 = [(−1)²+(0)²+(−1)²+(0)²+(2)²]/5 = (1+0+1+0+4)/5 = 6/5 = 1.2
两人平均成绩相同,方差也相同,稳定性一样。
变式:若甲:8, 8, 8, 8, 8(全8环),则 s²甲 = 0,甲更稳定。
三个集中趋势度量各有适用场景,选错统计量可能得出荒谬的结论。
| 统计量 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| 平均数 | 利用全部数据信息 | 易受极端值影响 | 成绩平均分、平均气温 |
| 中位数 | 不受极端值影响 | 未利用全部信息 | 工资水平、房价中位数 |
| 众数 | 反映最常见情况 | 可能不存在或不唯一 | 最受欢迎尺码、最畅销商品 |
某公司20名员工工资:18人月薪5000元,1人月薪50000元(CEO),1人月薪80000元(创始人)。
平均数 = (18×5000 + 50000 + 80000)/20 = 108000 元
中位数 = 5000 元,众数 = 5000 元
问题:平均数108000元能代表普通员工工资吗?
→ 不能!极端高收入拉高了平均数。此时应选用中位数或众数,更能反映普通员工的真实收入。
7位评委打分:9.5, 9.2, 9.8, 5.0, 9.6, 9.4, 9.5
问题:5.0分明显是恶意低分,如何计算公平得分?
标准做法:去掉一个最高分和一个最低分后取平均。
去掉 9.8 和 5.0,剩余:9.5, 9.2, 9.6, 9.4, 9.5
平均分 = (9.5+9.2+9.6+9.4+9.5)/5 = 47.2/5 = 9.44
→ 去掉极端值后的平均数更能反映选手真实水平。这是"截尾平均数"的实际应用。
某鞋店一周销售记录:38码5双、39码12双、40码18双、41码8双、42码2双。
平均数 = (38×5+39×12+40×18+41×8+42×2)/45 ≈ 39.8 码
众数 = 40 码
→ 进货时应参考众数(40码),因为众数代表需求量最大的尺码。平均数39.8码没有实际对应商品。
甲班平均分85分,乙班平均分83分。但甲班有方差16,乙班有方差4。
表面看:甲班平均分更高。
深入看:乙班方差小得多,说明乙班成绩更集中、更稳定;甲班分数波动大,两极分化严重。
→ 描述成绩时,应同时报告平均数和方差,才能全面反映班级情况。
原始数据(单位:次):
85,92,78,105,88,95,110,82,90,98,115,75,102,89,94,108,77,100,93,87,112,80,96,103,91,86,99,109,84,97,106,79,101,92,88,104,81,95,107,90,83,100,94,111,76,98,102,89,105,93
任务:
(1)频数分布表:
| 成绩分组 | 频数 | 频率 |
|---|---|---|
| 70 ~ 80 | 4 | 0.08 |
| 80 ~ 90 | 12 | 0.24 |
| 90 ~ 100 | 18 | 0.36 |
| 100 ~ 110 | 11 | 0.22 |
| 110 ~ 120 | 5 | 0.10 |
| 合计 | 50 | 1.00 |
(2)统计量计算:
平均数 x̄ = (总和)/50 = 4740/50 = 94.8 次
排序后中位数:第25、26个数分别为94和95,中位数 = (94+95)/2 = 94.5 次
众数:90~100组内,92出现2次、95出现2次、其他最多1次。整体看 92, 95, 100, 102, 105 均出现2次,为多众数。
若取最集中的代表值,可选 95 次左右。
(3)判断:
平均数94.8、中位数94.5 非常接近,且数据分布较对称(无极端异常值),三者均可。但中位数不受极端值影响更稳健,推荐用 中位数 94.5 次 或 平均数 94.8 次 代表一般水平。