第28章 统计初步

代号:STATS · 部门:数据分析科
🎮 去挑战模式
九年级 · 下册
01 · 任务简报 — 统计学的力量

【情报摘要】

统计学是收集、整理、描述和分析数据的科学。在这个信息爆炸的时代,数据无处不在——从考试成绩到股市走势,从气温变化到用户行为。

本章核心任务:学会用数字说话,从原始数据中提炼出真正有价值的信息。

核心术语速查:

▸ 例题 — 基本概念辨析

为了解某校800名学生的视力情况,从中抽取50名学生进行视力测试。

总体:该校800名学生的视力情况

个体:每一名学生的视力情况

样本:被抽取的50名学生的视力情况

样本容量:50

注意:样本容量是纯数字,不带单位。"50名学生"不是样本容量,"50"才是。

【小测验】某班40名学生中,身高在160~165cm的有8人。则这一组的频率是?
02 · 数据的整理与表示 — 频数分布表与直方图

【核心流程】从原始数据到频数分布直方图

原始数据 → 确定组距与组数 → 列频数分布表 → 画频数分布直方图

步骤详解:

Step 1计算极差:最大值 − 最小值
Step 2确定组距与组数:组数 = 极差 / 组距(通常取5~12组)
Step 3列频数分布表:统计每组数据的个数(频数)
Step 4画频数分布直方图:横轴为数据分组,纵轴为频数

注意:频数分布直方图中小长方形的高 = 频数,宽 = 组距。所有长方形面积之和反映总频数。

▸ 例题 — 制作频数分布表

某班30名学生数学测验成绩(分)如下:

78, 82, 65, 90, 88, 72, 95, 68, 85, 76, 92, 81, 73, 89, 84, 77, 91, 69, 86, 75, 94, 80, 71, 87, 83, 79, 93, 67, 74, 70

解:

极差 = 95 − 65 = 30。取组距 = 10,则组数 = 30/10 = 3组。分组:60~70, 70~80, 80~90, 90~100。

成绩分组频数频率
60 ~ 7040.133
70 ~ 8090.300
80 ~ 90110.367
90 ~ 10060.200
合计301.000

◈ 频数分布直方图 — 交互演示 ◈

点击按钮重新生成随机数据并绘制直方图
【小测验】某频数分布直方图中,组距为5,某长方形高为8。则该组的频数为?
03 · 平均数与加权平均数 — 数据的"重心"

【核心公式】

算术平均数:

x̄ = (x₁ + x₂ + ... + xₙ) / n

加权平均数:

x̄ = (w₁x₁ + w₂x₂ + ... + wₙxₙ) / (w₁ + w₂ + ... + wₙ)

其中 w₁, w₂, ..., wₙ 为各数据的权重。

简记:加权平均数 = 总和 / 总权重 = Σ(wx) / Σw

加权平均数的本质:不同数据的重要性不同,权重大的数据对结果影响更大。

▸ 例题1 — 简单平均数

小明5次数学测验成绩分别为:82, 88, 79, 91, 85。求平均分。

解:

x̄ = (82 + 88 + 79 + 91 + 85) / 5 = 425 / 5 = 85

∴ 平均分为 85 分

▸ 例题2 — 加权平均数(学期成绩)

某学生学期成绩由平时成绩(权重30%)、期中成绩(权重30%)、期末成绩(权重40%)组成。已知平时85分、期中90分、期末88分。求学期总评。

解:

x̄ = (85×0.3 + 90×0.3 + 88×0.4) / (0.3+0.3+0.4)

= (25.5 + 27 + 35.2) / 1 = 87.7

∴ 学期总评为 87.7 分

思考:若按简单平均:(85+90+88)/3 = 87.67。加权后期末权重更大,结果略高。

▸ 例题3 — 加权平均数(招聘评分)

某公司招聘,笔试占60%、面试占30%、实操占10%。应聘者A三项得分分别为80、90、70。求A的综合得分。

解:

x̄ = 80×0.6 + 90×0.3 + 70×0.1 = 48 + 27 + 7 = 82

∴ A 的综合得分为 82 分

对比:简单平均 = (80+90+70)/3 = 80。笔试权重高拉高了总分,这正是加权平均的意义。

【小测验】某员工基本工资3000元(权重40%)、绩效奖金5000元(权重60%)。求月平均工资。
04 · 中位数与众数 — 数据的"代表"

【定义与求法】

中位数:将一组数据按大小顺序排列后,处于中间位置的数。

众数:一组数据中出现次数最多的数。一组数据可能没有众数,也可能有多个众数。

注意:中位数只与数据的排列位置有关,不受极端值影响。众数只与出现频率有关。

▸ 例题1 — 奇数个数据的中位数

求数据 12, 15, 9, 18, 11 的中位数。

解:

先排序:9, 11, 12, 15, 18

n = 5(奇数),中位数 = 第 (5+1)/2 = 3 个数

∴ 中位数 = 12

▸ 例题2 — 偶数个数据的中位数

求数据 23, 19, 28, 15, 30, 22 的中位数和众数。

解:

排序:15, 19, 22, 23, 28, 30

n = 6(偶数),中位数 = (第3个数 + 第4个数)/2 = (22 + 23)/2 = 22.5

每个数只出现1次,∴ 没有众数。

▸ 例题3 — 有众数的情况

某班10名学生鞋码:38, 39, 40, 39, 38, 41, 39, 40, 39, 38。求中位数和众数。

解:

排序:38, 38, 38, 39, 39, 39, 39, 40, 40, 41

n = 10(偶数),中位数 = (39 + 39)/2 = 39

39出现4次,出现次数最多,∴ 众数 = 39

实际意义:鞋厂进货时应多进39码,因为需求量最大。

【小测验】数据 7, 3, 5, 9, 3, 8, 3 的中位数和众数分别是?
05 · 方差与标准差 — 离散程度度量

【核心概念】

平均数、中位数描述数据的集中趋势(中心位置),而方差和标准差描述数据的离散程度(波动大小)。

方差公式:

s² = [(x₁−x̄)² + (x₂−x̄)² + ... + (xₙ−x̄)²] / n

标准差:方差的算术平方根

s = √s²

意义:方差/标准差越大,数据波动越大,越不稳定;反之越稳定。

▸ 例题 — 方差计算步骤化演示

计算数据 5, 7, 9, 11, 13 的方差和标准差。

Step 1 — 求平均数:

x̄ = (5+7+9+11+13)/5 = 45/5 = 9

Step 2 — 求各数据与平均数的差:

xᵢxᵢ − x̄
55 − 9 = −4
77 − 9 = −2
99 − 9 = 0
1111 − 9 = 2
1313 − 9 = 4

Step 3 — 求差的平方:

xᵢ − x̄(xᵢ − x̄)²
−416
−24
00
24
416

Step 4 — 求方差(平方的平均数):

s² = (16+4+0+4+16)/5 = 40/5 = 8

Step 5 — 求标准差:

s = √8 = 2√2 ≈ 2.83

结论:这组数据的方差为 8,标准差约为 2.83。

▸ 例题 — 方差比较(稳定性判断)

甲乙两名射击运动员各射击5次,成绩如下:

甲:8, 9, 8, 9, 6     乙:7, 8, 7, 8, 10

谁的成绩更稳定?

解:

甲:x̄ = (8+9+8+9+6)/5 = 40/5 = 8

s²甲 = [(0)²+(1)²+(0)²+(1)²+(−2)²]/5 = (0+1+0+1+4)/5 = 6/5 = 1.2

乙:x̄ = (7+8+7+8+10)/5 = 40/5 = 8

s²乙 = [(−1)²+(0)²+(−1)²+(0)²+(2)²]/5 = (1+0+1+0+4)/5 = 6/5 = 1.2

两人平均成绩相同,方差也相同,稳定性一样。

变式:若甲:8, 8, 8, 8, 8(全8环),则 s²甲 = 0,甲更稳定。

【小测验】数据 A:1, 3, 5, 7, 9;数据 B:4, 5, 5, 5, 6。则?
06 · 统计量的选用 — 什么场景用什么数

【决策指南】

三个集中趋势度量各有适用场景,选错统计量可能得出荒谬的结论。

统计量优点缺点适用场景
平均数利用全部数据信息易受极端值影响成绩平均分、平均气温
中位数不受极端值影响未利用全部信息工资水平、房价中位数
众数反映最常见情况可能不存在或不唯一最受欢迎尺码、最畅销商品
🏢 场景一:公司工资报告

某公司20名员工工资:18人月薪5000元,1人月薪50000元(CEO),1人月薪80000元(创始人)。

平均数 = (18×5000 + 50000 + 80000)/20 = 108000 元

中位数 = 5000 元,众数 = 5000 元

问题:平均数108000元能代表普通员工工资吗?

→ 不能!极端高收入拉高了平均数。此时应选用中位数或众数,更能反映普通员工的真实收入。

🏅 场景二:歌唱比赛评分

7位评委打分:9.5, 9.2, 9.8, 5.0, 9.6, 9.4, 9.5

问题:5.0分明显是恶意低分,如何计算公平得分?

标准做法:去掉一个最高分和一个最低分后取平均。

去掉 9.8 和 5.0,剩余:9.5, 9.2, 9.6, 9.4, 9.5

平均分 = (9.5+9.2+9.6+9.4+9.5)/5 = 47.2/5 = 9.44

→ 去掉极端值后的平均数更能反映选手真实水平。这是"截尾平均数"的实际应用。

👟 场景三:鞋厂进货决策

某鞋店一周销售记录:38码5双、39码12双、40码18双、41码8双、42码2双。

平均数 = (38×5+39×12+40×18+41×8+42×2)/45 ≈ 39.8 码

众数 = 40 码

→ 进货时应参考众数(40码),因为众数代表需求量最大的尺码。平均数39.8码没有实际对应商品。

📊 场景四:班级成绩对比

甲班平均分85分,乙班平均分83分。但甲班有方差16,乙班有方差4。

表面看:甲班平均分更高。

深入看:乙班方差小得多,说明乙班成绩更集中、更稳定;甲班分数波动大,两极分化严重。

→ 描述成绩时,应同时报告平均数和方差,才能全面反映班级情况。

【小测验】想了解某城市居民的真实收入水平,最适合的统计量是?
07 · 综合演练 — 数据分析实战

【综合题】某校九年级50名学生1分钟跳绳测试成绩分析

原始数据(单位:次):

85,92,78,105,88,95,110,82,90,98,115,75,102,89,94,108,77,100,93,87,112,80,96,103,91,86,99,109,84,97,106,79,101,92,88,104,81,95,107,90,83,100,94,111,76,98,102,89,105,93

任务:

  1. 制作频数分布表(组距10,分组70~80, 80~90, 90~100, 100~110, 110~120)
  2. 计算平均数、中位数、众数
  3. 判断哪个统计量最能代表学生的一般水平
▸ 解答

(1)频数分布表:

成绩分组频数频率
70 ~ 8040.08
80 ~ 90120.24
90 ~ 100180.36
100 ~ 110110.22
110 ~ 12050.10
合计501.00

(2)统计量计算:

平均数 x̄ = (总和)/50 = 4740/50 = 94.8 次

排序后中位数:第25、26个数分别为94和95,中位数 = (94+95)/2 = 94.5 次

众数:90~100组内,92出现2次、95出现2次、其他最多1次。整体看 92, 95, 100, 102, 105 均出现2次,为多众数。

若取最集中的代表值,可选 95 次左右。

(3)判断:

平均数94.8、中位数94.5 非常接近,且数据分布较对称(无极端异常值),三者均可。但中位数不受极端值影响更稳健,推荐用 中位数 94.5 次 或 平均数 94.8 次 代表一般水平。

【最终测验】一组数据方差为0,则这组数据?
← 返回目录 进入实战演练 →