北京大学统计与数据科学学院(原数学科学学院统计系)创建于1956年,是我国最早设立统计学专业的高校之一,2015年独立建院。应用统计硕士(专业代码:025200)属于专业学位硕士,学制2年,授予应用统计硕士学位,培养方向涵盖:
• 大数据分析与机器学习
• 金融统计与风险管理
• 生物统计与医学数据科学
• 社会统计与调查设计
• 工业统计与质量控制
年北大应用统计硕士统考招生约45人(含推免28人),报录比约12:1,是人文社科类与理工类交叉热门专业。其中推免比例较高(约62%),统考名额约17人,但因报考人数持续增长,实际录取分数线逐年攀升。2024年复试线为372分(政治/英语60,专业课90),录取考生初试平均分达398分,数学三与统计基础科目成为关键得分项。
课程设置强调“理论—方法—应用”三位一体:
• 核心课:高等概率论、数理统计、多元统计分析、回归分析、时间序列分析
• 应用课:机器学习导论、大数据处理技术、贝叶斯统计、实验设计与分析
• 实践环节:企业实习(与腾讯、阿里、平安等合作)、数据竞赛(Kaggle、天池)、科研项目制学习
北大应用统计考研专业课科目为《统计学基础》(代码432),满分150分,由两部分构成:
① 概率论(60分):包括随机事件与概率、随机变量及其分布、数字特征、大数定律与中心极限定理
② 数理统计(90分):包括参数估计、假设检验、方差分析、回归分析、贝叶斯初步
近年命题呈现三大趋势:
• 计算量增大:2023年第18题要求推导贝叶斯估计的后验分布并计算均方误差,步骤超15步
• 应用性增强:2022年第25题以“某电商平台用户转化率提升”为背景,要求建立二项分布模型并设计A/B检验方案
• 交叉性凸显:2024年新增“用马尔可夫链建模用户行为路径”题型,融合概率模型与实际问题
| 年份 | 报考人数 | 推免人数 | 统考名额 | 复试线 | 录取均分 |
|---|---|---|---|---|---|
| 2018 | 218 | 15 | 22 | 355 | 372 |
| 2020 | 342 | 21 | 19 | 368 | 385 |
| 2022 | 487 | 26 | 18 | 370 | 391 |
| 2024 | 563 | 28 | 17 | 372 | 398 |
趋势分析:
① 报考人数年均增长21.3%,2024年突破560人
② 统考录取率从2018年的10.1%降至2024年的3.0%
③ 高分成为标配:初试≥390分考生中83%进入最终录取名单
统计与数据科学学院现有博导21人,硕导36人,代表性导师方向:
• 陈松蹊教授:非参数统计、环境统计(大气污染建模)
• 何晓群教授:应用回归分析、多元统计
• 房祥忠教授:可靠性分析、生存分析
• 刘力生教授:生物统计、临床试验设计
• 王明强教授:贝叶斯统计、机器学习理论
• 杨立坚教授:高维数据分析、深度学习可解释性
【重要提示】2024年起,北大应用统计硕士实行“大类招生、分向培养”:
• 第一学期统一课程学习
• 第二学期根据兴趣与导师组意见选择:
→ 数据科学方向(与计算机学院联合培养)
→ 金融统计方向(与光华管理学院合作)
→ 医学统计方向(与北大医学部协作)
| 知识点 | 近5年平均分值 | 题型 |
|---|---|---|
| 最大似然估计 | 12分 | 计算题+证明题 |
| 假设检验(双侧T检验) | 10分 | 应用题 |
| 一元线性回归建模 | 14分 | 综合题 |
| 正态总体参数区间估计 | 8分 | 计算题 |
| 中心极限定理应用 | 6分 | 选择+计算 |
大纲以传统统计理论为主,侧重概率计算与参数估计,无应用题型,题量12道(8选择+4计算)
新增“统计软件基础(R语言)”附录,出现1道应用建模题(如:某药厂药品合格率检验方案设计)
加入机器学习基础概念(如:过拟合、偏差-方差分解),2022年新增“用贝叶斯方法更新信念”综合题
明确要求掌握:
• 大数据场景下的抽样偏差识别
• 非参数方法(如:K-S检验)应用
• 多元回归中变量选择准则(AIC/BIC)比较
• 模型诊断(残差分析、异方差检验)
一、选择题(每题5分,共50分)
1. 设X₁,X₂,…,Xₙ为来自总体N(μ,σ²)的样本,其中σ²未知,检验H₀:μ=μ₀ vs H₁:μ≠μ₀,应采用统计量:
A. Z = (X̄-μ₀)/(σ/√n) B. T = (X̄-μ₀)/(S/√n) C. χ² = (n-1)S²/σ₀² D. F = S₁²/S₂²
答案:B
解析:σ未知时,无论样本量大小,均用T统计量
在一元线性回归模型Y=β₀+β₁X+ε中,若β₁的95%置信区间为(1.2, 3.8),则在α=0.05水平下对H₀:β₁=0的检验结论是:
A. 拒绝H₀ B. 不拒绝H₀ C. 无法判断 D. 需补充p值
答案:A
解析:0不在置信区间内,等价于拒绝原假设
二、计算题(每题20分,共60分)
17. 设总体X的概率密度为f(x;θ) = θx^{θ-1}, 0
参考答案:
矩估计:E(X)=θ/(θ+1) ⇒ θ̂₁ = X̄/(1-X̄)
似然函数L(θ)=θ³∏Xᵢ^{θ-1} ⇒ lnL=3lnθ+(θ-1)∑lnXᵢ
求导得θ̂₂ = -3/∑lnXᵢ
某电商平台为测试新算法对转化率的影响,随机选取10000名用户,其中5000人使用新算法(转化率12.6%),5000人使用旧算法(转化率10.8%)。请设计检验方案并计算p值(α=0.05)。
参考答案:
设新旧转化率分别为p₁,p₂,检验H₀:p₁=p₂ vs H₁:p₁>p₂
合并比例p̂=(630+540)/10000=0.117
Z = (0.126-0.108)/√[0.117×0.883×(1/5000+1/5000)] ≈ 4.92
p值≈4.2×10⁻⁷ < 0.05 ⇒ 强烈拒绝H₀
三、证明题(每题20分,共40分)
21. 设X₁,…,Xₙ iid ~ Exp(λ),证明T=∑Xᵢ是λ的充分统计量,并求其分布。
参考答案:
联合密度f(x;λ)=λⁿe^{-λ∑xᵢ},由因子分解定理,T=∑Xᵢ是充分统计量
T ~ Gamma(n,λ)(形状n,速率λ),即f_T(t)=λⁿt^{n-1}e^{-λt}/Γ(n)
高频考点题型示例:
• 贝叶斯估计计算题:给定先验分布Beta(2,3),样本5次试验成功3次,求后验分布及后验均值估计
答案:后验Beta(5,5),均值0.5
• 高维数据处理题:某数据集含1000个样本、50个特征,要求说明变量筛选步骤并解释LASSO作用机制
要点:标准化→相关性分析→主成分分析/LASSO回归→模型验证
• 实验设计题:三因素三水平实验(温度、压力、时间),要求写出正交表并说明交互作用检验方法
方案:L₂₇(3¹³)表,用方差分析检验主效应与交互效应
年考生常见失误:
① 混淆“统计显著性”与“实际显著性”:某题中p=0.048即宣称“效果极好”,未报告效应量
② 忽略模型前提:线性回归未检验残差正态性与方差齐性
③ 计算错误率高:最大似然估计求导时忽略约束条件(如θ>0)
【2022年第25题】某生物实验室测量某蛋白表达量,样本均值=4.2μg/mL,标准差=0.8μg/mL,n=16。要求:
(1) 构造μ的95%置信区间
(2) 若要求估计误差不超过0.2,样本量至少多少?
标准答案:
(1) t₀.₀₂₅(15)=2.131 ⇒ CI = 4.2 ± 2.131×0.8/4 = (3.87, 4.53)
(2) n ≥ (z₀.₀₂₅×σ/E)² = (1.96×0.8/0.2)² ≈ 61.5 ⇒ n=62
年新增“统计思维应用题”:
• 题干:某市2020年空气质量达标天数占比82%,2021年随机抽查120天,达标105天。问是否可认为达标率有显著提升?
• 要求:① 写出假设;② 选择检验方法;③ 计算检验统计量;④ 给出结论;⑤ 说明可能的误差类型
高分答案要点:
① H₀:p≤0.82 vs H₁:p>0.82
② 单样本Z检验(np₀=98.4>5, n(1-p₀)=21.6>5)
③ Z=(0.875-0.82)/√[0.82×0.18/120]≈1.52
④ p=0.064>0.05 ⇒ 不显著
⑤ 可能犯II类错误(未检测出真实提升)
2020年前真题:侧重基础计算,适合入门训练
2. 2020-2022年真题:开始出现应用建模,需结合实际背景作答
3. 2023-2024年真题:强调模型解释与误差分析,要求用统计语言描述结论
特别提醒:2025年考生需重点关注:
• R/Python基础代码(如:用summary(lm())输出解读)
• 非参数方法应用(如:Mann-Whitney U检验场景)
• 多重比较校正(Bonferroni、FDR)
第一阶段(3-6月):基础夯实
• 精读《概率论与数理统计》(浙大四版)+《数理统计》(韦博成)
• 完成课后习题(重点:最大似然估计、假设检验)
• 建立公式卡片:每日默写10个核心公式
第二阶段(7-9月):真题攻坚
• 分模块刷近10年真题(按知识点归类)
• 建立错题本:标注错误类型(概念/计算/审题)
• 开始R语言入门:掌握mean()、t.test()、lm()等基础函数
第三阶段(10-12月):模拟冲刺
• 全真模拟(3小时/套,严格计时)
• 重点突破高频考点:回归分析、参数估计、假设检验
• 组建学习小组:每周1次错题讲解
【2024年考生经验】
张同学(总分412):
“我将最大似然估计题型拆解为5步模板:①写似然函数;②取对数;③求导;④解方程;⑤验证二阶导。考试时按模板作答,步骤清晰,阅卷老师给满15/20分。”
| 备考阶段 | 概率论得分率 | 统计学得分率 | 总分预估 |
|---|---|---|---|
| 基础阶段结束 | 65% | 58% | 320 |
| 强化阶段结束 | 82% | 75% | 375 |
| 冲刺阶段结束 | 92% | 88% | 405+ |
关键突破点:
• 概率论:极限定理与大数定律应用(提升空间15分)
• 统计学:回归分析与模型诊断(提升空间20分)
• ❌ 只做题不总结:某考生刷题200+,但未整理“T检验与Z检验选择条件”,考试混淆失分
• ❌ 忽视软件操作:2023年新增R语言代码题,未练习者完全空白
• ❌ 死记结论:如“p<0.05即有效”,未理解“统计显著≠实际重要”
正确做法:
① 每周做1次知识点图谱复盘
② 每月完成1个小型数据项目(如:用lm()分析房价影响因素)
③ 加入真题讨论群:定期分享解题思路
logL <- function(theta){ -sum(dnorm(x,theta[1],theta[2],log=TRUE)) }
optim(c(0,1), logL)model <- lm(y~x, data=df); plot(model)可以!2024年录取考生中32%为跨考生,主要来自数学、计算机、经济学专业。但需在备考中:
• 补学《概率论》《数理统计》核心内容
• 掌握R/Python基础操作
• 重点突破“统计建模”题型
• 3月前:基础教材学习
• 4-6月:课后习题训练
• 7-9月:真题分类突破
• 10-12月:模拟冲刺+查漏补缺
关键节点:9月大纲发布后需调整重点(2024年新增“统计因果推断”)
北大应用统计硕士复试占比50%,包含:
• 专业综合面试(60分):统计思想、建模能力
• 英语口语(20分):自我介绍+文献翻译
• 上机测试(20分):用R完成简单数据分析
提示:2024年新增“统计伦理”论述题(如:数据隐私保护原则)
建议分三步补救:
① 先掌握微积分核心(导数、积分、泰勒展开)
② 再学习线性代数基础(矩阵运算、特征值)
③ 最后攻克概率统计(从离散分布入手)
推荐资源:《微积分入门》(小平邦彦)、《线性代数应该这样学》
参考三要素:
• 个人兴趣(是否愿意长期研究该领域)
• 导师风格(严格型/宽松型/企业合作型)
• 就业前景(数据科学方向起薪高、金融统计稳定性强)
案例:2023年王同学因擅长编程,选择数据科学方向,实习于阿里达摩院
北大统考试题严格保密,但:
• 近年真题回忆版可通过考生社群获取
• 2010-2019年真题已部分公开
• 重要提醒:警惕“内部题库”骗局!易搜职考网所有资料均来自公开渠道整理
• 应届生:时间充裕,但缺乏实际项目经验
• 在职考生:有工作经验优势(如金融统计方向),但需平衡工作与学习
建议:在职考生可选择“非全日制”项目(2024年新增,周末授课)
重点练习:
① 数据读取(read.csv())
② 描述统计(summary()、table())
③ 基础建模(lm()、t.test())
④ 结果输出(print()、write.csv())
模拟题:用mtcars数据集分析mpg与wt的关系,并绘制散点图+回归线
年北大应用统计有5个调剂名额:
• 南京大学(统计与数据科学学院)
• 中山大学(数据科学与计算机学院)
• 华东师范大学(统计学院)
• 需初试分数≥360,且专业课考432
提示:调剂系统开放前3天准备个人陈述+成绩单
届毕业生去向:
• 互联网大厂(35%):阿里、腾讯、字节(数据分析师/算法工程师)
• 金融机构(25%):中信证券、平安保险(风险管理/精算)
• 继续深造(20%):海外名校(CMU、UCLA)
• 公务员(10%):国家统计局、央行
• 创业(10%):数据科技公司创始人
平均起薪:28K/月(北京),3年经验可达50K+
关注易搜职考网公众号,回复“北大统计2025”获取:
① 《432统计学基础核心公式手册》(PDF)
② 《近10年真题分类汇编》(含详细解析)
③ R语言入门10讲(视频+代码)
④ 2025模拟卷(含答案与评分标准)