考试内容详解:五维知识体系全覆盖
〈概率论与数理统计〉——北大应用统计考研的“基石模块”
核心要求:不仅掌握公式,更要理解其推导逻辑与适用边界。例如2022年考题要求从定义出发证明样本方差的无偏性,并指出在非独立同分布下的修正方案。
高频考点深度解析:
- 大数定律与中心极限定理:2021年以“独立同分布下样本均值渐近分布”的证明题出现,要求写出Lindeberg条件并验证;
- 充分统计量与完备性:2023年结合指数族分布族,要求证明泊松分布样本的充分完备统计量,并据此构造UMVUE;
- 贝叶斯推断:2024年出现共轭先验选择题( Beta-Binomial 模型),需推导后验分布并计算预测概率。
典型真题示例(2023年):设 (X_1,dots,X_n) 为来自密度函数 (f(x|theta)=theta x^{theta-1},,0
《统计学基础》——逻辑严密性的“试金石”
命题趋势:从“计算正确”转向“推导严谨”。2020年起,所有假设检验题均要求写出:① 原假设与备择假设;② 检验统计量;③ 拒绝域;④ p值计算;⑤ 结论解释。
易错点警示:
- 区间估计误解:2022年多考生将“95%置信区间”误写为“参数以95%概率落在区间内”,实则应表述为“重复抽样100次,约95个区间含真值”;
- 方差分析前提:2021年要求判断单因素方差分析是否适用,需检验正态性(Shapiro-Wilk)与方差齐性(Levene检验);
- 抽样误差来源:2023年论述题要求区分抽样误差与非抽样误差,并举例说明如何在问卷设计中降低后者。
深度拓展:北大真题常考“反常识”结论——如“样本量增大时,t检验对非正态性的稳健性增强,但对方差齐性假设的稳健性减弱”,需结合中心极限定理与F分布性质解释。
《应用统计方法》——从理论到实践的“桥梁”
重点方向:线性回归(占应用部分55%)、时间序列(25%)、多元统计(20%)。
2020–2024年真题高频模型:
- 多元线性回归:2022年考题给出身高、体重、BMI预测血压的回归结果,要求判断多重共线性(VIF>10)、异方差性(Breusch-Pagan检验)并修正;
- ARIMA建模:2023年提供GDP季度数据,要求:① 识别差分阶数;② 用ACF/PACF定阶;③ 用AIC准则筛选模型;④ 残差白噪声检验(Ljung-Box Q=8.2, p=0.42);
- Logistic回归:2024年考题涉及医疗数据预测疾病风险,要求计算OR值并解释其临床意义,同时指出模型局限性(如不能推断因果)。
考生高频失分点:在“模型诊断”环节遗漏关键步骤——如仅做残差图却未计算标准化残差、未进行杠杆值与Cook距离分析影响点,导致模型稳定性存疑。
〔软件实操〕——2022年起新增的“实操模块”
考核形式:提供CSV数据文件,要求用R语言完成指定分析任务(占15分),不考代码记忆,重逻辑实现。
2023–2024真题示例:
2023年真题:读取“clinical.csv”,包含变量:ID, Age, Gender, BMI, BP(收缩压)、Glucose。要求:
- 绘制BMI与BP的散点图,添加线性拟合线;
- 拟合多元线性回归模型:BP ~ Age + BMI + Glucose;
- 输出模型摘要,解释BMI系数的统计学与实际意义;
- 计算BMI的95%置信区间;
- 预测某患者(Age=45, BMI=28.3, Glucose=110)的BP值。
标准解法要点:
- 必须使用
read.csv()+str()检查数据结构; - 绘图需用
ggplot2或基础包plot()+abline(); - 回归用
lm(),诊断用plot(model, which=1:2); - 预测用
predict(model, newdata=...),注意newdata需为数据框; - 置信区间用
confint(model, "BMI", level=0.95)。
避坑指南:2022年有考生未指定 newdata 类型,直接传向量导致预测失败——说明“变量名需严格匹配”是高频扣分点。
【综合建模】——决定高分的关键“压轴题”
题型特征:跨章节融合,通常涉及3个以上知识点,要求写出完整分析流程(问题→建模→诊断→解释→局限)。
2024年压轴题深度还原:
“某电商平台收集用户点击数据(n=5000),变量:User_ID, Time_on_site, Clicks, Device(0=PC,1=Mobile)、Purchase(0/1)。请建立模型分析设备类型是否影响购买转化,并评估模型效果。”
满分答案关键步骤:
- 探索性分析:分组计算PC/Mobile用户的平均点击时长、转化率,绘制条形图;
- 模型选择:因响应变量为二分类,选用Logistic回归而非线性回归;
- 交互效应检验:加入 Device × Time_on_site 项,用似然比检验判断交互项是否显著;
- 模型诊断:Hosmer-Lemeshow检验(χ²=7.2, p=0.51→拟合优)、ROC曲线(AUC=0.78→中等判别力);
- 结果解释:Device=Mobile的OR=0.62(95%CI:0.48–0.79),说明移动用户转化率显著低于PC用户;
- 局限性:未控制用户忠诚度、季节性因素,可能存在遗漏变量偏误。
命题逻辑:北大真题正从“纯技术考核”转向“统计思维考核”,要求考生像数据科学家一样思考问题,而不仅是套公式。
? 真题难度本质:不是“会不会”,而是“全不全、准不准、快不快”
年阅卷反馈显示:满分150分中,≥130分者占比3.2%,其共性特征为——步骤完整(+15%分)、计算准确(+12%分)、时间充裕(+8%分)。相反,60%考生失分集中在:① 假设检验未写五步;② R代码未注释;③ 解释脱离实际背景(如只说“p<0.05”而未说明实际意义)。