考试内容全景解析
统计学基础理论核心考点
本模块是整个考试的“地基”,2024年真题中占分约42分,主要涵盖以下内容:
- ? 概率空间与随机变量:样本空间、事件域、概率公理化定义;离散型与连续型随机变量;分布函数F(x)的性质与应用;
- ? 数字特征:期望、方差、协方差、相关系数的计算与性质;切比雪夫不等式应用;
- ? 常用分布:伯努利、二项、泊松、均匀、指数、正态分布的特征与应用背景(如泊松近似二项分布的条件);
- ? 大数定律与中心极限定理:独立同分布情形下X̄的渐近正态性;样本均值标准化过程;
- ? 抽样分布:χ²、t、F分布的定义、构造与自由度意义;正态总体样本方差的分布。
- • 混淆“独立”与“不相关”(正态总体下二者等价,但一般情形下不成立);
- • 忽略中心极限定理的适用条件(n≥30仅为经验法则,偏态分布需更大样本);
- • t分布用于方差未知的小样本,但要求总体近似正态。
年第5题:设X₁,X₂独立同分布于U(0,1),求Y=X₁+X₂的分布函数F_Y(y)。
【解题关键】分段积分:y∈[0,1]与[1,2];卷积公式应用;图形辅助理解三角形分布。
概率统计核心模块
本模块是真题“拉分大户”,2024年占比约48分,重点包括:
- ? 参数估计:
• 矩估计法(步骤:用样本矩替代总体矩);
• 最大似然估计(对数似然函数求导、边界值判断);
• 无偏性、有效性、相合性证明(如X₍ₙ₎在均匀分布中是否无偏)。 - ? 假设检验:
• 两类错误定义与关系;
• Z检验、t检验、χ²检验、F检验的适用条件;
• p值法与临界值法的等价性;
• 多重比较问题(如ANOVA后的事后检验)。 - ? 区间估计:
• 单个/两个正态总体均值、方差的置信区间;
• 大样本下比例的置信区间(如np̂≥5且n(1-p̂)≥5);
• 置信水平与区间宽度的关系。
年高频考点示例:似然比检验初步
某药厂声称新药治愈率为85%,临床试验100人中治愈82人。在α=0.05下检验该声明是否成立(用似然比检验)。
【解题步骤】
- 设治愈率p,H₀:p=0.85 vs H₁:p≠0.85;
- 似然函数L(p)=C₁₀₀⁸² p⁸²(1-p)¹⁸;
- MLE为p̂=0.82;
- 似然比λ=L(0.85)/L(0.82);
- 计算-2lnλ≈χ²₁(0.95)=3.84,判断是否拒绝。
此题虽未要求完整计算,但考查似然比思想,体现湖南大学对现代统计方法的前瞻性。
数据分析与统计软件应用
软件应用考查从“结果解读”转向“过程控制”,2024年真题体现以下能力要求:
- ? R/Python基础:
• 向量、矩阵、数据框操作;
• 条件语句与循环(for/if);
• 常用函数(mean(), lm(), plot())。 - ? 数据清洗:
• 缺失值识别(is.na())与处理(删除/插补);
• 异常值检测(箱线图IQR法、3σ原则);
• 变量类型转换(as.factor(), as.numeric())。 - ? 可视化:
• 散点图(加拟合线:abline(lm(y~x)));
• 残差诊断图(plot(lm_obj));
• 时间序列图(ts.plot())与自相关图(acf())。 - ? 建模流程:
• 模型设定→拟合→诊断→修正→解释;
• 模型比较(AIC/BIC准则);
• 交叉验证思想(训练集/测试集划分)。
年典型代码题(文字描述)
用R完成:加载data.csv;筛选y>0的样本;对x1,x2做对数变换;拟合y对log(x1),log(x2)的线性模型;输出模型摘要与残差图。
【参考代码】
df <- read.csv("data.csv")
df_sub <- df[df$y > 0, ]
df_sub$log_x1 <- log(df_sub$x1)
df_sub$log_x2 <- log(df_sub$x2)
model <- lm(y ~ log_x1 + log_x2, data=df_sub)
summary(model)
plot(model, which=1) # 残差-拟合值图
考生需理解每行作用,尤其plot(model, which=1)的统计意义。
应用建模与真实案例
应用题是“综合能力试金石”,2024年两道大题均来自实际场景,要求完整建模报告式作答:
数据字段:user_id, first_buy_date, recent_30_days_freq, avg_price, churn(是否流失)
【考查目标】
- 构造响应变量(如30天内流失=1);
- 特征工程:用户生命周期、最近购买间隔、价格敏感度;
- 模型选择:逻辑回归 vs 决策树;
- 模型评估:混淆矩阵、KS曲线、提升度。
数据:某省14市GDP、人口、教育支出、基建投资、产业结构等
【考查目标】
- 多重共线性检验(相关矩阵、VIF);
- 变量筛选(逐步回归AIC准则);
- 模型解释:β系数的经济含义(如“教育支出每增加1亿元,GDP平均增长0.08亿元”);
- 政策建议:基于回归结果提出差异化策略。
湖南大学特别强调:“统计不是黑箱,结论必须可解释”。因此,即使使用复杂模型(如随机森林),也需给出变量重要性排序与主要驱动因素说明。