数据预处理:80%的工作量,20%的价值
在真实场景中,数据清洗往往占分析时间的60%-80%。以电商用户行为数据为例,常见问题包括:
- 缺失值:用户未登录时浏览记录缺失,需区分“随机缺失(MCAR)”与“非随机缺失(MNAR)”,后者需用多重插补(MICE);
- 异常值:某用户单日点击10万次(正常<500),需结合业务规则(如IP限频)与统计方法(IQR/3σ)联合判定;
- 时间对齐:用户点击流与订单数据时间戳不一致,需转换为统一时区(UTC+8)并按用户ID分组聚合。
实战技巧:使用pandas的`infer_objects()`自动转换数据类型;`df.select_dtypes()`筛选数值型列;`sklearn.preprocessing.Imputer`进行智能填充。
统计分析方法:避免“p值崇拜”
许多考生过度依赖t检验/ANOVA,却忽视前提假设。例如,比较两组用户转化率时:
- 错误做法:直接使用独立样本t检验(要求正态性);
- 正确做法:先做Shapiro-Wilk检验正态性,若p<0.05则用Mann-Whitney U非参数检验;或使用Bootstrap重采样估计置信区间。
案例:某APP新功能上线后,用户停留时长从42s→45s(p=0.048),但效应量Cohen's d=0.12(小效应),实际业务价值有限。此时应建议“暂缓推广”,而非“立即上线”。——统计显著≠实际重要。
数据可视化:避免“图表污染”
优秀可视化应遵循:简洁性、信息性、可行动性。例如:
- 错误:饼图展示10个类目(扇区过小,难以分辨);
- 正确:用条形图+排序,或分组柱状图对比;
- 进阶:在折线图中用虚线标注关键事件(如“618大促开始”),帮助解释趋势变化。
工具建议:Tableau用于快速探索;Matplotlib/Seaborn用于论文图表;Power BI用于业务看板。关键不是工具,而是:你想让观众看到什么?
机器学习基础:警惕“黑箱陷阱”
在信贷风控中,使用深度神经网络预测违约率虽精度高,但无法向监管解释“为何拒绝贷款”。此时应:
- 优先选择可解释模型(逻辑回归+SHAP值);
- 若用复杂模型,需做局部可解释性分析(LIME/SHAP);
- 确保模型无偏见(如性别/地域歧视),通过公平性指标(Demographic Parity Difference)校验。
真实案例:某银行因使用“不可解释模型”被监管处罚,而另一家银行采用XGBoost+SHAP报告,成功通过合规审查。
数据库与数据结构:高效分析的基石
在处理亿级日志数据时,常见性能瓶颈:
- SQL优化:避免`SELECT `,使用`WHERE`下推过滤;对`user_id`建索引;
- 数据结构:用`defaultdict(list)`存储用户行为序列,避免嵌套循环;
- 分布式:将数据按`date`分区,用`spark.sql("SELECT ... WHERE dt='2024-06-01'")`加速查询。
核心原则:先理解数据规模(GB/TB/PB级),再选择合适工具链——小数据用pandas,中数据用Dask,大数据用Spark。