机器学习数据预处理速查表
机器学习数据预处理速查表,整理缺失值、异常值、缩放、编码、特征选择、数据切分和防止泄漏的常用处理思路。
资料介绍
机器学习数据预处理速查表面向从原始数据到可训练特征的准备阶段。它覆盖缺失值、异常值、数值缩放、类别编码、特征选择、降维、数据切分和预处理流水线等常见环节,适合快速建立模型输入的检查清单。
预处理不是越多越好,关键是每条规则都能解释,并且只使用预测时点之前的信息。若用全量数据计算均值、类别映射或特征重要性,测试结果就会被污染;若上线时类别、单位或字段顺序发生变化,离线指标也难以复现。
文件信息
- 文件:
ml-preprocessing-data.pdf - 格式:PDF
- 大小:461.11 KB
- 内容重点:缺失、异常、缩放、编码、选择、切分与泄漏检查
推荐使用方法
先盘点字段语义和预测时点,再固定训练、验证和测试边界;只用训练集拟合填补、缩放、编码和选择规则,并保存映射与版本。应用到其他集合后检查列数、特征顺序、范围和未见类别,最后把处理日志纳入实验记录。
使用边界
速查表不替代领域数据字典、缺失机制分析和上线监控。自动删除异常、填补缺失或合并类别可能改变研究结论。涉及个人、财务或医疗数据时,还应做脱敏、访问控制和处理留痕。
保存到自己的网盘
建议先保存整套资源,避免遗漏文件,也方便以后在手机和电脑上继续获取。
夸克网盘(无需提取码)
推荐将「机器学习数据预处理速查表」保存到该网盘
百度网盘
将「机器学习数据预处理速查表」保存到该网盘
机器学习数据预处理速查表阅读与上手说明
预处理的目标是让特征适合模型,同时保持训练、验证和测试边界清楚。建议先记录原始字段语义,再按训练数据拟合规则,最后将同一规则应用到其他集合。
安装前准备
- 准备可打开 PDF 的阅读器,并确认文件下载完整。
- 明确目标列、预测时点、特征类型和缺失值含义。
- 准备训练、验证和测试数据的划分方案。
快速上手
- 01
盘点字段与缺失
按数值、类别、文本、日期和标识符检查字段,统计缺失、异常范围、重复记录和未来信息。
- 02
只用训练数据拟合规则
缺失值填补、缩放、编码、降维和特征选择都在训练集上估计参数,避免把验证或测试信息带回训练。
- 03
处理类别与尺度
根据模型和业务语义选择编码、标准化或稳健缩放,保留类别映射、单位和未见类别处理规则。
- 04
在各集合复用并验证
将训练得到的规则应用于验证和测试,检查行数、列数、范围、缺失和特征顺序,记录被丢弃或新增的字段。
使用建议
- 异常值处理需要说明业务原因,不要为了提高指标随意删除样本。
- 时间数据按时间顺序切分,避免随机切分让未来信息进入训练。
- 保留原始字段和预处理版本,方便排查线上与离线结果差异。
故障排查与卸载方法
预处理后测试指标异常高怎么办?
检查填补、缩放、编码、特征选择是否先在全量数据上拟合,或是否存在预测时点之后的字段。
上线数据出现训练时没有的类别怎么办?
为未见类别定义明确策略,例如合并为其他类别或返回可监控的缺失状态,并保持训练与推理映射版本一致。
常见问题
机器学习预处理最重要的原则是什么?
在训练边界内拟合处理规则,并将相同规则应用到验证、测试和推理数据,避免数据泄漏和特征顺序漂移。
缺失值应该删除还是填补?
要根据缺失机制、字段含义、样本量和模型要求决定,并记录填补规则和缺失指示信息。
哪些模型特别需要特征缩放?
依赖距离、梯度或正则化的模型通常更关注尺度;树模型对缩放不敏感,但仍需保持特征语义和推理流程一致。
如何检查预处理是否改变了特征含义?
比较处理前后的列数、类型、单位、范围、类别映射和缺失数量,并在小样本上手工核对结果。
下载时需要提取码吗?
夸克网盘无需提取码;百度网盘所需的四位提取码会直接显示在下载入口旁。