数据整理速查表
面向 R tidyr 数据整理的速查资料,覆盖长宽表转换、拆分合并、缺失值处理、嵌套数据和列名规范。
资料介绍
数据整理速查表围绕 tidyr 的结构化操作展开,重点包括长表与宽表转换、列拆分与合并、缺失值处理、嵌套数据和列名规范。数据整理不是简单地“把表变漂亮”,而是明确每一行、每一列和每个键的含义,让后续统计、绘图和建模能够使用正确的粒度。
整理流程中最容易被忽略的是行数变化。一个键对应多个值时,展开或连接会自然产生多行;如果没有先确认一对多关系,结果可能被重复计数。每次转换都应记录预期行数、键和聚合规则,并用已知汇总值做回归检查。
文件信息
- 文件:
tidyr.pdf - 格式:PDF
- 大小:913.97 KB
- 适合场景:R 长宽表转换、缺失值清洗、数据分析前处理
推荐使用方法
先画出输入数据的粒度和目标结构,标记主键与测量列。再选择 pivot、拆分、合并或嵌套操作,每一步都检查行数和键唯一性。完成后保留整理前后的摘要、缺失处理说明和测试样本,以便后续更新数据时复用。
使用边界
速查表只提供数据结构操作参考,不会自动判断字段含义、缺失机制或统计方法。整理后的表仍需由业务人员确认;涉及财务、健康、位置等敏感数据时,应限制样本、日志和导出范围。
保存到自己的网盘
建议先保存整套资源,避免遗漏文件,也方便以后在手机和电脑上继续获取。
夸克网盘(无需提取码)
推荐将「数据整理速查表」保存到该网盘
百度网盘
将「数据整理速查表」保存到该网盘
R tidyr 数据整理速查表教程
tidyr 的重点是让数据结构与分析问题匹配。先明确一行代表什么,再选择长宽表转换、拆分、合并或缺失值处理,并在每一步检查行数和键。
安装前准备
- 了解 R 数据框、筛选、连接和分组。
- 准备包含重复键、缺失值和多值字段的小样本。
- 准备可打开 PDF 的阅读器。
快速上手
- 01
定义一行的含义
写下每一行代表的实体和时间粒度,确认主键、候选键以及哪些列是测量值。
- 02
整理列名与类型
统一列名、日期、数值和字符类型,先处理明显的空白和重复列名。
- 03
转换长宽结构
根据分析或绘图需要选择长表或宽表,转换后检查行数、键唯一性和测量列类型。
- 04
处理缺失与重复
区分真正缺失、结构性缺失和未知值,检查重复键后再填补、删除或聚合。
使用建议
- 长表通常更适合分组、绘图和批量操作,宽表适合部分报告或矩阵式输入。
- 任何 pivot 或拆分操作都应记录键和预期行数,防止静默扩大数据。
- 不要把缺失值、空字符串和字符串‘未知’混为一谈。
故障排查与卸载方法
pivot 后出现重复组合错误怎么办?
检查用于标识一行的键是否真的唯一,先聚合重复记录或补充键,再进行长宽表转换。
填补缺失值后结果变了怎么办?
区分结构性缺失和随机缺失,保留填补标记并比较填补前后的分布和分组统计。
常见问题
数据整理前为什么要定义一行的含义?
明确粒度和主键后,才能判断重复记录、长宽结构和聚合方式,避免整理过程中悄悄改变统计单位。
什么时候使用长表?
分组分析、绘图和批量处理通常更适合长表;宽表可作为特定报告或矩阵接口的输出结构。
缺失值和空字符串一样吗?
不一样。缺失可能表示未知或未观测,空字符串可能是输入为空,具体处理要依据字段定义。
整理后如何快速验证?
检查行数、列数、键唯一性、数据类型、缺失分布和几个已知样本,并与整理前的汇总值对照。
下载时需要提取码吗?
夸克网盘无需提取码;百度网盘所需的四位提取码会直接显示在下载入口旁。