数据清洗夏日的向日葵|数据清洗概述_家电

数据清洗的结果是对各种脏数据清洗成对应标准的干净的、连续的数据，提供给数据统计、数据挖掘等使用。

1、数据完整性问题

解决思路：数据补全

（1）通过其他信息补全，比如通过身份证号码推算性别、籍贯、出生日期、年龄等

（3）实在补不全的，必须剔除，但是不要删除，说不定以后用得上

2、数据唯一性问题

解决思路：去除重复记录，只保留一条

（1）按照主键去重，用sql或者excel去除重复记录即可

（2）按照规则去重，编写一系列规则，对重复情况负责的数据去重，例如不同渠道来的客户数据，可以通过相同的关键信息进行匹配，合并去重

3、数据权威性问题

解决思路：用最权威那个渠道的数据

对不同渠道设定权威级别，然后再不同场合下选最重要的

4、数据合法性问题

解决思路：设定判定规则

（1）设定强制合法规则，凡事不在规则范围内的，强制设置最大值以及最小值，剔除或者判断为无效

字段类型合法规则：日期字段格式过滤，如将日期字段格式为“2010-10-10”

字段内容合法规则：性别in（男、女、未知））；出生日期<=今天

（2）设定警告规则，凡是不在规则范围内的，进行警告然后人工处理，如警告规则：年龄>110

（3）离群值人工特殊处理，使用分箱、聚类、回归等方式发现离群值

5、结局数据一致性问题

解决思路：遍历数据体系

（1）指标体系（度量）

（2）维度（分组、统计口径）

（3）单位

（4）频度

（5）数据

1、解决高纬度问题

解决思路：降维

（1）主成分分析

（2）随机森林

2、解决低纬度或者缺少维度问题

解决思路：抽象

（1）各种汇总、平均、加总、最大、最小等

（2）各种离散化、聚类、自定义分组等

3、解决无关信息和字段冗余问题

解决思路：剔除字段

4、解决多指标数值、单位不同问题

解决思路：归一化

（1）最小-最大

（2）0-均值

（3）小数定标

（一）预处理阶段

预处理阶段主要做两件事情：

一是将数据导入处理工具。通常来说，建议使用数据库，单机跑数搭建MySQL环境即可。如果数据量大（千万级以上），可以使用文本文件存储+Python操作的方式，也可以导入oracle数据库。

（二）第一步：缺失值清洗

缺失值是最常见的数据问题，处理缺失值也有很多方法，我建议按照以下四个步骤进行：

1、确定缺失值范围

对每个字段都计算其缺失值比例，然后按照缺失比例和字段重要性，分别制定策略，可用下图表示：

2、去除不需要的字段

这一步很简单，直接删掉即可……但强烈建议清洗每做一步都备份一下，或者在小规模数据上试验成功再处理全量数据，不然删错了会追悔莫及。

3、填充缺失内容

某些缺失值可以进行填充，方法有以下三种：

前两种方法比较好理解。关于第三种方法，举个最简单的例子：年龄字段缺失，但是有屏蔽后六位的身份证号，从身份证号中截取，处理填充。

4、重新取数

以上，简单的梳理了缺失值清洗的步骤，但其中有一些内容远比我说的复杂，比如填充缺失值。

（三）第二步：格式内容清洗

如果数据是由系统日志而来，那么通常在格式和内容方面，会与元数据的描述一致。而如果数据是由人工收集或用户填写而来，则有很大可能性在格式和内容上存在一些问题，简单来说，格式内容问题有以下几类：

2、内容中有不该存在的字符

某些内容可能只包括一部分字符，比如身份证号是数字+字母，中国人姓名是汉字（赵C这种情况还是少数）。最典型的就是头、尾、中间的空格，也可能出现姓名中存在数字符号、身份证号中出现汉字等问题。这种情况下，需要以半自动校验半人工方式来找出可能存在的问题，并去除不需要的字符。

3、内容与该字段应有内容不符

姓名写了性别，身份证号写了手机号等等，均属这种问题。但该问题特殊性在于：并不能简单的以删除来处理，因为成因有可能是人工填写错误，也有可能是前端没有校验，还有可能是导入数据时部分或全部存在列没有对齐的问题，因此要详细识别问题类型。

格式内容问题是比较细节的问题，但很多分析失误都是栽在这个坑上，比如跨表关联或VLOOKUP失败（多个空格导致工具认为“陈丹奕”和“陈丹奕”不是一个人）、统计值不全（数字里掺个字母当然求和时结果有问题）、模型输出失败或效果不好（数据对错列了，把日期和年龄混了）。因此，请各位务必注意这部分清洗工作，尤其是在处理的数据是人工收集而来，或者你确定产品前端校验设计不太好的时候……

（四）第三步：逻辑错误清洗

这部分的工作是去掉一些使用简单逻辑推理就可以直接发现问题的数据，防止分析结果走偏。主要包含以下几个步骤：

1、去重

有的分析师喜欢把去重放在第一步，但我强烈建议把去重放在格式内容清洗之后，原因已经说过了（多个空格导致工具认为“陈丹奕”和“陈丹奕”不是一个人，去重失败）。而且，并不是所有的重复都能这么简单的去掉……

举例，一家公司叫做“ABC管家有限公司“，在销售A手里，然后销售B为了抢这个客户，在系统里录入一个”ABC官家有限公司“。你看，不仔细看你都看不出两者的区别，而且就算看出来了，你能保证没有”ABC官家有限公司“这种东西的存在么……

当然，如果数据不是人工录入的，那么简单去重即可。

2、去除不合理值

一句话就能说清楚：有人填表时候瞎填，年龄200岁，年收入100000万（估计是没看见”万“字），这种的就要么删掉，要么按缺失值处理。这种值如何发现？提示：可用但不限于箱形图（Box-plot）.

3、修正矛盾内容

逻辑错误除了以上列举的情况，还有很多未列举的情况，在实际操作中要酌情处理。另外，这一步骤在之后的数据分析建模过程中有可能重复，因为即使问题很简单，也并非所有问题都能够一次找出，我们能做的是使用工具和方法，尽量减少问题出现的可能性，使分析过程更为高效。

（五）第四步：非需求数据清洗

这一步说起来非常简单：把不要的字段删了。

但实际操作起来，有很多问题，例如：

把看上去不需要但实际上对业务很重要的字段删了；

某个字段觉得有用，但又没想好怎么用，不知道是否该删；

一时看走眼，删错字段了。

前两种情况我给的建议是：如果数据量没有大到不删字段就没办法处理的程度，那么能不删的字段尽量不删。第三种情况，请勤备份数据……

THE END

数据清洗夏日的向日葵

通透！详解主数据历史数据的清洗方法和工具算法数据源

数据清洗是什么？为什么要进行数据清洗？数据清洗的常见方法有？

数据清洗的概念常见问题及实践（数据清洗）

数据清洗的概念常见问题及实践方法

数据清洗是什么，有哪些处理方法

数据清洗概述：数据质量的评价指标

数据清洗的详细解析及操作步骤概述

数据清洗研究综述20231108.docx

数据编辑使用指南

数据分析工作总结（精选9篇）

行业数据分析详解，一文搞懂哪些行业需要数据分析

云计算解读EventBridgeTransform，数据转换和处理的灵活能力干货技术博文

数据清洗夏日的向日葵

大数据清洗

数据清洗范文

大语言模型系列—预训练数据集及其清洗框架