关于数据清洗的步骤及方法的理解袋鼠社区|数据清洗的目的何在,你是如何理解数据清洗这一概念的_家电

一是将数据导入处理工具。通常来说，建议使用数据库，单机跑数搭建MySQL环境即可。如果数据量大（千万级以上），可以使用文本文件存储+Python操作的方式。

第一步：缺失值清洗缺失值是最常见的数据问题，处理缺失值也有很多方法，我建议按照以下四个步骤进行：

1、确定缺失值范围：对每个字段都计算其缺失值比例，然后按照缺失比例和字段重要性，分别制定策略，可用下图表示：

2、去除不需要的字段：这一步很简单，直接删掉即可……但强烈建议清洗每做一步都备份一下，或者在小规模数据上试验成功再处理全量数据，不然删错了会追悔莫及（多说一句，写SQL的时候delete一定要配where！）。

3、填充缺失内容：某些缺失值可以进行填充，方法有以下三种：

以业务知识或经验推测填充缺失值以同一指标的计算结果（均值、中位数、众数等）填充缺失值以不同指标的计算结果填充缺失值

前两种方法比较好理解。关于第三种方法，举个最简单的例子：年龄字段缺失，但是有屏蔽后六位的身份证号，so……

第二步：格式内容清洗如果数据是由系统日志而来，那么通常在格式和内容方面，会与元数据的描述一致。而如果数据是由人工收集或用户填写而来，则有很大可能性在格式和内容上存在一些问题，简单来说，格式内容问题有以下几类：

2、内容中有不该存在的字符

某些内容可能只包括一部分字符，比如身份证号是数字+字母，中国人姓名是汉字（赵C这种情况还是少数）。最典型的就是头、尾、中间的空格，也可能出现姓名中存在数字符号、身份证号中出现汉字等问题。这种情况下，需要以半自动校验半人工方式来找出可能存在的问题，并去除不需要的字符。

3、内容与该字段应有内容不符

格式内容问题是比较细节的问题，但很多分析失误都是栽在这个坑上，比如跨表关联或VLOOKUP失败（多个空格导致工具认为“陈丹奕”和“陈丹奕”不是一个人）、统计值不全（数字里掺个字母当然求和时结果有问题）、模型输出失败或效果不好（数据对错列了，把日期和年龄混了，so……）。因此，请各位务必注意这部分清洗工作，尤其是在处理的数据是人工收集而来，或者你确定产品前端校验设计不太好的时候……

第三步：逻辑错误清洗这部分的工作是去掉一些使用简单逻辑推理就可以直接发现问题的数据，防止分析结果走偏。主要包含以下几个步骤：

1、去重

有的分析师喜欢把去重放在第一步，但我强烈建议把去重放在格式内容清洗之后，原因已经说过了（多个空格导致工具认为“陈丹奕”和“陈丹奕”不是一个人，去重失败）。而且，并不是所有的重复都能这么简单的去掉……

当然，如果数据不是人工录入的，那么简单去重即可。

2、去除不合理值

一句话就能说清楚：有人填表时候瞎填，年龄200岁，年收入100000万（估计是没看见”万“字），这种的就要么删掉，要么按缺失值处理。这种值如何发现？提示：可用但不限于箱形图（Box-plot）.

3、修正矛盾内容

逻辑错误除了以上列举的情况，还有很多未列举的情况，在实际操作中要酌情处理。另外，这一步骤在之后的数据分析建模过程中有可能重复，因为即使问题很简单，也并非所有问题都能够一次找出，我们能做的是使用工具和方法，尽量减少问题出现的可能性，使分析过程更为高效。

第四步：非需求数据清洗这一步说起来非常简单：把不要的字段删了。

但实际操作起来，有很多问题，例如：

把看上去不需要但实际上对业务很重要的字段删了；某个字段觉得有用，但又没想好怎么用，不知道是否该删；一时看走眼，删错字段了。

前两种情况我给的建议是：如果数据量没有大到不删字段就没办法处理的程度，那么能不删的字段尽量不删。第三种情况，请勤备份数据……

合作咨询market@dtstack.com

总部地址杭州市余杭区五常街道阿里巴巴数字生态创新园4号楼袋鼠云

THE END

关于数据清洗的步骤及方法的理解袋鼠社区

实现数据价值的三部曲：数据清洗数据处理和数据集成

原创解析：大数据分析中的数据清洗与特征工程实践精髓开发网

AI驱动的数据清洗：提升数据质量的高效策略

数据清洗是什么？如何进行数据清洗？

新媒体数据分析流程详解：从明确目的到归纳总结

封面报道财新周刊频道

如何利用TensorFlow打造你的机器学习项目

3700字！爬虫数据清洗已经不重要了，我这样的爬虫架构，如履薄冰腾讯云开发者社区

网站数据分析（6）——缺失值异常值和重复值的处理在数据清洗过程中，主要处理的是缺失值异常值和重复值。所谓清洗，是对数

关于数据清洗的步骤及方法的理解袋鼠社区

2024新奥奥天天免费资料，系统解答解释落实VIP96.31.25车主社区

大数据征信发展

精准一肖100%准确精准的含义,精准分析实践TGH51.128迷你版汽车零配件零售

三期内必开特一肖,统计信息解析说明IQF63.732跨界版五A添盛坊青稞原浆

关于数据分析那些事，看这一篇文章就够了新闻中心数据观中国大数据产业观察

如何制作精美的词云图：详细步骤与技巧分享

2023年科学教案中班实用(十七篇)

AI可以算国运吗？秦汉荀子马克思循环论李淳风

数据预处理之数据清洗caiqingfei