预约成功
在对数据集是否正确的检查中,最容易发现需要被处理的情况就是 空值和异常值 。空值出现在数据集中往往一眼便能识别;异常值则需要一定经验性地判断,例如:数值特别夸张、文本特别长、不匹配的数据类型。在后续步骤的数据认知中,对指标进行统计汇总、分布观察等也能帮助识别异常值。
1、处理数据集的不同数值——空值处理
空值,如果在平时的汇总统计中可忽略则忽略,如果不可忽略则可采用以下方法来处理:
替换:使用平均值、众数进行替换或者使用最接近的数据替换它,需要仔细对比寻找该行数据的其它值是否相近;
推断:运用模型结合使用非空变量进行推断、预测计算得到这个空值,如:时间序列、回归模型等;
删除:实在无法处理的空值,而且你已经确定它会影响到后续的计算、分析,那么你可以考虑将该行记录删除。如果不确定是否会影响,可考虑暂不处理。
2、处理数据集的不同数值——异常值处理
初步观察寻找异常值:
在 Excel 中可以通过筛选功能或去除重复值对数据列进行观察;
在 SQL 中可以通过 distinct 进行去重观察;
在 Python 中,可以通过 pandas.drop_duplicates() 等方式进行去重观察。
垃圾数据或者异常值能采取的处理手段较少,当数据记录占比较大,我们首先应去寻找造成数据异常的原因,尝试从源头解决它;当数据记录占比不多时,我们可以采取直接删除的方式。
以上就是有关于处理数据集的不同数值的相关内容,以及相应的解析,不论你是已经入职数据分析师岗位的新人,还是打算进入数据分析岗位的小白,以上的内容都或多或少会对大家有所帮助,环球网校的小编在这里祝大家的数据分析师职业道路顺利。