日期:2018-11-26 19:58
过程。
2. 数据清理方法
1)缺失值
对于缺失值的处理,一般是能补的就想办法把它补上,实在补不上的就丢弃处理。
通常的处理方法有:忽略元组、人工填写缺失值、使用一个全局变量填充缺失值、使用属性的中心度量填充缺失值、使用与给定元组属同一类的所有样本的属性均值或中位数、使用最可能的值填充缺失值。
2)噪声数据
噪声是被测量变量的随机误差或方差。去除噪声、使数据光滑的技术有分箱、回归、离群点分析等。
3)数据清理过程
这个环节主要包括数据预处理、清理方法、校验清理方法、执行清理工具及