Flipsson教育科技
学习数据

毁掉分析的数据质量,常见的5种污染

本文点出当分析结果反常时,比算法更该先去怀疑的五种学习数据质量问题。

毁掉分析的数据质量,常见的5种污染 缩略图

当仪表盘上的数字与直觉相左时,大多数老师会先怀疑自己的判断。但在现场,真正的原因不是分析方法,而是输入进去的数据本身被污染了的情况要多得多。“扔进垃圾就出来垃圾”这句话,在学习数据上也原样适用。再精巧的分析,架在被污染的数据之上,也只会造出像模像样的谎话。要信任分析,就得先检查数据的质量。

经常发生的五种污染

下面这五种,在几乎所有学校的数据里都能撞见一回。

  1. 重复记录:一个学生把同一个活动交了两次,或者系统把同一条日志重复保存了。参与率就悄悄被抬高。如果合计比人数还多,那基本就是重复。
  2. 幽灵账号:转学走的学生或测试用账号留在名单里,把分母撑大,让所有比率都显得比实际更低。完成率70%,其实去掉5个幽灵之后可能是85%。
  3. 时间错误:服务器时区设置错了的话,临近午夜的提交就会被记到第二天,迟交率整个被扭曲。明明是韩国的学校,服务器却在别的时区,就会错开9个小时。
  4. 空白与0的混淆:把未参加考试当作0分来处理,平均分就会崩掉。没考试和得了0分是完全不同的意思,却被并进同一个数字里。
  5. 单位不一致:一个系统把学习时间记成分钟,另一个记成秒,合并的时候就会出现60倍的误差。

如果分析结果令人吃惊,那么应该先掂量一下:你发现的可能不是洞察,而是错误。

分析前的5分钟检查流程

在正式进入分析之前,只要养成快速确认下面四点的习惯,就能滤掉大部分污染。

  • 扫一眼极端值:一天学习999分钟、一个学生提交作业50次这类不现实的数值几乎总是错误。请排序之后先看上下两头。
  • 合计验算:确认班级人数与数据行数是否对得上。对不上就是重复或遗漏。
  • 确认空白比例:某一列的空白超过30%,就不要只凭那个指标下结论。依据不牢的结论,还不如不下。
  • 抽样亲自比对:挑三名学生,用眼睛把数据与实际记录对一遍。自动生成的数字也要经人验证一次才生得出信任。

数据质量不是检查一次就完事的事。每换一个学期、每更新一次工具,同样的污染都会重新混进来。所以,把质量检查安排成分析之前总要重复一遍的短仪式更好。检查熟练之后,30人班级的数据3分钟就能扫完。麻烦的只是最初的一两次,比起拿着错误的数字在家长面前作出错误说明的风险,那3分钟是再便宜不过的保险。

要点总结

好的分析只从好的数据里出来。重复、幽灵账号、时间错误、空白处理、单位不一致这五样,是制造出看似洞察的错觉的最常见凶手。当分析结果与直觉相左时,请在怀疑自己的判断之前先怀疑数据。5分钟的质量检查,能挡住一整个学期的错误决策。

登录后参与互动
评论 0

来发表第一条评论吧。

同一主题 · 学习数据
推荐文章