Flipsson教育科技
AI 评价

减少批改偏差的匿名批改与 AI 的角色

本文介绍如何用匿名批改和 AI 缓解姓名、字迹、光环效应左右分数的问题。

减少批改偏差的匿名批改与 AI 的角色 缩略图

同样一份答卷,如果是“平时成绩好的学生”写的,分数就会往上走。这就是所谓的光环效应(halo effect)。字迹、姓名,乃至上一份答卷留下的印象,都会左右批改。老师既然也是人,就很难仅凭意志完全阻断这种影响。AI 可以作为减少这类人性偏差的中立的第二批改者来使用。不过 AI 也有另一种类型的偏差,因此需要把两者交叉的设计。

左右分数的那些看不见的变量

以下是被研究反复证实的批改偏差。越是自信公正的老师,越值得检查一番。

  • 光环效应:平时的印象会原样转移到分数上。
  • 顺序效应:紧接在写得好的答卷之后批改的普通答卷,看起来比实际更差。
  • 字迹偏差:工整的字迹会与内容无关地抬高分数。
  • 疲劳偏差:批改越到后半段,标准越容易摇摆,也越容易草草放过。

把 AI 用作中立装置的方法

  1. 把遮蔽了学生识别信息的答卷输入给 AI。抹去姓名和学号的匿名处理是起点。
  2. AI 批改不受字迹和姓名影响,因此成为检查标准本身一致性的一面镜子。
  3. 如果老师给的分数与 AI 给的分数只在特定学生群体上系统性地拉开差距,就要怀疑人这一侧存在偏差。
  4. 把批改顺序随机打乱,以减少顺序效应和疲劳偏差。

AI 也可能带有训练数据的偏差。但它与人的偏差种类不同,因此两者交叉时能互相照亮对方的盲区。

注意:AI 的偏差同样是检查对象

把 AI 当作中立装置,并不意味着就一定公正。机器的偏差也必须通过抽样揪出来。

  • 抽样确认 AI 的分数是否一贯偏袒某种表达方式或某些词汇。
  • 看看它在非标准表达、方言、外语背景学生的答卷上是否产生不利影响。核心在于不落俗套的文字是否被不当扣分。
  • 也要检查 AI 是否有给长答案更高分的倾向。篇幅偏差意外地常见。

把交叉检查真正跑起来的方法

如果道理明白了却不知从何下手,建议先在一次评价上小规模地跑一遍下面的流程。做过一次,之后的检查就会变快。

  1. 把一个班的答卷抹去姓名与学号,做成匿名题组。
  2. 老师先批改,在不看这些分数的状态下,让 AI 也批改同一套题组。
  3. 把两个分数的差按学生逐一排开,看看是否只在特定群体上出现单向的偏斜。
  4. 若看到偏斜,就把那些答卷收拢起来读一读究竟哪里不同。是因为字迹,还是因为表达方式,就会浮现出来。

在这个过程中发现的东西,不是为了改分数,而是为了在下一次批改时意识到自己的尺子。偏差无法一次消除,但只要见过一次,下次就会减少。

要点总结

公正的批改来自减少变量的设计。匿名处理、顺序随机化,以及与 AI 的交叉检查,能同时揭示人与机器两方面的偏差。完美的客观并不存在,但可以让偏差变得可见。从变得可见的那一刻起就能着手减少它,这才是这套设计真正的价值。

登录后参与互动
评论 0

来发表第一条评论吧。

同一主题 · AI 评价
推荐文章