AI 评价
减少批改偏差的匿名批改与 AI 的角色
本文介绍如何用匿名批改和 AI 缓解姓名、字迹、光环效应左右分数的问题。
同样一份答卷,如果是“平时成绩好的学生”写的,分数就会往上走。这就是所谓的光环效应(halo effect)。字迹、姓名,乃至上一份答卷留下的印象,都会左右批改。老师既然也是人,就很难仅凭意志完全阻断这种影响。AI 可以作为减少这类人性偏差的中立的第二批改者来使用。不过 AI 也有另一种类型的偏差,因此需要把两者交叉的设计。
左右分数的那些看不见的变量
以下是被研究反复证实的批改偏差。越是自信公正的老师,越值得检查一番。
- 光环效应:平时的印象会原样转移到分数上。
- 顺序效应:紧接在写得好的答卷之后批改的普通答卷,看起来比实际更差。
- 字迹偏差:工整的字迹会与内容无关地抬高分数。
- 疲劳偏差:批改越到后半段,标准越容易摇摆,也越容易草草放过。
把 AI 用作中立装置的方法
- 把遮蔽了学生识别信息的答卷输入给 AI。抹去姓名和学号的匿名处理是起点。
- AI 批改不受字迹和姓名影响,因此成为检查标准本身一致性的一面镜子。
- 如果老师给的分数与 AI 给的分数只在特定学生群体上系统性地拉开差距,就要怀疑人这一侧存在偏差。
- 把批改顺序随机打乱,以减少顺序效应和疲劳偏差。
AI 也可能带有训练数据的偏差。但它与人的偏差种类不同,因此两者交叉时能互相照亮对方的盲区。
注意:AI 的偏差同样是检查对象
把 AI 当作中立装置,并不意味着就一定公正。机器的偏差也必须通过抽样揪出来。
- 抽样确认 AI 的分数是否一贯偏袒某种表达方式或某些词汇。
- 看看它在非标准表达、方言、外语背景学生的答卷上是否产生不利影响。核心在于不落俗套的文字是否被不当扣分。
- 也要检查 AI 是否有给长答案更高分的倾向。篇幅偏差意外地常见。
把交叉检查真正跑起来的方法
如果道理明白了却不知从何下手,建议先在一次评价上小规模地跑一遍下面的流程。做过一次,之后的检查就会变快。
- 把一个班的答卷抹去姓名与学号,做成匿名题组。
- 老师先批改,在不看这些分数的状态下,让 AI 也批改同一套题组。
- 把两个分数的差按学生逐一排开,看看是否只在特定群体上出现单向的偏斜。
- 若看到偏斜,就把那些答卷收拢起来读一读究竟哪里不同。是因为字迹,还是因为表达方式,就会浮现出来。
在这个过程中发现的东西,不是为了改分数,而是为了在下一次批改时意识到自己的尺子。偏差无法一次消除,但只要见过一次,下次就会减少。
要点总结
公正的批改来自减少变量的设计。匿名处理、顺序随机化,以及与 AI 的交叉检查,能同时揭示人与机器两方面的偏差。完美的客观并不存在,但可以让偏差变得可见。从变得可见的那一刻起就能着手减少它,这才是这套设计真正的价值。
登录后参与互动

来发表第一条评论吧。