AI 評量
減少批改偏誤的匿名批改與 AI 的角色
針對姓名、字跡、月暈效應動搖分數的問題,用匿名批改與 AI 加以緩解的方法。
同樣一份答案,如果是「平時表現好的學生」寫的,分數就會往上跑。這就是所謂的月暈效應(halo effect)。字跡、姓名,甚至前一份答案留下的印象都會動搖批改。老師既然也是人,光憑意志要完全阻隔這種影響並不容易。AI 可以作為減少這類人性偏誤的中立第二批改者來運用。不過 AI 也有另一種類型的偏誤,因此需要讓兩者交叉的設計。
動搖分數的隱形變數
以下是研究反覆確認過的批改偏誤。越是相信自己公正的老師,越值得檢視一番。
- 月暈效應:平時的印象會原封不動地轉移到分數上。
- 順序效應:接在一份寫得好的答案後面批改的普通答案,看起來會比實際更差。
- 字跡偏誤:工整的字跡會與內容無關地拉高分數。
- 疲勞偏誤:越到批改後段,基準越會動搖,也越容易草草帶過。
把 AI 當中立裝置使用的方法
- 把遮蔽學生識別資訊的答案輸入 AI。抹除姓名與座號的匿名處理是起點。
- AI 批改不受字跡與姓名影響,因此能成為檢視基準本身一致性的鏡子。
- 若老師的分數與 AI 的分數只在特定學生群體上系統性地拉開,就要懷疑人這一側的偏誤。
- 把批改順序隨機打散,以減少順序效應與疲勞偏誤。
AI 也可能帶有訓練資料的偏誤。但它與人的偏誤種類不同,因此兩者交叉時能互相照亮對方的死角。
注意:AI 的偏誤也是檢查對象
把 AI 當成中立裝置使用,並不代表就一定會公平。機器的偏誤也必須用抽樣抓出來。
- 以抽樣確認 AI 的分數是否一貫地偏袒特定表達方式或特定詞彙。
- 檢視它在非標準表達、方言、外語背景學生的答案上是否產生不利的作用。不落俗套的文章有沒有被不當扣分,是核心所在。
- 也要檢查 AI 是否有給長篇答案較高分數的傾向。篇幅偏誤意外地常見。
實際跑一次交叉檢查的方法
若明白原理卻不知如何開始,建議在一場評量上小規模跑一次以下程序。做過一次之後,往後的檢查就會變快。
- 從一個班級的答案中抹除姓名與座號,做成匿名題組。
- 老師先批改,並在沒看到那些分數的狀態下,讓 AI 也批改同一組。
- 把兩組分數的差異依學生排開,看看是否只在特定群體上差異偏向同一邊。
- 若看到偏向,就把那些答案收集起來,讀出它們有什麼不同。是因為字跡,還是因為表達方式,就會顯現出來。
在這個過程中發現的事情,不是為了更改分數,而是為了在下一次批改時意識到自己的尺規。偏誤無法一次消除,但只要曾經看見過,下一次就會減少。
重點整理
公平的批改來自減少變數的設計。匿名處理、順序隨機化,以及與 AI 的交叉檢查,能同時揭露人與機器兩邊的偏誤。完美的客觀並不存在,但可以讓偏誤變得可見。從讓它變得可見的那一刻起就能逐步減少,這才是這套設計真正的價值。
登入後參與互動

來發表第一則留言吧。