Flipsson教育科技
AI 評量

減少批改偏誤的匿名批改與 AI 的角色

針對姓名、字跡、月暈效應動搖分數的問題,用匿名批改與 AI 加以緩解的方法。

減少批改偏誤的匿名批改與 AI 的角色 縮圖

同樣一份答案,如果是「平時表現好的學生」寫的,分數就會往上跑。這就是所謂的月暈效應(halo effect)。字跡、姓名,甚至前一份答案留下的印象都會動搖批改。老師既然也是人,光憑意志要完全阻隔這種影響並不容易。AI 可以作為減少這類人性偏誤的中立第二批改者來運用。不過 AI 也有另一種類型的偏誤,因此需要讓兩者交叉的設計。

動搖分數的隱形變數

以下是研究反覆確認過的批改偏誤。越是相信自己公正的老師,越值得檢視一番。

  • 月暈效應:平時的印象會原封不動地轉移到分數上。
  • 順序效應:接在一份寫得好的答案後面批改的普通答案,看起來會比實際更差。
  • 字跡偏誤:工整的字跡會與內容無關地拉高分數。
  • 疲勞偏誤:越到批改後段,基準越會動搖,也越容易草草帶過。

把 AI 當中立裝置使用的方法

  1. 把遮蔽學生識別資訊的答案輸入 AI。抹除姓名與座號的匿名處理是起點。
  2. AI 批改不受字跡與姓名影響,因此能成為檢視基準本身一致性的鏡子。
  3. 若老師的分數與 AI 的分數只在特定學生群體上系統性地拉開,就要懷疑人這一側的偏誤。
  4. 把批改順序隨機打散,以減少順序效應與疲勞偏誤。

AI 也可能帶有訓練資料的偏誤。但它與人的偏誤種類不同,因此兩者交叉時能互相照亮對方的死角。

注意:AI 的偏誤也是檢查對象

把 AI 當成中立裝置使用,並不代表就一定會公平。機器的偏誤也必須用抽樣抓出來。

  • 以抽樣確認 AI 的分數是否一貫地偏袒特定表達方式或特定詞彙。
  • 檢視它在非標準表達、方言、外語背景學生的答案上是否產生不利的作用。不落俗套的文章有沒有被不當扣分,是核心所在。
  • 也要檢查 AI 是否有給長篇答案較高分數的傾向。篇幅偏誤意外地常見。

實際跑一次交叉檢查的方法

若明白原理卻不知如何開始,建議在一場評量上小規模跑一次以下程序。做過一次之後,往後的檢查就會變快。

  1. 從一個班級的答案中抹除姓名與座號,做成匿名題組。
  2. 老師先批改,並在沒看到那些分數的狀態下,讓 AI 也批改同一組。
  3. 把兩組分數的差異依學生排開,看看是否只在特定群體上差異偏向同一邊。
  4. 若看到偏向,就把那些答案收集起來,讀出它們有什麼不同。是因為字跡,還是因為表達方式,就會顯現出來。

在這個過程中發現的事情,不是為了更改分數,而是為了在下一次批改時意識到自己的尺規。偏誤無法一次消除,但只要曾經看見過,下一次就會減少。

重點整理

公平的批改來自減少變數的設計。匿名處理、順序隨機化,以及與 AI 的交叉檢查,能同時揭露人與機器兩邊的偏誤。完美的客觀並不存在,但可以讓偏誤變得可見。從讓它變得可見的那一刻起就能逐步減少,這才是這套設計真正的價值。

登入後參與互動
留言 0

來發表第一則留言吧。

相同主題 · AI 評量
推薦文章