Flipsson教育科技
AI 評量

敘述式試題的 AI 評分,老師親自驗證信度的 5 個步驟

整理在把敘述式答案交給 AI 之前,老師自行驗證評分信度的現場實用流程。

敘述式試題的 AI 評分,老師親自驗證信度的 5 個步驟 縮圖

批改兩個班份量的期中考 30 道敘述式試題,改到最後一份答案時,標準已經和一開始有了微妙的差異。上午改的答案和下午改的答案,尺度並不相同;接在一份刁鑽答案之後的普通答案,看起來也會顯得更好。AI 評分能減少這個評分者內信度(intra-rater reliability)的問題,但如果照單全收就把分數輸進去,一通家長申訴就會讓一切崩盤。導入之前,驗證要先做。請記得,沒有驗證就導入的第一年,最常聽到的一句話就是「為什麼只對我家孩子這麼嚴格」這樣的抗議。

委託評分前必經的 5 個步驟

在把答案整批交給 AI 之前,只要守住以下順序,就能大幅減少事故。一個步驟都不要跳過,在第一次單元評量時好好走過一遍,之後整個學期都能重複使用同一套流程。

  1. 挑選錨定答案:從實際的學生答案中,挑出滿分、部分給分、零分各 3~5 份,把給分標準用文字明確寫下來。這是把「大概到這個程度就是滿分」的腦中感覺掏出來變成文字的過程。
  2. 盲測交叉評分:同樣的 20 份答案由老師與 AI 各自評分,再比較分數差距。關鍵在於雙方都在看不到對方分數的狀態下評分。
  3. 分析不一致區間:只把差距達 2 分以上的答案集中起來檢視原因。多半出在部分給分的界線、錯字的處理,或是同義詞是否採計。
  4. 修正提示詞:明確加入像「拼字錯誤不扣分」「包含 2 個以上核心概念即給部分分數」這樣的規則。
  5. 再驗證後套用:再跑一次 20 份,一致率超過 90% 就套用到全部。未達 90% 就回到第 4 步。

關鍵在於把 AI 放在「第二位評分者」的位置,而不是第一位評分者。最終責任仍留在人身上。

現場常被忽略的地方

  • 用不同詞彙表達相同意思的答案(同義詞處理),AI 經常判錯。例如把「光合作用」寫成「製造養分的過程」,若沒有在標準文字裡寫明採計範圍,就會被判為零分。
  • 含有圖畫或圖表的答案,在轉成文字的階段會流失資訊。這一類型還是由人親自評分比較安全。
  • 分數分布若偏向一側,就是評分規準過寬或過嚴的訊號。平均落在 95 分或 40 分時,就得重新修整標準的文字。
  • 不能因為驗證過一次就永遠信任。題型一改變,信度也得從頭重新累積。

重點整理

AI 敘述式評分的價值不在於「快」,而在於可重現的一致性。只要顧好錨定答案、交叉評分、不一致分析這三根支柱,評分時間可以縮短,信度反而還會提升。請不要一開始就套用到全年級,而是從第一次單元評量的一個班級小規模開始,慢慢累積資料。把驗證流程做成一份文件,下個學期的檢核 30 分鐘就能結束。

登入後參與互動
留言 0

來發表第一則留言吧。

相同主題 · AI 評量
推薦文章