AI 评价
用 AI 自动生成评分量表并一致执行的实战工作流
介绍用 AI 生成表现性评价的评分量表初稿,并把它一致地套用到学生答卷上的流程。
做表现性评价的评分量表时,各档之间的界线常常变得模糊。区分"优秀"和"一般"的标准如果落不成一句话,最后每次评分都会摇摆。昨天算一般的答卷,今天看着像优秀。AI 在 评分量表初稿生成 和 标准执行的一致性 这两处,能帮上意想不到的大忙。它减轻了从一张白纸里硬挤出各档的负担,也辅助你把同一把尺子用在 30 个人身上。
第 1 步:用 AI 快速做出量表初稿
别从白纸开始,把评价目标和年级水平给它,让它给出一份四级量表的初稿。比如输入"初二科学探究报告,变量控制、资料解读、结论合理性 3 个维度,各 4 个水平",就会得到一份表述初稿。之后老师必须动手修改。AI 初稿照搬着用,就会留下与学校实际情况脱节的表述。
- 把 AI 写的标准改成可观察的行为动词。不用"理解",而用"区分并标出两个以上的变量"这样让评分者用眼睛就能确认的说法。
- 把水平之间的差别用数量写明。加入"1 条依据"和"2 条以上依据"这类可以数的标准,界线就清楚了。
- 维度数量归拢到 3~4 个。贪多了条目一涨,评分就垮了。
第 2 步:确保执行的一致性
量表再好,人套到 30 个人身上也会摇摆。这里就把 AI 当作辅助评分者来用。
- 把学生答卷和定稿的量表一起输入。
- 让 AI 把 各维度的水平和依据句子 一并输出。
- 老师只快速读依据句子,认可或者修改。检查依据比检查分数更快也更准。
不能只拿到分数,还要一并拿到"为什么是这个水平"的依据,这样向学生和家长解释才容易。
常见失误与检查清单
- 量表条目一超过 6 个,评分负担就会剧增。请压缩到 3~4 个核心维度。
- 别把 AI 的依据句子原样转给学生,先用老师自己的语言润一遍。机械的语气会削弱信任。
- 同一份答卷跑两遍,结果如果摇摆,说明标准的表述模糊。只把那一条重新具体化。
- 在量表上给满分示例和不达标示例各附一行,执行时的摇摆会明显减少。
和学生一起使用的评分量表
只把量表当评分工具,太可惜了。在评价之前提前向学生公开,评分标准就直接成了学习目标。知道自己会被拿什么来衡量的学生,会朝那个方向准备。实际按下面这样用,效果会很大。
- 布置作业之前一起读量表,用例子说明每个维度是什么意思。
- 拿一份写得好的答卷和一份不足的答卷,让学生亲自用量表打一遍分。
- 对一对评分结果,聊聊同一份答卷为什么大家给出的评价不一样。
走过一遍这个过程,学生成果的水平会明显提升。知道标准以后写的东西,和不知道标准写的东西,从一开始就不一样。
要点整理
评分量表的本质是 关于评分的约定。AI 能帮你把这份约定快速做成初稿,并帮你均匀地套用到 30 个人身上。建议先从初稿生成和依据输出这两件事引入。一份好好打磨过的量表,下个学期、下一届也能复用,所以最初的 30 分钟投入是最划算的买卖。
登录后参与互动

来发表第一条评论吧。