每个中心都被自动评分的想法所吸引:快速、不依赖教师的时间表、各班之间一致。简短回答:AI可以在规模上使用,前提是有一个筛选机制来决定哪些文章可以直接发布,哪些文章需要人工审核

机器评分的三种典型错误

  • 虚构证据。 评论引用了“在你的文章中”的一句话,但该句并不存在,或者被截断到改变意思的程度。学生读完后在自己的文章中找不到那句话。
  • 测量错误。 最明显的例子是发音:如果系统通过播放录音来评分发音标准,它实际上是在第二次评分词汇和语法,而不是发音。这个标准的证据必须来自对音频信号的测量。
  • 输入数据错误但仍然给分。 写作任务1的图表缺失,口语录音只有三部分中的一部分,音频文件静音。如果系统仍然返回一个数字,这个数字是毫无意义的,但看起来仍然真实。

第三种错误是最危险的,因为它是无声的。

最低可信度门槛

在机器评分的分数到达学生手中之前,必须经过以下条件——缺乏数据进行验证则视为不合格,默默通过是最危险的错误:

  • 评分未被验证者驳回。
  • 评论中的所有引用都能追溯到文章中的确切句子。
  • 系统自认未评分的标准不再存在。
  • 输入数据有效:足够的图像,足够的录音部分,文章不是抄袭。
  • 可信度达到中心设定的阈值。

这正是LinguaGrade的运作方式:符合所有条件的文章将自动发布,任何不符合条件的文章将进入教师审核的队列。中心可以根据自己的政策开启或关闭自动发布模式,并设定可信度阈值。

在规模上信任之前的校准

可信度阈值不应凭感觉选择。正确的方法是:取几十篇已经由教师评分的文章,让系统重新评分,然后比较两列。观察两个数字:偏差超过半个分数的比例,以及系统自信但错误的文章比例。第二个数字才是决定阈值的关键。

只有在这一步之后,才应该真正开启学生的自动发布。在此之前,让所有文章经过教师审核,并将机器评分作为帮助教师更快的草稿。

对学生说什么

透明是保持信任的条件:明确说明文章是通过系统初步评分并在必要时由教师审核,为学生提供申诉渠道,并指定最终责任人。一个明确说明这一点的中心比一个让学生自行猜测的中心更值得信赖。

常见问题

AI评分能替代正式记录中的教师评分吗?

不能。这是内部练习分数,而不是被认可的考试结果。

有多少百分比的文章应该经过教师审核?

取决于您设定的阈值和输入数据的质量。需要监控的是这个比例是否稳定或逐渐增加——逐渐增加意味着输入质量在下降。

学生应该知道自己的文章是由机器评分的吗?

应该。这样做不会降低反馈的价值,并且可以避免中心在出现投诉时的麻烦。

来源