自我练习的人遇到同样的障碍:听力和阅读有答案,而写作则没有。简短回答:自我评分可以解决可计数的错误,但无法替代在内容和论证方面的错误。
自我评分的四步流程
- 步骤 1 — 测量可计数的内容:字数(任务 1 最少 150 字,任务 2 最少 250 字)、段落数、复杂句数、内容词的重复次数。
- 步骤 2 — 分别评分四个标准:任务响应、连贯性和衔接、词汇资源、语法范围和准确性。每个标准一个分数,并附上一行理由。不要提前给出总分。
- 步骤 3 — 从下往上逐句阅读。这种方法将句子与文章的流畅性分开,因此语法错误会显露出来,而顺读时你会自动忽略这些错误。
- 步骤 4 — 只重写最弱的一段,而不是整篇文章。集中修改可以学到更多,而不是重写整篇。
每个标准的详细信息请参见文章 四个标准评分 IELTS 写作。
机器能做得好的部分
自动工具,包括使用语言模型的工具,在有明确标准的任务中表现良好:字数统计、重复检测、指出语法错误、提供替换词建议、识别缺少主题句的段落。这些反馈是有价值的,并且是即时的——这是一个 30 人的班级在每篇写作后无法获得的。
三种机器无法可靠捕捉的错误
- 偏题但写得好。 文章流畅,词汇丰富,论证严谨——但回答了一个与题目不同的问题。这是任务响应标准中最耗分的错误。
- 虚构的例子。 数据和证据听起来合理,但并不真实。对于评分者来说是一个大问号;对于自动工具来说,看起来与真实证据没有区别。
- 抄袭题目。 只是重新表述题目以达到字数要求。机器检测到 250 字,但读者会觉得文章空洞。
因此,一个严谨的评分系统必须在让模型评分之前进行检查,并且必须将可疑的文章保留给教师,而不是直接公布。在 LinguaGrade,文章只有在通过一个可靠的门户后才能自我发布:评分未被驳回,所有评论中的引用必须能够追溯到文章中的确切句子,没有任何标准等待人工审核,输入数据干净,可靠性达到阈值。如果未满足其中任何条件,则文章将进入教师审核的队列。阅读更多 用 AI 评分写作和口语的可靠性有多高。
常见问题
自我评分能替代教师吗?
不能替代,但可以减少需要教师参与的次数。在将文章提交给教师之前,先修正所有可计数的错误是最有效利用教师时间的方法。
每周应该写多少篇文章?
少写但更仔细地修改比写很多篇但不修改要好。每周两篇的反馈效果优于五篇写完就放的文章。
使用网络上的免费工具评分可靠吗?
在语法和字数方面是可靠的。但在分数方面不可靠——尤其是当工具没有说明它基于哪些标准得出这个分数时。