どのセンターも自動採点のアイデアに魅了されています:迅速で、教師のスケジュールに依存せず、クラス間で一貫性があります。短い回答:AIはスケールで使用可能ですが、どの作品が直接公開され、どの作品が人間を介さなければならないかを決定するゲートウェイが必要です。
機械採点における三つの典型的な失敗
- 証拠の捏造。 「あなたの作品の中の」文を引用するが、その文は存在しないか、意味が変わるほどに切り取られている。学習者はその文を自分の作品の中で見つけられない。
- 誤ったものを測定。 最も明白な例は発音です:システムが発音の基準を録音を読み上げることで採点する場合、それは語彙と文法を二度採点しているのです。この基準の証拠は、音声信号自体の測定から引き出されるべきです。
- 入力データが壊れているが、スコアが出る。 ライティングのTask 1の図が欠けている、スピーキングの録音が三つの部分のうち一部分しかない、音声ファイルが無音。システムが数字を返す場合、その数字は無意味であり、見た目は本物のように見えます。
三つ目の失敗が最も危険です。なぜなら、それは静かだからです。
最小限の信頼できるゲートウェイ
機械による採点のスコアが学習者の手に渡る前に、以下の条件を必ず通過させるべきです — そして検証するためのデータが不足している場合は不合格と見なされ、静かに通過させることは最も危険な失敗です:
- 採点がバリデーターによって却下されていない。
- コメント内のすべての引用が作品内の正確な文に追跡できる。
- システムがまだ採点できないと自認している基準がない。
- 入力データが有効である:十分な画像、十分な録音部分、作品が問題をコピーしていない。
- 信頼性がセンターによって設定された閾値に達している。
これがLinguaGradeの運営方法です:すべての条件を満たした作品は自動的に公開され、いずれかの条件を満たさない作品は教師の承認を待つことになります。センターは自動公開のモードをオンまたはオフにし、信頼性の閾値を自らのポリシーに基づいて設定します。
スケールで信頼を置く前のキャリブレーション
信頼性の閾値は感覚で選ぶべきではありません。正しい方法は:教師によってバンドが付けられた数十の作品を取り、システムに再採点させ、二つの列を比較します。二つの数字を見ます:半バンド以上の偏差率と、システムが自信を持っているが間違っている作品の割合。二つ目の数字が閾値を決定する数字です。
このステップの後に初めて、実際の学習者のために自動公開をオンにすべきです。それ以前は、すべての作品を教師に通過させ、機械による採点を教師を助けるためのドラフトとして使用してください。
学習者に何を伝えるか
透明性は信頼を維持する条件です:システムによって初期採点された作品と、必要な場合に教師が承認することを明記し、学習者に異議申し立ての道を提供し、最終的な責任者を明確にします。このように明確にするセンターは、学習者に自分で推測させるセンターよりも信頼性があります。
よくある質問
AIのスコアは公式記録の教師のスコアに置き換えられますか?
いいえ。これは内部練習のスコアであり、認定試験の結果ではありません。
何パーセントの作品が教師を通過すべきですか?
設定した閾値と入力データの質によります。この割合が安定しているか、徐々に増加しているかを監視することが重要です — 増加している場合は、入力の質が悪化していることを意味します。
学習者は自分の作品が機械によって採点されたことを知るべきですか?
はい。このことはフィードバックの価値を減少させず、センターが異議申し立ての際に問題を避けるのに役立ちます。