Jedes Zentrum ist von der Idee der automatischen Bewertung angezogen: schnell, unabhängig vom Lehrplan der Lehrer, konsistent zwischen den Klassen. Kurze Antwort: KI kann in großem Maßstab eingesetzt werden, vorausgesetzt, es gibt eine Filterung, die entscheidet, welche Arbeiten direkt veröffentlicht werden dürfen und welche durch Menschen geprüft werden müssen.
Drei typische Fehler bei der Maschinenbewertung
- Falsche Zitate. Kommentare, die einen Satz "in Ihrer Arbeit" zitieren, der nicht existiert oder so stark gekürzt ist, dass sich die Bedeutung ändert. Die Schüler finden diesen Satz nach dem Lesen nicht in ihrer Arbeit.
- Falsche Messung. Ein offensichtliches Beispiel ist die Aussprache: Wenn das System das Kriterium Aussprache bewertet, indem es die Transkription liest, bewertet es tatsächlich Vokabular und Grammatik ein zweites Mal und nicht die Aussprache. Der Nachweis für dieses Kriterium muss aus der Messung des tatsächlichen Audiosignals stammen.
- Eingabedaten sind fehlerhaft, aber es wird trotzdem eine Punktzahl ausgegeben. Ein Writing-Beitrag hat das Diagramm von Task 1 verloren, die Speaking-Aufzeichnung enthält nur einen Teil von drei Teilen, die Audiodatei ist stumm. Wenn das System trotzdem eine Zahl zurückgibt, ist diese Zahl bedeutungslos, sieht aber echt aus.
Der dritte Fehler ist der gefährlichste, da er still ist.
Minimale Vertrauensschwelle
Bevor eine von der Maschine bewertete Punktzahl an den Schüler übermittelt wird, sollte sie zwingend die folgenden Bedingungen erfüllen — und fehlende Daten zur Überprüfung gelten als nicht bestanden, stillschweigende Genehmigung ist der gefährlichste Fehler:
- Die Bewertung wurde nicht vom Validator abgelehnt.
- Alle Zitate in den Kommentaren können auf den genauen Wortlaut in der Arbeit zurückverfolgt werden.
- Es gibt keine Kriterien, die das System selbst als nicht bewertet angibt.
- Die Eingabedaten sind gültig: genügend Bildmaterial, genügend Audioaufnahmen, die Arbeit ist kein Plagiat.
- Die Zuverlässigkeit erreicht die vom Zentrum festgelegte Schwelle.
So funktioniert LinguaGrade: Arbeiten, die alle Bedingungen erfüllen, werden automatisch veröffentlicht, während Arbeiten, die eine Bedingung nicht erfüllen, in der Warteschlange zur Genehmigung durch den Lehrer verbleiben. Das Zentrum kann den automatischen Veröffentlichungsmodus aktivieren oder deaktivieren und die Vertrauensschwelle gemäß seiner Richtlinien festlegen.
Kalibrierung, bevor man im großen Maßstab vertraut
Die Vertrauensschwelle sollte nicht nach Gefühl gewählt werden. Der richtige Ansatz: Nehmen Sie einige Dutzend Arbeiten, die bereits von Lehrern bewertet wurden, lassen Sie das System diese erneut bewerten und vergleichen Sie die beiden Spalten. Achten Sie auf zwei Zahlen: den Prozentsatz der Abweichungen um mehr als eine halbe Bandbreite und den Prozentsatz der Arbeiten, bei denen das System selbstbewusst, aber falsch ist. Die zweite Zahl ist entscheidend für die Festlegung der Schwelle.
Erst nach diesem Schritt sollte die automatische Veröffentlichung für echte Schüler aktiviert werden. Zuvor sollten alle Arbeiten durch den Lehrer gehen, und die Maschinenbewertung sollte als Entwurf verwendet werden, um den Lehrern zu helfen, schneller zu arbeiten.
Was den Schülern gesagt werden sollte
Transparenz ist eine Voraussetzung für das Vertrauen: Es sollte klar angegeben werden, dass die Arbeit vorläufig durch das System bewertet wurde und dass ein Lehrer in den erforderlichen Fällen die Genehmigung erteilt, um den Schülern einen Beschwerdeweg und die letztendliche Verantwortung zu bieten. Ein Zentrum, das dies offen kommuniziert, ist vertrauenswürdiger als eines, das die Schüler im Unklaren lässt.
Häufig gestellte Fragen
Kann die KI-Bewertung die Lehrerbewertung in offiziellen Unterlagen ersetzen?
Nein. Dies ist eine interne Übungspunktzahl, nicht das Ergebnis einer anerkannten Prüfung.
Wie viel Prozent der Arbeiten sollten durch Lehrer überprüft werden?
Das hängt von der festgelegten Schwelle und der Qualität der Eingabedaten ab. Wichtig ist, dass dieser Prozentsatz stabil bleibt oder allmählich steigt — ein Anstieg bedeutet, dass die Eingabedaten schlechter werden.
Sollten die Schüler wissen, dass ihre Arbeit von einer Maschine bewertet wurde?
Ja. Dies mindert nicht den Wert des Feedbacks und verhindert Probleme für das Zentrum im Falle von Beschwerden.
Referenzquelle: IELTS — Writing Band Descriptors und wichtige Bewertungsrichtlinien; Cambridge English — IELTS Speaking Band Descriptors (öffentliche Version).