
S2E1 | Bewertungs- und Feedbacktools auf dem Prüfstand
Zehn Schülertexte, zehn Bewertungen – und teilweise völlig unterschiedliche Ergebnisse. Für Rainer Mühlhoff ist der Fall klar: KI-basierte Korrektur- und Feedbacksysteme sind zu unzuverlässig für die Leistungsbewertung. Aber tragen die Daten diese Schlussfolgerung wirklich? Wir schauen uns zwei Studien von Mühlhoff genauer an und fragen, was sie tatsächlich über Variabilität, Reliabilität und die Qualität von KI-Feedback zeigen – und was die Forschung zum Vergleich von menschlicher und automatisierter Bewertung dazu sagt. Mühlhoff, R., & Henningsen, M. (2024). Chatbots im Schulunterricht: Wir testen das Fobizz-Tool zur automatischen Bewertung von Hausaufgaben. arXiv. Mühlhoff, R., & Quägwer, S. (2026). Automatisierte Korrektur mit KI? Wir testen zwei verbreitete Tools. SEMINAR – Lehrerbildung und Schule, 32(2), 62–76. Yun, J. (2023). Meta-analysis of inter-rater agreement and discrepancy between human and automated English essay scoring. English Teaching, 78(3), 105–124. Huang, Y., Palermo, C., & Wilson, J. (2026). Accuracy and fairness of generative AI in automated essay scoring: Comparing GPT-4o, feature-based models, and human raters. Assessing Writing, 69, 101047.

