Ein KI-Tutor ist ein System unter Dauerprüfung










Was die Prüfstudie misst
Eine gute Antwort ist noch kein Lernnachweis: Schulen brauchen getrennte Metriken, menschliche Audits und unabhängige Lernnachweise.
Ein Tutor-Label ist kein Gütesiegel. Die auf arXiv veröffentlichte Fassung eines AIED-2026-Konferenzbeitrags beschreibt, wie Khan Academy Khanmigo mit Offline-Tests und meist ein- bis zweiwöchigen Live-Experimenten prüft. In mehr als 40 Experimenten bewegten sich produktinterne Metriken teils gegeneinander.
Die Messungen müssen getrennt bleiben: Dialogzüge zählen Interaktion. LLM-klassifizierte «kognitive Beteiligung» bewertet sichtbare Äusserungen. Next-item correctness prüft einen neuen Gegenstand derselben Fertigkeit in derselben Sitzung ohne erneute Khanmigo-Hilfe. Randomisierte Live-Experimente können kausale Varianteneffekte auf solche kurzfristigen Produktmetriken schätzen. Das belegt aber weder langfristiges Behalten noch Ferntransfer oder allgemeinen beziehungsweise darüber hinausgehenden kausalen Lernerfolg.
Auch der Messfühler macht Fehler: Für den Math-Error-Judge berichtet der Beitrag F1 0,61 und eine Falsch-Negativ-Rate von 0,41. Automatische Judges brauchen deshalb dokumentierte Güte, menschliche Fachstichproben und Eskalationswege.
Alle Autor:innen sind mit Khan Academy affiliiert; untersucht werden das eigene Produkt und die eigene Messinfrastruktur. Unabhängige Replikation, längerfristige Outcomes und die Übertragbarkeit auf andere Kontexte sind begrenzt oder nicht berichtet.
Das Carousel führt unsere publizierte Position bewusst fort: Gute Lerndialoge diagnostizieren, dosieren Hilfe, schützen Eigenaktivität, reagieren auf Fehler und führen zurück in selbstständiges Können. Neu sind Metrikleiter, sichtbare Zielkonflikte samt Unsicherheit, Versionslogik, menschliche Auditierung und der Prüfcheck für Schulen.
Für die Schweiz bleibt offen: Passen Lehrplan, Sprachen, Datenschutz, Minderjährigenschutz, Verträge, Ressourcen und Assessment? Das ist eine lokale Anschlussfrage, keine Rechtsauskunft und keine Aussage des Papers.
Quellen
- Methodologies for Improving the Quality of AI Tutoring in K-12 Education – arXiv abstract
- Methodologies for Improving the Quality of AI Tutoring in K-12 Education – PDF
- Methodologies for Improving the Quality of AI Tutoring in K-12 Education – Springer publication
- Ein Chatbot ist noch kein Tutor
- Digitales Pausenbrot – Startseite und Bibliotheksstand
- Digitales Pausenbrot – Feed
- Digitales Pausenbrot / Lucca Spohn – Substack-Startseite
- Digitales Pausenbrot / Lucca Spohn – Substack-Feed
- Cognitive Offloading vs. Cognitive Activation
- KI als Antwortmaschine vs. Sokratischer Coach
- Die Aufgabe, die ich nicht stellen kann