Für die konkrete Aufgabe, sprechen zu lernen, liefern eine KI-Sprech-App und ein menschlicher Tutor ähnliche Ergebnisse. Eine Crossover-Studie von Zafer Susoy fand keinen signifikanten Unterschied in der Sprechleistung zwischen beiden. Der eigentliche Unterschied liegt bei Angst, Kosten und Tiefe. Nutze die App für tägliche Wiederholungen, einen Menschen für Tiefe.
Die Frage, die eigentlich gestellt wird
Fast niemand tippt diese Suche aus Interesse an Lehrmethodik ein. Man tippt sie, weil man seit Jahren eine Sprache lernt, sie lesen kann, einem Film folgen kann, und dann fragt ein Kellner etwas, und der Mund funktioniert plötzlich nicht mehr.
Der Standardrat lautet dann „nimm dir einfach einen Tutor“. Ein guter Rat, den genau diese Person nicht befolgen wird. Sie bucht keinen Tutor, gerade weil ein Tutor ein Zeuge ist. Einer fremden Person Geld dafür zu zahlen, beim Scheitern zuzusehen, ist eine schwere Entscheidung für jemanden, dessen ganzes Problem darin besteht, dass Beobachtetwerden genau das ist, was ihn blockiert.
Also dreht man die Frage um. Statt zu fragen, welche Option theoretisch überlegen ist, fragt man, welche das eigentliche Hindernis beseitigt. Und genau diese Frage kann die Forschung beantworten.
Was die Forschung sagt, wenn man beide im selben Raum testet
Der sauberste Test für diesen Vergleich ist eine Within-Subjects-Crossover-Studie von Zafer Susoy, veröffentlicht in Frontiers in Psychology. 48 Studierende im ersten Jahr des Lehramtsstudiums Englisch an einer türkischen staatlichen Universität absolvierten je zwei vergleichbare Sprechprüfungen im Abstand von zwei Wochen. Eine wurde von einem KI-Chatbot begleitet, die andere von menschlichen Lehrkräften. Beide wurden nach einem TOEFL-iBT-Bewertungsraster von 0 bis 12 bewertet, und vor jeder Prüfung wurde eine Sprechangst-Skala erhoben.
Drei Ergebnisse sind wichtig.
Die Noten kamen aufs Gleiche heraus. KI-Bedingung 8,12, menschliche Bedingung 8,35, t(47) = 1,21, p = 0,23. Kein signifikanter Unterschied. Was auch immer man bei einer KI-Prüfung für fehlend hält, es zeigte sich weder in leichteren noch in strengeren Noten. Menschliche und KI-Bewertung stimmten außerdem stark überein, Cohens Kappa = 0,86.
Die Angst war bei der Maschine niedriger, 98,48 gegenüber 102,94, p = 0,01, ein kleiner Effekt.
Und das Ergebnis, das den ganzen Vergleich neu einordnet: Mit einem Menschen im Raum sagte die Angst die Note voraus, r = -0,500, p < 0,01. Bei der KI sagte sie gar nichts voraus, r = -0,042. Die nervöseren Studierenden verloren vor einer Person echte Punkte. Vor der Maschine tauchten ihre Nerven auf der Bewertung gar nicht mehr auf.
Das ist keine Aussage darüber, dass die KI besser unterrichtet. Es ist eine Aussage darüber, dass ein menschliches Publikum eine Steuer erhebt, und dass diese Steuer genau die Lernenden am härtesten trifft, die ohnehin schon mit dem Sprechen kämpfen.
Wo der menschliche Tutor klar gewinnt
Jetzt das Gegengewicht, denn ein Vergleich, der nur die schmeichelhafte Studie zitiert, ist Werbung.
Yi Ma und Mingyang Chen führten eine 16-wöchige Studie mit 150 chinesischen Englischlernenden auf Mittelstufenniveau durch, veröffentlicht in Frontiers in Psychology, mit einem verzögerten Test in Woche 20. Drei Gruppen: KI mit Lehrer-Unterstützung, KI allein und eine Kontrollgruppe.
- IELTS-Bandwerte-Zuwachs: 1,45 mit KI plus Lehrkraft, 0,92 mit KI allein, 0,31 in der Kontrollgruppe.
- Beibehaltung in Woche 20: 94 % der Fortschritte blieben bei der unterstützten Gruppe erhalten, 87 % bei KI allein.
- Die reine KI-Gruppe erreichte, was die Forschenden ein Neuheitsplateau nannten, etwa zwischen Woche 9 und 12. Ein Lernender beschrieb, in einer Schleife festzustecken, ohne dass irgendetwas ihn zu schwierigerem Material drängte.
- 34 % der Lernenden waren von der mangelnden kulturellen Anpassungsfähigkeit der KI frustriert.
- Die Spracherkennung war nicht zu allen gleich gnädig. Lernende vom Land brauchten 2,3-mal so viele Wiederholungen wie Lernende aus der Stadt. Eine Person sagte, der amerikanische Akzent der KI habe sie sich wie eine Fremde in der eigenen Übung fühlen lassen.
Liest man diese Zahlen ehrlich: KI allein brachte in 16 Wochen fast einen ganzen IELTS-Bandwert, und das ist echt. Die Gruppe mit einem Menschen gewann deutlich mehr, erreichte seltener ein Plateau und behielt mehr davon. Der Beitrag der Lehrkraft war konkret: Lehrer-Unterstützung sagte Lernautonomie voraus, also das Gefühl, das eigene Lernen zu steuern, mit β = 0,52. Die Personalisierung der KI sagte etwas anderes voraus, nämlich Kompetenz, das Gefühl, gut darin zu sein, mit β = 0,37. Sie sind kein Ersatz füreinander. Sie bedienen unterschiedliche Bedürfnisse.
Die Einschränkung, die niemand, der KI verkauft, drucken will
Die Chatbot-Literatur ist stark bei kurzfristigen Fortschritten innerhalb des Programms und schwach dabei, was danach passiert.
Mengdi Li, Yinyu Wang und Xiaorong Yang werteten 41 experimentelle und quasi-experimentelle Studien mit 3515 Teilnehmenden aus und fanden einen mittleren bis großen positiven Effekt auf den Zweitspracherwerb, ES = 0,576, mit einem 95-Prozent-Konfidenzintervall von 0,385 bis 0,768, p < 0,001. Ihre eigene Moderatoranalyse enthält den Vorbehalt: Interventionen von ein bis sieben Tagen zeigten mit die größten Effekte. Sehr kurze Studien mit sehr großen Zahlen sind das klassische Anzeichen dafür, dass man Neuheit und unmittelbare Übungseffekte misst, nicht dauerhaftes Können.
Es gibt ein zweites Problem, und es ist strukturell, nicht statistisch. Große Sprachmodelle sind darauf trainiert, zustimmend zu sein. Stanfords SycEval-Studie maß unterwürfig zustimmendes Verhalten in 58,19 % der Modellantworten. Ein Gesprächspartner, der dazu neigt, allem zuzustimmen, ist ein schlechter Fehlerdetektor und, was für diese Aufgabe schlimmer ist, eine schlechte Probe für die Realität. Echte Gesprächspartner unterbrechen. Sie werden ungeduldig. Sie werden nicht langsamer, nur weil man verwirrt aussieht. Nur gegen etwas unendlich Geduldiges zu üben, lässt einen ganzen Muskel völlig untrainiert.
Wer einen einzigen ehrlichen Satz zur Übertragung will: KI-Übung baut zuverlässig den Reflex des Sprechens auf, und ein menschliches Gespräch ist immer noch der Ort, an dem sich zeigt, ob dieser Reflex den Kontakt übersteht.
Was jede Option wirklich kostet
Kosten sind hier kein Detail. Sie sind der Mechanismus, der entscheidet, wie viel man übt.
Menschlicher Sprachunterricht, laut italkis eigener Preisseite: Community-Tutoren, also Muttersprachler oder fließend Sprechende ohne formale Lehrerausbildung, verlangen meist 4 bis 20 Dollar pro Lektion. Professionelle Lehrkräfte mit Qualifikation, Zertifizierung und strukturiertem Lehrplan verlangen meist 10 bis 40 Dollar pro Lektion. Man zahlt den Preis aus dem Tutorenprofil, ohne versteckte Buchungsgebühr an der Kasse, und italki nimmt seine Provision von der Seite der Lehrkraft. Die meisten Tutoren bieten eine Probelektion an, meist 30 Minuten, mit 30 bis 50 % Rabatt. Preply ist der andere große Marktplatz in dieser Kategorie und arbeitet mit einem Abo aus festen Wochenstunden.
Das ist für echte menschliche Aufmerksamkeit ein wirklich fairer Preis. Aber man beachte, was diese Preisstruktur mit dem Verhalten macht. Ein Tutor ist ein Termin im Kalender mit Preisschild, also bucht man ein oder zwei pro Woche. Eine KI-Sprech-App ist ein fester monatlicher Minutenpool, also kostet ein weiteres zehnminütiges Gespräch praktisch nichts extra, und man kann es um 6 Uhr morgens führen oder auf dem Weg zum Laden. Häufigkeit ist der eigentliche Ursprung von Sprechfertigkeit. Die App gewinnt nicht bei der Qualität pro Stunde. Sie gewinnt bei den Stunden.
Für wen sich was eignet
Nimm einen menschlichen Tutor, wenn: du schon gut genug sprichst, um ein Gespräch zu führen, und von kompetent zu präzise willst. Du brauchst kulturelle und pragmatische Nuancen, Registerwechsel, die Dinge, die technisch korrekt sind, aber falsch ankommen. Du hast eine Frist, eine Prüfung, ein Vorstellungsgespräch, einen Umzug. Du weißt, dass du nicht dranbleibst, wenn nicht jemand dienstags um sieben auf dich wartet. Oder du willst jemanden, der sich deine eine bestimmte schlechte Angewohnheit merkt und sie auch in der vierten Woche nicht durchgehen lässt.
Nutze eine KI-Sprech-App, wenn: du weit mehr verstehst, als du produzieren kannst. Du hast seit Monaten oder Jahren keinen vollständigen Satz mehr laut in der Sprache gesagt. Deine verfügbare Übungszeit ist zersplittert, fünfzehn Minuten hier, zehn dort, zu Zeiten, zu denen kein Tutor wach ist. Du willst Volumen, und du willst denselben Fehler vierzig Mal machen, ohne dass sich jemandes Gesicht verändert.
Nutze beide, wenn es dir ernst ist. Das ist keine diplomatische Nicht-Antwort, sondern das Ergebnis mit dem größten gemessenen Zuwachs in der Studie von Ma und Chen. Die produktive Reihenfolge ist für die meisten Erwachsenen App zuerst, Mensch danach: Wiederholungen sammeln und die Angst mit der Maschine verlieren, dann eine deutlich weniger verängstigte sprechende Person zu einem Tutor bringen, der endlich an etwas anderem als deiner Panik arbeiten kann.
Wo Mintza in dieses Argument passt
Mintza ist ein live geführtes, offenes Sprachgespräch mit einem zweisprachigen KI-Lehrer. Kein Transkribieren-und-Warten, kein Text-Chat, kein Lektionsskript zum Abarbeiten. Du sprichst, er antwortet, und er korrigiert dich mitten im Gespräch, statt dir hinterher einen Bericht zu geben.
Der Teil, der für diesen Vergleich zählt, ist der zweisprachige Mechanismus. Der Lehrer spricht sowohl die Sprache, die du lernst, als auch eine, die du schon kannst. Wenn du mitten im Satz einfrierst, wechselt er in die Sprache, die du schon beherrschst, löst die Blockade und führt dich zurück in die Zielsprache. Dieses Verhalten ist nach Niveau festgelegt, nicht dem Zufall überlassen: Auf Einsteiger-Niveau spricht er meist deine eigene Sprache und führt die neue in kurzen, wiederholbaren Häppchen ein, auf Anfänger-Niveau hält er das Gespräch größtenteils in der Zielsprache und nutzt deine Sprache zum Erklären und Beruhigen, auf Mittelstufe-Niveau bleibt er fast vollständig in der Zielsprache und weicht nur aus, wenn du wirklich kämpfst, und auf Fortgeschritten-Niveau bleibt er vollständig in der Zielsprache, im natürlichen Tempo, und gibt Feedback auf Augenhöhe statt im Lehrmodus. Die Korrekturintensität skaliert genauso, von reinem Vormachen ohne explizite Korrekturen auf Einsteiger-Niveau bis zu Nuance und Register auf Fortgeschritten-Niveau.
Genau das macht Sprechen ab dem ersten Tag überlebbar. Ein Tutor, der zufällig deine Muttersprache teilt, kann das auch, und gute Tutoren tun es. Aber man kann sich nicht darauf verlassen, einen zu finden, man zahlt pro Stunde für dieses Privileg, und die reine Immersions-Community-Tutorin, zu der viele Lernende geschickt werden, kann es überhaupt nicht. Dieser Notausgang ist es, der einen Anfänger davon abhält, den Satz aufzugeben, und einen Satz aufzugeben ist der Grund, warum Menschen aufhören.
Der Rest ist auf Volumen statt Zeremonie ausgelegt. Fünfzehn Sprachen in jeder Kombination und Richtung. Vier Niveaus und ein Auswahlmenü für regionale Akzente bei Sprachen mit unterscheidbaren regionalen Varianten. Beides wird pro Sprache gespeichert. Er merkt sich frühere Gespräche und kann dort weitermachen, wo du aufgehört hast, statt wieder bei Smalltalk anzufangen. Keine Serien, keine mitlaufende Uhr während des Sprechens, kein vorgegebener Weg, und Erinnerungen nur, wenn du sie einrichtest. Du bekommst 20 Gratisminuten, wenn du dich mit Google oder Apple anmeldest, ohne Karte, und sie verfallen nie. Bezahlte Pläne sind monatliche Minutenpools, Basic 180, Plus 360, Pro 600, ohne Tageslimit. Den aktuellen Preis prüfst du im App Store oder bei Google Play, er variiert je nach Land.
Das Fazit
Die ehrliche Antwort auf „App oder Tutor“ lautet, dass beide nicht um denselben Job konkurrieren.
Ein menschlicher Tutor ist der bessere Lehrer. Ein Tutor gibt dir Tiefe, kulturelles Urteilsvermögen, Verbindlichkeit und das nützliche Unbehagen einer echten Person, die dich nicht endlos entgegenkommt. Wenn du dir einen leisten kannst und wirklich erscheinst, buch einen. Die Forschung stützt das: Die Lernenden mit einem Menschen neben der KI gewannen am meisten und behielten am meisten.
Eine KI-Sprech-App ist das bessere Fitnessstudio. Dort sind die Wiederholungen billig genug, um täglich stattzufinden, und niemand bewertet dich, während du stolperst. Das Ergebnis von Susoy ist das ganze Argument in einem Satz: Die Noten kamen aufs Gleiche heraus, und nur die menschliche Bedingung berechnete dir eine Gebühr fürs Nervössein.
Wenn du die Sprache verstehst und einfrierst, sobald dich jemand anspricht, ist die Reihenfolge nicht kompliziert. Bau den Reflex dort auf, wo dich niemand beobachtet. Dann lass dich beobachten.
Weiterführend: warum du eine Sprache verstehst, aber nicht sprechen kannst, wie du eine Sprache allein sprechen übst und die besten KI-Apps zum Sprechen einer Sprache üben.
Mintza ist verfügbar für iPhone, iPad und Mac und Android.