スピーキング力を伸ばすという一点に絞れば、AIスピーキングアプリと人間の講師はほぼ同じスコアを出します。Zafer Susoyによるクロスオーバー研究では、両者のスピーキング到達度に有意差は見られませんでした。本当の違いは不安、費用、そして深さです。日々の反復はアプリで買い、深さは人間で買うのが正解です。

なぜ「AIか人間か」と検索するのか

この言葉で検索する人のほとんどは、教育理論に興味があるわけではありません。何年も言語を勉強してきて、読めるし、映画も追えるのに、店員に何か聞かれた瞬間、口が動かなくなる。そういう経験をしたからこそ検索しているのです。

そこで返ってくる定番のアドバイスは「とにかくチューターを見つけよう」です。良いアドバイスですが、まさにこの人には効きません。チューターを予約しないのは、チューターが「見ている人」だからです。何かができない自分を見せるためにお金を払うのは、見られることそのものが自分を壊す原因である人にとって、ハードルが高すぎます。

だから問いを裏返す必要があります。どちらが理論的に優れているかではなく、どちらが今の自分を止めているものを取り除いてくれるかを聞くのです。そしてこれは、研究が答えられる問いです。

同じ条件で比べた研究は何を示したか

この比較を最も純粋な形で検証したのが、Zafer Susoyによる被験者内クロスオーバー研究で、Frontiers in Psychologyに掲載されました。トルコの公立大学で英語教育を学ぶ1年生48人が、2週間の間隔を空けて同程度の難易度のスピーキング試験を2回受けました。一方はAIチャットボットが、もう一方は人間の講師が実施し、どちらもTOEFL iBT基準の0から12点のルーブリックで採点され、それぞれの試験前にスピーキング不安の尺度も測定されました。

重要な結果は三つあります。

スコアはほぼ同じでした。 AI条件が8.12、人間条件が8.35で、t(47) = 1.21、p = 0.23。有意差はありません。AIの試験官に何か欠けていると思っていたとしても、それが甘い採点にも厳しい採点にも表れなかったということです。人間とAIの採点も強く一致しており、Cohenのカッパ係数は0.86でした。

不安は機械が相手のときのほうが低くなりました。 98.48対102.94、p = 0.01で、効果量は小さいものです。

そしてこの比較全体の見方を変える発見があります。 人間が相手だと、不安がスコアを予測しました(r = -0.500、p < 0.01)。AIが相手だと、その関係はほぼ消えました(r = -0.042)。緊張しやすい学生ほど、人の前では実際に点数を落としていました。機械の前では、その緊張が採点に表れなかったのです。

これはAIのほうが教え方が優れているという話ではありません。人間という聞き手がいることそのものが一種の税金になり、その税金はすでに話すことに苦労している学習者ほど重くのしかかる、という話です。

人間の講師が明確に勝る点

ここでバランスを取ります。都合の良い研究だけを引用する比較は、もはや広告だからです。

Yi MaとMingyang Chenは、中国人の中級英語学習者150人を対象に16週間の研究を行い、Frontiers in Psychologyに発表しました。20週目には遅延テストも実施されています。グループは三つ、教師の足場かけ付きAI、AI単独、そして対照群です。

  • IELTSバンドの伸び:教師付きAIが1.45、AI単独が0.92、対照群が0.31。
  • 20週目の定着率:足場かけ付きグループが94%、AI単独が87%。
  • AI単独グループは9週目から12週目あたりで、研究者が「目新しさの停滞」と呼ぶ現象にぶつかりました。ある学習者は、より難しい教材へ押し出してくれるものが何もないループに閉じ込められたと語っています。
  • 学習者の34%が、AIの文化的な適応力の乏しさに不満を持ちました。
  • 音声認識の精度は誰にでも平等ではありませんでした。地方の学習者は都市部の学習者よりも2.3倍多くの繰り返しを必要とし、ある学習者はAIのアメリカ英語アクセントのせいで自分の練習の中で外国人になった気がしたと語っています。

数字は正直に読む必要があります。AI単独でも16週間でIELTSバンドをほぼ1つ伸ばしており、これは本物の成果です。そして人間が加わったグループは、それよりはるかに多く伸び、停滞も少なく、より多くを保持していました。教師が特に効いていたのは特定の一点です。教師の足場かけは学習者の自律性、つまり自分の学びを自分で導いている感覚を予測しました(β = 0.52)。AIの個別最適化が予測していたのは別のもの、有能感、つまり自分がうまくやれているという感覚でした(β = 0.37)。両者は代わりにはならず、それぞれ違う欲求を満たしています。

AIを売る側が書きたがらない限界

チャットボットに関する研究は、短期的でプログラム内の伸びには強く、その後どうなるかには弱いのが実情です。

Mengdi Li、Yinyu Wang、Xiaorong Yangは、実験研究と準実験研究41件、参加者3,515人分をまとめ、第二言語習得への中程度から大きな正の効果を見出しました(ES = 0.576、95% CI [0.385, 0.768]、p < 0.001)。ただし彼ら自身の調整変数分析には注意書きがあります。1日から7日という短い介入が、最大級の効果を示していたのです。非常に短い研究が非常に大きな数字を生むのは、定着した技能ではなく、目新しさと直後の練習効果を測っている典型的なサインです。

もう一つ、統計ではなく構造そのものに根ざした問題があります。大規模言語モデルは、相手に同意するように訓練されています。スタンフォード大学のSycEvalの研究は、モデルの応答の58.19%に迎合的な振る舞いを確認しました。何を言っても受け入れがちな会話相手は、誤りを見つける力が弱く、しかもこの用途にとってはさらに悪いことに、現実のリハーサルとしても不十分です。実際の会話相手は割り込んできます。苛立ちます。困っている顔をしても待ってはくれません。無限に辛抱強い相手とだけ練習していると、ある一つの筋肉がまったく鍛えられないままになります。

転移について正直に一文でまとめるなら、AIとの練習は話す反射神経を確実に育てますが、その反射神経が現実に通用するかどうかを確かめる場は、依然として人間との会話です。

実際にかかる費用の違い

費用はここでは細部ではありません。どれだけ練習するかを左右する仕組みそのものです。

italkiの料金ページによれば、人間のチューターのうち、正式な教員資格を持たないネイティブや流暢な話者である「コミュニティチューター」は、1レッスンあたり$4〜$20が相場です。資格やカリキュラムを備えた「プロの講師」は1レッスンあたり$10〜$40が相場です。支払うのはチューターのプロフィールに表示された金額そのもので、決済時の隠れた予約手数料はなく、italkiは講師側から手数料を取ります。多くのチューターが、通常30分ほどの割引体験レッスンを用意しています。同じ市場のもう一つの大手Preplyは、週あたりの時間数を決めるサブスクリプション制です。

これは人間の専門知識に払う金額として、十分に妥当です。ただ、この料金の仕組みが行動に何をするかに注目してください。チューターは値札の付いた予定なので、週に1回か2回しか予約しません。AIスピーキングアプリは月ごとの分数プールなので、もう一回10分話すことの限界費用はゼロに近く、朝6時でも買い物の道すがらでも会話できます。スピーキング力を本当に育てるのは頻度です。アプリが時間あたりの質で勝るわけではありません。時間の総量で勝るのです。

それぞれが本当に向いている人

人間のチューターを選ぶべき人: すでに会話を成り立たせられるレベルにあり、そこそこできるから正確にできるへ進みたい人。文化的・語用論的なニュアンス、文法的には正しくても響きがずれる部分を直したい人。試験や面接、引っ越しなど締め切りがある人。誰かが火曜の7時に待っていてくれないと結局やらないと自分でわかっている人。あるいは自分のよくない癖を覚えていて、4週目になってもそれを見逃してくれない相手がほしい人。

AIスピーキングアプリを使うべき人: 理解できる量に対して、口から出せる量がずっと少ない人。もう何ヶ月も、あるいは何年もその言語で完全な一文を声に出していない人。使える練習時間が細切れで、15分や10分単位で、チューターが誰も起きていない時間帯にしか取れない人。とにかく量を積みたい人、同じ間違いを40回してもだれの表情も変わらない状態がほしい人。

本気なら両方を使うべきです。 これは八方美人な答えではなく、Ma and Chenの研究でもっとも大きな効果が出た組み合わせそのものです。多くの大人にとって効率が良い順番は、まずアプリ、次に人間です。機械で反復を重ねて恐怖を取り除き、そのあとで、パニック以外のことに取り組める、ずっと怖がらなくなった話し手をチューターのもとへ連れていくのです。

この議論の中でMintzaが担う役割

Mintzaは、バイリンガルのAIティーチャーとのライブでオープンな音声会話です。文字起こしを待つ時間も、テキストチャットも、なぞるだけのレッスン台本もありません。話せば返事があり、あとからレポートを渡されるのではなく、会話の中でその場で訂正されます。

この比較にとって重要なのはバイリンガルの仕組みです。ティーチャーは学習中の言語と、すでに話せる言語の両方を話します。文の途中で固まると、すでに知っている言語に切り替えて助け、そこから目標言語へ連れ戻します。この振る舞いはレベルによって管理されており、運任せではありません。未経験では主に母語で話し、新しい言語を短く繰り返せる単位で導入します。初級では会話の大半を目標言語で進めながら、説明と安心づけに母語を使います。中級ではほぼ目標言語だけにとどまり、詰まったときだけ抜け出します。上級では自然な速さで目標言語のみを保ち、教師モードではなく対等な話し相手としてのフィードバックを返します。訂正の強さも同じ形で調整され、未経験ではモデルを示すだけで明示的な訂正はなく、上級ではニュアンスと言葉遣いの調整になります。

これが、初日からスピーキングを始めても続けられる理由の核心です。母語を共有できるチューターも同じことができますし、良いチューターは実際にそうします。ただし、そういう相手が見つかる保証はなく、そのために時間単位でお金を払う必要があり、多くの学習者が勧められがちな「目標言語オンリー」のコミュニティチューターにはそもそもそれができません。この逃げ道があるからこそ、初心者は文の途中で諦めずに済みます。そして文を諦めることが、学習をやめる理由になるのです。

残りの部分は、儀式ではなく量のために作られています。15言語をどの組み合わせ、どちらの方向でも。レベルは4段階、地域ごとに発音が分かれる言語には地域アクセントも選べます。どちらも言語ごとに保存されます。前回の会話を覚えていて、世間話に戻ることなく続きから再開できます。連続記録も、話している間の時計表示も、決められた道筋もなく、リマインダーも自分で設定したときだけ届きます。GoogleかAppleでサインインすれば、カード登録なしで無料20分がもらえ、期限は切れません。有料プランは月ごとの分数プール、Basicは月180分、Plusは月360分、Proは月600分で、1日の上限はありません。現在の料金は国によって異なるため、App StoreかGoogle Playの掲載情報でご確認ください。

結論

「アプリか講師か」への正直な答えは、そもそも同じ仕事を争っていない、というものです。

人間の講師は、より優れた教師です。深さ、文化的な判断力、説明責任、そして永遠には合わせてくれない生身の人間という、有用な居心地の悪さを与えてくれます。払える余裕があり、実際に通い続けられるなら、予約すべきです。研究もそれを裏づけています。AIに人間を組み合わせた学習者が、もっとも多く伸び、もっとも多く保持していました。

AIスピーキングアプリは、より優れたジムです。反復が毎日できるほど安く、下手なところを見せても誰も採点していません。Susoyの結果こそがこの議論全体を一行にまとめています。スコアは同じで、緊張に課金してきたのは人間条件だけでした。

言語を理解していて、話しかけられると固まってしまうなら、次にすることは複雑ではありません。誰にも見られていない場所で反射神経を作りましょう。それから、見られに行きましょう。

関連記事:聞けばわかるのに話せないのはなぜか言語を一人で話す練習をする方法言語スピーキング練習に最適なAIアプリ

MintzaはiPhone、iPad、MacAndroidに対応しています。