말하기 실력을 키운다는 한 가지 목표만 놓고 보면 AI 말하기 앱과 사람 튜터는 거의 같은 점수를 내요. Zafer Susoy의 교차설계 연구에서는 둘의 말하기 성취도에 유의미한 차이가 나타나지 않았어요. 진짜 차이는 불안, 비용, 그리고 깊이예요. 매일의 반복은 앱으로 채우고, 깊이는 사람으로 채우세요.

왜 “AI냐 사람이냐"를 검색하게 될까요

이 말을 검색창에 치는 사람 대부분은 교육 이론이 궁금해서가 아니에요. 몇 년을 그 언어에 매달려서 읽을 줄도 알고 영화도 따라가는데, 종업원이 뭔가 묻는 순간 입이 얼어붙어 버린 경험이 있기 때문이에요.

그럴 때 흔히 듣는 조언은 “그냥 튜터를 구해"예요. 좋은 조언이지만 정작 이 사람은 따르지 않을 조언이에요. 튜터를 예약하지 않는 이유는 튜터가 지켜보는 사람이기 때문이에요. 뭔가를 못하는 자신을 보여 주려고 낯선 사람에게 돈을 낸다는 건, 지켜보는 눈 자체가 자신을 무너뜨리는 사람에게는 팔기 힘든 제안이에요.

그러니 질문을 뒤집어야 해요. 어느 쪽이 이론적으로 더 우월한지가 아니라, 지금 자신을 막고 있는 걸 어느 쪽이 없애 주는지를 물어야 해요. 그리고 이건 연구가 답할 수 있는 질문이에요.

같은 조건에서 비교한 연구는 무엇을 보여줬을까요

이 비교를 가장 깨끗하게 검증한 건 Zafer Susoy의 피험자 내 교차설계 연구로, Frontiers in Psychology에 실렸어요. 터키의 한 국립대학에서 영어교육을 전공하는 1학년 48명이 2주 간격으로 난이도가 비슷한 말하기 시험을 두 번 치렀어요. 한 번은 AI 챗봇이, 한 번은 사람 강사가 진행했고, 둘 다 TOEFL iBT 기준 0~12점 루브릭으로 채점됐으며 시험 전마다 말하기 불안 척도도 측정했어요.

중요한 결과는 세 가지예요.

점수는 거의 같았어요. AI 조건 8.12, 사람 조건 8.35, t(47) = 1.21, p = 0.23. 유의미한 차이가 아니에요. AI 시험관에게 뭔가 부족하다고 생각했더라도, 그게 후한 채점으로도 박한 채점으로도 나타나지 않았다는 뜻이에요. 사람과 AI의 채점도 강하게 일치했어요, 코헨의 카파 계수 0.86.

불안은 기계 앞에서 더 낮았어요. 98.48 대 102.94, p = 0.01, 효과 크기는 작았어요.

그리고 이 비교 전체를 다시 보게 만드는 결과가 있어요. 사람 앞에서는 불안이 점수를 예측했어요(r = -0.500, p < 0.01). AI 앞에서는 그 관계가 거의 사라졌어요(r = -0.042). 더 긴장한 학생일수록 사람 앞에서는 실제로 점수를 잃었어요. 기계 앞에서는 그 긴장이 성적표에 나타나지 않았어요.

이건 AI가 더 잘 가르친다는 뜻이 아니에요. 사람이라는 청중이 있다는 사실 자체가 일종의 세금이 되고, 그 세금은 이미 말하기에 힘겨워하는 학습자에게 가장 무겁게 매겨진다는 뜻이에요.

사람 튜터가 확실히 앞서는 부분

이제 균형을 맞출 차례예요. 유리한 연구만 인용하는 비교는 결국 광고니까요.

Yi Ma와 Mingyang Chen은 중국인 중급 영어 학습자 150명을 대상으로 16주 연구를 진행해 Frontiers in Psychology에 발표했고, 20주 차에 지연 테스트도 실시했어요. 그룹은 세 개, 교사의 발판을 더한 AI, AI 단독, 그리고 대조군이었어요.

  • IELTS 밴드 상승폭: 교사와 함께한 AI가 1.45, AI 단독이 0.92, 대조군이 0.31.
  • 20주 차 유지율: 발판을 받은 그룹이 94%, AI 단독이 87%.
  • AI 단독 그룹은 9~12주 차 무렵 연구자들이 “새로움의 정체기"라 부른 지점에 부딪혔어요. 한 학습자는 더 어려운 자료로 밀어붙이는 게 아무것도 없는 반복 속에 갇힌 느낌이었다고 말했어요.
  • 학습자의 34%가 AI의 문화적 적응력 부족에 답답함을 느꼈어요.
  • 음성 인식은 모두에게 똑같이 친절하지 않았어요. 지방 학습자는 도시 학습자보다 2.3배 더 많이 반복해야 했고, 한 학습자는 AI의 미국식 억양 때문에 자기 연습 안에서 스스로 외국인이 된 기분이었다고 말했어요.

이 숫자는 정직하게 읽어야 해요. AI 단독으로도 16주 만에 IELTS 밴드를 거의 하나 올렸고, 이건 진짜 성과예요. 그리고 사람이 더해진 그룹은 그보다 훨씬 많이 늘었고, 정체도 덜했고, 더 많이 유지했어요. 교사의 기여는 구체적이었어요. 교사의 발판은 학습자의 자율성, 즉 스스로 학습을 이끄는 감각을 예측했어요(β = 0.52). AI의 개인화가 예측한 건 다른 것, 유능감, 즉 잘하고 있다는 감각이었어요(β = 0.37). 둘은 대체재가 아니에요. 서로 다른 필요를 채워요.

AI를 파는 쪽이 밝히고 싶어 하지 않는 한계

챗봇 관련 연구는 단기적인, 프로그램 안에서의 향상에는 강하지만 그 이후에는 약해요.

Mengdi Li, Yinyu Wang, Xiaorong Yang은 실험 연구와 준실험 연구 41건, 참가자 3,515명을 모아 제2언어 습득에 중간에서 큰 수준의 긍정적 효과를 확인했어요(ES = 0.576, 95% CI [0.385, 0.768], p < 0.001). 다만 이들의 조절변수 분석에는 유보가 붙어요. 1일에서 7일짜리 짧은 개입이 가장 큰 효과 중 하나를 보였거든요. 아주 짧은 연구가 아주 큰 수치를 내는 건, 지속되는 실력이 아니라 새로움과 직후 연습 효과를 재고 있다는 전형적인 신호예요.

두 번째 문제는 통계가 아니라 구조에 있어요. 대형 언어 모델은 상대에게 동의하도록 훈련돼요. 스탠퍼드의 SycEval 연구는 모델 응답의 58.19%에서 아첨하는 태도를 확인했어요. 뭘 말해도 잘 받아들이는 대화 상대는 오류를 잡아내는 힘이 약하고, 이 목적에는 더 나쁘게도, 현실을 위한 리허설로서도 부족해요. 실제 대화 상대는 말을 끊어요. 조바심을 내요. 헷갈려 보인다고 기다려 주지 않아요. 한없이 참을성 있는 상대하고만 연습하면 근육 하나가 통째로 훈련되지 않은 채 남아요.

전이에 대해 정직하게 한 문장으로 정리하면, AI 연습은 말하기 반사 신경을 확실히 길러 주고, 그 반사 신경이 현실에서도 통하는지는 여전히 사람과의 대화에서 드러나요.

실제로 드는 비용은 얼마나 다를까요

비용은 여기서 사소한 문제가 아니에요. 얼마나 자주 연습할지를 결정하는 장치 그 자체예요.

italki의 공식 가격 페이지에 따르면, 정식 교사 훈련 없이 원어민이거나 유창한 화자인 커뮤니티 튜터는 레슨당 보통 $4~$20를 받아요. 자격증과 인증, 체계적인 수업 계획을 갖춘 전문 강사는 레슨당 보통 $10~$40를 받아요. 결제는 튜터 프로필에 적힌 금액 그대로이고 결제 시 숨겨진 예약 수수료는 없으며, italki는 강사 쪽에서 수수료를 떼요. 대부분의 튜터가 보통 30분짜리 체험 레슨을 30~50% 할인가로 제공해요. Preply는 이 분야의 또 다른 대형 마켓플레이스로, 주간 시간을 정해 두는 구독제로 운영돼요.

전문가의 시간에 지불하는 값으로는 충분히 합리적이에요. 다만 이 가격 구조가 행동에 미치는 영향을 봐야 해요. 튜터는 가격표가 붙은 일정이라서 일주일에 한두 번만 예약하게 돼요. AI 말하기 앱은 월 정액 분수 풀이라서 10분 더 대화하는 한계비용이 거의 0에 가깝고, 아침 6시든 가게로 걸어가는 길이든 상관없이 할 수 있어요. 말하기 실력이 실제로 자라는 건 빈도에서예요. 앱이 시간당 품질로 이기는 게 아니에요. 시간의 총량으로 이겨요.

각각 진짜로 누구에게 맞을까요

사람 튜터가 맞는 경우: 이미 대화를 이어갈 수 있을 만큼 말할 수 있고, 능숙함에서 정교함으로 나아가고 싶은 사람. 문화적, 화용적 뉘앙스, 문법적으로는 맞지만 어감이 어긋나는 부분을 다듬고 싶은 사람. 시험이나 면접, 이사처럼 마감이 있는 사람. 화요일 저녁 7시에 누군가 기다리고 있지 않으면 결국 안 하게 된다는 걸 스스로 아는 사람. 아니면 자신의 특정한 나쁜 버릇을 기억해 뒀다가 4주 차가 되어도 넘어가 주지 않는 상대가 필요한 사람.

AI 말하기 앱이 맞는 경우: 이해하는 만큼 말로 내놓지 못하는 사람. 몇 달, 혹은 몇 년째 그 언어로 완전한 문장을 소리 내어 말해 본 적이 없는 사람. 쓸 수 있는 연습 시간이 15분, 10분씩 조각나 있고 튜터가 아무도 깨어 있지 않은 시간대인 사람. 양을 원하는 사람, 같은 실수를 마흔 번 해도 아무 표정 변화가 없는 상태를 원하는 사람.

진지하다면 둘 다 쓰세요. 이건 무난하게 얼버무리는 답이 아니라 Ma와 Chen의 연구에서 가장 큰 효과가 나온 결과예요. 대부분의 성인에게 생산적인 순서는 앱이 먼저, 사람이 다음이에요. 기계로 반복을 채우고 두려움을 덜어낸 뒤, 공포가 아닌 다른 무언가를 다룰 수 있는, 훨씬 덜 겁먹은 화자를 튜터에게 데려가는 거예요.

이 논의에서 Mintza가 있는 자리

Mintza는 이중언어 AI 티처와 나누는 라이브 음성 대화예요. 받아쓰기를 기다리는 시간도, 텍스트 채팅도, 따라가야 할 레슨 대본도 없어요. 말하면 답이 오고, 나중에 리포트를 받는 대신 대화 안에서 바로 교정해 줘요.

이 비교에서 중요한 건 이중언어 구조예요. 티처는 배우는 언어와 이미 할 줄 아는 언어를 둘 다 말해요. 문장 중간에 얼어붙으면 이미 아는 언어로 넘어가 막힌 곳을 풀어 주고 다시 목표 언어로 데려와요. 이 동작은 우연이 아니라 레벨별로 정해져 있어요. 입문에서는 주로 모국어로 말하고 새 언어를 짧고 반복 가능한 덩어리로 소개해요. 초급에서는 대화 대부분을 목표 언어로 이어가면서 설명과 안심에는 모국어를 써요. 중급에서는 거의 전부 목표 언어에 머무르고 막힐 때만 잠깐 빠져나와요. 고급에서는 자연스러운 속도로 목표 언어만 유지하고, 티처 모드가 아니라 동료 수준의 피드백을 줘요. 교정 강도도 같은 식으로 조절돼서, 입문에서는 명시적인 교정 없이 모델만 보여 주고, 고급에서는 뉘앙스와 어투를 다듬어요.

이게 바로 첫날부터 말하기를 시작해도 버틸 수 있게 만드는 핵심이에요. 모국어를 함께 쓰는 사람 튜터도 이걸 할 수 있고, 좋은 튜터는 실제로 그렇게 해요. 다만 그런 사람을 찾는다는 보장이 없고, 그 특권을 위해 시간당 돈을 내야 하며, 많은 학습자가 권유받는 “목표 언어만” 쓰는 커뮤니티 튜터는 애초에 이걸 할 수가 없어요. 이 탈출구가 있어서 초보자가 문장을 포기하지 않게 돼요. 그리고 문장을 포기하는 게 결국 그만두게 되는 이유예요.

나머지는 격식이 아니라 양을 위해 만들어졌어요. 15개 언어를 어떤 조합으로든, 어느 방향으로든. 레벨은 4단계이고, 지역별로 발음이 다른 언어에는 지역 억양도 고를 수 있어요. 둘 다 언어별로 저장돼요. 지난 대화를 기억해서 스몰토크로 되돌아가지 않고 이어서 시작할 수 있어요. 연속 기록도, 말하는 동안 화면에 뜨는 시계도, 정해진 경로도 없고, 알림은 직접 설정했을 때만 와요. Google이나 Apple로 로그인하면 카드 등록 없이 무료 20분이 주어지고 만료되지 않아요. 유료 플랜은 월 정액 분수 풀로, Basic은 월 180분, Plus는 월 360분, Pro는 월 600분이며 하루 상한은 없어요. 현재 가격은 국가마다 달라서 App Store나 Google Play 상품 페이지에서 확인하세요.

결론

“앱이냐 튜터냐"에 대한 정직한 답은, 애초에 같은 역할을 두고 경쟁하는 게 아니라는 거예요.

사람 튜터가 더 나은 선생님이에요. 깊이와 문화적 판단력, 책임감, 그리고 영원히 맞춰 주지 않는 진짜 사람이라는 유용한 불편함을 줘요. 감당할 수 있고 실제로 꾸준히 나갈 수 있다면 예약하세요. 연구도 이를 뒷받침해요. AI와 사람을 함께 쓴 학습자가 가장 많이 늘었고 가장 많이 유지했어요.

AI 말하기 앱은 더 나은 체육관이에요. 반복이 매일 할 만큼 저렴하고, 헤매는 동안 아무도 채점하지 않아요. Susoy의 결과가 이 논의 전체를 한 줄로 보여줘요. 점수는 같았고, 긴장에 값을 매긴 건 사람 조건뿐이었어요.

언어를 이해하는데 누가 말을 걸면 얼어붙는다면, 다음 순서는 복잡하지 않아요. 아무도 보지 않는 곳에서 반사 신경을 만드세요. 그다음에 지켜보는 눈 앞으로 가세요.

관련 글: 들으면 이해되는데 말은 안 나오는 이유, 혼자 언어 말하기 연습하는 방법, 언어 말하기 연습에 가장 좋은 AI 앱.

Mintza는 iPhone, iPad, MacAndroid에서 이용할 수 있어요.