2026년, 제품을 만들기 위한 실시간 음성 AI 모델로 최고는 구글의 Gemini Live API예요. 음성 토큰은 OpenAI 입력 가격의 약 10분의 1, 지원 언어는 97개, 첫 음성까지 걸리는 시간은 실측 기준 가장 빨라요. OpenAI의 GPT-Live는 날것의 대화로는 최고이지만 API가 없어요. 프로덕션 경험을 바탕으로 솔직하게 비교해 볼게요.
이 비교를 믿어도 되는 이유
이번 달 여러분이 보게 될 음성 AI 모델 순위는 하나같이 공개 발표 글을 읽은 사람이 쓴 거예요. 이 글은 매달 음성 모델 청구서를 내는 팀이 썼어요. 저희 언어 대화 앱 Mintza는 프로덕션에서 Gemini Live API 위에서 돌아가요. 실제 사용자, 15개 언어, 한 시간을 넘기는 세션이죠. 그건 편향이고, 처음부터 분명히 밝혀 둬요. 그리고 그건 이 모델들이 실제로 어디서 무너지는지를 저희가 아는 이유이기도 해요. 발표 글이 빼놓는 부분이죠.
그래서 이 비교는 증거가 말하는 한 OpenAI가 더 잘하는 점을 인정하고, 공식 가격 페이지에서 가격을 가져오며, 이 모델 중 하나를 대규모로 돌린다는 게 실제로 어떤 일인지 알려 드려요.
GPT-Live 대 Gemini Live: 성격이 다른 두 제품
많은 사람이 검색하는 이 비교는 애초에 범주를 잘못 잡은 것이고, 그걸 풀어내는 게 이 글의 절반이에요.
OpenAI가 2026년 7월 8일에 ChatGPT의 새 음성 모드로 공개한 GPT-Live는 소비자용 제품이에요. 정말 인상적이에요. 진짜 전이중 방식이라 듣기와 말하기를 동시에 하고, 자사 시스템 카드의 표현을 빌리면 응답할지 계속 들을지를 그 자리에서 판단해요. 이 목록에서 그렇게 하는 건 이것뿐이에요. 하지만 그 위에 무언가를 만들 수는 없어요. 2026년 7월 하순 기준 GPT-Live API는 없고, API가 생기면 알림을 받는 양식만 있어요. 같은 시스템 카드는 GPT-Live가 어려운 질의를 텍스트 모델에 넘긴다는 점, 그리고 GPT-Live-1과 mini 버전이 여러 지능 평가에서 GPT-5.5 Thinking보다 능력이 떨어진다는 점도 솔직하게 인정해요. 게다가 OpenAI는 이에 대한 지원 언어 목록을 공개하지 않았고, TechCrunch는 OpenAI 자신의 힌디어 데모에 대한 억양 비판을 보도했어요.
OpenAI가 실제로 개발자에게 제공하는 건 Realtime API로, 현재는 gpt-realtime-2.1과 mini 버전이에요. 강력한 제품이에요. 네이티브 음성 대 음성이고 WebRTC, WebSocket, SIP를 지원해요. 하지만 의미 기반 음성 활동 감지를 쓰는 턴 방식이라 전이중이 아니고 세션은 60분에서 막혀요. GPT-Live를 사람처럼 느끼게 하는 그 마법이 바로 빌릴 수 없는 부분이에요.
Gemini Live API는 정반대 모양이에요. 제품 전체가 곧 API예요. 구글이 개발자에게 내놓는 것이 곧 구글이 가진 것이에요.
Google Gemini Live API: 실제로 그 위에 만들 수 있는 모델
구글은 2026년 3월 26일에 Gemini 3.1 Flash Live를 발표하며 지금까지 가장 높은 품질의 오디오·음성 모델이라고 밝혔어요. 음성으로 도구를 다루는 능력을 재는 ComplexFuncBench Audio에서 90.8퍼센트, 그리고 생성된 오디오에는 SynthID 워터마크가 들어가요. 만드는 사람에게 중요한 숫자는 문서 안에 있어요.
- 가격. 공식 가격 페이지에 따르면 음성 입력은 100만 토큰당 $3.00, 음성 출력은 100만 개당 $12.00이에요. 무료 등급이 있어서 청구서 없이 시제품을 만들 수 있어요. 경험에서 나온 솔직한 당부가 하나 있어요. 이 토큰 가격을 1분당 숫자로 환산해서 그걸 비용이라고 부르지 마세요. 라이브 세션에서는 매 턴마다 다시 보내지는 대화 컨텍스트와 사고 토큰에도 비용이 붙어서, 실제 대화의 1분당 비용은 단순한 음성 토큰 계산보다 훨씬 위에 놓여요. 그래도 1분에 몇 센트, OpenAI 요금의 일부라는 사실은 변함없지만, 예산은 가격표가 아니라 실측한 세션에서 잡으세요.
- 지원 언어. Live API 문서에는 97개 지원 언어가 적혀 있고 모델은 본질적으로 다국어예요. 문장 도중에도 언어를 바꿀 수 있는데, 이건 생각보다 훨씬 중요해서 뒤에서 다시 다룰게요.
- 제어. 감도와 무음 길이를 설정할 수 있는 자동 음성 활동 감지, 아니면 완전 수동 턴 제어예요. 배지인은 생성을 끊어요. 음성은 30가지예요.
- 세션. 솔직한 단서예요. 음성 세션은 컨텍스트 압축 없이는 15분으로 제한되고, 개별 연결은 약 10분마다 GoAway 경고와 함께 교체돼요. 문서에 적힌 답이 세션 재개와 컨텍스트 윈도우 압축이고, 실제로 작동해요. 저희 프로덕션 세션은 여러 번 교체되는 연결을 넘나들며 한 시간 넘게 이어져요.
다른 누군가가 이 글을 썼다면 저희가 밝혀 주길 바랐을 단서가 둘 있어요. 현재 모델 gemini-3.1-flash-live-preview는 프리뷰 단계이고 정식 버전이 아니에요. 그리고 2.5의 네이티브 오디오 생성에 있던 두 가지 표현 기능, 감정을 담은 대화와 능동적 음성은 3.1 Flash Live에서 지원되지 않아요.
xAI Grok Voice: 청구서가 가장 단순한 대항마
Grok Voice는 흥미로운 세 번째 선택지이고, 가격을 머릿속으로 계산할 수 있는 유일한 존재예요. 1분에 $0.05, 시간당 $3인 정액제이고, 그 1분 가운데 얼마가 발화인지와 상관없어요. 진짜 음성 대 음성 API인 grok-voice-latest로, 서버 쪽 음성 활동 감지를 갖췄고 진짜로 차별화되는 기능이 있어요. 120초의 음성으로 목소리를 복제하는 거예요. 스무 가지가 넘는 음성과 25개 이상의 언어를 제공해요.
정액제는 좋아하기 쉽고 잘못 판단하기도 쉬워요. 대화 제품은 그 분량의 대부분을 듣는 데 쓰는데, 듣기는 Gemini 계량기에서 싼 쪽 절반이에요. 흔한 가동 비율에서는 Gemini가 1분에 $0.05보다 뚜렷하게 싸요. 하지만 세션이 짧고 빽빽하다면 Grok의 셈법은 후련할 만큼 정직하고, 그 벤치마크 점수는 곧 보시겠지만 위로용 상 따위가 아니에요.
Amazon Nova 2 Sonic: 기업용 전화 연동이라는 승부수
Amazon의 Nova 2 Sonic은 Bedrock 위의 통합 음성 대 음성 모델로, 100만 토큰짜리 컨텍스트 윈도우와 이 무리 가운데 가장 탄탄한 전화 연동을 갖췄어요. Amazon Connect, Twilio와의 연동인데, 콘택트 센터 팀이 딱 듣고 싶어 하는 이야기예요. 지원 언어는 7개로 여기서 가장 좁아요. 음성 제품이 기업으로 들어가는 전화선이라면 Nova 2 Sonic은 후보에 들어요. 다국어라면 들지 않아요.
Claude, 그리고 오픈 소스라는 한구석
솔직한 각주가 둘 있어요. Anthropic의 Claude에는 소비자용 음성 모드가 있지만, 그건 음성 인식, 텍스트, 음성 합성 파이프라인이라 소수의 프리셋 음성과 18개 언어를 갖췄고 실시간 음성 API는 없어요. 만드는 사람은 넘어가도 돼요.
오픈 소스는 많은 사람이 짐작하는 것보다 앞서 있어요. Kyutai의 Moshi는 200밀리초 안팎의 실용적인 지연을 지닌 진짜 전이중 오픈 소스 모델이고, Qwen3-Omni는 종단 간 옴니모달 모델의 오픈 웨이트를 제공해요. 둘 다 상용 API만큼 다듬어지진 않았지만, 제약이 자체 하드웨어에서 돌리는 것이라면 그 선택지는 존재해요.
벤치마크가 말하는 것, OpenAI에 유리한 부분까지
가장 쓸모 있는 제3자 데이터는 Artificial Analysis Speech-to-Speech Index로, 음성 추론, 대화 감각, 에이전트형 도구 사용을 합성한 지표예요. 입맛대로 골라 읽지 말고 통째로 읽어 보세요.
- 종합 점수. 고추론 설정의 GPT-Realtime-2가 77.2퍼센트로 선두, Grok Voice Think Fast가 75.7로 뒤를 잇고, 고추론 설정의 Gemini 3.1 Flash는 69.5예요. 종합은 OpenAI가 이겨요. 광고성 글이 되지 않을 거라고 말씀드렸죠.
- 음성 추론. 사실상 상위 셋이 나란해요. Grok이 97.1퍼센트, GPT-Realtime-2와 Gemini 3.1 Flash는 둘 다 97이에요. 음성을 통한 지능은 이제 3강 사이에서는 기본 전제예요.
- 대화 감각. 여기가 OpenAI가 진짜로 압도하는 영역이에요. Full Duplex Bench에서 OpenAI 모델은 95.2에서 95.7퍼센트, Gemini는 74.3, Grok은 77.8이에요. OpenAI 음성을 사람처럼 느끼게 하는 자연스러운 끼어들기, 맞장구, 말차례 주고받기는 실재하고 실측된 것이지 마케팅이 아니에요.
- 지연 시간. 첫 음성까지 걸리는 시간의 실측 최고 기록은 구글 몫이에요. Gemini 2.5 Flash Native Audio는 0.63초에 응답해 Grok의 0.78을 앞서요. 대화에서는 먼저 말하기 시작하는 모델이 더 똑똑하게 느껴져요.
벤치마크를 낸 쪽이 붙이고 저희도 되풀이하는 단서가 하나 있어요. 이것들이 재는 건 API 모델이에요. GPT-Live 자체는 벤치마크에 올릴 수 없어요. 올릴 API가 없기 때문이에요. 업계 최고의 대화 감각은 당장은 소비자만의 혜택이에요.
그래서 솔직한 성적표예요. OpenAI는 대화 감각과 종합에서 이겨요. Gemini는 가격에서 몇 배, 지원 언어에서 몇 배, 첫 음성까지의 실측 지연, 그리고 모두와 대등한 개발자 접근에서 이겨요. 어느 쪽 승리가 중요한지는 여러분이 무엇을 만드는지에 온전히 달렸어요.
Gemini Live를 프로덕션에서 돌리며 배운 것
이건 다른 어떤 순위도 쓸 수 없는 절이니 구체적으로 갈게요. Mintza는 Go WebSocket 프록시 뒤에서 Gemini Live를 돌리고, 대화는 한 시간 넘게 이어져요.
10분마다 연결이 교체되는 건 실재하고 견딜 만해요. Gemini는 약 10분마다 WebSocket 연결을 교체하고 먼저 GoAway 경고를 보내요. 저희 백엔드는 세션 재개 핸들을 써서 대화 도중에 투명하게 재연결하니 사용자는 알아채지 못해요. 한 시간짜리 레슨이 조용히 여섯 개 남짓한 연결에 걸쳐요. 아키텍처가 대화 하나에 소켓 하나를 전제한다면, 이게 가장 먼저 무너지는 지점이에요.
음성 활동 감지는 기본값이 아니라 제품 결정이에요. Gemini에서는 말을 마쳤다고 모델이 결론짓기까지 무음이 얼마나 이어져야 하는지 설정할 수 있어요. 문서는 1초 미만 값을 권해요. 저희는 일부러 그 몇 배로 늘렸어요. 단어를 찾느라 잠시 멈추는 언어 학습자는 아직 말을 마친 게 아니고, 모든 멈춤에 달려드는 선생님은 학생이 떠나는 선생님이기 때문이에요. 범용 어시스턴트는 경쾌한 말차례 주고받기를 원하지만, 학습 제품은 인내심을 원해요. 그 한 파라미터가 갈림길이고, 그걸 재작성이 아니라 설정으로 만들 수 있었던 건 Gemini의 VAD가 설정 가능했기 때문이에요.
때로는 모델을 우회하도록 설계해요. 인내심 있는 VAD에는 대가가 있어요. 길고 유창하게 독백하는 학생은 턴을 넘길 만큼 오래 멈추지 않고, 저희는 확정되지 않은 한 번의 턴이 결국 연결을 끊는, 문서에 없는 상한을 발견했어요. 저희 해법은 이래요. 끊김 없이 오래 이어지는 발화 뒤에 백엔드가 몇 초짜리 무음 오디오를 스트림에 끼워 넣어요. VAD는 그 만들어진 멈춤을 보고, 선생님은 그때까지 나온 말 전부에 응답하며, 학생은 아무것도 잃지 않고 이어 가요. 프로덕션 음성 AI는 이런 우회책으로 가득해요. 그럴 여력을 미리 잡아 두세요.
저희는 일부러 반이중을 골랐어요. Mintza는 선생님이 말하는 동안 마이크를 음소거해요. 전화의 에코 제거는 믿을 수 없고, 자기 목소리를 듣는 모델은 자기 자신에게 말을 걸기 때문이에요. 저희는 배지인을 음성 명료도와 일부러 맞바꿨어요. Gemini가 가장 크게 지는 벤치마크인 Full Duplex Bench가 저희 용도에서는 거의 문제가 되지 않는 것도 이 때문이에요. 저희는 설계로 끼어들기를 껐어요. 벤치마크 가중치는 순위표가 아니라 여러분의 제품을 따라야 해요.
긴 세션에는 컨텍스트 관리가 필요해요. 한 시간 넘는 대화는 컨텍스트 윈도우를 넘치게 하니, 저희는 Gemini의 컨텍스트 압축에 기대고 시스템 프롬프트를 다섯 층으로 짜요. 기본 인격, 언어 교사 인격, 수준별 행동, 레슨, 그리고 사용자에 관한 지식이에요. 그 인격은 세션 전체와 교체되는 모든 연결을 넘어 유지돼요. 한 시간에 걸친 그 일관성은 사양표에 적히지 않는 능력이에요.
언어와 가격이 곧 비즈니스 모델 전부예요. Mintza는 15개 언어를 어느 방향으로든 210개 조합으로 단일 모델 위에서 가르쳐요. Gemini의 다국어 품질이 믿을 만큼 고르고, 모델이 문장 도중에 언어를 바꿀 수 있기 때문이에요. 그게 바로 저희의 이중 언어 구원을 가능하게 해요. 학생이 막히면 선생님이 그 모국어로 넘어갔다가 다시 데려오는 거죠. 그리고 Gemini의 음성 요금에서는 1분 대화가 몇 센트로 끝나고, 그것이 월 180분에서 600분의 발화를 소비자 가격의 월 요금제로 파는 걸 성립시켜요. 입력 비용이 열 배였다면 이 제품은 존재하지 않았을 거예요.
실시간 음성 모델이 가능하게 하는 것
이 모델 분야가 중요한 이유는 그것이 열어젖히는 제품의 폭에 있고, 그 각각이 서로 다른 차원에 부담을 줘요.
- 언어 말하기 연습. 저희 사례예요. 지원 언어, 대규모에서의 가격, 인내심 있는 말차례 주고받기, 그리고 긴 세션에 걸친 인격 안정에 부담을 줘요. 그 소비자 쪽은 ChatGPT로 언어를 말할 수 있게 될까?에서 다뤘어요.
- 언어를 넘어선 튜터링과 교육. 같은 긴 세션, 인내심 있게 듣는 프로파일에 연습과 진척을 위한 도구 사용이 더해져요.
- 고객 지원과 전화 연동. SIP와 전화 시스템 배관에 부담을 줘요. 그래서 OpenAI의 SIP 지원과 Nova 2 Sonic의 Amazon Connect, Twilio 연동이 존재해요.
- 접근성과 실시간 번역. 화면을 못 쓰는 사람을 위한 음성 우선 인터페이스, 그리고 실시간 번역이에요. 여기서는 구글도 OpenAI도 전용 모델 파생본을 내놓아요.
- 말벗과 일상 어시스턴트. 대화 감각 자체가 곧 제품인 유일한 범주예요. 그래서 OpenAI가 GPT-Live로 보여 준 전이중의 자연스러움이 거기서는 그토록 중요해요.
“최고"는 일에 따라 달라지는 함수예요. 말벗 앱은 Full Duplex Bench를 무겁게 봐야 해요. 전화 연동 제품은 연동을 무겁게 봐야 하고요. 대규모 교육 제품은 지원 언어, 가격, VAD 제어를 무겁게 봐야 하는데, 그 일, 마침 저희가 안에서부터 아는 그 일이야말로 Gemini가 확실하게 이기는 일이에요.
결론
오늘 실제 제품을, 특히 다국어 제품을 만든다면 Gemini Live API가 2026년 최고의 실시간 음성 AI 모델이에요. 음성 입력은 OpenAI의 Realtime API보다 한 자릿수 저렴하고, 지원 언어는 남들의 수십 개에 맞선 97개, 첫 음성은 실측 최고 속도, 시작할 무료 등급, 그리고 음성 동작을 제품 결정으로 만드는 설정 가능성을 갖췄어요. OpenAI는 업계에서 가장 자연스러운 대화를 만들어 놓고 그걸 ChatGPT 안에 가뒀어요. 그 Realtime API는 훌륭하지만 기업용 가격이에요. Grok Voice는 정액제와 목소리 복제를 갖춘, 주목할 대항마예요. Nova 2 Sonic은 콘택트 센터를 손에 쥐고 있어요. Claude는 이 경주에 없어요.
저희는 그 결론에 비싼 방식으로 도달했어요. 그 위에 만들어 보면서요. Mintza는 이긴 모델이 프로덕션에서 어떤 모습인지 그 자체예요. 대화가 한 시간 넘게 이어지는 15개 언어의 말하기 선생님이죠. Gemini Live API가 제품 팀이 한 가지 일을 위해 모든 파라미터를 손본 뒤에는 어떻게 들리는지 알고 싶다면, 첫 10분은 무료예요. 그리고 모델이 아니라 앱을 고르는 중이라면, 이 분야 전체를 언어 말하기 연습에 가장 좋은 AI 앱에서 비교했어요.