Лучшая голосовая ИИ-модель реального времени для создания продукта в 2026 году — Gemini Live API от Google: аудио-токены примерно за десятую часть входной цены OpenAI, 97 поддерживаемых языков и самое быстрое измеренное время до первого звука. GPT-Live от OpenAI — лучший чистый разговор, но у него нет API. Вот честное сравнение, из опыта продакшена.

Почему этому сравнению можно доверять

Каждый рейтинг голосовых ИИ-моделей, что вы найдёте в этом месяце, написан тем, кто прочитал посты о запусках. Этот написан командой, которая каждый месяц оплачивает счёт за голосовую модель. Mintza, наше приложение для языковых разговоров, работает на Gemini Live API в продакшене: реальные пользователи, пятнадцать языков, сессии длиннее часа. Это предвзятость, и мы заявляем о ней сразу. Это же и причина, почему мы знаем, где эти модели на самом деле ломаются, — а это как раз то, что посты о запусках опускают.

Поэтому это сравнение признаёт то, в чём, как говорят факты, OpenAI лучше, печатает цены с официальных страниц и рассказывает, что на самом деле означает запуск одной из этих моделей в масштабе.

GPT-Live против Gemini Live: два разных вида продукта

Сравнение, которое большинство ищет, — это категориальная ошибка, и её прояснение — половина статьи.

GPT-Live, который OpenAI запустил 8 июля 2026 года как новый голосовой режим ChatGPT, — потребительский продукт. Он по-настоящему впечатляет: настоящий полнодуплексный звук, то есть он слушает и говорит одновременно и, словами его собственной системной карты, в моменте решает, ответить или продолжать слушать. Больше ничто в этом списке так не умеет. Но на нём нельзя строить. На конец июля 2026 года API у GPT-Live нет, только форма, чтобы получить уведомление, когда он появится. Та же системная карта откровенно признаёт, что GPT-Live передаёт трудные запросы текстовым моделям и что GPT-Live-1 и его мини-вариант менее способны, чем GPT-5.5 Thinking, по нескольким оценкам интеллекта. И OpenAI не публикует список поддерживаемых языков для него; TechCrunch сообщал о критике акцента в собственном демо OpenAI на хинди.

Что OpenAI реально предлагает разработчикам — это Realtime API, сейчас gpt-realtime-2.1 и мини-вариант. Это сильный продукт: нативно «речь-в-речь», поддержка WebRTC, WebSocket и SIP. Но он пошаговый, с семантическим определением голосовой активности, а не полнодуплексный, и сессии ограничены 60 минутами. Магия, из-за которой GPT-Live кажется человечным, — как раз та часть, которую нельзя арендовать.

Gemini Live API — противоположной формы: полный продукт и есть API. То, что Google отгружает разработчикам, — это то, что есть у самого Google.

Gemini Live API от Google: модель, на которой действительно можно строить

Google анонсировал Gemini 3.1 Flash Live 26 марта 2026 года, назвав его своей самой качественной аудио- и голосовой моделью на тот момент, с 90,8 % на ComplexFuncBench Audio для голосового использования инструментов и водяными знаками SynthID на сгенерированном звуке. Цифры, важные для разработчика, живут в документации:

  • Цена. Согласно официальной странице цен, входное аудио стоит $3 за миллион токенов, а выходное — $12 за миллион. Есть бесплатный тариф, так что прототипировать можно без счёта. Одна честная заметка из опыта: не переводите эти цены на токены в цифру «за минуту» и не называйте это своей стоимостью. Живая сессия также тарифицирует контекст разговора, пересылаемый на каждом шаге, и любые токены рассуждений, так что реальная стоимость минуты разговора выходит заметно выше наивной арифметики аудио-токенов. Это по-прежнему центы за минуту и по-прежнему доля тарифов OpenAI, но планируйте бюджет по измеренным сессиям, а не по прайс-листу.
  • Языки. Документация Live API перечисляет 97 поддерживаемых языков, и модель по природе многоязычна: она может переключаться посреди фразы, что важнее, чем кажется, и к чему мы ещё вернёмся.
  • Управление. Автоматическое определение голосовой активности с настраиваемой чувствительностью и длительностью тишины или полностью ручная передача хода. Перебивание отменяет генерацию. 30 голосов.
  • Сессии. Честный мелкий шрифт: аудио-сессии ограничены 15 минутами без сжатия контекста, а отдельные соединения ротируются примерно каждые 10 минут с предупреждением GoAway. Возобновление сессии и сжатие окна контекста — задокументированный ответ, и они работают; наши продакшен-сессии идут дольше часа через множество ротированных соединений.

Две оговорки, которые мы хотели бы видеть раскрытыми, если бы это писал кто-то другой. Текущая модель, gemini-3.1-flash-live-preview, в статусе preview, а не GA. И две выразительные функции из нативной аудио-генерации 2.5, аффективный диалог и проактивный звук, не поддерживаются в 3.1 Flash Live.

Grok Voice от xAI: претендент с самым простым счётом

Grok Voice — интересный третий вариант и единственный, чью цену можно посчитать в уме: единые $0,05 за минуту, $3 в час, независимо от того, сколько в этой минуте речи. Это настоящий API «речь-в-речь», grok-voice-latest, с определением голосовой активности на стороне сервера и по-настоящему отличающей его функцией: клонированием голоса из 120 секунд аудио. Он предлагает более двух десятков голосов и покрытие более 25 языков.

Единую цену легко полюбить и легко неверно оценить. Разговорный продукт тратит большую часть минут на слушание, а слушание — дешёвая половина счётчика Gemini. При типичной загрузке Gemini выходит заметно дешевле, чем $0,05 за минуту. Но если ваши сессии короткие и плотные, арифметика Grok освежающе честна, а его баллы в бенчмарках, как вы сейчас увидите, — не утешительный приз.

Amazon Nova 2 Sonic: корпоративная телефонная ставка

Nova 2 Sonic от Amazon — единая модель «речь-в-речь» на Bedrock с окном контекста в миллион токенов и самой глубокой телефонной историей в группе: интеграции с Amazon Connect и Twilio, а это ровно то, что хочет услышать команда контакт-центра. Он перечисляет 7 языков — самое узкое покрытие здесь. Если ваш голосовой продукт — телефонная линия в корпорацию, Nova 2 Sonic в шорт-листе. Если это что-то многоязычное — нет.

Claude и уголок с открытым исходным кодом

Две честные сноски. У Claude от Anthropic есть потребительский голосовой режим, но это конвейер «речь-в-текст, текст, текст-в-речь» с небольшим набором предустановленных голосов и 18 языками, и настоящего голосового API реального времени нет. Разработчики могут двигаться дальше.

Открытый код продвинулся дальше, чем думает большинство. Moshi от Kyutai — по-настоящему полнодуплексная модель с открытым исходным кодом и практической задержкой около 200 миллисекунд, а Qwen3-Omni предлагает открытые веса для сквозной омни-модальной модели. Ни у одной нет лоска коммерческих API, но если ваше ограничение — запуск на собственном оборудовании, вариант есть.

Что говорят бенчмарки, включая часть, что в пользу OpenAI

Самые полезные сторонние данные — Artificial Analysis Speech-to-Speech Index, композит из речевого рассуждения, разговорной динамики и агентного использования инструментов. Читайте его целиком, а не выборочно:

  • Общий композит: GPT-Realtime-2 на высоком рассуждении лидирует с 77,2 %, Grok Voice Think Fast следует с 75,7, а Gemini 3.1 Flash на высоком рассуждении стоит на 69,5. OpenAI выигрывает композит. Мы говорили, что это будет не хвалебная статья.
  • Речевое рассуждение: по сути тройная ничья на вершине. Grok набирает 97,1 %, а GPT-Realtime-2 и Gemini 3.1 Flash оба на 97. Интеллект-по-звуку теперь базовое требование среди большой тройки.
  • Разговорная динамика: вот где OpenAI по-настоящему доминирует. На Full Duplex Bench модели OpenAI набирают от 95,2 до 95,7 % против 74,3 у Gemini и 77,8 у Grok. Естественные перебивания, поддакивания и передача хода, из-за которых голос OpenAI кажется человечным, реальны и измерены, а не маркетинг.
  • Задержка: самое быстрое измеренное время до первого звука принадлежит Google. Gemini 2.5 Flash Native Audio отвечает за 0,63 секунды, опережая Grok с 0,78. В разговоре модель, которая начинает говорить первой, кажется умнее.

Одна оговорка, которую делают публикаторы бенчмарка и повторяем мы: они измеряют API-модели. Сам GPT-Live нельзя протестировать, потому что нет API для теста. Лучшая разговорная динамика в индустрии пока — эксклюзив для потребителей.

Итак, честная зачётка: OpenAI выигрывает разговорную динамику и композит. Gemini выигрывает цену в разы, языки в разы, измеренную задержку первого звука и доступ для разработчиков на равных со всеми. Какой набор побед важен — зависит целиком от того, что вы строите.

Что мы узнали, запуская Gemini Live в продакшене

Это раздел, который не может написать ни один другой рейтинг, так что будем конкретны. Mintza запускает Gemini Live за прокси на Go по WebSocket, с разговорами длиннее часа.

Ротация соединения каждые 10 минут реальна и переживаема. Gemini ротирует WebSocket-соединения примерно каждые 10 минут, сперва посылая предупреждение GoAway. Наш бэкенд переподключается прозрачно, используя дескрипторы возобновления сессии, посреди разговора, и пользователь ничего не замечает. Часовой урок тихо охватывает полдюжины соединений. Если ваша архитектура предполагает один сокет на разговор, это первое, что ломается.

Определение голосовой активности — это продуктовое решение, а не значение по умолчанию. Gemini позволяет настроить, как долго должна длиться тишина, прежде чем модель заключит, что вы закончили. Документация предлагает значения меньше секунды. Мы намеренно растянули их в несколько раз, потому что изучающий язык, делающий паузу, чтобы подобрать слово, ещё не закончил говорить, а преподаватель, который набрасывается на каждую паузу, — это преподаватель, от которого ученики уходят. Универсальному ассистенту нужна бойкая передача хода; обучающему продукту нужно терпение. Этот один параметр — и есть разница, и только настраиваемость VAD у Gemini сделала это настройкой, а не переписыванием.

Иногда вы конструируете обходной путь вокруг модели. У терпеливого VAD есть цена: студент, выдающий длинный беглый монолог, никогда не делает паузу достаточно долгую, чтобы уступить ход, и мы нашли незадокументированный потолок, где один незавершённый ход в итоге убивает соединение. Наше решение: после долгого непрерывного отрезка речи бэкенд вставляет несколько секунд тихого звука в поток, VAD видит сфабрикованную паузу, преподаватель отвечает на всё сказанное до сих пор, и студент продолжает, ничего не потеряв. Продакшен-голос ИИ полон таких обходных путей. Закладывайте их в бюджет.

Мы выбрали полудуплекс намеренно. Mintza отключает микрофон, пока преподаватель говорит, потому что эхоподавление на телефонах ненадёжно, а модель, которая слышит себя, говорит сама с собой. Мы обменяли перебивание на чистоту звука, намеренно. Вот почему и Full Duplex Bench, бенчмарк, который Gemini проигрывает сильнее всего, почти не важен для нашего случая: мы отключили перебивания по замыслу. Веса вашего бенчмарка должны следовать за вашим продуктом, а не за таблицей лидеров.

Длинным сессиям нужно управление контекстом. Час разговора переполнил бы окно контекста, поэтому мы полагаемся на сжатие контекста у Gemini, а наш системный промпт составлен из пяти слоёв: базовая личность, личность языкового преподавателя, поведение по уровню, урок и знания пользователя. Персона держится всю сессию и через каждое ротированное соединение. Эта связность на протяжении часа — способность, которой нет в спецификациях.

Языки и цена — это вся бизнес-модель. Mintza учит пятнадцати языкам в любом направлении, 210 пар, на одной модели, потому что многоязычное качество Gemini достаточно ровное, чтобы ему доверять, и модель может переключать языки посреди фразы, а это и делает возможной нашу двуязычную выручку: преподаватель переходит на ваш родной язык, когда вы застреваете, а затем возвращает обратно. И при аудио-тарифах Gemini минута разговора стоит центы, а это и делает продажу помесячных планов от 180 до 600 устных минут жизнеспособной по потребительским ценам. При десятикратной входной цене этого продукта бы не было.

Что делают возможным голосовые модели реального времени

Причина, почему этот класс моделей важен, — диапазон продуктов, которые он открывает, и каждый нагружает своё измерение:

  • Разговорная практика языка. Наш случай. Нагружает языки, цену в масштабе, терпеливую передачу хода и стабильность персоны на длинных сессиях. О потребительской стороне мы написали в статье Может ли ChatGPT научить вас говорить на языке?
  • Репетиторство и образование помимо языков: тот же профиль долгой сессии и терпеливого слушания, плюс использование инструментов для упражнений и прогресса.
  • Клиентская поддержка и телефония. Нагружает SIP и обвязку телефонных систем, поэтому и существуют поддержка SIP у OpenAI и интеграции Nova 2 Sonic с Amazon Connect и Twilio.
  • Доступность и живой перевод. Голосовые интерфейсы для тех, кто не может пользоваться экранами, и перевод в реальном времени, где и Google, и OpenAI выпускают отдельные варианты моделей.
  • Компаньоны и повседневные ассистенты. Единственная категория, где разговорная динамика и есть продукт, поэтому полнодуплексная естественность, которую OpenAI показал с GPT-Live, так там важна.

«Лучшая» — функция задачи. Приложению-компаньону стоит сильно взвешивать Full Duplex Bench. Телефонному продукту — интеграции. Образовательному продукту в масштабе — языки, цену и управление VAD, и эта задача, та, что мы знаем изнутри, — та, которую Gemini выигрывает решительно.

Вердикт

Если вы строите реальный продукт сегодня, особенно многоязычный, Gemini Live API — лучшая голосовая ИИ-модель реального времени в 2026 году: на порядок дешевле по входному аудио, чем Realtime API от OpenAI, 97 языков против десятков у остальных, самое быстрое измеренное первое аудио, бесплатный тариф для старта и настраиваемость, делающая поведение голоса продуктовым решением. OpenAI построил самый естественный разговор в индустрии и запер его внутри ChatGPT; его Realtime API отличен, но по цене для корпораций. Grok Voice — претендент, за которым стоит следить, с единой ценой и клонированием голоса. Nova 2 Sonic владеет контакт-центром. Claude не в этой гонке.

Мы пришли к этому вердикту дорогим путём: построив на нём. Mintza — это то, как выигрывающая модель выглядит в продакшене: преподаватель речи на пятнадцати языках, чьи разговоры идут дольше часа. Если хотите услышать, как звучит Gemini Live API, когда продуктовая команда настраивает каждый параметр под одну задачу, первые десять минут бесплатны. А если вы выбираете приложение, а не модель, мы сравнили всё поле в статье лучшие приложения с ИИ для разговорной практики языка.

Mintza доступно для iOS и Android.