O melhor modelo de voz IA em tempo real para construir um produto em 2026 é a Gemini Live API do Google: tokens de áudio a cerca de um décimo do preço de entrada da OpenAI, 97 idiomas suportados, e o tempo até o primeiro áudio mais rápido medido. O GPT-Live da OpenAI é a melhor conversa pura, mas não tem API. Aqui está a comparação honesta, direto da experiência em produção.

Por que você pode confiar nesta comparação

Todo ranking de modelos de voz IA que você vai encontrar este mês foi escrito por alguém que leu os posts de lançamento. Este foi escrito por um time que paga uma fatura de modelo de voz todo mês. O Mintza, nosso app de conversação em idiomas, roda na Gemini Live API em produção: usuários reais, quinze idiomas, sessões que passam de uma hora. Isso é um viés, e estamos declarando ele logo de cara. Também é o motivo de sabermos onde esses modelos realmente quebram na prática, que é justamente a parte que os posts de lançamento deixam de fora.

Então esta comparação reconhece o que a evidência diz que a OpenAI faz melhor, coloca os preços das páginas oficiais, e conta o que realmente envolve rodar um desses modelos em escala.

GPT-Live contra Gemini Live: dois tipos de produto diferentes

A comparação que a maioria das pessoas busca é um erro de categoria, e esclarecer isso é metade do artigo.

O GPT-Live, que a OpenAI lançou em 8 de julho de 2026 como o novo modo de voz do ChatGPT, é um produto para consumidores. É genuinamente impressionante: áudio full-duplex de verdade, ou seja, escuta e fala ao mesmo tempo e, nas palavras da própria system card, decide na hora se responde ou continua escutando. Nada mais nesta lista faz isso. Mas você não consegue construir em cima dele. Até o fim de julho de 2026 não existe API do GPT-Live, só um formulário para avisar quando existir. A mesma system card também admite com franqueza que o GPT-Live delega consultas difíceis para modelos de texto e que o GPT-Live-1 e sua variante mini são menos capazes que o GPT-5.5 Thinking em várias avaliações de inteligência. E a OpenAI não publica lista de idiomas suportados para ele; o TechCrunch reportou críticas de sotaque à própria demo em hindi da OpenAI.

O que a OpenAI realmente oferece para desenvolvedores é a Realtime API, atualmente gpt-realtime-2.1 e uma variante mini. É um produto forte: voz para voz nativa, com suporte a WebRTC, WebSocket e SIP. Mas é por turnos, com detecção semântica de atividade de voz, não full-duplex, e as sessões têm teto de 60 minutos. A mágica que faz o GPT-Live parecer humano é exatamente a parte que você não consegue alugar.

A Gemini Live API tem o formato oposto: o produto completo é a API. O que o Google entrega para desenvolvedores é o que o Google tem.

Google Gemini Live API: o modelo em que você realmente consegue construir

O Google anunciou o Gemini 3.1 Flash Live em 26 de março de 2026, chamando ele de seu modelo de áudio e voz de maior qualidade até agora, com 90.8 por cento no ComplexFuncBench Audio para uso de ferramentas guiado por voz e marca d’água SynthID no áudio gerado. Os números que importam para quem constrói estão na documentação:

  • Preço. Segundo a página de preços oficial, o áudio de entrada custa $3.00 por milhão de tokens e o de saída $12.00 por milhão. Existe um nível gratuito, então dá para prototipar sem fatura. Um alerta de honestidade tirado da experiência: não converta esses preços por token num valor por minuto e chame isso de custo. Uma sessão ao vivo também cobra o contexto da conversa reenviado a cada turno e eventuais tokens de raciocínio, então o custo real por minuto de uma conversa fica bem acima da conta ingênua feita só com tokens de áudio. Ainda são centavos por minuto, e ainda é uma fração das tarifas da OpenAI, mas o orçamento deve vir de sessões medidas, não da tabela de preços.
  • Idiomas. A documentação da Live API lista 97 idiomas suportados, e o modelo é multilíngue por natureza: consegue trocar no meio da frase, o que importa mais do que parece e sobre o qual vamos voltar.
  • Controle. Detecção automática de atividade de voz com sensibilidades e duração de silêncio configuráveis, ou controle de turno totalmente manual. A interrupção cancela a geração. 30 vozes.
  • Sessões. A letra miúda honesta: sessões de áudio são limitadas a 15 minutos sem compressão de contexto, e conexões individuais giram a cada 10 minutos, mais ou menos, com um aviso GoAway. Retomada de sessão e compressão da janela de contexto são a resposta documentada, e funcionam; nossas sessões em produção passam de uma hora por meio de várias conexões alternadas.

Duas ressalvas que gostaríamos de ver divulgadas se outra pessoa estivesse escrevendo isso. O modelo atual, gemini-3.1-flash-live-preview, tem status preview, não é GA. E dois recursos expressivos da geração de áudio nativo 2.5, o diálogo afetivo e o áudio proativo, não são suportados no 3.1 Flash Live.

xAI Grok Voice: o desafiante com a conta mais simples

O Grok Voice é a terceira opção interessante, e a única cujo preço dá para calcular de cabeça: um fixo de $0.05 por minuto, $3 por hora, não importa quanto daquele minuto seja realmente fala. É uma API de voz para voz de verdade, grok-voice-latest, com detecção de atividade de voz do lado do servidor e um recurso genuinamente diferenciador: clonagem de voz a partir de 120 segundos de áudio. Oferece mais de duas dezenas de vozes e cobertura de mais de 25 idiomas.

Preço fixo é fácil de amar e fácil de julgar errado. Um produto de conversação passa a maior parte dos minutos escutando, e escutar é a metade barata do medidor do Gemini. Em ciclos de uso típicos, o Gemini acaba saindo bem mais barato que $0.05 por minuto. Mas se suas sessões são curtas e densas, a aritmética do Grok é refrescantemente honesta, e os resultados dele em benchmarks, como você vai ver, não são nenhum prêmio de consolação.

Amazon Nova 2 Sonic: a aposta enterprise de telefonia

O Nova 2 Sonic da Amazon é um modelo unificado de voz para voz no Bedrock, com janela de contexto de um milhão de tokens e a história de telefonia mais profunda do grupo: integrações com Amazon Connect e Twilio, exatamente o que um time de central de atendimento quer ouvir. Ele lista 7 idiomas, a cobertura mais estreita aqui. Se seu produto de voz é uma linha telefônica para uma empresa, o Nova 2 Sonic entra na lista curta. Se é algo multilíngue, não.

Claude, e o canto do código aberto

Duas notas de rodapé honestas. O Claude, da Anthropic, tem um modo de voz para consumidores, mas é um pipeline de voz para texto, texto, texto para voz, com um conjunto pequeno de vozes predefinidas e 18 idiomas, e não existe uma API de voz em tempo real de verdade. Quem quer construir pode seguir em frente.

O código aberto está mais avançado do que a maioria imagina. O Moshi, da Kyutai, é um modelo de código aberto genuinamente full-duplex, com latência prática em torno de 200 milissegundos, e o Qwen3-Omni oferece pesos abertos para um modelo omni-modal de ponta a ponta. Nenhum dos dois tem o acabamento das APIs comerciais, mas se sua restrição é rodar no seu próprio hardware, a opção existe.

O que os benchmarks dizem, incluindo a parte que favorece a OpenAI

Os dados de terceiros mais úteis vêm do Artificial Analysis Speech-to-Speech Index, um composto de raciocínio de fala, dinâmica conversacional e uso agêntico de ferramentas. Vale ler ele inteiro, não seletivamente:

  • Composto geral: o GPT-Realtime-2 com raciocínio alto lidera com 77.2 por cento, o Grok Voice Think Fast vem em seguida com 75.7, e o Gemini 3.1 Flash com raciocínio alto fica em 69.5. A OpenAI vence o composto. Já avisamos que isso não seria um texto só de elogios.
  • Raciocínio de fala: praticamente um empate triplo no topo. O Grok marca 97.1 por cento, com o GPT-Realtime-2 e o Gemini 3.1 Flash empatados em 97. Inteligência sobre áudio já é o básico esperado entre os três grandes.
  • Dinâmica conversacional: é aqui que a OpenAI domina de verdade. No Full Duplex Bench, os modelos da OpenAI marcam de 95.2 a 95.7 por cento contra 74.3 do Gemini e 77.8 do Grok. As interrupções naturais, os sinais de escuta e o controle de turno que fazem a voz da OpenAI parecer humana são reais e medidos, não marketing.
  • Latência: o tempo até o primeiro áudio mais rápido medido é do Google. O Gemini 2.5 Flash Native Audio responde em 0.63 segundos, à frente do Grok com 0.78. Numa conversa, o modelo que começa a falar primeiro parece mais inteligente.

Uma ressalva que os próprios publicadores do benchmark fazem e que repetimos aqui: essas medições são dos modelos de API. O GPT-Live em si não pode ser medido, porque não existe API para medir. A melhor dinâmica conversacional da indústria é, por enquanto, exclusividade de consumidor.

Então o placar honesto: a OpenAI vence a dinâmica conversacional e o composto. O Gemini vence preço por um múltiplo, idiomas por um múltiplo, a latência medida até o primeiro áudio, e acesso para desenvolvedores em igualdade de condições com todo mundo. Qual conjunto de vitórias importa depende inteiramente do que você está construindo.

O que aprendemos rodando o Gemini Live em produção

Esta é a seção que nenhum outro ranking consegue escrever, então vamos ser específicos. O Mintza roda o Gemini Live atrás de um proxy WebSocket em Go, com conversas que passam de uma hora.

A rotação de conexão a cada 10 minutos é real, e dá para sobreviver a ela. O Gemini gira conexões WebSocket a cada 10 minutos, mais ou menos, enviando primeiro um aviso GoAway. Nosso backend reconecta de forma transparente usando identificadores de retomada de sessão, no meio da conversa, e o usuário nunca percebe. Uma aula de uma hora atravessa silenciosamente meia dúzia de conexões. Se sua arquitetura assume um único socket por conversa, isso é a primeira coisa que quebra.

Detecção de atividade de voz é uma decisão de produto, não um padrão qualquer. O Gemini deixa você configurar quanto tempo um silêncio precisa durar antes de o modelo concluir que você terminou. A documentação sugere valores abaixo de um segundo. Nós esticamos isso para várias vezes esse valor, deliberadamente, porque um estudante de idiomas que pausa para buscar uma palavra não terminou de falar, e um professor que ataca cada pausa é um professor que os alunos abandonam. Um assistente genérico quer troca de turno ágil; um produto de aprendizado quer paciência. Esse único parâmetro faz a diferença, e só a configurabilidade do VAD do Gemini transformou isso num ajuste em vez de uma reescrita.

Às vezes você projeta em torno do modelo. VAD paciente tem um custo: um estudante que solta um monólogo longo e fluente nunca pausa tempo suficiente para ceder o turno, e encontramos um teto não documentado onde um único turno não confirmado acaba matando a conexão. Nossa solução: depois de um longo trecho ininterrupto de fala, o backend insere alguns segundos de áudio silencioso no fluxo, o VAD enxerga a pausa fabricada, o professor responde a tudo que foi dito até ali, e o estudante continua sem perder nada. Voz IA em produção é cheia de gambiarras assim. Reserve orçamento para elas.

Escolhemos half-duplex de propósito. O Mintza silencia o microfone enquanto o professor fala, porque o cancelamento de eco em celulares é pouco confiável, e um modelo que se escuta acaba falando consigo mesmo. Trocamos interrupção por clareza de áudio, deliberadamente. Por isso o Full Duplex Bench, o benchmark em que o Gemini perde de forma mais dura, quase não importa para o nosso caso de uso: desativamos interrupções por design. Os pesos do seu benchmark deveriam seguir seu produto, não o ranking.

Sessões longas precisam de gestão de contexto. Uma hora de conversa transbordaria a janela de contexto, então dependemos da compressão de contexto do Gemini, e nosso prompt de sistema é composto por cinco camadas: personalidade base, personalidade de professor de idiomas, comportamento por nível, aula e conhecimento do usuário. A persona se mantém em toda a sessão e em cada conexão alternada. Essa coerência ao longo de uma hora é uma capacidade que nenhuma ficha técnica lista.

Idiomas e preço são o modelo de negócio inteiro. O Mintza ensina quinze idiomas em qualquer direção, 210 combinações, num único modelo, porque a qualidade multilíngue do Gemini é uniforme o bastante para confiar, e o modelo consegue trocar de idioma no meio da frase, que é o que torna possível nosso resgate bilíngue: o professor cai no seu idioma nativo quando você trava, depois te traz de volta. E nas tarifas de áudio do Gemini, um minuto de conversa custa centavos, o que torna viável vender planos mensais de 180 a 600 minutos falados a preços de consumidor. A dez vezes o custo de entrada, esse produto não existiria.

O que os modelos de voz em tempo real tornam possível

O motivo pelo qual essa classe de modelo importa é a gama de produtos que ela desbloqueia, e cada um estressa uma dimensão diferente:

  • Prática de fala em idiomas. Nosso caso. Estressa idiomas, preço em escala, controle de turno paciente, e estabilidade de persona em sessões longas. Escrevemos sobre o lado consumidor disso em O ChatGPT pode te ensinar a falar um idioma?
  • Tutoria e educação além de idiomas: o mesmo perfil de sessão longa e escuta paciente, mais uso de ferramentas para exercícios e progresso.
  • Suporte ao cliente e telefonia. Estressa a infraestrutura de SIP e sistemas telefônicos, motivo pelo qual existem o suporte SIP da OpenAI e as integrações do Nova 2 Sonic com Amazon Connect e Twilio.
  • Acessibilidade e tradução ao vivo. Interfaces centradas em voz para pessoas que não conseguem usar telas, e tradução em tempo real, onde tanto Google quanto OpenAI lançam variantes de modelo dedicadas.
  • Companhia e assistentes do dia a dia. A única categoria em que a dinâmica conversacional é o próprio produto, motivo pelo qual a naturalidade full-duplex que a OpenAI demonstrou com o GPT-Live importa tanto ali.

“Melhor” é uma função do trabalho. Um app de companhia deveria dar bastante peso ao Full Duplex Bench. Um produto de telefonia deveria dar peso às integrações. Um produto educacional em escala deveria dar peso a idiomas, preço e controle de VAD, e esse trabalho, aquele que por acaso conhecemos por dentro, é o que o Gemini vence com folga.

O veredito

Se você está construindo um produto de verdade hoje, especialmente um multilíngue, a Gemini Live API é o melhor modelo de voz IA em tempo real em 2026: uma ordem de grandeza mais barato em áudio de entrada que a Realtime API da OpenAI, 97 idiomas contra as dezenas dos outros, o primeiro áudio medido mais rápido, um nível gratuito para começar, e a configurabilidade para transformar comportamento de voz numa decisão de produto. A OpenAI construiu a conversa mais natural da indústria e trancou ela dentro do ChatGPT; sua Realtime API é excelente, mas com preço para empresas. O Grok Voice é o desafiante para ficar de olho, com preço fixo e clonagem de voz. O Nova 2 Sonic domina a central de atendimento. O Claude não está nessa corrida.

Chegamos a esse veredito pelo caminho caro: construindo em cima dele. O Mintza é como o modelo vencedor se parece em produção, um professor de fala de quinze idiomas com conversas que passam de uma hora. Se você quiser ouvir como a Gemini Live API soa quando um time de produto ajusta cada parâmetro para um único trabalho, os primeiros dez minutos são grátis. E se você está escolhendo um app em vez de um modelo, comparamos o campo inteiro em os melhores apps de IA para praticar conversação em outro idioma.

Mintza está disponível para iOS e Android.