El mejor modelo de voz IA en tiempo real para construir un producto en 2026 es la Gemini Live API de Google: tokens de audio a cerca de una décima parte del precio de entrada de OpenAI, 97 idiomas compatibles, y el tiempo hasta el primer audio más rápido medido. GPT-Live de OpenAI es la mejor conversación en bruto, pero no tiene API. Aquí está la comparación honesta, desde la experiencia en producción.

Por qué puedes confiar en esta comparación

Todo ranking de modelos de voz IA que encuentres este mes fue escrito por alguien que leyó los posts de lanzamiento. Este lo escribió un equipo que paga una factura de modelo de voz cada mes. Mintza, nuestra app de conversación en idiomas, corre sobre la Gemini Live API en producción: usuarios reales, quince idiomas, sesiones que duran más de una hora. Ese es un sesgo, y lo declaramos desde el inicio. También es la razón por la que sabemos dónde se rompen estos modelos en la práctica, que es justo la parte que los posts de lanzamiento omiten.

Así que esta comparación reconoce lo que la evidencia dice que OpenAI hace mejor, imprime los precios de las páginas oficiales, y cuenta lo que implica de verdad correr uno de estos modelos a escala.

GPT-Live contra Gemini Live: dos tipos de producto distintos

La comparación que más gente busca es un error de categoría, y aclararlo es la mitad del artículo.

GPT-Live, que OpenAI lanzó el 8 de julio de 2026 como el nuevo modo de voz de ChatGPT, es un producto para consumidores. Es genuinamente impresionante: audio full-duplex real, lo que significa que escucha y habla al mismo tiempo y, en palabras de su propia ficha de sistema, decide en el momento si responder o seguir escuchando. Nada más en esta lista hace eso. Pero no puedes construir sobre él. Hasta finales de julio de 2026 no existe una API de GPT-Live, solo un formulario para avisarte cuando exista una. Esa misma ficha de sistema también admite con franqueza que GPT-Live delega las consultas difíciles a modelos de texto y que GPT-Live-1 y su variante mini son menos capaces que GPT-5.5 Thinking en varias evaluaciones de inteligencia. Y OpenAI no publica una lista de idiomas compatibles para él; TechCrunch reportó críticas de acento sobre la propia demo en hindi de OpenAI.

Lo que OpenAI realmente ofrece a los desarrolladores es la Realtime API, actualmente gpt-realtime-2.1 y una variante mini. Es un producto sólido: voz a voz nativa, con soporte de WebRTC, WebSocket y SIP. Pero es por turnos con detección semántica de actividad de voz, no full-duplex, y las sesiones tienen un tope de 60 minutos. La magia que hace que GPT-Live se sienta humano es precisamente la parte que no puedes alquilar.

La Gemini Live API tiene la forma opuesta: el producto completo es la API. Lo que Google le entrega a los desarrolladores es lo que Google tiene.

Google Gemini Live API: el modelo sobre el que sí puedes construir

Google anunció Gemini 3.1 Flash Live el 26 de marzo de 2026, llamándolo su modelo de audio y voz de mayor calidad hasta la fecha, con 90.8 por ciento en ComplexFuncBench Audio para uso de herramientas guiado por voz y marca de agua SynthID en el audio generado. Los números que le importan a quien construye viven en la documentación:

  • Precio. Según la página de precios oficial, el audio de entrada cuesta $3.00 por millón de tokens y el de salida $12.00 por millón. Hay un nivel gratuito, así que puedes prototipar sin factura. Una nota de honestidad desde la experiencia: no conviertas esos precios por token en un número por minuto y lo llames tu costo. Una sesión en vivo también factura el contexto de la conversación que se reenvía en cada turno y cualquier token de razonamiento, así que el costo real por minuto de una conversación queda notablemente por encima de la matemática ingenua de tokens de audio. Sigue siendo centavos por minuto, y sigue siendo una fracción de las tarifas de OpenAI, pero presupuesta a partir de sesiones medidas, no de la hoja de precios.
  • Idiomas. La documentación de la Live API lista 97 idiomas compatibles, y el modelo es multilingüe por naturaleza: puede cambiar a mitad de frase, algo que importa más de lo que parece y a lo que volveremos.
  • Control. Detección automática de actividad de voz con sensibilidades y duración de silencio configurables, o turnos completamente manuales. La interrupción cancela la generación. 30 voces.
  • Sesiones. La letra pequeña honesta: las sesiones de audio están limitadas a 15 minutos sin compresión de contexto, y las conexiones individuales rotan aproximadamente cada 10 minutos con una advertencia GoAway. La reanudación de sesión y la compresión de la ventana de contexto son la respuesta documentada, y funcionan; nuestras sesiones en producción duran más de una hora a través de muchas conexiones rotadas.

Dos advertencias que querríamos ver reveladas si alguien más escribiera esto. El modelo actual, gemini-3.1-flash-live-preview, está en estado preview, no es GA. Y dos funciones expresivas de la generación de audio nativo 2.5, el diálogo afectivo y el audio proactivo, no están disponibles en 3.1 Flash Live.

xAI Grok Voice: el retador con la factura más simple

Grok Voice es la tercera opción interesante, y la única cuyo precio puedes calcular de memoria: un $0.05 por minuto plano, $3 por hora, sin importar cuánto de ese minuto sea habla. Es una API de voz a voz real, grok-voice-latest, con detección de actividad de voz en el lado del servidor y una función genuinamente diferenciadora: clonación de voz a partir de 120 segundos de audio. Ofrece más de dos docenas de voces y cobertura de más de 25 idiomas.

El precio plano es fácil de amar y fácil de juzgar mal. Un producto de conversación pasa la mayoría de sus minutos escuchando, y escuchar es la mitad barata del medidor de Gemini. En ciclos de uso típicos, Gemini termina saliendo notablemente más barato que $0.05 por minuto. Pero si tus sesiones son cortas y densas, la aritmética de Grok es refrescantemente honesta, y sus puntajes en benchmarks, como vas a ver, no son ningún premio de consolación.

Amazon Nova 2 Sonic: la jugada empresarial de telefonía

Nova 2 Sonic de Amazon es un modelo unificado de voz a voz en Bedrock con una ventana de contexto de un millón de tokens y la historia de telefonía más profunda del grupo: integraciones con Amazon Connect y Twilio, justo lo que un equipo de centro de contacto quiere escuchar. Lista 7 idiomas, la cobertura más estrecha aquí. Si tu producto de voz es una línea telefónica hacia una empresa, Nova 2 Sonic entra en la lista corta. Si es algo multilingüe, no.

Claude, y el rincón de código abierto

Dos notas al pie honestas. Claude de Anthropic tiene un modo de voz para consumidores, pero es una tubería de voz a texto, texto y texto a voz con un pequeño conjunto de voces preestablecidas y 18 idiomas, y no hay una API de voz en tiempo real real. Los constructores pueden seguir de largo.

El código abierto está más avanzado de lo que la mayoría asume. Moshi de Kyutai es un modelo de código abierto genuinamente full-duplex con latencia práctica alrededor de 200 milisegundos, y Qwen3-Omni ofrece pesos abiertos para un modelo omni-modal de extremo a extremo. Ninguno tiene el pulido de las APIs comerciales, pero si tu restricción es correr sobre tu propio hardware, la opción existe.

Lo que dicen los benchmarks, incluyendo la parte que favorece a OpenAI

Los datos de terceros más útiles son el Artificial Analysis Speech-to-Speech Index, un compuesto de razonamiento de habla, dinámica conversacional y uso agéntico de herramientas. Léelo completo, no de forma selectiva:

  • Compuesto general: GPT-Realtime-2 en razonamiento alto lidera con 77.2 por ciento, Grok Voice Think Fast sigue con 75.7, y Gemini 3.1 Flash en razonamiento alto se ubica en 69.5. OpenAI gana el compuesto. Te dijimos que esto no sería una nota de puro elogio.
  • Razonamiento de habla: prácticamente un empate a tres bandas en la cima. Grok anota 97.1 por ciento, con GPT-Realtime-2 y Gemini 3.1 Flash ambos en 97. La inteligencia sobre audio ya es un requisito básico entre los tres grandes.
  • Dinámica conversacional: aquí es donde OpenAI domina de verdad. En Full Duplex Bench, los modelos de OpenAI anotan entre 95.2 y 95.7 por ciento contra el 74.3 de Gemini y el 77.8 de Grok. Las interrupciones naturales, los asentimientos y el manejo de turnos que hacen que la voz de OpenAI se sienta humana son reales y medidos, no marketing.
  • Latencia: el tiempo hasta el primer audio más rápido medido pertenece a Google. Gemini 2.5 Flash Native Audio responde en 0.63 segundos, por delante de Grok con 0.78. En una conversación, el modelo que empieza a hablar primero se siente más inteligente.

Una advertencia que hacen los propios publicadores del benchmark y que repetimos: esto mide los modelos de API. GPT-Live en sí no puede evaluarse, porque no hay una API que evaluar. La mejor dinámica conversacional de la industria es, por ahora, exclusiva para consumidores.

Así que el marcador honesto: OpenAI gana la dinámica conversacional y el compuesto. Gemini gana precio por un múltiplo, idiomas por un múltiplo, la latencia medida hasta el primer audio, y acceso para desarrolladores en igualdad de condiciones con todos los demás. Qué conjunto de victorias importa depende por completo de lo que estés construyendo.

Lo que aprendimos corriendo Gemini Live en producción

Esta es la sección que ningún otro ranking puede escribir, así que seremos específicos. Mintza corre Gemini Live detrás de un proxy WebSocket en Go, con conversaciones que duran más de una hora.

La rotación de conexión cada 10 minutos es real, y sobrevivible. Gemini rota las conexiones WebSocket aproximadamente cada 10 minutos, enviando primero una advertencia GoAway. Nuestro backend reconecta de forma transparente usando identificadores de reanudación de sesión, en plena conversación, y el usuario nunca se entera. Una lección de una hora abarca silenciosamente media docena de conexiones. Si tu arquitectura asume un solo socket por conversación, esto es lo primero que se rompe.

La detección de actividad de voz es una decisión de producto, no un valor por defecto. Gemini te deja configurar cuánto debe durar un silencio antes de que el modelo concluya que terminaste. La documentación sugiere valores por debajo de un segundo. Nosotros lo estiramos varias veces por encima de eso, deliberadamente, porque un estudiante de idiomas que hace una pausa para buscar una palabra no ha terminado de hablar, y un profesor que salta sobre cada pausa es un profesor que los estudiantes abandonan. Un asistente genérico quiere turnos ágiles; un producto de aprendizaje quiere paciencia. Ese único parámetro es la diferencia, y solo la configurabilidad de VAD de Gemini lo convirtió en un ajuste en vez de una reescritura.

A veces diseñas alrededor del modelo. El VAD paciente tiene un costo: un estudiante que suelta un monólogo largo y fluido nunca hace una pausa lo bastante larga para ceder el turno, y encontramos un tope no documentado donde un solo turno sin confirmar eventualmente mata la conexión. Nuestra solución: después de un tramo largo e ininterrumpido de habla, el backend inserta unos segundos de audio en silencio en el flujo, el VAD ve la pausa fabricada, el profesor responde a todo lo dicho hasta ese momento, y el estudiante continúa sin perder nada. La voz IA en producción está llena de soluciones alternativas como esta. Preparate para ellas.

Elegimos half-duplex a propósito. Mintza silencia el micrófono mientras el profesor habla, porque la cancelación de eco en teléfonos es poco confiable y un modelo que se escucha a sí mismo termina hablándose a sí mismo. Cambiamos la interrupción por claridad de audio, deliberadamente. Por eso también Full Duplex Bench, el benchmark que Gemini pierde con más margen, apenas importa para nuestro caso de uso: desactivamos las interrupciones por diseño. Los pesos de tu benchmark deberían seguir a tu producto, no a la tabla de posiciones.

Las sesiones largas necesitan gestión de contexto. Una hora de conversación desbordaría la ventana de contexto, así que dependemos de la compresión de contexto de Gemini, y nuestro system prompt está compuesto por cinco capas: personalidad base, personalidad de profesor de idiomas, comportamiento por nivel, lección y conocimiento del usuario. La personalidad se mantiene a lo largo de toda la sesión y de cada conexión rotada. Esa coherencia durante una hora es una capacidad que ninguna hoja de especificaciones enumera.

Idiomas y precio son todo el modelo de negocio. Mintza enseña quince idiomas en cualquier dirección, 210 combinaciones, sobre un solo modelo, porque la calidad multilingüe de Gemini es lo bastante uniforme como para confiar en ella y el modelo puede cambiar de idioma a mitad de frase, que es lo que hace posible nuestro rescate bilingüe: el profesor entra en tu idioma nativo cuando te bloqueas, y luego te trae de vuelta. Y a las tarifas de audio de Gemini, un minuto de conversación cuesta centavos, que es lo que hace viable vender planes mensuales de 180 a 600 minutos hablados a precios de consumidor. Al décuple del costo de entrada, este producto no existiría.

Lo que los modelos de voz en tiempo real hacen posible

La razón por la que esta clase de modelo importa es la variedad de productos que desbloquea, y cada uno pone a prueba una dimensión distinta:

  • Práctica de habla en idiomas. Nuestro caso. Pone a prueba idiomas, precio a escala, turnos pacientes, y estabilidad de personalidad en sesiones largas. Escribimos sobre el lado para consumidores de esto en ¿Puede ChatGPT enseñarte a hablar un idioma?
  • Tutoría y educación más allá de los idiomas: el mismo perfil de sesión larga y escucha paciente, más uso de herramientas para ejercicios y progreso.
  • Atención al cliente y telefonía. Pone a prueba la infraestructura de SIP y sistemas telefónicos, que es por lo que existen el soporte SIP de OpenAI y las integraciones de Nova 2 Sonic con Amazon Connect y Twilio.
  • Accesibilidad y traducción en vivo. Interfaces centradas en voz para personas que no pueden usar pantallas, y traducción en tiempo real, donde tanto Google como OpenAI lanzan variantes de modelo dedicadas.
  • Compañía y asistentes diarios. La única categoría donde la dinámica conversacional es el producto en sí, por lo que la naturalidad full-duplex que OpenAI demostró con GPT-Live importa tanto ahí.

“El mejor” es una función del trabajo. Una app de compañía debería ponderar mucho Full Duplex Bench. Un producto de telefonía debería ponderar las integraciones. Un producto educativo a escala debería ponderar idiomas, precio y control de VAD, y ese trabajo, el que resulta que conocemos desde adentro, es el que Gemini gana con claridad.

El veredicto

Si estás construyendo un producto real hoy, especialmente uno multilingüe, la Gemini Live API es el mejor modelo de voz IA en tiempo real en 2026: un orden de magnitud más barato en audio de entrada que la Realtime API de OpenAI, 97 idiomas contra las docenas de los demás, el primer audio medido más rápido, un nivel gratuito para empezar, y la configurabilidad para convertir el comportamiento de voz en una decisión de producto. OpenAI construyó la conversación más natural de la industria y la encerró dentro de ChatGPT; su Realtime API es excelente pero tiene precio empresarial. Grok Voice es el retador a seguir, con precio plano y clonación de voz. Nova 2 Sonic domina el centro de contacto. Claude no está en esta carrera.

Llegamos a ese veredicto por el camino caro: construyendo sobre él. Mintza es cómo se ve el modelo ganador en producción, un profesor de habla de quince idiomas con conversaciones que duran más de una hora. Si quieres escuchar cómo suena la Gemini Live API cuando un equipo de producto ajusta cada parámetro para un solo trabajo, los primeros diez minutos son gratis. Y si estás eligiendo una app en vez de un modelo, comparamos todo el panorama en las mejores apps de IA para practicar conversación en un idioma.

Mintza está disponible para iOS y Android.