Le meilleur modèle vocal IA en temps réel pour construire un produit en 2026 est la Gemini Live API de Google : des jetons audio à environ un dixième du prix d’entrée d’OpenAI, 97 langues prises en charge, et le temps jusqu’au premier audio le plus rapide mesuré. GPT-Live d’OpenAI offre la meilleure conversation à l’état brut, mais sans API. Voici la comparaison honnête, issue de l’expérience en production.
Pourquoi faire confiance à cette comparaison
Chaque classement de modèles vocaux IA que l’on trouve ce mois-ci a été écrit par quelqu’un qui a lu les articles de lancement. Celui-ci a été écrit par une équipe qui paye une facture de modèle vocal chaque mois. Mintza, notre application de conversation linguistique, tourne sur la Gemini Live API en production : de vrais utilisateurs, quinze langues, des sessions qui dépassent l’heure. C’est un biais, et il est assumé d’emblée. C’est aussi la raison pour laquelle ces modèles sont connus là où ils cassent vraiment, la partie que les articles de lancement omettent.
Cette comparaison reconnaît donc ce que les preuves montrent qu’OpenAI fait mieux, reprend les prix des pages officielles, et détaille ce qu’implique réellement le fonctionnement de l’un de ces modèles à grande échelle.
GPT-Live contre Gemini Live : deux types de produits différents
La comparaison la plus recherchée est une erreur de catégorie, et la clarifier constitue la moitié de cet article.
GPT-Live, qu’OpenAI a lancé le 8 juillet 2026 comme nouveau mode vocal de ChatGPT, est un produit grand public. Il est réellement impressionnant : audio full-duplex authentique, c’est-à-dire qu’il écoute et parle en même temps et, selon les mots de sa propre fiche système, décide sur l’instant s’il doit répondre ou continuer à écouter. Rien d’autre dans cette liste ne fait cela. Mais il est impossible d’y construire quoi que ce soit. Fin juillet 2026, il n’existe aucune API pour GPT-Live, seulement un formulaire pour être averti lorsqu’elle existera. Cette même fiche système reconnaît aussi franchement que GPT-Live délègue les requêtes complexes à des modèles textuels, et que GPT-Live-1 ainsi que sa variante mini sont moins performants que GPT-5.5 Thinking sur plusieurs évaluations d’intelligence. Et OpenAI ne publie aucune liste de langues prises en charge ; TechCrunch a rapporté des critiques sur l’accent de la propre démo hindi d’OpenAI.
Ce qu’OpenAI offre réellement aux développeurs, c’est la Realtime API, actuellement gpt-realtime-2.1 et une variante mini. C’est un produit solide : speech-to-speech natif, prise en charge de WebRTC, WebSocket et SIP. Mais il est tour par tour avec détection sémantique de l’activité vocale, pas full-duplex, et les sessions sont plafonnées à 60 minutes. La magie qui rend GPT-Live si humain est précisément la partie qu’on ne peut pas louer.
La Gemini Live API a la forme inverse : le produit complet, c’est l’API. Ce que Google livre aux développeurs, c’est exactement ce que Google possède.
Google Gemini Live API : le modèle sur lequel on peut vraiment construire
Google a annoncé Gemini 3.1 Flash Live le 26 mars 2026, le présentant comme son modèle audio et vocal de plus haute qualité à ce jour, avec 90,8 % sur ComplexFuncBench Audio pour l’utilisation d’outils pilotée par la voix et un filigrane SynthID sur l’audio généré. Les chiffres qui comptent pour un développeur figurent dans la documentation :
- Prix. Selon la page tarifaire officielle, l’audio en entrée coûte 3,00 $ par million de jetons et l’audio en sortie 12,00 $ par million. Un niveau gratuit permet de prototyper sans facture. Une précision honnête, tirée de l’expérience : il ne faut pas convertir ces prix par jeton en un coût à la minute et l’appeler son coût réel. Une session en direct facture aussi le contexte de la conversation renvoyé à chaque tour et les éventuels jetons de raisonnement, si bien que le coût réel à la minute d’une conversation dépasse sensiblement le calcul naïf sur les seuls jetons audio. Cela reste de l’ordre du centime par minute, et cela reste une fraction des tarifs d’OpenAI, mais il faut budgéter à partir de sessions mesurées, pas de la grille tarifaire.
- Langues. La documentation de la Live API liste 97 langues prises en charge, et le modèle est intrinsèquement multilingue : il peut changer de langue en pleine phrase, ce qui compte plus qu’on ne le pense et sur quoi on reviendra.
- Contrôle. Détection automatique de l’activité vocale avec sensibilités et durées de silence configurables, ou gestion des tours entièrement manuelle. L’interruption annule la génération. 30 voix.
- Sessions. La précision honnête : les sessions audio sont limitées à 15 minutes sans compression du contexte, et les connexions individuelles tournent environ toutes les 10 minutes avec un avertissement GoAway. La reprise de session et la compression de la fenêtre de contexte constituent la réponse documentée, et elles fonctionnent ; nos sessions en production dépassent l’heure à travers de nombreuses connexions renouvelées.
Deux réserves qu’on aimerait voir signalées si quelqu’un d’autre écrivait cet article. Le modèle actuel, gemini-3.1-flash-live-preview, est en statut preview, pas en disponibilité générale. Et deux fonctionnalités expressives de la génération audio native 2.5, le dialogue affectif et l’audio proactif, ne sont pas prises en charge sur 3.1 Flash Live.
xAI Grok Voice : le challenger à la facture la plus simple
Grok Voice est la troisième option intéressante, et la seule dont le prix se calcule de tête : un forfait fixe de 0,05 $ par minute, soit 3 $ de l’heure, quelle que soit la part de parole réelle dans cette minute. C’est une véritable API speech-to-speech, grok-voice-latest, avec détection de l’activité vocale côté serveur et une fonctionnalité réellement différenciante : clonage vocal à partir de 120 secondes d’audio. Elle propose plus de deux douzaines de voix et une couverture de plus de 25 langues.
Un tarif forfaitaire est facile à apprécier et facile à mal évaluer. Un produit de conversation passe la plupart de ses minutes à écouter, et l’écoute constitue la moitié la moins chère du compteur de Gemini. Sur des cycles d’utilisation typiques, Gemini revient nettement moins cher que 0,05 $ par minute. Mais si les sessions sont courtes et denses, l’arithmétique de Grok est d’une honnêteté rafraîchissante, et ses scores aux benchmarks, comme on va le voir, ne sont pas un lot de consolation.
Amazon Nova 2 Sonic : la carte entreprise de la téléphonie
Nova 2 Sonic d’Amazon est un modèle speech-to-speech unifié sur Bedrock, avec une fenêtre de contexte d’un million de jetons et l’offre téléphonique la plus complète du groupe : intégrations avec Amazon Connect et Twilio, exactement ce qu’une équipe de centre de contact souhaite entendre. Il liste 7 langues, la couverture la plus restreinte ici. Si le produit vocal visé est une ligne téléphonique vers une entreprise, Nova 2 Sonic fait partie de la sélection. S’il s’agit de quelque chose de multilingue, non.
Claude, et le coin open source
Deux notes de bas de page honnêtes. Claude d’Anthropic dispose d’un mode vocal grand public, mais il s’agit d’un pipeline speech-to-text, texte, text-to-speech avec un petit ensemble de voix prédéfinies et 18 langues, et il n’existe aucune véritable API vocale en temps réel. Les développeurs peuvent passer leur chemin.
L’open source est plus avancé qu’on ne le pense généralement. Moshi de Kyutai est un modèle open source réellement full-duplex avec une latence pratique d’environ 200 millisecondes, et Qwen3-Omni propose des poids ouverts pour un modèle omni-modal de bout en bout. Aucun des deux n’a le raffinement des API commerciales, mais si la contrainte est de tourner sur son propre matériel, l’option existe.
Ce que disent les benchmarks, y compris la partie qui favorise OpenAI
Les données tierces les plus utiles proviennent de l’Artificial Analysis Speech-to-Speech Index, un indice composite combinant raisonnement vocal, dynamique conversationnelle et utilisation agentique d’outils. Il faut le lire dans son intégralité, pas de façon sélective :
- Composite global : GPT-Realtime-2 en raisonnement élevé arrive en tête avec 77,2 %, Grok Voice Think Fast suit à 75,7, et Gemini 3.1 Flash en raisonnement élevé se situe à 69,5. OpenAI remporte le composite. Il avait été promis que cet article ne serait pas un éloge à sens unique.
- Raisonnement vocal : quasiment une égalité à trois en tête. Grok obtient 97,1 %, avec GPT-Realtime-2 et Gemini 3.1 Flash tous deux à 97. L’intelligence appliquée à l’audio est désormais un prérequis chez les trois grands.
- Dynamique conversationnelle : c’est là qu’OpenAI domine véritablement. Sur Full Duplex Bench, les modèles d’OpenAI obtiennent entre 95,2 et 95,7 % contre 74,3 pour Gemini et 77,8 pour Grok. Les interruptions naturelles, les signaux d’écoute et la gestion des tours de parole qui rendent la voix d’OpenAI si humaine sont réels et mesurés, pas du marketing.
- Latence : le temps jusqu’au premier audio le plus rapide mesuré revient à Google. Gemini 2.5 Flash Native Audio répond en 0,63 seconde, devant Grok à 0,78. Dans une conversation, le modèle qui commence à parler en premier paraît plus intelligent.
Une réserve que les éditeurs du benchmark eux-mêmes formulent, et qu’il faut répéter ici : ces mesures portent sur les modèles d’API. GPT-Live lui-même ne peut pas être mesuré, faute d’API à mesurer. La meilleure dynamique conversationnelle du secteur reste, pour l’instant, une exclusivité grand public.
Voici donc le bilan honnête : OpenAI remporte la dynamique conversationnelle et le composite. Gemini remporte le prix par un multiple, les langues par un multiple, la latence mesurée jusqu’au premier audio, et un accès pour développeurs à égalité avec tous les autres. L’ensemble de victoires qui compte dépend entièrement de ce que l’on construit.
Ce que la production de Gemini Live a appris à l’équipe
Voici la section qu’aucun autre classement ne peut écrire ; il faut donc être précis. Mintza fait tourner Gemini Live derrière un proxy WebSocket en Go, avec des conversations qui dépassent l’heure.
La rotation de connexion toutes les 10 minutes est bien réelle, et gérable. Gemini fait tourner les connexions WebSocket environ toutes les 10 minutes, en envoyant d’abord un avertissement GoAway. Le backend se reconnecte de façon transparente grâce aux identifiants de reprise de session, en pleine conversation, et l’utilisateur ne s’en aperçoit jamais. Une leçon d’une heure traverse silencieusement une demi-douzaine de connexions. Si une architecture suppose une seule connexion par conversation, c’est la première chose qui casse.
La détection de l’activité vocale est une décision produit, pas un réglage par défaut. Gemini permet de configurer la durée du silence nécessaire avant que le modèle ne conclue que l’utilisateur a fini de parler. La documentation suggère des valeurs inférieures à une seconde. Ce paramètre a été étiré à plusieurs fois cette valeur, délibérément, car un apprenant qui marque une pause pour chercher un mot n’a pas fini de parler, et un professeur qui saute sur chaque pause est un professeur que les élèves finissent par quitter. Un assistant générique veut des échanges rapides ; un produit d’apprentissage veut de la patience. Ce seul paramètre fait toute la différence, et seule la configurabilité du VAD de Gemini en a fait un réglage plutôt qu’une réécriture.
Il arrive de concevoir autour du modèle. Un VAD patient a un coût : un élève qui livre un long monologue fluide ne marque jamais de pause assez longue pour céder le tour de parole, et un plafond non documenté a été découvert, où un tour de parole unique jamais validé finit par tuer la connexion. La solution retenue : après un long passage ininterrompu de parole, le backend insère quelques secondes d’audio silencieux dans le flux, le VAD perçoit la pause fabriquée, le professeur répond à tout ce qui a été dit jusque-là, et l’élève poursuit sans rien perdre. La voix IA en production regorge de contournements de ce genre. Il faut les prévoir.
Le choix du half-duplex a été délibéré. Mintza coupe le microphone pendant que le professeur parle, car l’annulation d’écho sur les téléphones reste peu fiable, et un modèle qui s’entend lui-même finit par se parler à lui-même. La clarté audio a été privilégiée au détriment de l’interruption, délibérément. C’est aussi pourquoi Full Duplex Bench, le benchmark où Gemini perd le plus nettement, compte à peine pour cet usage : les interruptions ont été désactivées par conception. La pondération d’un benchmark devrait suivre le produit, pas le classement.
Les sessions longues exigent une gestion du contexte. Une heure de conversation ferait déborder la fenêtre de contexte, d’où le recours à la compression de contexte de Gemini, et le prompt système est composé de cinq couches : personnalité de base, personnalité de professeur de langue, comportement selon le niveau, leçon, et connaissance de l’utilisateur. La persona reste cohérente sur toute la session et à travers chaque connexion renouvelée. Cette cohérence sur une heure est une capacité qu’aucune fiche technique ne mentionne.
Langues et prix constituent tout le modèle économique. Mintza enseigne quinze langues dans n’importe quelle direction, 210 combinaisons, sur un seul modèle, car la qualité multilingue de Gemini est suffisamment homogène pour lui faire confiance, et le modèle peut changer de langue en pleine phrase, ce qui rend possible le secours bilingue : le professeur bascule dans la langue maternelle de l’utilisateur en cas de blocage, puis le ramène. Et aux tarifs audio de Gemini, une minute de conversation coûte quelques centimes, ce qui rend viable la vente de forfaits mensuels de 180 à 600 minutes parlées à des prix grand public. À dix fois le coût d’entrée, ce produit n’existerait pas.
Ce que rendent possible les modèles vocaux en temps réel
Cette classe de modèle compte en raison de l’éventail de produits qu’elle débloque, et chacun sollicite une dimension différente :
- Pratique orale des langues. Notre cas d’usage. Il sollicite les langues, le prix à grande échelle, une gestion patiente des tours de parole, et la stabilité de la persona sur de longues sessions. Le volet grand public de ce sujet a été traité dans ChatGPT peut-il vous apprendre à parler une langue ?
- Tutorat et éducation au-delà des langues : le même profil de sessions longues et d’écoute patiente, plus l’utilisation d’outils pour les exercices et le suivi des progrès.
- Support client et téléphonie. Cela sollicite l’infrastructure SIP et téléphonique, ce qui explique la prise en charge SIP d’OpenAI et les intégrations d’Amazon Connect et de Twilio par Nova 2 Sonic.
- Accessibilité et traduction en direct. Des interfaces centrées sur la voix pour les personnes qui ne peuvent pas utiliser d’écran, et la traduction en temps réel, où Google comme OpenAI proposent des variantes de modèle dédiées.
- Compagnonnage et assistants du quotidien. La seule catégorie où la dynamique conversationnelle est le produit lui-même, ce qui explique pourquoi le naturel full-duplex démontré par OpenAI avec GPT-Live y compte tant.
« Meilleur » dépend entièrement de l’usage. Une application de compagnonnage devrait fortement pondérer Full Duplex Bench. Un produit de téléphonie devrait pondérer les intégrations. Un produit éducatif à grande échelle devrait pondérer les langues, le prix et le contrôle du VAD, et cet usage précis, celui que l’équipe connaît de l’intérieur, est celui que Gemini remporte nettement.
Le verdict
Pour qui construit un véritable produit aujourd’hui, en particulier multilingue, la Gemini Live API est le meilleur modèle vocal IA en temps réel en 2026 : un ordre de grandeur moins cher sur l’audio en entrée que la Realtime API d’OpenAI, 97 langues contre les dizaines des autres, le premier audio mesuré le plus rapide, un niveau gratuit pour démarrer, et la configurabilité nécessaire pour faire du comportement vocal une décision produit. OpenAI a construit la conversation la plus naturelle du secteur et l’a enfermée dans ChatGPT ; sa Realtime API est excellente mais tarifée pour les entreprises. Grok Voice est le challenger à surveiller, avec sa tarification forfaitaire et son clonage vocal. Nova 2 Sonic règne sur le centre de contact. Claude n’est pas dans cette course.
Ce verdict a été atteint par la voie coûteuse : en construisant dessus. Mintza montre à quoi ressemble le modèle gagnant en production, un professeur de conversation en quinze langues avec des sessions qui dépassent l’heure. Pour entendre à quoi ressemble la Gemini Live API lorsqu’une équipe produit ajuste chaque paramètre pour un seul objectif, les dix premières minutes sont gratuites. Et pour choisir une application plutôt qu’un modèle, l’ensemble du terrain a été comparé dans les meilleures applications IA pour pratiquer l’oral.