2026 年最适合拿来搭产品的实时语音 AI 模型是谷歌的 Gemini Live API:音频 token 价格大约只有 OpenAI 输入价的十分之一,支持 97 种语言,首次出声延迟实测最快。OpenAI 的 GPT-Live 是最好的纯对话体验,但它没有 API。下面是实话实说的横评,出自生产环境里的一线经验。
你为什么可以信这份横评
这个月你能看到的每一份语音 AI 模型排名,都是有人读完发布稿写出来的。这一份,是一支每个月都要付语音模型账单的团队写的。Mintza 是我们的语言对话应用,它在生产环境里跑的就是 Gemini Live API:真实用户、十五种语言、单次会话时长超过一小时。这是一种偏向,我们先摆在明面上。这也正是我们知道这些模型到底会在哪里出问题的原因,而这恰恰是发布稿避而不谈的那部分。
所以这份横评会承认证据表明 OpenAI 做得更好的地方,会照抄官方定价页上的价格,也会告诉你把其中一个模型跑到规模化,实际上意味着什么。
GPT-Live 对比 Gemini Live:两类不同的产品
大多数人搜索的那个对比,其实是把两个类别搞混了,把这一点讲清楚,就等于讲清了半篇文章。
GPT-Live 是 OpenAI 于 2026 年 7 月 8 日推出的 ChatGPT 新版语音模式,它是一个消费级产品。它确实令人印象深刻:真正的全双工音频,也就是一边听一边说,用它自己的系统卡里的话说,每时每刻自行决定是回应还是继续听。这份榜单上没有别的模型能做到这一点。但你没法基于它开发。截至 2026 年 7 月下旬,GPT-Live 还没有 API,只有一个表单,供你在 API 面世时收到通知。同一份系统卡也坦白:GPT-Live 会把难题转交给文本模型处理,而且在多项智能评测里,GPT-Live-1 及其 mini 版本都不如 GPT-5.5 Thinking。OpenAI 也没有为它公布支持的语言清单;TechCrunch 报道过,有人批评 OpenAI 自家印地语演示的口音。
OpenAI 真正给开发者的,是 Realtime API,目前是 gpt-realtime-2.1 和一个 mini 版本。这是个很强的产品:原生语音到语音,支持 WebRTC、WebSocket 和 SIP。但它采用基于语义的语音活动检测、按轮次进行,不是全双工,而且单次会话上限 60 分钟。让 GPT-Live 感觉像真人的那份魔力,恰恰是你租不到的那部分。
Gemini Live API 是相反的形态:完整的产品就是 API。谷歌交给开发者的,就是谷歌手里的全部。
谷歌 Gemini Live API:你真正能拿来搭产品的模型
谷歌在 2026 年 3 月 26 日发布了 Gemini 3.1 Flash Live,称它是迄今音质和语音质量最高的模型,在面向语音驱动工具调用的 ComplexFuncBench Audio 上拿到 90.8%,并对生成的音频加了 SynthID 水印。对一个开发者真正重要的数字,都写在文档里:
- 价格。 根据官方定价页,音频输入每百万 token 3.00 美元、音频输出每百万 12.00 美元。有免费额度,所以你做原型不用付一分钱。有一条来自经验的实话:别把这些 token 价折算成每分钟数字,就当成自己的成本。一场实时会话还要为每一轮重新发送的对话上下文以及思考 token 付费,所以一场真实对话的每分钟成本,会明显高于单看音频 token 那点朴素算法。它仍然是每分钟几美分,仍然只是 OpenAI 费率的一个零头,但要按实测会话来做预算,而不是照着价目表来。
- 语言。 Live API 文档列出支持 97 种语言,而且模型本身就是多语言的:它能在句子中途切换,这一点的重要性超乎你的想象,后面我们还会回到它。
- 控制。 自动语音活动检测,灵敏度和静音时长都可配置,也可以完全手动控制轮次。插话会取消当前生成。30 个声音。
- 会话。 实话实说的细则:在不做上下文压缩的情况下,音频会话被限制在 15 分钟以内,而且单个连接大约每 10 分钟轮换一次,之前会先发出 GoAway 警告。会话续接和上下文窗口压缩就是文档给出的解法,而且确实有用;我们生产环境里的会话能跑超过一小时,横跨多次轮换的连接。
有两点,换成别人来写我们也会希望被披露出来。当前的模型 gemini-3.1-flash-live-preview 是预览状态,不是正式发布。另外,2.5 原生音频生成里的两项富有表现力的特性,情感对话和主动音频,在 3.1 Flash Live 上不支持。
xAI Grok Voice:账单最简单的挑战者
Grok Voice 是很有意思的第三选择,也是唯一一个定价能在脑子里算出来的:统一价每分钟 0.05 美元,每小时 3 美元,不管这一分钟里有多少是语音。它是一个真正的语音到语音 API,grok-voice-latest,带服务端语音活动检测,还有一个真正拉开差距的特性:用 120 秒音频克隆声音。它提供两打以上的声音,覆盖 25 种以上语言。
统一定价既让人喜欢,也容易看走眼。一个对话产品,大部分时间都花在听上,而听正是 Gemini 计费里便宜的那一半。在典型的占空比下,Gemini 算下来会明显比每分钟 0.05 美元更便宜。但如果你的会话又短又密,Grok 的算账方式就清爽得让人省心,而且它的跑分成绩,你马上就会看到,绝不是什么安慰奖。
亚马逊 Nova 2 Sonic:面向企业电话场景的一手
亚马逊的 Nova 2 Sonic 是 Bedrock 上一个统一的语音到语音模型,带一百万 token 的上下文窗口,也拥有这组模型里最深的电话场景故事:与 Amazon Connect 和 Twilio 打通,这正是一支呼叫中心团队想听到的。它列出 7 种语言,是这里覆盖面最窄的。如果你的语音产品是一条打进企业的电话线,Nova 2 Sonic 值得进入候选名单。如果它要多语言,那就不用考虑了。
Claude,以及开源那一角
两条实话实说的脚注。Anthropic 的 Claude 有一个消费级语音模式,但它是一条语音转文字、文本、文字转语音的流水线,只带一小组预设声音和 18 种语言,也没有实时语音 API。开发者可以直接跳过。
开源的进度比大多数人以为的要靠前。Kyutai 的 Moshi 是一个真正全双工的开源模型,实际延迟在 200 毫秒上下,而 Qwen3-Omni 为一个端到端的全模态模型提供了开放权重。两者都没有商用 API 那份打磨过的成色,但如果你的约束是要跑在自己的硬件上,这条路是有的。
跑分怎么说,包括对 OpenAI 有利的那部分
最有用的第三方数据是 Artificial Analysis 语音到语音榜单,它是语音推理、对话动态和智能体工具调用的综合分。要整体地读,别挑着读:
- 综合总分: GPT-Realtime-2 在高推理档以 77.2% 领先,Grok Voice Think Fast 以 75.7 紧随其后,Gemini 3.1 Flash 在高推理档为 69.5。综合分是 OpenAI 赢。我们说过这不会是一篇捧场文。
- 语音推理: 榜首基本是三家打平。Grok 得 97.1%,GPT-Realtime-2 和 Gemini 3.1 Flash 都是 97。在音频之上的智能水平,如今在三巨头之间已是入场门槛。
- 对话动态: 这里是 OpenAI 真正碾压的地方。在 Full Duplex Bench 上,OpenAI 的模型拿到 95.2% 到 95.7%,对上 Gemini 的 74.3 和 Grok 的 77.8。那些让 OpenAI 语音感觉像真人的自然插话、随声附和和轮次切换,是真实的、被测量过的,不是营销话术。
- 延迟: 首次出声实测最快的是谷歌。Gemini 2.5 Flash Native Audio 在 0.63 秒内开口,领先于 Grok 的 0.78。在一场对话里,先开口的那个模型让人觉得更聪明。
榜单发布方提了一条告诫,我们在这里重复一遍:这些测的都是 API 模型。GPT-Live 本身没法跑分,因为根本没有 API 可测。业界最好的对话动态,眼下是消费端独占。
所以实话实说的成绩单是:OpenAI 赢下对话动态和综合分。Gemini 在价格上赢出一个量级,在语言数量上赢出一个量级,赢下实测首次出声延迟,也在跟所有人平等的条件下赢下开发者可用性。哪一组胜利更重要,完全取决于你要做的是什么。
把 Gemini Live 跑在生产环境里,我们学到了什么
这一节是别的排名写不出来的,所以我们会讲得很具体。Mintza 在一个 Go 写的 WebSocket 代理后面跑 Gemini Live,单次会话时长超过一小时。
10 分钟的连接轮换是真的,但扛得住。 Gemini 大约每 10 分钟轮换一次 WebSocket 连接,之前会先发 GoAway 警告。我们的后端用会话续接句柄在对话中途透明地重连,用户毫无察觉。一堂一小时的课,就这么悄悄横跨了六七个连接。如果你的架构假设一场对话对应一个 socket,这会是第一个崩掉的地方。
语音活动检测是一个产品决策,不是一个默认值。 Gemini 让你配置:一段静音要持续多久,模型才判定你说完了。文档建议用一秒以内的值。我们特意把它拉长到那个值的好几倍,因为一个语言学习者停下来找词,并不代表他说完了,而一位一逮到停顿就抢话的老师,是学生会弃用的老师。一个通用助手想要利落的轮次切换;一个学习产品想要耐心。就这一个参数,决定了差别,而只有 Gemini 那种可配置的 VAD,才让它成了一个设置项,而不是一次重写。
有时候你得绕着模型做工程。 耐心的 VAD 是有代价的:一个学生一口气流利地长篇独白,从不停顿够久来交出发言权,而我们发现了一个文档没写的上限,一个迟迟不提交的轮次,最终会把连接杀掉。我们的解法是:在一段不间断的长时间说话之后,后端往音频流里拼进几秒的静音,VAD 看到这个人造的停顿,老师对目前说过的所有内容做出回应,学生则继续说下去,什么都没丢。生产环境里的语音 AI 满是这种绕行方案。给它们留出预算。
我们是故意选了半双工。 Mintza 在老师说话时把麦克风静音,因为手机上的回声消除并不可靠,而一个听得见自己声音的模型会跟自己说话。我们特意用插话能力换来了音频清晰度。这也是为什么 Full Duplex Bench,那个 Gemini 输得最惨的跑分项,对我们的使用场景几乎无所谓:我们是有意关掉了插话。你的跑分权重应该跟着你的产品走,而不是跟着排行榜走。
长会话需要上下文管理。 一场超过一小时的对话会撑爆上下文窗口,所以我们靠 Gemini 的上下文压缩,而我们的系统提示词由五层组成:基础人设、语言老师人设、水平行为、课程,以及用户信息。这个角色人设在整场会话、在每一次轮换的连接里都保持一致。这种跨越一小时的连贯性,是参数表上不会列出来的能力。
语言和价格,就是整个商业模式。 Mintza 双向教十五种语言,210 个方向组合,都跑在同一个模型上,因为 Gemini 的多语言质量足够均匀、值得信任,而且模型能在句子中途切换语言,这正是我们那套双语救援得以成立的原因:当你卡壳时,老师会切进你的母语,然后再把你带回来。而按 Gemini 的音频费率,一分钟对话只花几美分,这正是让每月 180 到 600 语音分钟的套餐能以消费级价格卖得动的原因。如果输入成本是十倍,这个产品根本不会存在。
实时语音模型能带来什么
这一类模型之所以重要,是因为它能解锁的产品之广,而每一种产品都在拷问一个不同的维度:
- 语言口语练习。 我们的场景。它拷问的是语言数量、规模化下的价格、耐心的轮次切换,以及长会话里角色人设的稳定性。这件事在消费端的那一面,我们写在了ChatGPT 能教会你开口说一门语言吗?
- 语言以外的辅导和教育: 同样是长会话、耐心倾听的画像,再加上做练习和记录进度所需的工具调用。
- 客户支持和电话场景。 拷问的是 SIP 和电话系统那套底层管道,这正是 OpenAI 的 SIP 支持、Nova 2 Sonic 与 Amazon Connect 和 Twilio 的打通之所以存在的原因。
- 无障碍和实时翻译。 面向无法使用屏幕的人的语音优先界面,以及实时翻译,谷歌和 OpenAI 都为此推出了专门的模型变体。
- 陪伴和日常助手。 这是唯一一个把对话动态本身当作产品的类别,也正因如此,OpenAI 用 GPT-Live 展示的那种全双工自然感,在这里格外重要。
“最好”是一个随任务而变的函数。一个陪伴应用应该给 Full Duplex Bench 很高的权重。一个电话产品应该给集成能力很高的权重。一个规模化的教育产品应该给语言、价格和 VAD 控制很高的权重,而这个任务,恰好是我们从内部熟知的那个,也正是 Gemini 决定性胜出的那个。
结论
如果你今天要做一个真正的产品,尤其是多语言的产品,Gemini Live API 是 2026 年最好的实时语音 AI 模型:音频输入价比 OpenAI 的 Realtime API 便宜一个量级,97 种语言对上别人的几十种,实测首次出声最快,有免费额度可以起步,还有让你把语音行为变成产品决策的可配置性。OpenAI 造出了业界最自然的对话,却把它锁在了 ChatGPT 里;它的 Realtime API 很出色,但价格是给企业定的。Grok Voice 是值得关注的挑战者,有统一定价和声音克隆。Nova 2 Sonic 拿下了呼叫中心。Claude 不在这场竞赛里。
我们是用最费钱的方式得出这个结论的:把它拿来搭产品。Mintza 就是那个胜出的模型跑在生产环境里的样子,一位教十五种语言、单次会话时长超过一小时的口语老师。如果你想听听一支产品团队为一件事把每个参数都调到位之后,Gemini Live API 到底是什么声音,前十分钟免费。而如果你要选的是一款应用,而不是一个模型,我们在最好的几款练口语 AI 应用里把整个赛场都比了一遍。