2026 年最適合拿來打造產品的即時語音 AI 模型,是 Google 的 Gemini Live API:音訊 token 大約是 OpenAI 輸入價的十分之一,支援 97 種語言,實測的首段音訊回應速度最快。OpenAI 的 GPT-Live 是最出色的純對話,但它沒有 API。以下是一份誠實的比較,來自正式環境的實戰經驗。
為什麼你可以信這份比較
這個月你會看到的每一份語音 AI 模型排名,都是讀完發布文章的人寫的。這一份,是由一個每個月都要付一張語音模型帳單的團隊寫的。我們的語言對話 App Mintza,在正式環境跑的就是 Gemini Live API:真實使用者、十五種語言、動輒超過一小時的工作階段。這是一種偏好,我們一開始就先講明。這也正是為什麼我們知道這些模型實際上會在哪裡出狀況,而那恰恰是發布文章略過的部分。
所以這份比較會承認證據所指出、OpenAI 做得更好的地方,會照著官方計價頁面印出價格,並告訴你把這類模型規模化跑起來,實際上是怎麼一回事。
GPT-Live 對上 Gemini Live:兩種不同的產品
大多數人搜尋的那組比較,其實搞錯了類別,而把這一點釐清,就已經是這篇文章的一半。
GPT-Live 是 OpenAI 在 2026 年 7 月 8 日推出、作為 ChatGPT 全新語音模式的一款消費者產品。它確實令人驚豔:真正的全雙工音訊,意思是它一邊聽、一邊說,用它自己系統卡的話說,它會在當下判斷該回應、還是繼續聽。這份清單上沒有別的東西做得到這件事。但你沒辦法拿它來打造產品。截至 2026 年 7 月下旬,並沒有 GPT-Live API,只有一份表單,讓你在它問世時收到通知。同一份系統卡也坦白承認,GPT-Live 會把困難的查詢轉交給文字模型,而 GPT-Live-1 和它的 mini 版本,在幾項智慧評測上都不如 GPT-5.5 Thinking。OpenAI 也沒有為它公布支援語言清單;TechCrunch 就報導過,OpenAI 自家的印地語示範遭到口音方面的批評。
OpenAI 真正提供給開發者的,是 Realtime API,目前是 gpt-realtime-2.1 和一個 mini 版本。它是個很強的產品:原生語音對語音,支援 WebRTC、WebSocket 與 SIP。但它採用輪流發言搭配語意式語音活動偵測,並非全雙工,而且工作階段上限 60 分鐘。讓 GPT-Live 感覺像真人的那份魔法,恰恰是你租不到的那一部分。
Gemini Live API 的形狀正好相反:完整的產品就是那個 API。Google 交到開發者手上的,就是 Google 手上有的。
Google Gemini Live API:你真的能拿來打造產品的模型
Google 在 2026 年 3 月 26 日發表 Gemini 3.1 Flash Live,稱它是至今品質最高的音訊與語音模型,在為語音驅動的工具使用而設的 ComplexFuncBench Audio 上拿到 90.8%,並在生成音訊上加了 SynthID 浮水印。對開發者真正要緊的數字,都寫在文件裡:
- 價格。 根據官方計價頁面,音訊輸入每百萬 token 3.00 美元、音訊輸出每百萬 token 12.00 美元。有免費方案,所以你不必先付帳單就能做原型。有一點來自實戰的誠實提醒:別把這些 token 價格換算成每分鐘數字,就當成你的成本。一場即時工作階段還會為每一輪重送的對話脈絡以及任何思考 token 計費,所以一場真實對話的每分鐘成本,會明顯高過單純的音訊 token 算術。它依然是每分鐘幾分錢,依然只是 OpenAI 費率的一小部分,但你的預算要抓自實測過的工作階段,而不是抓自那張計價表。
- 語言。 Live API 文件列出支援 97 種語言,而且這個模型天生就是多語的:它能在句子中途切換語言,這件事比你想像的更重要,我們稍後會再回來談。
- 控制。 自動語音活動偵測,靈敏度和靜默時長都可設定,也可以完全手動輪流發言。插話會取消生成。30 種聲音。
- 工作階段。 誠實的細節得寫在小字裡:不做脈絡壓縮的話,音訊工作階段上限 15 分鐘,而且每一條連線大約每 10 分鐘就會輪替一次,並先送出一個 GoAway 警告。工作階段續接和脈絡窗壓縮,就是文件給出的解法,而且它們管用;我們正式環境的工作階段能跨越好幾條輪替過的連線,一路跑到超過一小時。
有兩點但書,換作別人來寫這篇,我們也會希望對方講清楚。目前的模型 gemini-3.1-flash-live-preview 是預覽狀態,不是正式版。另外,2.5 原生音訊生成裡的兩項富表現力功能,情感對話和主動音訊,在 3.1 Flash Live 上並不支援。
xAI Grok Voice:帳單最單純的挑戰者
Grok Voice 是很有意思的第三個選項,也是唯一一個你能在腦中直接算出帳的:不管那一分鐘裡有多少是語音,都是統一的每分鐘 0.05 美元、每小時 3 美元。它是個真正的語音對語音 API,grok-voice-latest,採用伺服器端語音活動偵測,還有一項真正拉開差距的功能:用 120 秒音訊做聲音複製。它提供兩打以上的聲音,涵蓋 25 種以上語言。
統一計價很容易讓人喜歡,也很容易讓人誤判。一個對話產品絕大多數分鐘都花在聆聽上,而聆聽正是 Gemini 計費表上便宜的那半邊。在一般的收發比之下,Gemini 算起來會比每分鐘 0.05 美元便宜不少。但如果你的工作階段又短又密,Grok 的算術就令人耳目一新地誠實,而它的評測分數,你接下來就會看到,也絕不是什麼安慰獎。
Amazon Nova 2 Sonic:企業電話語音這一手
Amazon 的 Nova 2 Sonic 是 Bedrock 上一個統一的語音對語音模型,脈絡窗達一百萬 token,電話語音方面的整合也是這群裡最深的:與 Amazon Connect 和 Twilio 整合,這正是客服中心團隊想聽到的。它列出 7 種語言,是這裡涵蓋最窄的。如果你的語音產品是一條打進企業的電話線,Nova 2 Sonic 值得列入名單。如果它要走任何多語路線,那就不是了。
Claude,以及開源這一角
兩則誠實的註腳。Anthropic 的 Claude 有一個消費者語音模式,但它走的是語音轉文字、文字、文字轉語音的流程,只有一小組預設聲音和 18 種語言,也沒有即時語音 API。想打造產品的人可以略過。
開源的進度,比多數人以為的更靠前。Kyutai 的 Moshi 是一個真正全雙工的開源模型,實務延遲約 200 毫秒;Qwen3-Omni 則為一個端到端的全模態模型提供了開放權重。兩者都沒有那些商用 API 的成熟度,但如果你的限制是得跑在自己的硬體上,這個選項是存在的。
評測怎麼說,包括對 OpenAI 有利的那一段
最有用的第三方資料,是 Artificial Analysis 語音對語音指數,它綜合了語音推理、對話節奏和代理式工具使用。要整份讀,不要挑著看:
- 整體綜合分: 高推理模式下的 GPT-Realtime-2 以 77.2% 領先,Grok Voice Think Fast 以 75.7 緊追,高推理模式下的 Gemini 3.1 Flash 落在 69.5。綜合分是 OpenAI 贏。我們早說了這不會是一篇捧場文。
- 語音推理: 頂端基本上是三強平手。Grok 拿 97.1%,GPT-Realtime-2 和 Gemini 3.1 Flash 都是 97。在音訊之上的智慧,如今在三強之間已是基本門檻。
- 對話節奏: 這正是 OpenAI 真正稱霸的地方。在 Full Duplex Bench 上,OpenAI 的模型拿到 95.2 到 95.7%,對上 Gemini 的 74.3 和 Grok 的 77.8。那些讓 OpenAI 語音感覺像真人的自然插話、附和聲和輪流發言,是真的,也被量測出來了,不是行銷話術。
- 延遲: 實測首段音訊最快的,屬於 Google。Gemini 2.5 Flash Native Audio 在 0.63 秒內回應,領先 Grok 的 0.78。在一場對話裡,先開口的那個模型感覺比較聰明。
有一點但書,評測發布方自己會講,我們也再說一遍:這些量的是那些有 API 的模型。GPT-Live 本身沒辦法拿來評測,因為根本沒有 API 可測。業界最好的對話節奏,目前是消費端專屬的。
所以,誠實的成績單是:OpenAI 贏了對話節奏和綜合分。Gemini 在價格上贏了好幾倍,在語言數上贏了好幾倍,贏了實測的首段音訊延遲,也在與所有人平等的條件下贏在開發者取用。哪一組勝利要緊,完全看你在打造什麼。
我們把 Gemini Live 跑在正式環境學到的事
這是別的排名寫不出來的一節,所以我們會講得很具體。Mintza 把 Gemini Live 跑在一個 Go 寫的 WebSocket 代理後面,工作階段動輒超過一小時。
那個 10 分鐘的連線輪替是真的,而且撐得過去。 Gemini 大約每 10 分鐘就輪替一次 WebSocket 連線,並先送出一個 GoAway 警告。我們的後端會用工作階段續接控制碼,在對話進行中無縫重連,使用者完全察覺不到。一堂一小時的課,安安靜靜地橫跨六條左右的連線。如果你的架構假設一場對話配一個 socket,這會是第一個垮掉的地方。
語音活動偵測是一個產品決策,不是一個預設值。 Gemini 讓你設定,一段靜默要維持多久,模型才判斷你講完了。文件建議設在一秒以下。我們刻意把它拉長到那個值的好幾倍,因為一個語言學習者停下來找一個詞,並不代表他講完了,而一個一逮到停頓就撲上來的老師,是一個學生會退掉的老師。一個通用助理想要俐落的輪流發言;一個學習產品想要耐心。就這一個參數,造成了差別,而正是 Gemini 的 VAD 可設定性,讓這變成一個設定選項,而不是一次重寫。
有時候你得繞著模型做工程。 有耐心的 VAD 是有代價的:一個學生一口氣講出一段流利的長獨白,永遠不會停頓夠久、把發言權交出去,而我們發現了一個文件沒寫的上限,一個沒被提交的單一發言,最終會把連線給殺掉。我們的解法:在一段長而不斷的說話之後,後端會把幾秒的靜音音訊接進音訊串流裡,VAD 看到這個人造的停頓,老師就回應到目前為止說過的一切,學生則毫無損失地接著講下去。正式環境的語音 AI 滿是這類變通做法。要把它們算進預算裡。
我們是刻意選了半雙工。 Mintza 在老師說話時會把麥克風靜音,因為手機上的回音消除並不可靠,而一個聽得到自己聲音的模型,會對著自己講話。我們刻意用插話換取音訊的清晰。這也是為什麼 Full Duplex Bench,這個 Gemini 輸得最慘的評測,對我們的使用情境幾乎無關緊要:我們是刻意把插話關掉的。你的評測權重應該跟著你的產品走,而不是跟著排行榜走。
長工作階段需要脈絡管理。 一場超過一小時的對話會撐爆脈絡窗,所以我們仰賴 Gemini 的脈絡壓縮,而我們的系統提示由五層組成:基礎人格、語言老師人格、程度行為、課程,以及使用者知識。這個角色設定會撐過整場工作階段和每一條輪替過的連線。一小時裡的那份連貫,是規格表上不會列出的一項能力。
語言和價格,就是整個商業模式。 Mintza 在單一模型上,雙向教十五種語言、210 種組合,因為 Gemini 的多語品質夠一致到值得信賴,而且模型能在句子中途切換語言,這正是我們那套雙語救援得以成立的原因:當你卡住時,老師會切進你的母語,再把你帶回來。而在 Gemini 的音訊費率下,一分鐘對話只花幾分錢,這正是為什麼在消費者價位上,賣一個月 180 到 600 個口說分鐘的月方案是站得住腳的。若輸入成本是十倍,這個產品就不會存在。
即時語音模型讓什麼成為可能
這一類模型之所以要緊,在於它解鎖的那一整片產品,而每一種都在拉扯不同的面向:
- 語言口說練習。 我們這一款。它拉扯的是語言、規模化下的價格、有耐心的輪流發言,以及長工作階段裡角色設定的穩定。我們在ChatGPT 能教會你開口說一種語言嗎?裡寫過這件事消費端的那一面。
- 語言以外的家教與教育。 同一套長工作階段、有耐心聆聽的樣貌,再加上為練習和進度所需的工具使用。
- 客服與電話語音。 拉扯的是 SIP 和電話系統的底層接線,這正是為什麼有 OpenAI 的 SIP 支援,以及 Nova 2 Sonic 對 Amazon Connect 和 Twilio 的整合。
- 無障礙與即時翻譯。 為無法使用螢幕的人所設的語音優先介面,以及即時翻譯,Google 和 OpenAI 在這方面都推出了專門的模型變體。
- 陪伴與日常助理。 唯一一個對話節奏本身就是產品的類別,這也是為什麼 OpenAI 用 GPT-Live 展示的那份全雙工自然感,在這裡格外要緊。
「最好」是一個看工作而定的函數。一個陪伴 App 應該把 Full Duplex Bench 的權重放很重。一個電話語音產品應該把整合能力放重。一個規模化的教育產品應該把語言、價格和 VAD 控制放重,而那份工作,正是我們碰巧從裡到外都熟的那一份,也正是 Gemini 決定性勝出的那一份。
結論
如果你今天要打造一個真正的產品,尤其是一個多語的產品,Gemini Live API 是 2026 年最好的即時語音 AI 模型:音訊輸入比 OpenAI 的 Realtime API 便宜一個數量級,97 種語言對上其他人的區區幾十種,實測首段音訊最快,一開始就有免費方案可用,還有讓語音行為成為產品決策的可設定性。OpenAI 打造出業界最自然的對話,卻把它鎖在 ChatGPT 裡;它的 Realtime API 很優秀,但定價是給企業的。Grok Voice 是值得盯著看的挑戰者,有統一計價和聲音複製。Nova 2 Sonic 拿下客服中心。Claude 不在這場競賽裡。
我們是用最貴的方式得出這個結論的:靠著把產品建在它上面。Mintza 就是那個勝出的模型,跑在正式環境會長成的樣子,一位工作階段動輒超過一小時的十五語口說老師。如果你想聽聽看,當一個產品團隊為單一一份工作把每個參數都調過之後,Gemini Live API 聽起來是什麼樣子,前十分鐘免費。而如果你要挑的是一個 App,而不是一個模型,我們在最適合練習開口說一種語言的 AI App裡比較了整片場域。