2026年、製品を作るためのリアルタイム音声AIモデルとして最良なのはGoogleのGemini Live APIです。音声トークンはOpenAIの入力価格のおよそ10分の1、対応言語は97、そして最初の音声までの時間は実測で最速です。OpenAIのGPT-Liveは生の会話としては最良ですが、APIがありません。本番運用の経験から、正直に比較します。
この比較を信頼していい理由
今月あなたが目にする音声AIモデルのランキングは、どれも公開時の発表記事を読んだ人が書いたものです。この記事は、毎月音声モデルの請求書を支払っているチームが書きました。私たちの言語会話アプリMintzaは、本番でGemini Live APIの上で動いています。実在のユーザー、15言語、1時間を超えるセッションです。それはバイアスであり、最初にはっきり申告しておきます。それはまた、これらのモデルが実際にどこで壊れるのかを私たちが知っている理由でもあります。発表記事が省く部分です。
そこでこの比較では、証拠が示すかぎりOpenAIが優れている点を認め、公式の価格ページから価格を載せ、これらのモデルの一つを大規模に動かすとは実際どういうことかをお伝えします。
GPT-Live対Gemini Live:2種類の異なる製品
多くの人が検索するこの比較は、そもそもカテゴリーの取り違えであり、それを解きほぐすことが記事の半分です。
OpenAIが2026年7月8日にChatGPTの新しい音声モードとして公開したGPT-Liveは、消費者向け製品です。本当に見事な出来です。真の全二重方式で、聞くことと話すことを同時にこなし、自らのシステムカードの言葉を借りれば、応答するか聞き続けるかをその場で判断します。このリストの中でそれができるのは他にありません。ですが、その上に何かを作ることはできません。2026年7月下旬時点でGPT-LiveのAPIはなく、あるのはAPIができたときに通知を受け取るためのフォームだけです。同じシステムカードは、GPT-Liveが難しい問い合わせをテキストモデルに委ねること、そしてGPT-Live-1とそのmini版が複数の知能評価においてGPT-5.5 Thinkingより能力が劣ることも、率直に認めています。しかもOpenAIはこれについて対応言語一覧を公開しておらず、TechCrunchはOpenAI自身のヒンディー語デモに対するアクセントへの批判を報じました。
OpenAIが実際に開発者に提供しているのはRealtime APIで、現行はgpt-realtime-2.1とそのmini版です。これは強力な製品です。ネイティブな音声対音声で、WebRTC、WebSocket、SIPに対応します。ですが、意味論的な音声アクティビティ検出を用いるターン制で全二重ではなく、セッションは60分で頭打ちになります。GPT-Liveを人間らしく感じさせるあの魔法こそ、借りることのできない部分なのです。
Gemini Live APIは正反対のかたちです。製品のすべてがAPIです。Googleが開発者に届けるものが、Googleの持っているものそのものなのです。
Google Gemini Live API:実際にその上に作れるモデル
Googleは2026年3月26日にGemini 3.1 Flash Liveを発表し、これまでで最高品質のオーディオおよび音声モデルだとしました。音声駆動のツール利用を測るComplexFuncBench Audioで90.8パーセント、そして生成された音声にはSynthIDの電子透かしが入ります。作り手にとって重要な数字は、ドキュメントの中にあります。
- 価格。 公式の価格ページによれば、音声入力は100万トークンあたり$3.00、音声出力は100万あたり$12.00です。無料枠があるので、請求書なしで試作できます。経験からの正直な注意が一つあります。これらのトークン価格を1分あたりの数字に換算して、それを自分のコストと呼ばないでください。ライブセッションでは、ターンごとに送り直される会話のコンテキストと思考トークンにも課金されるため、実際の会話の1分あたりコストは、素朴な音声トークンの計算よりもかなり上に着地します。それでも1分あたり数セントで、OpenAIのレートのごく一部であることに変わりはありませんが、予算は価格表からではなく、実測したセッションから見積もってください。
- 対応言語。 Live APIのドキュメントには97の対応言語が載っており、モデルは本質的に多言語対応です。文の途中でも言語を切り替えられます。これは思っている以上に効いてくるので、あとで戻ってきます。
- 制御。 感度と無音の長さを設定できる自動の音声アクティビティ検出か、完全に手動のターン制御か。バージインは生成を打ち切ります。30種類の声があります。
- セッション。 正直な但し書きです。音声セッションはコンテキスト圧縮なしでは15分に制限され、個々の接続はおよそ10分ごとにGoAway警告を伴って切り替わります。ドキュメントに記された答えがセッション再開とコンテキストウィンドウ圧縮で、それは機能します。私たちの本番のセッションは、何度も切り替わる接続をまたいで1時間以上続きます。
もし他の誰かがこれを書いているなら開示してほしいと思う但し書きが2つあります。現行のモデルgemini-3.1-flash-live-previewはプレビュー版で、正式版ではありません。そして2.5のネイティブ音声生成にあった2つの表現機能、感情豊かな対話と能動的な音声は、3.1 Flash Liveでは対応していません。
xAI Grok Voice:請求が最もシンプルな対抗馬
Grok Voiceは興味深い第3の選択肢で、価格を暗算できる唯一の存在です。1分$0.05、1時間$3の定額で、その1分のうちどれだけが発話であるかにかかわりません。本物の音声対音声APIであるgrok-voice-latestで、サーバー側の音声アクティビティ検出を備え、真に差別化された機能があります。120秒の音声からの声のクローニングです。20種類を超える声と、25以上の言語のカバーを提供します。
定額制は好きになりやすく、見誤りやすくもあります。会話製品はその分数の大半を聞くことに費やしますが、聞くことはGeminiのメーターでは安いほうの半分です。典型的な稼働比率では、Geminiは1分$0.05よりはっきり安くなります。ですが、もしセッションが短く密なら、Grokの計算は清々しいほど正直で、そのベンチマークのスコアは、これからご覧のとおり、慰めの賞などではありません。
Amazon Nova 2 Sonic:エンタープライズ電話連携の一手
AmazonのNova 2 Sonicは、Bedrock上の統合された音声対音声モデルで、100万トークンのコンテキストウィンドウと、この一群の中で最も充実した電話連携を備えています。Amazon ConnectとTwilioとの連携で、これはコンタクトセンターのチームがまさに聞きたい話です。対応言語は7で、ここでは最も狭いカバーです。音声製品がエンタープライズへの電話回線であるなら、Nova 2 Sonicは候補リストに入ります。多言語のものなら、入りません。
Claudeと、オープンソースの一角
正直な脚注が2つあります。AnthropicのClaudeには消費者向けの音声モードがありますが、それは音声認識、テキスト、音声合成のパイプラインで、少数のプリセット音声と18言語を持ち、リアルタイム音声のAPIはありません。作り手は先に進んで構いません。
オープンソースは多くの人が思うより先を行っています。KyutaiのMoshiは、200ミリ秒前後という実用的な遅延を持つ、真の全二重のオープンソースモデルであり、Qwen3-Omniはエンドツーエンドのオムニモーダルモデルのオープンウェイトを提供します。どちらも商用APIほどの磨きはありませんが、もし制約が自前のハードウェアで動かすことなら、その選択肢は存在します。
ベンチマークが語ること、OpenAIに有利な部分も含めて
最も役に立つ第三者のデータはArtificial Analysis Speech-to-Speech Indexで、音声推論、会話のダイナミクス、エージェント的なツール利用を合成した指標です。都合よくつまみ食いせず、まるごと読んでください。
- 総合スコア。 高推論設定のGPT-Realtime-2が77.2パーセントで首位、Grok Voice Think Fastが75.7で続き、高推論設定のGemini 3.1 Flashは69.5です。総合はOpenAIが勝ちます。提灯記事にはならないと言ったとおりです。
- 音声推論。 実質的に上位3つが横並びです。Grokが97.1パーセント、GPT-Realtime-2とGemini 3.1 Flashはともに97です。音声を通じた知能は、いまや大手3社の間では前提条件です。
- 会話のダイナミクス。 ここはOpenAIが本当に圧倒する領域です。Full Duplex Benchで、OpenAIのモデルは95.2から95.7パーセント、対するGeminiは74.3、Grokは77.8です。OpenAIの音声を人間らしく感じさせる自然な割り込み、相づち、ターンの取り合いは、実在し、実測されたものであって、宣伝ではありません。
- 遅延。 最初の音声までの時間の実測最速はGoogleのものです。Gemini 2.5 Flash Native Audioは0.63秒で応答し、Grokの0.78を上回ります。会話では、先に話し始めるモデルのほうが賢く感じられます。
ベンチマークの公表者が付け、私たちも繰り返す但し書きが一つあります。これらが測っているのはAPIモデルです。GPT-Live自体はベンチマークにかけられません。かけるべきAPIが存在しないからです。業界で最良の会話のダイナミクスは、今のところ消費者だけの特典なのです。
そこで正直な採点表です。OpenAIは会話のダイナミクスと総合で勝ちます。Geminiは価格で数倍、対応言語で数倍、最初の音声までの実測遅延、そして誰とも対等な開発者アクセスで勝ちます。どちらの勝ちが効いてくるかは、あなたが何を作っているかで完全に決まります。
Gemini Liveを本番で動かして学んだこと
これは他のどのランキングも書けない章なので、具体的にいきます。Mintzaは、GoのWebSocketプロキシの背後でGemini Liveを動かし、会話は1時間以上続きます。
10分ごとの接続切り替えは実在し、乗り切れます。 Geminiはおよそ10分ごとにWebSocket接続を切り替え、先にGoAway警告を送ってきます。私たちのバックエンドはセッション再開ハンドルを使い、会話の途中で透過的に再接続するので、ユーザーは気づきません。1時間のレッスンは、静かに半ダースほどの接続にまたがります。もしアーキテクチャが1会話につき1ソケットを前提としているなら、これが最初に壊れるところです。
音声アクティビティ検出は既定値ではなく、製品の判断です。 Geminiでは、話し終えたとモデルが結論づけるまでに無音がどれだけ続くべきかを設定できます。ドキュメントは1秒未満の値を勧めています。私たちはあえて、その何倍もの長さに伸ばしました。言葉を探して間を置く語学学習者はまだ話し終わっておらず、あらゆる間に飛びつく先生は、生徒が離れていく先生だからです。汎用アシスタントはきびきびしたターンの取り合いを望みますが、学習製品は辛抱強さを望みます。あの1つのパラメータが分かれ目であり、それを書き直しではなく設定にできたのは、GeminiのVADが設定可能だったからこそです。
ときにはモデルを回避する作り込みをします。 辛抱強いVADには代償があります。長く流暢に独白する生徒は、ターンを譲るのに十分なほど長くは止まりませんし、私たちは、確定されない1つのターンがやがて接続を落とすという、文書化されていない上限を見つけました。私たちの対処法はこうです。途切れなく長く話し続けたあと、バックエンドが数秒の無音の音声をストリームに差し挟みます。VADはその作られた間を見て、先生はそこまでに言われたすべてに応答し、生徒は何も失わずに続けられます。本番の音声AIは、こうした回避策で満ちています。そのための余力を見込んでおいてください。
私たちはあえて半二重を選びました。 Mintzaは、先生が話している間はマイクをミュートします。電話のエコーキャンセルは当てにならず、自分の声を聞いてしまうモデルは自分自身に向かって話し始めるからです。私たちは、あえてバージインを音声の明瞭さと引き換えにしました。Geminiが最も大きく負けるベンチマークであるFull Duplex Benchが、私たちの用途ではほとんど問題にならないのも、このためです。私たちは設計として割り込みを無効にしました。ベンチマークの重みづけは、ランキング表ではなく、あなたの製品に従うべきです。
長いセッションにはコンテキスト管理が要ります。 1時間以上の会話はコンテキストウィンドウをあふれさせるので、私たちはGeminiのコンテキスト圧縮に頼っており、システムプロンプトは5つの層から構成しています。基本の人格、語学教師としての人格、レベルに応じた振る舞い、レッスン、そしてユーザーに関する知識です。その人格は、セッション全体と、切り替わるすべての接続をまたいで保たれます。1時間にわたるその一貫性は、仕様書には載らない能力です。
対応言語と価格が、ビジネスモデルのすべてです。 Mintzaは15言語をどの方向にも、210の組み合わせで、単一のモデルの上で教えます。Geminiの多言語品質が信頼できるほど均一で、モデルが文の途中で言語を切り替えられるからです。それこそが私たちのバイリンガルの助け船を可能にします。生徒が行き詰まると先生がその母語に切り替え、また連れ戻すのです。そしてGeminiの音声レートでは、1分の会話が数セントで済み、それが月180分から600分の発話を消費者価格の月額プランとして売ることを成り立たせます。入力コストが10倍だったら、この製品は存在しなかったでしょう。
リアルタイム音声モデルが可能にするもの
このモデル分野が重要な理由は、それが解き放つ製品の幅にあり、そのそれぞれが異なる次元に負荷をかけます。
- 語学のスピーキング練習。 私たちの事例です。対応言語、大規模での価格、辛抱強いターンの取り合い、そして長いセッションにわたる人格の安定に負荷をかけます。その消費者側についてはChatGPTで言語を話せるようになる?で書きました。
- 言語を超えた個別指導と教育。 同じく長時間セッションで辛抱強く聞くプロファイルに、演習や進捗のためのツール利用が加わります。
- カスタマーサポートと電話連携。 SIPと電話システムの配管に負荷をかけます。だからこそOpenAIのSIP対応や、Nova 2 SonicのAmazon ConnectとTwilioの連携が存在します。
- アクセシビリティとライブ翻訳。 画面を使えない人のための音声優先のインターフェースと、リアルタイム翻訳です。ここではGoogleもOpenAIも専用のモデル派生版を出しています。
- 話し相手と日々のアシスタント。 会話のダイナミクスそのものが製品になる唯一のカテゴリーです。だからこそOpenAIがGPT-Liveで示した全二重の自然さが、そこではこれほど効いてくるのです。
「最良」とは仕事の関数です。話し相手アプリはFull Duplex Benchを重く見るべきです。電話連携の製品は連携を重く見るべきです。大規模な教育製品は対応言語、価格、VAD制御を重く見るべきで、その仕事、たまたま私たちが内側から知っている仕事こそ、Geminiが決定的に勝つものです。
結論
今日、実際の製品を、とりわけ多言語のものを作るなら、Gemini Live APIが2026年のリアルタイム音声AIモデルとして最良です。音声入力はOpenAIのRealtime APIより一桁安く、対応言語は他社の数十に対して97、最初の音声は実測最速、始めるための無料枠があり、音声の振る舞いを製品の判断にできる設定可能性を備えています。OpenAIは業界で最も自然な会話を作り上げ、それをChatGPTの中に閉じ込めました。そのRealtime APIは優秀ですが、エンタープライズ向けの価格です。Grok Voiceは定額制と声のクローニングを備えた、注目すべき対抗馬です。Nova 2 Sonicはコンタクトセンターを制します。Claudeはこのレースにいません。
私たちはその結論に、高くつくやり方でたどり着きました。その上に作ることによって、です。Mintzaは、勝ったモデルが本番でどう見えるかそのもの、会話が1時間以上続く15言語の会話の先生です。Gemini Live APIが、製品チームが一つの仕事のためにあらゆるパラメータを調整したときにどう聞こえるのかを知りたいなら、最初の10分は無料です。そしてモデルではなくアプリを選んでいるなら、この分野の全体を言語スピーキング練習に最適なAIアプリで比べました。