أفضل نموذج ذكاء اصطناعي صوتي فوري لبناء منتج في 2026 هو Gemini Live API من Google: رموز صوتية بنحو عُشر سعر إدخال OpenAI، و97 لغة مدعومة، وأسرع زمن مقيس لأول صوت. وGPT-Live من OpenAI أفضل محادثة خالصة، لكن لا API له. وفي ما يلي المقارنة الصادقة، من خبرة الإنتاج.

لماذا يمكنك الوثوق بهذه المقارنة

كل ترتيب لنماذج الذكاء الاصطناعي الصوتي ستجده هذا الشهر كتبه من قرأ منشورات الإطلاق. أما هذا فكتبه فريق يدفع فاتورة نموذج صوتي كل شهر. Mintza، تطبيق محادثة اللغات لدينا، يعمل على Gemini Live API في الإنتاج: مستخدمون حقيقيون، خمس عشرة لغة، جلسات تمتدّ أكثر من ساعة. هذا انحياز، ونعلنه مقدّمًا. وهو أيضًا سبب معرفتنا أين تنكسر هذه النماذج فعلًا، وهو الجزء الذي تغفله منشورات الإطلاق.

فهذه المقارنة تُقرّ بما يقول الدليل إن OpenAI تتفوّق فيه، وتطبع الأسعار من صفحات التسعير الرسمية، وتخبرك بما يتضمّنه تشغيل أحد هذه النماذج على نطاق واسع فعلًا.

GPT-Live مقابل Gemini Live: نوعان مختلفان من المنتجات

المقارنة التي يبحث عنها معظم الناس خطأ في الفئة، وتوضيحها نصف المقال.

‏GPT-Live، الذي أطلقته OpenAI في 8 يوليو 2026 وضعًا صوتيًا جديدًا لـChatGPT، منتج استهلاكي. وهو مبهر فعلًا: صوت مزدوج الاتجاه حقيقي، أي يستمع ويتحدث في الوقت ذاته، ويقرّر بحسب بطاقة نظامه في اللحظة ما إذا كان سيردّ أم يواصل الاستماع. لا شيء آخر في هذه القائمة يفعل ذلك. لكنك لا تستطيع البناء عليه. حتى أواخر يوليو 2026 لا يوجد API لـGPT-Live، بل نموذج للإشعار عند توفّره. وتصرّح بطاقة النظام ذاتها بأن GPT-Live يفوّض الاستعلامات الصعبة إلى نماذج نصية، وبأن GPT-Live-1 وصيغته mini أقلّ قدرةً من GPT-5.5 Thinking عبر عدة تقييمات ذكاء. ولا تنشر OpenAI قائمة لغات مدعومة له؛ وذكرت TechCrunch نقدًا للكنة في عرض OpenAI التوضيحي للهندية نفسه.

ما تقدّمه OpenAI فعلًا للمطوّرين هو Realtime API، حاليًا gpt-realtime-2.1 وصيغة mini. وهو منتج قوي: تحويل كلام إلى كلام أصيل، ودعم WebRTC وWebSocket وSIP. لكنه قائم على الأدوار مع كشف نشاط صوتي دلالي، لا مزدوج الاتجاه، وجلساته بحدّ أقصى 60 دقيقة. والسحر الذي يجعل GPT-Live يبدو بشريًا هو بالضبط الجزء الذي لا يمكنك استئجاره.

أما Gemini Live API فشكله معاكس: المنتج الكامل هو الـAPI. فما تطلقه Google للمطوّرين هو ما تملكه Google.

Google Gemini Live API: النموذج الذي يمكنك البناء عليه فعلًا

أعلنت Google Gemini 3.1 Flash Live في 26 مارس 2026، واصفةً إياه بأعلى نماذجها الصوتية جودةً حتى الآن، بنسبة 90.8 بالمئة على ComplexFuncBench Audio لاستخدام الأدوات الموجّه صوتيًا، وبعلامة SynthID المائية على الصوت المولّد. والأرقام التي تهمّ الباني موجودة في الوثائق:

  • السعر. بحسب صفحة التسعير الرسمية، يكلّف إدخال الصوت 3.00 دولارات لكل مليون رمز وإخراج الصوت 12.00 دولارًا لكل مليون. وثمة باقة مجانية، فيمكنك بناء نموذج أولي دون فاتورة. وملاحظة صدق من الخبرة: لا تحوّل أسعار الرموز تلك إلى رقم للدقيقة وتسمّه تكلفتك. فالجلسة الحية تحاسبك أيضًا على سياق المحادثة الذي يُعاد إرساله في كل دور وعلى أي رموز تفكير، فتكلفة المحادثة الحقيقية للدقيقة تقع أعلى بكثير من حساب رموز الصوت الساذج. لا تزال سنتات في الدقيقة، ولا تزال جزءًا يسيرًا من أسعار OpenAI، لكن ضع الميزانية من جلسات مقيسة، لا من ورقة الأسعار.
  • اللغات. تسرد وثائق Live API 97 لغة مدعومة، والنموذج متعدد اللغات بطبيعته: يمكنه التبديل في منتصف الجملة، وهو أهمّ مما تظن وسنعود إليه.
  • التحكّم. كشف نشاط صوتي تلقائي بحساسيات ومدة صمت قابلة للضبط، أو تبادل أدوار يدوي كليًا. والمقاطعة تلغي التوليد. 30 صوتًا.
  • الجلسات. التفاصيل الصادقة الدقيقة: الجلسات الصوتية محدودة بـ15 دقيقة دون ضغط السياق، والاتصالات الفردية تتناوب كل 10 دقائق تقريبًا مع تحذير GoAway. واستئناف الجلسة وضغط نافذة السياق هما الحلّ الموثّق، وهما يعملان؛ فجلسات إنتاجنا تمتدّ أكثر من ساعة عبر اتصالات متناوبة كثيرة.

تحفّظان كنّا نودّ الإفصاح عنهما لو كتب هذا غيرنا. النموذج الحالي، gemini-3.1-flash-live-preview، بحالة معاينة، لا إتاحة عامة. وميزتان تعبيريتان من توليد الصوت الأصيل في 2.5، الحوار العاطفي والصوت الاستباقي، غير مدعومتين على 3.1 Flash Live.

xAI Grok Voice: المنافس بأبسط فاتورة

‏Grok Voice هو الخيار الثالث المثير، والوحيد الذي يمكنك حساب تسعيره في رأسك: 0.05 دولار للدقيقة ثابتًا، 3 دولارات للساعة، مهما كان مقدار الكلام في تلك الدقيقة. وهو API حقيقي لتحويل الكلام إلى كلام، grok-voice-latest، بكشف نشاط صوتي من جانب الخادم وميزة تميّزه فعلًا: استنساخ الصوت من 120 ثانية من التسجيل. ويقدّم أكثر من عشرين صوتًا وتغطية لأكثر من 25 لغة.

التسعير الثابت سهل الحبّ سهل الخطأ في تقديره. فمنتج المحادثة ينفق معظم دقائقه في الاستماع، والاستماع هو النصف الرخيص في عدّاد Gemini. وعند دورات التشغيل النموذجية، يخرج Gemini أرخص بوضوح من 0.05 دولار للدقيقة. لكن إن كانت جلساتك قصيرة كثيفة، فحساب Grok صادق بشكل منعش، ودرجاته المعيارية، كما سترى، ليست جائزة ترضية.

Amazon Nova 2 Sonic: خيار الهاتفية للمؤسسات

Nova 2 Sonic من Amazon نموذج موحّد لتحويل الكلام إلى كلام على Bedrock، بنافذة سياق من مليون رمز، وأعمق قصة هاتفية في المجموعة: تكاملات مع Amazon Connect وTwilio، وهو بالضبط ما يودّ فريق مركز اتصال سماعه. ويسرد سبع لغات، أضيق تغطية هنا. فإن كان منتجك الصوتي خطًا هاتفيًا إلى مؤسسة، فـNova 2 Sonic في القائمة القصيرة. وإن كان أي شيء متعدد اللغات، فلا.

Claude، وركن المصادر المفتوحة

هامشان صادقان. لـClaude من Anthropic وضع صوتي استهلاكي، لكنه مسار تحويل كلام إلى نص، ثم نص، ثم نص إلى كلام، بمجموعة صغيرة من الأصوات الجاهزة و18 لغة، ولا API صوتي فوري. يمكن للبانين المضيّ قُدُمًا.

المصادر المفتوحة أبعد شوطًا مما يظنّ معظم الناس. فـMoshi من Kyutai نموذج مفتوح المصدر مزدوج الاتجاه فعلًا بزمن استجابة عملي نحو 200 مليّ ثانية، وQwen3-Omni يقدّم أوزانًا مفتوحة لنموذج متعدد الوسائط من طرف إلى طرف. لا يملك أيّ منهما صقل الواجهات التجارية، لكن إن كان قيدك التشغيل على عتادك الخاص، فالخيار موجود.

ماذا تقول المقاييس، بما في ذلك الجزء الذي يميل إلى OpenAI

أنفع بيانات طرف ثالث هي مؤشر Artificial Analysis لتحويل الكلام إلى كلام، وهو مركّب من الاستدلال الصوتي وديناميكيات المحادثة واستخدام الأدوات الوكيلي. اقرأه كاملًا، لا انتقائيًا:

  • المركّب الإجمالي: يتصدّر GPT-Realtime-2 عند الاستدلال العالي بـ77.2 بالمئة، يتبعه Grok Voice Think Fast بـ75.7، ويجلس Gemini 3.1 Flash عند الاستدلال العالي عند 69.5. تفوز OpenAI بالمركّب. قلنا لك إن هذا لن يكون مقالًا دعائيًا.
  • الاستدلال الصوتي: تعادل ثلاثي فعليًا في القمة. يسجّل Grok 97.1 بالمئة، مع GPT-Realtime-2 وGemini 3.1 Flash كليهما عند 97. والذكاء فوق الصوت صار الآن الحدّ الأدنى بين الكبار الثلاثة.
  • ديناميكيات المحادثة: هنا تهيمن OpenAI فعلًا. على Full Duplex Bench، تسجّل نماذج OpenAI من 95.2 إلى 95.7 بالمئة مقابل 74.3 لـGemini و77.8 لـGrok. والمقاطعات الطبيعية وإشارات الإصغاء وتبادل الأدوار التي تجعل صوت OpenAI يبدو بشريًا حقيقية ومقيسة، لا تسويقًا.
  • زمن الاستجابة: أسرع زمن مقيس لأول صوت لـGoogle. يجيب Gemini 2.5 Flash Native Audio في 0.63 ثانية، متقدّمًا على Grok عند 0.78. وفي المحادثة، النموذج الذي يبدأ التحدث أولًا يبدو أذكى.

تحفّظ يذكره ناشرو المقياس ونكرّره: هذه تقيس نماذج الـAPI. أما GPT-Live نفسه فلا يمكن قياسه، لأنه لا API لقياسه. وأفضل ديناميكيات محادثة في الصناعة هي حاليًا حصرية للمستهلكين.

فبطاقة النتائج الصادقة: تفوز OpenAI بديناميكيات المحادثة وبالمركّب. ويفوز Gemini بالسعر بمضاعفات، وباللغات بمضاعفات، وبزمن أول صوت المقيس، وبوصول المطوّرين على قدم المساواة مع الجميع. وأي مجموعة انتصارات تهمّ يتوقّف كليًا على ما تبنيه.

ما تعلّمناه من تشغيل Gemini Live في الإنتاج

هذا هو القسم الذي لا يستطيع أي ترتيب آخر كتابته، فسنكون محدّدين. يشغّل Mintza منظومة Gemini Live خلف وسيط WebSocket مكتوب بلغة Go، بمحادثات تمتدّ أكثر من ساعة.

تناوب الاتصال كل 10 دقائق حقيقي، وقابل للتجاوز. يتناوب Gemini اتصالات WebSocket كل 10 دقائق تقريبًا، مرسلًا تحذير GoAway أولًا. وتعيد خلفيّتنا الاتصال بشفافية باستخدام مقابض استئناف الجلسة، في منتصف المحادثة، دون أن يلاحظ المستخدم. ودرس من ساعة يمتدّ بهدوء عبر ستة اتصالات تقريبًا. فإن افترضت بنيتك مقبسًا واحدًا لكل محادثة، فهذا أول ما ينكسر.

كشف النشاط الصوتي قرار منتج، لا إعداد افتراضي. يتيح Gemini ضبط طول الصمت اللازم قبل أن يستنتج النموذج أنك انتهيت. وتقترح الوثائق قيمًا دون الثانية. مدّدناها إلى أضعاف ذلك عمدًا، لأن متعلّم لغة يتوقّف للبحث عن كلمة لم ينتهِ من الحديث، ومعلّم ينقضّ على كل وقفة معلّم يتركه الطلاب. فالمساعد العام يريد تبادل أدوار سريعًا؛ ومنتج التعلّم يريد صبرًا. وهذا المعطى الواحد هو الفرق، وقابليّة ضبط كشف النشاط الصوتي في Gemini وحدها جعلته إعدادًا لا إعادة كتابة.

أحيانًا تهندس حول النموذج. للكشف الصبور تكلفة: طالب يلقي مونولوجًا طليقًا طويلًا لا يتوقّف بما يكفي لتسليم الدور، ووجدنا سقفًا غير موثّق حيث يقتل دور واحد غير مثبَّت الاتصال في النهاية. وإصلاحنا: بعد امتداد طويل متواصل من الكلام، تدمج الخلفية بضع ثوانٍ من الصوت الصامت في التدفّق، فيرى الكشف الوقفة المصطنعة، ويردّ المعلّم على كل ما قيل حتى الآن، ويواصل الطالب دون خسارة شيء. والذكاء الاصطناعي الصوتي في الإنتاج مليء بحلول التفافية كهذه. خصّص لها ميزانية.

اخترنا نصف الاتجاه عمدًا. يكتم Mintza الميكروفون أثناء حديث المعلّم، لأن إلغاء الصدى على الهواتف غير موثوق، ونموذج يسمع نفسه يتحدث إلى نفسه. قايضنا المقاطعة بوضوح الصوت عمدًا. ولهذا أيضًا فإن Full Duplex Bench، المقياس الذي يخسره Gemini بأشدّ صورة، لا يكاد يهمّ حالتنا: عطّلنا المقاطعات بحكم التصميم. وأوزان مقاييسك ينبغي أن تتبع منتجك، لا لوحة الصدارة.

الجلسات الطويلة تحتاج إدارة سياق. ساعة من المحادثة ستفيض عن نافذة السياق، فنعتمد على ضغط السياق في Gemini، وموجّه نظامنا مؤلّف من خمس طبقات: الشخصية الأساسية، وشخصية معلّم اللغة، وسلوك المستوى، والدرس، ومعرفة المستخدم. وتصمد الشخصية عبر الجلسة كاملة وكل اتصال متناوب. وهذا الاتساق عبر ساعة قدرة لا تسردها أوراق المواصفات.

اللغات والسعر هما نموذج العمل كله. يعلّم Mintza خمس عشرة لغة بأي اتجاه، 210 أزواج، على نموذج واحد، لأن جودة Gemini متعددة اللغات موحّدة بما يكفي للثقة، ويمكن للنموذج تبديل اللغات في منتصف الجملة، وهو ما يجعل إنقاذنا ثنائي اللغة ممكنًا: ينتقل المعلّم إلى لغتك الأم حين تتعثّر، ثم يعيدك. وبأسعار الصوت في Gemini، تكلّف دقيقة المحادثة سنتات، وهو ما يجعل بيع باقات شهرية من 180 إلى 600 دقيقة منطوقة قابلًا للحياة بأسعار استهلاكية. وبعشرة أضعاف تكلفة الإدخال، لما وُجد هذا المنتج.

ما تُتيحه النماذج الصوتية الفورية

سبب أهمية هذه الفئة من النماذج هو مدى المنتجات التي تفتحها، وكلٌّ منها يجهد بُعدًا مختلفًا:

  • ممارسة التحدث باللغات. حالتنا. تجهد اللغات والسعر على النطاق وتبادل الأدوار الصبور وثبات الشخصية عبر الجلسات الطويلة. وكتبنا عن الجانب الاستهلاكي لهذا في هل يستطيع ChatGPT تعليمك التحدث بلغة؟
  • التدريس والتعليم بما يتجاوز اللغات: الملمح ذاته من جلسات طويلة واستماع صبور، إضافة إلى استخدام الأدوات للتمارين والتقدّم.
  • دعم العملاء والهاتفية. تجهد SIP وسِباكة النظام الهاتفي، ولهذا يوجد دعم SIP لدى OpenAI وتكاملات Amazon Connect وTwilio لدى Nova 2 Sonic.
  • إمكانية الوصول والترجمة الحية. واجهات صوت أولًا لمن لا يستطيعون استخدام الشاشات، والترجمة الفورية، حيث تطلق Google وOpenAI صيغ نماذج مخصّصة.
  • المرافقة والمساعدون اليوميون. الفئة الوحيدة التي تكون فيها ديناميكيات المحادثة هي المنتج، ولهذا يهمّ فيها كثيرًا طبيعيّة الاتجاه المزدوج التي أظهرتها OpenAI مع GPT-Live.

«الأفضل» دالة على المهمة. تطبيق المرافقة ينبغي أن يثقّل Full Duplex Bench كثيرًا. ومنتج الهاتفية ينبغي أن يثقّل التكاملات. ومنتج التعليم على النطاق ينبغي أن يثقّل اللغات والسعر والتحكّم في كشف النشاط الصوتي، وتلك المهمة، التي نعرفها نحن من الداخل، هي التي يفوز بها Gemini بلا منازع.

الحُكم

إن كنت تبني منتجًا حقيقيًا اليوم، ولا سيّما متعدد اللغات، فإن Gemini Live API هو أفضل نموذج ذكاء اصطناعي صوتي فوري في 2026: أرخص بمرتبة قدر على إدخال الصوت من Realtime API لدى OpenAI، و97 لغة مقابل عشرات لدى الجميع، وأسرع أول صوت مقيس، وباقة مجانية للبدء، وقابليّة ضبط تجعل سلوك الصوت قرار منتج. بنت OpenAI أكثر محادثة طبيعية في الصناعة وأقفلتها داخل ChatGPT؛ وRealtime API لديها ممتاز لكنه مسعّر للمؤسسات. وGrok Voice هو المنافس الجدير بالمتابعة، بتسعير ثابت واستنساخ صوت. وNova 2 Sonic يملك مركز الاتصال. وClaude ليس في هذا السباق.

بلغنا هذا الحُكم بالطريقة الباهظة: بالبناء عليه. Mintza هو ما يبدو عليه النموذج الفائز في الإنتاج، معلّم تحدّث بخمس عشرة لغة تمتدّ محادثاته أكثر من ساعة. إن أردت أن تسمع كيف يبدو Gemini Live API حين يضبط فريق منتج كل معطى لمهمة واحدة، فالعشر دقائق الأولى مجانية. وإن كنت تختار تطبيقًا لا نموذجًا، فقد قارنّا المجال كله في أفضل تطبيقات الذكاء الاصطناعي لممارسة التحدث بلغة.

يتوفّر Mintza على iOS وAndroid.