أطلقت جوجل نموذجي Gemini 3.8 Live و3.8 Live Extended Thinking، وهما نموذجان صوتيان ثنائيا الاتجاه (speech-to-speech) يتيحان محادثة صوتية فورية مع إمكانية مقاطعة النموذج أثناء حديثه، ما يجعلهما منافساً مباشراً لعائلة GPT-Live من OpenAI.

2 دقيقة قراءة
عاجل

جوجل تطلق Gemini 3.8 Live وLive Extended Thinking لمحادثات صوتية فورية

ما الذي أُطلق؟

أعلنت جوجل عن نموذجين صوتيين جديدين: Gemini 3.8 Live وGemini 3.8 Live Extended Thinking. النموذجان من فئة speech-to-speech، أي أنهما يحوّلان الصوت إلى صوت مباشرة بدل المرور بمرحلة تحويل الكلام إلى نص ثم توليد رد نصي ثم تحويله إلى صوت.

النسخة Extended Thinking تمنح النموذج مساحة استدلال أطول قبل الرد، وهي مفيدة للأسئلة المركّبة، لكنها قد ترفع زمن الاستجابة.

لماذا يهم هذا؟

الفرق الجوهري في هذه الفئة هو المقاطعة أثناء الكلام (barge-in): يمكن للمستخدم أن يقطع النموذج وهو يتحدث، فيتوقف ويعالج المدخل الجديد. هذا السلوك هو ما يفصل الوكلاء الصوتيين القابلين للاستخدام فعلياً عن الواجهات الصوتية المتقطعة.

التكامل التقني

يعتمد النموذج على نقطة WebSocket:

wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...

ويمكن بناء واجهة تجريبية كاملة في المتصفح دون أي مكتبات خارجية، باستخدام Web Audio API لكل من التقاط الصوت وتشغيله. هذا يخفض حاجز التجربة للفرق الهندسية بشكل كبير.

مقارنة سريعة

المعيار Gemini 3.8 Live GPT-Live (OpenAI)
النمط صوت إلى صوت صوت إلى صوت
المقاطعة أثناء الكلام مدعومة مدعومة
وضع تفكير موسّع نعم (Extended Thinking) حسب الإصدار
قناة التكامل WebSocket في Google AI API واجهات OpenAI
ملاءمة السحابة تكامل طبيعي مع Google Cloud تكامل مع Azure/OpenAI

حالات استخدام للشرق الأوسط

  • مراكز الاتصال: التعامل مع الاستفسارات بالعربية والإنجليزية في الوقت نفسه دون تحويل بين نماذج.
  • الخدمات الحكومية: مساعد صوتي للاستعلام عن المعاملات، مع ضبط System Prompt يحدد النطاق والصلاحيات.
  • التجارة الإلكترونية: دعم ما بعد البيع صوتياً مع تقليل زمن الانتظار.

ما يجب الحذر منه

جودة اللهجات العربية تتفاوت بين النماذج الصوتية، ويجب اختبارها فعلياً قبل الإنتاج. كذلك تحتاج المؤسسات إلى مراجعة سياسات حوكمة البيانات والامتثال المحلي، خصوصاً في القطاعات الحكومية والمالية.

ملاحظة للمراجعة البشرية: هذا ملخص تحريري مبني على إعلان جوجل ووثائق المطوّرين؛ يُرجى التحقق من التسعير النهائي وتوافر النموذج في مناطق Google Cloud قبل النشر.

أسئلة شائعة

ما هو Gemini 3.8 Live؟

هو نموذج صوتي ثنائي الاتجاه (speech-to-speech) من جوجل يحوّل الكلام إلى كلام مباشرة دون وسيط نصي، ما يقلل زمن الاستجابة ويسمح بمحادثة طبيعية مع إمكانية مقاطعة النموذج أثناء حديثه.

كيف يختلف Gemini 3.8 Live عن GPT-Live من OpenAI؟

كلاهما من فئة الصوت ثنائي الاتجاه، لكن Gemini 3.8 Live يُتاح عبر نقطة WebSocket في Google AI API مع نسخة Extended Thinking للتفكير الأعمق، بينما تعتمد عائلة GPT-Live على واجهات OpenAI. الفرق العملي يظهر في جودة اللهجات العربية، والتسعير، وسهولة التكامل مع Google Cloud.

هل يناسب Gemini 3.8 Live الشركات في الشرق الأوسط الآن؟

مناسب للتجارب الأولية ومراكز الاتصال متعددة اللغات، لكن يُنصح بإجراء اختبار لهجات عربية متعددة قبل الإنتاج، ومراجعة متطلبات الامتثال وحوكمة البيانات في كل دولة.

ما معنى Extended Thinking في النموذج الصوتي؟

هو وضع يمنح النموذج وقتاً أطول للاستدلال قبل الرد، ما يفيد في الأسئلة المعقدة أو متعددة الخطوات، لكنه قد يزيد زمن الاستجابة مقارنة بالوضع الفوري.

المصدر: Simon Willison (LLM & tools)

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.