جمینای 3.8 Live: مدل صوتی که همزمان فکر میکنه و حرف میزنه
خلاصهٔ کاملتر
گوگل دو مدل صوتی جدید به اسم Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking معرفی کرده. اینها مدلهای live dialogue هستن، یعنی مدلهایی که تقریباً real-time و با صدا باهاشون گفتوگو میکنی. به گفتهٔ تیم Gemini Audio، هدف اینه که ساختن voice agent (یعنی دستیاری که با دستور صوتی کار انجام میده) برای محیط production قابلاعتمادتر بشه و حرف زدن با Gemini تو اپ Gemini، Google Workspace و Search روونتر بشه.
نسخهٔ Live برای مقیاس بالا و هزینهٔ کم ساخته شده. تصویر رو تقریباً همزمان پردازش میکنه و وسط مکالمه خودش متوجه میشه که زبون عوض شده و بین 97 زبان جابهجا میشه. ابزارها و API callها رو هم پشت صحنه اجرا میکنه و همون موقع به گفتوگو ادامه میده. یعنی کاربر لازم نیست ساکت منتظر بمونه تا کار تموم بشه. این مدل تو Speech Agent Arena از نظر ترجیح کاربرها رتبهٔ دوم رو گرفته.
نسخهٔ Extended Thinking برای کارهای پیچیده و چندمرحلهایه و همزمان فکر میکنه و حرف میزنه. مثلاً اول با یه جملهٔ کوتاه مثل «بذار چک کنم…» درخواست رو تأیید میکنه و بعد پیشرفت کارهای پسزمینه رو قدمبهقدم برای کاربر توضیح میده. تو دموهای گوگل، این مدل از روی طرح دستی و بازخورد صوتی کامپوننت React ساخته و چند رزرو رو با function callهای async هماهنگ کرده.
از نظر عددها، Extended Thinking با امتیاز 82.6 رتبهٔ اول Speech to Speech Quality Index مؤسسهٔ Artificial Analysis رو گرفته. تو انجام کارهای agentic هم روی بنچمارک τ-Voice به 68.6% و روی τ-Voice-banking شرکت Sierra به 35.1% رسیده و تو Big Bench Audio هم 97.7% گرفته. گوگل میگه قیمتش در مقایسه با بقیهٔ مدلهای frontier خیلی رقابتیه و روی EVA-Bench شرکت ServiceNow هم بین دقت و کیفیت مکالمه تعادل خوبی داشته.
هر دو مدل از امروز برای توسعهدهندهها تو Gemini API و Google AI Studio در دسترسن و برای شرکتها تو Gemini Enterprise بهصورت private preview عرضه شدن. پلتفرمهایی مثل LiveKit، Pipecat، Agora، LangChain و Vercel هم از Gemini Live API پشتیبانی میکنن و زیرساخت پخش زندهٔ صدا و تصویر رو خودشون مدیریت میکنن. کاربرهای عادی Live رو تو Search Live و Extended Thinking رو تو Gemini Live و برای مشترکهای Google AI تو Docs، Gmail و Keep میبینن.
همهٔ صداهایی که این مدلها تولید میکنن با SynthID واترمارک میشن. SynthID یه نشونهٔ نامحسوسه که داخل خود صدا بافته میشه تا بشه تشخیص داد صدا ساخت هوش مصنوعیه و جلوی سوءاستفاده و اطلاعات غلط گرفته بشه.
نکات کلیدی:
- Gemini 3.8 Live برای مقیاس و هزینهٔ کم و Live Extended Thinking برای کارهای پیچیدهٔ چندمرحلهای ساخته شده
- Extended Thinking با امتیاز 82.6 رتبهٔ اول Speech to Speech Quality Index رو داره
- امتیاز Extended Thinking روی τ-Voice برابر 68.6% و روی Big Bench Audio برابر 97.7% هست
- Gemini 3.8 Live وسط مکالمه بین 97 زبان جابهجا میشه و ابزارها رو پشت صحنه اجرا میکنه
- هر دو مدل تو Gemini API و Google AI Studio در دسترسن و نسخهٔ سازمانی در private preview هست
- همهٔ صداهای تولیدی با SynthID واترمارک میشن




