ترجمهٔ صوتی زندهٔ گوگل با Gemini 3.5 Live Translate
خلاصهٔ کاملتر
گوگل از Gemini 3.5 Live Translate رونمایی کرده، تازهترین مدل صوتیاش برای ترجمهٔ زندهٔ گفتار-به-گفتار. این مدل خودش بیش از ۷۰ زبان رو تشخیص میده و یه گفتار ترجمهشدهٔ روان و طبیعی تولید میکنه که آهنگ، سرعت و زیروبمی صدای گوینده رو هم حفظ میکنه. به گفتهٔ گوگل، ترجمه توی محصولاتش هر ماه بیش از یک تریلیون کلمه برای میلیاردها کاربر انجام میشه و این نسخه قدم بعدیِ همون مسیره.
تفاوت اصلی این مدل با سیستمهای نوبتیه. سیستمهای قبلی منتظر میموندن گوینده حرفش رو تموم کنه و بعد جواب بدن، ولی این مدل پیوسته صدا تولید میکنه و یه توازن بین دو چیز برقرار میکنه: صبر کردن برای گرفتن زمینهٔ بیشتر که کیفیت رو بالا میبره، و ترجمهٔ فوری که باعث میشه همگام با گوینده بمونه. نتیجهاش اینه که صدا بدون مکثهای ناجور پخش میشه و کل جلسه فقط چند ثانیه عقبتر از گوینده میمونه.
مدل از همین امروز روی چند محصول گوگل داره عرضه میشه. برای دولوپرها بهصورت پیشنمایش عمومی از طریق Gemini Live API و Google AI Studio در دسترسه، برای شرکتها بهصورت پیشنمایش خصوصی توی Google Meet، و برای همه از طریق اپ Google Translate روی اندروید و iOS. گوگل میگه مدل ورودی چندزبانه رو بدون نیاز به تنظیم دستی مدیریت میکنه و در برابر نویز هم مقاومه، پس میتونه توی محیطهای شلوغ و غیرقابلپیشبینی هم کار کنه.
چند پلتفرم دولوپری مثل Agora، Fishjam، LiveKit، Pipecat و Vision Agents هم با Gemini Live API یکپارچه شدن تا ساخت اپهای ترجمهٔ صوتی راحتتر شه؛ این یکپارچگیها زیرساخت پیچیدهٔ استریم بلادرنگ رسانه رو مدیریت میکنن. بهعنوان نمونه، شرکت Grab داره مدل رو برای ارتباط چندزبانهٔ تقریباً همزمان بین رانندهها و مسافرها موقع سوار شدن تست میکنه؛ کاربرهاش ماهانه بیش از ۱۰ میلیون تماس صوتی از طریق Grab میگیرن.
توی Google Meet هم ترجمهٔ گفتار بهزودی از این مدل استفاده میکنه و یه جهش بزرگ داره: از ۵ زبان قبلی به بیش از ۷۰ زبان، و امکان بیش از ۲۰۰۰ ترکیب زبانی توی یه جلسه، در حالی که قبلاً فقط ترجمه به/از انگلیسی ممکن بود. روی اندروید هم یه «حالت شنیدن» تازه داره راه میافته که اجازه میده ترجمه رو مستقیم از بلندگوی گوشی بشنوی؛ کافیه گوشی رو مثل یه تماس معمولی دم گوشت بگیری.
گوگل میگه همهٔ صدای تولیدشده توسط مدلهاش با SynthID واترمارک میشه. این واترمارک نامحسوس مستقیم توی خروجی صدا تنیده میشه تا محتوای تولیدشده با هوش مصنوعی همچنان قابل تشخیص بمونه و جلوی اطلاعات غلط گرفته شه.
نکات کلیدی:
- Gemini 3.5 Live Translate گفتار رو تقریباً همزمان به بیش از ۷۰ زبان ترجمه میکنه
- برخلاف سیستمهای نوبتی، پیوسته صدا تولید میکنه و فقط چند ثانیه عقبتر از گوینده میمونه
- لحن، سرعت و زیروبمی صدای گوینده تو ترجمه حفظ میشه
- روی Google Translate، Meet و AI Studio و از طریق Gemini Live API عرضه میشه
- همهٔ صدای تولیدشده با واترمارک نامحسوس SynthID علامتگذاری میشه




