Gemini 3.5 Transcribe؛ مدل تازهٔ صوتبهمتن گوگل
خلاصهٔ کاملتر
گوگل از Gemini 3.5 Transcribe رونمایی کرده؛ به گفتهٔ تیم Gemini Audio دقیقترین مدل speech-to-text (یعنی مدلی که صدا رو به متن تبدیل میکنه) این شرکت تا امروز. فرقش با مدلهای معمول تشخیص گفتار اینه که بهجای متن خام، مستقیم متن تمیز و قالببندیشده تحویل میده؛ حتی وقتی نویز پسزمینه هست یا طرف داره اصطلاح تخصصی میگه.
مدل از دو مسیر در دسترسه. برای کارهای زنده مثل دستیار صوتی یا زیرنویس لحظهای، gemini-3.5-transcribe-live روی Live API با تأخیر زیر یک ثانیه جواب میده. برای فایلهای ضبطشده مثل جلسه و تماس پشتیبانی هم gemini-3.5-transcribe روی Interactions API هست که تفکیک گوینده و timestamp کلمهبهکلمه میده؛ تا سه گوینده پایدار کار میکنه و بیشتر از اون هنوز آزمایشیه.
بخش جالبش رونویسی هوشمنده: کلمات پرکننده و تپق رو حذف میکنه و اگه وسط حرف خودت رو تصحیح کنی، همون نسخهٔ نهایی رو مینویسه. طبق سنجش Artificial Analysis، نرخ خطای کلمه یا WER (یعنی چند درصد کلمهها غلط نوشته میشن) بهطور میانگین ۴.۰ درصد در حالت استریم و ۲.۶ درصد در حالت غیراستریمه. روی بنچمارک چندزبانهٔ FLEURS هم ۵.۵۰ و ۵.۰۴ درصد ثبت شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰ درصد بهتر شده.
گوگل همین مدل رو توی محصولات خودش هم پخش کرده. روی Gboard اندروید با قابلیت Rambler حرفها رو به متن مرتب تبدیل میکنه و با صدا میشه متن رو ویرایش کرد. توی Google Antigravity با اجازهٔ کاربر از محتوای صفحه کمک میگیره تا اسم فایلها درست نوشته بشن، و توی اپ Gemini روی macOS دستور صوتی هم میگیره و کارهای سنگین مثل ساخت تصویر رو با function call به مدلهای دیگهٔ Gemini میسپاره. نسخهٔ Chrome هم بهزودی میاد.
فعلاً همهچی پیشنمایش عمومیه: توسعهدهندهها از Gemini API در Google AI Studio و Antigravity بهش میرسن و سازمانها از Gemini Enterprise Agent Platform. پلتفرمهایی مثل LiveKit، Pipecat، LangChain، Agora و Vercel هم از طریق Live API پشتیبانیش رو اضافه کردن، پس لازم نیست خودت زیرساخت استریم صدا رو بسازی.
نکات کلیدی:
- WER میانگین ۴.۰ درصد در حالت استریم و ۲.۶ درصد در حالت غیراستریم، طبق سنجش Artificial Analysis
- تشخیص و رونویسی خودکار بیشتر از ۸۵ زبان با لهجههای مختلف
- تفکیک گوینده تا ۳ نفر همراه با timestamp کلمهبهکلمه؛ بیشتر از ۳ نفر هنوز آزمایشیه
- زمان رسیدن به متن نهایی حدود ۷۰ درصد بهتر از Chirp 3
- دو مدل جدا: gemini-3.5-transcribe-live برای Live API و gemini-3.5-transcribe برای Interactions API




