Gemini 3.8 Live و 3.5 Transcribe برای ساخت اپهای صوتی real-time
خلاصهٔ کاملتر
گوگل دیپمایند مدلهای صوتی جدیدش رو تو Gemini API و Google AI Studio منتشر کرده. Gemini 3.8 Live یه مدل speech-to-speech بومیه (یعنی صدا رو مستقیم میگیره و صدا تحویل میده، بدون اینکه وسطش به متن تبدیل کنه) و میتونه همزمان با ادامهی مکالمه کار انجام بده. نسخهی 3.8 Live Extended Thinking برای درخواستهای پیچیده استدلال عمیقتری داره و طبق پست گوگل، تو جدول Speech-to-Speech سایت Artificial Analysis رتبهی اول رو گرفته.
مهمترین قابلیت، function calling ناهمزمان هست، یعنی مدل میتونه یه API یا ابزار رو پشت صحنه صدا بزنه و در همین حین به حرف زدن با کاربر ادامه بده. قابلیتهای دیگهش: درک ورودی تصویری زنده کنار صدا، خوندن دقیق کدهای تأیید و شمارهپروندهها، پشتیبانی از بیش از 97 زبان و ترکیب صدای زنده با دادهی ساختاریافته. نسخهی Extended Thinking هم thinking قابل تنظیم داره و میتونه استدلال چندمرحلهای رو پشت صحنه انجام بده و همزمان پیشرفت کارش رو برای کاربر توضیح بده.
گوگل این مدلها رو جایگزین سادهتری برای معماری cascaded معرفی کرده، یعنی همون روشی که صدا اول به متن تبدیل میشه، بعد مدل زبانی جواب میده و آخر دوباره متن به صدا تبدیل میشه. قیمت از طریق Live API برای ورودی صوتی 0.005 دلار و برای خروجی صوتی 0.018 دلار در دقیقهست. پلتفرمهایی مثل LiveKit، Pipecat، Agora، LangChain و Vercel هم بهعنوان شریک، زیرساخت استریم رسانه رو برای استفادهی واقعی فراهم میکنن.
Gemini 3.5 Transcribe که ماه پیش منتشر شده، مدل مخصوص تبدیل گفتار به متنه و بیش از 85 زبان رو پشتیبانی میکنه. نرخ خطای کلمه (WER) تو حالت استریم 4.0% و بدون استریم 2.6% گزارش شده. عوض شدن زبان وسط جمله رو خودکار تشخیص میده و با custom_vocabulary میتونی تا 1,000 اصطلاح تخصصی یا اسم شرکت بهش بدی تا دقیقتر تشخیصشون بده. حالت smart transcription هم کلمههای پرکننده رو حذف میکنه و متن مرتب و خوانا تحویل میده.
از طریق Interactions API هم میشه فایلهای صوتی تا 1 ساعت رو با timestamp و تفکیک گویندهها رونویسی کرد. گوگل برای شروع، نمونهاپها رو تو GitHub گذاشته. مدلهای دیگهای مثل Gemini 3.5 Live Translate برای ترجمهی صوتی بیش از 70 زبان، Gemini 3.1 Flash TTS برای تولید گفتار و Lyria 3.5 برای تولید موسیقی هم تو Gemini API در دسترسن.
نکات کلیدی:
- Gemini 3.8 Live و 3.8 Live Extended Thinking از طریق Live API در دسترسن
- قیمت 0.005 دلار در دقیقه برای ورودی صوتی و 0.018 دلار برای خروجی صوتی هست
- مدلهای Live از function calling ناهمزمان و بیش از 97 زبان پشتیبانی میکنن
- Gemini 3.5 Transcribe تو استریم WER برابر 4.0% و بدون استریم 2.6% داره
- custom_vocabulary تا 1,000 اصطلاح میگیره و فایلهای صوتی تا 1 ساعت رونویسی میشن




