Live API گوگل: مکالمهٔ صوتی زنده با Gemini
خلاصهٔ کاملتر
تو مستندات گوگل اومده که Live API برای تعامل صوتی و تصویری بلادرنگ با Gemini ساخته شده. بهجای اینکه هر بار یه درخواست جدا بفرستی، یه اتصال پایدار WebSocket باز میمونه و جریان پیوستهٔ صدا، عکس و متن از توش رد میشه. ورودی صوتی خام PCM شانزدهبیتی با نرخ ۱۶ کیلوهرتز و تصویر حداکثر یک فریم بر ثانیه JPEG قبول میشه و خروجی هم صدای PCM با نرخ ۲۴ کیلوهرتزه.
چیزی که این API رو از یه چتبات صوتی معمولی جدا میکنه، رفتار طبیعی مکالمهست. با barge-in کاربر هر وقت خواست میتونه وسط حرف مدل بپره، affective dialog لحن جواب رو با حالوهوای گوینده هماهنگ میکنه و proactive audio تعیین میکنه مدل اصلاً کِی جواب بده. رونویسی متنی ورودی و خروجی، فراخوانی تابع و جستوجوی گوگل هم در دسترسه؛ همهش روی ۷۰ زبان.
برای وصل شدن دو مسیر هست: سروربهسرور که بکاند خودت به Live API وصل میشه و دادههای کلاینت رو براش فوروارد میکنه، و کلاینتبهسرور که فرانتاند مستقیم و با توکن موقت وصل میشه و بکاند رو دور میزنه. گوگل برای هرکدوم راهنمای جدا گذاشته و Agent Development Kit رو هم برای ساخت ایجنت استریمی معرفی کرده.
به گفتهٔ گوگل کاربردهاش از دستیار خرید و NPC بازی تا همراه سلامت، مشاور مالی و ترجمهٔ همزمان صدابهصدا رو میگیره. اگه هم نمیخوای از صفر با WebSocket سروکله بزنی، یکپارچهسازیهای آمادهای مثل LiveKit، Pipecat، Agora و Firebase AI Logic هستن. بالای همین صفحه گوگل یادآوری کرده که Interactions API حالا عمومی شده و برای دسترسی به تازهترین مدلها و امکانات همون رو پیشنهاد میکنه.
نکات کلیدی:
- اتصال پایدار WebSocket برای استریم همزمان صدا، تصویر و متن
- پشتیبانی از ۷۰ زبان، پریدن وسط حرف مدل و تنظیم لحن بر اساس حالت کاربر
- دو مدل پیادهسازی: سروربهسرور و کلاینتبهسرور با توکن موقت
- یکپارچهسازی آمادهٔ LiveKit، Pipecat، Agora و Firebase AI Logic
- گوگل برای امکانات تازهتر، Interactions API رو پیشنهاد میکنه




