gpt-realtime-translate: ترجمه زنده گفتار با هوش مصنوعی
خلاصهٔ کاملتر
مدل gpt-realtime-translate یه مدل ترجمه گفتار به گفتار (speech-to-speech) بلادرنگه که OpenAI برای تجربههای صوتی چندزبانه ارائه داده. این مدل صدای گفتاری رو میگیره، زبان منبع رو خودکار تشخیص میده، و هم صدای ترجمهشده هم متن پیادهشده رو برمیگردونه. توسعهدهنده فقط باید زبان خروجی موردنظر رو مشخص کنه.
دو ویژگی اصلی این مدل رو از مدلهای عمومی متمایز میکنه: اول اینکه روی هزاران ساعت صدای مترجمان حرفهای آموزش دیده، پس فقط ترجمه میکنه و به دستورالعملهای احتمالی درون گفتار پاسخ نمیده. دوم اینکه میتونه همزمان با دریافت صدای ورودی، صدای ترجمهشده رو هم استریم کنه — این یعنی تأخیر (latency) واقعاً پایین در مکالمات پیوسته.
برای اتصال به این مدل از endpoint اختصاصی /v1/realtime/translations استفاده میشه. مدل از پروتکل WebRTC برای اپهای مرورگری و WebSocket برای پایپلاینهای سمت سرور پشتیبانی میکنه. صدا به فرمت PCM16 با نرخ نمونهبرداری ۲۴ کیلوهرتز ارسال میشه و صدای ترجمهشده در قطعههای ۲۰۰ میلیثانیهای برمیگرده. برخلاف مدلهای Realtime معمولی، هیچ چرخه نوبت (turn lifecycle) یا مدیریت وضعیت مکالمهای وجود نداره.
یه ویژگی جالب دیگه dynamic voice adaptation هست — به جای اینکه یه صدای ثابت انتخاب بشه، مدل لحن، زیر و بمی، و سبک گفتاری گوینده اصلی رو دنبال میکنه. در جلسات چندنفره، صدای ترجمهشده با تغییر گوینده عوض میشه.
سه سناریوی اصلی برای استفاده از این مدل معرفی شده: ترجمه تب مرورگر (پخش زنده، وبینار، کلاس آنلاین) با getDisplayMedia()، ترجمه تماس تلفنی با Twilio Media Streams، و ترجمه ویدیوکال گروهی با LiveKit. مدل بیش از ۷۰ زبان ورودی و ۱۳ زبان خروجی رو پشتیبانی میکنه.
نکات کلیدی:
- مدل
gpt-realtime-translateفقط برای ترجمه بهینهشده — برای ساخت ایجنتهای صوتی ازgpt-realtime-2استفاده کنید - زبان خروجی با
session.audio.output.languageتنظیم میشه - ترجمه همزمان با دریافت صدا استریم میشه، بدون نیاز به مکث گوینده
- API کلید OpenAI باید سمت سرور بمونه؛ در مرورگر از client secret کوتاهمدت استفاده کنید
- برای رونویسی متنی از زبان منبع، باید
gpt-realtime-whisperرو جداگانه تنظیم کرد




