Qwen3.8-LiveTranslate: ترجمهٔ همزمان با صدای خود گوینده
خلاصهٔ کاملتر
Qwen3.8-LiveTranslate یه مدل ترجمهٔ همزمان (simultaneous interpretation) از تیم Qwen هست که حرف رو همون لحظه ترجمه میکنه و سعی میکنه هم هویت گوینده و هم لحن صداش حفظ بشه. ورودی رو از ۶۰ زبان قبول میکنه، ولی فقط ۲۹ تاش خروجی صوتی کامل دارن و بقیه فقط متن برمیگردونن. نویسنده میگه این فاصلهٔ ۳۱ زبانی مهمه و اگه محصولت خروجی صوتی لازم داره، قبل از ساختنش باید چک کنی زبان مقصدت تو کدوم دستهست.
معماری مدل یه mixture-of-experts ترکیبیه (یعنی چند زیرشبکهٔ متخصص که برای هر ورودی فقط بعضیهاشون فعال میشن) و دو نیمه داره. بخش thinker زبان مبدأ و ترجمهش رو همزمان استریم میکنه و منتظر تموم شدن جمله نمیمونه. بخش talker هم گفتار رو با صدای خود گوینده میسازه، نه یه صدای مصنوعی عمومی. صدا و متن به شکل درهمتنیده تولید میشن، نه پشتسرهم، تا تأخیر بین شنیدن و ترجمه کم بشه.
سه تا قابلیت دیگه هم داره. میتونه گویندههای مختلف رو از هم جدا کنه و صدای هر کدوم رو جدا شبیهسازی کنه. متن اصلی و ترجمه رو کنار هم و همزمانشده نشون میده که برای زیرنویس به درد میخوره. از زمینهٔ قبلی گفتوگو هم برای رفع ابهام استفاده میکنه، مثلاً یه اسم مستعار رو به اسم کامل یه نفر که قبلاً اومده وصل میکنه.
الان تنها راه دسترسی API خود Qwen هست. نسخهٔ open-weight نداره و تاریخی هم براش اعلام نشده، برخلاف خیلی از مدلهای دیگهٔ Qwen. یعنی نه میتونی لوکال اجراش کنی نه fine-tune. تو تست مستقل با اسکریپت خود Qwen، جملههای کوتاه خوب ترجمه شدن و اندونزیایی، اسپانیایی و فارسی نتیجهٔ خوبی داشتن. ولی تو یه گفتوگوی رفتوبرگشتی، مدل نمیفهمید نوبت یه نفر کِی تموم شده و قطع کردن وسط حرف هم درست کار نکرد. پس تشخیص نوبت و منطق استریم رو باید خودت دور API بنویسی.
Qwen میگه تو معیارهای وفاداری، روانی و ثبات، همسطح یا بهتر از ترجمهٔ زندهٔ GPT و Gemini هست. نرخ خطای diarization (یعنی اشتباه تو تشخیص اینکه کی داره حرف میزنه) رو هم حدوداً نصف GPT و یکسوم Gemini گزارش کرده. نویسنده میگه اینها عددهای خود سازندهست و تجربهٔ عملی تو مکالمهٔ پیوسته عقبتر از تبلیغاته. به نظرش این مدل یه شروع زودهنگام و بلندپروازانهست. برای کارهای کوتاه مثل دکمهٔ push-to-talk یا زیرنویس کلیپهای تیکهتیکه خوبه، ولی برای مترجم زندهٔ گفتوگو کلی کار مهندسی لازمه.
نکات کلیدی:
- ورودی ۶۰ زبان، ولی خروجی صوتی فقط برای ۲۹ زبان.
- فقط از طریق API در دسترسه و نسخهٔ open-weight نداره.
- معماری MoE با دو بخش thinker برای استریم ترجمه و talker برای ساخت صدا.
- جملههای کوتاه خوب ترجمه میشن، ولی تشخیص پایان نوبت و قطع حرف درست کار نمیکنه.
- Qwen نرخ خطای diarization رو حدود نصف GPT و یکسوم Gemini گزارش کرده، که عدد خود سازندهست.




