تست عملی Qwen3.8-LiveTranslate: ترجمه همزمان هنوز کامل نیست
خلاصهٔ کاملتر
Qwen3.8-LiveTranslate یه مدل ترجمه همزمانه که همون لحظه که طرف داره حرف میزنه، گفتارش رو به زبان دیگه به صورت متن و صدا برمیگردونه. از ۶۰ زبان پشتیبانی میکنه که ۲۹ تاش خروجی صوتی کامل دارن و بقیه فقط متنیان. فعلاً فقط از طریق API در دسترسه و خبری از نسخه open-source نیست.
معماریش یه mixture-of-experts ترکیبیه (یعنی مدلی که برای هر ورودی فقط بخشی از زیرمدلهاش فعال میشن) و دو تیکه داره. بخش «thinker» گفتار رو میگیره و متن اصلی و ترجمهش رو با هم stream میکنه، بدون اینکه منتظر تموم شدن جمله بمونه. بخش «talker» از اون خروجی صدا میسازه و سعی میکنه ویژگیهای صدای خود گوینده رو نگه داره. متن و صدا هم تقریباً همزمان تولید میشن، نه پشت سر هم.
سه قابلیتی که Qwen روش تأکید داره اینان: جدا کردن گویندهها و کپی صدای هر کدوم تو گفتگوی چندنفره، نشون دادن متن اصلی و ترجمه کنار هم، و استفاده از context قبلی گفتگو برای رفع ابهام. مثلاً اگه قبلاً اسم کامل کسی اومده باشه، بعداً لقبش رو به همون آدم وصل میکنه.
نویسنده مدل رو با API رسمی و اسکریپت نمونه خود Qwen و با میکروفون زنده تست کرده. جملههای کوتاه، مثل یه خط از دیالوگ دادگاه، خوب ترجمه شدن. ولی مشکل اصلی turn-taking بود، یعنی تشخیص اینکه گوینده کی حرفش تموم شده. خروجی گاهی وسط کار قطع میشد یا با تأخیر زیاد میرسید. قطع کردن مدل وسط صحبت برای اصلاح یا تغییر مسیر هم کار نکرد.
کیفیت خود ترجمه برای یه جمله ثابت تو روسی، عربی، هلندی، آلمانی، اردو، هندی، اندونزیایی، اسپانیایی، پرتغالی و فارسی خوب بود. اندونزیایی، اسپانیایی، پرتغالی و فارسی از همه تمیزتر بودن و اردو و هندی «قابل قبول». به گفته نویسنده، موتور ترجمه قویه ولی سیستمی که دورش پیچیده شده حلقه ضعیفه. برای استفاده واقعی باید خودت یه pipeline برای تشخیص صدا، تقسیم نوبتها و مدیریت قطع صحبت دورش بسازی.
Qwen ادعا میکنه تو دقت، روانی و یکدستی با GPT Realtime Translate و Gemini 3.5 Live Translate برابره یا جلوتره. نرخ خطای diarization (یعنی تشخیص اینکه کدوم جمله رو کی گفته) هم حدود نصف GPT و یکسوم Gemini اعلام شده. نویسنده تأکید میکنه اینها عددهای خود Qwen هستن و مستقل بررسی نشدن.
نکات کلیدی:
- پشتیبانی از ۶۰ زبان، که ۲۹ تاش خروجی صوتی با صدای کپیشده گوینده دارن
- فعلاً فقط از طریق API، بدون زمانبندی مشخص برای انتشار open-source
- معماری mixture-of-experts با دو بخش thinker برای متن و talker برای صدا
- تو تست عملی، جملههای کوتاه خوب ترجمه شدن ولی turn-taking و قطع کردن وسط صحبت درست کار نکرد
- ادعای Qwen: نرخ خطای diarization حدود نصف GPT و یکسوم Gemini، بدون تأیید مستقل




