Qwen3.8: اولین مدل ردهMax علیبابا با وزن باز
خلاصهٔ کاملتر
تو این مقاله اومده که علیبابا مدل Qwen3.8-2.4T-A95B رو روی Hugging Face و با وزن باز منتشر کرده و این اولین باره که یه مدل همردهٔ خط تجاری Qwen-Max به شکل باز بیرون میآد. معماریش mixture-of-experts هست: ۲.۴ تریلیون پارامتر کل، ولی برای هر توکن فقط ۹۵ میلیارد پارامتر فعال میشه. کانتکست بومیش ۲۶۲٬۱۴۴ توکنه و تا حدود یک میلیون توکن هم گسترش پیدا میکنه. با vLLM و SGLang هم سازگاره.
از نظر ساختار، مدل ۹۲ لایه و بعد پنهان ۸۱۹۲ داره و یه الگوی تکرارشونده رو دنبال میکنه: سه بلوک Gated DeltaNet (توجه خطی) و بعدش یه بلوک Gated Attention معمولی، ۲۳ بار پشت سر هم. ایدهٔ این ترکیب اینه که صرفهجویی محاسباتی توجه خطی برای دنبالههای بلند رو بگیره ولی هر چند لایه یه بار با توجه کامل، دقت بازیابی رو حفظ کنه. لایهٔ MoE هم بین ۵۱۲ متخصص مسیریابی میکنه و ۱۰ متخصص بهعلاوهٔ ۱ متخصص مشترک رو روشن میکنه.
تو جدول بنچمارکی که خود علیبابا داده، نسخهٔ میزبانیشده یعنی Qwen3.8-Max تو Terminal Bench 2.1 نمرهٔ ۸۶.۶ میگیره؛ جلوتر از Opus 4.8 و Fable 5 (هر دو ۸۴.۶) و عقبتر از GPT 5.6 Sol با ۸۸.۸. تو PaperBench با ۹۳.۰ بالاترین نمرهٔ جدوله و تو FrontierSWE هم با ۷۳.۵ جلو میافته، ولی تو DeepSWE 1.1 با ۵۶.۶ از هر سه رقیب بسته عقب میمونه.
به گفتهٔ نویسنده، خبر اصلی بیشتر از مقایسه با رقبا، فاصلهایه که این مدل با نسل قبلی خودش گرفته: DeepSWE 1.1 از ۲۱.۶ به ۵۶.۶ رسیده، FrontierSWE از ۴۰.۷ به ۷۳.۵ و Terminal Bench از ۷۴.۵ به ۸۶.۶. یعنی علیبابا فقط یه مدل بزرگتر نداده، تو یه پرش نسخه بخش زیادی از فاصلهش با مدلهای بستهٔ صدرنشین رو پر کرده.
هزینهٔ این ماجرا حافظهست. تو MoE هزینهٔ محاسبات هر توکن به پارامترهای فعال بستگی داره، ولی همهٔ ۲.۴ تریلیون پارامتر باید یه جایی در دسترس بمونه؛ وزنها روی Hugging Face تو ۲۱۳ شارد safetensors پخش شدن و اجرای واقعیش چند GPU یا چند نود میخواد. برای همینم علیبابا نسخهٔ ابری Qwen3.8-Max رو مسیر عملیتر معرفی میکنه؛ نسخهای که ورودی تصویری، حالت بدون فکر، کانتکست پیشفرض یک میلیونی و ابزارهای داخلی هم داره.
نکات کلیدی:
- ۲.۴ تریلیون پارامتر کل، ۹۵ میلیارد فعال برای هر توکن با مسیریابی بین ۵۱۲ متخصص
- کانتکست بومی ۲۶۲٬۱۴۴ توکن، قابل گسترش تا حدود ۱٬۰۱۰٬۰۰۰ توکن
- ترکیب Gated DeltaNet با Gated Attention تو الگوی سهبهیک، ۲۳ بار تکرار
- جلو تو PaperBench (۹۳.۰) و FrontierSWE (۷۳.۵)، عقب تو DeepSWE 1.1 (۵۶.۶)
- جهش بزرگ نسبت به Qwen3.7-Max تقریباً تو همهٔ بنچمارکهای کدنویسی و ایجنتی
- خودمیزبانی عملاً کلاستر چندنودیه؛ برای بیشتر تیمها Qwen Cloud مسیر واقعبینانهتره




