Qwen3.8 با ۲.۴ تریلیون پارامتر وزنباز شد
خلاصهٔ کاملتر
تو معرفی رسمی اومده که Qwen3.8-2.4T-A95B اولین مدل کلاس Qwen-Max هست که وزنهاش باز منتشر میشه. یه مدل ترکیب متخصصها (MoE) با ۲.۴ تریلیون پارامتر کل و ۹۵ میلیارد پارامتر فعال بهازای هر توکن، با ۹۲ لایه و بُعد پنهان ۸۱۹۲. کوئن میگه تمرکزش روی کدنویسی، پژوهش حرفهای و کارهای عاملی طولانیمدته.
چیدمان لایهها یه الگوی تکرارشوندهست: سه بلوک Gated DeltaNet همراه با MoE و بعد یه بلوک Gated Attention همراه با MoE، که ۲۳ بار تکرار میشه. یعنی بهجای یه مکانیزم توجه واحد، توجه خطی و توجه گیتدار کنار هم کار میکنن؛ همین هم یکی از دلایل مدیریت بهتر متنهای خیلی بلنده. بخش MoE هم ۵۱۲ متخصص داره که برای هر توکن ۱۰ متخصص مسیریابیشده بهعلاوهٔ ۱ متخصص مشترک فعال میشن.
همین طراحی دلیل ارزونبودن محاسبهٔ هر توکنه، ولی معاملهش حافظهست: با اینکه فقط ۹۵ میلیارد پارامتر محاسبه میشه، برای اجرا باید کل ۲.۴ تریلیون پارامتر تو حافظه لود بشه. وزنها تو ۲۱۳ شارد safetensors منتشر شدن و با vLLM و SGLang سازگارن، پس عملاً بدون کلاستر چند-GPU سراغش نمیشه رفت.
تو جدولهای منتشرشده، Qwen3.8-Max تو Terminal Bench 2.1 نمرهٔ ۸۶.۶ گرفته، جلوتر از Opus 4.8 و Fable 5 (هر دو ۸۴.۶) ولی عقبتر از GPT 5.6 Sol max با ۸۸.۸. تو PaperBench با ۹۳.۰ سرگروهه، ولی تو DeepSWE 1.1 با ۵۶.۶ عقب میافته. جهش نسبت به نسل قبلی خودش بزرگ و یکدستهست؛ مثلاً همون DeepSWE از ۲۱.۶ به ۵۶.۶ و FrontierSWE از ۴۰.۷ به ۷۳.۵ رسیده.
فرق نسخهٔ وزنباز با Qwen3.8-Max اینه که نسخهٔ میزبانیشده ورودی تصویری، حالت بدون تفکر، کانتکست پیشفرض یک میلیون توکن و ابزارهای داخلی داره. این نسل پارامتر reasoning_effort رو هم معرفی میکنه که عمق استدلال رو تنظیم میکنه، و گزینهٔ preserve_thinking که استدلال نوبتهای قبلی رو نگه میداره — هر دو دقیقاً به درد کارهای عاملی چندمرحلهای میخورن.
نکات کلیدی:
- ۲.۴ تریلیون پارامتر کل، ۹۵ میلیارد فعال بهازای هر توکن
- کانتکست بومی ۲۶۲٬۱۴۴ توکن، قابل گسترش تا حدود ۱٬۰۱۰٬۰۰۰ توکن
- ترکیب Gated DeltaNet و Gated Attention بهجای یه مکانیزم توجه واحد
- ۵۱۲ متخصص، با ۱۰ مسیریابیشده و ۱ مشترک برای هر توکن
- انتشار در ۲۱۳ شارد safetensors، سازگار با vLLM و SGLang
- reasoning_effort و preserve_thinking برای کنترل عمق و حفظ استدلال




