معماری Qwen4 زودتر از خودش رسید
خلاصهٔ کاملتر
تیم Qwen علیبابا مدل Qwen3.8-Flash-Next رو منتشر کرده، یه پیشنمایش open-weight از همون معماریای که قراره Qwen4 روش ساخته بشه. مدل ۱۲۵ میلیارد پارامتر داره ولی برای تولید هر توکن فقط ۶ میلیاردش شلیک میشه. برای مقایسه، Qwen3.7-Plus خودشون ۳۹۷ میلیارد پارامتر داره و ۱۷ میلیارد رو فعال میکرد، یعنی این یکی تقریباً با یکسوم محاسبات فعال کار میکنه.
ادعا سر توانایی نیست، سر هزینهست. به گفتهٔ تیم، نگرانی اصلیشون اینه که انتخابهای معماری چه بلایی سر صورتحساب inference (یعنی هزینهٔ اجرای مدل موقع پاسخ دادن) میاره، حالا که کارهای ایجنتی با کانتکست خیلی بلند دارن به بار کاری عادی تبدیل میشن.
سهتا از چهار تغییر معماری نسبتاً متعارفن: یه اسکیم sparse attention که بهجای انتخاب تکتک توکنها روی میکروبلاک کار میکنه، یه مکانیزم gated residual که کنترل میکنه چی بین لایهها رد بشه، و رسپی آموزشی که warmup اندازهٔ بچ رو کلاً حذف کرده. تغییر چهارم عجیبه: بهجای اضافه کردن expert، مدل ۵۱ میلیارد پارامتر رو به شکل یه embedding جدا میچسبونه که با قطعههای دو و سهکاراکتری ایندکس میشه.
تیم میگه این کار محاسبات کمتری میخواد و راحتتر میشه روی شتابدهندههای کمحافظه offload کرد. نویسنده میگه همین جملهٔ آخر ارزش دوبار خوندن داره، چون طراحی برای شتابدهندهٔ کمحافظه کاریه که وقتی میکنی که نتونی بهترین چیپها رو بخری، و این دقیقاً جاییه که تحریمهای صادراتی آزمایشگاههای چینی رو گذاشتن.
سر اعداد باید محتاط بود، چون همهشون مال خود علیباباست. TNW قبلاً نوشته بود که شرکت Qwen3.8 رو دومین مدل برتر دنیا خونده بدون اینکه مدرکی نشون بده، و این امتیازها هم باز از هارنس خود تیم اومدن. یه نکتهٔ نسبتاً صادقانه هم تو کارت مدل هست: امتیاز Humanity's Last Exam رو بهجای گریدر خود بنچمارک، GPT-4o داده که افشاگریه، نه بیطرفی.
چیزی که برای اروپا سؤالبرانگیزه لایسنسه. وزنها روی Hugging Face زیر لایسنس qwen-community نشستن و TNW هفتم آگوست گزارش داد علیبابا میخواد از بزرگترین کاربرهای تجاریش پول بگیره. ماده ۵۳(۲) قانون هوش مصنوعی اروپا دو تکلیف مستندسازی رو برای مدلهای با لایسنس آزاد و متنباز برمیداره، ولی بند ۱۰۳ میگه اجزایی که در ازای پول عرضه میشن نباید معافیت بگیرن. Thomson Reuters هم مدلش رو روی Qwen ساخته و سرنوشت اون لایسنس رو به ارث میبره.
نکات کلیدی:
- Qwen3.8-Flash-Next: ۱۲۵ میلیارد پارامتر کل، ۶ میلیارد فعال به ازای هر توکن
- Qwen3.7-Plus برای مقایسه ۳۹۷ میلیارد پارامتر و ۱۷ میلیارد فعال داشت
- ۵۱ میلیارد پارامتر به شکل embedding جدا با ایندکس قطعههای دو و سهکاراکتری
- امتیاز Humanity's Last Exam با GPT-4o گرید شده، نه گریدر رسمی بنچمارک
- لایسنس qwen-community و برنامهٔ علیبابا برای پول گرفتن از کاربرهای بزرگ تجاری
- ماده ۵۳(۲) و بند ۱۰۳ AI Act معافیت متنباز رو برای مدلهای درآمدزا زیر سؤال میبرن




