Escha-W2: کوئن ۳۵ میلیاردی توی ۱۲ گیگ
خلاصهٔ کاملتر
Escha-W2 یه بیلد ۲ بیتی از مدل Qwen3.6-35B-A3B هست؛ مدلی از خانوادهٔ Mixture-of-Experts با ۲۵۶ متخصص. تو معرفی اومده که کل بسته ۱۲.۳ گیگابایت روی دیسک جا میگیره و با یه سرور سازگار با OpenAI روی پورت 30000 بالا میاد. حداقل سختافزار یه کارت ۱۶ گیگی مثل RTX 5060 Ti هست، ولی ۲۴ گیگ توصیه شده؛ روی ۱۶ گیگ باید بین طول کانتکست و تعداد درخواست همزمان یکی رو انتخاب کنی، چون هر دو از یه استخر KV مشترک برمیدارن.
جالبترین بخش، هزینهٔ کیفیته. تیم سازنده نتایج رو با یه بیسلاین FP8 مقایسه کرده که خودش حدود ۳۵ گیگ حافظه میخواد: میانگین شش محور ۸۲.۳ در برابر ۸۲.۱، یعنی عملاً مساوی. MMLU-Pro یکونیم واحد پایینتره، ریاضی و GPQA کمی بالاتر، و ابزار و کانتکست بلند تقریباً بدون افت موندن. تنها شکاف واقعی تولید کد بلندمدته: LiveCodeBench v6 با ۴.۴ واحد افت، که سازنده هم اونو تنها نقطهٔ ضعف ظرفیتی این بیلد میدونه.
برای سرو کردن دو موتور وجود داره. sglang گزینهٔ پیشفرضه و همهٔ عددهای این صفحه باهاش گرفته شده — تنها موتوری که همزمانی، tool calling و خروجی ساختاریافته رو پشتیبانی میکنه. zml یه باینری تکفایل بدون پایتونه که روی جوابهای بلند ۱۵ تا ۲۶ درصد سریعتر دیکد میکنه، ولی فقط تککاربره، برتریش فقط تو حالت greedy با دمای صفر ظاهر میشه، و روی کارت ۱۶ گیگی با پرامپت بلند شکست میخوره.
روی RTX 4090 سرعت دیکد تککاربر ۲۲۵ توکن بر ثانیه و اوج توان سرور ۱۳۲۱ توکن بر ثانیه با ۳۲ استریم اندازهگیری شده؛ 5090 به ۲۸۳ و حدود ۲۶۷۰ میرسه و 3090 کندترینه با ۱۵۴. به گفتهٔ سازنده سه تنظیم بیشترین اثر رو داره: گرافهای CUDA حتماً باید روشن باشن چون حالت eager روی این معماری حدود ۴.۴ برابر کندتره، غیرفعال کردن کش پیشوندی حدود ۲۰٪ دیکد تکاستریم میارزه، و لیست batch سایزهای گراف باید بزرگترین batch واقعی رو شامل بشه.
یه هشدار عملی هم داده شده که ارزش خوندن داره: اگه خروجی مدل روون ولی بیمعنی بود، اول نسخهٔ transformers رو چک کن. زیر نسخهٔ ۵.۸ سرور بالا میاد و فقط یه warning میده، ولی با پارامترهای معماری اشتباه سرو میکنه. این چکپوینت فقط متنیه و نباید بهش ورودی تصویری داد.
نکات کلیدی:
- بیلد ۲ بیتی Qwen3.6-35B-A3B با حجم ۱۲.۳ گیگابایت، اجراشدنی روی یه GPU خونگی ۱۶ تا ۲۴ گیگی
- میانگین شش محور بنچمارک ۸۲.۳ در برابر ۸۲.۱ برای FP8؛ تنها افت جدی تو LiveCodeBench
- دو موتور سرو: sglang برای همزمانی و ابزار، zml برای تککاربر بدون پایتون
- ۲۲۵ توکن بر ثانیه روی RTX 4090 و تا ۱۳۲۱ توکن بر ثانیه با ۳۲ استریم همزمان
- نسخهٔ transformers زیر ۵.۸ بدون خطا خروجی بیمعنی میده




