مدل ۲۷ میلیارد پارامتری Qwen3 حالا تو ۱۰ گیگ جا میشه
خلاصهٔ کاملتر
Escha Labs یه نسخهٔ کوانتیزهٔ ۲ بیتی از Qwen3.8-27B منتشر کرده به اسم Escha-W2 که کل مدل ۲۷میلیاردپارامتری رو تو ۱۰.۱۵ گیگابایت جا داده؛ در حالی که نسخهٔ معمولیش چندین برابر این حجمو لازم داره. این کوچیکسازی یعنی کل مدل، حافظهٔ KV cache و یه context window قابلقبول رو میشه رو یه کارت گرافیک مصرفی ۲۴ گیگابایتی مثل RTX 3090 یا 4090 جا داد، اونم با تنظیمات درست تا ۱۲۸هزار توکن context.
معمولاً وقتی وزنهای یه مدل رو از ۱۶ یا ۸ بیت به ۲ بیت میریزی، کیفیت خروجی خصوصاً تو استدلال چندمرحلهای افت میکنه. Escha-W2 با یه ترکیب ۲ بیتی و ۳ بیتی رو لایههای مختلف (میانگین ۲.۴۶۹ بیت به ازای هر وزن) و نگهداشتن embedding و لایهٔ خروجی رو int8 جلوی این افتو گرفته. طبق بنچمارک خود سازنده در مقایسه با نسخهٔ FP8، این مدل تو استدلال عمومی حتی جلوتره، تو GPQA-Diamond فقط یه سؤال عقبه، و تو LiveCodeBench هم تقریباً همسطحه.
دلیل اینکه این مدل رو یه GPU جا میشه فقط کوانتیزیشن نیست؛ معماری Qwen3.8-27B خودش هیبریده و فقط ۱۶ تا از ۶۴ لایهش attention کامل دارن، بقیه از یه مکانیزم به اسم gated-delta-net استفاده میکنن که حافظهٔ داخلیش (حدود ۰.۱۵ گیگابایت) با بزرگتر شدن context رشد نمیکنه. همین باعث میشه KV cache به ازای هر توکن فقط ۶۴ کیلوبایت باشه، در حالی که یه مدل معمولی با attention کامل رو همهٔ لایهها چهار برابر این مقدار حافظه میخواد.
اجرای این مدل ساده نیست: چون فرمت کوانتیزیشنش به کرنلهای دیکد سفارشی نیاز داره، باید یه رانتایم جدا بر پایهٔ SGLang به اسم escha-runtime-qwen3dense نصب کنی که به یه نسخهٔ خاص از PyTorch گیره و نباید کنارش SGLang معمولی از PyPI نصب بشه. یه نکتهٔ عملی مهم اینه که prefix caching فقط رو پرامپتهای کاملاً تکراری کار میکنه، نه رو مکالمههایی که هی طولانیتر میشن، چون حافظهٔ لایههای SSM از وسط راه قابلازسرگیری نیست.
نکات کلیدی:
- Escha-W2 مدل Qwen3.8-27B رو با میانگین ۲.۴۶۹ بیت به ازای هر وزن تو ۱۰.۱۵ گیگابایت فشرده کرده
- رو RTX 3090، 4090 و 5090 تست شده و رو یه کارت ۲۴ گیگابایتی تا ۱۲۸هزار توکن context میده
- نیاز به CUDA 12.8، پایتون ۳.۱۲ و رانتایم اختصاصی escha-runtime-qwen3dense داره
- کیفیت long-context بالای ۶۴هزار توکن هنوز بهطور مستقل تست نشده




