Escha-W2: مدل ۲۷ میلیاردی Qwen3.8 روی یه GPU خونگی
خلاصهٔ کاملتر
Escha Labs یه نسخهٔ فشردهشدهٔ ۲ بیتی از Qwen3.8-27B به اسم Escha-W2 منتشر کرده. وزنهای این مدل که معمولاً با دقت ۱۶ بیت حدود ۵۴ گیگابایت جا میگیرن، اینجا با ترکیب ۲ و ۳ بیت (میانگین ۲٫۴۶۹ بیت بهازای هر وزن) به فقط ۱۰٫۱۵ گیگابایت رسیدن. این یعنی کل مدل بههمراه KV cache (یعنی حافظهٔ موقتی که مدل برای پردازش کانتکست نگه میداره) و یه کانتکست ۶۴هزار توکنی، تو یه کارت گرافیک ۲۴ گیگ معمولی جا میشه.
دلیل اصلی اینکه کانتکست طولانی اینقدر ارزون تموم میشه، بیشتر معماریه تا کوانتیزیشن. از ۶۴ لایهٔ مدل، فقط ۱۶ تاش اتنشن کامل انجام میدن و بقیه از یه مکانیزم به اسم gated-delta-net استفاده میکنن که برای هر استریم فقط یه مقدار ثابت حافظهٔ بازگشتی (حدود ۰٫۱۵ گیگابایت) نگه میداره، فارغ از طول کانتکست. نتیجهش اینه که KV cache این مدل حدود یهچهارم چیزیه که یه مدل معمولی با اتنشن کامل رو همهٔ لایهها لازم داره.
نصبش سه بخش داره: یه نسخهٔ مشخص از PyTorch (۲٫۹.x)، یه رانتایم اختصاصی از Escha Labs که یه فورک از SGLang رو با خودش داره، و خود وزنهای مدل. طبق مستندات، نباید sglang رو جدا از PyPI نصب کرد چون با رانتایم اختصاصی تداخل پیدا میکنه. سه متغیر محیطی MEM، CTXLEN و MAMBA_RATIO هم مشخص میکنن حافظهٔ GPU چطور بین وزنها، KV cache و حافظهٔ بازگشتی تقسیم بشه؛ چون این سه از یه استخر مشترک تغذیه میشن، تنظیم برای کانتکست خیلی بلند یعنی فدا کردن تعداد استریم همزمان.
روی RTX 4090 با تنظیمات پیشفرض، مدل با کانتکست ۶۴هزار توکنی حدود ۶۷ توکن در ثانیه میده و ۱۸ گیگابایت VRAM مصرف میکنه؛ با تنظیم توانبالا همون کارت به ۶۴۹ توکن در ثانیه رو ۱۶ استریم میرسه. رو RTX 5090 با ۳۲ گیگ VRAM، عدد به ۹۵۵ توکن در ثانیه رو ۱۶ استریم میرسه. بیشترین کانتکست ممکن رو کارت ۲۴ گیگ هم ۱۳۱۰۷۲ توکنه، که یه پرامپت ۱۲۰هزار توکنی رو تو ۶۸ ثانیه پردازش میکنه.
نکات کلیدی:
- Escha-W2 نسخهٔ ۲ بیتی Qwen3.8-27B هست، حدود ۱۰٫۱۵ گیگابایت بهجای ۵۴ گیگابایت نسخهٔ اصلی
- با معماری هیبریدی (۱۶ لایهٔ اتنشن کامل از ۶۴ تا) روی یه کارت ۲۴ گیگ میشه تا ۱۲۸هزار توکن کانتکست داشت
- RTX 4090 پیشفرض حدود ۶۷ توکن در ثانیه میده، با تنظیم توانبالا تا ۶۴۹ توکن در ثانیه
- پیشکش پرامپت (RADIX=1) فقط برای پرامپتهای عیناً تکراری کار میکنه، نه مکالمههای در حال رشد
- نصب نیازمند PyTorch نسخهٔ ۲٫۹.x و رانتایم اختصاصی Escha Labs هست؛ sglang نباید جدا از PyPI نصب بشه




