فشردهسازی مدل ۲۷ میلیاردی Qwen3.8 بدون افت کیفیت
خلاصهٔ کاملتر
آزمایشگاه Das تو مؤسسه علوم و فناوری اتریش (ISTA)، همون تیمی که GPTQ رو ساخته، دو روش جدید فشردهسازی وزن به اسم GSQ و RCO معرفی کرده و اونها رو روی مدل ۲۷ میلیاردی Qwen3.8-27B تست کرده. نتیجه، نسخههایی به حجم ۸ تا ۱۲ گیگه که آزمایشگاه ادعا میکنه «بدون افت کارکرد»ن، یعنی با وجود کوچیکشدن شدید، عملکردشون رو بنچمارکهای واقعی به نسخه با دقت کامل خیلی نزدیکه.
GSQ (مخفف Gumbel Softmax Quantization) تکتک وزنهای مدل رو بررسی میکنه و برای هرکدوم تعداد بیت (۲، ۳ یا ۴ بیتی) رو انتخاب میکنه که کمترین آسیب رو به اون وزن خاص بزنه؛ چون بعضی وزنها فشردهسازی سنگین رو تحمل میکنن ولی بعضیها نه. حاصل کار GSQ یه نقشه حساسیت برای کل مدله. بعد RCO (مخفف Riemannian Constrained Optimization) با یه بودجه حافظه ثابت، مثلاً ۱۱.۸ گیگ، بیتها رو بین کل تنسورها تقسیم میکنه؛ به وزنهای حساس بیت بیشتر میده و به وزنهای مقاوم بیت کمتر، تا دقیقاً به سایز هدف برسه.
تو تست عملی با llama.cpp روی یه کارت RTX تکجیپییو با ۴۸ گیگ حافظه، نسخه ۱۱.۸ گیگ فقط کمی بیشتر از ۲۸ گیگ حافظه گرفته (با احتساب کش KV). این مدل یه انیمیشن HTML/کانواس از یه کباب دونر چرخان روی آتیش ساخته که تو همون تلاش اول، گرادیان شعله، سایهزنی و فیزیک چکهکردن روغن درست دراومده. تو یه کوئری SQL طولانی و تودرتو هم یه باگ منطقی مخفی (مرتبسازی صعودی بهجای نزولی) رو دقیقاً مثل مدل اصلی و بدون فشردهسازی پیدا کرده.
مدل یه مسئله چندمرحلهای شیمی هم حل کرده، شامل تعادل انحلالپذیری (Ksp)، اثر یون مشترک و موازنه جرم، و بدون هیچ توهم یا خطای استدلالی به جواب عددی درست رسیده. اینجور مسئلهها معمولاً با یه خطای کوچیک اولیه کل جواب رو خراب میکنن، پس رسیدن درست بهش نشونه خوبیه که فشردهسازی استدلال چندمرحلهای رو خراب نکرده.
نقطه ضعف اصلی، چندزبانگیه، ولی بهنظر میرسه از خود مدل پایه Qwen3.8 اومده نه از فشردهسازی. تو تست روی حدود ۷۵ زبان، زبانهای اصلی مثل چینی، اسپانیایی و عربی خوب جواب دادن ولی زبانهای کممنبع مثل توی و بلوچی ضعیف بودن؛ همین ضعف تو مدل اصلی هم هست.
نکات کلیدی:
- GSQ برای هر وزن بهترین بیتعمق (۲، ۳ یا ۴ بیتی) رو انتخاب میکنه و RCO این بیتها رو بین کل مدل با یه بودجه حافظه ثابت مثل ۱۱.۸ گیگ تقسیم میکنه.
- نسخه توصیهشده Qwen3.8-27B با حجم ۱۱.۸ گیگ روی یه کارت ۴۸ گیگی فقط حدود ۲۸ گیگ حافظه مصرف کرده.
- مدل فشرده یه باگ منطقی مخفی تو یه کوئری SQL تودرتو رو دقیقاً مثل نسخه اصلی پیدا کرده.
- مدل یه مسئله چندمرحلهای تعادل شیمیایی (Ksp) رو بدون توهم یا خطا حل کرده.
- ضعف چندزبانگی (قوی تو زبانهای اصلی، ضعیف تو زبانهای کممنبع) از مدل پایه اومده، نه از GSQ یا RCO.




