Ridge: مدل ۲۷ میلیاردی Qwen رو یه کارت خانگی
خلاصهٔ کاملتر
تو این مقاله اومده که تیم empero-ai یه نسخهٔ فشردهٔ Qwen3.8-27B رو با روشی به اسم Ridge منتشر کرده. Qwen3.8-27B یه مدل ۲۷ میلیارد پارامتریه که هم استدلال میکنه هم ورودی تصویری میگیره، و نسخهٔ کاملش حدود ۵۰ گیگابایت جا میگیره. Ridge اینو میرسونه به ۱۱.۷ گیگابایت، یعنی چیزی که تا دیروز چند تا GPU میخواست، حالا رو یه کارت گرافیک ۱۶ گیگی هم بالا میاد.
فرق Ridge با کوانتیزیشنهای معمولی مثل IQ2 اینه که به معماری مدل کار داره. بیشتر لایههای این مدل از GatedDeltaNet استفاده میکنن، یعنی یه جایگزین سریعتر برای attention که یه حافظهٔ عددی کوچیک از چیزی که تا حالا خونده نگه میداره، و هر چهار لایه یه بار هم attention کامل میاد. نویسنده میگه اگه اون مقادیر state رو زیادی فشرده کنی، مدل وسط تولید متن رشتهٔ کلام رو گم میکنه، حتی اگه حجم فایل رو کاغذ عالی باشه.
برای همین Ridge اون لایههای state رو با دقت بالاتر نگه میداره و در عوض لایههای feed-forward وسط شبکه رو محکمتر فشرده میکنه، چون اونا افت دقت رو خیلی بهتر تحمل میکنن. خروجی یه فایل GGUF به اسم Qwen3.8-27B-Ridge-3.7bpw.gguf با میانگین ۳.۷ بیت به ازای هر پارامتر (BPW) به جای ۱۶ بیت معموله، بهعلاوهٔ یه فایل mmproj جدا برای ورودی تصویر. تو تست با llama-server کمی زیر ۱۴ گیگابایت VRAM مصرف کرده.
تو تست کدنویسی، مدل با یه پرامپت و بدون هیچ کتابخونهٔ بیرونی یه انیمیشن تکفایلی HTML از رشد درخت از دونه ساخته، با برش لایههای خاک، ریشههایی که پایین میرن و بالا هم تاج درخت رشد میکنه، ذرات غبار و پسزمینهٔ غروب. البته بیشتر از ده دقیقه فکر کرده تا به جواب برسه. تو تست نویسندگی هم لحن مارک تواین رو خوب درآورده، ولی معمای منطقی پنهان تو پرامپت رو نگرفته، که به گفتهٔ نویسنده یه ایراد واقعی تو استدلاله نه فقط یه لغزش سبکی.
جمعبندی نویسنده اینه که برای کدنویسی، نوشتن و استدلال انگلیسی روی یه ماشین با VRAM محدود، Ridge الان یکی از بهترین گزینههای این خانوادهست. ولی بینقص نیست: تو تست بینایی، انگلیسی دستنویس رو درست خونده اما اردو و عربی رو کلاً از دست داده و مالایی رو با اندونزیایی قاطی کرده، و کیفیت ترجمهٔ چندزبانهش یه پله از نسخههای کمفشردهتر پایینتره. فایل روی Hugging Face و سازگار با llama.cpp منتشر شده.
نکات کلیدی:
- حجم مدل از حدود ۵۰ گیگابایت به ۱۱.۷ گیگابایت رسیده، با میانگین ۳.۷ بیت برای هر پارامتر
- Ridge لایههای state مربوط به GatedDeltaNet رو با دقت بالا نگه میداره و feed-forward رو بیشتر فشرده میکنه
- اجرا با llama-server زیر ۱۴ گیگابایت VRAM برده، پس رو کارت ۱۶ گیگی جا میشه
- برای ورودی تصویر باید فایل جدای mmproj-Qwen3.8-27B-BF16.gguf رو هم دانلود کنی
- تشخیص خط اردو و عربی و تفکیک مالایی از اندونزیایی هنوز ضعیفه
- منتشرکننده empero-aiه، همون تیم دیستیل ۹ میلیاردی Qwen3.8




