یه مدل ۳۲۰ میلیاردی که حالا رو دو تا GPU جا میشه
خلاصهٔ کاملتر
GLM 5.3 Flash یه مدل زبانی-تصویری ۳۲۰ میلیارد پارامتریه از آزمایشگاه Z.ai (سازندهٔ خانوادهٔ مدلهای GLM) که هم عکس میفهمه هم متن. تو دقت کامل، نگهداری وزنهاش تنها حدود ۳۲۰ گیگابایت فضا میخواد که عملاً بیرون از دیتاسنتر قابل اجرا نیست. یه گروه پژوهشی مستقل تو اتریش با دو تکنیک کوانتیزیشن (یعنی فشردهسازی اعداد داخل مدل) به اسم GSQ و RCO، همون مدل رو به زیر ۱۴۰ گیگابایت رسوندن، در حالی که رو یه بنچمارک ۲۰۰۰ سوالی فقط حدود دو امتیاز از نسخهٔ کامل عقب میمونه.
کوانتیزیشن یعنی کوچیک کردن هر عدد داخل مدل از ۱۶ بیت به چیزی مثل ۴ بیت یا کمتر. بیشتر روشهای کوانتیزیشن هر عدد رو فقط به نزدیکترین مقدار مجاز گرد میکنن و رد میشن. GSQ بهجای این کار، برای هر وزن چندتا گزینهٔ گرد کردن رو امتحان میکنه، میبینه کدوم عملکرد مدل رو بهتر نگه میداره و بعد همونو نهایی میکنه؛ یعنی بهجای حدس زدن، واقعاً تست میکنه. این کار رو سطح تکتک وزنهای مدل انجام میشه.
RCO یه سطح بالاتر کار میکنه: تصمیم میگیره هر لایهٔ مدل چقدر از یه بودجهٔ بیت ثابت (اینجا ۱۳۷ گیگابایت) رو بگیره. لایههای حساستر بودجهٔ بیشتر میگیرن و لایههای کماهمیتتر بیشتر فشرده میشن، تا کل مدل دقیقاً به سایز هدف برسه. اول RCO بودجهٔ هر لایه رو مشخص میکنه، بعد GSQ همون بودجه رو برای تکتک وزنهای اون لایه بهینه خرج میکنه.
نتیجهٔ نهایی تو قالب GGUF ذخیره میشه، همون فرمتی که ابزارهایی مثل llama.cpp برای اجرای مدلهای کوانتیزهشده میفهمن. حتی بعد از این فشردهسازی، اجرای مدل هنوز سختافزار جدی میخواد: تو تست این پروژه از دو تا GPU H100 با ۸۰ گیگابایت رم هرکدوم استفاده شده تا مدل ۱۳۷ گیگابایتی رو بینشون تقسیم کنن. کامپایل کردن llama.cpp با ۱۶ هستهٔ CPU حدود ۱۵ تا ۲۰ دقیقه طول کشیده.
رو تستهای تصویری، مدل کوانتیزهشده خوب جواب داد و تونست یه عکس از شفق قطبی رو با HTML و CSS بازسازی کنه و ترکیب رنگها و طرح کلی صحنه رو حفظ کنه. تو تست چندزبانه نتیجه ناهمگون بود: تو زبانهای پرکاربرد خوب کار کرد ولی تو زبانهای کممنبع ضعیفتر بود و گاهی تکرار یا لوپ میزد، ضعفی که به گفتهٔ نویسنده از خود مدل اصلی GLM 5.3 به ارث رسیده، نه از کوانتیزیشن. تو یه مسئلهٔ استدلالی ترکیبی هم جواب درست رو داد ولی کندتر از نسخهٔ کوانتیزهنشده بود.
نکات کلیدی:
- مدل ۳۲۰ میلیارد پارامتری از ۳۲۰ گیگابایت به زیر ۱۴۰ گیگابایت فشرده شده
- افت کیفیت فقط حدود دو امتیاز رو یه بنچمارک ۲۰۰۰ سوالی
- GSQ سطح تکتک وزنها رو بهینه میکنه، RCO بودجهٔ بیت هر لایه رو تعیین میکنه
- اجرا هنوز به دو GPU H100 هشتادگیگی نیاز داره
- تو زبانهای کممنبع و استدلال طولانی هنوز ضعف داره




