GLM-5.2 رو میشه لوکال اجرا کرد؛ حتی با کوانت ۱ بیتی
خلاصهٔ کاملتر
GLM-5.2، مدل باز جدید Z.ai، با ۷۴۴ میلیارد پارامتر (۴۰ میلیارد پارامتر فعال) و پنجرهٔ کانتکست ۱٬۰۴۸٬۵۷۶ توکنی اومده و روی کدنویسی طولانیمدت، استدلال و کارهای ایجنتی هدفگذاری شده. آنسلاث میگه این قویترین مدل باز تا امروزه و تو بنچمارکهای Artificial Analysis و خیلی جاهای دیگه پابهپای Claude Opus 4.8، GPT-5.5 و Gemini 3.1 Pro حرکت میکنه — مثلاً ۶۲.۱ روی SWE-bench Pro و ۸۲.۷ روی Terminal Bench 2.1.
نکتهٔ اصلی مطلب آنسلاث ولی خود مدل نیست، اجرای لوکالشه. نسخهٔ کامل حدود ۱.۵ ترابایت جا میگیره که عملاً از دسترس خارجه؛ با کوانتهای Unsloth Dynamic این عدد میاد پایین: کوانت ۲ بیتی UD-IQ2_M حدود ۲۳۹ گیگ فضا میخواد و روی یه مک با ۲۵۶ گیگ حافظهٔ یکپارچه یا یه GPU ۲۴ گیگی بهعلاوهٔ ۲۵۶ گیگ رم (با آفلود MoE) بالا میاد. کوانت ۱ بیتی با ۲۲۳ گیگ و ۸ بیتی با ۸۱۰ گیگ کار میکنه.
سؤال بدیهی اینه که اینهمه فشردهسازی چقدر مدل رو خراب میکنه. آنسلاث برای جوابدادن بنچمارک KLD (فاصلهٔ کولبک-لایبلر بین خروجی مدل اصلی و کوانتشده) گرفته: کوانت ۱ بیتی داینامیک حدود ۷۶.۲٪ دقت top-1 نگه میداره در حالی که ۸۶٪ کوچیکتره، و ۲ بیتی حدود ۸۲٪ با ۸۴٪ کاهش حجم. ترفندش اینه که لایههای مهم رو با دقت بالاتر نگه میداره و لایههای کماهمیت رو به بیت پایین میبره.
نویسنده تأکید میکنه این عددها بد تفسیر نشن: ۷۶٪ top-1 یعنی نمیگه «پایتخت فرانسه» ۲۴٪ مواقع سیدنی میشه. اون ۲۴٪ باقیمونده بیشتر سر کلمات پرکننده و شروع جملهست — مثلاً بهجای «I will now…» میگه «The novel is below:». یعنی خروجی غلط یا نامفهوم تولید نمیکنه، فقط توزیع انتخاب توکن کمی جابهجا میشه. کوانتهای ۴ و ۵ بیتی داینامیک هم عملاً بدون افت هستن.
برای اجرا دو مسیر پیشنهاد شده: Unsloth Studio (رابط وب متنباز که خودش آفلود روی رم و چند GPU رو تشخیص میده و پارامترهای inference رو خودکار تنظیم میکنه) یا مستقیم llama.cpp با فایلهای GGUF از هاگینگفیس. تنظیمات پیشنهادی برای اغلب کارها temperature = 1.0 و top_p = 0.95 ـه.
مدل سه حالت تفکر داره: بدون فکر، و دو سطح High و Max که برای کارهای پیچیده Max توصیه میشه. تو llama.cpp میشه با --reasoning on/off یا کلید enable_thinking تفکر رو خاموش کرد. برای کانتکست خیلی بلند هم کوانتکردن KV cache راهحله؛ با q4_0 (حدود ۴.۵ بیت بهازای هر وزن) میشه طول کانتکست رو حدود ۳.۵ برابر بیشتر کرد.
نکات کلیدی:
- GLM-5.2: مدل باز Z.ai با ۷۴۴B پارامتر، ۴۰B فعال و کانتکست ۱ میلیون توکن
- کوانتهای Unsloth Dynamic GGUF: از ۱.۵TB به ۲۲۳–۲۴۵ گیگ برای ۱ و ۲ بیت
- بر اساس KLD: ۱ بیتی ~۷۶.۲٪ و ۲ بیتی ~۸۲٪ دقت top-1؛ ۴ و ۵ بیتی تقریباً بدون افت
- اجرا با Unsloth Studio یا llama.cpp؛ سه حالت تفکر (خاموش، High، Max)
- کوانت KV cache برای رسیدن به کانتکستهای خیلی بلندتر




