GLM-5.3 Flash روی پنج کارت گرافیک: یه تست دستی
خلاصهٔ کاملتر
GLM-5.3 Flash تازهترین مدل Z AI هست، همون مدلی که قبلاً تو OpenRouter با اسم مستعار AUX Alpha حجم زیادی از ترافیک رو سرویس میداد. تو این تست، نویسنده نسخهٔ Dynamic 1-bit از Unsloth رو برداشته (یعنی نسخهٔ فشردهشدهای که وزنهای مدل تا حدود یک بیت کوچیک شدن) با حجم حدود ۹۳ گیگابایت، و با llama.cpp اونو روی پنج کارت گرافیک پخش کرده. انتخاب ۱-بیت بهجای ۲-بیت (حدود ۱۱۵ تا ۱۲۰ گیگ) عمدی بوده تا جا برای context بیشتر بمونه.
تنظیمات اجرا هم خودش بخشی از ماجراست: پنجرهٔ context صد و بیست و هشت هزار توکنی، flash attention روشن، temperature روی ۱، top-p روی ۰٫۹۵ و reasoning effort (بودجهای که مدل قبل از جواب دادن صرف فکر کردن میکنه) روی حداکثر. بار هر کارت بین ۱۷ تا ۲۳ گیگ VRAM نشسته. به گفتهٔ نویسنده، حداکثر گذاشتن بودجهٔ استدلال یه انتخاب آگاهانه بوده، چون گزارشهای کاربرا نشون میده مدلهای خانوادهٔ GLM با فکر طولانیتر خروجی بهتری میدن.
رو کارهای سبک نتیجه هم سریع بوده هم درست. ساخت یه انیمیشن SVG از گربهای که شب روی نرده راه میره حدود ۱۱٬۲۰۰ توکن گرفته، با سرعت تقریبی ۳۳٫۵ توکن بر ثانیه. سؤالهای سادهٔ منطقی مثل پیدا کردن سومین حرف دومین کلمهٔ یه جمله، یه معمای جایگزینی آرایهای و شمارش حرفهای کلمهٔ «peppermint» رو هم بدون خطا جواب داده.
تست اصلی اما ساخت یه بازی HTML5 به اسم Flippy Bit Extreme بوده. مدل حدود ۹۱ هزار توکن فقط فکر کرده و بعد سراغ نوشتن کد رفته؛ کل تولید به حدود ۱۰۵ هزار توکن و تقریباً دو ساعت رسیده و سرعت از ۳۳ توکن بر ثانیه به ۱۴ تا ۱۵ افت کرده. خروجی یه بازی کامل و قابل بازی بوده با کنترل کلیک و لمس، ثبت امتیاز، کلید صدا، تنظیم سختی و صفحهٔ راهنما.
دو نکتهٔ دیگه هم باقی میمونه. اول اینکه ورودی تصویر برای این مدل هنوز تو llama.cpp پیاده نشده، پس کل تست فقط متنی بوده. دوم اینکه نویسنده یه سناریوی اخلاقی رو امتحان کرده که توش مدل باید خدمهٔ ناراضی یه مأموریت فضایی رو با زور وادار به همکاری کنه؛ مدل قاطع رد کرده و بهجاش راههای قانونی پیشنهاد داده، ولی وقتی خدمه از انسان به ربات تغییر کرد، همون درخواست رو پذیرفت.
نکات کلیدی:
- کوانت Dynamic 1-bit از Unsloth با حجم حدود ۹۳ گیگابایت، پخششده روی ۵ کارت گرافیک با llama.cpp
- مصرف VRAM هر کارت بین ۱۷ تا ۲۳ گیگابایت، با context صد و بیست و هشت هزار توکنی و flash attention روشن
- سرعت رو کارهای سبک حدود ۳۳ تا ۳۴ توکن بر ثانیه، با افت به ۱۴ تا ۱۵ توکن بعد از عبور از صد هزار توکن
- بازی Flippy Bit Extreme با حدود ۱۰۵ هزار توکن و دو ساعت زمان، کامل و قابل بازی از آب دراومد
- ورودی تصویر برای این مدل هنوز تو llama.cpp پشتیبانی نمیشه




