مدل مرموز Ox Alpha همون GLM-5.3-Flash بود
خلاصهٔ کاملتر
Z.ai کد مدل GLM-5.3-Flash رو باز کرد؛ همون مدلی که هفتهٔ گذشته با کدنام Ox Alpha و بدون معرفی سازندهش روی OpenRouter بالا اومد و سر و صدای زیادی راه انداخت. کاربرها خیلی زود حدس زدن پشتش Z.ai هست و حالا خود شرکت اسمش رو رسمی کرده.
از نظر ساختار، GLM-5.3-Flash یه مدل mixture of experts هست (یعنی بهجای اینکه کل شبکه برای هر درخواست کار کنه، فقط بخشی از متخصصها روشن میشن). روی کاغذ ۳۲۰ میلیارد پارامتر داره ولی برای جواب دادن به هر پرامپت فقط ۱۸ میلیارد پارامترش فعال میشه. ورودیش تا یک میلیون توکن متن و تصویر و ویدیو رو میگیره و جوابش تا ۱۳۱٬۰۷۲ توکن میره.
بزرگترین تغییر نسبت به مدلهای قبلی Z.ai تو مکانیزم attention هست؛ همون بخشی که پرامپت رو به توکن میشکنه و توکنها رو با هم مقایسه میکنه تا مهمهاشون رو پیدا کنه. اینجا از sparse attention استفاده شده، یعنی مدل بهجای بررسی تکتک توکنها فقط مرتبطترینها رو نگاه میکنه. کنارش linear attention هم اضافه شده: تو حالت عادی دو برابر شدن طول پرامپت مصرف حافظه رو چهار برابر میکنه، ولی با این روش فقط دو برابر میشه.
دلیل سنگین بودن attention اینه که از تابع softmax استفاده میکنه تا عددهای مدل رو به احتمال تبدیل کنه، و linear attention همین تابع رو با یه الگوریتم سبکتر عوض میکنه. مدل روی ۳۰ تریلیون توکن آموزش دیده و Z.ai برای پایدارتر کردن آموزش سراغ فناوریای به اسم mHC رفته که جلوی خراب شدن gradient (همون سیگنالی که بعد از هر مرحلهٔ آموزش بین لایهها میچرخه و وزنها رو اصلاح میکنه) رو تو مسیر میگیره.
به گفتهٔ Z.ai اجرای این مدل ۱۰ برابر کمتر از نسل قبلی خرج برمیداره. تو مقایسهای که خود شرکت با Claude Opus 4.8 و GPT-5.6 Terra و Gemini 3.7 Flash منتشر کرده، GLM-5.3-Flash بالاترین امتیاز GDPval-AA v2 (سنجش توانایی مدل تو انجام کارهای دانشی) رو گرفته و تو AutomationBench که کار کردن با اپلیکیشنهای ابری رو میسنجه دوم شده. وزنها هم روی Hugging Face منتشر شدن.
نکات کلیدی:
- معماری mixture of experts با ۳۲۰ میلیارد پارامتر کل و ۱۸ میلیارد پارامتر فعال در هر درخواست
- ورودی تا یک میلیون توکن (متن، تصویر، ویدیو) و خروجی تا ۱۳۱٬۰۷۲ توکن
- با linear attention، دو برابر شدن طول پرامپت مصرف حافظه رو فقط دو برابر میکنه نه چهار برابر
- آموزش روی ۳۰ تریلیون توکن با کمک فناوری mHC برای جلوگیری از خراب شدن gradient
- ادعای Z.ai: هزینهٔ اجرا ۱۰ برابر کمتر از نسل قبل، رتبهٔ اول GDPval-AA v2 و رتبهٔ دوم AutomationBench
- وزنهای مدل روی Hugging Face در دسترسه




