GLM-5.3 بالاترین نمرهٔ KingBench 3 رو گرفت
خلاصهٔ کاملتر
ZAI مدل GLM-5.3 رو حدود دو ماه بعد از GLM-5.2 منتشر کرده و تو این مقاله اومده که این مدل تو بنچمارک مستقل KingBench 3 نمرهٔ ۷۳ از ۸۰ — یعنی ۹۱٫۲۵ درصد — گرفته که بالاترین رکورد ثبتشدهٔ این تسته. KingBench 3 یه مجموعهٔ ثابت از تسکهای کدنویسی، شبیهسازی، ریاضی و تولید گرافیک ـه که عین همون پرامپتها روی همهٔ مدلها اجرا میشه، پس عددهاش با جدولهای خودتبلیغی شرکتها فرق داره.
تو جدول نهایی، GLM-5.3 با ۹۱٫۲۵ درصد جلوتر از Fable 5 با ۸۲٫۵، Qwen3.8 Max با ۸۱٫۲۵، Opus 4.8 با ۸۰ و Opus 5 و Kimi K3 که هر دو ۷۷٫۵ درصد گرفتن ایستاده. تسکها هم متنوعن: شبیهسازی آسانسور با درخواستهای تصادفی طبقات، مدل سهبعدی جعبهٔ لنز تماسی با Three.js، میز تاشو با اسلایدر انیمیشن، تولید SVG، یه بازی تیر و کمان با لیدربورد، یه مسئلهٔ ترکیبیات و یه پایپلاین کامل fine-tune مدل Gemma 2B.
سختترین سؤال بنچمارک، ساخت یه ساعت مچی سهبعدی با عقربههای زنده، نمایش روز و تاریخ و دو تایمزون ـه که بیشتر مدلها بین صفر تا سه میگیرن. GLM-5.3 اینجا نمرهٔ ۷ گرفته، در حالی که Fable 5 نمرهٔ ۴ و Opus 5 نمرهٔ ۳ گرفتن. تسک میز تاشو، SVG پاندا، بازی تیر و کمان و پایپلاین fine-tune هم نمرهٔ کامل ۱۰ گرفتن.
نکتهٔ اصلی مقاله خود عددها نیست، سرعت پیشرفته: GLM-5.2 روی همین بنچمارک ۷۵ درصد گرفته بود و دو ماه بعد همون معماری با همون تعداد پارامتر به ۹۱٫۲۵ درصد رسیده. نویسنده میگه این جهش فقط از پستترینینگ — یعنی آموزش تکمیلی روی همون وزنهای پایه — اومده، پس هنوز جای پیشرفت بدون بزرگتر کردن مدل زیاده. البته به گفتهٔ نویسنده Fable 5 هنوز تو مسئلههای خیلی طولانی و چندمرحلهای دست بالا رو داره.
ZAI میگه GLM-5.3 رو مخصوص تحلیل امنیتی، ممیزی کد و پیدا کردن آسیبپذیری آموزش داده و باهاش روی ابزارهای توسعه، اپهای پیامرسان و زیرساخت اینترنت کار شده. استدلال مقاله اینه که مدلی که یاد گرفته کد کجا میشکنه، درک عمیقتری از رفتار کد داره و همین به تسکهای عادی کدنویسی هم سرریز میکنه. چون همین توانایی برای حملهٔ واقعی هم بهدرد میخوره، ZAI در کنارش طرحی به اسم open source shield معرفی کرده: قابلیتهای دفاعی باز میمونن و کاربردهای پرخطرتر پشت دسترسی کنترلشده میرن.
نکات کلیدی:
- نمرهٔ GLM-5.3 تو KingBench 3 برابر ۷۳ از ۸۰ یا ۹۱٫۲۵ درصده، بالاترین رکورد این بنچمارک.
- GLM-5.2 دو ماه قبل روی همین تست ۷۵ درصد گرفته بود، با همون معماری و همون تعداد پارامتر.
- Fable 5 با ۸۲٫۵ درصد و Opus 5 و Kimi K3 با ۷۷٫۵ درصد پشت سرش موندن.
- تو تسک ساعت مچی سهبعدی نمرهٔ ۷ گرفته، مقابل ۴ برای Fable 5 و ۳ برای Opus 5.
- مدل بهطور ویژه برای ممیزی کد و کشف آسیبپذیری آموزش دیده و همراه طرح open source shield منتشر شده.




