پردهٔ Ox Alpha افتاد: همون GLM 5.3 Flash بود
خلاصهٔ کاملتر
تو این مقاله اومده که جامعهٔ تسترها قبل از اعلام رسمی، هویت Ox Alpha رو از روی نشونههای فنی حدس زده بودن: توکنایزرش دقیقاً با GLM 5.3 یکی بود، ویدیو-انکودرش مثل GLM5V رفتار میکرد و حتی کدهای خطای API هم با سیستمهای ZAI میخوند. روز ۲۶ آگوست ZAI تأیید کرد و برخلاف انتظار، بهجای نگهداشتن مدل بهصورت بسته، وزنهای کاملش رو با لایسنس MIT رو Hugging Face گذاشت.
از نظر مشخصات، GLM 5.3 Flash یه مدل MoE با ۳۲۰ میلیارد پارامتر کله که فقط ۱۸ میلیاردش به ازای هر توکن فعاله. این فاصله مهمه: پارامتر کل حافظهٔ لازم رو تعیین میکنه و پارامتر فعال سرعت و هزینهٔ محاسبات رو. رو بنچمارکهای خود ZAI نمرهٔ Terminal-Bench 2.1 برابر ۸۴.۳ ثبت شده، نزدیک به ۸۵ برای Claude Opus 4.8، و رو DeepSWE از ۴۶.۲ نسل قبلی به ۶۳.۴ پریده.
نکتهٔ جالب مقاله اینه که تست مجدد مستقل رو API رسمی ۶۳ از ۸۰ (۷۸.۷۵٪) گرفت، در حالی که همون مجموعه تست تو دورهٔ Ox Alpha ۷۰ از ۸۰ (۸۷.۵٪) گرفته بود. کل افت هم فقط تو تسکهای تصویری one-shot بود و تسکهای agentic و استدلال ساختاریافته تو هر دو اجرا نمرهٔ کامل گرفتن. دلیلش قطعی نیست؛ میتونه واریانس عادی باشه یا تفاوت چکپوینت نهایی با نسخهٔ پیشنمایش.
برای اجرای لوکال، مدل با کوانتیزیشن ۴ بیتی حدود ۱۸۰ گیگابایت حافظه میخواد و کوانتهای ۲ و ۳ بیتی جامعه دنبال رسوندنش به حدود ۱۰۰ گیگابایتن. این با موج جدید سختافزار حافظهبالا جور درمیاد، مثل Mac Studio با تا ۵۱۲ گیگابایت حافظهٔ یکپارچه. ZAI هم گفته کل پیشنمایش استیلث رو چیپهای داخلی چین و با یه موتور اینفرنس مبتنی بر SGLang اجرا شده، با حدود ۳ برابر بهبود کارایی سرو.
نکات کلیدی:
- Ox Alpha همون GLM 5.3 Flash بود؛ وزنهای کامل با لایسنس MIT رو Hugging Face منتشر شد
- ۳۲۰ میلیارد پارامتر کل و ۱۸ میلیارد فعال؛ حدود ۱۸۰ گیگابایت حافظه در کوانت ۴ بیتی
- دورهٔ استیلث: ۴۴ تریلیون توکن، بیش از ۵۰۰ هزار کاربر و بیش از ۱۳ میلیون سشن
- قیمت API: ۱۵ سنت ورودی، ۵۰ سنت خروجی و ۳ سنت ورودی کششده به ازای هر میلیون توکن
- کل سرو دورهٔ استیلث رو چیپهای چینی بهجای Nvidia، با حدود ۳ برابر بهبود کارایی




