GLM-5.3-Flash: مدل بازوزن ۳۲۰ میلیاردی Z.ai
خلاصهٔ کاملتر
تو این مقاله اومده که GLM-5.3-Flash اولین مدل نیتیو مالتیمودال خانوادهٔ GLM-5 از Z.aiه و بازوزن با لایسنس MIT منتشر شده. معماریش MoE هست (یعنی بهجای اجرای کل شبکه برای هر توکن، یه روتر فقط چند زیرشبکهٔ «expert» رو فعال میکنه): ۳۲۰ میلیارد پارامتر کل و ۱۸ میلیارد فعال. یعنی دانش یه مدل خیلی بزرگ رو داری ولی هزینهٔ محاسباتیش به یه مدل ۱۸ میلیاردی نزدیکتره.
چیز تازه برای سری GLM، ترکیب sparse attention با linear attentionه. attention استاندارد ترنسفورمر با بلندتر شدن دنباله هزینهش مربعی بالا میره، ولی این ترکیب اجازه میده تا همون سقف یک میلیون توکن بری بدون اینکه هزینهٔ سرو منفجر شه. یه تکنیک دیگه هم به اسم Manifold-Constrained Hyper-Connections یا همون mHC اضافه شده که Z.ai میگه بازدهی مقیاسپذیری رو بهتر میکنه. پیشآموزش هم روی ۳۰ تریلیون توکن دادهٔ مالتیمودال انجام شده.
به گفتهٔ مدلکارت خود Z.ai، این مدل از نسل قبلی یعنی GLM-5.2 جلو زده، حدود یکدهم قیمتشه و رو تسکهای کدنویسی و agentic به Claude Opus 4.8 نزدیک میشه. جالبتر اینکه قبل از رونمایی با اسم رمز «Ox Alpha» ناشناس رو OpenRouter و OpenCode میچرخید و پرمصرفترین مدل اونجا شد؛ یعنی توسعهدهندهها فقط بر اساس کیفیت خروجی انتخابش کرده بودن، بدون هیچ برند و تبلیغی.
نویسنده ضعفهاش رو هم میگه: تو خوندن دستخط یه یادداشت چندزبونه، اردو رو کامل جا انداخت و حتی بعد از تأکید هم مطمئن نشد؛ برای OCR اسناد چندزبونه حواست به این باشه. در عوض برای اجرای لوکال گزینهٔ راحتیه، چون از روز اول SGLang، vLLM، Transformers، KTransformers، TokenSpeed و Unsloth پشتیبانی میکنن و لایسنس MIT هم ابهام استفادهٔ تجاری، فاینتیون و بازتوزیع رو برمیداره.
نکات کلیدی:
- ۳۲۰ میلیارد پارامتر کل، فقط ۱۸ میلیارد فعال در هر توکن (معماری MoE)
- پنجرهٔ کانتکست ۱ میلیون توکن با ترکیب sparse و linear attention
- لایسنس MIT: استفادهٔ تجاری، فاینتیون و بازتوزیع بدون محدودیت
- ادعای Z.ai: نزدیک به Claude Opus 4.8 در کدنویسی و agentic با حدود یکدهم قیمت GLM-5.2
- پارامتر reasoning_effort با سه حالت low/high/max و پیشفرض max؛ فلگ clear_thinking پیشفرض false




