GLM 5.3 Flash؛ کیفیت Opus با قیمت خرد
خلاصهٔ کاملتر
شرکت ZAI مدل تازهاش GLM 5.3 Flash رو رسماً معرفی کرد، همون مدلی که قبلتر به شکل مخفی و با اسم Ox Alpha در دسترس بود. تو این مقاله اومده که قیمت رسمیاش هر یک میلیون توکن ورودی ۱۵ سنت، هر میلیون توکن خروجی ۵۰ سنت و ورودی کششده (یعنی همون متنی که قبلاً فرستادی و دوباره استفاده میشه) فقط ۳ سنته. برای کارهای طولانی agentic که مدام یه context تکراری رو میفرستن، همین نرخ کش بیشترین صرفهجویی رو داره.
به گفتهٔ نویسنده، ارزون بودن بهتنهایی خبر نیست؛ خبر اینه که کیفیت هم افت نکرده. تو تست مستقل KingBench که بعد از رونمایی و روی API رسمی گرفته شده، این مدل ۶۳ از ۸۰ یعنی ۷۸.۷۵٪ گرفته: کمی پایینتر از Claude Opus 4.8 با ۸۰٪ و بالاتر از Opus 5 و Kimi K3 با ۷۷.۵٪ و DeepSeek V4 Pro با ۷۶.۲۵٪. مدل بزرگتر همین خانواده یعنی GLM 5.3 کامل با ۹۱.۲۵٪ هنوز بالاتره، پس Flash بهترین عضو خانواده نیست ولی همردهٔ Opus بازی میکنه.
دلیل فنی این قیمت، معماری mixture-of-experts هست، یعنی مدل از چندین «متخصص» داخلی ساخته شده و برای هر توکن فقط بخشی از اونها روشن میشن. GLM 5.3 Flash روی کاغذ ۳۲۰ میلیارد پارامتر داره ولی برای هر توکن فقط ۱۸ میلیارد پارامترش فعاله. حافظهٔ موردنیاز رو کل پارامترها تعیین میکنن و هزینهٔ محاسبات رو پارامترهای فعال، پس این مدل دانش یه مدل غولپیکر رو داره ولی خرجش اندازهٔ یه مدل ۱۸ میلیاردیه.
عامل دوم زیرساخت سرو کردنه. شرکت ZAI تأیید کرده کل دورهٔ آزمایش مخفی، یعنی ۴۴ تریلیون توکن برای بیش از ۵۰۰ هزار کاربر و بیشتر از ۱۳ میلیون سشن، روی تراشههای هوش مصنوعی چینی و با یه موتور inference سفارشی مبتنی بر SGLang اجرا شده که حدود ۳ برابر کارایی سرویسدهی رو بالا برده. نویسنده این الگو رو شبیه کاری میدونه که DeepSeek هم کرد: سختافزار داخلی، بعد قیمت تهاجمی.
نویسنده میگه قیمت API فقط نصف ماجراست. وزنهای کامل با لایسنس MIT روی Hugging Face منتشر شدن، پس اگه سختافزارش رو داشته باشی هزینهٔ توکنی صفره؛ با کوانتیزیشن ۴ بیتی حدود ۱۸۰ گیگ حافظه لازمه و نسخههای بیتپایینتر دارن این عدد رو به سمت ۱۰۰ گیگ میبرن. یه هشدار هم هست: تستهای بعد از عرضهٔ رسمی، افت نمره تو تولید یکمرحلهای گرافیک مثل SVG نشون دادن، پس بهتره روی کیس خودت بنچمارک بگیری.
نکات کلیدی:
- قیمت API: ۱۵ سنت ورودی، ۵۰ سنت خروجی و ۳ سنت ورودی کششده به ازای هر میلیون توکن
- معماری MoE با ۳۲۰ میلیارد پارامتر کل و فقط ۱۸ میلیارد پارامتر فعال در هر توکن
- نمرهٔ ۷۸.۷۵٪ در KingBench؛ زیر Opus 4.8 با ۸۰٪ و بالای Opus 5 با ۷۷.۵٪
- نمرهٔ ۸۴.۳ در Terminal-Bench 2.1 و ۶۳.۴ در DeepSWE در برابر ۴۶.۲ نسخهٔ قبلی GLM 5.2
- وزنها با لایسنس MIT روی Hugging Face؛ حدود ۱۸۰ گیگ حافظه با کوانتیزیشن ۴ بیتی
- ۴۴ تریلیون توکن دورهٔ مخفی روی تراشههای چینی با موتوری مبتنی بر SGLang سرو شده




