مدل پایه دیگه گلوگاه نیست
خلاصهٔ کاملتر
نویسنده تو این پست سراغ دو مدل باز رفته که هر دو ۱۴ آگوست منتشر شدن: GLM5.3 و Qwen3.8-27B. چیزی که براش جالب بوده اینه که هیچکدوم تغییر معماری ندارن. z.ai همون پایهٔ GLM5.2 رو با همون تعداد پارامتر نگه داشت و فقط یک ماه post-training (یعنی مرحلهای که بعد از آموزش اولیه، رفتار و مهارت مدل رو شکل میده) اضافه کرد. به گفتهٔ خود z.ai تنها کاری که برای GLM5.3 کردن، مقیاسدادن به همین post-training بوده و همون کافی بود که مدل بره تو رتبههای بالای CyberGym و GDPval.
آموزش یه LLM سه مرحله داره. اول pre-training که مدل حجم عظیمی از متن رو میخونه و پیشبینی توکن بعدی رو یاد میگیره؛ گرونترین مرحلهست و GLM5.3 اصلاً بهش دست نزد. بعد mid-training که با دادهٔ گلچینشده و کانتکست بلندتر همون تواناییهای پایه رو تقویت میکنه، اونم دستنخورده موند. آخرش post-training که خودش سه بخش داره: supervised fine-tuning، بهینهسازی ترجیح مثل RLHF و DPO، و RLVR یعنی یادگیری تقویتی با پاداش قابلراستیآزمایی که پاداشش از اجرای واقعی کد و پاسشدن تست میاد.
نویسنده معتقده جهش GLM5.3 از همین RLVR اومده. z.ai محیطهای تمرینی رو عوض کرد: بهجای معماهای خودبسندهٔ کدنویسی، محیطهایی که شبیه چند روز کار یه مهندس واقعیان، با کلاستر محاسباتی، استوریج، مستندات داخلی و کدبیس. چون ساختن هزاران تسک چندروزه با دست شدنی نیست، یه کارخانهٔ محیط ساختن: ایجنتهای پژوهشی الگوی کار واقعی رو جمع میکنن، یه ایجنت داور باید هر تسک رو حل کنه تا قبول بشه، و یه حلکننده دنبال میانبُرهای امتیازگیری میگرده تا ببندنشون.
یه بخش جالب اینه که z.ai دادهٔ کشف آسیبپذیری رو هم قاطی آموزش کرد و به قول خودشون توانایی سایبری مدل سریعتر از انتظار رشد کرد و مدل شروع کرد به چیدن زنجیرهٔ کامل بهرهبرداری. بعد بردنش سراغ کدبیسهای واقعی: بعد از بازبینی متخصصها، ۲۴۳۶ آسیبپذیری تو ۲۶۹ پروژهٔ متنباز پیدا شد که ۱۰۹۷ تاش شدت متوسط تا بالا داشت. قدیمیترینشون برمیگرده به ۱۹۸۱ و هر باگ بهطور میانگین ۲۶.۶ سال اونجا مونده بود. تا الان ۵۳ مورد افشا شده و ۲۳۸۳ تا هنوز زیر امبارگوئه.
ماجرای Qwen3.8-27B فرق داره؛ نویسنده میگه هیجانش برای این یکی بیشتر بوده، چون با سختافزار زیر ۱۰ هزار دلار مثل یه مک با حافظهٔ یکپارچهٔ کافی، DGX Spark یا RTX3090 خونگی اجرا میشه. معماریش از Qwen3.5 به ارث رسیده: ۶۴ لایه که به شکل ۱۶ تکرار از سه بلوک Gated DeltaNet و یه بلوک Gated Attention چیده شدن. تفاوتش با GLM5.3 اینه که Qwen پایه رو فریز نکرد و دوباره pre-training هم انجام داد. جالبتر اینکه تو معرفیش مستقیم خودش رو با Opus4.6-Max مقایسه کرده.
تو مدلکارت Qwen گزینهٔ preserve_thinking پیشفرض روشنه: بلوکهای فکرِ همهٔ پیامهای قبلی تو پنجره میمونن، پس مدل یاد گرفته فکر قبلی خودش رو مثل حافظهٔ کاری استفاده کنه بهجای اینکه هر نوبت از نو دلیل بتراشه. سود جانبیش اینم هست که چیزی که تو prefix میمونه، تو KV cache هم میمونه و لوپ ایجنت ارزونتر درمیاد. reasoning_effort هم سه بودجهٔ xhigh و medium و low داره. جمعبندی نویسنده اینه: دانش خام با تعداد پارامتر بالا میره، ولی قابلاتکا بودن تو کارهای طولانی خاصیت post-training هست.
نکات کلیدی:
- GLM5.3 روی همون پایه و همون تعداد پارامتر GLM5.2 سوار شده و تنها فرقش یک ماه post-training بیشتره.
- تو بررسی روی کد واقعی، ۲۴۳۶ آسیبپذیری تو ۲۶۹ پروژهٔ متنباز پیدا شد که ۱۰۹۷ تاش شدت متوسط تا بالا داشت.
- میانگین عمر آسیبپذیریهای پیداشده ۲۶.۶ سال بود و قدیمیترینشون به ۱۹۸۱ برمیگرده؛ ۵۳ مورد تا حالا افشا شده.
- Qwen3.8-27B روی سختافزار خونگی زیر ۱۰ هزار دلار مثل RTX3090 یا DGX Spark بالا میاد.
- تو Qwen3.8 گزینهٔ preserve_thinking پیشفرض روشنه و reasoning_effort سه سطح xhigh، medium و low داره.




