مدلهای هوش مصنوعی عمداً دارن کمسوادتر میشن
خلاصهٔ کاملتر
به گفتهٔ نویسنده، نمرههای استدلال مدلها بالا میره در حالی که محاسبات هر توکن داره کم میشه. GLM-5.2 با حدود ۴۰ میلیارد پارامتر فعال — یعنی اون تیکه از مدل که واقعاً برای هر توکن اجرا میشه — ۹۹.۲ درصد AIME 2026 رو میزنه و Qwen3.5 با ۱۷ میلیارد فعال ۹۱.۳ درصد. برای مقایسه، GPT-4 توی ۲۰۲۳ با شایعهٔ ۲۸۰ میلیارد پارامتر فعال بهزور یه سوال AIME رو حل میکرد.
ولی همین مدلها تو سوالهای سادهٔ اطلاعاتی میلنگن. روی SimpleQA — یه بنچمارک یادآوری حقایق بدون هیچ ابزاری — صدرنشین فعلی Gemini 2.5 Pro با ۵۳ درصده؛ یعنی بهترین حافظهای که میشه خرید هنوز نصف سوالها رو غلط جواب میده. Artificial Analysis نرخ توهم Qwen3.5 4B و 9B رو ۸۰ تا ۸۲ درصد اندازه گرفته: وقتی چیزی رو نمیدونن، با اعتماد به نفس از خودشون درمیارن.
نویسنده میگه این یه معاملهٔ عمدیه، نه یه باگ. حقایق تو وزنها جا میگیرن — تحقیقهای مربوط به ظرفیت دانش حدود دو بیت به ازای هر پارامتر تخمین میزنن — ولی استدلال خیلی بهتر فشرده میشه، چون یه مشت رویهٔ تکراریه: شکستن مسئله، نگهداشتن حالت میانی، چککردن کار خودش، برگشتن از مسیر غلط. تقطیر — یعنی یاد دادن رفتار یه مدل بزرگ به یه مدل کوچیک — این رویهها رو خوب منتقل میکنه. حقایق هم فاسد میشن و رویهها نه.
پس بار دانستن میافته گردن harness — یعنی همون لایهای که بازیابی، جستوجوی وب و مستندات رو دم دست مدل میذاره. یه ایجنت کدنویسی هم همینجوری کار میکنه: بهجای حفظبودن API یه پکیج، node_modules رو میگرده و جوابش به همون نسخهای گره میخوره که واقعاً نصبه. نویسنده معتقده همین کار توهم رو قابلرسیدگی میکنه، چون جواب غلطی که به یه سند ارجاع داده آدرس داره و سند رو میشه اصلاح کرد.
نکات کلیدی:
- GLM-5.2 با حدود ۴۰ میلیارد پارامتر فعال ۹۹.۲ درصد AIME 2026 میگیره؛ Qwen3.5 با ۱۷ میلیارد فعال ۹۱.۳ درصد.
- روی SimpleQA بهترین نتیجهٔ فعلی Gemini 2.5 Pro با ۵۳ درصده.
- نرخ توهم Qwen3.5 4B و 9B روی بنچمارک دانش ۸۰ تا ۸۲ درصده.
- ظرفیت دانش حدود دو بیت به ازای هر پارامتره؛ برای همین مدلهای دانشمحور اینقدر بزرگ شدن.
- DeepSeek V4-Flash با حدود ۱۳ میلیارد پارامتر فعال استدلال میکنه، ولی ۲۷۱ میلیارد پارامتر دیگهش تو expertها عمدتاً انبار حقایقه.
- Qwen3.5 9B کوانتیزهشده تو ۶ گیگ VRAM جا میشه؛ پیشبینی نویسنده اینه که یه مدل ۲۰ تا ۴۰ میلیاردی با استدلال فرانتیر روی کارت ۲۴ گیگی خونگی اجرا شه.




