کوئن ۳.۸ مکس: بنچمارکها چی میگن؟
خلاصهٔ کاملتر
کوئن ۳.۸ مکس، مدل open weight تیم کوئن علیبابا با ۲.۴ تریلیون پارامتر، حالا با بنچمارکهای منتشرشده اومده بیرون. تو این مقاله اومده که ادعای اولیهی کوئن — یعنی «بعد از جمینای، دومین مدل موجود» — بسته به اینکه به کدوم تست نگاه کنی، یه جاهایی درسته و یه جاهایی کاملاً میریزه به هم.
روی DeepSWE که یه تست مهندسی نرمافزاره و معمولاً بهترین پیشبینی از حس واقعی کار کردن با مدله، کوئن ۳.۸ مکس نمرهی ۵۶.۶ گرفته. برای مقایسه: جمینای ۵ نمرهی ۷۰، GPT-5.6 Sol نمرهی ۷۳ و Opus 4.8 نمرهی ۵۹. نسخهی قبلی یعنی کوئن ۳.۷ مکس فقط ۲۱.۶ گرفته بود، پس این جهش خودش یکی از بزرگترین پیشرفتهای نسلبهنسل این دورهست — ولی هنوز فاصله با صدرنشینها پر نشده.
داستان تو استدلال فرق میکنه. GPQA از سؤالهای علمی سطح تحصیلات تکمیلی ساخته شده که عمداً جوری طراحی شدن که با جستوجو یا تطبیق الگو نشه جوابشون رو داد، و کوئن ۳.۸ مکس اینجا ۹۲.۶ گرفته؛ عملاً همتراز جمینای و فقط یه پله پایینتر از GPT-5.6 Sol. نویسنده میگه این نتیجه برای یه مدل open weight واقعاً قویه و نشون میده مدل تو فکر کردن و جواب دادن به سؤال سخت خوبه، حتی اگه تو کدنویسی اینطور نباشه.
یه نکتهی مهم دیگه اینه که open weight بودن اینجا به معنی اجرا روی سیستم خودت نیست. با ۲.۴ تریلیون پارامتر، این مدل حتی روی یه ورکاستیشن قوی هم جا نمیشه؛ وزنها منتشر شدن ولی برای اجراشون زیرساخت ابری لازمه. راه عملی برای امتحان کردنش، همون رابط چت خود کوئنه. اگه دنبال اجرای محلی بهخاطر حریم خصوصی یا هزینهای، مدلهای کوچیکتری مثل Gemma یا خانوادهی GPT-OSS گزینهی درستترن.
جمعبندی نویسنده اینه که «open weight» و «بهترین مدل موجود» دو تا ادعای متفاوتن. شرکتها معمولاً با بنچمارکی شروع میکنن که مدلشون توش بهتره، پس بهجای اعتماد به یه عدد تیتر، باید همون تستی رو نگاه کنی که به کار خودت نزدیکه. برای کار استدلالی و دانشی کوئن ۳.۸ مکس انتخاب محکمیه؛ برای کدنویسی جدی، فعلاً GPT-5.6 Sol و جمینای ۵ و Opus جلوترن.
نکات کلیدی:
- ۲.۴ تریلیون پارامتر، open weight، ولی عملاً غیرقابل اجرا روی سختافزار شخصی
- DeepSWE: ۵۶.۶ در برابر ۷۳ برای GPT-5.6 Sol، ۷۰ برای جمینای ۵ و ۵۹ برای Opus 4.8
- GPQA: ۹۲.۶، همسطح جمینای و کمی پایینتر از GPT-5.6 Sol
- جهش ۲۱.۶ به ۵۶.۶ نسبت به کوئن ۳.۷ مکس، یکی از بزرگترین پیشرفتهای نسلی این دوره
- ادعای «دوم بعد از جمینای» فقط روی بنچمارکهای منتخب استدلالی میایسته




