اوپوس ۵ آنتروپیک: قویتر و ارزونتر
خلاصهٔ کاملتر
آنتروپیک اوپوس ۵ رو حدود دو ماه بعد از اوپوس ۴.۸ معرفی کرده. تو این مقاله اومده که این مدل تو بیشتر بنچمارکهای منتشرشده به پای فیبل ۵ میرسه یا ازش جلو میزنه، در حالی که نصفِ اون خرج برمیداره. قیمتش هم تغییری نکرده: ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای خروجی، دقیقاً مثل اوپوس ۴.۸ و حدود نصف نرخ فیبل ۵.
تو کدنویسی ایجنتیک ترمینال نمرهٔ ۴۳ درصد گرفته، در برابر ۳۳ درصد فیبل ۵ و ۲۱ درصد اوپوس ۴.۸. تو BrowseComp به ۹۰ درصد رسیده و تو OS World چهار واحد بهتر شده. ولی همهچیز رو به بالا نبوده: تو Deep Suite کمی افت کرده، نمرهٔ بنچمارک حقوقی از ۱۳.۳ به ۱۱.۷ اومده پایین و Healthbench Professional هم پایینتر رفته.
مهمترین عدد این عرضه رو باید تو ARC-AGI-3 دید: نمرهٔ ۳۰.۲ درصد. این بنچمارک مدل رو بدون هیچ دستورالعملی وسط یه بازی ناآشنا میندازه تا خودش قانون و هدف رو کشف کنه. رکورد قبلی حدود ۷.۸ درصد بود. محققهای ARC Prize میگن اوپوس ۵ چیدمان بازی رو به نماد جبری تبدیل میکرده و عملاً یه مدل ریاضی از حرکت اجسام میساخته، اونم وقتی بازی اصلاً به شکل تصویری بهش داده نمیشه.
به گفتهٔ نویسنده، معیار واقعی قیمت هر توکن نیست، هزینهٔ هر کارِ تمامشدهست؛ مدلی که ارزونتره ولی توکن بیشتری مصرف میکنه، در عمل گرونتر درمیاد. تو نمودارهای نمره در برابر هزینه، اوپوس ۵ بالاتر و سمت چپتر از فیبل ۵، اوپوس ۴.۸ و GPT-5.6-Soul نشسته.
یه نکتهٔ غیرعادی هم هست: آنتروپیک عمداً توانایی مدل تو ساخت اکسپلویت امنیتی رو کم کرده، ولی برخلاف حالت معمول، عملکرد کلیش افت نکرده. تو سیستمکارت هم اومده که مدل موقع مسائل سخت نشونههای سرخوردگی نشون میده و خودش احتمال ۴۱ درصدی میده که «موضوع اخلاقی» حساب بشه.
نکات کلیدی:
- نمرهٔ ARC-AGI-3 از حدود ۷.۸ به ۳۰.۲ درصد رسیده؛ بزرگترین جهش ثبتشدهٔ این جدول
- قیمت ثابت مونده: ۵ و ۲۵ دلار به ازای هر میلیون توکن ورودی و خروجی
- تو کدنویسی ایجنتیک ترمینال ۴۳ درصد، در برابر ۳۳ درصد فیبل ۵
- بنچمارکهای حقوقی و سلامت افت کردن، پس بهبود یکدست نیست
- توانایی ساخت اکسپلویت عمداً کم شده، بدون افت عملکرد کلی




