اوپوس ۵.۱ در بنچمارکها چقدر جلوتره؟
خلاصهٔ کاملتر
انتروپیک اعداد بنچمارک کلود اوپوس ۵.۱ رو منتشر کرده و به گفتهٔ این مقاله، مدل جدید تو همهٔ دستههایی که خود انتروپیک دنبال میکنه از اوپوس ۵ جلوتره. شاخصترین عدد مال Terminal Bench Science 1.0 هست، یعنی بنچمارکی که میسنجه مدل چقدر میتونه یه چرخهٔ تحقیق علمی رو تنهایی ببنده: فرضیه بسازه، تو ترمینال آزمایش اجرا کنه و بدون دخالت آدم تکرارش کنه. اوپوس ۵ اینجا حدود ۲۵ تا ۲۹ درصد گرفته بود، اوپوس ۵.۱ از ۵۰ درصد رد شده.
دومین جهش بزرگ تو AutomationBench هست که کارهای واقعی داخل شرکتها رو شبیهسازی میکنه: وصل کردن APIها، اسکریپت کردن کارهای تکراری و ساختن پایپلاینهایی که سر حالتهای خاص از کار نیفتن. نرخ موفقیت از ۱۷.۱ درصد به ۳۱.۴ درصد رسیده. تو کدنویسی agentic هم عدد ۵۵.۸ درصده در برابر ۴۲ تا ۵۲.۳ درصد اوپوس ۵ و ۳۷.۳ درصد GPT-5.6، و تو Cursor Bench 3.2.0 هم ۷۳.۴ در برابر حدود ۷۰.
کار با کامپیوتر که همیشه نقطهضعف مدلهای انتروپیک بوده، تو OSWorld 2.0 با روش امتیاز جزئی به ۷۷.۹ درصد رسیده، از ۷۲.۹ تا ۷۵.۴ قبلی. تو GDPval-AA v2 هم که کارهای دانشی با ارزش اقتصادی واقعی رو میسنجه امتیاز به ۱۸۵۳ رسیده، در برابر ۱۷۲۳ تا ۱۸۲۴ اوپوس ۵ و ۱۷۱۱ برای GPT-5.6. رد کردن بیدلیل سؤالهای بیخطر هم ۶۰ درصد کم شده و برای سؤالهای زیستشناسی و پزشکی ۸۵ درصد.
نویسنده تأکید میکنه انتروپیک بهجای قیمت هر توکن، هزینه به ازای هر کار رو مبنا گذاشته و روی اون نمودار اوپوس ۵.۱ حدود ۲.۵ برابر بهصرفهتره. قیمت cache read (یعنی وقتی مدل ورودی تکراری رو از کش میخونه بهجای پردازش دوباره) هم حدود یکچهارم ارزونتر شده. در عین حال نویسنده یادآوری میکنه بنچمارک فقط کارهای استاندارد رو میسنجه، پس این اعداد کف بهبودن نه کل تصویر.
نکات کلیدی:
- Terminal Bench Science 1.0: از حدود ۲۵ تا ۲۹ درصد به بالای ۵۰ درصد
- AutomationBench: از ۱۷.۱ درصد به ۳۱.۴ درصد
- کدنویسی agentic: ۵۵.۸ درصد، در برابر ۳۷.۳ درصد GPT-5.6
- OSWorld 2.0 (کار با کامپیوتر): ۷۷.۹ درصد
- هزینهٔ هر کار حدود ۲.۵ برابر بهصرفهتر، cache read حدود ۲۵ درصد ارزونتر
- رد شدن اشتباه درخواستهای بیخطر ۶۰ درصد کمتر، زیستشناسی و پزشکی ۸۵ درصد




