Claude Opus 5.1 و جهش بزرگ در بنچمارکهای کدنویسی
خلاصهٔ کاملتر
به نوشتهٔ این مقاله، Anthropic اول سپتامبر Opus 5.1 رو منتشر کرد و این بزرگترین جهش بنچمارک کدنویسیایه که تا حالا برای یه نسخهٔ نقطهای اعلام کرده. روی Terminal Bench 2.0 نمره از ۲۴.۷٪ (Opus 5) رسیده به ۵۲.۶٪، یعنی ۲۷.۹ واحد رشد، جلوتر از GPT-5.1-Codex با ۲۲.۴٪. خود Anthropic برای این عدد خطای استاندارد ۳.۵ تا ۴.۵ واحدی گزارش کرده. Terminal Bench 4.0 هم از ۴۲٪ به ۵۵.۸٪ رفته.
تو یه بنچمارک مستقل هشتسؤالی (فرانتاند، 3JS، SVG، یه مسئلهٔ ریاضی و تسکهای ایجنتی طولانی) نمرهٔ ۷۴ از ۸۰ یعنی ۹۲.۵٪ گرفته، بالاترین نمرهٔ ثبتشدهٔ اون تست بین همهٔ مدلها. بزرگترین پرش مال سختترین سؤال بوده: یه ساعت مچی سهبعدی با حرکت روان عقربه و دو منطقهٔ زمانی، که از ۴ از ۱۰ رسیده به ۹ از ۱۰. جدول نهایی: Opus 5.1 با ۹۲.۵٪، GLM 5.3 با ۹۱.۱٪، Opus 5 با ۸۲.۵٪ و Qwen 3.8 Max با ۸۱.۲٪.
قیمت لیست دست نخورده: هر میلیون توکن ورودی ۱۰ دلار و خروجی ۵۰ دلار. تنها تغییر، ارزونشدن cache read (خوندن از کش) از ۱ دلار به ۰.۲۵ دلاره، یعنی ۷۵٪ کمتر. ولی cache write سر جاش مونده: ۱۲.۵ دلار برای کش پنجدقیقهای و ۲۰ دلار برای یکساعته. نتیجهش جابهجایی وزن صورتحسابه؛ تو یه فاکتور واقعی با ۵۷۳ میلیون توکن و مبلغ حدود ۱۰۲۴ دلار، نوشتن توی کش فقط ۹.۴٪ توکنها بوده ولی ۶۵.۸٪ هزینه. یعنی دیگه باید حواست به تعداد دفعات ساختهشدن کش باشه، نه خوندهشدنش.
جز هزینه، سه شکایت دیگه هم تکراره. کاربرها از یه fallback بیصدا روی پرامپتهای امنیتی و سیستمی میگن؛ یعنی بخشی از درخواستها بیخبر مسیرش عوض میشه و هزینه و جوابش فرق میکنه. بعدش سه تغییر ناسازگار در API که ظاهراً جلوی استخراج استدلال مدل رو میگیره: tool_choice: any حالا خطای ۴۰۰ برمیگردونه، بلاکهای thinking فقط با همین نسخه خونده میشن، و برای اکانتهای بعد از ۳۱ آگوست، ویرایش نوبتهای قبلی استدلالهای بعدی رو باطل میکنه. آخری هم نثر متراکمتره که خود مستندات Anthropic تأییدش کرده.
خود Anthropic هنوز Opus 5 رو مدل پیشفرض پیشنهاد میده و Opus 5.1 رو برای استدلال سنگین و کار ایجنتی طولانی کنار میذاره. نویسنده میگه این مدل دقیقاً همونجا پولش رو درمیآره: تیم Claude Code میگه تو تسکهای بلند دیرتر گیر میکنه و بهتر توضیح میده کجا مونده. تو یه ارزیابی code review روی ۴۵ تسک و ۱۰۵ ایراد شناختهشده، recall تقریباً ثابت مونده (۶۱٪ در برابر ۶۱.۹٪) ولی precision از ۳۲.۸٪ به ۳۷.۳٪ رفته، تعداد کامنتها ۳۴٪ و ایرادهای بیاهمیت ۷۰٪ کم شده. در عوض بازبینیها ۴۹٪ طولانیتر شده.
نکات کلیدی:
- Terminal Bench 2.0 از ۲۴.۷٪ به ۵۲.۶٪ و Terminal Bench 4.0 از ۴۲٪ به ۵۵.۸٪ رفته.
- تو بنچمارک مستقل، نمرهٔ ۹۲.۵٪ در برابر ۹۱.۱٪ برای GLM 5.3 و ۸۲.۵٪ برای Opus 5.
- خوندن از کش از ۱ دلار به ۰.۲۵ دلار به ازای هر میلیون توکن رسیده، ولی نوشتن توی کش روی ۱۲.۵ و ۲۰ دلار ثابت مونده.
- تو یه فاکتور حدود ۱۰۲۴ دلاری، cache write با ۹.۴٪ توکنها ۶۵.۸٪ هزینه رو برداشته.
- tool_choice: any حالا خطای ۴۰۰ میده و مکالمهٔ اکانتهای جدید عملاً فقط append-only شده.
- Anthropic پیشفرض رو Opus 5 میدونه و Opus 5.1 رو برای کار ایجنتی طولانی توصیه میکنه.




