Claude Opus 5.5 روی میز بنچمارک
خلاصهٔ کاملتر
Artificial Analysis صفحهٔ سنجش Claude Opus 5.5 رو بهروز کرده؛ مدل اختصاصی Anthropic که ۲۲ سپتامبر ۲۰۲۶ عرضه شد. این نسخه یه reasoning model حساب میشه، یعنی قبل از جواب دادن یه زنجیرهٔ استدلال داخلی رو طی میکنه. ورودی متن و تصویر میگیره، خروجیش فقط متنه و پنجرهٔ کانتکستش یک میلیون توکنه؛ چیزی حدود ۱۵۰۰ صفحهٔ A4.
تو شاخص Artificial Analysis Intelligence Index نسخهٔ 4.3.2 امتیاز ۵۸ گرفته، در حالی که مدلهای همرده بهطور میانه ۲۵ میگیرن. این شاخص از ۱۰ ارزیابی مختلف ساخته شده، از AA-Briefcase v1.1 و GDPval-AA v2.1 تا Terminal-Bench 4.0، SciCode، Humanity's Last Exam و AA-Omniscience. پس یه عدد تکبعدی نیست و کار عاملی (agentic)، کدنویسی و دانش رو با هم میسنجه.
طرف دیگهٔ ماجرا قیمته. هر یک میلیون توکن ورودی ۴ دلار و هر یک میلیون توکن خروجی ۲۰ دلار درمیاد، که هر دو دو برابر میانهٔ بازارن (۲ و ۱۰ دلار). میانگین هزینهٔ هر تسک روی این شاخص ۵.۹۸ دلار شده. مدل پرحرف هم هست: برای کل شاخص ۲۶۰ میلیون توکن خروجی تولید کرده در برابر میانهٔ ۸۸ میلیون. تخفیف ۹۵ درصدی کش میتونه بخشی از این هزینه رو پایین بیاره.
جمعبندی خود Artificial Analysis اینه که این مدل جزو باهوشترینهاست ولی نسبت به مدلهای همقیمتش یه کم گرونه. سرعت خروجی (توکن بر ثانیه) هنوز اندازهگیری نشده و تو صفحه N/A ثبت شده. مدل از طریق ۶ ارائهدهندهٔ API در دسترسه و وزنهاش هم منتشر نشده، پس نمیشه لوکال اجراش کرد.
نکات کلیدی:
- عرضهشده در ۲۲ سپتامبر ۲۰۲۶ توسط Anthropic، مدل اختصاصی و بدون وزن باز
- امتیاز ۵۸ در Artificial Analysis Intelligence Index v4.3.2 در برابر میانهٔ ۲۵
- قیمت: ۴ دلار ورودی و ۲۰ دلار خروجی به ازای هر میلیون توکن، با ۹۵٪ تخفیف کش
- میانگین ۵.۹۸ دلار هزینه برای هر تسک شاخص و ۲۶۰ میلیون توکن خروجی در کل ارزیابی
- پنجرهٔ کانتکست یک میلیون توکن، ورودی متن و تصویر، در دسترس از ۶ ارائهدهندهٔ API




