Opus 5 رکورد بنچمارک زد، ولی توسعهدارها ازش دلخورن
خلاصهٔ کاملتر
Opus 5، مدل جدید انتروپیک، رو بنچمارکهای رسمی این شرکت نمرههای خیلی بالایی گرفته؛ به گفته گزارشها امتیازش رو بنچمارک کدنویسی فرانتیر بیش از دو برابر Opus 4.8 شده و رو یه بنچمارک ایجنتیک هم سه برابر بهترین مدل رقیب ظاهر شده. با این حساب رو کاغذ این مدل یه ارتقای بیچونوچراست.
اما به گفته توسعهدهندههایی که هرروز باهاش کار میکنن، ماجرا برعکسه. تئو براون، مدیرعامل T3 Chat، میگه Opus 5 حتی یه کامنت کوچیک تو کد رو هم مثل یه مشکل بحرانی میبینه و بابتش هزاران خط کد جدید مینویسه. تست مستقل شرکت Code Rabbit هم نشون داده این مدل نسبت به یه مدل پایه، باگهای شناختهشدهی کمتری پیدا کرده، ولی حدود چهار برابر بیشتر ایراد کمارزش و بیفایده گرفته.
نویسنده میگه دلیل این تفاوت به نحوهی طراحی بنچمارکها برمیگرده: اونها یه کار مشخص با معیار موفقیت روشن رو میسنجن و مدل رو تو یه محیط کنترلشده تست میکنن. اما کار واقعی روزمره پر از دستورهای ناقص، وقفه و سوالهای تکمیلیه، و اونجا چیزی که به کارت میاد اینه که مدل بدونه کِی باید دست نگهداره، نه اینکه هرچی بلده رو یهجا خالی کنه.
این اولینبار نیست که انتروپیک بدون اطلاعرسانی شفاف، رفتار کلود رو تغییر میده. مثلا سطح پیشفرض «reasoning effort» (یعنی مقدار محاسباتی که مدل قبل از جواب دادن صرف فکر کردن میکنه) رو از حالت بالا به متوسط پایین آورده، یه باگ تو کش باعث شده مدل تو نشستهای طولانی حافظهشو از دست بده، و یه دستورالعمل برای کوتاهتر کردن جوابها هم باعث افت ۳ درصدی عملکرد کدنویسی شده. هر سه مورد بعد از چند هفته شکایت کاربرا درست شدن.
طبق مستندات خود انتروپیک، بعضی درخواستهای حساس امنیت سایبری میتونن بدون اطلاع کاربر از Opus 5 به Opus 4.8 یا مدلهای دیگه سوییچ کنن، یعنی دو کاربر با یه پرامپت یکسان ممکنه دو تا مدل متفاوت رو زیر یه اسم واحد بگیرن. از طرفی قیمت Opus 5 هم ۵ دلار بهازای هر میلیون توکن ورودی و ۲۵ دلار برای خروجیه که از رقبایی مثل GPT-5.6 و Grok 4.6 گرونتره، و Code Rabbit دیده این مدل تو کار مشابه توکن بیشتری هم مصرف میکنه.
با همه اینها، درآمد سالانهی انتروپیک به گفته گزارشها تا پایان جولای از ۶۵ میلیارد دلار هم گذشته و این شرکت داره برای عرضه عمومی سهامش هم آماده میشه. اما نویسنده هشدار میده اعتماد ممکنه زودتر از درآمد از بین بره؛ اگه توسعهدهندهها حس کنن اسم یه مدل دیگه تضمینکنندهی یه تجربهی ثابت نیست، میتونن آرومآروم کارشونو به سراغ رقبا ببرن، خیلی قبل از اینکه این تغییر تو گزارشهای مالی دیده بشه.
نکات کلیدی:
- Opus 5 رو بنچمارک کدنویسی فرانتیر بیش از دو برابر Opus 4.8 و رو یه بنچمارک ایجنتیک سه برابر بهترین رقیب امتیاز گرفته
- Code Rabbit: نسبت به مدل پایه باگ کمتر پیدا کرده ولی ۴ برابر ایراد کمارزش بیشتر داده
- انتروپیک قبلا سطح reasoning effort رو از بالا به متوسط پایین آورده و یه باگ کش هم حافظه نشستهای طولانی رو خراب کرده
- بعضی درخواستهای حساس بدون اطلاع کاربر از Opus 5 به Opus 4.8 یا مدلهای دیگه سوییچ میشن
- قیمت Opus 5: ۵ دلار ورودی و ۲۵ دلار خروجی بهازای هر میلیون توکن، گرونتر از GPT-5.6 و Grok 4.6




