قیمت و سطح استدلال اوپوس ۵
خلاصهٔ کاملتر
تو این مقاله اومده که اوپوس ۵ دقیقاً با نرخ Opus 4.8 عرضه شده — ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای هر میلیون توکن خروجی — یعنی مدل باهوشتر شده بدون اینکه گرونتر بشه. ولی به گفتهٔ نویسنده، تصمیم واقعی که رو صورتحساب اثر میذاره قیمت نیست، سطح تلاش استدلالیه که براش تنظیم میکنی.
فرض رایج اینه که زنجیرهٔ فکر طولانیتر یعنی جواب بهتر، و اوپوس ۵ همین فرض رو به شکل قابلاندازهگیری میشکنه. طبق دادهٔ خود آنتروپیک، دقت مدل رو بنچمارکهای Frontier coding تو سطح «متوسط» به اوج میرسه و با رفتن به «بالا» یا «حداکثر» نهفقط گرونتر که ضعیفتر هم میشه. توضیح محتمل اینه که مدل بیش از حد فکر میکنه: وقتی مسئله راهحل روشنی داره، فکر کردن اضافه به مدل فرصت میده به جواب درست اولش شک کنه.
اما این پایان ماجرا نیست. Vals AI بهعنوان یه گروه ارزیاب مستقل، تو مجموعهتست خودش سطح «بالا» رو بهترین دیده. نویسنده میگه هر دو میتونن درست باشن، چون سطح ایدهآل به نوع کار بستگی داره: کارهای کدنویسی و ایجنتیک که جواب قابلراستیآزمایی دارن با «متوسط» بهتر جواب میدن، ولی تحلیل باز و چندمرحلهای ممکنه از تأمل بیشتر سود ببره. توصیهش اینه که پیشفرض رو «متوسط» بذاری و «بالا» رو فقط جایی که تست کردی.
یه نمونهٔ روشن هم برای «حداکثر» هست: ارزیابی اوپوس ۵ رو مسائل المپیاد ریاضی ۲۰۲۶، با تفکر تطبیقی روی حداکثر و محدودیت ۲۵۶ هزار توکن خروجی، که نتیجهش امتیاز کامل ۴۲ از ۴۲ بود. در عوض تو شاخص Epoch Capabilities، اوپوس ۵ پشت فیبل ۵ و GPT-5.6 میایسته؛ جمعبندی نویسنده اینه که اوپوس ۵ باهوشترین مدل نیست، بهترین مدل از نظر نسبت هزینه به کاراییـه.
نکات کلیدی:
- قیمت بدون تغییر: ۵ دلار ورودی و ۲۵ دلار خروجی بهازای هر میلیون توکن
- رو بنچمارکهای کدنویسی، تلاش استدلالی «متوسط» بهترین دقت (حدود ۵۳٪) رو میده
- گذاشتن پیشفرض رو «حداکثر» اغلب یعنی هزینهٔ بیشتر برای جواب بدتر
- Vals AI تو تستهای خودش سطح «بالا» رو بهتر دیده؛ یعنی جواب واحد وجود نداره
- «حداکثر» برای مسائل واقعاً سخت و باز مثل نوشتن اثبات ریاضی معنی میده
- تو شاخص ترکیبی Epoch، اوپوس ۵ پشت فیبل ۵ و GPT-5.6 قرار میگیره




