Opus 4.8 رکورد ARC-AGI-3 رو شکست
خلاصهٔ کاملتر
حساب توییتری فعال حوزه هوش مصنوعی scaling01 گزارش داده که Opus 4.8 توی بنچمارک ARC-AGI-3 رکورد زده و امتیازش سه برابر GPT-5.5 شده. منبع ادعا جدول امتیازات رسمی arcprize.org هست و طبق همین گزارش، بهترین مدلها تازه به «۱.۵ درصد بهرهوری انسان» رسیدن — توصیفی که خود نویسنده با طعنه «خیرهکننده» صداش میکنه.
ARC-AGI-3 نسل سوم بنچمارکهای ARC Prize هست که برخلاف آزمونهای متنی کلاسیک، تعاملی و بازیمحوره: مدل باید توی محیطهای تازهای که قبلاً ندیده، قانونها رو خودش کشف کنه و هدف رو پیش ببره. این طراحی حفظکردن جواب رو تقریباً بیفایده میکنه و به همین خاطر امتیازها معمولاً خیلی پایینتر از بنچمارکهای معموله.
سهبرابرکردن امتیاز نسبت به GPT-5.5 برای آنتروپیک یه برد مهمه، مخصوصاً که ARC-AGI بهعنوان یکی از معدود معیارهای سنجش «هوش واقعاً عمومی» شناخته میشه. ولی عدد ۱.۵ درصد بهرهوری انسانی روی دیگه سکهست: حتی بهترین مدل دنیا هم هنوز برای حل این مسئلهها بهمراتب ناکارآمدتر از آدمهاست.
البته منبع این خبر یه توییت کوتاهه و اعداد دقیق توی تصویر پیوست و جدول arcprize.org هستن؛ برای قضاوت کامل باید منتظر تحلیلهای مفصلتر موند. با این حال جهتگیری روشنه: جدول ARC-AGI-3 داره تکون میخوره و رقابت سر صدرش جدی شده.
نکات کلیدی:
- Opus 4.8 صدرنشین جدید ARC-AGI-3 شده و امتیازش سه برابر GPT-5.5 هست
- ARC-AGI-3 بنچمارک تعاملی و بازیمحوره که یادگیری در محیط تازه رو میسنجه
- بهترین مدلها هنوز حدود ۱.۵ درصد بهرهوری انسان رو دارن
- منبع خبر، جدول رسمی arcprize.org و یه گزارش توییتریه




