بنچمارکهای GPT-6 Astra چی رو میسنجن؟
خلاصهٔ کاملتر
نویسنده میگه فرق این نسل بنچمارک با نسل قبلی مثل MMLU اینه که به جای سؤال چهارگزینهای، کار واقعی و قابل راستیآزمایی میدن و جواب غلط جریمه داره. Terminal Bench Science مثلاً ۲۵ هزار اندازهگیری روشنایی ستارهها یا نزدیک ۳ گیگابایت تصویر ماهوارهای رو میده دست مدل و ازش میخواد کد بنویسه و یه یافتهٔ مشخص دربیاره. نمرهدهی هم روی دادهٔ کنارگذاشتهشده انجام میشه، پس حدس زدن گرون تموم میشه.
Agent's Last Exam که تو UC Berkeley ساخته شده، هزاران کار تو ۵۵ صنعت رو پوشش میده. یه نمونهاش کار با نرمافزار ماشینکاری صنعتیه که ۱۰ هزار نقطه روی سطح مرجع نمونهبرداری میشه و نقطههای حیاتی باید توی ۰.۳ میلیمتر بشینن؛ اگه یه برخورد ابزار تشخیص داده بشه، نمره صفر میشه. طبق گزارشها Astra اینجا رکورد جدید زده و در ضمن توکن کمتری هم مصرف کرده، یعنی هزینهٔ واقعی هر کار پایینتر اومده.
جالبترین جهش مربوط به Frontier Math Tier 4 از Epoch AI بوده. این تیر عمداً طوری طراحی شده بود که تقریباً حلنشدنی باشه و یه استاد ریاضی گفته بود امیدواره هوش مصنوعی روش صفر بگیره. یه سال پیش مدلها نزدیک صفر بودن و GPT-5 حدود ۱۰ تا ۲۰ درصد گرفته بود. Astra طبق گزارشها با استدلال ۹۸ درصد و بدون هیچ زنجیرهٔ فکری ۸۳ درصد گرفته. ادعای جداگانهای هم هست که مدل یه نتیجهٔ شناختهشده دربارهٔ فاصلهٔ اعداد اول رو یه مرتبهٔ بزرگی بهتر کرده.
ARC-AGI-3 مدل رو میبره تو محیطهای بازیمانند با الگوهایی که قبلاً ندیده، تا مدلهایی که نمیتونن لحظهای استدلال کنن لو برن. سازندهها یه خط پایهٔ انسانی داشتن: میانگین تعداد حرکت آدمهایی که مرحله رو حل کردن. Astra حدود ۹۶ درصد مواقع از این خط پایه بهتر بوده و تقریباً ۵۰ درصد حرکت کمتری زده. خود سازندهها قبل از تست فکر میکردن بهرهوری حرکت یه مرز پایدار بین آدم و مدل میمونه، که نموند.
نویسنده اضافه میکنه که بالا رفتن نمره لزوماً یعنی مدل کمغلطتر نیست، ولی این بار این دوتا با هم حرکت کردن: OpenAI مدل رو روی موقعیتهایی تست کرده که نسلهای قبلی توشون واقعاً توهم زده بودن و کاهش سه تا ده برابری گزارش شده. در عین حال همهٔ بنچمارکهای بیرونی یکدست به نفع Astra نیستن؛ روی GDPval بعضی تنظیمات از مدلهای کوچکتر رقبا هم پایینتر افتاده.
نکات کلیدی:
- Frontier Math Tier 4: از نزدیک صفر یه سال پیش به ۹۸٪ با استدلال و ۸۳٪ بدون زنجیرهٔ فکری
- Agent's Last Exam: هزاران کار در ۵۵ صنعت؛ یه برخورد ابزار در ماشینکاری نمره رو صفر میکنه
- ARC-AGI-3: عبور از خط پایهٔ انسانی در حدود ۹۶٪ مواقع با نصف تعداد حرکت
- کاهش گزارششدهٔ توهم بین سه تا ده برابر نسبت به مدلهای قبلی OpenAI
- Jane Street مدل رو در کدنویسی جلوتر دید ولی «شهود معاملاتی» Claude رو یه قدم روبهجلوتر دونست




