Astra تو ARC-AGI-3 به ۹۹.۹ درصد رسید
خلاصهٔ کاملتر
تیم ARC Prize نتایج GPT-6 Astra روی ARC-AGI-3 رو منتشر کرد. ARC-AGI-3 یه بنچمارک بازیمحوره: مدل رو تو محیطهای نوبتی و ناآشنا میذاره بدون اینکه بهش بگه هدف چیه، و مدل باید خودش کاوش کنه، قانونهای محیط رو کشف کنه، هدف رو حدس بزنه و برای رسیدن بهش نقشه بریزه. آدمها ۱۰۰ درصد این محیطها رو حل میکنن.
نویسنده، Greg Kamradt، میگه Astra با هارنس استاندارد (رابط ساده و یکسان برای همهٔ مدلها، که خود مدل تصمیم میگیره چه یادداشتی رو با خودش نگه داره) روی نسخهٔ Semi-Private نمرهٔ ۶۲.۷ درصد با هزینهٔ حدود ۲۶ هزار دلار گرفته. با هارنس Provider Adapter، که وضعیت استدلال داخلی مدل بین درخواستها حفظ میشه و مکالمهٔ طولانی فشرده میشه، نمره به ۹۹.۹ درصد با حدود ۱۹ هزار دلار میرسه. هر دو رکورد فعلی جدولان.
یافتهٔ جالبتر مربوط به کارایی حرکته، نه هزینه. ARC Prize قبلاً با تست حدود ۵۰۰ نفر از مردم عادی، میانهٔ تعداد حرکت لازم برای هر مرحله رو بهعنوان خط پایهٔ انسانی ثبت کرده بود. Astra تو هارنس Provider Adapter در ۹۶ درصد مراحل کمتر از این خط پایه حرکت کرده و بهطور میانگین ۵۱.۷ درصد حرکت کمتری لازم داشته. به گفتهٔ نویسنده این یه نقطهٔ عطف واقعیه، چون فرض قبلی تیم این بود که حتی وقتی AI بازی رو حل میکنه، برای فهمیدنش خیلی بیشتر از آدم باید کاوش کنه.
نویسنده میگه رفتاری که بیشتر از همه جلب توجه کرده، ساختن یه نمادگذاری فشرده و شخصی توسط خود مدله. Astra محیط رو به یه مدل نمادین کدمانند تبدیل میکنه و وضعیت و نقشههاش رو باهاش دنبال میکنه؛ مثلاً L8: hub q2 (8↓) وضعیت مرحله رو ثبت میکنه و چیزی مثل extend8 to3 بعدش retract10 to2 یه دنبالهٔ مرتب از کارها رو. تو یه آزمایش جدا با هارنس PRO-LONG که مدل به سندباکس اجرای کد دسترسی داشت، Astra برای هر بازی ابزار مخصوص خودش رو نوشت، تا حد ساختن فایلهایی مثل maze_solver.py و patrol_solver.py.
نویسنده تأکید میکنه که اشباع شدن این بنچمارک اثبات AGI نیست. ARC-AGI-3 دامنهٔ محدود و مکانیک قطعی و بسته داره و پیچیدگی دنیای واقعی رو نشون نمیده. مقایسهٔ PRO-LONG با انسان هم منصفانه نیست چون شرکتکنندههای انسانی مفسر کد و دفترچه نداشتن. از این به بعد نتایج هر دو هارنس جداگانه روی جدول امتیازها گزارش میشه و تیم دنبال طراحی نسل بعدی بنچمارکه.
نکات کلیدی:
- ۶۲.۷ درصد با هارنس استاندارد (~۲۶ هزار دلار) و ۹۹.۹ درصد با Provider Adapter (~۱۹ هزار دلار) روی ARC-AGI-3 Semi-Private
- در ۹۶ درصد مراحل کمتر از میانهٔ انسانی حرکت کرده، بهطور میانگین ۵۱.۷ درصد کمتر
- اجراهای Provider Adapter حدود ۳.۶۶ برابر سریعتر بودن و ۴۹ درصد توکن کمتری مصرف کردن
- خط پایهٔ انسانی از تست حدود ۵۰۰ نفر از مردم عادی ساخته شده و انسان ۱۰۰ درصد محیطها رو حل میکنه
- ARC Prize صراحتاً میگه این نتیجه ادعای رسیدن به AGI نیست




