GPT-6 Astra پشت کامپیوتر میشینه
خلاصهٔ کاملتر
به گفتهٔ این مقاله، داستان اصلی GPT-6 Astra اینه که هوش عمومیش تقریباً همسطح نسل قبلی یعنی GPT-5.6 Sol مونده و از بعضی رقبا هم عقبتره، ولی تو کارهای agentic (یعنی وقتی خود مدل پشت کامپیوتر میشینه، مرورگر باز میکنه و دستور ترمینال میزنه) یکی از بزرگترین جهشهای یه نسخهٔ واحد رو ثبت کرده. همین شکاف بین «هوش ثابت» و «عامل خیلی بهتر» کل ماجرای این عرضهست.
تو OS World 2.0 که توانایی راه انداختن یه دسکتاپ واقعی رو میسنجه، Astra ۷۲.۶ درصد گرفته در برابر ۶۵.۷ درصد Sol و ۷۰.۲ درصد Claude Opus 5، و همون دسته کارها رو بهطور میانگین حدود ۴۰ دقیقه تموم کرده جای ۷۵ دقیقهٔ Sol. تو ScreenSpot Pro که فقط یه چیز رو چک میکنه، اینکه مدل از روی اسکرینشات دکمهٔ درست رو پیدا و کلیک میکنه یا نه، از ۷۶.۹ به ۹۲.۷ درصد رفته و AutomationBench هم از ۱۸.۱ به ۴۱.۴ درصد بیشتر از دو برابر شده.
اون عدد تیتری ۹۹.۹ درصد تو ARC-AGI-3 اما اونقدر که به نظر میرسه تمیز نیست. تیم ARC Prize مدل رو دو جور تست کرده: تو هارنس استاندارد و بیطرف که همهٔ مدلها رو یکسان میسنجه Astra ۶۲.۷ درصد گرفته، و تو آداپتور خود OpenAI که حالت استدلال خصوصی مدل رو بین اکشنها نگه میداره ۹۹.۹ درصد. نویسنده میگه مقایسهٔ مستقیم این دو عدد با بقیهٔ مدلها منصفانه نیست و خود سازندههای بنچمارک هم اینو یه جهش تو استدلال تعاملی میدونن، نه اثبات AGI.
بخش امنیت پرسروصداترین قسمته: صد درصد ExploitBench، ۴۲.۴ درصد ExploitGym و ۸۸ درصد یه بنچمارک تازهٔ SRE اونم تو یه تلاش. OpenAI مدل رو اولین موردی میدونه که به آستانهٔ داخلی «توانایی سایبری بحرانی» رسیده، برای همین قابلیتهای تهاجمی پیشرفته پشت یه برنامهٔ دسترسی محدود قفله و نسخهٔ عمومی این جور درخواستها رو رد میکنه. نویسنده اضافه میکنه که طبق system card، رصد کردن زنجیرهٔ استدلال این مدل هم سختتر از قبل شده و همین یه بدهبستون واقعیه که نباید ازش راحت گذشت.
از نظر هزینه، هر میلیون توکن ورودی ۱۰ دلار و خروجی ۵۰ دلار درمیاد، یعنی حدود دو و نیم برابر Sol. ولی اندازهگیری مستقل Artificial Analysis نشون داده Astra تو ارزیابیهای ایجنت کدنویسی حدود یکسوم توکن Sol رو مصرف میکنه، پس برای کارهای طولانی هزینهٔ هر تسک تقریباً سربهسر درمیاد. برای استفادهٔ عمومی و روزمره اما همون نتیجهٔ قبلی رو گرونتر تحویل میده.
نکات کلیدی:
- OS World 2.0: ۷۲.۶٪ برای Astra در برابر ۶۵.۷٪ برای GPT-5.6 Sol، با نصف زمان اجرا
- ScreenSpot Pro از ۷۶.۹٪ به ۹۲.۷٪ و AutomationBench از ۱۸.۱٪ به ۴۱.۴٪
- ARC-AGI-3: ۹۹.۹٪ با آداپتور OpenAI ولی ۶۲.۷٪ با هارنس بیطرف
- اولین مدلی که OpenAI اونو تو آستانهٔ «توانایی سایبری بحرانی» طبقهبندی کرده
- قیمت API: ۱۰ دلار ورودی و ۵۰ دلار خروجی به ازای هر میلیون توکن




