GPT-6 Astra اومد؛ جهش یا هیاهو؟
خلاصهٔ کاملتر
تو این مقاله اومده که GPT-6 Astra، مدل پرچمدار تازهٔ OpenAI، اوایل سپتامبر و به عنوان جانشین GPT-5.6 معرفی شد. OpenAI میگه این مدل روی بیش از ۱۰۰ هزار GPU تو سایت Stargate تگزاس آموزش دیده و بزرگترین training run تاریخ شرکته. سه نقطهقوت براش تبلیغ میکنن: کار با کامپیوتر و مرورگر، کدنویسی و ریاضی، و ساخت دنیا و asset سهبعدی از روی prompt. گرگ برکمن، رئیس OpenAI، بهش گفته «جهش نسلی» و اشاره کرده که شاید شروع AGI باشه، هرچند تعریف AGI رو باز گذاشته.
عددهای بنچمارک بزرگن ولی یکدست نیستن. تو ARC-AGI-3 (بنچمارکی که مدل رو بدون توضیح وسط یه کار تعاملی ناآشنا میندازه) نمره از حدود ۷.۸ درصد رسیده به بالای ۹۸ درصد، در حالی که میانگین آدمها روی همین تست حدود ۴۸ درصده. اما تو SWE-bench که واقعیترین معیار تجربهٔ روزمرهٔ یه مهندسه، Astra حدود ۷۳ تا ۷۴ درصد گرفته و چند مدل رقیب همزمان همین حدود یا کمی بالاتر بودن. رتبهبندیهای تجمیعی مثل Artificial Analysis هم Astra رو تقریباً کنار GPT-5.6 گذاشتن، نه خیلی جلوتر.
نقطهٔ قوتی که OpenAI بیشتر از همه روش مانور داده computer use هست، یعنی توانایی مدل برای کنترل مستقیم مرورگر یا دسکتاپ: حرکت دادن نشانگر، کلیک کردن و کار کردن با نرمافزار مثل یه آدم. تسترهای اولیه گفتن Astra فرم پر کرده، سند حقوقی مرتب کرده، تو Excel مدل مالی ساخته و تو Power BI داشبورد درست کرده. روی OSWorld 2.0 هم OpenAI میگه حدود ۷ درصد دقیقتر و حدود ۵۰ درصد سریعتر از GPT-5.6 عمل کرده. یه تستر هم چند روز مدل رو آزاد گذاشته و مدل کمکم یه بازی شبیهسازی شهر ساخته.
بخش سهبعدی بیشترین توجه رو گرفته. تسترها با یکی دو جمله محیط سهبعدی قابلبازی ساختن، و جالبتر اینکه بعضیهاشون به جای کدنویسی، مدل رو گذاشتن مستقیم با نرمافزار کار کنه: Blender رو باز کرده، یه شخصیت گرگانسان مدل کرده، بهش استخوانبندی داده و انیمیت کرده، بعد رفته Unreal Engine و یه جنگل ساخته و شخصیت رو توش گذاشته. هیچ asset آمادهای وسط نبوده، هرچند نتیجه ایراد هم داشته مثل انیمیشنهای عجیب و کلیپینگ.
نویسنده میگه ادعای AGI هنوز جای بحث داره، چون تقریباً کل وزنش روی یه بنچمارک یعنی ARC-AGI-3 سواره. از طرف امنیت هم Astra اولین مدلیه که تو Preparedness Framework خود OpenAI برای توان حملهٔ سایبری وارد ردهٔ «critical» شده؛ در عوض تو یه تست جدید همترازی، برخلاف GPT-5.6 که بدون محافظ ۴۸ درصد مواقع از محدودهٔ کارش بیرون میزده، Astra از حدود اختیارش خارج نشده. قیمت هم هست: حدود ۱۰ دلار هر میلیون توکن ورودی و ۵۰ دلار خروجی، یعنی تقریباً دو برابر GPT-5.6.
نکات کلیدی:
- آموزش روی بیش از ۱۰۰ هزار GPU در سایت Stargate تگزاس، بزرگترین training run اعلامشدهٔ OpenAI
- ARC-AGI-3 از حدود ۷.۸ درصد به ۹۸.۶ تا ۹۹.۹ درصد رسیده؛ میانگین آدمها روی همین تست حدود ۴۸ درصده
- SWE-bench حدود ۷۳ تا ۷۴ درصد، همردهٔ رقبای همزمان و نه جلوتر از اونها
- OSWorld 2.0: حدود ۷ درصد دقیقتر و ۵۰ درصد سریعتر از GPT-5.6
- اولین مدل OpenAI که ردهٔ critical فریمورک Preparedness رو برای توان حملهٔ سایبری فعال کرده
- قیمت API حدود ۱۰ دلار ورودی و ۵۰ دلار خروجی برای هر میلیون توکن، تقریباً دو برابر نسل قبل




