GPT-6 Astra واقعاً باهوشترین مدل دنیاست؟
خلاصهٔ کاملتر
OpenAI مدل GPT-6 Astra رو باهوشترین مدل دنیا معرفی کرده، ولی ارزیابهای مستقل تصویر یکدستتری نشون نمیدن. تو Intelligence Index شرکت Artificial Analysis، که یه نمرهٔ ترکیبی از توان استدلال عمومیه، Astra نمرهٔ ۶۱ گرفته؛ دقیقاً همون عددی که نسخهٔ قبلیاش GPT-5.6 Sol گرفته بود و پایینتر از Fable 5.1 با ۶۶. یعنی روی این شاخص، هیچ جهش کلیای نسبت به نسل قبل دیده نمیشه.
جنجالیترین عدد، ۹۹.۹٪ روی ARC-AGI-3ه؛ آزمونی که یادگیری در لحظه رو میسنجه نه الگوی حفظشده. ماجرا اینه که ARC Prize دو جور تستش کرده. تو harness استاندارد و بیطرف، که استدلال خصوصی مدل رو بین قدمها نگه نمیداره، نمره ۶۲.۷٪ شد؛ تو adapter خود OpenAI که این حالت رو حفظ میکنه، ۹۹.۹٪. ایراد به خود adapter نیست، به مقایسهست: مدلهای قدیمیتر تو نمودار رسمی با شرایط سختگیرانهتر سنجیده شده بودن.
تو کدنویسی هم ماجرا بیشتر شبیه تساویه تا برتری قاطع. Astra روی Terminal Bench 4.0 با حدود ۵۷.۹٪ واضح جلوئه (Sol ۳۷.۳٪ و Fable 5.1 ۵۵.۸٪)، ولی روی Deep SWE با ۷۴.۱٪ فقط حدود ۱.۴ واحد از نسخهٔ قبلی خودش جلوتره و عملاً همسطح Claude Opus 5 و حتی یه مدل Gemini Flashه. تو Coding Agent Index، Fable 5.1 با ۷۰ جلوتر از ۶۷ Astra میمونه.
قیمت این وسط مهمه. هر میلیون توکن ورودی ۱۰ دلار و خروجی ۵۰ دلار، در برابر ۴ و ۲۰ دلار Sol؛ یعنی حدود ۲.۵ برابر. حتی با صرفهجویی تو تعداد توکن، هزینهٔ کل هر تسک تو حالت حداکثر تلاش حدود ۷۵٪ بیشتر درمیاد. چندجا هم پسرفت گزارش شده: GDPval، ارزیابی کار با ابزارهای بانکی، استدلال روی متنهای خیلی بلند و کیفیت ارائه تو یه تست بلندمدت.
جایی که Astra واقعاً جلو میزنه، کار با کامپیوتره. روی OS World 2.0 نمرهٔ ۷۲.۶٪ گرفته با تقریباً دو برابر سرعت Sol، روی ScreenSpot Pro از ۷۶.۹ رفته به ۹۲.۷ و تو تست پیدا کردن سوزن توی انبار کاه روی حدود یک میلیون توکن، ۹۶٪ دقت داشته در برابر ۷۴٪ Sol. تو امنیت هم اونقدر جهش داشته که OpenAI برای اولین بار مدل رو تو آستانهٔ ریسک سایبری بحرانی طبقهبندی کرده و دسترسی به پیشرفتهترین قابلیتهاش رو باز نذاشته.
نکات کلیدی:
- Intelligence Index: Astra ۶۱، مساوی با GPT-5.6 Sol و پایینتر از Fable 5.1 با ۶۶
- ARC-AGI-3: ۶۲.۷٪ با harness استاندارد در برابر ۹۹.۹٪ با adapter خود OpenAI
- قیمت ۱۰ و ۵۰ دلار به ازای هر میلیون توکن، حدود ۷۵٪ هزینهٔ بیشتر برای هر تسک
- برتری روشن روی Terminal Bench 4.0 و OS World 2.0 و ScreenSpot Pro
- Frontier Math Tier 4 اشباع شده، ولی از ۶۸ مسئلهٔ حلنشدهٔ اردوش فقط ۲ تا رو حل کرده
- Apollo Research هشدار داده استدلال داخلی این مدل سختتر رصد میشه




