ارزیابی CodeRabbit از GPT-6 Astra
خلاصهٔ کاملتر
تیم CodeRabbit نتیجهٔ ارزیابی اولیهاش از GPT-6 Astra، مدل تازهٔ OpenAI، رو منتشر کرده. معیارشون «پوشش باگ عملی» بوده، یعنی از بین باگهای برچسبخوردهٔ یه مجموعهٔ تست، مدل چندتاشون رو جوری گزارش میکنه که برنامهنویس واقعاً بتونه روش کار کنه. تو این سنجش Astra حدود ۴٪ بیشتر از GPT-5.6 Sol و ۲۲٪ بیشتر از Opus 5 باگ گرفته.
به گفتهٔ نویسنده، جای اصلی تفاوت یه جای دیگهست. سختترین بخش بازبینی کد بیرون از خطوط تغییریافته اتفاق میافته؛ یه تغییر میتونه بهتنهایی درست به نظر برسه ولی جای دیگهای از سیستم رو بشکنه. تو همین زیرمجموعهٔ سخت و بینفایلی، فاصلهٔ Astra به ۲۰٪ نسبت به Sol و ۳۳٪ نسبت به Opus 5 میرسه. تیم تأکید میکنه این عدد رتبهبندی کلی کیفیت بازبینی نیست و قرار نیست روی هر pull request تکرار بشه.
قیمت این توانایی بالاست. نرخ رسمی Astra هر میلیون توکن ورودی ۱۰ دلار و هر میلیون توکن خروجی ۵۰ دلاره، یعنی همون نرخ پایهٔ Claude Fable 5.1 و فقط قیمت کششون فرق داره. تو یه تسک نمونه با ۱۰۰ هزار توکن ورودی و ۱۰ هزار توکن خروجی، هزینه ۱.۵ دلار درمیاد: حدود ۲.۵ برابر Sol، نزدیک ۴.۷ برابر Terra و حدود ۴۷ برابر Luna.
ولی نویسنده میگه قیمت توکن تصمیم رو تموم نمیکنه. OpenAI گزارش کرده تو بعضی ارزیابیهای خودش هزینهٔ هر تسک با Astra کمتر درمیاد، چون مدل قویتر ممکنه توکن کمتر یا تلاش کمتری لازم داشته باشه. پیشنهاد تیم اینه که هزینهٔ هر «نتیجهٔ موفق» رو روی کار خودتون اندازه بگیرید و مدل گرون رو فقط جایی بذارید که شواهد پراکنده و بههموابستهان، نه روی کارهای روتینی که یه مدل ارزونتر هم درست انجامشون میده.
برای امتحان همین توانایی تو یه فضای دیگه، تیم با Astra یه بازی اکشن نقشآفرینی به اسم NIGHTSHIFT با Godot و GDScript ساخته که سختترین بخشش تعادل بین هفت کلاس شخصیت، یه درخت مهارت ۹۸۸ نودی و ۴۰ منطقه تو ۱۰ فصل بوده. از نظر داده هم میگن نه خودشون و نه ارائهدهندههای مدل روی کد اختصاصی مشتریها آموزش نمیبینن؛ Astra برای مشتریهای واجد شرایط API از zero data retention پشتیبانی میکنه و Fable بهصورت پیشفرض ۳۰ روز داده رو برای پایش ایمنی نگه میداره.
نکات کلیدی:
- Astra حدود ۴٪ بیشتر از GPT-5.6 Sol و ۲۲٪ بیشتر از Opus 5 باگ برچسبخورده گزارش کرده
- تو بازبینیهای سخت بینفایلی، اختلاف به ۲۰٪ نسبت به Sol و ۳۳٪ نسبت به Opus 5 میرسه
- نرخ API آسترا: هر میلیون توکن ورودی ۱۰ دلار و هر میلیون توکن خروجی ۵۰ دلار
- تو تسک نمونهٔ ۱۰۰ هزار توکن ورودی و ۱۰ هزار خروجی، هزینه ۱.۵ دلاره، یعنی ۲.۵ برابر Sol
- Claude Fable 5.1 همون نرخ پایه رو داره و فقط قیمت کش فرق میکنه




