Grok 4.7 برای کدنویسی و کارهای طولانی اومد
خلاصهٔ کاملتر
SpaceXAI مدل Grok 4.7 رو عرضه کرده و اونو قویترین مدل خودش برای کدنویسی و کارهای دانشی معرفی میکنه. این مدل الان توی Cursor، ابزار Grok Build، خود Grok API، ابزارهای کدنویسی شخص ثالث، model routerها (سرویسهایی که درخواست رو بین چند مدل پخش میکنن) و پلتفرمهای ابری در دسترسه. شرکت اونو یه رقیب سریعتر و ارزونتر برای بقیهٔ مدلهای سطح اول میدونه.
قیمت از ۲ دلار برای هر میلیون توکن ورودی و ۶ دلار برای هر میلیون توکن خروجی شروع میشه که دقیقاً همون قیمت Grok 4.6 هست. یه نسخهٔ fast هم هست که خروجی رو دو برابر سریعتر میده ولی قیمتش هم دو برابره. Grok Build هم فعلاً دسترسی رایگان برای امتحان کردنش میده.
پشت این مدل یه base model جدید و بزرگتره. آموزشش با یه دورهٔ طولانیتر reinforcement learning (یعنی یادگیری از طریق پاداش گرفتن برای جواب درست) انجام شده. مجموعهٔ کارهای آموزشی هم سختتر بوده و بیشتر سمت کارهایی رفته که چند ساعت طول میکشن. نتیجه اینه که مدل روی کارهای سخت بیشتر دووم میاره، خروجیش رو با دقت بیشتری چک میکنه و context طولانی رو بهتر مدیریت میکنه.
تو بنچمارکها پیشرفتش واضحه: امتیاز CursorBench 4.0 از ۴۰.۴٪ به ۴۶.۳٪ رسیده و تو DeepSWE v1.1 با تلاش بالا ۷۱.۰٪ گرفته. تو Terminal-Bench 4.0 هم ۳۸.۰٪ و تو EEBench ۶۴.۰٪ آورده. ولی برتریش همهجا نیست: تو HealthBench Professional با ۵۶.۷٪ از GPT-5.6 Sol Max و Fable 5.1 Max عقبتره.
امنیت هم بخش مهمی از این نسخهست. به گفتهٔ SpaceXAI، مدل یه لایهٔ محافظتی کاملاً جدید داره و تو مقاومت در برابر jailbreak (یعنی ترفندهایی برای دور زدن محدودیتهای مدل) قویترین مدلشونه. تو HackerBench v0.3 فقط به ۳.۳٪ از درخواستهای پرخطر دوکاربردی جواب داده، در حالی که کارهای امنیتی مشروع رو بهندرت رد میکنه. چند شریک امنیتی هم دسترسی دعوتی به قابلیتهای red-team مدل برای تحقیقات دفاعی گرفتن.
نکات کلیدی:
- قیمت: ۲ دلار ورودی و ۶ دلار خروجی برای هر میلیون توکن، مثل Grok 4.6.
- نسخهٔ fast دو برابر سریعتر و دو برابر گرونتره.
- CursorBench 4.0 از ۴۰.۴٪ به ۴۶.۳٪ رسیده و DeepSWE v1.1 به ۷۱.۰٪.
- تو HealthBench Professional با ۵۶.۷٪ پشت GPT-5.6 Sol Max و Fable 5.1 Max مونده.
- تو HackerBench v0.3 فقط ۳.۳٪ درخواستهای پرخطر رد نشدن.




