Real-SWE: وقتی هوش مصنوعی باید کد واقعی یه شرکت رو دست بزنه
خلاصهٔ کاملتر
شرکت Specific بنچمارک (یعنی مجموعهای استاندارد از تستها برای مقایسهٔ مدلهای مختلف) تازهای به اسم Real-SWE منتشر کرده. برخلاف بیشتر بنچمارکهای کدنویسی که از مسئلههای ساختگی یا عمومی استفاده میکنن، هر وظیفهٔ Real-SWE از یه کدبیس خصوصی و واقعیه که از یه شرکت واقعی لایسنس گرفته شده؛ یعنی دقیقاً همون کاری که مهندسای اون شرکت روزانه انجام میدن.
به گفتهٔ نویسندهها، این وظیفهها سه ویژگی دارن که بنچمارکهای معمولی ندارن: رو کدبیس خصوصی هستن که هیچ مدلی قبلاً روش آموزش ندیده، نتیجهٔ کار واقعاً رو کسبوکار اثر میذاره (مثل درستکردن مالیات فاکتورها یا مهاجرت مشتریها)، و باید قوانین و الگوهای کدنویسی خاص همون شرکت رو رعایت کنن. دستورالعمل هر وظیفه هم عمداً ناقصه، شبیه چیزی که یه مدیر واقعی به یه مهندس میده، و مدل باید خودش جزئیات رو تو کدبیس پیدا کنه.
نتیجهها نشون میده مدلها هنوز خیلی ضعیف عمل میکنن: ۷۱.۴٪ از اجراهای کوتاهتر از ۱۰ دقیقه شکست خوردن، و این عدد برای اجراهای طولانیتر هم به ۷۳.۴٪ میرسه. رایجترین علت شکست «نیازمندی جاافتاده» بوده، یعنی مدل بخشی از خواستهٔ کارفرما رو اصلاً انجام نداده. مدل GPT-5.6 Sol بیشترین درصد شکست از نوع «فرضیهٔ تاییدنشده» (۴۳.۳٪) رو داشته، یعنی چیزی رو فرض کرده که هیچوقت چکش نکرده.
هزینهٔ هر اجرا هم بین ۲.۵۰ تا ۶.۹۶ دلار متغیره؛ Gemini 3.8 Flash ارزونترین و Fable 5.1 گرونترین بوده. هر ایجنت تو یه سندباکس ایزوله با دسترسی به ابزارایی مثل AWS، Docker، Kubernetes، گیتهاب، Slack و پایگاهدادههای مختلف اجرا شده، دقیقاً شبیه محیط کاری واقعی یه مهندس نرمافزار.
نکات کلیدی:
- بنچمارک Real-SWE از کدبیسهای خصوصی و واقعی شرکتها استفاده میکنه، نه مسئلههای ساختگی
- ۷۱.۴٪ از اجراهای کوتاهمدت و ۷۳.۴٪ از اجراهای طولانیمدت شکست خوردن
- رایجترین علت شکست «نیازمندی جاافتاده» بوده
- هزینهٔ هر اجرا بین ۲.۵۰ تا ۶.۹۶ دلار بوده، Gemini 3.8 Flash ارزونترین
- GPT-5.6 Sol بیشترین نرخ خطای «فرضیهٔ تاییدنشده» رو داشته (۴۳.۳٪)




