RoadmapBench؛ محکی سخت برای ایجنتهای کدنویسی
خلاصهٔ کاملتر
این مقاله یه بنچمارک جدید به اسم RoadmapBench معرفی میکنه که هدفش سنجیدن ایجنتهای کدنویسی تو کارهای واقعی و بلندمدته. نویسندهها میگن ایجنتهای کدنویسی دارن بیشتر و بیشتر تو توسعهٔ نرمافزار واقعی به کار میرن، جایی که حتی یه دور ارتقای نسخه ممکنه ماهها کار هماهنگ رو کلی فایل بخواد.
مشکلی که به گفتهٔ نویسندهها بنچمارکهای فعلی دارن اینه که بیشترشون رو رفع تکباگِ ریپازیتوریهای پایتون تمرکز دارن، اون هم با ارزیابی درشتِ قبول/رد. برای همین نمیتونن کار بلندمدت و چندهدفه رو تو مقیاس مهندسی واقعی نشون بدن.
برای پر کردن این خلأ، RoadmapBench شامل ۱۱۵ تسک کدنویسی بلندمدت هست که پایهشون ارتقای نسخهٔ واقعی پروژههای اوپنسورسه؛ رو ۱۷ ریپازیتوری و ۵ زبان برنامهنویسی مختلف. تو هر تسک، ایجنت رو یه اسنپشات از نسخهٔ مبدأ کد قرار میگیره و یه دستورالعمل نقشهراهِ چندهدفه میگیره که باید قابلیتهای نسخهٔ مقصد رو پیاده کنه. اندازهٔ کار هم کوچیک نیست: بهطور میانه ۳۷۰۰ خط تغییر تو ۵۱ فایل.
نویسندهها ۱۳ مدل frontier رو رو این بنچمارک ارزیابی کردن و نتیجه قابلتأمله. قویترین مدل یعنی Claude-Opus-4.7 فقط ۳۹.۱٪ تسکها رو حل کرده و ضعیفترینشون فقط ۵.۲٪. این عددها در تضاد شدید با بنچمارکهای رفعباگ هستن که مدلها معمولاً روشون نمرهٔ بالایی میگیرن.
جمعبندی مقاله اینه که توسعهٔ نرمافزار بلندمدت و چندهدفه هنوز یه مسئلهٔ عمدتاً حلنشدهست. یعنی با اینکه ایجنتها تو رفع باگهای کوچیک خوب شدن، وقتی پای کار واقعی و بزرگِ مهندسی وسط میاد، فاصلهٔ زیادی تا سطح یه توسعهدهندهٔ انسانی دارن.
نکات کلیدی:
- RoadmapBench ایجنتهای کدنویسی رو با تسکهای بلندمدت و واقعی محک میزنه
- ۱۱۵ تسک از ارتقای نسخهٔ پروژههای اوپنسورس، رو ۱۷ ریپو و ۵ زبان
- هر تسک بهطور میانه ۳۷۰۰ خط تغییر تو ۵۱ فایل میخواد
- قویترین مدل (Claude-Opus-4.7) فقط ۳۹.۱٪ و ضعیفترین ۵.۲٪ رو حل کرد
- نتیجه: توسعهٔ نرمافزار بلندمدت هنوز مسئلهای حلنشدهست




