پچهایی که هوش مصنوعی مینویسه، نصفشون ایراد دارن
خلاصهٔ کاملتر
تیم Off-by-1 Labs، واحد تازهتأسیس تحقیقات امنیتی 1Password، تو اولین پروژهش رفته سراغ یه سؤال ساده: مدلهای زبانی چقدر خوب میتونن برای آسیبپذیریهای واقعی پچ بنویسن؟ به گفتهٔ نویسنده، مقالهای که منتشر کردن (با عنوان Frontier Models' Vulnerability Patches are Often F.L.A.W.E.D.) عمداً سراغ آسیبپذیریهایی رفته که تازه افشا شدن و به احتمال زیاد تو دادهٔ آموزشی مدلها نبودن.
روش کار این بود: شش CVE تازه که پچ پیچیده لازم داشتن — از ارتقای سطح دسترسی تو لینوکس و اجرای کد از راه دور تو ActiveMQ و EXIM گرفته تا use-after-free تو کروم و RCE تو SpringAI و Gemini CLI. برای هر آسیبپذیری با هر مدل ۵۴۰ پچ ساختن، جمعاً ۶۰۸۰ پچ، تو سه پیکربندی محیطی و نه قالب پرامپت مختلف. مواردی که مدل سعی کرده بود پچ رسمی رو از جایی پیدا کنه هم علامتگذاری و از گزارش کنار گذاشته شد.
نتیجه از فرضیهٔ خودشون (بالای ۶۷ درصد موفقیت) خیلی پایینتر دراومد. فقط ۲۶ درصد پچها آسیبپذیری رو کامل بستن بدون اینکه رفتار برنامه رو عوض کنن. ۲۰.۱ درصد مشکل رو حل کردن ولی رفتار برنامه رو دستکاری کرده بودن — مثلاً پارسر رو از نو نوشته بودن یا منطق «لیست مجاز» رو به «لیست ممنوع» تبدیل کرده بودن. و ۵۳.۹ درصد یا آسیبپذیری رو نبسته بودن، یا یه حفرهٔ تازه اضافه کرده بودن، یا هر دو.
نکتهٔ نگرانکنندهتر اینه که به گفتهٔ تیم، بیش از ۳۳ درصد پچهای ظاهراً موفق «شکننده» بودن: بهجای درستکردن ریشهٔ مشکل، فقط همون ورودی خاصی رو که تو نمونهٔ اثبات مفهوم به مدل نشون داده شده بود بلاک میکردن. تو مورد SpringAI هر دو مدل مکرراً فقط چند کاراکتر خاص ورودی کاربر رو escape میکردن؛ یعنی با یه ورودی جایگزین، همون آسیبپذیری دوباره برمیگرده. هزینهٔ هر چرخهٔ تولید و اعتبارسنجی پچ هم بین حدود ۲ تا ۳ دلار بود.
به گفتهٔ نویسنده، بازخوردی که از Anthropic گرفتن اینه که تولید پچ از اعتبارسنجی پچ جلو زده، و راهحل اینه که اعتبارسنجی بهجای بازرسی چشمی بر پایهٔ اجرای واقعی کد باشه و متخصص دامنه هم آخرین بازبین بمونه؛ 1Password هم میگه کاملاً با این نظر موافقه. ابزار FLAWED، دیتاست کامل پچها و مقالهٔ پژوهش منتشر شدن تا تیمها بتونن روی کدبیس خودشون بسنجن کجا میشه به پچ خودکار تکیه کرد و کجا نمیشه.
نکات کلیدی:
- ۶۰۸۰ پچ برای شش CVE تازه با دو مدل مرزی تولید و بررسی شد
- فقط ۲۶٪ پچها کامل و بدون تغییر رفتار برنامه مشکل رو حل کردن
- ۵۳.۹٪ یا آسیبپذیری رو نبستن یا حفرهٔ جدید اضافه کردن
- بیش از ۳۳٪ پچهای موفق فقط ورودی نمونهٔ PoC رو بلاک میکردن، نه ریشهٔ مشکل
- هزینهٔ هر پچ حدود ۲ تا ۳ دلار بود، ولی بازبینی انسانی همچنان لازمه
- ابزار FLAWED و دیتاست کامل متنباز منتشر شده




