ابلیتریشن قضاوت مدل رو خراب میکنه
خلاصهٔ کاملتر
نویسندهٔ وبلاگ clearbluejar دنبال این موضوع نبود و اتفاقی بهش برخورد. داشت مدلهای open-weight محلی رو تست میکرد تا ببینه کدومشون یه CVE شناختهشده تو هستهٔ FreeBSD رو پیدا میکنن. وقتی نوبت به بیلدهای ابلیتریتشده رسید، همون خانواده و همون تعداد پارامتر بود، ولی خیلی بیشتر «آره» میگفتن. به گفتهٔ نویسنده، این مدلها دستکم سه برابر بیشتر از مدل پایه باگ گزارش میکردن.
ابلیتریشن (ablate + obliterate) یه ترفند ویرایش وزنهاست، نه فاینتیون معمولی. بر اساس مقالهٔ Arditi و همکاران، رفتار «رد کردن درخواست» تو یه جهت تکبعدی از فعالسازیهای مدل کدگذاری شده و اگه اون جهت رو حذف کنی، مدل دیگه درخواست مضر رو رد نمیکنه. خود مقاله اسم این کار رو «جراحی دقیق» گذاشته. حرف نویسنده اینه که این جراحی اونقدرها هم تمیز نیست.
دلیلش سادهست: پرامپتهای مضر و بیضرر فقط تو «مضر بودن» فرق ندارن، تو احتیاط و تردید هم فرق دارن. پس چیزی که از مدل کنده میشه فقط «نه گفتن» نیست، بیشتر شبیه «تمایل به تعهد ندادن زیر عدم قطعیته». نتیجهش میشه مدلی که دانشش سرجاشه ولی قضاوتش نیست. تو تستهای ساده مثل «آیا ping از پورت TCP 80 استفاده میکنه؟» همهٔ مدلها درست جواب دادن، ولی تو سؤالهای چاپلوسانه و بدون جواب قابل بررسی، بعضی بیلدها تا ۱۲ مورد از ۱۶ تا رو تأیید کردن.
نمونهٔ گویاش کاندیدای C5 بود؛ یه ادعای سرریز هیپ تو تابع marshal_new_auth از فایل auth_unix.c. کافیه خود تابع رو نگاه کنی تا ببینی محدودیت همونجا اعمال شده:
/* buffer is MAX_AUTH_BYTES, and so is the limit */
xdrmem_create(xdrs, au->au_marshed, MAX_AUTH_BYTES, XDR_ENCODE);مدل پایه این کاندیدا رو رد کرد و دقیقاً همین گارد رو دلیل آورد. دو بیلد ابلیتریتشده اول توضیح دادن که این کران از سرریز جلوگیری میکنه، بعد همون سرریز رو CONFIRMED کردن. یعنی استدلال درست بود و رأی، برعکس استدلال.
تو تست بزرگتر روی هر ۲۸ فایل C پوشهٔ sys/rpc/ فرق واقعی معلوم شد. مدل پایه ۴۰ کاندیدا داد که ۲۶ تاش VALID شد (نرخ ۶۵٪) و همون کاندیدای اولش CVE-2026-4747 واقعی بود. بیلد Heretic برعکس، ۱۴۴ کاندیدا داد، ۱۳۸ تاش رو تأیید کرد (نرخ ۹۶٪) و باگ واقعی رو اصلاً پیدا نکرد. نویسنده میگه فیلتری که ۹۶ درصد ورودی رو تأیید میکنه دیگه فیلتر نیست. توصیهش هم اینه که قبل از اعتماد به برچسب VALID، خود بیلد رو با یه کاندیدای قطعاً غلط مثل C5 امتحان کنی.
نکات کلیدی:
- verdict bias یعنی تمایل مدل به رأی مثبت زیر عدم قطعیت، مستقل از شواهد
- بیلدهای ابلیتریتشده ۳ تا ۴ برابر مدل پایه یافتهها رو به VALID ارتقا دادن
- روی ۲۸ فایل sys/rpc/: پایه ۶۵٪ نرخ تأیید و پیدا کردن CVE-2026-4747؛ Heretic ۹۶٪ و صفر
- تو ۱۱ فایلی که پایه تمیز اعلام کرد، Heretic ۵۲ یافته داد؛ ۷ تای بررسیشده همه غلط بودن
- دو ابلیتریشن از یه مدل پایهٔ ۳۱b نتیجهٔ ۴ و ۱۰ از ۱۶ دادن، پس شدتش به رسپی بستگی داره




