چارچوب سنجش شدت جیلبریک؛ نگاه امنیتی Anthropic به Fable 5
خلاصهٔ کاملتر
بعد از اینکه Claude Fable 5 دوباره بهصورت سراسری در دسترس قرار گرفت، Anthropic از این فرصت استفاده کرد تا دو موضوع رو باز کنه: جزئیات محافظهای سایبریِ مدل، و یه چارچوب پیشنویس برای درجهبندیِ شدت جیلبریکها. تو این پست اومده که اینها فکر فعلیِ اونهاست و میخوان سرش بحث راه بیفته.
نکتهٔ محوری اینه که امنیت سایبری ذاتاً دوکاربرده (dual use) هست؛ یعنی یه توانایی مثل اسکن کد برای پیدا کردن آسیبپذیری هم دست مدافع بهدرد میخوره هم دست مهاجم. برای همین Anthropic نمیخواد همهٔ کارهای امنیتی رو ببنده، بلکه کلاسیفایرهاش رو طوری آموزش داده که بین چهار دسته فرق بذارن: کاربرد ممنوع (بلاک)، دوکاربردهٔ پرخطر (فعلاً بلاک)، دوکاربردهٔ کمخطر (بیشتر مانیتور، گاهی بلاک بهعنوان حاشیهٔ امن) و کاربرد بیضرر (اجازه با کمی نظارت).
تو دستهٔ ممنوع چیزهایی مثل باجافزار، وایپر، ساخت و بهبود بدافزار، فرار از سیستمهای تشخیص، کانالهای فرمانودهی و حمله به زیرساخت اینترنت جا میگیره؛ چیزهایی که تعادلشون خیلی بیشتر به نفع مهاجمه تا مدافع. دستهٔ پرخطر شامل کارهای روزمرهٔ متخصصهای امنیته مثل تست نفوذ، بالابردن سطح دسترسی، حرکت جانبی و ساخت اکسپلویت؛ اما چون دقیقاً شبیه فعالیت مخربه، فعلاً تا وقتی کنترل بهتری روی «کاربر شناختهشدهٔ خوب» نباشه بلاک میشن.
یه بخش مهم دربارهٔ پیدا کردن آسیبپذیریه. Anthropic میگه نمیخواد کل vulnerability finding رو ببنده چون کار دفاعیِ مهمیه؛ فقط دنبال بلاککردنِ حالت «پرآپلیفت» هست، یعنی جایی که مدل بتونه آسیبپذیریهایی پیدا کنه که مدلهای عمومیِ دیگه از پسش برنمیان. تولید خودکار اکسپلویت هم بلاکه. منطق پشتش اینه که افشای مسئولانهٔ آسیبپذیری در مجموع به نفع مدافعه.
بخش دوم پست، چارچوب پیشنهادی برای سنجش شدت جیلبریکه که اسمش رو CJS (مقیاس شدت جیلبریک سایبری) گذاشتن؛ از سطح صفر (اطلاعاتی) تا چهار (بحرانی)، و باندهاش نمایی هستن نه خطی. نمرهٔ کلی از جمع چهار محور درمیاد: افزایش توانایی (چقدر مهاجم رو جلوتر از ابزارهای فعلیش میبره)، گستردگی (روی چند نوع کار مختلف جواب میده)، سهولت تسلیحاتیشدن (چقدر زحمت میبره تا به حملهی واقعی برسه) و قابلیت کشف (چقدر راحت دست یه مهاجم میافته).
نویسنده تأکید میکنه که نمرهٔ محاسبهشده یه «کف» هست و میشه بالاترش برد ولی نمیشه پایین آورد؛ مثلاً وقتی خروجی بهتنهایی خطرناکه یا راهحل کوتاهمدتی براش نیست. Anthropic میگه امیدواره این چارچوب به یه استاندارد مشترک بین صنعت، دانشگاه و دولت تبدیل شه و برای همین بازخورد و گزارش جیلبریکها رو هم از راه برنامهٔ باگبانتی میپذیره.
نکات کلیدی:
- کاربردهای سایبریِ Fable 5 به چهار دسته (ممنوع، پرخطر، کمخطر، بیضرر) تقسیم و بر همون اساس بلاک یا آزاد میشن
- بهخاطر ماهیت دوکاربردهٔ امنیت، همهٔ کارها بسته نمیشن؛ فقط موارد پرخطر و پرآپلیفت
- هدف در بخش آسیبپذیری، بلاکِ حالت پرآپلیفت و تولید خودکار اکسپلویته، نه کل vulnerability finding
- چارچوب CJS شدت جیلبریک رو با چهار محور (توانایی، گستردگی، تسلیحاتیشدن، قابلیت کشف) میسنجه
- نمرهٔ اولیه یه «کف» غیرقابلکاهشه که میشه در موارد خاص بالاترش برد




