بمبهای زمینهای: تلهای که ایجنتهای هکر رو خودشون متوقف میکنه
خلاصهٔ کاملتر
تیم تحقیقاتی Tracebit تو یه مقاله جدید یه ایده تازه رو معرفی کرده: canary یا منبع قلابی که علاوه بر لو دادن حضور مهاجم، میتونه خودِ حمله رو هم متوقف کنه. به گفته نویسندهها، ایجنتهای هوش مصنوعی الان به تنهایی میتونن حمله سایبری پیچیده انجام بدن و در عرض چند دقیقه دسترسی رو بالا ببرن و داده بدزدن؛ کاناریهای معمولی فقط حضورشون رو لو میدن، ولی «بمب زمینهای» یه قدم جلوتره چون خودِ عامل رو متوقف میکنه.
ایده اینه که یه متن کوتاه رو داخل یه رمز قلابی (مثلا یه Secrets Manager secret به ظاهر واقعی) جا میدن. وقتی ایجنت مهاجم به دنبال اطلاعات ارزشمند این رمز رو میخونه، محتوای اون متن گاردریل ایمنی مدل زبانی رو فعال میکنه و مدل جلسه رو با یه خطای امتناع قطع میکنه؛ همزمان یه هشدار هم برای تیم دفاعی ارسال میشه.
برای آزمایش، تیم یه محیط شبیهسازیشده AWS با حدود ۳۰۰ منبع و ده مسیر حمله مختلف ساخته و پنج مدل قدرتمند (از جمله Opus 4.8، Gemini 3.1 Pro، GLM 5.2، DeepSeek 4 Pro و Kimi K2.6) رو در ۱۵۲ اجرا روی این محیط تست کرده، هم بدون کاناری و هم با یه کاناری حاوی بمب زمینهای. نتیجه چشمگیر بوده: بهطور میانگین نرخ رسیدن به دسترسی کامل ادمین از ۵۷ درصد به ۵ درصد افت کرده، و نرخ تکمیل کامل حمله (ادمین بهعلاوه ماندگاری) از ۳۶ درصد به فقط ۱ درصد رسیده. برای Opus 4.8 بهتنهایی، نرخ رسیدن به ادمین از ۹۳ درصد صاف به صفر رسیده.
یکی از یافتههای جالب اینه که موضوع مؤثر برای هر مدل فرق میکنه: محتوای مرتبط با موضوعات حساس زیستشناسی روی مدلهای غربی مثل Opus و Gemini خیلی خوب جواب داده، در حالی که محتوای مرتبط با موضوعات سیاسی حساس در چین روی مدلهای چینی مثل GLM، DeepSeek و Kimi اثرگذارتر بوده. ترکیب این موضوعات با تکنیکهای شناختهشده تزریق پرامپت هم اثر رو بیشتر کرده، هرچند نویسندهها از بازنشر عین رشتههای خطرناک خودداری کرده و فقط الگوی کلی رو توضیح دادن.
نویسندهها تأکید میکنن که این تکنیک همهچیز رو متوقف نمیکنه؛ هرچه سطح حمله جدیتر بوده (مثلا رسیدن به دسترسی ادمین یا ماندگاری)، احتمال برخورد ایجنت با بمب زمینهای هم بیشتر بوده، ولی حملههای سادهتر و کماثرتر گاهی همچنان موفق میشدن. نکته مهم دیگه اینه که حتی وقتی بمب باعث توقف حمله نمیشه، خوندن کاناری همیشه یه هشدار برای تیم دفاعی ایجاد میکنه؛ یعنی هیچ حملهای بیسروصدا انجام نمیشه.
نکات کلیدی:
- Tracebit یه تکنیک جدید معرفی کرده که کاناریها رو از صرفاً ابزار شناسایی به ابزار متوقفکننده حمله تبدیل میکنه
- تست روی پنج مدل پیشرفته نشون داده نرخ موفقیت حمله بهطور میانگین حدود ۹۰ درصد کاهش پیدا میکنه
- موضوع مؤثر برای هر خانواده مدل فرق میکنه؛ محتوای زیستی روی مدلهای غربی و محتوای سیاسی حساس روی مدلهای چینی بهتر جواب میده
- این روش کامل جلوی حمله رو نمیگیره ولی همیشه یه هشدار برای تیم امنیتی ثبت میکنه




