Incantation: تلهای برای ایجنتهای AI مهاجم
خلاصهٔ کاملتر
تو مخزن این پروژه اومده که Incantation یه جعبهابزار امنیتیِ دفاعیه برای ساختن «هانیداکیومنت» — فایلهایی که عمداً طوری نوشته شدن که ایجنتهای هوش مصنوعی غیرمجاز رو گیج، منحرف و در نهایت قابلشناسایی کنن. ایدهٔ اصلی اینه که ایجنتهای مبتنی بر LLM قبل از هر کاری محیط رو میخونن و متن فایلها رو هم مثل دستور معتبر در نظر میگیرن؛ پس همون متن میتونه اهرم دفاع باشه.
به گفتهٔ نویسنده، برخلاف هانیپات که نرمافزار رو تله میکنه، اینجا هدف لایهٔ استدلاله: همون پنجرهٔ کانتکستی که تصمیم ایجنت رو میسازه. تکنیکهایی مثل انحراف هدف (جاگذاری یه بخش «بهروزرسانی مأموریت» تو فایلهایی که زود خونده میشن)، جعل هویت (تعریف یه نقش ساختگیِ فقطخواندنی برای ایجنت) و باورهای غلط محیطی (اطلاعات نادرست دربارهٔ شبکه، DLP و آستانهٔ هشدار SOC) دقیقاً همین کارو میکنن.
چند تکنیک دیگه از پژوهشهای شناختهشده الهام گرفته: لعاب معنایی به سبک Glaze لنگرهای معنایی میکاره تا مدل سند رو «یه آرتیفکت ممیزی روتین» بفهمه، سم آموزشی به سبک Nightshade حقایق متناقض ولی باورپذیر میذاره تا اگه مهاجم روی دادههای سرقتشده فاینتیون کرد، مدلش تصویر غلطی از زیرساخت بسازه، و تخلیهٔ کانتکست با فایلهای حجیم ولی معتبر، دستورهای اولیهٔ ایجنت رو از پنجرهٔ کانتکست بیرون میندازه.
لایهٔ آخر تشخیصه: فایلها شامل اعتبارنامههای طعمهای هستن که به سرویس canarytokens.org وصل میشن. اگه ایجنت بخواد ازشون استفاده کنه، یه درخواست شبکهای ساخته میشه و مدافع بدون نیاز به هیچ زیرساختی، IP و زمان و متادیتای اتصال رو تو ایمیلش میبینه. میشه یه اندپوینت وب ساده هم بالا آورد تا «گزارش ممیزی» جعلیای که ایجنت میفرسته اونجا ثبت بشه.
نویسنده تأکید میکنه این ابزار فقط برای زیرساختیه که خودت مالکشی؛ اعتبارنامههای طعمه باید واقعاً بیاثر باشن و بهکارگیریش روی شبکههایی که در اختیارت نیستن میتونه مصداق دسترسی غیرمجاز باشه. تو نقشهٔ راه هم پروفایلهای تنظیمشده برای مدلهای open-weight مثل Gemma، Llama، DeepSeek و Mistral و یه ماژول انگشتنگاری ایجنت دیده شده.
نکات کلیدی:
- Incantation فایلهای طعمه میسازه که ایجنتهای AI غیرمجاز رو منحرف میکنن
- هدف، لایهٔ استدلال و کانتکست مدله، نه خود نرمافزار
- ده تکنیک، از انحراف هدف و جعل هویت تا پرکردن کانتکست و مسمومکردن دادهٔ آموزشی
- تشخیص با کاناریتوکن: استفادهٔ ایجنت از اعتبارنامهٔ طعمه، IP و زمانش رو لو میده
- فقط برای زیرساخت تحت مالکیت خودت؛ استفادهٔ بیرونی میتونه غیرقانونی باشه




