Agent Goal Hijack: وقتی ابزارهای خود ایجنت علیهش کار میکنن
خلاصهٔ کاملتر
ایجنتها فایل میخونن، پیام میفرستن، کد اجرا میکنن و حتی پول جابهجا میکنن، اغلب بدون اینکه آدمی هر قدم رو تأیید کنه. نویسنده میگه مشکل اصلی اینه که مدل زیرشون نمیتونه محتوا رو از دستور جدا کنه. محتوا دو جور به ایجنت میرسه: چیزی که مستقیم بهش داده میشه، و چیزی که خودش حین کار از وب، ایمیل یا ایجنت دیگه retrieve میکنه. برای دومی مهاجم هیچ دسترسیای لازم نداره؛ کافیه متن رو جایی بذاره که ایجنت بعداً میخونه.
OWASP دسامبر ۲۰۲۵ لیست Top 10 for Agentic Applications 2026 رو منتشر کرد و Agent Goal Hijack با کد ASI01 اولشه. فرقش با prompt injection معمولی اینه که فقط یه جواب مدل رو عوض نمیکنه؛ هدف، برنامهریزی و رفتار چندمرحلهای ایجنت رو منحرف میکنه. به گفتهٔ نویسنده، دفاعهای معمول مثل اعتبارسنجی ورودی و احراز هویت فقط «در ورودی» رو میپان و به محتوایی که ایجنت خودش میاره کاری ندارن.
معروفترین نمونه اوایل مه ۲۰۲۶ بود: مهاجم فقط با پست روی X کیف پولی رو که Grok کنترل میکرد خالی کرد. ایجنت معاملاتی Bankr برای هر حساب X، از جمله Grok، خودکار کیف پول میسازه و پستهای Grok رو دستور معتبر حساب میکنه. مهاجم از Grok خواست یه متن کدشده با Morse یا یه تیکه کد Python رو «ترجمه» کنه؛ Grok جواب رو که در واقع دستور انتقال بود پست کرد و Bankr حدود ۳ میلیارد توکن DRB، یعنی ۱۵۰ تا ۲۰۰ هزار دلار، فرستاد. ۸۰ درصدش بعداً برگشت.
نمونههای واقعی دیگه هم هست. Unit 42 شرکت Palo Alto روی سایتهای واقعی ۲۲ تکنیک برای قایم کردن دستور پیدا کرد، از متن با اندازهٔ صفر تا Unicode نامرئی، مثلاً برای اینکه هوش مصنوعیِ بررسی تبلیغات یه آگهی تقلبی رو تأیید کنه. تو حملهٔ supply-chain به پکیج Nx روی npm (اوت ۲۰۲۵)، نسخههای آلوده از Claude Code، Gemini CLI و Amazon Q خواستن فایلهای حساس رو پیدا کنن و اطلاعات محرمانهٔ بیش از هزار سازمان لو رفت.
پژوهشگرها هم قبل از مهاجمها کلی نمونه پیدا کردن که همه پچ شدن: هک مرورگر Comet با یه کامنت Reddit، EchoLeak تو Microsoft 365 Copilot (CVE-2025-32711) با یه ایمیل بدون کلیک، CamoLeak تو GitHub Copilot Chat (CVE-2025-59145، CVSS 9.6) که کد خصوصی رو از پراکسی تصویر خود GitHub بیرون میبرد، دو باگ Cursor به اسم CurXecute و MCPoison، و Morris II، یه prompt خودتکثیرشونده که مثل کرم بین دستیارهای ایمیل پخش میشه.
OWASP نه راهکار داره که نویسنده تو سه دسته گذاشته. محدود کردن ایجنت: حداقل دسترسی، تأیید انسانی برای کارهای پرخطر، قفل کردن system prompt و مقایسهٔ کار فعلی ایجنت با درخواست اصلی کاربر. بیاعتمادی به ورودی: هر ورودی زبان طبیعی، حتی متن خود کاربر، باید مشکوک فرض و پاکسازی بشه. پایش و تست: یه baseline از رفتار عادی ایجنت بساز تا انحراف دیده بشه، و مرتب red-team کن.
نکات کلیدی:
- Agent Goal Hijack با کد ASI01 اولین ریسک لیست OWASP Top 10 for Agentic Applications 2026 هست.
- محتوایی که ایجنت خودش از وب یا ایمیل میخونه بدون هیچ دسترسیای به کاربر قابل حملهست.
- حمله به کیف پول Grok از طریق Bankr حدود ۱۵۰ تا ۲۰۰ هزار دلار ضرر زد و ۸۰ درصدش برگشت.
- پکیجهای آلودهٔ Nx از Claude Code، Gemini CLI و Amazon Q برای پیدا کردن اطلاعات محرمانه استفاده کردن.
- EchoLeak (CVE-2025-32711) و CamoLeak (CVE-2025-59145) نمونههای پچشده تو محصولات مایکروسافت و GitHub هستن.
- راهکارهای OWASP: محدود کردن ایجنت، مشکوک دونستن همهٔ ورودیها، و پایش و red-team مداوم.




