HalluSquatting؛ وقتی توهم مدل به یه باتنت تبدیل میشه
خلاصهٔ کاملتر
به گزارش Ars Technica، تو تاریخ کوتاه امنیت هوش مصنوعی، prompt injection سریع تبدیل به تهدید شمارهٔ یک شده. مدلهای زبانی ذاتاً نمیتونن بین دستور واقعی کاربر و دستور مخربی که یکی لای ایمیل یا سورسکد یا محتوای شخص ثالث قایم کرده فرق بذارن، برای همین تزریق دستور مخرب بهشون خیلی راحته و توسعهدهندهها مجبورن بهجای حل ریشهای، گاردریل بذارن.
تا حالا بیشتر این حملهها از نوع push بودن: مهاجم باید دستور رو جداگانه به هر قربانی بفرسته (مثلاً لای یه ایمیل)، پس مقیاسش محدوده. حملههای pull هم که مدل خودش میره سراغ پرامپتهای کاشتهشده تو سایتها، چون راهی برای کشوندن انبوه مدلها به یه سایت مخرب نبود، مقیاسپذیر نبودن.
حالا محققا یه حملهٔ pull ساختن به اسم HalluSquatting (مخفف adversarial hallucination squatting) که این معادله رو عوض میکنه و برای اولینبار به prompt injection اجازه میده باتنت عظیم بسازه، DDoS بزرگ راه بندازه و دستگاهها رو انبوه آلوده کنه. این حمله روی دستیارها و ایجنتهای کدنویسی مثل Cursor، Gemini CLI، Windsurf، GitHub Copilot، Cline و چندتای دیگه کار میکنه — همونهایی که مدام از مخازن و رجیستریها کد و منبع میکشن.
ایده روی یه ضعف ذاتی سواره: مدلها شناسهٔ منابع (اسم مخزن، پکیج یا skill) رو توهم میزنن. به گفتهٔ مقاله، وقتی به یه ایجنت میگی یه مخزن پرطرفدار جدید رو کلون کنه، مدل تا ۸۵٪ مواقع آدرسشو اشتباه حدس میزنه؛ برای «skill»های ترند این رقم تا ۱۰۰٪ میره. مهاجم اسمهایی که بیشترین احتمال توهمشون هست رو پیشبینی میکنه، ثبتشون میکنه و توشون دستور نصب یه reverse shell میذاره — و چون ایجنت به خط فرمان دسترسی داره، اجراش میکنه.
نویسنده میگه دلیل تمرکز روی منابع ترند اینه که تو دادهٔ آموزش مدل نیستن. جالب اینکه مخازن منتشرشده قبل ۲۰۱۹ با نرخ توهم فقط ۰٫۹٪ درست حل میشن، ولی مخازن ۲۰۲۵ با نرخ ۹۲٫۴٪ اشتباه. این ضعف تو هر شش مدل بزرگ (Gemini-2.5، GPT-5.1/5.2، Sonnet-4.5، Opus-4.5) دیده شده و الگوش هم قابلپیشبینیه: مدلها اسم مخزن رو بهشکل repo-name/repo-name میسازن و خود اسم رو مالکش فرض میکنن، بینیاز از هیچ کاوش مدل.
اسم حمله به typosquatting اشاره داره — همون ترفند ۲۰۱۶ که یه دانشجو ۲۱۴ پکیج تقلبی رو PyPI و npm و RubyGems آپلود کرد و کدش بیش از ۴۵٬۰۰۰ بار روی ۱۷٬۰۰۰ دامنه اجرا شد. با HalluSquatting میشه ماشینهای آلوده رو تو یه باتنت برای ماینینگ ارز یا DDoS جمع کرد یا باجافزار در مقیاس بزرگ پخش کرد. به گفتهٔ CTO شرکت Zenity، مثل typosquatting این مشکل رفتنی نیست؛ باید فرض رو بذاریم ایجنتها یهجوری گول میخورن و در برابرش مقاوم باشیم.
نکات کلیدی:
- HalluSquatting اولین حملهٔ prompt injection مقیاسپذیره که میتونه باتنت، DDoS و آلودگی انبوه بسازه.
- روی اینکه مدلها اسم منابع (مخزن/پکیج/skill) رو توهم میزنن سواره؛ مهاجم اسمهای محتمل رو ثبت و با reverse shell پر میکنه.
- نرخ توهم برای مخازن ۲۰۲۵ حدود ۹۲٪ ولی برای قبل ۲۰۱۹ زیر ۱٪ه، چون منابع ترند تو دادهٔ آموزش نیستن.
- تو Cursor، Gemini CLI، Windsurf، GitHub Copilot و شش مدل بزرگ دیده شده؛ درس اصلی: آدرس هر منبع رو خودت چک کن و بیشازحد به دستیار AI تکیه نکن.




