دامنههای خیالی که هوش مصنوعی میسازه
خلاصهٔ کاملتر
به گفتهی محققهای Unit 42، مدلهای زبانی بزرگ (LLM) بهطور مداوم برای برندهای معتبر آدرس دامنههایی میسازن که اصلاً وجود ندارن. مهاجمها هم دارن از همین موضوع سوءاستفاده میکنن: این دامنههای ناموجود رو ثبت میکنن تا ترافیکی که سیستمهای هوش مصنوعی تولید میکنن رو بگیرن. تو مقاله اومده که اسم این پدیده رو گذاشتن phantom squatting و یه خطر واقعی برای زنجیرهی تأمین نرمافزاره.
منطق ماجرا اینه که دیگه LLM یه ابزار حاشیهای نیست، بلکه بخشی از خود چرخهی توسعهی نرمافزاره. دستیارهای کدنویسی به توسعهدهنده لینک مستند یا آدرس سرویس third-party پیشنهاد میدن، و ایجنتها هم خودشون درخواست HTTP به آدرسهایی میفرستن که مدل ساخته. مشکل اینجاست که خیلی وقتها کسی این خروجی رو مستقل بررسی نمیکنه و همه به مدل اعتماد میکنن.
نویسندهها این حمله رو ادامهی slopsquatting میدونن؛ همونطور که مدل اسم یه پکیج الکی رو میسازه، میتونه یه دامنهی الکی برای پورتال یا API یه برند هم بسازه. چرخهی حمله چهار مرحله داره: کشف الگوی توهم مدل با پرسوجوهای هدفمند، ثبت سریع دامنهها قبل از واکنش مدافعها، استفاده از خود مدل بهعنوان کانال تحویل حمله، و در آخر عبور از دفاعهای مبتنی بر اعتبار.
نکتهی کلیدی چیزیه که بهش میگن zero-reputation bypass: لحظهای که مهاجم یه دامنهی توهمی رو ثبت و مسلح میکنه، هیچ سابقهی تهدید، هیچ امتیاز اعتبار و هیچ ورودی تو بلاکلیست نداره. برای همین دفاعهای سنتی که به شهرت بد دامنه تکیه دارن، عملاً کور میمونن تا وقتی که تازه شروع کنه سیگنال بده.
برای اندازهگیری این تهدید، تیم یه چارچوب چند-ایجنتی ساخت: ۹۱۳ برند جهانی رو تحلیل کرد و ۶۸۵٬۳۳۹ پرسوجو رو روی دو خانوادهی مدل و سه تنظیم دما (T=0.1، T=0.7، T=1.5) اجرا کرد. نتیجه ۲.۱ میلیون آدرس یکتا شد که از بینشون ۱۳٬۲۲۹ تا آدرس مخرب تأییدشده در اومد. جالبه که دمای بالاتر (حالت Creative) نرخ دامنهی توهمی رو خیلی بالا میبره ولی نرخ بدافزار تقریباً ثابت میمونه.
مهمتر از همه، حدود ۲۵۰٬۰۰۰ دامنهی توهمی هنوز ثبتنشده باقی مونده، یعنی یه فرصت آماده برای مهاجمها که زودتر ثبتشون کنن. تو یه نمونهی واقعی، یه مهاجم با کمک یه دستیار کد یه kit فیشینگ به اسم Montana Empire ساخت که روی دامنهای کار میکرد که خط لولهی تشخیص تیم، ۲۳ روز جلوتر اون رو هدف پرخطر شناسایی کرده بود.
نکات کلیدی:
- مدلهای زبانی مدام دامنههای الکی برای برندهای واقعی میسازن و مهاجمها اونها رو ثبت میکنن
- این دامنهها چون تازهن، از فیلترهای مبتنی بر شهرت رد میشن (zero-reputation bypass)
- تحلیل ۹۱۳ برند و ۲.۱ میلیون آدرس، ۱۳٬۲۲۹ آدرس مخرب و حدود ۲۵۰٬۰۰۰ دامنهی توهمی ثبتنشده رو نشون داد
- دمای بالاتر مدل، حجم توهم رو زیاد میکنه ولی نرخ بدافزار تقریباً ثابته
- راهکار: خروجی آدرسهای مدل رو مستقل تأیید کنید و بهش بهعنوان منبع قطعی اعتماد نکنید




