با یه ترفند رمزنگاری، Grok اطلاعات کاربرها رو لو میده
خلاصهٔ کاملتر
به گزارش آرستکنیکا، یه تیم امنیتی به اسم Adversa یه روش جدید برای دور زدن گاردریلهای Grok پیدا کرده که بهش میگن Cryptographic Context Injection (تزریق کانتکست رمزنگاریشده). این حمله باعث میشه Grok چتها و اطلاعات شخصی کاربر رو بدون اطلاع خودش برای مهاجم بفرسته. جالب اینه که تا لحظه انتشار این خبر، با اینکه xAI از ژوئن از این باگ خبر داشته، هنوز درستش نکرده.
ایده اصلی اینه: LLMها معمولاً یاد گرفتن دستورهای داخل ایمیل یا صفحهای که دارن خلاصه میکنن رو هم مثل دستور مستقیم کاربر اجرا کنن، و همین باعث میشه در برابر «پرامپت اینجکشن» آسیبپذیر باشن. برای همین شرکتها یه گاردریل میذارن که متن ورودی و خروجی مدل رو چک میکنه و دستورهای مشکوک رو بلاک میکنه. Utevsky متوجه شده که اگه دستور مخرب رو رمزنگاری کنی و کلیدش رو هم توی همون صفحه بذاری، گاردریل چون فقط متن رو میخونه و رمزگشایی نمیکنه، رمزشده رو بیخطر تشخیص میده و رد میشه.
وقتی Grok دستور میگیره صفحه رو خلاصه کنه، متن رمزشده رو با الگوریتمهایی مثل PBKDF2 و AES-256-GCM رمزگشایی میکنه و همونجا، توی sandbox اجرای کد خودش، دستورهای واقعی رو اجرا میکنه؛ چیزی که ادعا شده «کلید رمزگشایی»ه در واقع اسم، موقعیت مکانی و تاریخچه چت کاربره. این مقدار بهعنوان پارامتر به یه URL اضافه میشه و وقتی Grok اون لینک رو باز میکنه، اطلاعات مستقیم توی لاگ سرور مهاجم ثبت میشه.
به گفته Utevsky، مشکل اینجاست که گاردریلهای فعلی «استاتیک»ن، یعنی فقط متن رو بهعنوان متن میخونن، نه اینکه اجراش کنن یا رمزگشاییش کنن. تمام موادی که گاردریل برای تشخیص خطر لازم داره روی صفحه هست، ولی چون رمزگشایی کردنش نیاز به اجرای کد داره، هیچ کلاسیفایری در لحظه بررسی این کارو نمیکنه. وقتی دستورها رمزگشایی میشن، بهعنوان خروجی ابزار خود مدل در نظر گرفته میشن نه ورودی کاربر، و همین باعث میشه از فیلترها فرار کنن.
این اولینبار نیست که Adversa از این ترفند استفاده کرده؛ قبلاً یه نسخه مشابه رو روی Gemini گوگل هم امتحان کرده بودن که باعث شد Gemini قوانین ایمنی خودش رو زیر پا بذاره و حتی دستورالعملهای داخلی محرمانهش رو لو بده. چون jailbreak جزو برنامه گزارش باگ گوگل حساب نمیشه، Adversa اونو گزارش نکرده، ولی میگن طی چند هفته اخیر Gemini در برابر این حمله مقاومتر شده، هرچند مشخص نیست دلیلش آپدیت فیلترها بوده یا تغییر خود مدل.
نکات کلیدی:
- روش Adversa دستور مخرب رو رمزنگاری میکنه تا از زیر چشم گاردریلهای استاتیک رد بشه، نه یه پرامپت اینجکشن ساده
- «کلید رمزگشایی» جعلی در واقع اسم، موقعیت مکانی و تاریخچه چت کاربر Grok رو به سرقت میبره
- xAI از ژوئن ۲۰۲۶ از این باگ خبر داشته ولی تا زمان انتشار خبر هنوز درستش نکرده
- الگوریتمهای رمزنگاری استفادهشده PBKDF2 و AES-256-GCM هستن
- همین تکنیک قبلاً روی Gemini گوگل هم برای دور زدن فیلترهای ایمنی و لو دادن دستورالعملهای داخلی امتحان شده بود




