محققها تونستن فکر پنهان مدلهای هوش مصنوعی رو بدزدن
خلاصهٔ کاملتر
شرکتهای بزرگ هوش مصنوعی مثل انتروپیک، OpenAI و گوگل معمولاً «رشتهٔ فکر» (chain-of-thought) مدلهاشون، یعنی مراحل استدلال قدمبهقدم قبل از رسیدن به جواب نهایی، رو مخفی نگه میدارن تا هم مالکیت فکریشون حفظ بشه و هم اطلاعات کمتری درز کنه. بهجای اینکه این رشتهٔ فکر رو سمت سرور نگه دارن، بهصورت بلوکهای متن رمزنگاریشده به کلاینت برمیگردوننش و کلاینت هم همون بلوکها رو با هر درخواست بعدی دوباره میفرسته.
یه گروه محقق تو مقالهای به اسم «دزدیدن رشتهٔ فکر از APIهای اختصاصی مدلهای زبانی» یه آسیبپذیری معماری پیدا کردن: این بلوکهای رمزی بین سشنها، کاربرها و حتی مدلهای مختلف توی اکوسیستم یه شرکت، کاملاً سازگار و قابل جابهجایی هستن. با تزریق بلوک رمزیِ یه مدل قوی به یه مدل ضعیفتر و کممحافظتتر از همون شرکت، میشه اون مدل ضعیف رو مجبور کرد بلوک رو رمزگشایی کنه و عین متنش رو آشکار برگردونه، بدون اینکه نیازی باشه مستقیماً مدل قوی رو جیلبریک کرد.
این آسیبپذیری چهار جور سوءاستفاده رو ممکن میکنه. اول، دور زدن مکانیزمهای ضدِ تقطیر (anti-distillation) که شرکتها برای جلوگیری از کپی شدن مدلهاشون گذاشتن؛ محققها این کارو روی مدلهای انتروپیک، OpenAI و گوگل نشون دادن. دوم، استخراج دادههای خصوصی در مقیاس بزرگ: با رمزگشایی ۳۱۵٬۳۲۰ بلوک رشتهٔ فکر که از مخزنهای عمومی جمعآوری شده بود، محققها ۳۶۷ مورد اطلاعات هویتی شخصی (PII) و ۱۸۲ اعتبارنامه (credential) پیدا کردن.
سوم، این روش میتونه اطلاعات خطرناکی که توی رشتهٔ فکر مدل پنهان مونده رو آشکار کنه، حتی وقتی خروجی نهایی و قابلمشاهدهٔ مدل با احتیاط درخواست مخرب رو رد کرده. چهارم، مهاجمها میتونن با همین ترفند یه پرامپتاینجکشن نامرئی بسازن؛ یعنی محتوای مخرب رو کاملاً داخل بلوکهای رمزی جاسازی کنن تا اجراهای عمومی و خودکار (agentic) رو مسموم کنه. محققها این یافته رو طبق روال افشای مسئولانه به شرکتها گزارش دادن و چندتا راهکار رمزنگاری و سیستمی برای مقابله باهاش پیشنهاد دادن.
نکات کلیدی:
- بلوکهای رمزنگاریشدهٔ رشتهٔ فکر (chain-of-thought) بین سشنها، کاربرها و مدلهای مختلف یه شرکت قابل جابهجایی هستن و همین، آسیبپذیری اصلیه
- محققها این حمله رو روی مدلهای انتروپیک، OpenAI و گوگل نشون دادن
- از ۳۱۵٬۳۲۰ بلوک عمومی، ۳۶۷ مورد اطلاعات شخصی (PII) و ۱۸۲ اعتبارنامه استخراج شد
- این روش میتونه اطلاعات خطرناک پنهانشده تو رشتهٔ فکر رو آشکار کنه، حتی اگه خروجی نهایی امن باشه
- یافته از طریق افشای مسئولانه گزارش شده و راهکارهای رمزنگاری برای رفعش پیشنهاد شده




