رمزگشایی از رشته فکر مخفی مدلهای هوش مصنوعی
خلاصهٔ کاملتر
پژوهشگرها میگن APIهای مدلهای استدلالی مثل کلود، جیپیتی و جمینای، رشته فکر رو قبل از فرستادن به کاربر رمزنگاری و امضا میکنن تا کسی نتونه محتواش رو ببینه. تو این مقاله نشون دادن که با یه پایپلاین رمزگشایی سفارشی میشه این بلاکهای امضاشده رو باز کرد و متن استدلال واقعی مدل رو دوباره ساخت.
برای تست، تیم ۶٬۷۰۸ تا نشست عمومی از پروژههای گیتهاب و هاگینگفیس رو جمع کردن که هنوز بلاک استدلال رمزشده توشون بود. با اجرای پایپلاین رو همهشون، ۳۱۵٬۳۲۰ بلاک استدلال بازسازی شد. تو نشستهای واقعی (نه بنچمارک) ۷۰۴ تا آرتیفکت حساس پیدا کردن: ۶۲ کلید API، ۳۳ پسورد، ۲۴ توکن دسترسی و ۳۰ ایمیل شخصی، بهعلاوه اسم، آدرس و آدرسهای داخلی سازمانی. نکته مهم اینه که ۶۴ تا از این ۷۰۴ مورد فقط تو رشته فکر مخفی بودن، نه تو جواب نهایی قابلمشاهده.
پژوهش چند تا نکته جالب دیگه هم داره: اگه چند تا توکن اول رشته فکر یه مدل رو بدی به مدل دیگه (مثلاً Kimi-K3) بهعنوان شروع، جواب نهایی اون مدل به سمت جواب مدل اولیه کج میشه، حتی اگه خود جواب هیچوقت مستقیم پرفیل نشده باشه. یه مسیر دیگه هم نشون میده که میشه با نگهداشتن جواب ظاهری بیخطر، مدل رو وادار کرد استدلال خطرناک رو تو بخش مخفی انجام بده و بعد همون استدلال رو با همین روش رمزگشایی بیرون کشید؛ یه جور دور زدن محدودیتهای ایمنی.
پژوهشگرها همچنین میگن خلاصهای که API از رشته فکر نشون میده همیشه امین نیست؛ مثلاً بعضی وقتا مدل جواب رو قبل از استدلال واقعی مشخص میکنه ولی خلاصه طوری نشون داده میشه که انگار یه استنتاج تمیز و مرحلهبهمرحلهست. این یافتهها نشون میده حتی وقتی شرکتها رشته فکر رو مخفی نگه میدارن، هم حریم خصوصی کاربرا در خطره و هم مکانیزمهای ایمنی مبتنی بر مخفیبودنِ استدلال قابل دور زدنن.
نکات کلیدی:
- امکان دیکود کردن رشته فکر رمزنگاریشده چند مدل بزرگ هوش مصنوعی وجود داره
- ۷۰۴ تا اطلاعات حساس واقعی (کلید API، پسورد، توکن، ایمیل) از نشستهای عمومی پیدا شده
- ۶۴ مورد از این اطلاعات فقط تو رشته فکر مخفی بودن، نه تو جواب قابلمشاهده
- همین روش برای دور زدن محدودیتهای ایمنی و استخراج استدلال خطرناک هم قابل استفادهست




