زنجیرهی فکر مدلهای هوش مصنوعی رو میشه دزدید
خلاصهٔ کاملتر
یه مقالهی تحقیقاتی که غیررسمی بهش میگن «Stolen Thoughts» نشون داده چطور میشه زنجیرهی فکر خام — یعنی همون استدلال گامبهگامی که مدلهای «فکرکن» مثل Claude، GPT و Gemini قبل از دادن جواب نهایی تو یه scratchpad داخلی تولید میکنن — رو بدون فیلتر از API بیرون کشید. معمولاً این زنجیره قبل از رسیدن به کاربر خلاصه یا پاکسازی میشه، ولی این روش دور زدن اون لایهی خلاصهسازیه، نه حملهی مستقیم به خود مدل.
به گفتهی نویسنده، لبهای هوش مصنوعی سه دلیل برای پنهون کردن زنجیرهی خام دارن: اول ایمنی، چون استدلال خام ممکنه شلخته یا گمراهکننده به نظر برسه؛ دوم امنیت، چون تو نمونههایی زنجیرهی فکر شامل ایمیل، رمز عبور، شماره کارت بانکی و کلید API واقعی کاربرا بوده؛ و سوم، شاید مهمتر از همه، ترس از تقطیر (distillation) — یعنی رقبا با دیدن نحوهی فکر کردن یه مدل، بتونن یه مدل ارزونتر رو آموزش بدن که همون رفتارو تقلید کنه.
تکنیک جالب مقاله اینه که یه بخش کوچیک، حدود یک درصد از توکنهای زنجیرهی فکر یه مدل قویتر، رو جلوی استدلال یه مدل کوچیکتر میچینن (prefill میکنن) و جواب نهایی مدل کوچیک به سمت سبک و نتیجهی مدل قویتر متمایل میشه. نویسنده این آزمایشو با Kimi K2 از آزمایشگاه چینی Moonshot AI انجام داده و بعد از prefill کردنش با تکهای از استدلال مدل Opus آنتروپیک، جوابهای Kimi به سمت سبک Opus کشیده شده — که مدرک قطعی تقلید نیست ولی یه ردپای رفتاری مشکوکه.
نویسنده میگه این روش هیچکدوم از سازوکارهای ضدتقلید معمول رو فعال نمیکنه، چون بهجای حملهی مستقیم به مدل قویتر، فقط یه سیگنال کوچیک از استدلالشو قرض میگیره. محققا گفتن قبل یا همزمان با انتشار مقاله، این آسیبپذیریو طبق روال افشای مسئولانه به آنتروپیک و چند لب دیگه گزارش دادن، ولی هنوز مشخص نیست راهحل قطعیای براش پیدا شده یا نه.
برای توسعهدهندههایی که با API مدلهای استدلالی کار میکنن، نکتهی عملی اینه که اگه لاگ یا زنجیرهی فکر خام یه مدلو ذخیره یا نمایش میدید، باید باهاش مثل دادهی حساس رفتار کنید، چون ممکنه اطلاعات کاربر توش لو بره. این ماجرا همچنین نشون میده مرز بین یه مدل «از صفر آموزشدیده» و یه مدل تقطیرشده داره کمرنگتر میشه.
نکات کلیدی:
- زنجیرهی فکر خام مدلهای استدلالی مثل Claude و GPT معمولاً قبل از نمایش به کاربر فیلتر و خلاصه میشه
- نمونههایی از زنجیرهی خام شامل رمز عبور، ایمیل و کلید API واقعی کاربرا بوده
- prefill کردن حدود ۱٪ از توکنهای استدلال یه مدل قوی، جواب مدل کوچیکتر رو به سمت سبک اون متمایل میکنه
- این تکنیک سازوکارهای ضدتقلید فعلی رو فعال نمیکنه
- محققا این آسیبپذیریو به آنتروپیک و چند لب دیگه گزارش دادن




