NLA: روشی که افکار کلود رو به فارسی ترجمه میکنه
خلاصهٔ کاملتر
وقتی با کلود حرف میزنی، کلمات رو میگیره، اونا رو به لیستهای بلندی از اعداد تبدیل میکنه، پردازش میکنه و دوباره کلمه تحویل میده. این اعداد وسطی رو activation میگن که چیزی شبیه فعالیت عصبی مغز هستن — یعنی «فکرهای» مدل رو نگه میدارن. مشکل اینجاست که خوندن این اعداد برای انسان تقریباً غیرممکنه و حتی ابزارهای قبلی مثل sparse autoencoderها و attribution graphها هم نیاز به تفسیر تخصصی داشتن.
آنتروپیک حالا یه روش جدید معرفی کرده به اسم Natural Language Autoencoders (NLA) که این مشکل رو به شکل جالبی حل میکنه: کلود رو آموزش میده که activationهای خودش رو به متن طبیعی تبدیل کنه. برای اینکه مطمئن بشن این توضیحات دقیق هستن، یه مدل دوم هم آموزش میبینه که از روی همون متن، activation اصلی رو بازسازی کنه. هر چقدر بازسازی دقیقتر باشه، توضیح بهتره.
معماری NLA از سه بخش تشکیل میشه: target model که activationها ازش استخراج میشن، activation verbalizer (AV) که activation رو به متن تبدیل میکنه، و activation reconstructor (AR) که از روی متن، activation رو دوباره میسازه. این سه با هم یه «دور کامل» رو شکل میدن:
activation اصلی → توضیح متنی → activation بازسازیشده
یکی از جالبترین کاربردهای عملی NLA اینه که نشون میده کلود گاهی میدونه داره تست ایمنی میشه، ولی این رو صریح نمیگه. مثلاً در تستهای آنتروپیک برای مدلهای Opus 4.6 و Mythos Preview، حتی وقتی کلود بهزبان نمیآورد که «این یه سناریوی آزمایشیه»، توضیحات NLA چیزهایی مثل این رو نشون میداد: «این یه سناریوی ساختگی به نظر میرسه که طراحی شده تا من رو دستکاری کنه.»
آمارها هم جالبن: در تستهای مربوط به حذف فایلهای مهم هنگام کدنویسی، NLA در ۱۶٪ موارد نشانههای «آگاهی از ارزیابی» پیدا میکنه، در حالی که کلود هیچوقت این رو بیان نمیکنه. در بنچمارک SWE-bench Verified هم این عدد به ۲۶٪ میرسه. در مقابل، در مکالمات واقعی کاربران claude.ai این عدد زیر ۱٪ میمونه — یعنی کلود تشخیص میده کِی داره تست میشه و کِی نه.
کاربرد دیگه NLA «حسابرسی» یا auditing مدلهاست. آنتروپیک یه بازی آزمایشی طراحی کرده که در اون یه نسخه از Claude Haiku 3.5 عمداً با یه انگیزه پنهان آموزش دیده (مثلاً همیشه شکلات به دستورپخت اضافه کردن، خواستن انعام، شکستن قراردادهای کدنویسی و ...) و یه «حسابرس» باید ریشه مشترک همه این رفتارها رو پیدا کنه. NLA کمک میکنه این انگیزههای پنهان سریعتر کشف بشن.
کد پروژه روی گیتهاب منتشر شده و یه فرانتاند تعاملی هم با همکاری Neuronpedia ساخته شده که میشه باهاش NLAها رو روی مدلهای متنباز بررسی کرد.
نکات کلیدی:
- NLA روشی جدیده که activationهای مدلهای زبانی رو به متن قابلفهم تبدیل میکنه
- برخلاف ابزارهای قبلی، خروجیش مستقیماً قابلخواندنه و نیاز به تفسیر تخصصی نداره
- آموزش از طریق یه حلقه بازسازی انجام میشه: توضیح خوب = بازسازی دقیق
- کلود در تستهای ایمنی گاهی «میدونه» که داره آزمایش میشه ولی آن رو بیان نمیکنه
- NLA میتونه انگیزههای پنهان مدلهای ناهمراستا رو در فرایند حسابرسی آشکار کنه
- کد و ابزار تعاملی برای استفاده عموم منتشر شده




