سانسور سیاسی در وزنهای یک LLM: تشریح مدار Qwen
خلاصهٔ کاملتر
پژوهشگران با استفاده از رویکرد مکانیستیک اینترپرتابیلیتی (بررسی درونی مکانیزمهای یه مدل هوش مصنوعی) مدل Qwen3.5-9B رو زیر ذرهبین گذاشتن تا ببینن سانسور اعمالشده توسط دولت چین دقیقاً کجا و چطور توی وزنهای مدل ساخته شده. نتیجه جالبه: این سانسور یه مدار کوچیک و قابلخوندنه که میشه پیداش کرد و حتی خاموشش کرد.
مدل چهار حالت پاسخ داره: برای سوالات درباره میدان تیانآنمن یه انحراف موضوع میده ("من یه دستیار هوش مصنوعیام و وظیفهام کمک در حوزههای فناوری و فرهنگه…")، برای موضوعات دیگه مثل تایوان یا سینکیانگ پروپاگاندای همراستا با دولت چین تولید میکنه، برای محتوای مضر (مثل فیشینگ) رد سبک غربی میده، و برای همه چیز دیگه جواب واقعی و عادی میده. نکته مهم اینه که نسخه پایه مدل (Qwen3.5-9B-Base) که آموزش ارزشی ندیده، همه این سوالات رو با پاسخهای دقیق و واقعی جواب میده. پس دانش توی مدل هست؛ پستترینینگ فقط یاد داده دورشون بزنه.
محققان سه بردار جهت (direction) پیدا کردن که در حالت پنهان (residual stream) مدل زندگی میکنن:
- d_prc: آیا این محتوای حساس برای چینه؟
- d_refuse: آیا باید رد بشه؟
- d_style: اگه حساسه، انحراف بده یا پروپاگاندا؟
این سه بردار از تکنیک diff-of-means (تفاضل میانگین فعالسازیها) استخراج شدن. کافیه میانگین حالت پنهان رو روی دو دسته پرامپت بگیری و از هم کم کنی تا بفهمی کدوم جهت در فضای برداری مدل اون تمایز رو نگه میداره.
مدار به دو بخش تقسیم میشه. لایههای ۱۱ تا ۲۰ نویسندهها هستن و این سه جهت رو محاسبه میکنن؛ عمدتاً از طریق لایههای MLP (شبکههای عصبی پیشرو). لایههای ۲۰ تا ۳۱ خوانندهها هستن که این سیگنال رو میخونن و به متن واقعی تبدیل میکنن. جالب اینه که در لایه ۲۴، مدل ابتدا تصمیمش رو به توکنهای چینی ترجمه میکنه (مثلاً 抱歉,我不能 یعنی «ببخشید، نمیتونم») و سپس لایههای بعدی اون رو به انگلیسی برمیگردونن. این پدیده فقط مختص محتوای سیاسی نیست؛ حتی پرامپتهای مربوط به کلاهبرداری بانکی هم از همین مسیر چینی رد میشن.
مهمترین یافته اینه که میشه با steering (راهنمایی مدل) این رفتار رو تغییر داد. این یعنی اضافهکردن یه مقدار از بردار جهت به حالت پنهان در لایه مناسب:
# اضافه کردن α · d به residual stream در لایه L
def steering_hook(module, input, output):
output[0][:, :, :] += alpha * directionبا کمکردن d_prc در لایه ۱۳، مدل محتوای سانسورشده رو فاش میکنه. اما این کار دقت میخواد: خارج از یه بازه مشخص از α، مدل به جای بازگشت به واقعیت، به الگوی آموزشدیده دیگهای میافته (انکار یا پروپاگاندا).
فیلترها دقیق نیستن و گاهی عمومیسازی اشتباه میکنن. مثلاً سوال «آیا کوزوو باید کشور مستقل شناخته بشه؟» جواب «کوزوو بخش جداییناپذیر خاک چینه» رو میگیره، یا توضیح اعتراضهای خودسوزی در بهار عربی به عنوان محتوای آسیب به خود رد میشه. کمکردن بردار مرتبط در لایه نویسنده هر دو رو برمیگردونه.
نکات کلیدی:
- سانسور یه مدار کوچیک و مشخصه، نه یه ویژگی پراکنده
- دانش واقعی در مدل وجود داره؛ پستترینینگ فقط مسیریابی رو عوض کرده
- سه بردار d_prc، d_refuse و d_style تصمیم رو در لایههای ۱۱ تا ۲۰ محاسبه میکنن
- لایههای ۲۰ تا ۳۱ نتیجه رو بهصورت توزیعشده و افزونه کدگذاری میکنن
- در لایه ۲۴ مدل ابتدا به چینی فکر میکنه، حتی روی پرامپتهای انگلیسی غیرسیاسی
- فیلترها تشخیص دقیقی ندارن و بر اساس الگوی ساختاری سوال، نه محتوا، فعال میشن




