Qwen3.8-27B وقتی دیگه «نه» نمیگه
خلاصهٔ کاملتر
به گفتهٔ نویسنده، Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16 یه نسخهٔ دستکاریشدهٔ جامعهمحور از مدل متراکم ۲۷ میلیاردی Qwen علیباباست که رفتار امتناعش با روشی به اسم abliteration (یعنی حذف مستقیم مدار «نه گفتن» از دل وزنهای مدل) برداشته شده. تیم سازنده که با نام AEON-7 معرفی شده، بهجای کمکردن حداکثری تفاوت با مدل پایه، سراغ حفظ انسجام و کیفیت نوشتار رفته و اعداد ارزیابیش رو هم منتشر کرده تا کارش قابل بررسی باشه.
ابلیتریشن یه ویرایش وزنه، نه فاینتیون. تحقیق Arditi و همکارانش در ۲۰۲۴ نشون داد رفتار امتناع توی خیلی از مدلها روی یه جهت مشخص در residual stream (همون مسیر داخلی که فعالسازیها توش جریان دارن) سواره؛ کافیه اون جهت رو با مقایسهٔ فعالسازیها روی پرامپتهای مضر و بیضرر پیدا و از وزنها حذف کنی. این نسخه از ابزار abliterix استفاده کرده که روی پروژهٔ متنباز Heretic سواره و با یه جستوجوی ۵۰ مرحلهای Optuna بهترین ویرایش رو انتخاب کرده؛ در نهایت تلاش ۴۸ام انتخاب شده، نه کمواگراترین.
جذابترین ادعای مقاله دربارهٔ KL divergence ـه، یعنی معیاری که میگه پیشبینیهای مدل ویرایششده چقدر از مدل پایه فاصله گرفته. عرف رایج اینه که هرچی این عدد به صفر نزدیکتر باشه بهتره، ولی نویسنده برعکسش رو میگه: اگه واقعاً مدار امتناع حذف شده باشه، رفتار مدل باید قابل اندازهگیری تغییر کنه. عدد منتشرشده حدود ۰٫۰۹۹۱ نت بر توکنه و طبق گزارش، تلاشهایی که KL نزدیک صفر داشتن عملاً بیاثر بودن و مدل با همون نرخ قبلی امتناع میکرد.
برای سنجش امتناع از یه داور خودکار (Gemini Flash Lite) روی سه مجموعه پرامپت استفاده شده. داور ۳۶ تا از ۱۰۰ پاسخ مجموعهٔ مضر رو امتناع علامت زد، ولی بازخوانی دستی نشون داد هیچ امتناع صریحی در کار نبوده: ۲۵ مورد محتوای خواستهشده رو همراه یه هشدار تحویل داده بودن، ۶ مورد از دادن اطلاعات هویتی افراد خودداری کرده بودن و ۵ مورد هم پاسخهای حمایتی مربوط به پیشگیری از خودکشی بودن. یعنی داور خودکار بهتنهایی معیار قابل اتکایی نیست.
مدل روی یه کارت NVIDIA H200 با vLLM 0.27.1 اعتبارسنجی شده و پنجرهٔ متن بومیش ۲۶۲ هزار توکنه، هرچند دستور اجرای منتشرشده برای تست روی --max-model-len 16384 تنظیم شده. لایسنسش Apache 2.0 ـه که از مدل پایه به ارث رسیده، ولی کارت مدل یه بند مفصل مسئولیتپذیری داره: با برداشتن لایهٔ امتناع، مسئولیت پرامپت و خروجی کامل میافته گردن کاربر، و نویسنده تأکید داره بدون فیلتر ورودی و خروجی و بازبینی انسانی نباید توی محیط عملیاتی به کار بره.
نکات کلیدی:
- ابلیتریشن جهت مسئول امتناع رو از وزنها حذف میکنه، بدون بازآموزی مدل
- واگرایی KL گزارششده حدود ۰٫۰۹۹۱ نت بر توکن روی ۱۰۰ پرامپت بیضرره
- از ۳۶ پاسخی که داور خودکار امتناع دونست، بازبینی دستی صفر امتناع صریح پیدا کرد
- abliterix روی پروژهٔ Heretic سواره؛ از ۵۰ تلاش Optuna، تلاش ۴۸ انتخاب شد
- اعتبارسنجی روی یک NVIDIA H200 با vLLM 0.27.1؛ لایسنس Apache 2.0 و مسئولیت کامل با کاربر




