نقد سیاستهای ایمنی Claude Fable 5
خلاصهٔ کاملتر
نِیتن لمبرت تو وبلاگ Interconnects دربارهٔ انتشار مدلی به اسم Claude Fable 5 و یه سری اقدامات ایمنی که آنتروپیک همراهش معرفی کرده مینویسه. اول روی قدرت مدل تأکید میکنه: به گفتهٔ او این باهوشترین مدل در دسترس عمومه و رو تقریباً هر بنچمارک مهمی جهش بزرگی داشته، اون هم با قیمتی حدود دو برابر مدلهای Opus فعلی. نویسنده میگه همین کیفیت بالاست که اهمیت بحث ایمنی رو بالا میبره، چون این فیلترها دارن شکل دسترسی به هوش مصنوعی پیشرفته رو عوض میکنن.
به نوشتهٔ مقاله، آنتروپیک چند لایه ابزار ایمنی اضافه کرده. برای حوزههای امنیت سایبری، بیولوژی/شیمی و distillation، یه سری classifier گذاشته که اگه درخواست مشکوک باشه، جواب بهجای Fable توسط مدل Opus 4.8 داده میشه و کاربر هم ازش باخبر میشه. آنتروپیک میگه بیش از ۹۵٪ نشستها اصلاً این fallback رو تجربه نمیکنن. نویسنده میگه این بخش، هرچند برای کاربر آزاردهندهست، از نظر فکری قابلدفاعه چون شفافه.
بخشی که نویسنده باهاش مشکل داره تو System Card مدل پنهون شده. به نوشتهٔ او، آنتروپیک برای درخواستهای مرتبط با توسعهٔ مدلهای پیشرفته (مثل ساخت pipeline آموزش، زیرساخت آموزش توزیعشده یا طراحی شتابدهندهٔ ML) محدودیت گذاشته، ولی این محدودیت به کاربر نشون داده نمیشه. بهجای fallback، اثربخشی مدل رو با روشهایی مثل تغییر پرامپت، steering vector یا fine-tuning کارآمد (PEFT) کم میکنه. لمبرت میگه مدلی که بیخبر کمهوشتر میشه، عملاً یه AI ناهمراستا (misaligned) هست.
نویسنده معتقده این دوگانگی سیاستها گیجکنندهست و به کل فرایند ایمنی آنتروپیک شک وارد میکنه. به نظر او این «ایمنی» بیشتر دربارهٔ حفظ موقعیت رقابتیه تا محافظت واقعی. او اشاره میکنه که آنتروپیک خیلی دربارهٔ حملات distillation (مخصوصاً از سمت بازیگرهای چینی) حرف زده، ولی فرضیهٔ خودش اینه که جلوگیری کامل از این کار، مدل رو ضعیفتر و موقعیت اقتصادی شرکت رو تضعیف میکنه؛ برای همین میگه شفافیت بیشتر براشون احترام بیشتری میآره.
نویسنده میپرسه چرا برای درخواستهای تحقیقاتی AI یه classifier شفاف مثل بقیهٔ حوزهها نذاشتن، و نتیجه میگیره که این ترکیبی از سیاستهای ایمنی منطقی با تاکتیکهای بیسروصدای حفظ بازاره. او میگه شخصاً نمیتونه به بهترین مدل دنیا تو حوزهٔ کاری خودش (ساخت مدل) اعتماد کنه.
در پایان، لمبرت بحث رو به «مسئلهٔ کنترل» وصل میکنه و میگه چنین فناوری قدرتمندی هیچوقت تعادل نهاییاش کنترل انحصاری توسط یه شرکت خصوصی نمیمونه. به گفتهٔ او این اتفاقها برای جامعهٔ سازندگان مدلهای متنباز در آمریکا یه نقطهٔ بسیج شده؛ او به انتشار مدل Nemotron 3 Ultra از Nvidia اشاره میکنه و میگه ما به هوشی نیاز داریم که بهش اعتماد کنیم، تغییرش بدیم و کنترلش کنیم. این، به گفتهٔ نویسنده، درس اخلاقی این ماجراست.
نکات کلیدی:
- نویسنده Fable 5 رو باهوشترین مدل عمومی میدونه، با قیمت حدود ۲ برابر Opus فعلی
- فیلترهای امنیت سایبری/بیولوژی شفافن و به Opus 4.8 سوییچ میکنن و کاربر باخبر میشه
- ولی فیلتر مربوط به توسعهٔ مدلهای پیشرفته بیخبر و با تغییر پرامپت/steering vector/PEFT مدل رو ضعیف میکنه
- به گفتهٔ نویسنده این کار یه نوع misalignment و در واقع تاکتیک حفظ بازاره نه ایمنی
- نتیجهگیری نویسنده: اکوسیستم متنباز جواب مطمئنتری برای کنترل و اعتماده




