عذرخواهی Anthropic بابت گاردریلهای مخفی Claude Fable
خلاصهٔ کاملتر
شرکت Anthropic بابت اینکه مدل جدیدش Claude Fable 5 رو با یه گاردریل مخفی محدود میکرده عذرخواهی کرده. این مدل اولین عضوِ در دسترسِ عمومِ خانوادهٔ Mythos هست؛ گروهی که خود شرکت ماهها هشدار میداد برای انتشار عمومی زیادی خطرناکن. Anthropic میگه برای کنترل این ریسکها، Fable رو با محدودیتهایی روی بعضی درخواستهای «پرریسک» عرضه کرده.
یکی از این حوزهها distillation بود؛ تکنیکی که توش یه مدل کوچیکتر رو با خروجی یه مدل بزرگتر آموزش میدن. طبق system card مدل (یه سند عمومی که توسعهدهندهها برای توضیح نحوهٔ کار سیستم منتشر میکنن)، Anthropic گفته بود درخواستهایی که فکر میکنه تلاش برای distillation هستن رو با دستکاری و خرابکردن مستقیم جواب مدل هندل میکنه — و کاربر هم اصلاً خبردار نمیشد که این محدودیت فعال شده یا جوابش عوض شده.
طبق گزارش The Verge، حالا Anthropic گفته رویکردش رو عوض میکنه: از این به بعد اینجور درخواستها به Claude Opus 4.8 یعنی مدل پرچمدار قبلیِ شرکت fallback میشن و هر بار هم بهوضوح به کاربر اعلام میشه. شرکت نوشته «هر بار که این اتفاق بیفته اینو میبینی». این همون کاریه که Fable تو بقیهٔ حوزههای پرریسک مثل زیستشناسی، شیمی و امنیت سایبری انجام میده.
نویسنده اشاره میکنه که این محدودیتها گاهی اونقدر سفتوسخت تنظیم شدن که مدل برای سوالهای پایهای هم تقریباً بیاستفاده شده — مثلاً تو حوزهٔ زیستشناسی — و سخنگوی شرکت هم اینو تأیید کرده.
خود Anthropic تو X توضیح داده که گاردریل نامرئی رو برای این انتخاب کرده که میشه خیلی هدفمندتر و با false positive کمتر سریع عرضهاش کرد، چون گاردریل قابلمشاهده رو میشه probe کرد پس باید مقاومتر باشه و وقت بیشتری میبره. ولی قبول کرده که این trade-off اشتباه بوده و کاربر باید نسبت به این محدودیتها دید داشته باشه.
این تغییر بعد از واکنش تند جامعهٔ پژوهشی هوش مصنوعی اومد؛ منتقدها هشدار داده بودن که این محدودیتِ مخفی میتونه پژوهشگرها و طرفهای سومی که فقط دارن مدل رو ارزیابی میکنن رو هم بگیره. Anthropic تو system card گفته بود توانایی مدلهای جدید تو شتابدادن به توسعهٔ AI این هدفگیری رو توجیه میکنه و قبلاً هم رقبای چینی مثل DeepSeek رو به distillation در مقیاس «صنعتی» متهم کرده بود.
نکات کلیدی:
- Claude Fable 5 مخفیانه پاسخهاش رو موقع شکِ distillation خراب میکرد بدون اینکه به کاربر بگه
- distillation یعنی آموزش مدل کوچیکتر با خروجی مدل بزرگتر
- حالا این درخواستها به Claude Opus 4.8 fallback میشن و به کاربر هم اطلاع داده میشه
- Anthropic قبول کرد انتخاب گاردریل نامرئی یه trade-off اشتباه بوده
- این تغییر بعد از فشار و انتقاد جامعهٔ پژوهشی AI اتفاق افتاد




