ابرقدرت ایمنیِ Anthropic از نگاه استرتچری
خلاصهٔ کاملتر
بن تامپسون تو استرتچری میگه با منتقدانی که بیانیههای عمومی Anthropic رو ترسفروشی برای بازاریابی میدونن همدردی داره. یادآوری میکنه که دو ماه پیش Anthropic از Mythos Preview رونمایی کرد و گفت برای انتشار عمومی زیادی خطرناکه (بهویژه در تواناییهای سایبری)، و بعد دو ماه بعد Fable رو منتشر کرد که نسخهای از Mythos با guardrailهای ایمنیه. به نظر نویسنده Fable مدل بهشدت چشمگیریه که مدلهای دیگه (از جمله GPT 5.5 و Opus 4.8) رو کوچیک جلوه میده و احتمالاً محصول یه pre-train جدید و اولین نسل تازهست.
نویسنده میگه guardrailها قابل jailbreak ان و ظاهراً کمی بعد از انتشار همین اتفاق افتاد. بعدش به روایت خود Anthropic از یه بلاگپست استناد میکنه: دولت آمریکا با استناد به اختیارات امنیت ملی یه دستور کنترل صادرات صادر کرد تا دسترسی هر تبعهٔ خارجی به Fable 5 و Mythos 5 معلق بشه، و در نتیجه Anthropic مجبور شد این دو مدل رو برای همهٔ مشتریها غیرفعال کنه؛ دسترسی به بقیهٔ مدلها تحت تأثیر قرار نگرفت. Anthropic استدلال کرد که این jailbreak فقط چند آسیبپذیری جزئی و از قبل شناختهشده رو پیدا کرده که مدلهای عمومی دیگه هم بدون بایپس پیداشون میکنن. نویسنده میگه دربارهٔ جزئیات مورد مناقشه چیزی برای اضافه کردن نداره، ولی از وقوع خود درگیری تعجب نمیکنه چون قبلاً استدلال کرده بود که تعارض بین دولت آمریکا و Anthropic اجتنابناپذیره.
بعد سؤال اصلی رو مطرح میکنه: اگه Mythos اینقدر خطرناکه، چرا اصلاً Fable رو منتشر کنی و چرا با دولتی که داره دقیقاً همون کاری که ادعا میکنی میخوای رو میکنه بجنگی؟ نویسنده میگه کارهای Anthropic کاملاً قابلفهمه؛ چیزی که این شرکت رو منحصربهفرد میکنه نحوهٔ توجیهشه. او سه «imperative» رو باز میکنه: اقتصادی (لبههای مدل کالایی میشن، پس ارزش در نزدیک شدن به کاربر و جایگزینی نرمافزاره)، داده (بهبود مدل از RL و استفادهٔ واقعی میاد، که چرا اشتراکهای سنگین یارانهای و سیاست نگهداری ۳۰ روزهٔ داده رو توضیح میده)، و قدرت (طرح اولیهٔ Anthropic برای تضعیف پنهانی Fable موقع کارهای توسعهٔ frontier LLM).
نویسنده روی طرح تضعیف پنهانی مکث میکنه و از System Card نقل میکنه که Anthropic گفته بود برای درخواستهای مربوط به توسعهٔ LLM پیشرفته، اثربخشی مدل رو با روشهایی مثل تغییر prompt، steering vector یا PEFT محدود میکنه، بدون اینکه به کاربر نشون داده بشه. Anthropic بعداً این تصمیم رو پس گرفت و گفت بهجاش این درخواستها رو به Opus 4.8 واگذار و به کاربر اعلام میکنه. به نظر نویسنده طرح اولیه روشن میکنه که Anthropic باور نداره کسی غیر از خودش باید frontier LLM بسازه، و هم توانایی و هم تمایلش رو به تغییر بیصدای مدل برای اعمال ترجیحات سیاستیش نشون داد.
در پایان، تامپسون میگه داستان همیشه «ایمنی» ئه، و این توجیهها کار میکنن چون برای Anthropic اصلاً توجیه نیستن؛ شرکت واقعاً باور داره تنها کسیه که به فوقهوش و خطرهاش اهمیت میده، و همین هر تصمیم و تقابلی رو توجیه میکنه. او این همراستایی کاملِ استعداد و مأموریت و کسبوکار رو با Apple مقایسه میکنه: هم بهش احترام میذاره چون بهروشنی مؤثره، هم ازش میترسه، چون به گفتهٔ او تاریخِ آدمهای باهوشی که مطمئنان میدونن بشریت به چی نیاز داره، تاریخ تلخیه. این یه تحلیل و دیدگاه شخصی یک نویسندهست.
نکات کلیدی:
- نویسنده استدلال میکنه Anthropic هر تصمیم تجاریش رو با روایت ایمنی توجیه میکنه
- دولت آمریکا با دستور کنترل صادرات دسترسی به Fable 5 و Mythos 5 رو معلق کرد
- سیاست نگهداری ۳۰ روزهٔ داده و طرح اولیهٔ تضعیف پنهانی مدل نقاط مناقشه بودن
- به نظر نویسنده همراستایی مأموریت و کسبوکار Anthropic هم مؤثره هم نگرانکننده
- این یه تحلیل نظری و دیدگاه یک نویسندهست، نه موضع رسمی Anthropic




