چارچوب پنجمرحلهای دیپمایند برای عرضهٔ ایمن AGI
خلاصهٔ کاملتر
به روایت این مقاله، چارچوبی که دیمیس هسابیس و تیم گوگل دیپمایند منتشر کردن یه مقالهٔ آکادمیک صرف نیست، بلکه یه سند عملیاتیه برای همین امروز: سیستمهای هوش مصنوعی رو تو پنج پلهٔ توانایی میچینه و برای هر پله میگه چه آزمون و چه محدودیتی قبل از عرضه لازمه. فرض پایهش سادهست — هرچی توانایی بالاتر بره، پیامد ناهمراستایی یا سوءاستفاده هم به همون نسبت بزرگتر میشه.
پلهٔ یک هوش مصنوعی باریک و تخصصیه؛ همون چیزی که بیشتر شرکتها امروز باهاش کار میکنن و رد تیمینگ و فیلتر محتوا و ارزیابی سوگیری براش کافیه. پلهٔ دو یعنی توانمندی قابلاتکا تو چند حوزه همزمان، که به گفتهٔ نویسنده سطح حمله رو عوض میکنه: مدلی که همزمان شیمی و زیستشناسی و لجستیک بلده میتونه کاری بکنه که یه دستیار شیمی محض هیچوقت نمیتونست.
از پلهٔ سه به بعد سختگیری جدی میشه: ارزیابی اجباری توانایی، رد تیمینگ مستقل و نه فقط داخلی، ممیزی تفسیرپذیری، گیتگذاری روی کاربردها و مستندسازی رسمی حالتهای شکست. پلهٔ چهار سیستمهای فراانسانی با توان پژوهش خودمختارن که استاندارد امنیتی وزنهای مدلشون همسطح زیرساخت حیاتی کشوریه، و پلهٔ پنج AGI کامله که بدون یه «safety case» مستند و کامل اصلاً نباید عرضه بشه.
نویسنده سه ستون فنی زیر این پلهها رو جدا میکنه: ارزیابی توانایی با تمرکز روی «dangerous capability uplift» یعنی کمک معنادار به ساخت سلاح یا حملهٔ سایبری بزرگمقیاس؛ ابزارهای تفسیرپذیری، چون تست ورودی-خروجی به تنهایی برای مدلهای قوی کافی نیست؛ و امنیت زیرساخت، از ماژول سختافزاری مدیریت کلید و آموزش ایرگپ گرفته تا لاگ دسترسی و مدل تهدیدی که مهاجم در سطح دولت-ملت رو فرض میگیره.
مقاله چارچوب OpenAI رو هم کنارش میذاره: اون بیشتر یه ردهبندی توصیفی از تواناییه، ولی مال دیپمایند هنجاریه و میگه چه کاری باید قبل از عرضه انجام بشه. در آخر هم پرسشهای بازش رو میشماره — چطور میشه توانایی نوظهوری رو تست کرد که اصلاً پیشبینی نشده، چه کسی پلهٔ یه سیستم رو تعیین میکنه و اختیار توقف عرضه رو داره، و سیستمهای عامل و چندوجهی کجای این پنج پله میشینن.
نکات کلیدی:
- پنج پله از هوش مصنوعی باریک تا AGI کامل، و هر پله الزام ایمنی و امنیتی سنگینتر خودش رو داره
- ملاک سختگیری «سطح توانایی» سیستمه، نه فقط کاربردی که براش در نظر گرفتن
- سه ستون فنی: ارزیابی توانایی، تفسیرپذیری و نظارت، امنیت وزنهای مدل و زیرساخت
- برخلاف چارچوب OpenAI که توصیفیه، این یکی هنجاریه و پیششرط عرضه تعیین میکنه
- شرکتها میتونن همین حالا از فروشندهٔ مدلشون بپرسن چه ارزیابیهایی شده و حالتهای شکست مستند کجاست
- تعارض منافع در ارزیابی، تواناییِ نوظهور پیشبینینشده و جای سیستمهای عامل هنوز بیجواب مونده




