تکنیک تازهٔ استدلال Astra، دردسر جدید ایمنی هوش مصنوعی
خلاصهٔ کاملتر
به گزارش The Information که سهشنبه منتشر شد، مدل تازهٔ OpenAI به اسم Astra از تکنیکی به اسم recurrent depth استفاده میکنه؛ روشی که بهش «بازگشت مبهم» (opaque recurrence) هم میگن. برخلاف مدلهای استدلالی معمول که پشتسرهم و مرحلهبهمرحله فکر میکنن، اینجا مدل یه پرسش رو چند بار تو یه حلقه پردازش میکنه و رد خوانای خیلی کمتری از خودش جا میذاره.
چرا این مهمه؟ زنجیرهٔ فکر (chain of thought، یعنی همون قدمهای میانی که مدل موقع حل مسئله بیرون میده) نمایش دقیقی از فکر واقعی مدل نیست، ولی تا امروز ابزار باارزشی برای دیدن رفتار بد یا ناهمراستایی بوده. تو ماجرای اخیر ایجنتهای سرکش OpenAI هم همین لاگها کمک کرد بفهمن ایجنتها چرا اونطوری رفتار کردن. بازگشت مبهم عملاً این رد رو دور میزنه.
باک شلگریس، مدیرعامل Redwood، نوشته از این گزارش «بهشدت نگرانه» و میگه نمیدونه Astra چقدر کمتر قابلپایشه، ولی اگه OpenAI این تکنیک رو جلوتر ببره میتونه میزان بازگشت رو خیلی زیاد کنه و پایشپذیری زنجیرهٔ فکر رو کامل از بین ببره. زوی موشوویتز هم نوشته این کار «بازی با آتیشه» و شاید برای جلوگیری از یه «مسابقه به سمت ته جدول» بین آزمایشگاههای AI به قانونگذاری نیاز باشه.
OpenAI این تصویر رو رد میکنه. طبق مقاله، استفادهٔ Astra از این تکنیک محدوده، انتظار میره زنجیرهٔ فکرش هنوز خوانا بمونه و شرکت هم گفته سراغ «neuralese» (استدلال با نمایش داخلی و غیرقابلخوندن) نمیره. یاکوب پاخوتسکی، دانشمند ارشد OpenAI، نوشته حفظ و استفاده از پایش زنجیرهٔ فکر از همون اولین مدلهای استدلالیشون یکی از هدفهای اصلی برنامهٔ تحقیقاتیشونه.
نگرانی اصلی مسیر آیندهست. رایان گرینبلت، دانشمند ارشد Redwood Research، میگه استدلال مبهم میتونه راحتتر از استدلال زنجیرهای مقیاس بگیره و کل استدلال رو از کانالهای قابلمشاهده بیرون ببره، تا جایی که مدل تقریباً همهچیز رو تو فضای نهفته (latent space) فکر کنه. گزارش بعدی The Information هم میگه Anthropic و Google DeepMind هم دارن دربارهٔ همین تکنیک حرف میزنن.
نکات کلیدی:
- Astra از recurrent depth یا «بازگشت مبهم» استفاده میکنه: پردازش حلقهای یه پرسش بهجای استدلال خطی.
- این روش رد خوانای زنجیرهٔ فکر رو کم میکنه و پایش رفتار مدل رو سختتر.
- OpenAI میگه استفاده محدوده، زنجیرهٔ فکر خوانا میمونه و سراغ neuralese نمیره.
- باک شلگریس و زوی موشوویتز هشدار دادن؛ موشوویتز از نیاز احتمالی به قانونگذاری گفته.
- به گزارش The Information، Anthropic و Google DeepMind هم دارن این تکنیک رو بررسی میکنن.




