نوام براون: ۱۰ هزار ایجنت و یک مسئله هزاره
خلاصهٔ کاملتر
دوارکش پاتل تو قسمت جدید پادکستش با نوام براون، پژوهشگر OpenAI و یکی از آدمهای اصلی پشت مدلهای استدلالی o1، حرف زده. نقطه شروع گفتوگو اینه که OpenAI اعلام کرده یکی از مسائل هزاره، یعنی هفت مسئله باز ریاضی با جایزه یک میلیون دلاری، رو با سیستمی از ۱۰ هزار ایجنت و ۱۳۰ میلیارد توکن تو ۸۸ ساعت حل کرده. نکته جالب اینه که خود براون حتی ۱۰ درصد اعتبار این نتیجه رو هم به مولتیایجنت نمیده و دلیل اصلی رو قدرت خود مدل میدونه.
براون مولتیایجنت رو راهی برای مقیاسدهی موازی test-time compute توضیح میده، یعنی همون محاسباتی که مدل موقع فکر کردن به جواب خرج میکنه. هرچی مدل بیشتر فکر کنه جواب بهتری میده، ولی نمیشه سه سال منتظر یه جواب موند؛ پس کارو بین چند ایجنت پخش میکنن. خودش میگه این روش کمی زیرخطیه: تو بنچمارکهای منتشرشده چهار ایجنت جواب رو دو برابر سریعتر میدن ولی دو برابر هم خرج برمیداره. ریاضی و وبسرچ خوب موازی میشن، ولی مثلاً نوشتن رمان نه.
طراحیشون هم با چیزی که بقیه ساختن فرق داره. به جای داربست آماده، مثل یه ایجنت هماهنگکننده که به بچههاش تسک میده و منتظر جواب میمونه، اینجا عمداً کمترین ساختار ممکن رو گذاشتن: ایجنتها فقط یه ابزار ساده دارن که باهاش به همدیگه پیام بدن و خودشون یاد میگیرن چطور هماهنگ بشن. براون میگه نتیجه شبیه کار کردن آدمها تو اسلکه؛ دو ایجنت سر جوابهای متفاوت بحث میکنن و آخرش یکیشون به بقیه اعلام میکنه نظرش عوض شده.
بخش دوم گفتوگو درباره خودبهبودی بازگشتی یا همون RSI ـه، یعنی حالتی که هوش مصنوعی خودش تحقیقات هوش مصنوعی رو جلو ببره. پاتل میگه سرعت پیشرفت ریاضیات، از حل چندتا مسئله المپیاد تا حالا، RSI رو به نظرش محتملتر و نزدیکتر کرده. براون محتاطتره: میگه هنوز اندازهگیری درستی ندارن که ۱۰ هزار ایجنت واقعاً چقدر بهتر از ۱۰۰۰ تا بوده، و حتی ممکنه ۱۰ هزار آدم فعلاً بهتر از ۱۰ هزار ایجنت هماهنگ بشن.
نکات کلیدی:
- سیستم ۱۰ هزار ایجنتی OpenAI تو ۸۸ ساعت ۱۳۰ میلیارد توکن خرج کرد
- براون کمتر از ۱۰ درصد اعتبار این نتیجه رو به مولتیایجنت میده
- تو بنچمارکهای منتشرشده چهار ایجنت یعنی دو برابر سرعت با دو برابر هزینه
- ایجنتها داربست آماده ندارن و فقط ابزار پیام دادن به هم دارن
- هنوز معلوم نیست ۱۰ هزار ایجنت چقدر از ۱۰۰۰ تا بهتر جواب میده




