وضعیت ایجنتهای پستترینینگ هوش مصنوعی
خلاصهٔ کاملتر
به گفتهٔ نویسنده (Mersad Abbasi)، این گزارش یه آزمایش قبلی رو با نسل تازهٔ مدلهای مرزی—Claude Fable 5، Opus 4.8 و GPT-5.5—بهروز میکنه. آزمایش FrogsGame یه کار پستترینینگ بلندمدته: ایجنت باید یه مدل پایهٔ ثابت (Qwen3-8B) رو بهتر کنه تا یه پازل رو حل کنه و برای این کار آزادی زیادی داره.
تو نسل قبل بیشتر مدلها برنامهٔ کلی درست رو پیدا میکردن ولی تو جزئیات شکست میخوردن؛ مثلاً از خودِ مدل ضعیف دادهٔ آموزشی بیکیفیت میساختن و روش آموزش میدادن و در نتیجه نویز رو تقویت میکردن. نتیجهگیری این بود که گلوگاه نه برنامهریزی، بلکه «شهود پژوهشی»ه: اینکه بفهمی کِی دادهٔ ضعیفه و کِی نباید بهش اعتماد کرد.
اینبار خیلی از این مشکلها بهتر شده. Opus 4.8 به میانگین ۳۰.۹٪ در pass@4 رسیده—حدود سهبرابر نسل قبل—و GPT-5.5 به ۹.۷٪. جالب اینکه تو تقریباً همهٔ شکستها، ایجنتها خودشون میدونستن جوابشون غلطه ولی بهخاطر محدودیت زمان بازم ثبتش میکردن. Claude تو هر ۸ اجرا از GRPO استفاده کرده و دیگه سراغ اون اشتباه قدیمی نرفته.
به گفتهٔ نویسنده، ستارهٔ ماجرا Claude Fable 5 بوده. Fable 5 تنها مدلی بوده که یه راه قابلاعتماد پیدا کرده تا بهجای دادهٔ ضعیف، دادهٔ آموزشیِ قطعاً درست بسازه: خروجی یه الگوریتم backtracking رو روایت میکنه، مدل پایه رو روش آموزش میده و بعد با RL عملکرد رو بالا میبره—همه تو بودجهٔ ۲۰ ساعته.
مقاله تأکید میکنه این یه reward hack یا سوءاستفاده از بنچمارک نیست؛ Fable 5 واقعاً الگوریتم زیربنایی رو کشف میکنه. تو ابعاد دیگه هم بهتر بوده: کالیبراسیون خیلی بهتر (خوشبینیِ خوداررزیابی فقط ۱.۲ برابر در مقابل ۴.۹ برابر Opus 4.8)، استفادهٔ کامل از زمان، و حتی تزریق خطای عمدی تو ۵٪ دادهها تا مدل یاد بگیره از اشتباه برگرده.
با این حال نویسنده میگه ارزیابی هنوز بزرگترین نقطهٔ شکسته: مدلها با نمونهٔ کم تصمیم میگیرن، نتیجهٔ نویزی رو بیشازحد جدی میگیرن و کم cross-validate میکنن. جمعبندی اینه که FrogsGame یه کار اسباببازیه ولی درسش نیست؛ داره نشون میده «ذائقهٔ پژوهشی» هم یه قابلیتیه که AI مدتی توش ضعیفه و بعد خوب میشه.
نکات کلیدی:
- بنچمارک FrogsGame با Fable 5، Opus 4.8 و GPT-5.5 دوباره اجرا شد
- Opus 4.8 با ۳۰.۹٪ حدود سهبرابر نسل قبل، GPT-5.5 روی ۹.۷٪
- Fable 5 با ساختن دادهٔ آموزشیِ درست از الگوریتم backtracking، ضعف اصلی رو حل کرد
- کالیبراسیون و استفاده از زمانِ Fable 5 خیلی بهتر بود
- ارزیابی و سنجش پیشرفت، هنوز بزرگترین نقطهٔ شکست مدلهاست




