RecreationWorld؛ زمین تمرین ایجنتهای کامپیوتری
خلاصهٔ کاملتر
تیم Qwen پروژهای به اسم RecreationWorld رو متنباز کرده که زمین تمرین و آزمون ایجنتهای hybrid computer-use ـه، یعنی ایجنتهایی که هم با موس و کیبورد تو رابط گرافیکی کار میکنن و هم مثل یه برنامهنویس کد مینویسن و بیلد میگیرن. تو گزارششون اومده که ایده اصلی سادهست: به جای اینکه نمره رو از روی شباهت کد بدن، یه نسخه در حال اجرا از یه اپ متنباز رو به ایجنت میدن و ازش میخوان همون چیزو دوباره بسازه.
همون نسخه در حال اجرا نقش «oracle» رو بازی میکنه، یعنی مرجعی که همیشه جواب درست رو نشون میده و ایجنت هر وقت خواست میتونه بهش سر بزنه. کاری که ایجنت انجام میده یه حلقهست، نه یه مسیر خطی: کاوش تو اپ مرجع، نوشتن کد، بیلد و اجرای نسخه خودش، نگاه کردن به نتیجه و بعد اصلاح. خودش تصمیم میگیره کی به کدوم مرحله برگرده.
ارزیابی با یه مجموعه assertion ثابت انجام میشه که قبلاً روی خود اپ مرجع اعتبارسنجی شدن؛ بخشی برنامهای و بخشی بصری با کمک یه مدل بینایی. چون ملاک رفتار قابل مشاهدهست و نه سورس، ایجنت آزاده با هر زبون، فریمورک و معماریای که خواست کارو جلو ببره. این همون چیزیه که به گفته نویسندهها باعث میشه تجربهای که ایجنت اینجا یاد میگیره فراتر از خود بازسازی هم به درد بخوره.
بنچمارک RecreationBench ۲۵۰ تسک کنار گذاشتهشده داره؛ پنجاهتا روی هرکدوم از اوبونتو، مکاواس، ویندوز، اندروید و وب. نتایج نشون میده هنوز فاصله زیاده: بهترین مدل یعنی GPT-6 Astra میانگین ۵۸.۰۶ درصد گرفته، Claude Opus 5 نمره ۴۴.۱۶ و Qwen3.8-Max خودشون ۳۴.۸ درصد. نکته تلختر اینه که فقط ۲.۸ درصد اپها رو بهترین مدل صددرصد درست درآورده.
هزینه هم بخشی از جدوله: هر تسک برای مدلهای بالای جدول حدود ۱۱۵ تا ۱۱۷ دلار تخمین زده شده، در حالی که Qwen3.7-Plus با ۱.۲۳ دلار پایینترین هزینه و پایینترین نمره رو داره. کل پروژه زیر لایسنس MIT منتشر شده و برای اجرا هم به uv نیاز داری و هم به بسته تسک فریزشده که روی Hugging Face و ModelScope گذاشتن.
نکات کلیدی:
- RecreationWorld پنج پلتفرم داره: اوبونتو، مکاواس، ویندوز، اندروید و وب، هرکدوم ۵۰ تسک.
- نمرهدهی بر اساس رفتار قابل مشاهدهست، پس انتخاب زبون و فریمورک آزاده.
- بهترین نتیجه یعنی GPT-6 Astra میانگین ۵۸.۰۶ درصد، و Claude Opus 5 با ۴۴.۱۶ درصد دومه.
- فقط ۲.۸ درصد اپها توسط بهترین مدل کاملاً درست بازسازی شدن.
- هزینه تخمینی هر تسک برای مدلهای صدر جدول حدود ۱۱۵ دلاره؛ لایسنس پروژه MIT ـه.




