کار با کامپیوتر؛ نقطهضعف بزرگ عاملهای هوش مصنوعی
خلاصهٔ کاملتر
تیم Steelman Labs تو یادداشت تازهش میگه کار با کامپیوتر (computer use) یکی از بزرگترین اهرمهای تأثیر واقعی هوش مصنوعیه، چون بیشتر کارهای فکری پشت استفاده از نرمافزار قفل شدن. ولی عددها امیدوارکننده نیستن: روی OSWorld-V2 که یه بنچمارک کارهای طولانی روی کامپیوتره، بهترین مدل فقط ۲۰.۶ درصد کارها رو کامل میکنه و روی Agents' Last Exam این عدد ۲۶.۲ درصده. کاربری که از چت انتظار معجزه داره، اینجا با کندی و خطا روبهرو میشه.
به گفتهٔ نویسندهها، بنچمارکهای ۲۰۲۴ و ۲۰۲۵ مثل OSWorld و WebArena و AndroidWorld نمرههای ۶۰ تا ۹۷ درصدی میدادن، ولی محیطهاشون تقریباً ثابت بود، نمایش متنی تمیزی داشتن و فضای کنشها از پیش کوچیک و مشخص بود. رابطهای کاربریِ دنیای واقعی اینشکلی نیستن؛ برای همین اون لیدربوردها باد کرده بودن و فاصلهٔ انتظار کاربر با عملکرد واقعی همینجا ساخته شد.
نکتهٔ اصلی مقاله اینه که عاملهایی که قراره با رابط کار کنن، عملاً از رابط فرار میکنن. تو نمونههای OSWorld-V2، برای رزرو هتل مدل بهجای کار با سایت کد جاوااسکریپت تزریق کرده تا سورس رو بخونه، اندپوینت داخلی API رو پیدا کرده و رزرو رو مستقیم فرستاده؛ برای خرید بلیت قطار هم دو مدل مختلف کلاً سایت رو دور زدن؛ و برای ترکیب دو تصویر تو GIMP، بهجای کار با خود برنامه اسکریپت پایتون نوشتن.
چرا این بده؟ بعضی کارها اصلاً فقط از راه رابط انجام میشن، دور زدن رابط عوارض پیشبینینشده داره و از همه مهمتر گرونتر و شکنندهتره. کلیککردن و پر کردن فرم برای آدم کار سختی نیست، ولی مهندسی معکوس API یه سایت خیلی پیچیدهتر از همون کلیکیه که جاش رو گرفته. تو بنچمارک WebGames که فقط واکنش و کنترل حرکتی یه کاربر معمولی رو میخواد، آدمها بالای ۹۵ درصد موفقن و مدلها خیلی عقبترن — و به گفتهٔ نویسندهها این فاصله با توکن و پارامتر بیشتر کم نمیشه.
نتیجهش یه تخصیص نامتعادل محاسباته: طبق تحلیل اونها بیشتر بودجهٔ کنش عامل صرف grounding بصری، دستکاری سطحپایین و سربار ابزارها میشه و برای برنامهریزی، بازبینی و جبران خطا چیز زیادی نمیمونه. حرف Steelman Labs اینه که حلقهٔ رایج «اسکرینشات ← استدلال مدل ← فراخوانی ابزار» ذاتاً جواب نمیده، چون همون مدل بزرگ رو مجبور میکنه همهکار بکنه. پیشنهادشون جدا کردن برنامهریزی از اجراست: یه «سیستم ۱» مخصوص کنترل حرکتی، نگاه تصویرمحور به صفحه و رسیدن به زمان واکنش در حد آدم.
نکات کلیدی:
- بهترین مدل روی OSWorld-V2 فقط ۲۰.۶ درصد کارها رو تموم میکنه
- نمرههای بالای بنچمارکهای قدیمی بهخاطر محیطهای ساده و ثابت بود
- عاملها بهجای کار با رابط، با API و اسکریپت دورش میزنن
- تو WebGames آدمها بالای ۹۵ درصد موفقن و این فاصله با مدل بزرگتر پر نمیشه
- پیشنهاد Steelman Labs: جدا کردن برنامهریزی از اجرا و یه «سیستم ۱» برای کنترل حرکتی




