عاملهای هوش مصنوعی حالا واقعاً با کامپیوتر کار میکنن
خلاصهٔ کاملتر
تو این گزارش a16z اومده که سؤال «آیا عاملها میتونن با کامپیوتر کار کنن؟» دیگه سؤال درستی نیست. نویسندهها میگن یه سال پیش بهترین مدل تو بنچمارک OSWorld-Verified فقط ۴۲ درصد میگرفت، ولی الان بهترین مدل ۸۵ درصد میگیره؛ یعنی بالاتر از حدود ۷۲ درصدی که آدمها روی همون تسکها میگیرن. به گفتهٔ اونها همین جهش بود که باعث شد این عاملها از حالت نمایشی دربیان و تو محیط واقعی قابل استفاده بشن.
تجربهٔ تیمهایی که باهاشون حرف زدن نشون میده این عاملها روی کارهای استاندارد و تکرارشونده بهترین عملکرد رو دارن: بهروزرسانی رکورد تو CRM، ورود به پورتالهای دولتی و بیمه، پردازش سفارش و تیکتهای IT. یه پلتفرم دادهٔ CPG ماهی ۱۵ تا ۲۰ میلیون تعامل با پورتالها رو خودکار کرده و وقتی رابط کاربری یه پورتال عوض میشه، خود عامل خرابی رو تشخیص میده و اسکرپر رو درست میکنه.
جایی که کار میلنگه، جاییه که نمیشه درستی خروجی رو سنجید. مثلاً اگه عاملی شرایط پرداخت یه قرارداد رو اشتباه بخونه و «net 30» بهجای «net 60» ثبت کنه، رکورد کاملاً منطقی به نظر میرسه و تا وقتی فاکتور اشتباه صادر نشه کسی متوجه نمیشه. نویسندهها معتقدن یه مدل باهوشتر این رو حل نمیکنه؛ چیزی که لازمه طراحی درست هارنس برای خطا، مسیر ارجاع به آدم و راه راستیآزماییه.
از نظر هزینه، اجرای یه عامل حدود ۶ تا ۸ دلار برای هر ساعت استنتاج آب میخوره و بسته به معماری بین ۳ تا ۱۵ دلار نوسان داره. این عدد تقریباً با برونسپاری خارجی حدود ۱۰ دلار در ساعت سربهسر میشه و در برابر نیروی اداری آمریکا با ۳۰ تا ۴۵ دلار در ساعت، حاشیهٔ سود ۷۰ تا ۸۰ درصدی میده. سرعتش ولی هنوز کمتر از آدمه — کاری که آدم دو سه دقیقهای تمومش میکنه، عامل هشت تا ده دقیقه وقت میبره.
جمعبندی نویسندهها اینه که لایهٔ اجرا داره کالای عمومی میشه و مزیت رقابتی میره بالاتر: شناخت فرایند واقعی یه شرکت، دسترسیها، رانبوکها و گاردریلها. یکی از اپراتورهایی که ماهی میلیونها تسک اجرا میکنه حتی نمیدونست پشت سیستمش کدوم مدل کار میکنه، چون نیازی نداشته بدونه. به گفتهٔ اونها وقتی سنگینترین کاربرها دیگه جدول رتبهبندی رو چک نمیکنن، یعنی جدول دیگه داستان اصلی نیست.
نکات کلیدی:
- نمرهٔ بهترین مدل تو OSWorld-Verified از ۴۲ درصد به ۸۵ درصد رسیده، بالاتر از آدمها
- بهترین کاربرد فعلی: کارهای استاندارد و پرتکرار روی نرمافزارهای قدیمی که API ندارن
- ضعف اصلی جاییه که نمیشه موفقیت کار رو همون لحظه راستیآزمایی کرد
- هزینه حدود ۶ تا ۸ دلار در ساعت استنتاج؛ با برونسپاری سربهسر و در برابر نیروی آمریکایی بهصرفه
- مزیت رقابتی از مدل رفته سراغ زمینه: رانبوک، دسترسی، مسیر ارجاع و شناخت فرایند شرکت




