APEX-Accounting: مدلها تو حسابداری کم میارن
خلاصهٔ کاملتر
تو این مقاله مرکور از بنچمارک تازهای به اسم APEX-Accounting رونمایی میکنه که با همکاری Ramp ساخته شده. هدفش اینه که ببینه ایجنتهای هوش مصنوعی میتونن کار واقعی حسابداری رو در حد استاندارد حرفهای انجام بدن یا نه. بنچمارک ۱۶۰ تسک داره که تو ۱۰ شرکت شبیهسازیشده تعریف شدن، و کارشناسهایی با سابقهٔ کار تو Deloitte، PwC، EY و KPMG هم تسکها و هم روبریک نمرهدهیشون رو نوشتن.
به گفتهٔ نویسندهها خبر اصلی این نیست که کدوم مدل جلوئه، بلکه اینه که هیچ مدلی بهشکل پایدار موفق نمیشه. هر مدل هشت بار روی هر تسک اجرا شده، چون کار حسابداری باید همیشه درست باشه نه فقط یه بار. باثباتترین مدل فقط ۲.۶٪ تسکها رو تو هر هشت اجرا درست حل کرده. تو جدول امتیازها Claude Fable 5 با ۵۶.۴٪ اوله، بعدش Muse Spark 1.1 با ۵۲.۶٪ و GPT-5.6 Sol با ۵۱.۵٪.
یه بخش جالب مقاله دربارهٔ رابطهٔ هزینه و کیفیته. مدلها با بودجههای ۱، ۵، ۱۰ و ۵۰ دلار به ازای هر تسک تست شدن و اثرش خیلی متفاوت بوده: Fable 5 با بودجهٔ یک دلار فقط ۱۱.۸٪ میگیره ولی با ۵۰ دلار به ۵۵.۲٪ میرسه، در حالی که Muse Spark 1.1 از همون اول قویه و با پول بیشتر تقریباً فرقی نمیکنه. نکتهٔ جالبتر اینه که مدلها بهطور میانگین فقط ۶۴.۷٪ سقف بودجه رو خرج میکنن.
نویسندهها میگن سه مدل برتر تقریباً شبیه هم شکست میخورن: حدود هفتتا از هر ده شکست از استدلال ناقص میاد، نه از ناتوانی تو پیدا کردن اطلاعات. مثلاً مدل یه مغایرت رو اول کار درست تشخیص میده، ولی بعداً همون نتیجه رو تو سند نهایی جا میندازه یا نقضش میکنه. به نظر اونها بهتر کردن بازیابی اطلاعات این مشکلو حل نمیکنه؛ مدلها به قضاوت حسابداری قویتر و انضباط بیشتر تو حفظ نتیجه در طول کل فرایند نیاز دارن.
بیش از ۴۰ حسابدار حرفهای با میانگین ۱۱ سال سابقه تسکها رو نوشتن و حل کردن و هر تسک بهطور میانگین ۱۳.۷ معیار ارزیابی داره؛ نمرهدهی رو یه داور هوش مصنوعی متنباز انجام میده که ۹۷٪ با داورهای انسانی همنظره. تمرکز بنچمارک روی بستن دفاتر پایان ماه و دفترداریه و مالیات، حسابرسی، تلفیق و گزارشگری بیرونی رو پوشش نمیده. یه نمونهٔ متنباز با یک شرکت و ۱۰ تسک هم منتشر شده.
نکات کلیدی:
- APEX-Accounting شامل ۱۶۰ تسک بستن دفاتر تو ۱۰ شرکت فرضیه
- بالاترین امتیاز ۵۶.۴٪ برای Claude Fable 5
- فقط ۲.۶٪ تسکها تو هر هشت اجرا درست حل شدن
- ۵۸٪ تسکها رو هیچ مدلی بهطور کامل حل نکرده
- حدود ۷۰٪ شکستها ریشه تو استدلال ناقص داره، نه کمبود اطلاعات




