هزینهی ایجنتهای AI به harness بستگی داره، نه فقط مدل
خلاصهٔ کاملتر
یه بنچمارک تازه از شرکت True Foundry میگه چیزی که واقعاً هزینهی توکن ایجنتهای هوش مصنوعی رو تعیین میکنه، بیشتر harnessـه تا خودِ مدل. harness یعنی لایهی نرمافزاری بین مدل و دنیای بیرون؛ چیزی که تصمیم میگیره ایجنت چند بار ابزار صدا بزنه، چه ترتیبی، و چقدر از تاریخچهی مکالمه تو context بمونه.
برای تست، تیم True Foundry ۱۴ تسک از بنچمارک سازمانی DevRev رو انتخاب کرد؛ تسکهایی که ایجنت باید از طریق چند سرور MCP، اطلاعات رو بین یه CRM، یه سیستم تیکتینگ و یه مخزن سند بههم وصل کنه. هر تسک ۳ بار اجرا شد و یه داور LLM بیطرف نمرهها رو داد.
نکتهی کلیدی اینه که مدل تو کل تست ثابت موند: Claude Opus یه بار از طریق managed agent خودِ Claude اجرا شد و یه بار از طریق True Forge (یه harness متنباز و خودمیزبان). با دقت یکسان، managed agent حدود ۱۰ میلیون توکن مصرف کرد ولی True Forge فقط ۳.۸ میلیون توکن، یعنی حدود ۶۲٪ کمتر، فقط با تغییر harness. بعدش وقتی مدل رو هم داخل True Forge با GLM 5.2 ارزونتر عوض کردن، هزینهی کل نسبت به baseline اولیه ۷۵٪ پایین اومد.
به گفتهی نویسنده، دلیل اصلی مصرف زیاد توکن معمولاً «tool bloat»ـه: تعریف طولانی ابزارها که حتی وقتی لازم نیستن تو context میمونن، خروجی کامل هر ابزار که ذخیره میشه بهجای خلاصه شدن، و رفتوبرگشتهای اضافه چون ایجنت برنامهریزی کارآمدی نداره. مدل قویتر گاهی میتونه این ضعف رو جبران کنه، ولی سقف کارایی رو مدیریت context تو harness تعیین میکنه، نه هوش خام مدل.
نویسنده یه دلیل دیگه هم برای انتخاب harnessهای خودمیزبان مطرح میکنه: قفل شدن رو یه وندور. managed agentهای هاستشده (مثل Claude یا Gemini) کل تعریف ایجنت رو رو زیرساخت خودشون نگه میدارن و عوض کردن مدل یا سیاستهای نگهداری داده براشون سخته؛ برای سازمانهایی که نیاز به zero-day retention یا اجرای کاملاً روی زیرساخت خودشون دارن، این محدودیتها اصلاً قابل قبول نیست. True Forge با لایسنس MIT، پیادهسازی با TypeScript، دیتابیس پیشفرض SQLite و پشتیبانی اختیاری از Postgres/Redis/Docker، همچین گزینهای رو فراهم میکنه.
نکات کلیدی:
- با ثابت نگهداشتن مدل (Claude Opus)، عوض کردن harness بهتنهایی ۶۲٪ توکن کمتر مصرف کرد (۳.۸M در برابر ۱۰M)
- اضافه کردن مدل ارزونتر GLM 5.2 رو True Forge، هزینهی کل رو نسبت به baseline اول ۷۵٪ کاهش داد
- تست شامل ۱۴ تسک از بنچمارک DevRev، با ۳ اجرا برای هر تسک و داوری یه LLM بیطرف بود
- دلیل اصلی مصرف زیاد توکن، «tool bloat» و مدیریت ضعیف context ـه، نه ضعف خودِ مدل
- True Forge متنباز و MIT-licensedـه، با SQLite پیشفرض اجرا میشه و از مدلهای لوکال مثل Ollama هم پشتیبانی میکنه




