فشردهسازی کانتکست، قبض ایجنت رو گرونتر میکنه
خلاصهٔ کاملتر
به گفتهٔ پوینتفایو، این تیم سه ابزار فشردهسازی کانتکست رو داخل Claude Code تست کرده و نسخهٔ دستنخوردهٔ همون ایجنت رو هم بهعنوان معیار پایه گذاشته. کل آزمایش روی ۲۹۰۸ سشن پولی انجام شده، هزینهها مستقیم از صورتحساب ارائهدهنده خونده شده و طرح اندازهگیری قبل از شروع قفل شده تا نشه نتیجهها رو دستچین کرد.
جالبترین بخش گزارش، تفکیک خود قبضه: ۷۵ درصد هزینه رو پرامپت سیستمی فریمورک و تعریف ابزارها میسازه و ۱۹ درصد دیگه رو استدلال پنهان مدل. چیزی که یه ابزار فشردهسازی اصلاً میتونه بهش دست بزنه فقط ۶ درصده و سقف عملی صرفهجویی حدود ۵ درصد میمونه. این اعداد مال سشنهای مهندسی نرمافزاره؛ تو کارهای پژوهشمحور سهم قابلدسترس خیلی بیشتر میشه و پتانسیل صرفهجویی تا حدود ۳۰ درصد بالا میره.
نتیجهٔ خود ابزارها هم غافلگیرکنندهست. RTK متنباز فقط ۱.۳ درصد توکن حذف کرد و ۲.۹ درصد ارزونتر درومد، که نویسندهها خودشون میگن از نظر آماری معنادار نیست. RTK-ML، نسخهٔ آزمایشی خود پوینتفایو، ۳۸.۴ درصد متن رو برید ولی ۶.۸ درصد گرونتر تموم شد و ابزار شخص ثالث Headroom تا ۴۶.۴ درصد بالاتر از پایه رفت. توضیحشون اینه که ایجنت برای پیدا کردن دوبارهٔ چیزی که حذف شده تِرن اضافه میزنه و هر تِرن کل تاریخچه رو دوباره میفرسته.
نویسنده هشدار جدیتری هم میده: فشردهسازی تهاجمی میتونه توانایی عمل ایجنت رو خراب کنه. برای ویرایش یه فایل، ایجنت باید کد موجود رو کاراکتربهکاراکتر عین خودش نقل کنه؛ اگه همون نقلقول فشرده بشه، پچ دیگه اعمال نمیشه. تو تستهای سخت بنچمارک SWE نرخ موفقیت اعمال پچ از ۲۷ از ۴۰ به ۱۵ از ۴۰ افتاده، هرچند تو کارهای مهندسی معمولی افت محسوسی دیده نشده.
تیم صادقانه اعلام میکنه که این پژوهش مستقل نیست، خود پوینتفایو نویسندهشه و نتیجهها به طراحی محصول بهینهسازی توکن خودشون خوراک میده. در عوض شش سؤال برای سنجش هر فروشندهٔ کاهش هزینهٔ ایجنت پیشنهاد میدن: دلار واقعی صورتحساب گزارش میشه یا توکن تخمینی، معیار هزینه به ازای تسک موفقه یا هر اجرا، رفتار ایجنت زیر مداخله سنجیده شده یا نه، و آیا دادههای خام هر اجرا در دسترسه.
نکات کلیدی:
- ۷۵ درصد هزینه پرامپت سیستمی و تعریف ابزارهاست و ۱۹ درصد استدلال پنهان مدل؛ فقط ۶ درصد قابلدسترسه
- RTK-ML با حذف ۳۸.۴ درصد متن، ۶.۸ درصد گرونتر شد و Headroom ۴۶.۴ درصد
- نسبت فشردهسازی پیشبینیکنندهٔ ضعیفی برای هزینهٔ واقعیه؛ همبستگی نزدیک صفره
- تو تستهای سخت SWE نرخ اعمال پچ از ۲۷/۴۰ به ۱۵/۴۰ افت کرد
- خود گزارش تأکید میکنه مستقل نیست و باید با دید نقادانه خونده بشه




