grep ساده از جستجوی برداری برای ایجنتها بهتره
خلاصهٔ کاملتر
این مقاله یه مطالعهٔ جدید از PwC رو معرفی میکنه با اسم «آیا grep تنها چیزیه که نیاز داری؟». تیم تحقیق ۱۱۶ سؤال از بنچمارک LongMemEval رو روی ۴ هارنس، ۵ مدل و ۲ روش بازیابی اجرا کرده و سنجیده چی واقعاً دقت رو جابهجا میکنه. یافتهٔ سرتیتر اینه که برای ایجنتهای LLM روی پرسشوپاسخ از حافظهٔ بلندمدت، جستجوی لغوی grep از جستجوی برداری (vector) بهتر کار میکنه.
اعداد روشنن: grep تو جفتهای مدل-هارنس بین ۸۳.۶ تا ۹۳.۱ درصد دقت گرفته، در حالی که vector بین ۶۲.۹ تا ۸۳.۶ درصد مونده. بزرگترین شکاف مال Gemini 3.1 Flash-Lite روی هارنس Chronos بود: ۸۶.۲٪ با grep در برابر ۶۲.۹٪ با vector، یعنی یه چرخش ۲۳ امتیازی.
نویسنده میگه شهود پشت این نتیجه سادهست. سؤالهای LongMemEval معمولاً به موجودیتهای مشخص بستگی دارن؛ مثل اسمها، تاریخها و عددها که عیناً تو تاریخچهٔ مکالمه ظاهر شدن. تطبیق دقیق رشته اینها رو دقیق میگیره، ولی امبدینگهای معنایی با هموار کردن همه چیز تو فضای شباهت، ممکنه متنهای قابلقبول ولی غلط برگردونن و همون توکن دقیقی که جواب بهش وابستهست رو از دست بدن.
اما به گفتهٔ نویسنده، بخشی که باید طرز فکر تیمها رو عوض کنه اینه که خود هارنس متغیر پنهانه. اگه مدل و دیتا رو ثابت نگه داری و فقط هارنس رو عوض کنی، دقت دو رقمی جابهجا میشه. مثلاً همون مدل Claude Opus 4.6 با grep و تحویل inline، روی هارنس Chronos دقت ۹۳.۱٪ گرفته ولی روی هارنس Claude Code فقط ۷۶.۷٪، یه شکاف ۱۶ امتیازی فقط از خود wrapper. هارنس کنترل میکنه که prompt چطور باشه، ابزارها چطور معرفی بشن و نتایج بازیابیشده چقدر از پنجرهٔ context رو بخورن.
تمیزترین نمونه، حالت تحویل نتایجه. تحویل inline نتایج رو مستقیم میریزه تو مکالمه، جایی که با system prompt و تاریخچه سر فضای context رقابت میکنن. تحویل فایلمحور نتایج رو روی دیسک مینویسه و ایجنت باید با فراخوانی ابزار اضافه بیارتشون، پس اندازهٔ نتیجه از فشار context جدا میشه. به گفتهٔ نویسنده، فقط عوض کردن inline به فایلمحور کافی بود که برتری grep تو چند پیکربندی پاک یا حتی برعکس بشه؛ شدیدترین موردش Codex CLI با GPT-5.4 بود که grep از ۹۳.۱٪ حالت inline به ۵۵.۲٪ حالت فایلمحور افت کرد.
نویسنده روی caveatها تأکید میکنه. این نتیجه محدود به پرسشوپاسخ از حافظهٔ مکالمهای بلندمدته، جایی که جوابها به شکل توکن دقیق تو تاریخچه هستن. خود نویسندهها صریح میگن ممکنه به سنتز علمی، بازیابی بازنویسیشده یا تسکهایی که تعمیم معنایی کل هدفه منتقل نشه؛ همون جاهایی که نقطهٔ قوت vectorه. یه آزمایش مقیاسپذیری دیگه هم که نویز بیشتری تزریق کرد نشون داد گاهی vector جلو میزنه، پس «grep همیشه برندهست» برداشت غلطیه. ضمناً این یه زیرمجموعهٔ ۱۱۶ سؤالیه که با یه LLM (GPT-4o) نمرهگذاری شده. با این حال درس عملی روشنه: قبل از سراغ رفتن به ایندکس امبدینگ، grep رو امتحان کن و به اینکه نتایج چطور به مدل میرسن، به اندازهٔ خود روش بازیابی توجه کن.
نکات کلیدی:
- grep لغوی برای پرسشوپاسخ از حافظهٔ بلندمدت گاهی بیش از ۲۰ امتیاز از جستجوی برداری بهتره
- چون سؤالها به اسم و تاریخ و عدد دقیق وابستهان، تطبیق رشتهٔ دقیق بهتر جواب میده
- خود هارنس ایجنت به اندازهٔ روش بازیابی روی دقت اثر داره؛ شکاف تا ۱۶ امتیاز فقط از wrapper
- عوض کردن تحویل نتایج از inline به فایلمحور میتونه برتری grep رو پاک یا برعکس کنه
- نتیجه محدود به این نوع تسکه و «grep همیشه برندهست» برداشت اشتباهیه




