وقتی deep research کل سقف اشتراکت رو تو نیم ساعت میسوزونه
خلاصهٔ کاملتر
تیم Quesma روی اقتصاد ایجنتهای هوش مصنوعی تحقیق میکنه و نویسنده برای همین کار یه پایپلاین دیپریسرچ شخصی ساخته. شروع ماجرا خندهداره: اولین نسخه، کل سقف پلن Claude Max 5x رو تو ۳۰ دقیقه سوزوند. اون اجرا ۱۱۱ ایجنت راه انداخته و ۱۲۳ ادعا رو در صف تأیید گذاشته بود، ولی فقط ۲۵ تاش تأیید شد و سنتز نهایی هیچوقت اجرا نشد. یعنی هزینهٔ کامل، خروجی صفر.
قدم اول راهحل، استفاده از چیزی بود که از قبل بابتش پول میداد: سه اشتراک Claude و Codex و Antigravity. نویسنده افزونهٔ claude-mem رو طوری گسترش داد که هر سه ابزار تو یه حافظهٔ مشترک محلی بنویسن و بخونن — هر چیزی که یکی یاد میگیره، بقیه هم ازش استفاده میکنن.
قدم دوم، الگوی ارکستراسیون مدله: به گفتهٔ نویسنده برای همهچیز به گرونترین مدل نیاز نیست. او نقشها رو پین کرد — Sonnet 5 برای «پیدا کردن» چون روی بنچمارکهای ایجنتی قویه و ارزون هم هست، Opus 4.8 برای «تأیید» چون بررسی به دقت بیشتری از جستوجو نیاز داره، Fable 5 فقط برای قضاوت و تجزیهٔ مسئله، و Haiku 4.5 برای کارهای ریز مثل استخراج و قالببندی. Codex نقش اجرای ابزار رو گرفت و Antigravity نقش «نظر دوم» از یه خانوادهٔ مدل متفاوت.
ترفند فنیش یه اسکریپت کوچیک Bashه که ایجنتهای Claude میتونن مثل هر دستور دیگهای صداش بزنن: اسکریپت اسم وندور و پرامپت رو میگیره، CLI مربوطه رو در حالت هدلس اجرا میکنه و خروجی رو هم برمیگردونه و هم تو حافظهٔ مشترک ذخیره میکنه. مزیتش اینه که توکن از اشتراک همون وندور کم میشه. همون wrapper خروجی رو برای پیامهای «سقف مصرف» و «اتمام اعتبار» رصد میکنه و با یه کد خروج خاص، ارکستریتور رو به سمت مدلهای Claude برمیگردونه.
یه نکتهٔ ریز ولی حیاتی: سابایجنتها بهصورت پیشفرض مدل والدشون رو به ارث میبرن و دقیقاً همین بود که سقف Fable رو تو نیم ساعت سوزوند. با پین کردن مدل به ازای هر نقش، مدت تحقیق پیوسته حدود ده برابر شد — از ۳۰ دقیقه به چند ساعت، بدون یه ریال هزینهٔ اضافه.
مشکل دوم اعتماد بود، نه هزینه. برای کم کردن توهم مدل، نویسنده چند قانون صریح گذاشت: هر کی ادعایی پیدا میکنه حق تأیید همون ادعا رو نداره و یه مدل یا ایجنت دیگه لینکها و نقلقولها و عددها رو چک میکنه؛ هیچچیز بدون URL و نقلقول از منبع اصلی وارد پایگاه دانش نمیشه؛ و هیچ عددی که تو صفحهٔ منبع نیست نباید گفته بشه. خود /deep-research هم از اول صف به آخر صف منتقل شد و حالا آخر هر روز روی یافتههای تأییدشده اجرا میشه — آخرین اجرا ۶۱ ایجنت و ۲۲ دقیقه.
نویسنده تأکید میکنه بررسی خودکار بهتنهایی کافی نیست: یه بار قانون تریاژش پروژهٔ Headroom با ۵۶ هزار ستاره رو بیسروصدا رد کرد، چون ادعای صرفهجوییش تأییدنشده بود. درس اصلاحی این شد که «ادعا رو رد کن، نه پروژه رو» — و جمعبندی کلی اینکه هیچ ایجنتی به آدم نمیگه اشکال از قانون خودشه.
نکات کلیدی:
- اجرای بیبرنامهٔ دیپریسرچ: ۱۱۱ ایجنت، ۳۰ دقیقه، سقف تمامشده و بدون گزارش نهایی
- پین کردن مدل به ازای هر نقش حیاتیه، چون سابایجنت پیشفرض مدل والد رو به ارث میبره
- تقسیم نقش: مدل ارزون پیدا میکنه، مدل دقیق تأیید میکنه، گرونترین فقط برنامهریزی و داوری
- CLIهای وندورهای دیگه بهصورت هدلس نقش سابایجنت میگیرن و توکن از اشتراک خودشون کم میشه
- قواعد ضدتوهم: جداسازی یابنده از تأییدکننده، الزام URL و نقلقول از منبع اصلی، ممنوعیت عدد بدون منبع




