بنچمارکِ خستگیناپذیر با ایجنتهای کدنویس
خلاصهٔ کاملتر
این مطلب خلاصهی یه گفتگو (قسمتی از سریِ How I AI با میزبانیِ Claire Vo) با Ankur Goyal، مدیرعاملِ Braintrust ه که حدودِ دو دهه سابقهی ساختِ دیتابیس داره. دو موضوعِ اصلی بررسی میشه: استفاده از ایجنتهای کدنویس برای بنچمارکِ زیرساخت، و AI evals.
Workflow اول دربارهی بنچمارکِ عمیق و خستگیناپذیره. به گفتهی Goyal، مدیرانِ مهندسی معمولاً از تغییرِ زیرساختِ اصلی میترسن چون هزینه و ریسکش بالاست. ولی حالا که مدلها کد خوب مینویسن، میشه تستها و معیارهای موفقیتِ خیلی سخت ساخت و ایجنت رو گذاشت تا خلاقانه و در پسزمینه روش کار کنه.
روندش اینشکلیه: اول مسئله و معیارِ موفقیت رو دقیق تعریف میکنی (مثالِ اونها: کوئریهای کندِ جستوجو روی میلیاردها trace تو بازهی ۹۰روزه) ولی چطورش کاملاً بازه. بعد به یه ایجنتِ قوی مثلِ Codex یه محیطِ واقعی میدی: دادهی شبیهِ production، و ابزارهایی مثلِ tmux برای مدیریتِ چند session، معمولاً روی یه ماشینِ قدرتمندِ ریموت مثلِ AWS EC2 برای بارِ محاسباتیِ سنگین.
بعد ایجنت کلِ فضای راهحل رو میگرده: تستِ همهی فرمتهای column store، همهی موتورهای اجرا، و ماتریسِ کاملِ فرمت در برابرِ موتور، و انواعِ ایندکس. Goyal میگه تو یه مورد بعد از یه هفته آزمایشِ مداوم، این روند کشف کرد که bloom filterها — که اغلب شهرتِ بدی دارن — برای مسئلهی خاصِ اونها بهترین جواب بودن. نکتهش اینه که ایجنت خسته نمیشه، context رو گم نمیکنه و میانبر نمیزنه؛ سطحی از دقت که دستی تقریباً غیرممکنه و باعث میشه تیم با اطمینان تغییراتِ بزرگِ معماری رو انجام بده.
Workflow دوم دربارهی evals ه. Goyal این مفهوم رو بازتعریف میکنه: eval فقط راهیه برای تعریفِ اینکه چی میخوای، نه چطور — یعنی یه PRD با مثالها و معیارهای موفقیتِ قابلسنجش. تو یه دموی زنده تو Braintrust نشون میده که چطور میشه با eval موفقیت رو تعریف کرد، عملکردِ AI رو نمره داد و محصول رو مداوم بهتر کرد — یعنی حرکت از یه فرایندِ دستی و حسی به یه سیستمِ کمّی و مقیاسپذیر برای کیفیت. مثالِ دموش ساختِ یه پرامپت برای ایجنتی بود که به سؤالاتِ مستنداتِ Braintrust جواب میده.
نکات کلیدی:
- ایجنتهای کدنویس میتونن روزها روی یه مسئلهی سختِ زیرساختی بنچمارک بزنن، کاری که دستی عملی نیست
- کلیدِ کار: تعریفِ دقیقِ مسئله و معیارِ موفقیت، بعد دادنِ محیطِ واقعی و ماشینِ قوی به ایجنت
- تو یه مورد، ایجنت بعد از یه هفته کشف کرد bloom filterها بهترین جوابن
- ایدهی محوری: eval نسخهی مدرنِ PRD ه — تعریفِ «چی» میخوای با مثال و معیارِ سنجشپذیر
- eval فرایندِ کیفیت رو از حالتِ حسی به یه سیستمِ کمّی و مقیاسپذیر میبره




