کد ریویوی خصمانه: تجربهٔ Wealthfront
خلاصهٔ کاملتر
تو این پست از سری ابزارهای توسعهٔ Wealthfront اومده که مسیرشون از شک به هوش مصنوعی شروع شد: اولش باور نداشتن مدل بتونه کد ریویو کنه، تا اینکه یه مهندس دیف یه برنچ مشکلدار رو داد به GPT-3.5 و باگی که هم از تستها هم از ریویوی انسانی رد شده بود — یه فیلتر SQL جاافتاده تو ریفکتور — بلافاصله پیدا شد. همین شد شروع یه آزمایش چندساله.
نویسندهها میگن ساخت رو به خرید ترجیح دادن، چون ابزارهای موجود دنبال ریویوی ۰.۲۵ دلاری و دوسهدقیقهای بودن، ولی تیم Wealthfront حاضر بود برای هر ریویو ۲۰ دلار بده و ۱۵ دقیقه صبر کنه. تلاش اولشون یعنی «جمعآوری داکیومنت» شکست خورد؛ به گفتهٔ اونها نمیشه از مدل خواست «فایلهای مرتبط رو پیدا کن»، چون تو کدبیسی با بیش از ۲۰ میلیون خط کد همهچی مرتبط به نظر میرسه.
نسخهٔ اول Iris ساختار سفتوسختی داشت: یه مدل گرانقیمت دیف رو میدید و باید سؤال پژوهشی میساخت، بعد ایجنتهای ارزونتر دنبال جواب میگشتن و به هر فایلی که خونده بودن نمرهٔ ربط ۱ تا ۹ میدادن. جالب اینکه جوابِ نوشتهشدهٔ ایجنتها دور ریخته میشد و فقط منابع دستاولشون نگه داشته میشد. این کار میکرد، ولی هزینهش ربطی به ریسک تغییر نداشت و مدل هرجا ازش میخواستن مشکل پیدا کنه، مشکل میساخت.
نسخهٔ فعلی سراغ «ریویوی خصمانه» رفته: مدل اصلی وقتی به یه مشکل احتمالی مشکوک میشه، دو سابایجنت با نقشهای مخالف میسازه — یکی بهعنوان دادستان مأمور پیدا کردن شواهد وجود مشکل، یکی بهعنوان وکیل مدافع مأمور پیدا کردن شواهد بیربط بودنش — و آخرش خودش مثل قاضی بین شواهد داوری میکنه. کنارش چند ترفند دیگه هم اضافه شده: اول ریویو آزاد به شکل متن نوشته میشه و فقط تهش تبدیل به فراخوانی ابزار ساختارمند میشه، و بهجای دهها ابزار اختصاصی، همهٔ دادهها تو یه فایلسیستم سندباکسشده گذاشته شده تا مدل با شل معمولی بگرده.
نتیجه رو با نظرسنجی از مهندسها سنجیدن: هر کامنت نمرهٔ ۱ تا ۵ میگیره. تو نسخهٔ اول توزیع نمرهها زنگولهای بود و وسطش روی ۳ میافتاد، ولی با ریویوی خصمانه تعداد نمرههای ۱ و ۲ بهشدت کم شد و بیشتر پولریکوئستها اصلاً کامنتی نمیگیرن. میانگین هر ریویو ۱۰ دقیقه و ۴ دلاره. با این حال تیم میگه قصد نداره ریویوی انسانی رو حذف کنه؛ ریویوی هوش مصنوعی بلاککننده نیست و فقط کنار ریویوی همتا میشینه.
نکات کلیدی:
- Iris یه سیستم کد ریویوی داخلیه که Wealthfront خودش ساخته، نه محصول آماده
- ایدهٔ اصلی: برای هر مشکل احتمالی، یه ایجنت موافق و یه ایجنت مخالف و یه مدل داور
- ساختار خصمانه مثبتهای کاذب رو خیلی کم کرد و سیگنال رو بالا برد
- بهجای ابزارهای اختصاصی زیاد، یه فایلسیستم سندباکسشده و شل معمولی
- میانگین ۱۰ دقیقه و ۴ دلار برای هر ریویو؛ ریویوی انسانی هنوز بلاککنندهست




