Devin Fusion؛ ترکیب چند مدل برای کد ارزونتر
خلاصهٔ کاملتر
تیم Cognition تو این پست میگه هزینهٔ استفاده از مدلهای گرون هوش مصنوعی برای هر کاری دیگه قابل تحمل نیست، ولی ابزارهای فعلی برای ترکیب مدلها هم خوب کار نمیکنن؛ رو بنچمارک قشنگ به نظر میان اما کدی تولید میکنن که آدم حاضر نیست merge کنه. راهحلشون یه هارنس چندمدلی به اسم Devin Fusion هست که به گفتهٔ نویسنده رو استفادهٔ واقعی، هزینه رو کم میکنه و هوشمندی رو هم نگه میداره.
قلب ایده چیزیه که بهش میگن sidekick. دو تا ایجنت به صورت موازی اجرا میشن: یکی با یه مدل frontier قوی و یکی با یه مدل ارزونتر. هر دوشون ایجنت کامل با ابزارهای خودشونن. ایجنت اصلی تصمیم میگیره کدوم کارها رو به sidekick بده و کدوما رو خودش انجام بده؛ نویسنده میگه بهتره ایجنت اصلی کمترین کار رو بکنه و بیشتر نقش برنامهریز و ناظر و بازبین نهایی رو داشته باشه.
به گفتهٔ نویسنده این روش سه تا مشکل روتینگ ساده رو حل میکنه: هوشمندی واقعی مدل قوی رو نگه میداره نه فقط نمرهٔ بنچمارک، فراتر از کارهای تکمرحلهای هم جواب میده، و چون هر مدل context مخصوص و کششدهٔ خودش رو داره، از cache miss های پرهزینه که تو ابزارهایی مثل «Smart Friend» و «Advisor» پیش میومد جلوگیری میکنه.
تکنیک دوم روتینگ پویا وسط کار هست. به جای اینکه اول کار یه مدل انتخاب بشه و آخرش معلوم شه اشتباه بوده، با کلسیفایرهای سبک وسط اجرا تصمیم میگیرن که کِی مدل عوض شه. نکتهٔ باهوشانهش اینه که عوض کردن مدل رو موقع فشردهسازی context انجام میدن، جایی که به هر حال cache miss اتفاق میافته، پس تعویض مدل عملاً «مجانی» تموم میشه.
نویسنده میگه رو بنچمارک FrontierCode بدون مدل Fable 5، این هارنس ۳۵٪ هزینه رو کم کرده در حالی که کیفیتش پابهپای مدلهای frontier مثل GPT-5.5 و Opus 4.8 مونده. با Fable 5 این عدد به ۴۱٪ رسیده. جالب اینکه تو استفادهٔ داخلی خودشون، ۸۸٪ از PRهای mergeشده کاملاً توسط همین روتر خودکار پیش رفته بودن.
جمعبندی نویسنده اینه که عصر استفاده از یه مدل واحد برای همهٔ کارها داره تموم میشه. با بالا رفتن هزینهٔ مدلهای قوی و زیاد شدن گزینهها با قیمت و هوش مختلف، هارنسهای چندمدلی این امکان رو میدن که از نقاط قوت هر مدل استفاده کنی. Devin Fusion الان به صورت پیشنمایش قابل امتحان کردنه.
نکات کلیدی:
- Devin Fusion یه هارنس چندمدلیه که هزینهٔ کدنویسی با AI رو کم میکنه
- ایدهٔ sidekick: یه ایجنت با مدل قوی و یه ایجنت با مدل ارزونتر به صورت موازی
- ایجنت اصلی برنامهریزی و بازبینی میکنه، کارهای بیشتر رو delegate میکنه
- تعویض مدل موقع فشردهسازی context انجام میشه تا cache miss اضافه نده
- روی FrontierCode بین ۳۵٪ تا ۴۱٪ کاهش هزینه بدون افت کیفیت




