SWE-1.7؛ مدلِ کدنویسیِ ارزونتر و باهوشترِ Cognition
خلاصهٔ کاملتر
شرکت Cognition مدل SWE-1.7 رو منتشر کرده و میگه تواناترین مدلیه که تا حالا آموزش داده؛ مدلی که به هوشِ سطحمرزی میرسه ولی هزینهش خیلی کمتره. به گفتهٔ اونا این نتیجهٔ یه سری بهبودِ گسترده تو خطلولهٔ یادگیریِ تقویتی (RL) هست: زیرساختِ بهتر، آموزشِ پایدارتر، دادهٔ باکیفیتتر و روشهای تازه برای کارهای طولانیمدت. این مدل الان تو Devin (وب، دسکتاپ و CLI) از طریقِ Cerebras با سرعتِ ۱۰۰۰ توکن در ثانیه در دسترسه.
نکتهٔ جالب اینه که SWE-1.7 روی پایهٔ Kimi K2.7 آموزش دیده که خودش قبلاً کلی RL دیده بود؛ با این حال کاگنیشن میگه دستاوردهای اضافیِ خودش این تصور که «آموزشِ پس از پایه یه سقف داره» رو به چالش میکشه و نشون میده RL میتونه تواناییها رو خیلی جلوتر ببره. این مدل مخصوصاً برای کارهای طولانی و ناهمگام بهینه شده که به گفتهٔ اونا بخشِ مهمی از مهندسیِ نرمافزارِ باکیفیته.
یکی از چالشهای آموزشهای طولانیِ RL «فروپاشیِ آنتروپی»ه؛ جایی که مدل دیگه کاوش نمیکنه و پاداش یه جا گیر میکنه. کاگنیشن میگه با نمونهگیریِ top-p و تکنیکی به اسمِ بازپخشِ توزیعِ نمونهگیری تونسته هم جلوی این فروپاشی رو بگیره و هم اختلافِ بینِ آموزش و استنتاج رو کنترل کنه، جوری که آنتروپی در طولِ آموزش تقریباً ثابت میمونه. استفاده از بهینهسازِ Muon و حذفِ عملیاتِ غیرقطعی هم بهشون کمک کرده.
بخشِ جالبِ زیرساخت اینه که به گفتهٔ نویسندهها RL لازم نیست همهٔ محاسباتش تو یه کلاستر باشه: فقط بخشِ trainer باید روی یه کلاسترِ پرپهنایباند بشینه و موتورهای استنتاج هرجا میتونن اجرا شن. اونا آموزش رو روی چهار دیتاسنتر تو سه قاره پخش کردن و بهجای فرستادنِ کلِ وزنها، فقط یه «دلتای فشرده» میفرستن که حجمِ انتقال رو بیشتر از ۹۹٪ کم میکنه. آپدیتِ وزنِ یه مدلِ هزارمیلیاردپارامتریِ بینقارهای تو ۱ تا ۲ دقیقه انجام میشه و فقط ۳ تا ۴ ثانیه استنتاج رو متوقف میکنه.
دو تکنیکِ دیگه هم مهمان. اول کیفیتِ داده: هر تسک از تستهای اجراییِ خودکار رد میشه، تسکهای کمسیگنال فیلتر میشن و تسکها جوری سختسازی میشن که مدل نتونه پاداش رو دور بزنه؛ حتی هر رگهٔ تقلب پاداشش صفر میشه. دوم «خودفشردهسازی» برای کارهای طولانی: مدل یاد میگیره وضعیتِ کاریش رو خلاصه کنه و از رویِ همون خلاصه ادامه بده، جوری که یه اجرا تا شش ساعت طول میکشه بدون اینکه از پنجرهٔ کانتکست جا بمونه.
به گفتهٔ کاگنیشن، بعد از اینهمه RL، رفتارِ SWE-1.7 نسبت به مدلِ پایه فرق کرده: قابلاعتمادتره، زنجیرهٔ فکریش فشردهتره و قبل از دستبهکارشدن، کدبیس رو خیلی کاملتر بررسی میکنه و دنبالِ ریشهٔ باگ میره نه فقط نشونهٔ ظاهریش. البته این دقتِ بیشتر یه هزینه هم داره: مدل فایلهای بیشتری رو دست میزنه و دامنهٔ تغییراتش بزرگتر میشه که خودشون میگن جای بهبود داره.
نکات کلیدی:
- SWE-1.7 مدلِ جدیدِ Cognition برای مهندسیِ نرمافزاره که هوشِ سطحمرزی رو با هزینهٔ خیلی کمتر ارائه میده و تو Devin از طریقِ Cerebras با ۱۰۰۰ توکن در ثانیه در دسترسه.
- روی پایهٔ Kimi K2.7 و با RL سنگین آموزش دیده؛ کاگنیشن میگه این نشون میده «سقفِ آموزشِ پس از پایه» اونقدرها هم که فکر میکردن نزدیک نیست.
- با نمونهگیریِ top-p و بازپخشِ توزیعِ نمونهگیری جلوی فروپاشیِ آنتروپی رو گرفتن و آموزش رو پایدار کردن.
- آموزش روی چهار دیتاسنتر در سه قاره پخش شده و انتقالِ وزن با دلتای فشرده بیشتر از ۹۹٪ سبکتر شده.
- با «خودفشردهسازی» اجراها تا شش ساعت طول میکشن؛ مدلِ نهایی ریشهٔ باگها رو بهتر پیدا میکنه ولی دامنهٔ تغییراتش بزرگتر شده.




