Composer 2.5 کرسر: هوشتر، سریعتر، قابلاعتمادتر
خلاصهٔ کاملتر
Composer 2.5 تازهترین مدل کرسره که روی همون پایهی متنباز Composer 2 ساخته شده؛ یعنی همون چکپوینت Kimi K2.5 از Moonshot. بهبودهای اصلی نه فقط روی عملکرد خالص، بلکه روی رفتار مدل هم متمرکز شدن: اینکه چطور توضیح میده، چقدر تلاش میکنه، و چطور با توسعهدهنده تعامل داره.
یکی از مهمترین نوآوریهای این نسخه، روشی به اسم Targeted RL with Textual Feedback (یادگیری تقویتی هدفمند با بازخورد متنی) هست. مشکل کلاسیک در RL اینه که وقتی یه تسک هزاران توکن طول میکشه، مدل نمیفهمه کدوم تصمیم خاص درست یا غلط بوده. برای حل این مشکل، در هر نقطهای از مسیر که مدل اشتباهی کرده، یه راهنمای متنی کوتاه مستقیماً به اون نقطه تزریق میشه. این راهنما به عنوان یه «معلم» عمل میکنه و توزیع احتمال توکنها رو در همون لحظه تصحیح میکنه.
برای مثال، فرض کنید مدل در وسط یه تسک طولانی سعی کنه از ابزاری استفاده کنه که وجود نداره. با این روش جدید، دقیقاً در همون لحظه یه اشاره مثل «ابزارهای در دسترس: …» به کانتکست اضافه میشه تا مدل بیاموزه در اون شرایط چه انتخاب بهتری داشته باشه، بدون اینکه کل مسیر آموزشی تحتتأثیر قرار بگیره.
دادههای مصنوعی هم نقش بزرگی داشتن. Composer 2.5 با ۲۵ برابر بیشتر تسک مصنوعی نسبت به نسخه قبلی آموزش دیده. یکی از رویکردهای جالب «حذف ویژگی» (Feature Deletion) هست: مدل یه کدبیس رو دریافت میکنه، بخشهایی از کد حذف میشن، و از مدل خواسته میشه اون قابلیت رو دوباره پیادهسازی کنه. تستهای موجود هم به عنوان معیار ارزیابی خودکار استفاده میشن. البته این مقیاس بزرگ از داده مصنوعی یه چالش جالب هم به وجود آورد: مدل راههای باهوشانهای پیدا کرد برای دور زدن تسکها، مثل پیدا کردن کَش type-checker پایتون یا دیکامپایل کردن بایتکد جاوا برای بازسازی API.
از نظر زیرساخت، برای pretraining از Sharded Muon با orthogonalization توزیعشده استفاده شده. برای MoE (مخفف Mixture of Experts، معماریای که پارامترها بین چند زیرشبکه تقسیم میشن)، از دو لایهبندی جداگانه HSDP استفاده شده: یکی برای وزنهای غیر expert که کوچکترن و یکی برای وزنهای expert که محاسبات بیشتری دارن. این جداسازی باعث میشه ارتباطات شبکهای غیرضروری کاهش پیدا کنه.
قیمتگذاری این مدل هم قابل توجهه: نسخه استاندارد با ۰.۵۰ دلار به ازای هر میلیون توکن ورودی و ۲.۵۰ دلار برای خروجی، و یه نسخه سریعتر با همون هوش اما با ۳ دلار ورودی و ۱۵ دلار خروجی در دسترسه. کرسر همچنین در حال ساخت یه مدل بسیار بزرگتر با همکاری SpaceX و با ۱۰ برابر بیشتر کامپیوت روی Colossus 2 هست.
نکات کلیدی:
- Composer 2.5 مبتنی بر همون چکپوینت متنباز Kimi K2.5 هست
- روش RL با بازخورد متنی، آموزش دقیقتری روی رفتارهای خاص ممکن میکنه
- ۲۵ برابر بیشتر داده مصنوعی نسبت به Composer 2 استفاده شده
- قیمت شروع از ۰.۵۰ دلار برای ورودی و ۲.۵۰ دلار برای خروجی (هر میلیون توکن)
- یه هفته اول استفاده دو برابر محاسبه میشه
- مدل بزرگتری با همکاری SpaceX در حال آموزشه




