اُرنیت ۱.۵؛ مدل بازمتنی که خودش تمرین میسازه
خلاصهٔ کاملتر
اُرنیت ۱.۵ یه خانواده مدل زبانی بازمتنه که با یه حلقهی خودبهبودی (یعنی سیستمی که خودش وظیفههای تمرینی جدید میسازه، بهجای اینکه منتظر بمونه آدمها بنچمارک بنویسن) آموزش دیده. تو این حلقه سه چیز با هم بهینه میشن: ساخت وظیفههای تازه، ساخت اسکفولد (یعنی چارچوب و ابزارهایی که مدل برای حل هر وظیفه ازشون استفاده میکنه) و اجرای واقعی مدل روی این وظیفهها که نتیجهش بهعنوان سیگنال یادگیری تقویتی برمیگرده.
نسخهی قبلی، اُرنیت ۱.۰، فقط ساخت اسکفولد و اجرای رولاوت رو بهینه میکرد و هنوز به یه ست ثابت از وظیفههای دستساز آدمها وابسته بود. اُرنیت ۱.۵ همون حلقه رو گسترش داده تا خود تولید وظیفهها رو هم شامل بشه؛ یعنی دیگه هیچکدوم از این سه بخش ثابت نمیمونن و همه با هم رشد میکنن. طبق ادعای سازندهها، این باعث میشه سختی و تنوع تمرینها همراه با قویتر شدن خود مدل تغییر کنه، چون یه دیتاست ثابت نمیتونه خودشو با مدلی که ازش عبور کرده تطبیق بده.
این مدل از صفر ساخته نشده: روی پایهی Qwen3.5 و Gemma4 و بعد از مراحل معمول پیشتمرین و پستمرین، حلقهی خودبهبودی روش اجرا شده. خانوادهی اُرنیت ۱.۵ دو سایز داره؛ یه مدل ۹ میلیارد پارامتری دنس که رو یه GPU تنها قابل اجراست (با یه نسخهی کوانتیزهشده برای موبایل) و یه مدل ۳۵ میلیارد پارامتری از نوع mixture-of-experts که فقط حدود ۳ میلیارد پارامتر رو در هر توکن فعال میکنه، یعنی هزینهی محاسباتیش خیلی کمتر از یه مدل دنس همسایزه.
طبق بنچمارکهای منتشرشده، اُرنیت ۱.۵-۳۵B-A3B تو تستهای کدنویسی و ایجنتیک مثل SWE-bench Verified، SWE-bench Pro، Terminal-Bench 2.1 و MCP-Atlas از رقیب همساختارش یعنی Qwen3.6-35B-A3B جلوتره و از مدلهای دنستری مثل Gemma-4-31B با فاصلهی زیاد بهتر عمل میکنه. نویسنده تأکید میکنه این نتایج فقط نشون میده روش خودبهبودی تو دستهی کدنویسی و ایجنتیک خوب جواب داده، نه اینکه وظیفههای خودساخته تو همهی حوزهها بهتر از دیتاست دستساز عمل میکنن.
برای کسایی که میخوان از این مدل استفاده کنن، خبر خاصی دربارهی نحوهی استفاده نیست: بعد از انتشار، مثل هر مدل بازمتن دیگه از طریق زیرساختهایی مثل vLLM سرو میشه و پرامپت میگیره. نکتهی جالبتر جهت کلی ماجراست: اگه این روند از نسخهی ۱.۰ به ۱.۵ ادامه پیدا کنه، نشون میده پایپلاینهای آموزش تقویتی دارن از برنامهی درسی مبتنی بر بنچمارک ثابت، به سمت حلقههایی میرن که خود توانایی مدل تعیین میکنه بعدش چی تمرین کنه.
نکات کلیدی:
- اُرنیت ۱.۵ برخلاف اُرنیت ۱.۰، تولید وظیفههای تمرینی رو هم وارد حلقهی بهینهسازی کرده، نه فقط اسکفولد و رولاوت.
- پایهی مدل Qwen3.5 و Gemma4 هست؛ خانواده شامل یه مدل ۹B دنس (با نسخهی موبایل کوانتیزه) و یه مدل ۳۵B با فعالسازی حدود ۳B پارامتر در هر توکنه.
- تو بنچمارکهایی مثل SWE-bench و Terminal-Bench 2.1 از Qwen3.6-35B-A3B و Gemma-4-31B جلوتره.
- نتایج فقط حوزهی کدنویسی و ایجنتیک رو پوشش میده، نه کل توانایی مدلهای زبانی.




