Ornith-1.5 اومد: مدلهای بازی که خودشون تمرینشون رو طراحی میکنن
خلاصهٔ کاملتر
دیپریینفورس، تیمی که پیشتر Ornith-1.0 رو منتشر کرده بود، حالا نسل بعدی این خانواده یعنی Ornith-1.5 رو بیرون داده. تفاوت اصلی اینه که Ornith-1.0 دور یهسری تسک ثابت که آدمها طراحی کرده بودن اسکفولد (چارچوب اجرای کار) میساخت، ولی Ornith-1.5 خودش تسکها رو هم پیشنهاد میده، هم براشون اسکفولد اختصاصی میسازه و هم دادههای یادگیری تقویتی رو از حل همون تسکها تولید میکنه؛ یه حلقه خودتکاملی بسته.
هر چرخه آموزش سه مرحله داره. اول با توجه به یه محیط یا کدبیس، دستورالعمل کلی، و سابقه تسکهایی که مدل قبلاً حل کرده، سیستم تسکهای تازه و سختتر پیشنهاد میده. بعد یه اسکفولد شامل دستورالعمل، ابزارها و استراتژی تجزیه کار میسازه یا بهبود میده، و در نهایت یه rollout (اجرای واقعی حل مسئله) بر همون اساس تولید میکنه. پاداش بین هر سه مرحله رد و بدل میشه، یعنی مدل همزمان یاد میگیره راهحل بهتر بنویسه، تسک آموزشی بهتری بسازه و ارزیابی دقیقتری انجام بده. پاداش هر تسک از ضرب سه فاکتور میاد: معتبر و قابلارزیابی بودن تسک، نزدیک بودن سختیش به مرز توانایی فعلی مدل (هدف یه نرخ موفقیت حدود ۲۰ درصده، چون وقتی مدل یه تسک رو همیشه حل میکنه دیگه اون تسک ارزش آموزشی نداره)، و تازه بودنش نسبت به تسکهای قبلی. تسکهای نامعتبر کلاً از رده خارج میشن و کل فرآیند با الگوریتم GRPO بهینه میشه.
رو جدولهای منتشرشده خود شرکت که میانگین پنج اجرای مستقله، نسخه ۳۹۷ میلیاردی (Mixture-of-Experts) رو Terminal-Bench 2.1 امتیاز ۸۵.۱ و رو DeepSWE امتیاز ۵۶.۰ گرفته، که به گفته دیپریینفورس تقریباً همتراز Claude Opus 4.8 هست (۸۵.۰ و ۵۹.۰) و از GLM-5.2 و DeepSeek-V4-Flash-0731 تو همون سایز جلوتره. نسخه ۳۵ میلیاردی که فقط ۳ میلیارد پارامتر در هر توکن فعال میکنه، ۶۸.۵ رو Terminal-Bench 2.1 و ۷۹.۰ رو SWE-Bench Verified گرفته؛ نسخه ۹ میلیاردی دنس هم ۴۷.۰ و ۷۰.۶ گرفته که طبق ادعای شرکت از Gemma 4-31B و Qwen 3.6-35B بهتره. تواناییش به کدنویسی محدود نمیشه: نسخه فلگشیپ رو GPQA Diamond (استدلال علمی) ۹۲.۸ و رو BrowseComp (جستجوی وب) ۸۶.۶ امتیاز گرفته.
دیپریینفورس همون تیمیه که Ornith-1.0 رو با لایسنس MIT و وزنهای باز رو هاگینگفیس منتشر کرده بود؛ اون نسخه با پست-ترینینگ رو چکپوینتهای Gemma 4 و Qwen 3.5 ساخته شده بود. این تیم قبلاً هم رو پروژههایی مثل CUDA-L1 و حلقه ایجنت IterX تو زمینه بهینهسازی یادگیری تقویتی کار کرده، و ریوارد هکینگ (سوءاستفاده مدل از منطق پاداش برای گرفتن امتیاز بدون حل واقعی مسئله) همیشه دغدغه این نوع کارها بوده. تو Ornith-1.5 همین نگرانی باعث شده مرحله اعتبارسنجی تسک بهعنوان یه فیلتر سختگیرانه اضافه بشه که تسکهای نامعتبر هیچ پاداشی نمیگیرن.
نکات کلیدی:
- Ornith-1.5 تو سه سایز عرضه شده: فلگشیپ ۳۹۷ میلیارد پارامتری MoE، مدل ۳۵ میلیاردی MoE با فعالسازی ۳ میلیارد پارامتر، و مدل ۹ میلیاردی دنس با نسخه موبایل کوانتایزشده
- نسخه ۳۹۷ میلیاردی رو Terminal-Bench 2.1 امتیاز ۸۵.۱ و رو DeepSWE امتیاز ۵۶.۰ گرفته، تقریباً همتراز Claude Opus 4.8
- هدف سختی تسکهای تولیدشده یه نرخ موفقیت حدود ۲۰ درصده تا همیشه چالشبرانگیز بمونن
- Ornith-1.0، نسل قبلی، با لایسنس MIT و پایه Gemma 4 / Qwen 3.5 قبلاً منتشر شده بود
- کل فرآیند آموزش سهمرحلهای با الگوریتم GRPO بهینه میشه




