Ornith-1.0 متنباز شد؛ مدلی که داربست خودش رو مینویسه
خلاصهٔ کاملتر
شرکت DeepReinforce خانوادهٔ مدلهای Ornith-1.0 رو متنباز کرده؛ خانوادهای «خودبهبوددهنده» که برای کدنویسی agentic ساخته شده و کل طیف رو پوشش میده: از یه نسخهٔ فشردهٔ ۹ میلیاردی Dense برای اجرا روی لبه تا یه مدل ۳۹۷ میلیاردی MoE برای کار در مقیاس مرزی، با گزینههای ۳۱ میلیاردی Dense و ۳۵ میلیاردی MoE در میانه. هر نسخه روی پایههای از پیش آموزشدیدهٔ Gemma 4 و Qwen 3.5 آموزش دیده.
چیزی که Ornith رو از بیشتر ستاپهای یادگیری تقویتی جدا میکنه، برخوردش با داربست (scaffold) ـه. معمولاً یه harness دستساز انسانی مسیر تولید راهحل رو هدایت میکنه؛ اینجا خود مدل یاد میگیره هم rolloutهای راهحل رو تولید کنه و هم داربست مخصوص همون تسک رو.
هر قدم RL دو مرحله داره: مدل با توجه به تسک و داربستی که آخرین بار برای اون تسک استفاده شده، یه داربست پالودهتر پیشنهاد میده، و بعد راهحل رو مشروط به همون داربست تولید میکنه. پاداشِ rollout به هر دو مرحله برمیگرده، پس مدل یاد میگیره ارکستراسیون رو هم مثل خود جواب بنویسه. تو طول آموزش، داربستها جهش پیدا میکنن و اونهایی انتخاب میشن که مسیرهای پرپاداشتر میسازن — یعنی استراتژی مخصوص هر تسک بدون مهندسی دستی harness خودش سر بلند میکنه.
اجازه دادن به مدل برای نوشتن داربست خودش، یه در رو باز میکنه: reward hacking، جایی که داربست، verifier رو راضی میکنه بدون اینکه واقعاً تسک رو حل کنه. DeepReinforce برای این یه دفاع سهلایه توصیف میکنه: یه مرز اعتماد بیرونی ثابت که محیط و ایزولهبودن تستها رو خارج از دسترس مدل نگه میداره؛ یه مانیتور قطعی که تلاش برای خوندن مسیرهای پنهان یا دستکاری اسکریپتهای راستیآزمایی رو علامت میزنه؛ و یه داور LLM فریزشده که هر وقت تقلب داخل سطح ابزارهای مجاز اتفاق بیفته، وتوی verifier رو میکنه.
روی عملکرد، شرکت ادعا میکنه Ornith-1.0 بین مدلهای متنباز هماندازه state of the artـه. طبق اعداد اعلامی، مدل پرچمدار ۳۹۷ میلیاردی به نمرهٔ ۷۷.۵ در Terminal-Bench 2.1 و ۸۲.۴ در SWE-Bench Verified رسیده — که به گفتهٔ خودشون همتراز Claude Opus 4.7 و رقبای متنباز درجهیکی مثل MiniMax M3 و DeepSeek-V4-Pro ـه.
جالبترین عدد برای توسعهدهندههای معمولی مال نسخهٔ ۹ میلیاردیه: ۴۳.۱ در Terminal-Bench 2.1 و ۶۹.۴ در SWE-Bench Verified، که ادعا میشه با مدلهای خیلی بزرگتری مثل Gemma 4-31B برابری میکنه — یعنی کدنویسی توانمند روی سختافزار محدود هم شدنیـه. مدل ۳۵ میلیاردی هم طبق گزارش از بیلدهای هماندازهٔ Qwen و Gemma جلو زده. وزنها و گزارش فنی روی Hugging Face منتشر شدن.
نکات کلیدی:
- Ornith-1.0 در چهار اندازه: ۹B Dense، ۳۱B Dense، ۳۵B MoE و ۳۹۷B MoE، روی پایهٔ Gemma 4 و Qwen 3.5
- مدل بهجای harness دستساز، خودش داربست تسک رو تولید و اصلاح میکنه و پاداش به هر دو مرحله میرسه
- دفاع سهلایه در برابر reward hacking: مرز اعتماد ثابت، مانیتور قطعی، داور LLM فریزشده
- مدل ۳۹۷B: نمرهٔ ۷۷.۵ در Terminal-Bench 2.1 و ۸۲.۴ در SWE-Bench Verified
- مدل ۹B با ۶۹.۴ در SWE-Bench Verified، کدنویسی جدی رو روی سختافزار محدود ممکن میکنه




