مدل Ornith-1.5 اومد؛ کدنویسی قوی با فقط ۳ میلیارد پارامتر فعال
خلاصهٔ کاملتر
Ornith AI یه مدل زبانی جدید به اسم Ornith-1.5-35B-A3B رو منتشر کرده که مخصوص کدنویسی و کارای عاملمحور (agentic) طراحی شده. این مدل از معماری mixture-of-experts (یعنی بهجای اینکه کل مدل برای هر توکن فعال بشه، فقط چندتا زیرشبکهٔ تخصصی «اکسپرت» درگیر میشن) استفاده میکنه؛ در کل ۳۵ میلیارد پارامتر داره ولی فقط حدود ۳ میلیارد پارامتر رو برای هر توکن فعال میکنه، و همین باعث میشه هزینهٔ اجراش نزدیک به یه مدل دنس ۳ میلیاردی باشه در حالی که ظرفیتش خیلی بیشتره.
نکتهٔ جالب این مدل روش آموزششه. بهجای اینکه فقط روی یه دادهست ثابت و دستساز تمرین ببینه، Ornith-1.5 با یه حلقهٔ self-improvement (خودبهبودی) آموزش دیده که همزمان سه چیز رو بهینه میکنه: تولید مسئلههای جدید برای تمرین، ساختن اسکفولد (چارچوب تعامل مدل با ابزارها و ترمینال) و بهبود جوابهای خود مدل. این مدل روی Ornith-1.0 ساخته شده که خودش از روی Qwen3.5 و Gemma4 توسعه پیدا کرده بود.
تو بنچمارکهای کدنویسی، Ornith-1.5 عملکرد خیلی خوبی داره: تو SWE-bench Verified نمرهٔ ۷۹ گرفته، در حالی که Qwen3.6-35B-A3B همردهش فقط ۷۳.۴ و حتی مدل دنس غولپیکر Qwen3.5-397B (تقریبا ده برابر بزرگتر) فقط ۷۶.۴ گرفتن. تو Terminal-Bench 2.1 هم با اسکفولد Claude Code به ۶۸.۵ رسیده که خیلی جلوتر از رقباست.
اما تو بنچمارکهای عمومیتر مثل استدلال و کارای عاملمحور چندمرحلهای (مثل MCP-Atlas)، مدلهای Muse-Glimmer-30B و Qwen3.5-397B هنوز جلوترن؛ یعنی این مدل بیشتر برای کارای واقعی مهندسی نرمافزار (رفع باگ، تغییر تو کد پروژه، کار با ترمینال) بهینهست تا استدلالهای باز و عمومی.
Ornith-1.5-35B-A3B با لایسنس MIT (که برای استفادهٔ تجاری هم آزاده) روی Hugging Face منتشر شده و با کتابخونهٔ استاندارد transformers سازگاره. با توجه به هزینهٔ اجرای پایین و عملکرد قوی تو بنچمارکهای کدنویسی، گزینهٔ جذابه برای تیمایی که دنبال ساخت ابزارای کدنویسی یا عاملهای خودکارن.
نکات کلیدی:
- Ornith-1.5-35B-A3B مدلی MoE با ۳۵ میلیارد پارامتر کل و حدود ۳ میلیارد پارامتر فعال به ازای هر توکن
- روی SWE-bench Verified نمرهٔ ۷۹ میگیره، بالاتر از Qwen3.6-35B-A3B (۷۳.۴) و Qwen3.5-397B (۷۶.۴)
- روی Terminal-Bench 2.1 با اسکفولد Claude Code به ۶۸.۵ میرسه
- روی MCP-Atlas و بعضی بنچمارکهای عمومی از Muse-Glimmer-30B و Qwen3.5-397B عقب میمونه
- با لایسنس MIT روی Hugging Face در قالب ۱۶ shard منتشر شده




