K2-Horizon-MoVA؛ کوچیک اما جلوتر از غولها
خلاصهٔ کاملتر
K2-Horizon-MoVA-36B-A4B یه مدل زبانی open-weight (یعنی وزنهاش عمومی منتشر شده) با معماری Mixture-of-Experts هست: ۳۶ میلیارد پارامتر ذخیره میکنه ولی برای هر توکن فقط ۴ میلیارد رو به کار میگیره. تو مقاله اومده که ادعای اصلی مدل همینه، نتیجهای نزدیک به مدلهای چند برابر بزرگتر با کسری از محاسبات. فعلاً فقط چکپوینت نهایی منتشر شده و چکپوینتهای میانی، دادهٔ آموزش و کد آموزش قراره بعداً بیاد.
قویترین عددهاش تو بنچمارکهای عاملی درمیاد، یعنی تستهایی که میسنجن مدل چقدر میتونه ابزار صدا بزنه و یه کار چندمرحلهای رو تا آخر ببره. تو tau3-Banking نمرهٔ ۲۶.۸ گرفته، بعدیش G9v3-39A5B با ۲۲.۱ و بعد Nemotron 3 Ultra با ۱۴.۲. تو Terminal-Bench 2.1 هم با ۵۸.۶ اول شده، جلوتر از Nemotron 3 Ultra با ۵۳.۹ و Muse Glimmer-30B با ۵۱.۷. یعنی از مدلی که ۵۵ میلیارد پارامتر فعال داره، حدود ۱۵ برابر خودش، جلو زده.
ولی همهجا برنده نیست. تو SciCode نمرهٔ ۳۸.۹ گرفته و پشت Muse Glimmer-30B با ۴۳.۶، Gemma 4 31B-it با ۴۳.۴ و Nemotron 3 Ultra با ۳۹.۹ مونده. تو Humanity’s Last Exam هم ۲۵.۲ در برابر ۲۸.۴ و تو GPQA Diamond هم ۸۰.۸ در برابر ۸۶.۷ از Nemotron 3 Ultra عقبه. الگو روشنه: دانش علمی عمیق هنوز مال مدل بزرگتره، ولی جایی که کار «انجام دادن» مهمه نه فقط «دونستن»، این مدل جلو میافته.
مدل از مرحلهٔ midtraining به بعد پنجرهٔ متن ۵۲۴٬۲۸۸ توکنی (همون ۵۱۲K) رو بهصورت بومی پشتیبانی میکنه، که برای مسیرهای طولانی یه agent یا سند و کدبیس بزرگ بدون تیکهتیکه کردن به درد میخوره. جمعبندی نویسنده اینه که تعداد کل پارامترها پیشبینیکنندهٔ خوبی برای کیفیت نیست و کیفیت دادهٔ آموزش و انتخابهای معماری خیلی بیشتر تأثیر دارن. داوری نهایی هم میمونه برای وقتی که کد و دادهٔ آموزش بیرون بیاد.
نکات کلیدی:
- ۳۶ میلیارد پارامتر کل، فقط ۴ میلیارد فعال به ازای هر توکن
- رتبهٔ اول در tau3-Banking با ۲۶.۸ و Terminal-Bench 2.1 با ۵۸.۶
- عقب از Nemotron 3 Ultra در GPQA Diamond با ۸۰.۸ در برابر ۸۶.۷
- پنجرهٔ متن بومی ۵۲۴٬۲۸۸ توکن از مرحلهٔ midtraining به بعد
- چکپوینتهای میانی، دادهٔ آموزش و کد آموزش هنوز منتشر نشده




