K2 Horizon: شش مدل کاملاً باز که هنوز خامن
خلاصهٔ کاملتر
تو این مقاله اومده که K2 Horizon یه خانوادهٔ ششتایی از مدلهای زبانی بازه که Institute of Foundation Models (IFM)، بازوی تحقیقاتی دانشگاه MBZUAI ابوظبی، منتشرش کرده. سایزها از ۰.۹ میلیارد پارامتر شروع میشن و تا یه مدل mixture-of-experts (یعنی معماریای که فقط بخشی از پارامترها رو برای هر درخواست فعال میکنه) با ۳۷۵ میلیارد پارامتر میرن. نکتهٔ مهم اینه که همهچیز زیر Apache 2.0 منتشر شده: وزنها، دادهٔ آموزش، checkpointها و کد. یعنی این فقط open weights نیست، واقعاً بازه.
روی کاغذ هر سایز یه نقطهٔ درخشش جدا داره. مدل ۰.۹B تو AIME 2026 (ریاضی) و BFCL (بنچمارک tool calling) از بقیه جلو میزنه که برای این ابعاد جالبه و نشون میده برای کارهای روی دستگاه تنظیم شده. مدل 7B تو SWE-bench و terminal-bench برندهست، یعنی گزینهٔ کدنویسی محلی روی یه ورکاستیشن. مدل 32B هم تو GPQA Diamond با ۸۲ در برابر ۲۷ خیلی جلو میافته. طول context هم یکدست نیست: ۰.۹B تا ۱۲۸ هزار توکن میره ولی 7B و 32B تا ۵۱۲ هزار توکن بالا میرن.
تست محلی روی یه ماشین با ۹۶ گیگ VRAM و اوبونتو و vLLM انجام شده و تصویر واقعیتری میده. مدل 32B با KV cache روی context حدود ۶۵ هزار توکنی نزدیک ۹۲ گیگ VRAM خورده، 7B حدود ۱۶.۷۶ گیگ و ۰.۹B کمی بیشتر از ۲ گیگ. یعنی 7B نقطهٔ شیرین یه GPU معمولیه و 32B عملاً کارتهای ردهٔ A100 یا H100 یا اجارهٔ GPU ابری میخواد.
تست کدنویسی خوب پیش نرفت. تسک این بود که از صفر یه فایل HTML بسازن که یه سیخ دونر چرخان جلوی کبابپز عمودی رو شبیهسازی کنه. مدل 32B بیشتر از ۳۰ دقیقه طول کشید و خروجیش موقع باز شدن اصلاً درست کار نمیکرد؛ خروجی 7B هم به گفتهٔ نویسنده اصلاً شبیه چیزی که خواسته بودن نبود. بدتر اینکه با وجود فعال بودن tool calling، هیچکدوم نتونستن فایل رو با tool call ذخیره کنن و آخرش مجبور شدن به جای tool parser خود vLLM از یه اسکریپت پایتون جداگانه استفاده کنن.
تو تست چندزبانه، زبانهای پرمنبع مثل انگلیسی، اسپانیایی، فرانسوی، روسی، لهستانی و چکی تمیز ترجمه شدن، ولی بنگالی، سواحیلی، تامیلی، پنجابی و اردو بههمریخته و با خط قاطی و کلمههای انگلیسی وسط متن درومدن؛ تو اردو حتی رشتههای بیربطی مثل AWS ظاهر شد. IFM میگه این نسخه یه checkpoint مرحلهاوله، ولی نویسنده یادآوری میکنه که خود IFM از یه پایپلاین کامل post-training حرف زده و همین سؤال درست میکنه که چرا هنوز اینقدر ناهمواری داره.
نکات کلیدی:
- شش مدل از ۰.۹B تا ۳۷۵B (MoE) زیر Apache 2.0 با وزن، دادهٔ آموزش، checkpoint و کد
- سه سایز ۰.۹B و 7B و 32B روی یک GPU با vLLM قابل اجرا هستن
- مصرف VRAM: حدود ۲ گیگ برای ۰.۹B، حدود ۱۶.۷۶ گیگ برای 7B و حدود ۹۲ گیگ برای 32B
- طول context: ۱۲۸ هزار توکن برای ۰.۹B و ۵۱۲ هزار توکن برای 7B و 32B
- 32B تو GPQA Diamond نمرهٔ ۸۲ در برابر ۲۷ گرفته؛ 7B تو SWE-bench و terminal-bench جلوتره
- tool parser روی vLLM کار نکرد و ذخیرهٔ فایل با tool call شکست خورد
- ترجمهٔ زبانهای کممنبع مثل بنگالی، تامیلی و اردو بههمریخته و با خط قاطی درومد
- رد استدلال مدل 32B نشون میداد جمله به جمله خودشو تصحیح میکنه، یعنی با اعتمادبهنفس کاذب توهم نمیزده




