Inkling-Small؛ همون قدرت با یکچهارم حجم
خلاصهٔ کاملتر
تینکینگ ماشینز از Inkling-Small رونمایی کرد؛ یه مدل open-weights که به گفتهٔ خود شرکت با یکچهارم حجم Inkling، کارایی قابلمقایسهای باهاش داره. معماریش Mixture-of-Experts هست، با ۲۷۶ میلیارد پارامتر کل و فقط ۱۲ میلیارد پارامتر فعال، و روی سیستمهای NVIDIA GB300 NVL72 آموزش دیده. مثل نسخهٔ بزرگتر، استدلال بومی روی صدا و تصویر، پنجرهٔ کانتکست تا ۱ میلیون توکن و امکان تنظیم «میزان تفکر» رو داره.
تو اعلامیه اومده که Inkling-Small بعد از برادر بزرگترش آموزش دیده و همین اجازه داده ترکیب دادهٔ پیشآموزش و رسپی یادگیریش بهتر بشه. یه چکپوینت اولیه رو با on-policy distillation و معلمیِ خودِ Inkling پسآموزش دادن و بعدش دو هفته RL کدنویسی ایجنتیک روش ادامه پیدا کرده. نتیجه اینه که تو استدلال و کدنویسی از Inkling جلو زده، ولی Inkling هنوز تو پوشش دانش و صحت اطلاعات جلوتره.
تو Humanity's Last Exam نمرهٔ ۳۱.۶ درصد گرفته در برابر ۲۹.۷ درصدِ Inkling، و این برتری تو همهٔ بودجههای تفکر حفظ میشه. رو SWEBench-Verified از مرز ۸۰ درصد رد شده (۸۰.۲ درصد) و تو Terminal-Bench 2.1 به ۶۴.۷ درصد رسیده. مهمتر از خودِ عددها، نسبت کارایی به توکن مصرفیه: بین مدلهای هموزنِ open-weights، منحنی کاراییش نسبت به محاسبات زمان تست بالاتر میایسته.
بخش چندوجهی همون معماری encoder-free رو نگه داشته: صدا به شکل اسپکتروگرام dMel و تصویر بهصورت پچهای ۴۰×۴۰ پیکسلی با یه hMLP چهارلایه پردازش و کنار توکنهای متنی چیده میشه. مدل حالا بهتر میتونه برای کارهای تصویری از Python کمک بگیره و تصویر رو برش بزنه یا زوم کنه، که روی سند و نمودار به کار میاد. وزنهای کامل روی Hugging Face منتشر شده و مدل برای fine-tune روی Tinker و چت متنی، تصویری و صوتی تو Tinker Playground در دسترسه.
نکات کلیدی:
- مدل open-weights با ۲۷۶ میلیارد پارامتر کل و ۱۲ میلیارد فعال، یکچهارم حجم Inkling
- استدلال بومی روی صدا و تصویر، کانتکست تا ۱ میلیون توکن، تفکر با میزان قابل تنظیم
- ۳۱.۶ درصد تو HLE و ۸۰.۲ درصد تو SWEBench-Verified، بالاتر از Inkling
- Inkling هنوز تو دانش عمومی و فکچوال بودن جلوتره
- وزنها روی Hugging Face، فاینتیون و چت روی Tinker




