Needle 3؛ مدلی زیر ۳۰ مگابایت برای اجرای آفلاین روی گوشی
خلاصهٔ کاملتر
شرکت Cactus Compute مدل Needle 3 رو معرفی کرده که کل حجمش بین ۸ تا ۲۹ مگابایته، یعنی اونقدر کوچیک که بشه داخل خود اپ موبایل بستهبندیش کرد بهجای اینکه هر بار به سرور زنگ بزنی. این مدل فقط سه کار میکنه: tool calling (یعنی تشخیص اینکه درخواست کاربر به کدوم تابع برنامه وصل میشه و پر کردن آرگومانهاش)، استخراج ساختاریافته، و ساخت embedding. به گفتهٔ سازنده، توانایی گفتوگوی عمومی عمداً کنار گذاشته شده تا همین سه تا کار دقیقتر در بیاد.
معماریش چیزیه که Cactus بهش میگه Laddered Simple Attention Network. جای MLP معمولی از Monarch Hadamard MLP استفاده میکنه، سازوکار attention از نوع grouped-query با شاخههای کانولوشن علّیه، و یه بخش حافظه به اسم engram داره که مثل یه بانک n-gram با عملیات gather خونده میشه. بیشتر پارامترهای مدل همونجا نشستن و Cactus میگه همین باعث میشه نسخهٔ ۱۲۱ میلیون پارامتری کار محاسباتی یه مدل ۵۰ میلیونی رو انجام بده.
صفت laddered یعنی مدل جوری آموزش دیده که هر عمقی از ۲ تا ۲۰ لایه خودش یه مدل مستقل و قابلاستقراره. پس یه تیم رباتیک میتونه نسخهٔ ۲ لایه رو روی یه تراشهٔ در حد میکروکنترلر بذاره و همزمان اپ موبایل نسخهٔ کامل ۲۰ لایه رو ببره، هر دو از یه آموزش. fine-tune با LoRA روی دیتاست DroidCall تو همهٔ عمقها بین ۱۸ تا ۳۶ واحد به دقت اضافه کرده و بعدش زیرشبکههای ۴ لایه، یعنی حدود ۲۹ میلیون پارامتر، تو همون بنچمارک از DeepSeek V4 Flash جلو زدن.
برای اینکه خروجی خراب نشه، مدل با یه گرامر بایتلِوِل دیکود میکنه که از روی schema ابزارهای خود توسعهدهنده کامپایل میشه. یعنی مدل آزاد نیست هر متنی بنویسه و هر توکنی که تولید میشه باید روی مسیر یه JSON معتبر بمونه. اگه هیچ ابزاری با درخواست کاربر جور نبود، خروجی درست یه لیست خالیه نه یه تابع ساختگی. هر جواب هم یه عدد اطمینان کالیبره از یه head جداگونه داره که اپ باهاش تصمیم میگیره خودکار عمل کنه، از کاربر تأیید بگیره، یا اصلاً جواب نده.
فشردهسازی هم با فرمت اختصاصی Cactus Quants انجام شده که حدود ۲٫۱۲۵ بیت به ازای هر پارامتر میشه، خیلی تهاجمیتر از ۴ بیت و ۸ بیت رایج امروز، و همین دلیل اصلی جا شدن صد و خردهای میلیون پارامتر تو یه فایل زیر ۳۰ مگابایته. فایل .cact هم طوری طراحی شده که memory-map بشه و سر جاش خونده بشه بهجای اینکه کامل تو رم باز بشه، که برای دستگاههای کمحافظه فرق میکنه. موتور اجرای هر پلتفرم هم زیر ۱ مگابایته.
نکات کلیدی:
- کل مدل یه فایل ۸ تا ۲۹ مگابایتیه و آفلاین روی گوشی، wearable، ربات و میکروکنترلر اجرا میشه
- فقط سه کار رو پوشش میده: tool calling، استخراج ساختاریافته و embedding؛ برای چت ساخته نشده
- هر عمقی از ۲ تا ۲۰ لایه یه مدل مستقل قابلاستقراره
- fine-tune روی DroidCall بین ۱۸ تا ۳۶ واحد دقت اضافه میکنه و زیرشبکهٔ ۴ لایه (حدود ۲۹M پارامتر) از DeepSeek V4 Flash جلو میزنه
- وزنها با Cactus Quants حدود ۲٫۱۲۵ بیت به ازای هر پارامتر فشرده شدن
- گرامر بایتلِوِل خروجی معتبر رو تضمین میکنه و هر جواب یه عدد اطمینان کالیبره داره




