بنچمارک Needle 3 در برابر مدلهای بزرگتر
خلاصهٔ کاملتر
Needle 3 یه مدل open-weight از Cactus Compute هست که برای سه کار روی سختافزار محدود ساخته شده: صدا زدن توابع، استخراج ساختاریافته و embedding. کل مدل یه فایل ۸ تا ۲۹ مگابایتیه. تو این مقاله اومده که نکتهٔ مهمش مقیاس نیست، بلکه بازدهیه: Cactus گزارش میکنه Needle تو tool call موبایلی از مدلهای ۱۰ برابر بزرگتر جلو میزنه و تو استخراج به مدلهای ۲ تا ۳ برابری میرسه، و کل شرطبندی این انتشار هم همین معاملهٔ عرض در برابر تخصصه.
بنچمارکها دو دستهان و هر دو معیار سفتوسختی دارن. tool calling با exact-match accuracy روی کل test split سنجیده شده، یعنی مدل یا تابع درست رو انتخاب میکنه و همهٔ آرگومانها رو درست پر میکنه یا اصلاً قبول نیست. اگه کاربر دو تا چیز بخواد باید دو تا call به ترتیب درست برگرده و اگه هیچ ابزاری به درخواست نخوره، جواب درست یه لیست خالیه. استخراج هم با field micro-F1 سنجیده شده، یعنی امتیاز بهازای هر فیلد حساب میشه نه کل رکورد.
پشت این دقت، چند تا انتخاب معماری هست. جای feed-forward معمولی یه Monarch Hadamard MLP نشسته، attention از نوع grouped-query با شاخههای کانولوشن علّیه، و یه بخش به اسم engram نقش بانک حافظهٔ n-gram رو بازی میکنه که بیشتر پارامترهای مدل همونجان. Cactus میگه همین باعث میشه مدل ۱۲۱ میلیونی حسابوکتاب یه مدل ۵۰ میلیونی رو بکنه، چون بهجای لایههای چگال بزرگ، الگوها رو از حافظه میخونه.
قسمت laddered یعنی هر عمقی از ۲ تا ۲۰ لایه یه مدل مستقل قابلاستقراره، پس توسعهدهنده گیر یه سایز ثابت نیست. fine-tune با LoRA روی DroidCall همهٔ سایزها رو بین ۱۸ تا ۳۶ واحد بالا برده و از ۴ لایه به بالا، یعنی حدود ۲۹ میلیون پارامتر، زیرشبکهٔ تیونشده از DeepSeek V4 Flash رد شده. دستور needle build --layers N آداپتور LoRA رو merge میکنه و عمق دلخواه رو بهصورت یه فایل ۴ بیتی .cact بیرون میده.
نویسنده خودش هم حواسش به محدودیتها هست. اگه اپ شما به یه چتبات نیاز داره که دربارهٔ هر موضوعی حرف بزنه، Needle 3 ابزار درستی نیست و خود model card هم همینو میگه. ولی برای اپی که باید گفتار یا متن کاربر رو به یه مجموعهٔ ثابت از توابع نگاشت کنه یا فیلد از فاکتور و رزرو در بیاره، اجرای کامل روی دستگاه بدون رفتوبرگشت شبکه و بدون هزینهٔ بهازای هر call، هم اقتصاد کار رو عوض میکنه هم تأخیر رو. ضمن اینکه همهٔ این عددها منتشرشدهٔ خود Cactus هست و بازتولید مستقل ثالثی پشتش نیست، پس نویسنده پیشنهاد میده بهعنوان سیگنال قوی بهش نگاه کنین نه واقعیت ممیزیشده.
نکات کلیدی:
- ادعای اصلی: برتری در tool calling نسبت به مدلهای ۱۰ برابر بزرگتر و برابری در استخراج با مدلهای ۲ تا ۳ برابری
- معیارها exact-match accuracy برای tool call و field micro-F1 برای استخراج، روی کل test split
- شش بنچمارک گزارش شده، از جمله DroidCall و Mobile Actions
- fine-tune با LoRA بین ۱۸ تا ۳۶ واحد دقت اضافه میکنه؛ از ۴ لایه (۲۹M پارامتر) به بالا از DeepSeek V4 Flash جلو میزنه
- بیشتر ۱۲۱ میلیون پارامتر مدل تو بخش engram ذخیره شده
- همهٔ نتایج از خود Cactusـه و ارزیابی مستقل ثالث نداره




