Needle: مدل زبانی ۲۶ میلیون پارامتری برای دستگاههای شخصی
خلاصهٔ کاملتر
تیم Cactus Compute یه مدل زبانی کوچیک اما کارآمد به اسم Needle منتشر کرده که فقط ۲۶ میلیون پارامتر داره. این مدل با استفاده از تکنیک تقطیر (distillation) از روی Gemini آموزش دیده و معماری خاصی به اسم Simple Attention Network داره — یه رویکرد تجربی که هدفش بازتعریف هوش مصنوعی روی دستگاههای مصرفی مثل گوشی، ساعت هوشمند و عینکهای AR هست.
از نظر معماری، مدل یه Encoder با ۱۲ لایه و یه Decoder با ۸ لایه داره. Encoder از Self-Attention گروهبندیشده (GQA) با RoPE استفاده میکنه و جالبه که هیچ لایه FFN (Feed-Forward Network) نداره. Decoder هم از طریق Cross Attention به Encoder وصل میشه و خروجی نهایی فراخوانی ابزار (Tool Call) رو تولید میکنه.
آموزش Needle دو مرحله داشته: پیشآموزش روی ۲۰۰ میلیارد توکن با ۱۶ تا TPU نسل v6e (حدود ۲۷ ساعت)، و بعد پسآموزش (post-training) روی ۲ میلیارد توکن از یه دیتاست تکشات فراخوانی تابع (فقط ۴۵ دقیقه). در حالت تولید، سرعت پردازش به ۶۰۰۰ توکن در ثانیه برای prefill و ۱۲۰۰ برای decode میرسه.
هدف اصلی Needle فراخوانی تابع (function calling) هست — یعنی وقتی کاربر یه سوال میپرسه، مدل میفهمه کدوم ابزار رو با چه آرگومانهایی صدا بزنه. به عنوان مثال:
result = generate(
model, params, tokenizer,
query="What's the weather in San Francisco?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False,
)
print(result)
# [{"name":"get_weather","arguments":{"location":"San Francisco"}}]در این حوزه، Needle از مدلهایی مثل FunctionGemma-270m، Qwen-0.6B، Granite-350m و LFM2.5-350m پیشی گرفته — با اینکه همه اونها پارامترهای بیشتری دارن. البته سازندهها صادقانه اشاره میکنن که اون مدلها ظرفیت گستردهتری دارن و در مکالمههای آزاد بهتر عمل میکنن.
یه نکته جذاب اینه که میشه Needle رو روی Mac یا PC معمولی فاینتیون کرد. یه رابط وب هم وجود داره که با یه دستور ساده needle playground بالا میاد و بهت اجازه میده روی ابزارهای خودت تست و آموزش انجام بدی. وزنهای مدل و کد تولید دیتاست هم به صورت کاملاً آزاد روی HuggingFace منتشر شدن.
نکات کلیدی:
- مدل فقط ۲۶ میلیون پارامتر داره و برای دستگاههای مصرفی (گوشی، ساعت، عینک) طراحی شده
- معماری ابتکاری Simple Attention Network بدون لایه FFN در Encoder
- در تست فراخوانی تابع تکشات از مدلهای بزرگتر پیشی گرفته
- فاینتیون روی Mac/PC ممکنه و رابط وب داره
- وزنهای مدل و دیتاست کاملاً متنباز هستن




