جما ۴ 12B؛ هوش چندوجهی روی لپتاپ
خلاصهٔ کاملتر
گوگل از جما ۴ 12B رونمایی کرد، جدیدترین مدل خانوادهٔ جما که هدفش بردن هوش چندوجهی و agentic مستقیم رو لپتاپه. این مدل بین مدل سبک E4B و مدل پیشرفتهتر 26B (که یه Mixture of Experts هست) قرار میگیره و قابلیتهای قوی رو با مصرف حافظهٔ کمتر بستهبندی میکنه. به گفتهٔ گوگل، این اولین مدل میانردهٔ اوناست که ورودی صوتی بومی داره.
مهمترین چیزی که این مدل رو متمایز میکنه، معماری بدون انکوردره. مدلهای چندوجهی معمولی برای پردازش تصویر و صدا انکودرهای جداگانه دارن که ورودی رو قبل از تحویل به مدل زبانی ترجمه میکنن؛ ولی همین انکودرهای جدا هم تأخیر اضافه میکنن و هم حافظه بیشتری میخورن. تو این مدل گوگل این انکودرها رو حذف کرده و ورودی صدا و تصویر مستقیم وارد بدنهٔ مدل زبانی میشه.
به گفتهٔ نویسندهها، برای بخش تصویر، انکودر بینایی جما ۴ با یه ماژول embedding سبک جایگزین شده که فقط از یه ضرب ماتریسی، positional embedding و نرمالسازی تشکیل شده و خود مدل زبانی پردازش بصری رو به عهده میگیره. برای صدا هم کار حتی سادهتره: انکودر صوتی کلاً حذف شده و سیگنال خام صدا مستقیم به همون فضای ابعادی توکنهای متنی نگاشت میشه.
از نظر کارایی، گوگل میگه عملکرد این مدل تو بنچمارکهای استاندارد به مدل بزرگتر 26B نزدیکه، ولی با کمتر از نصف ردپای حافظه. همین باعث میشه با ۱۶ گیگ رم یا حافظهٔ یکپارچه رو لپتاپهای معمولی اجرا بشه و تجربههای چندوجهی و agentic رو مستقیم رو دستگاه خودت بیاره.
مدل با لایسنس Apache 2.0 منتشر شده و وزنهاش رو Hugging Face و Kaggle قابل دانلوده. ابزارهایی مثل LM Studio، Ollama، llama.cpp، MLX، vLLM و Hugging Face Transformers پشتیبانیش میکنن. یه ویژگی دیگهش هم drafterهای Multi-Token Prediction هست که برای کم کردن تأخیر اومده. خانوادهٔ جما ۴ تا الان از مرز ۱۵۰ میلیون دانلود رد شده.
نکات کلیدی:
- مدل چندوجهی جدید گوگل با معماری بدون انکودر؛ تصویر و صدا مستقیم وارد مدل زبانی میشن
- با ۱۶ گیگ رم رو لپتاپ معمولی اجرا میشه و کاراییش به مدل 26B نزدیکه
- اولین مدل میانردهٔ جما با ورودی صوتی بومی
- لایسنس باز Apache 2.0 و پشتیبانی LM Studio، Ollama، vLLM و llama.cpp
- drafterهای Multi-Token Prediction برای کاهش تأخیر




