Gemma 4 12B گوگل؛ مدل بازی که رو لپتاپت جا میشه
خلاصهٔ کاملتر
تو این مقاله اومده که رونق هوش مصنوعی مولد قیمت حافظه رو به آسمون رسونده و خود گوگل هم بخشی از این روندِ بالا رفتن قیمته. برای همین نویسنده میگه منطقیه که گوگل چند تا مدل لوکالِ کممصرفتر هم عرضه کنه. تازهترینش Gemma 4 12B هست که جای خالی وسط خانوادهٔ Gemma 4 رو پر میکنه.
آوریل امسال گوگل چهار مدل تو خانوادهٔ Gemma 4 منتشر کرد و همون موقع به لایسنس بازترِ Apache 2.0 سوییچ کرد. اون مدلها شامل دو نسخهٔ بهینه برای موبایل (E2B و E4B) و یه جفت مدل برای کارهای جدیتر (یه مدل ۲۶B از نوع Mixture of Experts و یه مدل ۳۱B از نوع Dense) بودن. این وسط یه فضای خالی نسبتاً بزرگ میموند که مدل جدید دقیقاً همونجا میشینه.
نکتهٔ اصلی اینه که Gemma 4 12B خیلی تواناتر از نسخههای موبایله ولی برای اجرای لوکال به یه شتابدهندهٔ ۲۰ هزار دلاری احتیاج نداره. به گفتهٔ گوگل تا وقتی کامپیوترت ۱۶ گیگابایت رم سیستم یا VRAM داشته باشه، این مدل ۱۲ میلیارد پارامتری کار میکنه. این یعنی حدود نصف حافظهٔ Gemma 4 26B، و گوگل ادعا میکنه دستکم از نظر بنچمارک تقریباً بهاندازهٔ اون تواناست و از پس استدلال چندمرحلهای پیچیده و کارهای ایجنتی برمیاد که قبلاً نسخههای بزرگتر لازم بود.
این مدل علاوه بر این، اولین مدل خانوادهست که قابلیت Multi-Token Prediction یا همون MTP رو بهصورت پیشفرض داره؛ این قابلیت از سیکلهای پردازشی بلااستفاده برای حساب کردن توکنهای احتمالیِ آینده استفاده میکنه و نتیجهاش سرعت و کارایی بیشتره. گوگل نسخههای اختیاری MTP بقیهٔ مدلها رو هم منتشر کرده بود، ولی این اولین باره که از جعبه با MTP میاد.
بخش جالبش روش تازهٔ گوگل برای چندوجهی بودنه. کل خانوادهٔ Gemma 4 ذاتاً چندوجهیه و متن و صدا و تصویر رو بهعنوان ورودی میپذیره. بیشتر مدلها برای ورودی غیرمتنی از انکودرهای جداگانه استفاده میکنن که تأخیر و مصرف حافظه رو بالا میبره. ولی این مدل برای تصویر یه ماژول امبدینگ سادهشده داره و برای صدا اصلاً انکودینگ نداره و سیگنال خام صدا رو مستقیم به همون بردارهای توکنهای متن نگاشت میکنه؛ اینطوری اون انکودرِ سنگینِ واسطه حذف میشه.
نویسنده میگه اگه بخوای این مدل رو امتحان کنی، بدون دانلود هم از طریق ابزارهایی مثل LM Studio و Google AI Edge Gallery در دسترسه. ولی کل ایدهٔ Gemma 4 12B اینه که خودت لوکال اجراش کنی؛ وزنهاش روی Kaggle و Hugging Face آمادهست و حجمش یهکم زیر ۱۸ گیگابایته.
نکات کلیدی:
- Gemma 4 12B جای خالی میان خانوادهٔ Gemma 4 رو پر میکنه و رو لپتاپهای معمولی با ۱۶ گیگ رم اجرا میشه
- حدود نصف حافظهٔ نسخهٔ ۲۶B رو میخواد ولی گوگل میگه از نظر بنچمارک تقریباً بهاندازهٔ اون تواناست
- اولین مدل خانوادهست که Multi-Token Prediction رو بهصورت پیشفرض داره
- با حذف انکودر جداگانه برای تصویر و صدا، تأخیر و مصرف حافظه رو کم کرده
- وزنها با لایسنس Apache 2.0 روی Kaggle و Hugging Face و حجم حدود ۱۸ گیگ در دسترسه




