مدلهای QAT جما ۴: فشردهسازی برای موبایل
خلاصهٔ کاملتر
گوگل میگه از وقتی Gemma 4 رو دو ماه پیش منتشر کرده، مدام داره قابلیتهاش رو گسترش میده؛ اول Multi-Token Prediction برای تسریع inference و بعد یه مدل 12B. حالا چکپوینتهای جدیدی با Quantization-Aware Training (QAT) منتشر کرده تا Gemma 4 بازم کارآمدتر بشه و بشه مدلها رو محلی روی دستگاههای لبهی روزمره و GPUهای مصرفی اجرا کرد.
کوانتیزاسیون یعنی کم کردن حجم حافظهی مدل که هم اجرا روی سختافزار مصرفی رو ممکن میکنه و هم سرعت decode رو بالا میبره. مشکل اینه که روش معمول یعنی Post-Training Quantization (PTQ) معمولاً به افت کیفیت منجر میشه. بهجاش QAT فرایند کوانتیزاسیون رو مستقیم تو آموزش ادغام میکنه؛ یعنی حین آموزش، فشردهسازی رو شبیهسازی میکنه تا افت کیفیت موقع فشرده شدن مدل کم بشه. گوگل میگه نتایج QAT کیفیت کلی بالاتری نسبت به baseline استاندارد PTQ میده.
این نسخه شامل چکپوینتهای QAT برای فرمت محبوب Q4_0 و یه فرمت کوانتیزاسیون تازه و مخصوص موبایله. گوگل میگه با این فرمت موبایل، حجم حافظهی Gemma 4 E2B رو به ۱ گیگابایت رسونده.
برای موبایل، گوگل یه schema کوانتیزاسیون سفارشی مهندسی کرده، چون فرمتهای فشردهسازی استاندارد معمولاً برای پردازندههای موبایل سخت اجرا میشن. چند تکنیک کلیدیش اینه: static activations که تنظیمات مقیاسبندی داده رو حین آموزش پیشمحاسبه میکنه تا بار روی تراشهی موبایل کمتر و پاسخها سریعتر بشن؛ channel-wise quantization که دادهی فشرده رو طوری میچینه که با طراحی شتابدهندههای موبایل جور دربیاد؛ و کوانتیزاسیون هدفمند ۲ بیتی که فقط بخشهایی از مدل رو که توکن تولید میکنن تا ۲ بیت فشرده میکنه ولی لایههای اصلی استدلال رو با دقت بالاتر نگه میداره، تا حافظه کم بشه بدون اینکه مدل کمهوشتر بشه.
گوگل همچنین روی embedding و KV cache (یعنی فهرست واژگان مدل و حافظهی کوتاهمدتش) تمرکز کرده تا حافظهی فعال بهشدت کم بشه و بشه گفتوگوهای طولانی داشت. چون انکودرهای صدا و تصویر تو خیلی از کاربردها لازم نیستن، میشه فقط مدالیتههای موردنیاز رو دیپلوی کرد؛ مثلاً مدل متنمحور Gemma 4 E2B بدون Per-Layer Embeddings کمتر از ۱ گیگ حافظه میخواد.
برای شروع هم وزنها همین حالا روی Hugging Face موجودن: فرمتهای GGUF آمادهی llama.cpp و تنسورهای فشرده برای vLLM. مدلها رو میشه محلی روی دسکتاپ با ابزارهایی مثل llama.cpp و Ollama و LM Studio اجرا کرد، یا با LiteRT-LM و Transformers.js روی دستگاه و وب دیپلوی کرد. SGLang و vLLM و MLX (برای Apple Silicon) هم پشتیبانی میشن.
نکات کلیدی:
- گوگل چکپوینتهای QAT برای Gemma 4 منتشر کرد تا نیاز حافظه کم بشه
- QAT کوانتیزاسیون رو حین آموزش شبیهسازی میکنه و افت کیفیت رو نسبت به PTQ کم میکنه
- حجم حافظهی Gemma 4 E2B با فرمت موبایل به ۱ گیگابایت رسیده
- تکنیکهای موبایل: static activations، channel-wise، کوانتیزاسیون ۲ بیتی هدفمند و بهینهسازی KV cache
- وزنها روی Hugging Face موجودن و با llama.cpp، Ollama و LM Studio قابل اجرا روی دسکتاپن




