Gemma 4 سریعتر شد: معرفی MTP Drafter با سرعت ۳ برابری
خلاصهٔ کاملتر
چند هفته پیش گوگل مدلهای Gemma 4 رو معرفی کرد که تو همون هفتههای اول بیشتر از ۶۰ میلیون بار دانلود شدن. حالا گوگل یه قدم بزرگ دیگه برای بهینهتر کردن این مدلها برداشته و MTP Drafter رو برای خانواده Gemma 4 منتشر کرده. این ابزار با کمک یه معماری تخصصی از speculative decoding، تا ۳ برابر سرعت بیشتر رو بدون هیچ افتی در کیفیت خروجی فراهم میکنه.
اصل مشکلی که MTP حل میکنه اینه که inference مدلهای زبانی بزرگ بهطور ذاتی محدود به پهنای باند حافظه هست. پردازنده باید برای تولید هر توکن، میلیاردها پارامتر رو از VRAM به واحدهای محاسباتی منتقل کنه. این باعث میشه compute زیادی بلااستفاده بمونه و تأخیر خیلی بالا بره، مخصوصاً روی سختافزارهای مصرفکننده.
Speculative Decoding این گلوگاه رو باز میکنه. ایده اینه که به جای اینکه مدل سنگین (مثلاً Gemma 4 31B) هر توکن رو به تنهایی تولید کنه، یه مدل سبکوزن کنارش قرار میگیره که چند توکن بعدی رو پیشبینی میکنه. مدل اصلی بعد همه این پیشنهادها رو بهصورت موازی تأیید میکنه. اگه مدل اصلی با draft موافق باشه، کل دنباله رو در یه forward pass قبول میکنه و یه توکن اضافه هم خودش تولید میکنه. یعنی در زمانی که معمولاً یه توکن تولید میشد، حالا چند توکن آمادهست.
برای توسعهدهندهها این یعنی:
- کاهش چشمگیر تأخیر برای چت نزدیک به real-time، اپلیکیشنهای صوتی و agentic workflowها
- اجرای مدلهای 26B و 31B روی کامپیوترهای شخصی و GPUهای مصرفکننده با سرعت بالا
- بهبود عملکرد on-device برای مدلهای edge (E2B و E4B) که باعث صرفهجویی در باتری هم میشه
- بدون افت کیفیت، چون مدل اصلی همچنان تأیید نهایی رو انجام میده
از نظر فنی، مدلهای draft بهصورت یکپارچه از activation های مدل target استفاده میکنن و KV cache رو با هم به اشتراک میذارن؛ یعنی نیازی به محاسبه مجدد context نیست. برای مدلهای edge هم یه تکنیک clustering کارآمد در لایه embedder پیادهسازی شده تا گلوگاه محاسبه logit رو کم کنه.
گوگل همچنین بهینهسازیهای مخصوص سختافزار رو هم بررسی کرده. مثلاً روی Apple Silicon با batch size 1، مدل 26B MoE چالشهایی در routing داره، ولی با افزایش batch size به ۴ تا ۸، سرعت تا ۲.۲ برابر بیشتر میشه. نتیجه مشابهی هم روی NVIDIA A100 با batch size بالاتر دیده شده.
این MTP Drafterها الان با همون لایسنس Apache 2.0 در کنار مدلهای Gemma 4 منتشر شدن و میشه وزنهای مدل رو از Hugging Face و Kaggle دانلود کرد. پشتیبانی از ابزارهایی مثل transformers، MLX، vLLM، SGLang و Ollama هم وجود داره. برای موبایل هم از طریق Google AI Edge Gallery روی اندروید و iOS قابل تست هست.
نکات کلیدی:
- MTP Drafter برای Gemma 4 با تکنیک speculative decoding تا ۳ برابر سرعت تولید توکن رو بیشتر میکنه
- یه مدل سبکوزن چند توکن بعدی رو پیشبینی میکنه و مدل اصلی همهشون رو موازی تأیید میکنه
- KV cache بین مدل draft و target به اشتراک گذاشته میشه تا محاسبات تکراری حذف بشه
- بدون هیچ افتی در کیفیت خروجی و استدلال مدل
- با لایسنس Apache 2.0 روی Hugging Face، Kaggle و ابزارهایی مثل vLLM و Ollama در دسترسه
- روی Apple Silicon با batch size بالاتر تا ۲.۲ برابر سرعت بیشتر حاصل میشه




