DiffusionGemma؛ تولید متن تا ۴ برابر سریعتر
خلاصهٔ کاملتر
گوگل مدل جدیدی به اسم DiffusionGemma معرفی کرده؛ یه مدل آزمایشی و متنباز که سراغ روش text diffusion برای تولید متن رفته. این مدل با لایسنس Apache 2.0 منتشر شده و یه مدل MoE (ترکیبی از کارشناسها) با ۲۶ میلیارد پارامتره. نکتهٔ اصلی اینه که برخلاف مدلهای زبانی معمول که توکنها رو پشتسرهم و یکییکی میسازن، این مدل کل بلوکهای متن رو همزمان تولید میکنه و روی GPU تا ۴ برابر سریعتر میشه.
به گفتهٔ گوگل این مدل روی پایهٔ خانوادهٔ Gemma 4 و تحقیقات Gemini Diffusion ساخته شده و یه «diffusion head» تازه داره که برای بیشینه کردن سرعت طراحی شده. تو این مطلب اومده که مدلهای autoregressive معمولی Gemma 4 هنوز استاندارد خروجی باکیفیت برای محیط واقعی هستن، ولی DiffusionGemma بیشتر برای پژوهشگرها و توسعهدهندههاییه که دنبال کارهای محلی و تعاملی سرعتمحورن؛ مثل ویرایش درجا (in-line editing)، تکرار سریع و ساختن متنهای غیرخطی.
چند تا عدد و مزیت کلیدی هم اعلام شده. مدل با جابهجا کردن گلوگاه از پهنایباند حافظه به محاسبات، روی NVIDIA H100 بالای ۱۰۰۰ توکن در ثانیه و روی RTX 5090 بالای ۷۰۰ توکن در ثانیه میرسه. با اینکه ۲۶ میلیارد پارامتر داره، موقع اجرا فقط ۳.۸ میلیارد پارامترش فعال میشه، برای همین کوانتایز شده تو ۱۸ گیگابایت VRAM کارتهای مصرفی ردهبالا جا میشه.
یه ویژگی مهم دیگهاش توجه دوطرفه (bi-directional attention)ـه: مدل تو هر گذر ۲۵۶ توکن رو موازی تولید میکنه و هر توکن میتونه به بقیه نگاه کنه. همین باعث میشه تو کارهای غیرخطی مثل پر کردن وسط کد (code infilling) یا توالیهای ریاضی خیلی بهتر عمل کنه. مدل خروجی خودشو هم مرحلهبهمرحله بازبینی و اصلاح میکنه. نمونهاش اینه که Unsloth این مدل رو برای حل سودوکو فاینتیون کرده؛ کاری که مدلهای معمولی توش لنگ میزنن چون هر توکن به توکنهای بعدی وابستهست.
نویسنده توضیح میده چرا اصلاً diffusion برای متن؟ مدلهای معمولی مثل ماشینتحریر کلمهبهکلمه از چپ به راست متن میسازن. تو فضای ابری این روش کاراست چون سرور هزاران درخواست کاربر رو با هم دسته (batch) میکنه، ولی وقتی محلی و برای یه کاربر اجرا میشه، GPU بیشتر وقتش رو منتظر «توکن بعدی» میمونه و دستنخورده میمونه. DiffusionGemma بهجاش یه پاراگراف ۲۵۶ توکنی رو یکجا پیشنویس میکنه و سختافزار رو کامل به کار میگیره؛ مثل اینکه بهجای ماشینتحریر، یه چاپخونه کل بلوک متن رو یکجا مهر میزنه.
روش کارش شبیه مدلهای تولید تصویره: اول از یه بوم پر از توکنهای تصادفی شروع میکنه، بعد تو چند گذر توکنهای درست رو قفل میکنه و ازشون بهعنوان سرنخ برای اصلاح بقیه استفاده میکنه، تا متن نهایی شکل بگیره. گوگل میگه چون مدل کل پاراگراف رو همزمان میبینه، میتونه مثلاً قالببندی پیچیدهٔ Markdown رو بینقص ببنده یا کد رو تقریباً همون لحظه تولید و رندر کنه. در مقابل، خود گوگل تأکید میکنه که کیفیت کلی خروجیاش از Gemma 4 معمولی پایینتره و برای کاربردهایی که حداکثر کیفیت میخوان، بهتره همون Gemma 4 استاندارد استفاده شه. وزنهای مدل روی Hugging Face در دسترسه و با ابزارهایی مثل MLX، vLLM و Transformers سرو میشه.
نکات کلیدی:
- DiffusionGemma یه مدل متنباز و آزمایشیه که با روش text diffusion متن تولید میکنه
- بهجای کلمهبهکلمه، یه بلوک ۲۵۶ توکنی رو همزمان میسازه و روی GPU تا ۴ برابر سریعتره
- مدل MoE با ۲۶ میلیارد پارامتره که موقع اجرا فقط ۳.۸ میلیارد فعال میشه و تو ۱۸ گیگ VRAM جا میشه
- توجه دوطرفه باعث میشه تو کارهای غیرخطی مثل code infilling بهتر عمل کنه
- کیفیت خروجیاش از Gemma 4 معمولی پایینتره و بیشتر برای کارهای محلی و سرعتمحوره




