DiffusionGemma؛ مدلی که متن رو موازی مینویسه
خلاصهٔ کاملتر
تیم DiffusionGemma تو گزارش فنیاش از یه مدل زبانی آزمایشی با وزنهای باز رونمایی کرده که متن رو با دیفیوژن گسسته تولید میکنه. بهجای اینکه مثل مدلهای اتورگرسیو (AR) هر بار یه توکن بسازه، بلوکهایی به طول ۲۵۶ توکن رو برمیداره و طی چند مرحله بهصورت موازی پالایش میکنه تا به متن نهایی برسه. نویسندهها میگن هدف دقیقاً دور زدن همون گلوگاه دیکد ترتیبیه که سرعت مدلهای امروزی رو محدود میکنه.
نکتهٔ جالب اینه که مدل از صفر آموزش ندیده. به گفتهٔ تیم، اونها Gemma 4 رو که یه مدل mixture-of-experts با ۳.۸ میلیارد پارامتر فعال از مجموع ۲۵.۲ میلیارده فاینتیون کردن. خط لولهٔ آموزش دو مرحله داره: مرحلهٔ اول با فاینتیون نظارتشده به مدل یاد میده نویززدایی دوطرفه انجام بده، و مرحلهٔ دوم یادگیری تقویتی رو با sampler distillation ترکیب میکنه تا هم کیفیت تولید بهتر شه هم کارایی استنتاج.
همهٔ این کار با کمتر از ۱۰٪ کل بودجهٔ توکن آموزشیِ مدل AR اولیه انجام شده، یعنی از نظر محاسباتی نسبتاً ارزون تموم شده. تو ارزیابیها هم مدل بهطور میانگین حدود ۲۰ توکن در هر forward pass تولید میکنه و روی یه کارت NVIDIA H100 به چیزی حدود ۱۵۰۰ توکن در ثانیه میرسه؛ عددی که به گفتهٔ نویسندهها حتی از مدلهای AR با بهترین روشهای دیکد گمانهزنانه (speculative decoding) هم بهشکل محسوسی جلوتره.
تیم ادعا میکنه DiffusionGemma یه مرز پارتوی تازه برای توازن بین سرعت تولید و توانایی مدل میسازه. مدل قابلیتهای نسخهٔ پایه مثل حالت تفکر، ورودی چندوجهی و کانتکست بلند رو هم نگه داشته. جالبتر اینکه با وجود فاینتیون دیفیوژنی، هنوز میتونه به سبک اتورگرسیو هم تولید کنه و فقط افت کمی داره؛ چیزی که به نظر نویسندهها راه رو برای دیکد ترکیبی دیفیوژن-AR باز میکنه.
نکات کلیدی:
- تولید متن با دیفیوژن گسسته روی بلوکهای ۲۵۶ توکنی بهجای دیکد توکنبهتوکن
- ساختهشده با فاینتیون Gemma 4 (۳.۸ میلیارد پارامتر فعال از ۲۵.۲ میلیارد)
- آموزش دومرحلهای: نویززدایی دوطرفه، بعد یادگیری تقویتی بههمراه sampler distillation
- کمتر از ۱۰٪ بودجهٔ توکن آموزش مدل پایه مصرف شده
- حدود ۲۰ توکن در هر forward pass و نزدیک ۱۵۰۰ توکن در ثانیه روی یک H100
- حفظ حالت تفکر، ورودی چندوجهی و کانتکست بلند، بهعلاوهٔ امکان تولید اتورگرسیو




