راهنمای ساخت یک مدل زبانی دیفیوژنی
خلاصهٔ کاملتر
این مقاله یک مرور آموزشیه از اینکه diffusion language model (مدلی که بهجای تولید توکنبهتوکن، کل دنباله رو چند بار پالایش میکنه) چطور ساخته میشه. نویسندهها میگن مطلب رو از سخنرانیهاشون تو ICLR 2026 و MLSS 2026 درآوردن. نقطهٔ شروعشون ایراد مدلهای autoregressive ـه: توکن که بیرون اومد دیگه اصلاح نمیشه، تولید به تعداد توکنها مرحله لازم داره، و attention فقط به عقب نگاه میکنه.
ایدهٔ اصلی از دیفیوژن تصویر میاد: یک forward process که کمکم به داده نویز اضافه میکنه و یک reverse process که یاد میگیره همون مسیر رو برعکس بره. برای متن مشکل اینه که نویز گاوسی روی توکنهای گسسته اصلاً تعریف نمیشه. جوابی که تو مقاله اومده masking ـه: masked diffusion در عمل همون BERT ـه ولی با نرخ ماسک تصادفی، یعنی یک BERT مولد. موقع تولید هم از یک دنبالهٔ کاملاً ماسکشده شروع میکنی و هر دور جاهای خالی رو پر و بعد کمی از توکنها رو دوباره ماسک میکنی.
نویسندهها میگن این مدل ساده برای فهمیدن خوبه ولی محصولی نیست: طول خروجی ثابته، اصلاح خطا نداره و بدون post-training سریع نیست. block diffusion دیفیوژن رو روی بلوکهای دنباله انجام میده تا هم طول متغیر ممکن بشه و هم KV caching (نگه داشتن محاسبات بلوکهای قبلی برای استفادهٔ دوباره) کار کنه. معماری encoder-decoder هم انکودر رو برای نمایش توکنهای تمیز و یک دیکودر سبک رو برای پالایش میذاره، که همین هستهٔ Gemma Diffusion و Nemotron Diffusion ـه.
برای اصلاح خطا دو راه توضیح داده شده. اولی remasking ـه: هر مرحله چندتا از توکنهای بازشده رو دوباره ماسک میکنی تا فرصت اصلاح پیدا کنن، و این رو میشه بهعنوان سمپلر روی مدلهای آمادهٔ MDLM هم سوار کرد. راه دوم uniform state diffusion ـه که اصلاً ماسک نداره و بهجاش توکنها رو با توکن تصادفی عوض میکنه، پس هر توکنی در هر مرحله قابل بازنویسیه. مدل متنباز Gemma Diffusion از همین نوع دومه.
سرعت حرف اصلی این خانوادهست: چون هر مرحله میتونه چند توکن بسازه، تولید میتونه ۵ تا ۱۰ برابر سریعتر از autoregressive باشه و با distillation تعداد مراحل رو مرحلهبهمرحله نصف میکنن. Mercury اولین دیفیوژن LLM تجاریه و بالای ۱۰۰۰ توکن بر ثانیه روی GPU معمولی میده. تو علوم زیستی هم ESM3 این رویکرد رو تا ۱۰۰ میلیارد پارامتر روی پروتئین و Nucleotide Transformer v3 روی بیش از یک تریلیون توکن DNA بزرگ کردن.
نکات کلیدی:
- masked diffusion در عمل BERT با نرخ ماسک تصادفیه، ولی برخلاف BERT مولده
- block diffusion طول متغیر خروجی و KV caching رو ممکن میکنه
- remasking اجازه میده توکن اشتباه دوباره ماسک و بعد اصلاح بشه
- Gemma Diffusion روی uniform state diffusion بنا شده، نه روی ماسک
- Mercury 2 با مدلهای سریعی مثل Claude Haiku و Gemini Flash-Lite رقابت میکنه با ۵ تا ۱۰ برابر سرعت
- ESM3 تا ۱۰۰ میلیارد پارامتر روی پروتئین رفته و LLaDA نسخهٔ متنباز ۸ میلیاردیه




