DFlash؛ نسل بعدی speculative decoding برای سرعت بیشتر LLM
خلاصهٔ کاملتر
مشکلی که این مقاله دربارش حرف میزنه اینه که مدلهای زبانی بهخاطر ماهیت autoregressive شون کند کار میکنن؛ توکنها یکییکی تولید میشن و این برای سختافزار مدرن بهینه نیست. راهحل کلاسیک، speculative decoding ـه: یه مدل کوچیک و سریع (drafter) چند توکن رو حدس میزنه و مدل اصلی همهشون رو یکجا و موازی تأیید میکنه، بدون اینکه کیفیت خروجی عوض بشه.
به گفتهی نویسندهها، مشکل روشهای قبلی مثل EAGLE و MTP اینه که خودِ مدل drafter هم بازم autoregressive ـه و توکنهای پیشنویس رو دونهدونه میسازه. DFlash که تو Z Lab ساخته شده، بهجاش از یه مدل block diffusion استفاده میکنه که یه بلوک کامل از توکنها رو تو یه forward pass میسازه — دقیقاً همون چیزی که GPU و TPU دوست دارن.
ایدهی کلیدی اینه که مدل اصلی، context رو بهتر از هر کسی میشناسه. برای همین DFlash نمایشهای داخلی (hidden representations) توکنهای context رو از مدل اصلی میگیره و مستقیم توی KV cache ـه مدل drafter تزریق میکنه. اینجوری drafter لازم نیست کل context رو از صفر مدل کنه و فقط روی پیشبینی بلوک بعدی تمرکز میکنه، پس هم کوچیک میمونه هم acceptance length بالا میگیره.
نویسندهها میگن سرعت speculative decoding به دو چیز بستگی داره: چند تا توکن پیشنویس قبول میشن و مدل drafter چقدر هزینهی اضافه میذاره. DFlash هر دو رو بهتر میکنه؛ دیفیوژن هزینهی drafting رو میاره پایین و تزریق KV نرخ پذیرش رو میبره بالا. توی تستهاشون یه drafter پنجلایهی DFlash روی GSM8K به speedup ۳.۳ برابری میرسه، در حالی که EAGLE-3 با همون acceptance length فقط ۲.۱ برابر میگیره.
بخش مهم دیگه، رسوندن این تکنیک از تحقیق به production ـه. تیمهای Modal و SGLang با Z Lab کار کردن تا DFlash رو توی موتور جدید Spec V2 ـه SGLang پیاده کنن. این موتور با کمکردن نقاط همگامسازی بین host و device (چیزی که به گفتهی نویسنده performance رو نابود میکنه) و با overlap scheduling، تو یه تست روی Qwen 3-8B بیش از ۳۳٪ بهبود throughput داده.
نکات کلیدی:
- DFlash با block diffusion یه بلوک کامل توکن پیشنویس رو موازی میسازه، نه دونهدونه
- تزریق نمایشهای مدل اصلی توی KV cache ـه drafter باعث میشه drafter کوچیک ولی دقیق بمونه
- روی Qwen 3.5 397B به بیش از ۴.۳ برابر throughput ـه baseline و ۱.۵ برابر MTP رسیده
- حالا بهصورت پیشفرض توی موتور Spec V2 ـه SGLang در دسترسه و مدلش روی Hugging Face منتشر شده




