LLaDA2؛ دیفیوژن در مقیاس ۱۰۰ میلیارد پارامتر
خلاصهٔ کاملتر
تیم Ant Group مجموعهای به اسم LLaDA2.X منتشر کرده که خانوادهای از مدلهای زبانی دیفیوژنی گسسته (dLLM) رو شامل میشه. برخلاف مدلهای اتورگرسیو که توکنها رو یکییکی و به ترتیب میسازن، مدلهای دیفیوژنی متن رو موازی و طی چند مرحلهٔ پالایش تولید میکنن. تو معرفی پروژه اومده که LLaDA2.0 اولین بار این نوع مدل رو به مقیاس ۱۰۰ میلیارد پارامتر رسونده.
این خانواده دو عضو اصلی داره: LLaDA2.0-mini با ۱۶ میلیارد پارامتر و LLaDA2.0-flash با ۱۰۰ میلیارد پارامتر، هر دو با معماری Mixture-of-Experts. به گفتهٔ تیم سازنده، نسخهٔ flash بزرگترین مدل زبانی دیفیوژنی تا امروزه و روی تولید کد و دنبالکردن دستورهای پیچیده عملکرد خوبی نشون میده.
نکتهٔ جذابتر سرعته. با یه مکانیزم دیکود موازی، نسخهٔ LLaDA2.0-flash-CAP (مخفف Confidence-Aware Parallel) تا ۵۳۵ توکن در ثانیه میرسه که حدود ۲.۱ برابر تسریع نسبت به حالت عادی و بهمراتب سریعتر از مدلهای اتورگرسیو همردهست. برای عملی کردن مدل ۱۰۰ میلیاردی، یه موتور اینفرنس اختصاصی روی پایهٔ dInfer و SGLang ساختن که از بازاستفادهٔ KV-Cache و دیکود موازی بلاکی پشتیبانی میکنه.
مسیر پروژه هم ادامه داشته: LLaDA2.1 در فوریهٔ ۲۰۲۶ با ایدهٔ ویرایش توکن سرعت دیفیوژن متن رو بیشتر کرد و LLaDA2.2 در ژوئیهٔ ۲۰۲۶ با ویرایش لِوِنشتاین سراغ کاربردهای ایجنتی رفت. کل پروژه — وزنهای هر دو مدل بههمراه کد آموزش — روی Hugging Face و تحت لایسنس Apache 2.0 منتشر شده، یعنی برای استفادهٔ تجاری هم دستتون بازه.
نکات کلیدی:
- LLaDA2.0 اولین مدل زبانی دیفیوژنی در مقیاس ۱۰۰ میلیارد پارامتر
- دو نسخه: mini با ۱۶B و flash با ۱۰۰B، هر دو MoE
- نسخهٔ flash-CAP با دیکود موازی تا ۵۳۵ توکن در ثانیه و ۲.۱ برابر تسریع
- موتور اینفرنس اختصاصی روی dInfer و SGLang با بازاستفادهٔ KV-Cache
- وزنها و کد آموزش روی Hugging Face، با لایسنس Apache 2.0




