سرعت ۶ برابری MiniMax-H3 با SGLang
خلاصهٔ کاملتر
تیم SGLang Diffusion همراه Cache-DiT، NVIDIA و Ant Group نتیجهٔ بنچمارک مدل ویدیویی MiniMax-H3 رو روی ۸ تا کارت NVIDIA H200 منتشر کردن. همهچیز ثابت نگه داشته شده: همون پرامپتها، همون seed، رزولوشن ۱۳۴۴×۷۶۸، ۲۴ فریم بر ثانیه و ۵۰ گام denoising (یعنی همون مراحل تکراری که مدل توشون نویز رو کمکم پاک میکنه تا ویدیو در بیاد). خروجیها هم ۵ ثانیهای و ۱۰ ثانیهای بودن.
نقطهٔ شروع، مسیر بدون افت کیفیته: SGLang بدون هیچ تقریبی بین ۱.۸۵ تا ۱.۹۵ برابر از Diffusers سریعتره، یعنی دقیقاً همون محاسبات ولی روی یه رانتایم بهتر. بعد از اون دو تا اهرم پرریسکتر هست. Cache-DiT بعضی گامها رو اصلاً اجرا نمیکنه و نتیجهٔ کششده رو دوباره استفاده میکنه، و SubBlock با اتنشن اسپارس هزینهٔ گامهایی که واقعاً اجرا میشن رو کم میکنه.
ترکیب این دوتا تا ۶.۲۴ برابر میره بالا، ولی رایگان نیست. سریعترین پروفایل تستشده یعنی SubBlock 0.80 بهعلاوهٔ Cache-DiT stride روی T2VA به ۵.۰۶ و ۵.۷۲ برابر میرسه و روی FL2VA به ۵.۸۶ و ۶.۲۴ برابر. هزینهش یکنواخت نیست: FL2VA میانگین SSIM (یعنی معیار شباهت خروجی به ویدیوی مرجع) رو بین ۰.۸۵ تا ۰.۹۱ نگه میداره ولی T2VA تا ۰.۷۶ میاد پایین.
به گفتهٔ تیم SGLang، اگه اولویت کیفیته بهتره فقط Cache-DiT رو روشن کنی: تا ۲.۹۹ برابر سرعت با میانگین SSIM بین ۰.۹۰ تا ۰.۹۲. برای یه حالت متعادل هم SubBlock 0.75 بهعلاوهٔ Cache-DiT stride پیشنهاد میشه که ۴.۹۰ تا ۵.۹۳ برابر سرعت با SSIM بین ۰.۷۹ تا ۰.۹۰ میده. یعنی میتونی بسته به کارت، جای خودت رو روی این طیف انتخاب کنی.
زیر کاپوت سه لایه روی هم سوار میشن. کرنلهای فیوزشده AdaLN، gated residual، SwiGLU و QK RMSNorm همراه با RoPE سهبعدی رو تو کرنلهای کمتری جمع میکنن و رفتوبرگشت حافظه رو کم میکنن؛ روی هر سایت بهتنهایی بین ۲.۰۰ تا ۱۲.۱۶ برابر سریعترن. البته اینا فقط میکروبنچمارکان و مستقیم به سود end-to-end تبدیل نمیشن.
SubBlock هم یه روتر بدون نیاز به آموزشه: دنباله رو به بلاکهای ۶۴ توکنی میشکنه، برای هر بلاک کوئری امتیاز تخمینی هر بلاک کلید رو حساب میکنه و فقط پرامتیازها رو به کرنل block-sparse میده، بدون اینکه ماتریس کامل اتنشن ساخته شه. حواست باشه عدد sparsity سهم بلاکهای دورریختنیه نه نگهداشتنی، پس ۰.۷۵ یعنی حدود ۲۵٪ بلاکها میمونن. ده گام اول هم همیشه اتنشن متراکم اجرا میشه.
نکات کلیدی:
- مسیر بدون افت کیفیت SGLang روی ۸ کارت H200 بین ۱.۸۵ تا ۱.۹۵ برابر از Diffusers سریعتره
- سریعترین پروفایل یعنی SubBlock 0.80 بهعلاوهٔ Cache-DiT stride تا ۶.۲۴ برابر میره، با SSIM بین ۰.۷۶ تا ۰.۹۱
- برای کیفیتمحوری فقط Cache-DiT: تا ۲.۹۹ برابر سرعت با میانگین SSIM ۰.۹۰ تا ۰.۹۲
- کرنلهای فیوزشده روی سایتهای غیر GEMM بین ۲.۰۰ تا ۱۲.۱۶ برابر سریعترن، ولی این عدد میکروبنچمارکه
- پیکربندی تست: SGLang نسخهٔ v0.5.18، رزولوشن ۱۳۴۴×۷۶۸، ۲۴ FPS، ۵۰ گام، اندازهگیری ۱۸ آگوست ۲۰۲۶




