چطور DeepSeek-V4-Pro رو روی GPUهای ارزونتر H20 دووندن
خلاصهٔ کاملتر
DeepSeek-V4-Pro یه مدل عظیم از نوع Mixture-of-Experts (یعنی بهجای فعال کردن کل شبکه، هر بار فقط بخشی از expertهای داخلیش برای هر ورودی به کار میافته) با ۱.۶ تریلیون پارامتره که هم با وزن FP8 و هم FP4 عرضه شده. بهترین سختافزار براش گرافیکهای Blackwell مثل B300ـه، ولی خیلی از تیمها هنوز روی GPUهای قدیمیتر H20 کار میکنن که نه FP4 داره نه HBM به اون بزرگی. تیم LMSys تو این پست میگه چطور با چیدمانهای سرو مختلف همون کارایی رو از H20 در میارن.
نکتهی کلیدی اینه که یه مدل به یه پروفایل سرو ثابت نیاز نداره؛ هر پروفایل بسته به طول context و هدف (تاخیر کم یا throughput بالا) عوض میشه. برای کم کردن فشار حافظه، از Humming MXFP4AFP8 (فشردهسازی وزن expertها به FP4 با محاسبهی آنلاین روی FP8) و Online C128 (نگهداری فشردهتر state مربوط به KV cache) استفاده کردن. ترکیب این دو، ظرفیت توکنهای قابل نگهداری رو تا ۳.۸۸ برابر برای پروفایل DP32-EP32 و تا ۱۰.۱۴ برابر برای PP2-TP8 بالا برده.
برای prefill (پردازش اولیهی ورودی)، بهجای روش معمول MoE-EP از MoE-TP استفاده کردن؛ چون تو MoE-EP بعضی expertها بار بیشتری میگیرن و بقیهی رنکها منتظرشون میمونن. با یکسان کردن محاسبات روی همهی رنکها و فیوز کردن ارتباطات collective، TTFT (زمان تا اولین توکن) رو تا ۱۱.۳۵٪ پایین آوردن. برای decode هم اسپکیولیتیو دیکودینگ DSpark رو روی دو مرحلهی pipeline هماهنگ کردن و کرنلهای MoE رو فیوز کردن، که TPOT (زمان هر توکن خروجی) رو تا ۷۸٪ کم کرده.
نتیجهی نهایی جالبه: روی یه نود تک H20-141GB با batch size ۱، سرعت به ۲۷۱ توکن بر ثانیه رسیده، در مقابل ۳۸۳.۷ توکن بر ثانیه روی B300. یعنی با اینکه B300 حدود ۴۵.۶ برابر توان محاسباتی FP4 بیشتری از H20 داره، فاصلهی عملکرد واقعی به فقط ۱.۴۲ برابر رسیده. برای throughput بالا هم پروفایل DP16-EP16 به ۴.۶۷ هزار توکن خروجی بر ثانیه در هر نود میرسه، با TPOT میانگین ۲۷.۴ میلیثانیه.
نکات کلیدی:
- DeepSeek-V4-Pro مدل MoE با ۱.۶ تریلیون پارامتره، با وزنهای FP8 و FP4
- روی batch size ۱، H20-141GB به ۲۷۱ توکن بر ثانیه رسیده در مقابل ۳۸۳.۷ روی B300 (فاصله فقط ۱.۴۲ برابر)
- ترکیب Humming MXFP4AFP8 و Online C128 ظرفیت KV cache رو تا ۱۰.۱۴ برابر بالا برده
- تغییر از MoE-EP به MoE-TP در prefill، TTFT رو تا ۱۱.۳۵٪ کم کرده
- برای context تا ۱ میلیون توکن، پردازش prefill حدود ۴۳.۷ ثانیه طول میکشه




