vLLM 0.28 اومد: سرعت بیشتر برای مدلهای بزرگ
خلاصهٔ کاملتر
vLLM، موتور سرو کردن مدلهای زبانی، نسخهٔ 0.28.0 رو منتشر کرد: ۵۸۴ کامیت از ۲۷۰ مشارکتکننده که ۷۶ نفرشون تازهواردن. تو یادداشت انتشار اومده که سنگینترین بخش کار، یه تلاش بزرگ برای بهینهسازی Kimi-K3 تو کل استک بوده.
برای Kimi-K3 چیزهایی مثل Decode Context Parallel، کرنلهای fused برای مرحلهٔ decode و prefill و ترکیب all-gatherها اضافه شده که تو سطح کرنل ۱.۵ تا ۳ برابر سریعتره. یه بودجهٔ تطبیقی برای توکنهای speculative هم حدود ۶۰ درصد TTFT رو بهتر کرده، یعنی زمان تا رسیدن اولین توکن خروجی. شاردینگ اختیاری اکسپرت مشترک هم حدود ۱۷ گیگابایت حافظه به ازای هر GPU آزاد میکنه، و Kimi-K3 حالا روی ROCm با model runner نسخهٔ ۲ هم اجرا میشه.
برای DeepSeek V4 هم sparse MLA سرتاسری کار میکنه: هم تو decode ساده، هم MTP و هم speculative decoding با DSpark. پشتیبانی AMD Quark NVFP4 و اجرا روی gfx11 و gfx950 هم اضافه شده. خود Model Runner V2 پختهتر شده و جداسازی E/P/D، آفلود وزنها، CUDA graph برای encoder و پشتیبانی thinking_token_budget بهش رسیده.
یه بخش قابل توجه دیگه آفلود لایهای KV cacheه: حالا میشه روی دیسک آفلود کرد، مدیر لایهٔ دوم رو از بیرون پروژه با module_path وصل کرد و متریکهای آفلود رو دید. پیشفرضها هم عوض شدن: max_num_batched_tokens از ۸۱۹۲ به ۱۶۳۸۴ رفته، prefix caching برای مدلهای Mamba پیشفرض روشن شده و سقف پیشفرض ضبط CUDA graph روی Blackwell به ۱۰۲۴ رسیده.
قبل از آپدیت حواستون به تغییرات شکننده باشه: پشتیبانی bitsandbytes به یه پلاگین بیرون از درخت منتقل شده، نسخهٔ Transformers به 5.15.0 رفته، و calculate_kv_scales و override_attention_dtype حذف شدن. تو بخش امنیت هم یه DoS که با جعل sample rate از محدودیت مدت دیکود صدا رد میشد بسته شده و مستندات هشدار داده که --api-key جلوی همهٔ endpointها رو نمیگیره.
نکات کلیدی:
- نسخهٔ 0.28.0 شامل ۵۸۴ کامیت از ۲۷۰ مشارکتکنندهست که ۷۶ نفرشون اولین مشارکتشون بوده.
- ترکیب all-gatherها برای Kimi-K3 تو سطح کرنل ۱.۵ تا ۳ برابر سریعتر شده و شاردینگ اکسپرت مشترک حدود ۱۷ گیگابایت حافظهٔ هر GPU رو آزاد میکنه.
- مقدار پیشفرض max_num_batched_tokens از ۸۱۹۲ به ۱۶۳۸۴ رسیده و prefix caching برای مدلهای Mamba پیشفرض روشن شده.
- آفلود KV cache روی دیسک و اتصال مدیر لایهٔ دوم از بیرون پروژه با module_path اضافه شده.
- تغییرات شکننده: bitsandbytes به پلاگین out-of-tree منتقل شد، Transformers به 5.15.0 رفت، و calculate_kv_scales و override_attention_dtype حذف شدن.




