مدلاکسپرس انویدیا؛ کوتاهکردن زمان لود وزن مدلهای غولپیکر
خلاصهٔ کاملتر
به گفتهٔ انویدیا، جابهجاکردن وزن مدلها تو کلاستر یه هزینهٔ تکرارشوندهست: چه موقع کولداستارت، چه موقع اسکِیلشدن و آپدیتهای تدریجی، چه موقع پستترینینگِ RL. ModelExpress (بهاختصار MX) برای همین ساخته شده و ایدهٔ اصلیش اینه که قبل از لود مدل، اول دنبال نزدیکترین و سریعترین منبع وزن بگرده بهجای اینکه هر رپلیکا رو یه کولداستارت مستقل حساب کنه.
وقتی یه رپلیکای در حال سرویس، وزنهای سازگار رو تو GPU داشته باشه، MX اونها رو مستقیم از GPU به GPU و روی مسیر P2P RDMA با کتابخونهٔ NIXL منتقل میکنه و کلاً استوریج آبجکت، دیسک محلی و حافظهٔ هاست رو دور میزنه. اگه هیچ رپلیکایی در دسترس نباشه، از سریعترین مسیر ممکن (مثل استریم از آبجکتاستوریج بدون نشستن روی دیسک) بوتاسترپ میکنه.
نتیجهش چشمگیره: تو یه تست روی نودِ 8xB200، انتقال وزنهای DeepSeek-V4 Pro و کش کرنل JIT از یه رپلیکای فعال به یه رپلیکای تازه زیر ۱۰ ثانیه طول کشید و کل زمان استارت از ۸ دقیقه به ۱ دقیقه و ۴۴ ثانیه رسید. علاوه بر وزنها، MX میتونه کرنلهای کامپایلشده رو هم به رپلیکاهای بعدی به ارث بده تا مرحلهٔ گرمشدن (warmup) دوباره تکرار نشه.
به گفتهٔ نویسنده، MX یه سری قابلیت دیگه هم داره: درخواستهای دانلود همزمان چند رپلیکا رو تو یه دانلود هماهنگ جمع میکنه تا کلاستر فقط یه بار هزینهٔ دانلود بیرونی رو بده، و برای پستترینینگِ RL هم که وزنها هر استپ عوض میشن مکانیزم refit داره. MX با vLLM و SGLang یکپارچه شده و فریمورکهای Dynamo و llm-d رو هم پشتیبانی میکنه.
نکات کلیدی:
- ModelExpress (MX) ابزار انویدیا برای کمکردن زمان لود وزن مدلهای بزرگه
- بهجای کولداستارت مستقل، وزن رو از سریعترین منبع (ترجیحاً یه رپلیکای فعال) میگیره
- انتقال مستقیم GPU به GPU روی P2P RDMA با NIXL، بدون عبور از دیسک و حافظهٔ هاست
- استارت DeepSeek-V4 Pro از ۸ دقیقه به ۱ دقیقه و ۴۴ ثانیه رسید
- کش کرنلهای کامپایلشده رو هم منتقل میکنه و با vLLM، SGLang، Dynamo و llm-d کار میکنه




