NVIDIA Spectrum-X و پروتکل MRC: شبکهسازی نسل بعدی برای کارخانههای هوش مصنوعی
خلاصهٔ کاملتر
آموزش مدلهای زبانی بزرگ به زیرساخت شبکهای نیاز داره که بتونه با هزاران GPU بهطور همزمان کار کنه و کوچکترین اختلالی رو تحمل نکنه. NVIDIA Spectrum-X Ethernet بهعنوان پیشرفتهترین پلتفرم شبکهسازی هوش مصنوعی روز، پاسخ این نیاز رو میده و شرکتهایی مثل OpenAI، Microsoft و Oracle ازش استفاده میکنن.
مهمترین نوآوری معرفیشده روی این بستر، پروتکل MRC یا Multipath Reliable Connection هست؛ یه پروتکل RDMA که به یه اتصال واحد اجازه میده ترافیک رو روی چندین مسیر شبکه توزیع کنه. نتیجه؟ توان عبوری بیشتر، توزیع بار بهتر و دسترسپذیری بالاتر برای کلاسترهای بزرگ AI. تصور کن بهجای یه جادهی یکطرفه، یه شبکهی کامل خیابونی داری که یه اپ هوشمند لحظهبهلحظه بهترین مسیر رو بهت نشون میده.
Sachin Katti، مسئول بخش industrial compute در OpenAI، دربارهی این همکاری گفته: «پیادهسازی MRC در نسل Blackwell خیلی موفق بود و بدون همکاری نزدیک با NVIDIA امکانپذیر نمیشد. رویکرد end-to-end این پروتکل کمک کرد از اکثر کندیها و وقفههای مرتبط با شبکه جلوگیری بشه.» دیتاسنتر Fairwater مایکروسافت و Abilene در Oracle Cloud Infrastructure هم از همین پروتکل برای تأمین نیازهای عملکردی و مقیاسپذیریشون بهره میبرن.
یکی از مهمترین ویژگیهای MRC روی Spectrum-X، failure bypass technology هست که میتونه در چند میکروثانیه خرابی یه مسیر شبکه رو تشخیص بده و ترافیک رو بهصورت خودکار از طریق سختافزار منحرف کنه. در کلاسترهای آموزشی با هزاران GPU که باید همگام باشن، حتی یه وقفهی کوتاه میتونه کل کار رو کند یا متوقف کنه — این قابلیت جلوی همین اتفاق رو میگیره.
علاوه بر این، NVIDIA از Multiplane هم پشتیبانی میکنه؛ یعنی چندین فابریک شبکهی مستقل که هر کدوم یه مسیر ارتباطی جداگانه بین GPUها فراهم میکنن. Spectrum-X با شتابدهی سختافزاری load balancing بین این planes، تأخیر رو پایین نگه میداره و مقیاس رو تا صدها هزار GPU میرسونه. مدیران شبکه هم با ابزارهای telemetry دقیق، کنترل و دید کاملی روی مسیرهای ترافیک دارن.
MRC اول روی سختافزار Spectrum-X بهینه و آزمایش شد و بعد بهعنوان یه استاندارد باز از طریق Open Compute Project منتشر شد. این پروتکل روی NVIDIA ConnectX SuperNICs و سوئیچهای Spectrum-X بهصورت native اجرا میشه. NVIDIA در توسعهی MRC با AMD، Broadcom، Intel، Microsoft و OpenAI همکاری داشته.
نکات کلیدی:
- MRC یه پروتکل RDMA چندمسیرهست که ترافیک رو روی چند لینک شبکه موازی توزیع میکنه
- در صورت خرابی مسیر، failure bypass در چند میکروثانیه توسط سختافزار عمل میکنه
- OpenAI، Microsoft (Fairwater) و Oracle (Abilene) از این پروتکل در بزرگترین AI Factory های دنیا استفاده میکنن
- Multiplane به مقیاسپذیری تا صدها هزار GPU با تأخیر پایین کمک میکنه
- MRC بهعنوان استاندارد باز از طریق Open Compute Project قابل دسترسه
- این اکوسیستم با همکاری AMD، Broadcom، Intel، Microsoft و OpenAI توسعه پیدا کرده




