پلتفرم Blackwell انویدیا صدرنشین MLPerf Training 6.0 شد
خلاصهٔ کاملتر
انویدیا میگه هر مدل هوش مصنوعی مهمی با یه training run شروع میشه و زیرساختی که این آموزشها روش اجرا میشن، تعیین میکنه که تیمها چقدر سریع میتونن آزمونوخطا کنن و چه مقیاسی از مدل رو بسازن. توی MLPerf Training 6.0 — که آخرین نسخه از یه سری بنچمارک صنعتی دقیق و داوریشده برای سنجش پرفورمنس آموزش هوش مصنوعیـه — پلتفرم Blackwell توی همهی دستهها اول شد.
طبق اعلام انویدیا، این پلتفرم توی هر هفت آزمون سریعترین زمان آموزش رو داشت و تنها پلتفرمی بود که توی همهی بنچمارکهای مجموعه شرکت کرد. این دوره دو ورکلود جدید pretraining مبتنی بر معماری mixture-of-experts یا همون MoE اضافه شده: مدلهای DeepSeek-V3 با ۶۷۱ میلیارد پارامتر و GPT-OSS-20B، که نشون میده این معماری داره روزبهروز مرکزیتر میشه. توی MoE، توکنها باید بین GPUها مسیریابی بشن تا به زیرشبکهی expert درست برسن و همین یه چالش ارتباطی all-to-all میسازه.
انویدیا این دوره نتایجش رو روی دو سیستم rack-scale یعنی GB200 NVL72 و GB300 NVL72 ارائه داد. توی هر سیستم، سوییچهای نسل پنجم NVLink همهی ۷۲ تا GPU رو با پهنای باند بالا به هم وصل میکنن و اونها رو به یه استخر واحد از محاسبه و حافظه تبدیل میکنن، انگار یه GPU غولپیکر واحده. همین مزیت پهنای باند NVLinkـه که آموزش MoE در مقیاس بزرگ رو سریع میکنه.
یه نتیجهی مهم اینه که GB300 NVL72 توی این دوره تا ۱.۶ برابر سریعتر از GB200 NVL72 در همون مقیاس آموزش داد. انویدیا این بهبود رو به قابلیتهای Blackwell Ultra نسبت میده: چگالی محاسباتی بالاتر با روش NVFP4، ظرفیت حافظهی بیشتر و سقف توان بالاتری که به GPU اجازه میده پرفورمنس اوجش رو حفظ کنه. NVFP4 یه روش آموزش با دقت پایینه که پرفورمنس رو بالا میبره ولی دقت مدل رو هم نگه میداره.
از نظر مقیاس، انویدیا روی DeepSeek-V3 671B تا ۸۱۹۲ تا GPU با سیستمهای GB200 NVL72 بالا رفت که بزرگترین آموزش مبتنی بر Blackwell تا امروز توی این بنچمارکه. شریکها هم رکورد زدن: Microsoft Azure آموزش Llama 3.1 405B رو روی ۸۱۹۲ GPU به هدف کیفیت مرجع توی ۷.۰۷ دقیقه رسوند، و CoreWeave روی DeepSeek-V3 671B با ۸۱۹۲ GPU و شبکهی Spectrum-X Ethernet توی فقط ۲.۰۲ دقیقه به هدف رسید.
نویسنده تأکید میکنه توی محیطهای تولیدی که آموزشها هفتهها یا ماهها روی صدها هزار GPU طول میکشه، پایداری هم بهاندازهی پرفورمنس مهمه. انویدیا این رو با دو رویکرد حل میکنه: کمکردن قطعیها با غربال هر GPU توی بیش از ۳۰ مرحلهی تست و مسیریابی خودکار دور نقصها، و بازیابی سریعتر با NVRx که موقع قطعی بهجای ریاستارت کل کار، از آخرین checkpoint ادامه میده. این دوره ۱۹ سازمان مثل Azure، CoreWeave، Dell، Google Cloud و Supermicro هم شرکت کردن.
نکات کلیدی:
- پلتفرم Blackwell انویدیا توی MLPerf Training 6.0 توی همهی دستهها و هر هفت آزمون سریعترین زمان آموزش رو ثبت کرد
- دو ورکلود جدید MoE یعنی DeepSeek-V3 671B و GPT-OSS-20B به مجموعه اضافه شد
- سیستم GB300 NVL72 تا ۱.۶ برابر سریعتر از GB200 NVL72 آموزش میده، بهلطف NVFP4 و حافظه و توان بیشتر
- بزرگترین آموزش روی ۸۱۹۲ تا GPU اجرا شد؛ CoreWeave به هدف DeepSeek-V3 توی ۲.۰۲ دقیقه رسید
- پایداری با غربال سختافزار، مسیریابی خودکار دور نقصها و بازیابی از checkpoint با NVRx تأمین میشه




