انویدیا؛ بزرگترین ناشر مدلهای باز دنیا
خلاصهٔ کاملتر
این مقاله حاصل گفتوگو با Bryan Catanzaro، معاون تحقیقات یادگیری عمیق کاربردی انویدیاست و به یه نکتهٔ کمتر شنیدهشده میپردازه: شرکتی که با GPU شناخته میشه، بزرگترین ناشر مدلهای باز دنیا هم هست و مدلهاش جزو پردانلودترینهای Hugging Face هستن. این خانواده دو سر طیف رو پوشش میده؛ یه سرش مدلهای استدلالی Nemotron که با نسل سوم تو سه اندازهٔ Nano و Super و Ultra اومدن، سر دیگهش هوش مصنوعی فیزیکی.
تو سمت فیزیکی، مدل جهانی Cosmos بهجای پیشبینی کلمهٔ بعدی، حالت بعدی جهان رو با توجه به یه کنش پیشبینی میکنه؛ همین باعث میشه بشه باهاش برای موقعیتهای خطرناک یا گرون، دیتای آموزشی ساخت. Isaac GR00T برای رباتهای انساننما از Cosmos بهعنوان هستهٔ استدلال استفاده میکنه و Alpamayo هم همون پایه رو برای رانندگی خودران به کار میبره. کنارشون BioNeMo برای زیستشناسی و کشف دارو، Ising برای کوانتوم و Earth-2 برای اقلیم قرار دارن.
شعار تیم به گفتهٔ Catanzaro اینه که «سریعترین مدل، باهوشترین مدله»، چون سرعت تو هر مرحله به توانایی تبدیل میشه. برای همین بیشتر لایهها Mamba ـه که ورودی رو یکبار میخونه و تو حافظهای با اندازهٔ ثابت فشرده میکنه، و فقط چند لایهٔ attention لای اونها میمونه تا دقت بازیابی جزئیات حفظ بشه. روی این پایه، لایههای MoE هر توکن رو فقط به چند متخصص کوچیک میسپرن تا ظرفیت کل بالا بمونه ولی هزینهٔ هر توکن پایین بیاد.
انتخاب دوم جاییه که دو کسبوکار انویدیا به هم میرسن: مدلهای بزرگتر از همون قدم اول با فرمت عددی ۴ بیتی NVFP4 آموزش دیدن، چون تیم میدونست نسل بعدی GPU یعنی Blackwell با سختافزار سریع ۴ بیتی ساخته میشه. مرحلهٔ بعدی، پسآموزش با یادگیری تقویتیه و چون مدلها ارزونتر اجرا میشن، این مرحله رو میشه خیلی گستردهتر جلو برد. به گفتهٔ نویسنده گلوگاه واقعی نه دیتاست نه محاسبات، بلکه تنوع محیطهاییه که مدل توشون تمرین میکنه.
دربارهٔ اینکه چرا یه سازندهٔ تراشه همهچیز رو رایگان میده، دو دلیل مطرح میشه: برای طراحی سختافزار آینده باید بدونی هوش مصنوعی کجا میره و مطمئنترین راهش ساختن مدل و دادنش دست کاربر واقعیه؛ و دوم اینکه رشد انویدیا به رشد کل اکوسیستم گره خورده، پس هر تیمی که روی این مدلها بسازه مشتری بالقوهٔ محاسباته. باز بودن اینجا فقط انتشار وزن نیست: دیتاستهای آموزش و پسآموزش، محیطهای RL و دستور پخت هم منتشر میشن و لایسنس هم به OpenMDW بنیاد لینوکس منتقل شده.
نکات کلیدی:
- Nemotron برای استدلال، Cosmos برای جهان فیزیکی و GR00T برای رباتهای انساننما، همه با یه پایهٔ مشترک
- معماری هیبریدی Mamba بهعلاوهٔ چند لایه attention، پنجرهٔ کانتکست میلیونتوکنی رو عملی میکنه
- لایههای MoE ظرفیت زیاد رو با هزینهٔ کم هر توکن ترکیب میکنن
- آموزش ۴ بیتی NVFP4 نتیجهٔ همطراحی همزمان مدل و تراشهٔ Blackwell بوده
- گلوگاه بهبود مدلها تنوع محیطهای تمرین اعلام شده، نه دیتا و نه محاسبات
- «باز» یعنی دیتا و دستور پخت و محیطها، نه فقط فایل وزنها




