نموترون ۳.۵ لایتنینگ؛ مدلی برای کارهای تکراری ایجنتها
خلاصهٔ کاملتر
انویدیا مدل نموترون ۳.۵ لایتنینگ رو با وزنهای باز منتشر کرده؛ یه مدل ترکیبیازمتخصصها (MoE) با ۳۰ میلیارد پارامتر کل و حدود ۳ میلیارد پارامتر فعال بهازای هر توکن که از مدل بزرگتر Nemotron 3 Ultra تقطیر شده. تو این مقاله اومده که هدفش «لایهٔ اجرا»ی سیستمهای ایجنتیه: فراخوانی ابزار، بازیابی، اعتبارسنجی، قالببندی، دستهبندی و خلاصهسازی. قرار نیست یه مدل استدلالی درجهیک باشه؛ قراره سریع، ارزون و راحت فاینتیونشدنی باشه.
نویسنده میگه بیشتر کاری که یه ایجنت خودمختار انجام میده اصلاً سخت نیست: ابزار صدا بزن، خروجی رو چک کن، روی خطای گذرا دوباره تلاش کن، لاگ رو خلاصه کن، هشدار رو دستهبندی کن. هیچکدوم استدلال در سطح مدلهای فرانتیر نمیخواد، ولی بیشتر تیمها همهشو از همون مدل گرونی رد میکنن که براش API دارن. حرف انویدیا اینه که وقتی ۹۰٪ توکنهای یه ایجنت خرج این کارها میشه، این یعنی سوزوندن پول و اضافهکردن تأخیر بدون هیچ سودی.
سرعتش از سه انتخاب معماری میاد. اول، طراحی هیبریدی Mamba-ترنسفورمر که نگهداشتن کانتکست خیلی بزرگ (انویدیا تا یک میلیون توکن رو ذکر میکنه) رو ارزونتر از ترنسفورمر خالص میکنه. دوم، MoE نهفته: توکنها قبل از مسیریابی به یکی از ۳۰ متخصص، به یه فضای نهفتهٔ کوچیکتر تصویر میشن و همین دقت بهازای هر بایت محاسبهٔ فعال رو بالا میبره. سوم، رمزگشایی گمانهزنانه که از اول توش تعبیه شده — یه پیشبین چندتوکنی (MTP) بههمراه پشتیبانی از D-Flash و نسخهٔ D-Spark مخصوص سختافزار DGX Spark.
تو تست عملی یه بازبین، روی DGX Spark حدود ۷۱ توکن بر ثانیه تو یه استریم گزارش شده و حدسهای MTP حدود ۷۰٪ مواقع پذیرفته شدن — نرخ بالایی که مستقیم یعنی مرحلههای رمزگشایی کمتر. انویدیا هم ادعا میکنه throughput لایتنینگ حدود ۴ برابر مدلهای هماندازهٔ خانوادهٔ Qwen ـه و روی بنچمارک ایجنتی Pinch Bench با ۱۰ هزار تسک، ۳۰ تا ۳۵ درصد سریعتر از Qwen 3.6 MoE بوده. روی شاخص هوش Artificial Analysis تقریباً همتراز GPT-OSS درمیاد؛ یعنی ادعاش باهوشتر بودن نیست، سریعتر بودنه.
ضعفهاش هم مشخصه: به گفتهٔ همون بازبین، تو مقاومت برابر تزریق پرامپت و کارهایی که زنجیرهٔ فکر طولانی میخوان لنگ میزنه، چون توکن استدلالی زیادی تولید نمیکنه. پس بهترین جاش زیر دست یه ارکستریتوره، نه خودِ ارکستریتور. انویدیا کنارش روتر متنباز SwitchYard رو هم داده تا کارهای ساده محلی بمونن و سختها به مدل بزرگتر ارتقا پیدا کنن. چون لایتنینگ با دادهٔ کامل پسآموزش منتشر شده، تیمها ارزون فاینتیونش میکنن: CrowdStrike با حدود یکپنجم هزینه به دقت Nemotron 3 Super رسیده و CodeRabbit و Base10 تو کمتر از سه ساعت و حدود ۱۰۰ دلار یه اپاک آموزشش دادن.
نکات کلیدی:
- ۳۰ میلیارد پارامتر کل و حدود ۳ میلیارد فعال؛ وزنها، دادهٔ پسآموزش و دستورالعملها همه باز
- ساختهشده برای لایهٔ اجرای ایجنت: فراخوانی ابزار، اعتبارسنجی، قالببندی و خلاصهسازی
- ادعای ۴ برابر throughput نسبت به Qwenهای هماندازه و ۳۰ تا ۳۵ درصد سریعتر روی Pinch Bench
- دو چکپوینت BFloat16 و NVFP4 کوانتایزشده؛ فقط متن، بدون پشتیبانی تصویر
- مجوز Open Model انویدیا: کاربرد تجاری و تقطیر خروجیها بدون الزام به ذکر منبع




