Nemotron 3.5 Lightning؛ اسب بارکش ایجنتها
خلاصهٔ کاملتر
به گفتهٔ نویسنده، Nemotron 3.5 Lightning برای همون کارهایی ساخته شده که بیشترین توکن یه سیستم ایجنتی رو میبلعن ولی استدلال سطحبالا نمیخوان: فراخوانی ابزار، اعتبارسنجی، بازیابی، قالببندی، خلاصهسازی و دستهبندی. مدل mixture-of-experts با ۳۰ میلیارد پارامتر کل و ۳ میلیارد پارامتر فعاله و از Nemotron 3 Ultra تقطیر شده، پس موقع اجرا بیشتر شبیه یه مدل کوچیک متراکم رفتار میکنه.
ستون فقرات مدل همون معماری هیبرید Mamba-ترنسفورمر خانوادهٔ Nemotron 3 هست که پنجرهٔ کانتکست ۱ میلیون توکنی رو بهینهتر از ترنسفورمر خالص مدیریت میکنه. روش یه پیشبینیکنندهٔ چندتوکنی سوار شده تا هر forward pass بیش از یه توکن تولید بشه، بهعلاوهٔ speculative decoding با مدل درفت D-Flash و نسخهٔ D-Spark که مخصوص DGX Spark تنظیم شده.
انویدیا مدعیه خروجی نهایی حدود ۴ برابر توان عبوری مدلهای هماندازهٔ خانوادهٔ Qwen رو میده و تو بنچمارک ۱۰ هزار تسکی Pinch Bench بین ۳۰ تا ۳۵ درصد سریعتر از Qwen 3.6 MoE بوده. روی شاخص Artificial Analysis همردهٔ GPT-OSS درمیاد، ولی با توان عبوری بیشتر. چکپوینت هم دو شکل داره: BF16 برای دقت بیشتر و کار جدی فاینتیون، و NVFP4 که برای اکثر کاربرهای کارتهای RTX و DGX Spark گزینهٔ عملیتره.
تو تستهای agentic، مدل کارهایی مثل تلاش دوباره بعد از خطا، تصمیم به فراخوانینکردن ابزار وقتی لازم نیست، و زنجیرهکردن چند فراخوانی رو درست انجام داده. ولی نویسنده هشدار میده مقاومتش در برابر prompt injection ضعیفه، پس نباید مستقیم جلوی ورودی نامعتبر بشینه؛ بهتره یه ارکستریتور یا مدل قویتر بالاسرش باشه و Lightning فقط لایهٔ اجرای تکراری رو ببره جلو.
نقطهٔ قوت دیگهش ارزون بودن فاینتیونه: انویدیا دادهها و دستورالعملهای پسآموزش رو هم منتشر کرده و طبق مطالعات موردی، تیمهایی مثل Code Rabbit و Base10 یه اپاک آموزش رو زیر سه ساعت و با حدود ۱۰۰ دلار جمع کردن؛ CrowdStrike هم با فاینتیون به دقتی نزدیک مدل بزرگتر Nemotron 3 Super رسیده، با حدود یکپنجم هزینه. Unsloth هم اسکریپت فاینتیون روی GPU خانگی داده.
مقاله پیشنهاد میکنه Lightning رو کنار SwitchYard بذارید؛ یه لایهٔ مسیریابی متنباز روی RouteLLM که تصمیم میگیره هر تسک بره سراغ مدل ارزون لوکال یا به یه مدل قویتر مثل Kimi K3 ارتقا پیدا کنه. تو یه مقایسه، انجام حدود ۸۰ درصد یه مجموعه تسک با Opus 4.5 نزدیک ۱۸۰ دلار هزینه برده، ولی مسیریابی بین Opus و Lightning به نرخ موفقیت مشابه با هزینهٔ خیلی کمتر رسیده.
نکات کلیدی:
- ۳۰ میلیارد پارامتر کل، فقط ۳ میلیارد فعال؛ ساختهشده برای لایهٔ اجرای ایجنت، نه چت و استدلال عمیق
- معماری هیبرید Mamba-ترنسفورمر، پیشبینی چندتوکنی و speculative decoding با D-Flash و D-Spark
- حدود ۷۱ توکن بر ثانیه تکجریانی روی یه DGX Spark
- دو چکپوینت BF16 و NVFP4؛ NVFP4 انتخاب عملی روی کارتهای RTX
- ضعف در مقاومت به prompt injection؛ باید زیر یه ارکستریتور کار کنه
- فاینتیون ارزون (حدود ۱۰۰ دلار، زیر سه ساعت) و لایسنس Open Model با اجازهٔ استفادهٔ تجاری




