Nemotron 3.5: مدل ایمنی محتوای انویدیا
خلاصهٔ کاملتر
انویدیا مدل Nemotron 3.5 Content Safety رو منتشر کرده؛ ادامهٔ خانوادهای از مدلهای ایمنی محتوا که از یه دستهبند متنی انگلیسی شروع شد و حالا به یه مدل واحد چندرسانهای و چندزبانه رسیده. به گفتهٔ تیم انویدیا، این مدل توی یه فراخوانی استنتاج، ورودی چندرسانهای، پوشش چندزبانه، اعمال سیاست اختصاصی و استدلال قابلممیزی رو با هم یکی میکنه.
مهمترین تغییرش ارزیابی یکپارچهٔ چندرسانهایه: مدل یه پرامپت کاربر، یه تصویر اختیاری و یه پاسخ اختیاری دستیار رو بهعنوان یه زمینهٔ واحد میگیره و یه حکم ایمنی منسجم روی کل این ورودی میده. مزیتش اینه که نقضهایی که فقط از تعامل بین متن و تصویر یا بین درخواست و پاسخ بیرون میزنن، توی یه پاس گرفته میشن، نه با امتیازدهی جداگانه به هر بخش.
قابلیت تازهٔ بعدی، اعمال سیاست اختصاصیه. توی این مقاله اومده که محیطهای واقعی معمولاً با یه دستهبندی ایمنی جهانی واحد کار نمیکنن؛ مثلاً یه پلتفرم سلامت با یه چتبات خدمات مالی یا یه اپ آموزش کودکان پروفایل ریسک متفاوتی داره. Nemotron 3.5 یه مشخصات سیاست رو کنار ورودی میگیره و موقع صدور حکم روی همون سیاست استدلال میکنه، نه صرفاً تکیه به دستهبندی پیشفرض. این کار هم سرکوب دستههای نامربوط (مثلاً تریگرنشدن «خشونت» وقتی یه ابزار DevOps عبارت terminate a process رو میبینه) و هم تزریق دستههای اختصاصی رو ممکن میکنه.
یه حالت اختیاری به اسم THINK mode هم اضافه شده که قبل از برچسب نهایی safe / unsafe، یه رد استدلال گامبهگام بیرون میده. این رد استدلال برای ثبت لاگ ممیزی توی صنایع تحتنظارت، بازبینی انسانی و بهبود تدریجی زبان سیاستها بهدرد میخوره. وقتی تأخیر مهمه میشه این حالت رو خاموش کرد تا همون حکم دودویی سریع برگرده.
از نظر معماری، مدل روی Google Gemma 3 4B IT ساخته شده، پنجرهٔ زمینهٔ ۱۲۸K داره و انویدیا با یه آداپتور LoRA رفتار دستهبندی ایمنی رو روش نصب کرده، طوریکه روی GPUهای ۸ گیگابایت به بالا قابل اجرا بمونه. دستهبندی ایمنیش از چارچوب Aegis 2.0 پیروی میکنه: ۱۳ دستهٔ اصلی همراستا با MLCommons بهعلاوهٔ ۱۰ زیردستهٔ ریزتر.
نویسنده تأکید میکنه ۹۹٪ تصاویر آموزشی عکس واقعی هستن نه تصاویر مصنوعی SDXL، و همین یه ضعف شناختهشدهٔ بنچمارکهای ایمنی چندرسانهای رو جبران میکنه. طبق اعداد گزارششده، مدل روی Multilingual Aegis بهطور میانگین ۹۶.۵٪ و روی RTP-LX حدود ۸۸.۸٪ دقت داره و میانگین کلیش روی مجموعهٔ بنچمارکها حدود ۸۵٪ گزارش شده. مدل و دیتاستش روی Hugging Face با مجوز NVIDIA Open Model در دسترسه و از transformers و vLLM و SGLang پشتیبانی میکنه.
نکات کلیدی:
- یه مدل ۴ میلیاردی که متن، تصویر و پاسخ دستیار رو یکجا از نظر ایمنی ارزیابی میکنه
- اعمال سیاست اختصاصی هر سازمان موقع استنتاج، مهمترین قابلیت تازهٔ نسخهٔ ۳.۵
- حالت THINK یه رد استدلال قابلممیزی قبل از حکم نهایی میده
- ساختهشده روی Gemma 3 4B با LoRA، اجرا روی GPUهای ۸ گیگابایت به بالا
- پوشش مستقیم ۱۲ زبان و انتشار آزاد دیتاست آموزشی چندرسانهای




