Nemotron 3 Embed انویدیا صدرنشین بنچمارک RTEB شد
خلاصهٔ کاملتر
تو این پست اومده که بازیابی (retrieval) تو جریانهای کاری چندمرحلهای ایجنتی نقش حیاتی داره: بازیابی ضعیف باعث میشه ایجنت کانتکست بیربط بیاره، دوباره جستوجو کنه، بودجهٔ توکن رو هدر بده و نویز رو به مراحل بعدی استدلال ببره. انویدیا حالا Nemotron 3 Embed رو منتشر کرده؛ مجموعهای از مدلهای امبدینگ باز و قابلاستفادهٔ تجاری.
مجموعه سه مدل داره: Nemotron-3-Embed-8B-BF16 بهعنوان پرچمدار و لنگر کیفیت برای بازیابی حساس و RAG سازمانی؛ نسخهٔ 1B-BF16 برای پروداکشنی که تأخیر و هزینه براش مهمه؛ و 1B-NVFP4 که برای معماری Blackwell بهینه شده و ردپای حافظهٔ کمتری داره.
تو بنچمارکها، مدل 8B با ۷۸.۵ درصد رتبهٔ یک RTEB رو گرفته و روی MMTEB Retrieval هم ۷۵.۵ درصد شده. مدل 1B با ۷۲.۴ درصد روی RTEB، نرخ خطا رو ۲۷ درصد نسبت به نسل قبلی خودش کم کرده و روی MMTEB به ۷۱ درصد رسیده با ۲۸ درصد کاهش خطا. سنجشها با میانگین NDCG@10 روی RTEB، ViDoRe V3 Text، MMTEB و LongEmbed انجام شده.
جالبترین بخش ارزیابی، اندازهگیری اثر بازیابی روی هزینهٔ ایجنته. تیم یه search agent مبتنی بر Nemotron 3 Ultra رو برداشته و فقط مدل امبدینگش رو عوض کرده. نتیجه اینکه بازیابی دقیقتر، شواهد مرتبط رو زودتر برمیگردونه و ایجنت با جستوجوهای تکراری و دورهای استدلال کمتری کارو تموم میکنه — یعنی هم دقت بالاتر، هم هزینهٔ توکن پایینتر.
نسخهٔ NVFP4 وزنها و فعالسازیهای لایههای خطی رو به فرمت ۴ بیتی کوانتایز میکنه و از Quantization-Aware Distillation برای برگردوندن دقت روی ورودیهای طولانی استفاده میکنه. طبق اعداد اعلامشده، این نسخه تا دو برابر توان عملیاتی بیشتر از BF16 میده و بیش از ۹۹ درصد دقت BF16 رو حفظ میکنه.
روش ساختشون هم خوندنیه: مدل 8B با تبدیل دیکودر علّی بکبون Ministral-3-8B به یه انکودر دوطرفه ساخته شده، بعد با پیشآموزش کنتراستیو و فاینتیون روی دیتاستهای چندزبانهٔ حقوقی، مالی، پزشکی و آموزشی جلا خورده. مدل 1B هم از صفر آموزش ندیده؛ از یه پایهٔ 3B شروع کردن و دو دور هرس ساختاری با موتور NAS و تقطیر از معلم 8B انجام دادن تا به ۱.۱۴ میلیارد پارامتر برسه.
از نظر امکانات، هر سه مدل پنجرهٔ کانتکست ۳۲ هزار توکنی دارن، بازیابی چندزبانه و کد رو پشتیبانی میکنن و وزن، دیتاست و دستور پخت آموزششون بازه. روز اول روی Hugging Face در دسترسن، بهشکل میکروسرویس NIM هم قابل دیپلویان و vLLM ازشون پشتیبانی میکنه.
تو بخش پایانی، شرکتهایی مثل Automation Anywhere، Boomi، IBM، Palantir، ServiceNow، Zoom، turbopuffer و Mem0 گفتن دارن این مدلها رو ارزیابی میکنن؛ مثلاً Mem0 گزارش داده Nemotron-3-Embed-1B تو تست داخلیش روی LongMemEval نمرهٔ ۸۰.۳۸ گرفته در برابر ۷۸.۷۱ برای Qwen-3-0.6B. انویدیا هم دستور پخت فاینتیون و تقطیر رو باز کرده و میگه فاینتیون روی مستندات خودش NDCG@10 رو از ۵۶.۷ به ۶۳.۳ درصد رسونده.
نکات کلیدی:
- سه مدل باز: 8B پرچمدار، 1B-BF16 برای پروداکشن و 1B-NVFP4 برای Blackwell
- رتبهٔ یک RTEB با ۷۸.۵ درصد و ۷۵.۵ درصد روی MMTEB Retrieval
- نسخهٔ 1B نرخ خطا رو حدود ۲۷ تا ۲۸ درصد نسبت به نسل قبل کم کرده
- بازیابی بهتر یعنی هزینهٔ توکن کمتر برای ایجنت، نه فقط دقت بیشتر
- کانتکست ۳۲ هزار توکنی، پشتیبانی چندزبانه و بازیابی کد
- وزن، دیتاست و دستور پخت فاینتیون و تقطیر همه بازن




