NeMo AutoModel؛ فاینتیون سریعتر مدلهای MoE
خلاصهٔ کاملتر
انویدیا تو این پست فنی از کتابخونهٔ متنباز NeMo AutoModel میگه که روی Transformers نسخهٔ ۵ هاگینگفیس سوار میشه. مدلهای Mixture-of-Experts یا MoE (مدلهایی که بهجای یه شبکهٔ بزرگ، چند «متخصص» دارن و هر توکن فقط سراغ چندتاشون میره) حالا معماری غالب مدلهای پیشرفتهان، ولی آموزششون سخته.
ادعای اصلی اینه که با NeMo AutoModel و فقط عوضکردن یه خط import، بدون هیچ تغییر دیگهای تو کد، بین ۳.۴ تا ۳.۷ برابر توان پردازش بیشتر و ۲۹ تا ۳۲ درصد مصرف حافظهٔ GPU کمتر میگیری. همون API آشنای from_pretrained() سر جاشه و NeMoAutoModelForCausalLM زیرمجموعهٔ همون کلاس اصلیه.
این سرعت از سهجا میاد: Expert Parallelism که وزن متخصصها رو بین GPUها پخش میکنه و فشار حافظه رو کم میکنه، DeepEP که ارتباط بین GPUها و محاسبه رو با هم همپوشان میکنه، و کرنلهای TransformerEngine که عملیاتهای پایه مثل attention و لایههای خطی رو تندتر میکنن.
بکاند متخصصها هم از طریق BackendConfig تنظیم میشه؛ مثلاً میشه attention و لایهٔ خطی رو روی TransformerEngine و dispatch رو روی DeepEP گذاشت:
backend = BackendConfig(
attn="te", # TransformerEngine attention
linear="te", # TransformerEngine linear layers
experts="torch_mm", # Grouped expert matmul
dispatcher="deepep", # DeepEP fused all-to-all
)تو بنچمارکها، روی Qwen3-30B-A3B سرعت ۳.۶۹ برابر و حافظه ۲۹٪ کمتر شده، و روی Nemotron 3 Nano 30B سرعت ۳.۳۶ برابر و حافظه ۳۲٪ کمتر. جالب اینه که Transformers v5 موقع فاینتیون کامل مدل ۵۵۰ میلیاردی روی ۱۶ نود، اصلاً حافظه کم میاره، ولی AutoModel با شاردکردن متخصصها اون رو جا میده.
انویدیا میگه چون NeMo AutoModel روی همون سیستم بارگذاری وزن پویای v5 سواره، خروجی save_pretrained() یه چکپوینت استاندارد HF ـه که ابزارهایی مثل vLLM و SGLang هم میتونن لودش کنن. یعنی این مسیر ارتقا بدون دردسره و بیشتر از ۲۰ نوع مدل مثل Mixtral و DeepSeek V3 رو پوشش میده.
نکات کلیدی:
- NeMo AutoModel روی Transformers v5 سواره و فقط با عوضکردن import فعال میشه
- روی مدلهای MoE بین ۳.۴ تا ۳.۷ برابر سریعتر و ۲۹ تا ۳۲٪ کمحافظهتر
- سرعت از Expert Parallelism، DeepEP و کرنلهای TransformerEngine میاد
- تا مدل ۵۵۰ میلیاردی روی ۱۶ نود مقیاس میخوره
- خروجی چکپوینت استاندارد HF ـه و با vLLM و SGLang کار میکنه




