Molt؛ فریمورک سبک RL برای ایجنتها
خلاصهٔ کاملتر
انویدیا فریمورک متنباز Molt رو منتشر کرده؛ یه فریمورک یادگیری تقویتی (RL) که از اول برای ایجنتها طراحی شده و کاملاً PyTorch-native ـه. کل پشته سه تیکهست: Ray برای جایگذاری و صفهای ناهمگام، vLLM برای rollout، و NVIDIA AutoModel بههمراه FSDP2 برای آموزش. تو مخزن اومده که کل مسیر RL حدود ۹۲۰۰ خط کده ولی تا مدلهای MoE در ابعاد تریلیونی مقیاس میگیره — مثلاً DeepSeek-V3 با --fsdp.ep_size 256.
ایدهٔ محوری اینه که خودِ ایجنت همون برنامهست: پاداش هر کدیه که تو پایتون بنویسی، داخل یه Env یا ChatAgent. دو مسیر داری؛ یا Env به سبک Gymnasium که فریمورک حلقهٔ مدل رو میچرخونه، یا ChatAgent که خودت حلقه رو با SDK رسمی OpenAI یا Anthropic مینویسی و به سروری وصل میشی که خودکار جلوی موتورهای vLLM بالا میاد.
class MathEnv(Env):
async def step(self, state) -> Result:
reward = grade(state["action_text"], state["label"])
return Result(reward=reward, terminated=True)چون rollout و آموزش و همگامسازی وزنها با هم همپوشانی دارن، لاگپرابی که vLLM موقع تولید حساب کرده با چیزی که اکتور دوباره حساب میکنه فرق میکنه. Molt این اختلاف رو با نسبت اهمیت (importance ratio) و سه پرچم is_correction_level، is_correction_mode و is_correction_threshold جبران میکنه. برای مدلهای MoE هم --train.routing_replay و --actor.freeze_moe_router هست تا مسیر انتخاب اکسپرتها بین rollout و آموزش یکی بمونه.
تو جدول مقایسهای که خود مخزن گذاشته، Molt با همون ~۹۲۰۰ خط کد RL کنار OpenRLHF (~۷۲۰۰)، slime (~۲۵ هزار) و verl (~۶۲ هزار) نشسته و برخلاف بقیه فقط یه اکتور قابلآموزش داره (کریتیک PPO اختیاریه) و تنظیماتش هم فقط با فلگ CLI انجام میشه، نه YAML. رسپیهای آماده از SFT و RL روی Qwen3-4B و Qwen3.6-35B-A3B تا RL روی GLM-5.2 حدود ۷۵۰ میلیاردی رو پوشش میدن. مسیر نصب پیشنهادی کانتینر پروژهست، ولی پکیج molt-rl روی PyPI هم منتشر شده.
نکات کلیدی:
- Molt فریمورک RL انویدیا با تمرکز بر ایجنتهاست و کاملاً روی PyTorch سوار میشه
- پشته: Ray برای زمانبندی، vLLM برای rollout، NVIDIA AutoModel و FSDP2 برای آموزش
- حدود ۹۲۰۰ خط کد RL، با پشتیبانی TP/EP/CP و MoE تا مقیاس تریلیونی
- دو مسیر تعریف ایجنت: Env به سبک Gymnasium یا ChatAgent با SDK رسمی OpenAI و Anthropic
- اصلاح اختلاف لاگپراب بین rollout و آموزش، و تثبیت مسیریابی MoE با replay و freeze روتر
- رسپیهای آمادهٔ SFT و RL از Qwen3-4B تا GLM-5.2 حدود ۷۵۰ میلیاردی




