Miles v0.1؛ پستترینینگ در مقیاس تولید
خلاصهٔ کاملتر
تیم Miles نسخهٔ v0.1 رو منتشر کرد، یه سیستم فولاستک برای پستترینینگ مدلهای فرانتیر که جانشین نسخهٔ اول Miles حساب میشه و روی طراحی slime سوار شده. تو این پست اومده که اصل راهنمای کار «verified, clean, and customizable everywhere» بوده؛ یعنی هر مرحله از حلقهٔ RL هم راستیآزمایی شده باشه هم قابل تغییر.
حلقهٔ آموزش سه مرحله داره: rollout که موتورهای SGLang مسیرها رو تولید میکنن، training که تِرینر (Megatron-LM یا FSDP) لاس RL رو حساب میکنه، و weight update که وزنهای تازه برمیگرده روی ناوگان rollout. تو بارهای agentic چندتا مسیر کُند کل زمان rollout رو تعیین میکنن، برای همین Miles حالت fully async داره: زمانبندی در سطح تکنمونهست، هر مسیر که تموم شد جاش آزاد میشه و تِرینر منتظر کُندترین مسیر نمیمونه.
دو تا مشکل دقت هم حل شده. TITO همون token idهایی رو که مدل واقعاً تولید کرده نگه میداره، چون پارسکردن پیام و رندر دوبارهٔ chat template میتونه توکنها رو عوض کنه و تِرینر چیز دیگهای ببینه. R3 هم مسیر routing اکسپرتها رو موقع rollout ضبط میکنه و موقع آموزش همون رو پخش میکنه، چون تو MoE یه جابهجایی کوچیک تو top-k گرادیان رو میبره سراغ expert اشتباه.
سمت کارایی، آپدیت وزن با P2P روی RDMA فقط شاردهای لازم رو مستقیم مینویسه؛ برای Kimi-K2 با ۱ تریلیون پارامتر زمان آپدیت از ۵۳.۳ ثانیه به ۷.۲ ثانیه رسیده. جایی که RDMA نیست، Miles فقط دلتای وزنها رو منتشر میکنه: تو یه ران GLM-4.7-Flash حجم هر آپدیت از ۶۲.۴ گیگابایت به ۰.۶۹ تا ۰.۸۳ گیگابایت اومده پایین و مکث تولید ۳ تا ۵ ثانیه مونده.
بهعنوان نمونهٔ عملی، تیم یه مدل GLM-5.2 با ۷۴۴ میلیارد پارامتر (۴۰ میلیارد فعال) رو روی تسکهای ترمینال با ۶۴ کارت GB300 آموزش داده، ۳۲ تا برای rollout و ۳۲ تا برای training. صد قدم پایدار جلو رفته، هر قدم حدود ۴.۵ دقیقه، با نرخ اصابت کش پیشوندی ۹۶ درصد. Miles روی AMD هم اجرا میشه، از MI300X تا MI355X.
نکات کلیدی:
- آپدیت وزن Kimi-K2 یکتریلیونی با P2P از ۵۳.۳ ثانیه به ۷.۲ ثانیه رسید
- دلتای وزن معمولاً ۲٪ پارامترها برای rollout با BF16 و ۰.۵٪ برای FP4 هست
- LoRA RL روی GLM-5.2 فقط ۲۱۲ مگابایت پارامتر آموزشپذیر داره، حدود ۰.۰۱۴٪ وزن پایه
- OPD روی Qwen3.5-35B-A3B طول rollout رو از ۱۸.۶K به حدود ۶K توکن رسوند و DAPO رو از ۸۴.۶٪ به ۸۹.۵٪ برد
- پشتیبانی day-0 برای Kimi-K3، DeepSeek-V4، Inkling، Qwen3.8 و Nemotron 3 Ultra
- Zero-KL Alignment فعلاً فقط برای خانوادهٔ Qwen 3 در دسترسه




