راهنمای هاست کردن Nex-N2.5 با Docker و SGLang
خلاصهٔ کاملتر
Nex-AGI برای خانوادهی مدلهای متنباز Nex-N2.5 (سایزهای mini، Pro و Max) یه ایمیج Docker آماده به اسم nexagi/sglang:v0.5.18-nex-patch منتشر کرده که نسخهی شخصیسازیشدهی SGLang رو توش داره. یعنی برای هاست کردن مدل لازم نیست SGLang رو از صفر بیلد کنید، فقط کافیه ایمیج رو بگیرید، وزنهای مدل رو مانت کنید و سرور رو با فلگهای درست برای کارت گرافیکتون بالا بیارید.
سایز mini سبکترینه و رو دو کارت H100 با فلگ --tp 2 بالا میاد:
docker run --gpus all --shm-size 32g --ipc=host \
-p 30000:30000 -v /path/to/your/model:/model \
nexagi/sglang:v0.5.18-nex-patch \
python3 -m sglang.launch_server --model-path /model --tp 2 \
--reasoning-parser qwen3 --tool-call-parser qwen3_coderفلگ --shm-size 32g مهمه چون SGLang برای هماهنگی بین چند GPU به حافظهی مشترک بیشتری از پیشفرض داکر نیاز داره.
سایز Pro تقریبا همون دستوره، فقط --tp 8 بهجای --tp 2 چون رو یه نود با ۸ کارت H100 بالا میاد. پارسرهای reasoning و tool-call هم چون Pro از همون پایهی چندوجهی Nex-N2 استفاده میکنه، دقیقا مثل mini میمونه (qwen3 و qwen3_coder).
سایز Max داستان جداییه: چون رو یه مدل MoE با ۱.۶ تریلیون پارامتر ساخته شده، به یه کلاستر دو نودی با ۱۶ کارت H200 نیاز داره و دستور راهاندازیش فلگهای اضافهای مثل --ep-size 16 (برای موازیسازی expertها)، --moe-a2a-backend deepep و --kv-cache-dtype fp8_e4m3 (فشردهسازی کش KV) رو هم داره. باید همین دستور رو رو هر دو نود اجرا کنید و فقط NODE_RANK و آدرس MASTER_ADDR رو عوض کنید تا با هم هماهنگ بشن.
اگه فقط دنبال دسترسی API هستید، Pro و mini رو از طریق OpenRouter هم میشه استفاده کرد و لازم نیست نگران تهیهی GPU باشید. هاست کردن خودتون وقتی بهصرفهست که به data locality نیاز دارید، میخواید مدل رو فاینتیون کنید، یا حجم درخواستهاتون اونقدر بالاست که GPU اختصاصی از قیمت هر توکن API ارزونتر در بیاد.
نکات کلیدی:
- ایمیج Docker مشترک nexagi/sglang:v0.5.18-nex-patch برای هر سه سایز استفاده میشه.
- mini به ۲ کارت H100، Pro به ۸ کارت H100، و Max به ۱۶ کارت H200 رو دو نود نیاز داره.
- mini و Pro از پارسر qwen3 استفاده میکنن ولی Max از deepseek-r1.
- راهاندازی Max فلگهای اضافه مثل --ep-size 16 و --kv-cache-dtype fp8_e4m3 داره.
- تنظیمات پیشفرض نمونهگیری برای هر سه سایز: دما ۰.۷، top_p برابر ۰.۹۵ و top_k برابر ۴۰.




