راهاندازیِ سرورِ vLLM روی Hugging Face فقط با یه دستور
خلاصهٔ کاملتر
به گفتهٔ نویسنده، hf jobs run عملاً همون docker run منتها روی زیرساختِ Hugging Faceه: ایمیجِ رسمیِ vllm/vllm-openai رو برمیداری، با --flavor یه GPU میخوای و با --expose پورتِ vLLM رو بیرون میدی. کلِ ماجرا یه فرمانه و لازم نیست سروری بسازی یا کوبرنتیز راه بندازی.
hf jobs run --flavor a10g-large --expose 8000 --timeout 2h \
vllm/vllm-openai:latest \
vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000بعدِ یکیدو دقیقه که وزنها دانلود و مدل بوت شد، سرور بالاست. چون vLLM با APIِ OpenAI حرف میزنه، از هر جا — لپتاپ، نوتبوک یا کلاینتِ پایتونِ OpenAI — میتونی بهش وصل شی و فقط کافیه توکنِ HF رو بهعنوانِ کلید بفرستی. یه نکتهٔ مهم اینه که اندپوینت gatedه: هر درخواست باید توکنی با دسترسیِ read به namespace داشته باشه و بازکردنش تو مرورگرِ ساده رد میشه. همین دستور به مدلهای خیلی بزرگتر هم میرسه؛ کافیه یه flavorِ قویتر انتخاب کنی و با --tensor-parallel-size مدل رو بین چند GPU بشکنی — مثلاً مدلِ ۱۲۲ میلیاردیِ Qwen3.5 روی دو کارتِ H200. مقدارِ tensor-parallel-size باید با تعدادِ GPUها بخونه. برای این مدلِ خاص هم --max-model-len و --max-num-seqs رو پایین آوردن تا تو حافظه جا بشه. چون صورتحساب ثانیهایه، نویسنده تأکید میکنه بعدِ کار سرور رو با hf jobs cancel ببندی؛ --timeout فقط یه تورِ ایمنیه. یه a10g-large ساعتی حدودِ ۱٫۵ دلار درمیاد و بهتره کوچیکترین flavoری که مدلت توش جا میشه رو برداری. مقاله چند مسیرِ فراتر هم نشون میده: چت با مدل توی یه UIِ Gradio، وصلشدنِ SSH به جابِ در حالِ اجرا برای دیباگ و تماشای حافظهٔ GPU، و حتی استفاده از همین اندپوینت بهعنوانِ بکاندِ یه ایجنتِ کدنویسیِ ترمینالی. برای اجرای ابزار (tool call) هم باید سرور رو با فلگهای مربوطه بالا بیاری. در آخر نویسنده فرقِ HF Jobs و Inference Endpoints رو روشن میکنه: Jobs برای انعطاف و کنترلِ کامل و کارهای موقتیه (آزمایش، ارزیابیِ یکباره، تولیدِ دستهای)، در حالیکه Inference Endpoints برای سرویسِ ماندگارِ محصولیه و چیزهایی مثلِ کنترلِ دسترسیِ دقیقتر و scale-to-zero رو اضافه میکنه. نکات کلیدی:
- یه دستورِ واحد، یه اندپوینتِ خصوصیِ سازگار با OpenAI روی زیرساختِ HF بالا میاره
- پرداخت ثانیهایه و باید بعدِ کار جاب رو cancel کنی
- اندپوینت با توکن محافظت شده و عمومی نیست
- با --tensor-parallel-size به مدلهای چند-GPU و خیلی بزرگ میرسه
- Jobs برای آزمایشِ سریع، Inference Endpoints برای سرویسِ محصولی




