RunPod Serverless: پول GPU رو فقط وقتی کار میکنه بده
خلاصهٔ کاملتر
RunPod Serverless یه سرویسیه که میذاره یه مدل هوش مصنوعی (حتی وزنهای اوپنسورس که مستقیم از Hugging Face میگیری) رو بهصورت یه API دیپلوی کنی، بدون اینکه خودت GPU اجاره کنی و ۲۴ساعته روشن نگهش داری. کافیه یه مدل و یه GPU با VRAM کافی انتخاب کنی و محدودیتهای اسکیل رو تنظیم کنی؛ بقیهی کار، از مسیر دادن درخواستها تا بالا و پایین بردن ورکرها، دست خود RunPodـه.
صورتحساب بر اساس ثانیههای واقعی کارکرد GPU حساب میشه، نه ساعتهای یه سرور رزرو شده. وقتی هیچ ترافیکی نیست، ورکر کاملاً خاموش میشه (یعنی scale-to-zero) و هزینه صفر میشه؛ به محض رسیدن یه درخواست جدید، یه ورکر دوباره بالا میاد. نویسنده میگه این دقیقاً همون الگوی serverless معروفه (مثل AWS Lambda) که اینبار رو GPU پیاده شده، با همون تِرِید-آفِ همیشگی: یه تاخیر کلد استارت بعد از بیکاری.
مشکل اصلی scale-to-zero رو GPU اینه که لود کردن کانتینر و وزنهای مدل روی GPU وقت میبره، پس اولین درخواست بعد از بیکاری کند جواب میگیره. flash boot تلاش RunPod برای کوتاه کردن همین فاصلهست؛ کلد استارت رو کامل از بین نمیبره ولی کمترش میکنه. اگه بازم تاخیر قابلقبول نباشه، میشه چند تا ورکر رو همیشه روشن (warm) نگه داشت و بهجاش هزینهی بیشتری داد.
به گفتهی نویسنده، این مدل قیمتگذاری به روند مدلهای کوچیک و تخصصی میخوره؛ مثلاً مدل ۲میلیاردپارامتری MiniCPM از OpenBMB که فقط برای تولکالینگ ساخته شده، نه چت عمومی. این مدلها زیاد صدا زده میشن ولی هر بار کارشون کوتاهه، پس رو یه سرور همیشهروشن بیشتر وقتشون بیکاریـه؛ رو serverless دقیقاً همون چند ثانیهی کارکرد رو حساب میکنن. انتخاب سایز GPU و تنظیم حداقل و حداکثر ورکر، کل کار تنظیم اندپوینته.
نکات کلیدی:
- پول فقط به ازای ثانیههای کارکرد واقعی GPU حساب میشه، نه ساعتهای رزرو
- scale-to-zero یعنی سرویس وقتی بیکاره کاملاً خاموش میشه و هزینه صفره
- flash boot تاخیر کلد استارت رو کم میکنه ولی کامل حذفش نمیکنه
- گذاشتن حداقل ورکر بالای صفر، کلد استارت رو حذف میکنه ولی هزینهی دائمی داره
- مدلهای کوچیک و تخصصی مثل MiniCPM ۲میلیاردی، بهترین فیت رو با این مدل قیمتگذاری دارن




