Serverless Inference دیجیتالاوشن: ۳۰ مدل با یک کلید API
خلاصهٔ کاملتر
نویسنده میگه سختترین بخش عرضهٔ یک قابلیت هوش مصنوعی، وادار کردن مدل به جواب دادن نیست، بلکه پایدار و مقیاسپذیر نگه داشتنشه بدون اینکه بودجهات بسوزه. دیجیتالاوشن سرویس Serverless Inference رو دقیقاً برای همین ساخته: یک پلتفرم استنتاج کاملاً مدیریتشده و API-محور با بیش از ۳۰ مدل پایه در حوزههای متن، کد، بینایی، تولید تصویر و ویدیو و گفتار، همه پشت یک کلید و یک آدرس واحد با پرداخت بهازای توکن.
ایدهٔ اصلی، جدا کردن مصرف مدل از مدیریت زیرساخته. سرویس بیحالته (stateless)، یعنی هر درخواست باید کل کانتکست لازم رو همراه خودش بفرسته، و تخصیص GPU و مقیاسپذیری و چرخهٔ عمر مدل زیر کاپوت انجام میشه. API هم سازگار با OpenAIـه؛ به گفتهٔ مطلب اگه کدی داری که OpenAI رو صدا میزنه، فقط با عوض کردن دو خط (آدرس پایه و کلید) به دیجیتالاوشن سوییچ میکنی:
from openai import OpenAI
client = OpenAI(
base_url="https://inference.do-ai.run/v1/",
api_key=os.getenv("MODEL_ACCESS_KEY"),
)قلب معماری یک لایهٔ ترجمه به اسم Model Executor Serviceـه که بین API و هر بکاند مدل میشینه. این لایه تفاوتهای هر ارائهدهنده (شکل فراخوانی ابزار، فرمت رویدادهای استریم، نگاشت پارامترها و خطاها) رو جذب میکنه تا همهٔ مدلها از پشت یک قرارداد API یکسان دیده بشن. مدلهای متنباز روی Ray و vLLM روی کارتهای H100 اجرا میشن و مدلهای تجاری OpenAI و Anthropic از همین مسیر به API خودشون فوروارد میشن.
روی این پایه، چند قابلیت تولیدی هم سواره: کشینگ پرامپت برای کم کردن هزینهٔ کانتکستهای تکراری (مهم برای جریانهای ایجنتیک که ۸۰ تا ۹۷ درصد توکنهای ورودی تکراره)، حالت استدلال گامبهگام، ورودی چندوجهی (بینایی، تولید تصویر و ویدیو، تبدیل متن به گفتار، امبدینگ)، و ابزارهای داخلی مثل بازیابی از پایگاه دانش (RAG)، MCP و جستوجوی وب. یک Inference Router هم هست که هر درخواست رو بر اساس سیاست (ارزانترین، سریعترین یا رتبهبندی دستی) به بهترین مدل میفرسته.
از نظر اقتصادی، نویسنده میگه یک GPU اختصاصی چه ۵ درصد و چه ۹۵ درصد مصرف بشه هزینهاش یکیه، ولی این سرویس ظرفیت GPU رو بین همهٔ مشتریها به اشتراک میذاره و فقط بابت توکن مصرفی پول میگیری. از درسهایی که گرفتن هم اینه که ترافیک استنتاج غیرقابلپیشبینیه (یک اینتگریشن ایجنتیک میتونه حجم رو یکشبه ۱۰ برابر کنه)، بهرهوری GPU از سختافزار خام مهمتره، و استریم یک قید معماریه نه یک فیچر ساده.
نکات کلیدی:
- یک کلید و یک آدرس واحد برای بیش از ۳۰ مدل متن، کد، تصویر، ویدیو و صدا
- سازگار با OpenAI و Anthropic؛ مهاجرت کد با تغییر چند خط
- لایهٔ Model Executor تفاوت ارائهدهندهها رو پشت یک API یکسان پنهان میکنه
- کشینگ پرامپت، استدلال، ابزارهای داخلی (RAG/MCP/جستوجوی وب) و روتر هوشمند
- پرداخت بهازای توکن با ظرفیت GPU اشتراکی بهجای رزرو ساعت GPU




