مدلهای Hugging Face روی Foundry مایکروسافت با یک کلیک
خلاصهٔ کاملتر
مایکروسافت تو Build 2026 دو چیز رو معرفی کرد: Foundry Managed Compute و مدلهای Hugging Face روی Foundry. دومی یک کاتالوگِ منتخب از مدلهای open-weightِ اکوسیستم Hugging Face هست که هفتگی بهروز میشه و با یک کلیک روی Managed Compute دیپلوی میشه؛ وزنها از قبل تو Azure آماده شدن، runtimeها رو خودِ مایکروسافت میسازه و از نظر امنیتی اسکن میکنه، و هر مدل همون امنیت، governance، observability و صورتحسابِ بقیهٔ مدلهای Foundry رو داره.
فاندری خودش پلتفرمی برای ساختن اپهای هوش مصنوعیِ agentic هست و از نظر مایکروسافت بیشترین تنوعِ مدل رو بین ابرها داره؛ مدلهایی از مایکروسافت، OpenAI، Anthropic، Meta، Mistral، DeepSeek و Hugging Face، همه از یک endpoint و یک مجموعه SDK (پایتون، C#، جاوااسکریپت، جاوا). روی این مدلها هم Foundry Agent Service قرار داره با ارکستراسیونِ چند-agentی، حافظه، و tracing و مانیتورینگِ سرتاسری.
Managed Compute گزینهٔ سومِ دیپلویه (کنار pay-per-token و provisioned throughput): یک GPU platform-as-a-serviceِ مدیریتشده برای مدلهای open و سفارشی. تو مدلِ کاری رو با پارامترهایی مثل تعداد پارامتر، طولِ context و اولویتِ latency یا throughput توصیف میکنی و Foundry خودش topologyِ GPU رو زیرش مدیریت میکنه. آپدیتهای container، ارتقای runtime و پچهای امنیتی روی runtimeهای پشتیبانیشده (vLLM، SGLang، TensorRT-LLM، NIM، TEI، llama.cpp) خودکار انجام میشن، بدون اینکه مجبور باشی مدل رو دوباره دیپلوی کنی.
هر مدلی که وارد کاتالوگ میشه از یک pipelineِ چندمرحلهای رد میشه: شناساییِ مدلهای ترند، بررسیِ لایسنس و امنیت (فقط فرمتِ SafeTensors، بدون مسیرِ اجرای کدِ غیرقابلاعتماد و بدون trust_remote_code مگر با بازبینیِ سختگیرانه)، ساخت و اسکنِ runtimeها برای CVE و امضاشون، آپلودِ وزنها به storageِ امنِ Azure، و در آخر تستِ conformance و performance و انتشار با مسیرِ دیپلویِ یککلیکی. چون وزنها از قبل تو Azure و ایمیجهای runtime تو یک registryِ مایکروسافتی هستن، دیپلوی به دسترسیِ خروجی به Hugging Face Hub نیاز نداره و میشه تو شبکهٔ خصوصی به production رفت.
هر runtime برای معماریِ مدلی که بهش میخوره انتخاب میشه: vLLM و SGLang برای LLMها، TensorRT-LLM و NIM جایی که کاربرد داره، TEI برای embedding، و llama.cpp برای CPU و مدلهای کوچک. چون Hugging Face مستقیماً به vLLM و SGLang کمک میکنه، هر مدلی که تو کتابخانهٔ Transformers باشه میتونه همون روزی که رویِ Hugging Face میاد رویِ Foundry سرو بشه.
بعد از دیپلوی، مدل از طریق همون endpointِ یکپارچهٔ Foundry با SDKِ سازگار با OpenAI صدا زده میشه؛ فیلدِ model همون اسمِ deployment رو میگیره:
from openai import OpenAI
openai_client = OpenAI(base_url=endpoint, api_key=api_key)
completion = openai_client.chat.completions.create(
model=deployment.name,
messages=[{"role": "user", "content": "What is the capital of France?"}],
)
print(completion.choices[0].message)طبق اعلام مایکروسافت، این کاتالوگ الان بهصورت preview در دسترسه، با شتابدهندههای NVIDIA A100، H100 و AMD MI300X، و رویِ نقشهٔ راه هم پوششِ گستردهتر و قابلیتِ Bring Your Own Weights برای مدلهای fine-tuneشده و اختصاصی قرار داره.
نکات کلیدی:
- کاتالوگِ مدلهای open-weightِ Hugging Face با دیپلویِ یککلیکی روی Foundry Managed Compute
- وزنها از قبل تو Azure، runtimeها ساخته و CVE-اسکنشده توسط مایکروسافت
- فقط SafeTensors و بدون trust_remote_code؛ دیپلوی بدون نیاز به دسترسیِ خروجی به Hugging Face
- یک endpoint و یک SDKِ سازگار با OpenAI برای همهٔ مدلها
- runtimeهای پشتیبانیشده: vLLM، SGLang، TensorRT-LLM، NIM، TEI، llama.cpp
- الان preview روی A100، H100 و MI300X؛ BYO Weights رو نقشهٔ راهه




