Inference Router دیجیتالاوشن: مسیریابی هوشمند بین مدلهای AI
خلاصهٔ کاملتر
اکثر تیمهایی که با مدلهای زبانی بزرگ (LLM) کار میکنن، یه مدل واحد رو برای همه درخواستها استفاده میکنن — حتی وقتی که تسک سادهای مثل توضیح یه تابع نیازی به یه مدل frontier گرانقیمت نداره. در سیستمهای agentic که چندین agent بهصورت موازی کار میکنن، این مشکل چند برابر میشه و هزینهها سر به فلک میزنه. Inference Router دیجیتالاوشن دقیقاً برای حل این مشکل ساخته شده.
برای استفاده از روتر کافیه فقط یه خط توی کدت عوض کنی و بهجای نام مستقیم مدل، از یه پیشوند router: استفاده کنی:
curl -s https://inference.do-ai.run/v1/chat/completions \
-H "Authorization: Bearer $MODEL_ACCESS_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "router:software-engineering",
"messages": [
{"role": "user", "content": "Write a Python function to sort a list of dictionaries by key"}
]
}'روتر با presetهای آماده مثل Software Engineering، Writing و Knowledge Base عرضه میشه. هر preset سه حالت داره: کیفیت بهینه، کمترین هزینه، یا کمترین تأخیر. علاوه بر این، میشه custom router هم ساخت و برای هر تسک، توضیح متنی، مدلهای مجاز و سیاست انتخاب رو مشخص کرد.
زیرساخت روتر روی Plano اجرا میشه؛ یه پروکسی متنباز که در سه لایه کار میکنه: Envoy برای مدیریت اتصالات و TLS، یه فیلتر WASM برای ترجمه فرمت بین provider های مختلف (OpenAI، Anthropic، Gemini و...) بدون هیچ hop شبکهای، و Brightstaff — یه باینری Rust که منطق مسیریابی، رتبهبندی مدلها و tracing رو مدیریت میکنه. چون Rust گاربجکالکتور نداره، هیچ توقف ناگهانیای در جریان استریم توکنها ایجاد نمیشه.
مدل مسیریابی نسل اول (Arch-Router با ۱.۵ میلیارد پارامتر) نشون داد که یه مدل کوچک اختصاصی میتونه با دقت ۹۳.۱۷٪ و تأخیر ۵۱ میلیثانیه — یعنی ۲۸ برابر سریعتر از Claude 3.7 Sonnet — کار مسیریابی رو انجام بده. نسل دوم، Plano-Orchestrator، روی دادههای مکالماتی غنیتر آموزش دیده و مدل ۳۰ میلیارد پارامتریاش با میانگین ۸۷.۸۴٪ از GPT-5.1 (86.93%) و Claude Sonnet 4.5 (86.11%) جلوتره.
موتور رتبهبندی هم فقط به task تشخیص دادهشده اکتفا نمیکنه؛ در لحظه دادههای زنده هزینه و تأخیر رو از API قیمتگذاری دیجیتالاوشن و Prometheus میخونه و مدلها رو بر اساس اونها مرتب میکنه. چون تأخیر provider ها در طول روز تا ۲ تا ۳ برابر نوسان داره، این رتبهبندی زنده خیلی مهمتر از یه config ثابته.
نکات کلیدی:
- استفاده از Inference Router فقط یه تغییر یهخطی در فیلد model نیاز داره
- مدلهای اختصاصی کوچک در routing از مدلهای frontier عمومی دقیقتر و سریعترن
- توضیح متنی تسکها (route descriptions) مستقیماً روی دقت مسیریابی تأثیر میذاره — یه نوع prompt engineering برای infrastructure
- رتبهبندی زنده بر اساس هزینه و تأخیر واقعی، از config ثابت بهتره
- موتور routing بهصورت متنباز در پروژه Plano در دسترسه




