SwitchYard؛ روتر محلی مدلهای هوش مصنوعی
خلاصهٔ کاملتر
تو این مقاله اومده که روتر محلی هوش مصنوعی یه لایهی زیرساختیه که بین اپلیکیشن و چند مدل زبانی میشینه و همون لحظه تصمیم میگیره کدوم مدل باید جواب بده. به جای اینکه هر کاری بره سراغ گرونترین مدل، روتر به سیگنالهایی مثل پیچیدگی کار، نیاز به سرعت و حساسیت داده نگاه میکنه. SwitchYard روتر متنباز انویدیاست که روی RouteLLM ساخته شده، یه دستهبند و لایهی پراکسی بهش اضافه کرده و میتونه کامل روی سختافزار خودت اجرا شه.
به گفتهی نویسنده چهار انگیزه پشت مسیریابی هست: هزینه، چون تو مقیاس بالا خرج توکن سریع بالا میره و خیلی از مرحلهها اصلاً هوش مدل فرانتیر رو لازم ندارن؛ سرعت، چون ورکفلوهای ایجنتی با صدها مرحله نمیتونن هر بار منتظر مدل کند بمونن؛ تخصص، چون بهترین مدل عمومی لزوماً بهترین مدل برای یه کار خاص نیست؛ و حریم خصوصی، چون دادهی حساس باید روی زیرساخت محلی بمونه و فقط چکیدهی پاکشده بیرون بره.
Nemotron 3.5 Lightning یه مدل mixture-of-experts با ۳۰ میلیارد پارامتر و ۳۰ اکسپرته که معماریش ترکیبی از Mamba و ترنسفورمره و برای throughput بالا ساخته شده، نه عمق استدلال. انویدیا به روشش میگه latent MoE؛ یعنی توکنها اول به یه فضای نهفتهی کوچیکتر تصویر میشن بعد به اکسپرت فعال میرسن. روی DGX Spark حدود ۷۱ توکن بر ثانیه میده و یه کار استدلالی ۱۴۰۰ توکنی رو تو حدود ۲۰ ثانیه تموم کرده، در حالی که Kimi K3 از راه API حدود ۵۰ ثانیه وقت برده.
چهار استراتژی مسیریابی هم روی میزه. random ترافیک رو با نسبت ثابت پخش میکنه و بیشتر برای A/B تست و ساختن خط پایهی هزینه و کیفیت به درد میخوره. دستهبند مبتنی بر مدل یه مدل دوم رو میذاره تا ردهی هر درخواست رو تعیین کنه، ولی به ازای هر درخواست یه فراخوانی اضافه خرج برمیداره. stage router سیگنالهایی رو که همین الان تو مکالمه هست — مثل شکست خوردن فراخوانی ابزارها — میخونه و عملاً مجانی درمیاد.
escalation همهچی رو با مدل ارزون شروع میکنه و یه مدل داور سشن رو میپاد؛ هر وقت دردسر ببینه کار رو به مدل قویتر ارتقا میده و تا آخر همون سشن نگهش میداره. مثال عملی مقاله تحلیل هشدارهای شبکهست: مدل محلی از هر هشدار یه چکیدهی بدون دادهی هویتی میسازه و فقط همون برای ریشهیابی بیرون میره. نویسنده تأکید میکنه مسیریابی باید یه بار برای هر کار انجام شه نه هر نوبت مکالمه، چون نوبتبهنوبت کش رو خراب میکنه و سربار اضافه میسازه.
نکات کلیدی:
- SwitchYard روتر متنباز انویدیاست که روی RouteLLM ساخته شده و کامل روی زیرساخت خودت اجرا میشه
- چهار انگیزهی مسیریابی: هزینه، سرعت، تخصص و حریم خصوصی
- Nemotron 3.5 Lightning یه مدل MoE با ۳۰ میلیارد پارامتره که روی throughput تمرکز داره
- stage router مجانیه، ولی دستهبند مدلی و escalation فراخوانی اضافه دارن
- تصمیم مسیریابی رو یه بار برای هر کار بگیر، نه هر نوبت مکالمه




