کایتوس MotusAI رو آپدیت کرد: کارخونه توکن روی سرور خودت
خلاصهٔ کاملتر
کایتوس، از سازندههای زیرساخت AI، یه آپدیت بزرگ برای MotusAI منتشر کرده؛ پلتفرم سازمانیای که کل چرخه تولید و مصرف توکن رو داخل دیتاسنتر خود شرکت نگه میداره. به گفته کایتوس، ایده اصلی اینه که سازمانها «کارخونه توکن» خودشون رو بسازن: به جای فرستادن سورسکد و داده مشتری به API های ابری، استنتاج مدل و وزنها و کانتکست همه پشت فایروال خودشون میمونه.
روی کیفیت سرویس، MotusAI از PD Disaggregation (یعنی جدا کردن مرحله خوندن ورودی از مرحله تولید متن روی منابع مجزا)، کش پویای KV و بچینگ پویا استفاده میکنه تا TTFT یا همون زمان رسیدن اولین توکن پایین بیاد. با رانتایمهایی مثل vLLM و SGLang یکپارچه شده و بر اساس متریکهای زنده مقیاس میگیره. توی تست تولیدی، ۲۱ ثانیه بعد از پیک ترافیک اسکیل خودکار فعال شده و ظرفیت توی دو دقیقه به ۱۶ اینستنس رسیده.
یه API Gateway سازگار با OpenAI هم داره که تیمها بدون دست زدن به کد میتونن بین مدلهای متنباز و تجاری جابهجا بشن، و کانتکست میلیونتوکنی رو پشتیبانی میکنه. بخش حاکمیت داشبورد زنده TTFT و TPS و نرخ هیت کش رو نشون میده، GPU رو ریزدانه پارتیشن میکنه و برای هر دپارتمان سهمیه و نرخ صورتحساب داخلی میذاره. یعنی هر تیم میفهمه چقدر خرج کرده.
کایتوس میگه پلتفرم الان توی محیطهای واقعی کار میکنه: یه فینتک خارجی پلتفرم قبلیشو روی هشت سرور GPU با MotusAI عوض کرده، یه ارائهدهنده ابری ژاپنی به بیش از ۳۰ مشتری سازمانی سرویس میده و یه اپراتور جنوب شرق آسیا به خاطر چندمستاجری و صورتحساب داخلی سراغش رفته. دارن کاکس، مدیر کایتوس اروپا، میگه شرکتها فقط GPU بیشتر نمیخوان، میخوان بتونن سرویس توکن رو مدیریت و تسویه کنن و با خیال راحت مقیاسش بدن.
نکات کلیدی:
- کاهش ۳۰ تا ۵۰ درصدی هزینه سالانه توکن با سهمیه دپارتمانی و فیلتر درخواستهای تکراری
- بهرهوری GPU از ۶۸.۹٪ به ۹۵.۷٪ توی تستهای بنچمارک
- اسکیل خودکار ۲۱ ثانیه بعد از پیک و رسیدن به ۱۶ اینستنس در دو دقیقه
- API سازگار با OpenAI برای جابهجایی بین مدلها بدون تغییر کد
- یکپارچگی با vLLM و SGLang و پشتیبانی از کانتکست میلیونتوکنی




