دو مدل از AI Gateway که نباید قاطیشون کنی
خلاصهٔ کاملتر
تو این مقالهٔ بیستن اومده که هر درخواست به یه مدل، قبل از اینکه حتی یه توکن تولید بشه، باید به چند سؤال جواب بده: کلید معتبره؟ مال کدوم مشتری و کدوم پلنه؟ کدوم دیپلوی جوابش رو بده؟ سقف مصرفش پر شده؟ زیرساخت سالمه؟ مصرفش پای کی نوشته میشه؟ نویسنده میگه تو خیلی از تیمها این جوابها پخش شدن لای کد اپ، سرویس احراز هویت، کانفیگ زیرساخت و پایپلاین صورتحساب، و کار AI gateway اینه که همهشون رو بیاره تو یه لایهٔ کنترلی واحد.
به گفتهٔ نویسنده بیشتر پیادهسازیهای واقعی یکی از دو الگو رو دارن. access gateway ترافیک خروجی اپ خودت رو کنترل میکنه: یه رابط واحد جلوی چند ارائهدهنده میذاره، کلیدها و سیاستها رو یه جا جمع میکنه و اجازه میده بین سرویسهای بیرونی جابهجا بشی. serving gateway برعکسه و ترافیک ورودی مشتریها به مدلهای خودت رو کنترل میکنه. سؤالی که این دوتا رو جدا میکنه اینه: gateway داره ترافیک کی رو و به نمایندگی از کی مدیریت میکنه؟
برای فهمیدن کار سمت serving، مقاله یه درخواست رو قدمبهقدم دنبال میکنه. اول هویت: کلید فقط معتبر بودنش کافی نیست، باید به یه مشتری و پلن مشخص وصل بشه چون همین کلید، حلقهٔ اتصال به سقف مصرف، صورتحساب و تاریخچهٔ پشتیبانیه. بعد انتخاب مسیر سرویسدهی، که تو سیستمهای پیشرفتهتر حتی به سلامت و ظرفیت بکاند و KV cache locality (یعنی درخواست بره همونجایی که کانتکست قبلیش هست) نگاه میکنه.
مرحلهٔ بعدی محافظته: سقف درخواست و توکن، محدودیت همزمانی و جدا نگه داشتن مستأجرها، تا روز بد یه مشتری نشه روز بد همه. نویسنده تأکید میکنه قطعی کامل کم پیش میآد و مشکل معمول، خرابی جزئیه؛ یه بکاند که کند میشه بدون اینکه بیفته. بعدش اندازهگیری مصرف و در آخر یه رکورد قابل ممیزی که درخواست مشتری رو به رویداد استنتاج زیرش وصل میکنه. بدون این اتصال، موقع اعتراض به صورتحساب باید دوتا سیستم جدا رو دیباگ کنی.
بخش آخر مقاله Frontier Gateway خود بیستنه که یه serving gateway مدیریتشده و روی Dedicated Inference سواره: کلید مشتریها رو میسازه، سقف مصرف رو برای هر کلید جدا اعمال میکنه، مصرف توکن و کاراکتر رو به تفکیک کلید ثبت میکنه و API رو زیر دامنهٔ برند خودِ آزمایشگاه بالا میآره. نویسنده صادقانه میگه این محصول برای مدلهای روی بیستن ساخته شده و پراکسی عمومی برای ارائهدهندههای ثالث نیست.
نکات کلیدی:
- به تخمین Menlo Ventures، خرج سازمانها روی API مدلها از حدود ۳.۵ میلیارد دلار در اواخر ۲۰۲۴ به ۸.۴ میلیارد دلار تا میانهٔ ۲۰۲۵ رسیده.
- access gateway ترافیک خروجی اپ رو کنترل میکنه، serving gateway ترافیک ورودی مشتریها رو؛ قاطی کردنشون یعنی ارزیابی محصول اشتباه.
- تو Frontier Gateway سقف مصرف به گروه و مدل وصله و کلیدها از گروهشون ارث میبرن، برای همین چرخوندن کلید یه مشتری سقف مصرفش رو به هم نمیریزه.
- Poolside موقع عرضهٔ مدلهای Laguna، API وایتلیبلش رو ۴۸ ساعت بعد از ساخت اکانت بالا آورد، با P50 TTFT برابر ۱۴۶ میلیثانیه برای Laguna XS.2 و ۶۰۵ میلیثانیه برای Laguna M.1.
- سؤال کلیدی موقع ارزیابی: gateway چقدر از استنتاج خبر داره؟ یه gateway دور از استنتاج قابل حملتره ولی کانتکست کمتری داره.




