دو راه بهینهسازی سرو مدلهای زبانی
خلاصهٔ کاملتر
تو مهندسی inference، منظور از efficient frontier (یعنی مرز بهترین ترکیبهای ممکن وقتی منابع محدوده) بیشتر وقتها معاملهٔ بین latency و throughput ـه. نویسندهٔ مقالهٔ Baseten میگه تکنیکهای این حوزه دقیقاً دو دستهان: اونایی که تو رو روی همین مرز جابهجا میکنن، و اونایی که خود مرز رو هل میدن جلوتر و کارایی کلی بیشتری میسازن.
دستهٔ اول یعنی معامله. اندازهٔ batch (تعداد درخواستهایی که همزمان پردازش میشن) واضحترین نمونهشه: batch کوچیک تاخیر هر کاربر رو عالی نگه میداره ولی توکن کمی به ازای هر GPU تولید میشه و هزینهٔ هر توکن بالا میره؛ batch بزرگ دقیقاً برعکس. نوع parallelism هم همینه. به گفتهٔ نویسنده Tensor Parallelism برای پایین آوردن تاخیر خوبه چون ارتباطاتش روی NVLink سریع رد و بدل میشه، ولی Attention Data Parallelism توان کل رو بالا میبره و سرعت هر درخواست رو فدا میکنه.
کوانتیزه کردن مدل، یعنی اجرا با دقت عددی پایینتر روی وزنها یا activationها یا KV cache، هم تاخیر رو کم میکنه هم توان رو بالا میبره. پس خودش مرز سرو رو جلو میبره، ولی یه معاملهٔ تازه باز میکنه: کیفیت مدل در برابر کارایی. نویسنده میگه این یکی مرز خیلی دندونهداره و مخصوصاً با فرمتهای ممیز شناور microscaling مثل MXFP4 و NVFP4 میشه سود بزرگی گرفت بدون اینکه کیفیت عملاً افت کنه.
دستهٔ دوم کل مرز رو جابهجا میکنه و سودش ضرب میشه: بهینهسازی کرنلهای CUDA و خود مسیر forward pass، بعد speculative decoding (یعنی حدس زدن توکنهای بعدی و بعد اعتبارسنجی حدسها) با روشهایی مثل EAGLE-3 و DSpark و DFlash که مخصوصاً روی تولید کد خوب جواب میده چون خروجی قابلحدستره، و آخری P/D disaggregation یعنی جدا کردن مرحلهٔ prefill از decode روی ورکرهای مستقل تا نسبتشون با ترافیک واقعی تنظیم بشه.
نکتهٔ عملی مقاله اینه که این مرز تو واقعیت یه خط صاف نیست، دندونهداره و تغییرهای کوچیک گاهی اثر بزرگ دارن. پس نقطههای بهینه رو فقط با sweep و تست تجربی میشه پیدا کرد. یعنی برای زدن به یه هدف مشخص تو پروداکشن معمولاً لازم نیست دنبال روش جدید بگردی، باید کانفیگ درست رو برای شکل ترافیک خودت پیدا کنی.
نکات کلیدی:
- batch کوچیک تاخیر کمتر ولی هزینهٔ هر توکن بالاتر میده، batch بزرگ برعکس
- Tensor Parallelism به درد تاخیر کم میخوره، Attention Data Parallelism به درد توان بالا
- فرمتهای MXFP4 و NVFP4 کوانتیزیشن رو با افت کیفیت خیلی کم ممکن کردن
- EAGLE-3 و DSpark و DFlash روشهای امروزی speculative decoding ـن
- P/D disaggregation بیشتر برای بالا بردن throughput با تاخیر ثابت یا کمی بهتر به کار میره




