درمان تأخیرهای بلند LLM: هر درخواست رو دوبار بفرست
خلاصهٔ کاملتر
ایجنت صوتی شرکت HOAi به تماسهای تلفنی جواب میده و هر نوبت از مکالمه یه درخواست به LLM میفرسته. تو این پست اومده که بیشتر جوابها زیر ۱.۵ ثانیه برمیگرده، ولی هرازگاهی یکی ۱۰ تا ۲۰ ثانیه طول میکشه. رو تلفن این یعنی ۱۰ ثانیه سکوت معذبکننده، و بعد از یه مدت تماسگیرنده گوشی رو میذاره.
ماجرا همون tail latency ـه، یعنی همون درصد کوچیک درخواستهایی که خیلی کندتر از بقیه جواب میدن. نویسنده حساب میکنه یه تماس معمولی ۲۰ تا ۳۰ نوبت داره، پس اگه فقط ۱٪ درخواستها فاجعهبار کند باشن، یه تماس ۲۵ نوبتی حدود ۲۲٪ شانس داره که دستکم یه بار تو سکوت طولانی بیفته. یعنی چیزی که رو کاغذ نادر به نظر میرسه، عملاً هر چند تماس یه بار اتفاق میافته.
راهحل معمول اینه که بری سراغ پلن گرانتر ارائهدهنده: Priority tier آنتروپیک، priority processing اوپنایآی یا priority inference گوگل. اینا سریعتر و باثباتترن ولی هزینهٔ هر توکن رو دوبرابر میکنن. پیشنهاد نویسنده اینه که رو همون پلن استاندارد بمونی و هر درخواست رو دوبار بفرستی و هر جوابی زودتر رسید رو برداری. هزینهش هم دقیقاً همون دوبرابره.
برای مقایسه، ۵۰ درخواست واقعی production رو رو هر دو حالت دوباره اجرا کردن. تو زمان تا اولین توکن، میانه تقریباً برابر بود (۰.۶۱ در برابر ۰.۵۸ ثانیه)، ولی p99 از ۴.۲ ثانیه رو پلن priority به ۱.۲ ثانیه رو حالت دوبار فرستادن رسید. تو زمان تا جواب کامل هم میانهٔ هر دو ۱.۳۵ ثانیه بود، اما بدترین حالت از ۹.۸ ثانیه اومد رو ۳.۵ ثانیه.
نویسنده تأکید میکنه این ترفند شرط داره: فقط وقتی جواب میده که جوابهای کند نادر و مستقل از هم باشن، چون اونوقت احتمال اینکه هر دو کپی همزمان کند بشن خیلی کمه. حرف آخرش هم اینه که قبل از پول دادن برای پلن سریعتر، اول همین روش ساده رو بنچمارک کن، شاید با همون هزینه تأخیر بهتری بگیری.
نکات کلیدی:
- پلنهای priority هزینهٔ هر توکن رو دوبرابر میکنن؛ دوبار فرستادن درخواست هم دقیقاً همون دوبرابره
- تو تست ۵۰ درخواستی، بدترین زمان تا جواب کامل از ۹.۸ ثانیه به ۳.۵ ثانیه رسید
- بدترین زمان تا اولین توکن از ۴.۲ ثانیه به ۱.۲ ثانیه اومد پایین
- میانهٔ زمان تا جواب کامل تو هر دو حالت ۱.۳۵ ثانیه بود
- با ۱٪ درخواست کند، یه تماس ۲۵ نوبتی حدود ۲۲٪ شانس سکوت طولانی داره
- شرط کار کردن روش: کندیها نادر و مستقل از هم باشن




