سریعنگهداشتن ChatGPT در عصر کدنویسی ایجنتیک
خلاصهٔ کاملتر
به گفتهٔ اسپیر، دو تا شتاب همزمان دارن اتفاق میافتن: یکی رشد کاربر — ChatGPT تو پنج روز به یک میلیون کاربر رسید و تا فوریهٔ امسال ۹۰۰ میلیون کاربر فعال هفتگی داشته — و یکی هم شتابِ خودِ توسعه. با ایجنتها و Codex، مهندسها موازی کار میکنن و حجم تغییری که وارد سیستم میشه خیلی بیشتر شده.
نکتهٔ اصلی حرف نویسنده اینه که هر خط کد جدید یه هزینهٔ پنهان داره؛ یه if اضافه، یه ریکوئست شبکهٔ بیشتر، یه ساختار دادهٔ اضافه تو حافظه. اینها اولش نامرئیان ولی از یه بودجهٔ مشترک خرج میکنن و کمکم روی هم جمع میشن. با این نرخ بالای تغییر، اون لحظهای که باید نگران کندی و کمبود منابع بشی، زودتر میرسه.
اسپیر تأکید میکنه که تو اپلیکیشنهای AI همه فقط به inference فکر میکنن، ولی مسیر یه درخواست خیلی بزرگتره. قبل از اینکه پیام به موتور inference برسه، باید هویت و پلن کاربر چک بشه، تاریخچهٔ گفتگو و فایلها fetch بشن، و متن توکنایز و در صورت لزوم کوتاه (truncate) بشه. اینها CPU و RAM و I/O مصرف میکنن، نه GPU. پس اگه بقیهٔ مسیر کند باشه، سریعترین مدل هم به درد نمیخوره.
راهحلی که نویسنده پیشنهاد میده اینه که خودِ پرفورمنسانجینیرینگ هم سریعتر بشه، نه اینکه جلوی سرعت تیم رو بگیره. لوپ reactive — پیداکردن رگرسیون، پروفایلینگ، ریشهیابی، پیشنهاد و پیادهسازی فیکس و بنچمارک — که معمولاً سریالی و کنده، باید با ایجنتها خودکار بشه؛ لوپ active هم موازی: چند ایجنت همزمان دنبال بهینهسازی روی هاتپث، مصرف CPU، allocationها و bundle size بگردن.
نکات کلیدی:
- تا فوریهٔ ۲۰۲۶، ChatGPT حدود ۹۰۰ میلیون کاربر فعال هفتگی داشته و تو ۵ روز به اولین میلیون رسیده بود.
- تو OpenAI تا اکتبر ۲۰۲۵، حجم PRهای هفتگی هر مهندس ۷۰٪ رشد کرده و هر PR رو Codex ریویو میکنه.
- هزینهٔ پنهانِ تغییرات کوچیک روی هم جمع میشه و headroom رشد رو کم میکنه.
- بخش بزرگی از لتنسی بیرون از inferenceه: fetch context، توکنایزیشن، سریالایز و شبکه که CPU و RAM و I/O میخورن نه GPU.
- جواب، خودکار و موازیکردن لوپهای reactive و active پرفورمنس با ایجنتهای همیشهروشنه.




