قانون ۶۲.۵ دقیقهای برای کش کلود
خلاصهٔ کاملتر
کش پرامپت در API کلود یه مکانیزمه که بخش ثابت درخواستهات (مثل سیستمپرامپت، تعریف ابزارها، یا کانتکست پروژه) رو ذخیره میکنه تا درخواستهای بعدی ارزونتر بشن. مشکل اینه که این کش فقط ۵ دقیقه عمر داره — و با هر درخواستی که به اون کش بزنه، TTL دوباره به ۵ دقیقه برمیگرده. حالا سوال اینه: اگه داری بیکاری و کش داره منقضی میشه، ارزونتره که یه ping بفرستی و نگهش داری، یا بذاری بمیره و بعداً دوباره بنویسیش؟
جواب ۶۲.۵ دقیقه است. اگه انتظار داری ظرف این بازه دوباره به کش نیاز داشته باشی، هر ۵ دقیقه یهبار تازهاش کن. وگرنه بذار منقضی بشه. این عدد به مدل یا اندازه کش بستگی نداره — چون وقتی قیمت رایت رو تقسیم بر قیمت ریفرش میکنی، همه ضرایب حذف میشن. فقط نسبت قیمتها میمونه، که برای همه مدلها یکسانه.
از نظر اعداد، نوشتن کش ۵ دقیقهای ۱.۲۵ برابر قیمت پایه input هزینه داره، و هر بار خوندن (= تازهسازی) فقط ۰.۱ برابر. پس اگه n بار ریفرش بزنی، کِی هزینه ریفرشها برابر با هزینه یه نوشتن مجدد میشه؟ دقیقاً وقتی n = 12.5، یعنی ۱۲.۵ بار × ۵ دقیقه = ۶۲.۵ دقیقه.
چند تله مهم هم وجود داره که باید بهشون توجه کنی. اول: مدل Opus 4.7 از توکنایزر جدیدی استفاده میکنه که ممکنه همون متن رو تا ۳۵٪ بیشتر توکننویسی کنه — پس اگه پرامپتی رو از Opus 4.6 به 4.7 منتقل میکنی، حتماً با endpoint شمارش توکن بررسی کن. دوم: اگه پریفیکس زیر حداقل آستانه باشه (مثلاً زیر ۴۰۹۶ توکن برای Opus)، کش اصلاً نمیشه و خطایی هم نمیگیری — باید فیلدهای cache_creation_input_tokens و cache_read_input_tokens رو در پاسخ API چک کنی. سوم: پنجره جستجوی کش فقط ۲۰ بلاک به عقبه — اگه agent بیشتر از ۲۰ بلاک اضافه کنه، کش قبلی از دیدرس خارج میشه.
درباره compaction هم — یعنی خلاصهکردن کانتکست بلند به یه نسخه کوتاهتر — فرمول break-even اینه: اگه نسبت فشردهسازی r = S/N باشه (S توکن خروجی، N توکن ورودی)، تعداد ترنهای لازم برای سربهسر شدن برابره با (1 + 62.5r) / (1 - r). یعنی برای فشردهسازی ۱۰ به ۱، حدود ۸ ترن آینده کافیه. برای ۲ به ۱، باید ۶۵ ترن داشته باشی — که اصلاً منطقی نیست.
نکات کلیدی:
- اگه ظرف ۶۲.۵ دقیقه دوباره به کش نیاز داری، هر ۵ دقیقه تازهاش کن — وگرنه بذار منقضی بشه
- این قانون مستقل از مدل و اندازه پریفیکس ثابت میمونه، ولی میزان ضرر مالی از انتخاب اشتباه با مدل فرق میکنه
- Opus 4.7 ممکنه همون متن رو ۳۵٪ بیشتر توکننویسی کنه؛ قبل از مهاجرت چک کن
- پریفیکس زیر آستانه (۴۰۹۶ توکن برای Opus) اصلاً کش نمیشه و خطایی هم نمیگیری
- کش فقط ۲۰ بلاک به عقب نگاه میکنه — اگه agent پُرحرفه، breakpoint اضافه کن
- compaction فقط وقتی بهصرفهست که فشردهسازی خوب باشه و ترنهای کافی پیش رو داشته باشی




