چرا توکنهات اینقدر زود تموم میشه؟
خلاصهٔ کاملتر
هر بار که تو یه چت هوش مصنوعی enter میزنی، مدل کل نخ گفتوگو رو از اول دوباره میخونه: پیام اولت، جواب مدل، پیام دومت و همینطور تا آخر. به این بخش تکرارشونده میگن ورودی تکراری (reused input) و تو یه گفتوگوی طولانی، عمدهٔ توکنی که خرج میشه همینه، نه چیزی که واقعاً تایپ کردی. نویسنده میگه این باگ نیست و بعید هم هست آزمایشگاههای هوش مصنوعی برات درستش کنن، چون انگیزهٔ تجاریشون دقیقاً برعکسه.
همین موضوع توضیح میده چرا جوابهای غلط اینقدر گرون تموم میشن: وقتی میگی «درستش کن»، کل تبادل خراب دوباره فرستاده میشه و اصلاحیه هم روش سوار میشه. پیشنهاد نویسنده سادهست — بهجای پیام بعدی، همون پرامپت اول رو ویرایش کن و دوباره بفرست تا تبادل بد از تاریخچه پاک شه. سؤالهای مرتبط به یه سند رو هم یکجا بپرس و همون اول بگو خروجی چه شکلی باشه؛ اینجوری رفتوبرگشت اضافه پیش نمیآد.
به گفتهٔ نویسنده بیشترین اثر رو شروع یه نخ تازه موقع عوضشدن کار داره، چون گفتوگوهای طولانی حجم زیادی از context تکراری رو با خودشون اینور اونور میبرن. تو کارهای چندمرحلهای هم فقط نتیجهٔ نهایی هر مرحله رو ببر به مرحلهٔ بعد، نه پیشنویسها و منابع ردشده. نکتهٔ کمتوجهشده هم اینه که توکن خروجی یکبار هزینه نداره؛ هر جواب بلند از دور بعد جزو ورودی میشه و بارها حساب میشه.
دربارهٔ فایلها دو تا عادت فرق زیادی میسازه: خودت توی سند دنبال بخش مرتبط بگرد و فقط همون تیکه رو بفرست، و منبع رو تو سبکترین شکل ممکن — متن ساده یا Markdown — بده نه PDF و اسکرینشات. ابزارهای وصلشده هم هزینهٔ پنهان دارن؛ به نوشتهٔ مقاله و بر اساس یافتههای Anthropic، یه چیدمان معمولی با چند سرور ابزار میتونه حدود ۵۵٬۰۰۰ توکن فقط بابت تعریف ابزارها خرج کنه. برای کارهای طولانی هم میمونه compaction در OpenAI و context editing در Anthropic.
نکات کلیدی:
- عامل اصلی مصرف توکن، تاریخچهایه که هر بار دوباره فرستاده میشه، نه چیزی که تایپ میکنی
- پرامپت بد رو ویرایش کن، تو پیام بعدی اصلاحش نکن
- با عوضشدن کار، نخ تازه باز کن؛ بزرگترین صرفهجویی همینه
- فقط خروجی نهایی هر مرحله رو به مرحلهٔ بعد ببر
- خروجی کوتاه بخواه، چون هر جواب بعداً بارها بهعنوان ورودی حساب میشه
- متن ساده بفرست بهجای PDF و اسکرینشات، و فقط ابزارهایی رو وصل کن که همون کار لازم داره




