Knowledge Compressor: نصف کردن توکنهای مستندات
خلاصهٔ کاملتر
زبان طبیعی پر از تکرار و افزونگیه و این تو دنیای مدلهای زبانی یعنی هدر رفتن توکن. تو این مقاله اومده که وقتی حجم زیادی از دانش رو وارد سشن یه ایجنت میکنی، همون تکرارها جای مطالب دیگه رو تو context window (یعنی همون مقدار متنی که مدل میتونه یهجا جلوی چشمش داشته باشه) میگیرن. GitHub Next برای همین Knowledge Compressor رو ساخته: یه پروتوتایپ که مقاله میگیره و تکرار به تکرار توکنهاش رو کم میکنه، به شرطی که دانش داخلش هنوز قابل استفاده بمونه.
به گفتهٔ نویسنده، ایده شبیه تبدیل WAV به MP3 یا PNG به JPEGه، با این فرق که اینجا افت کیفیت باید از دید مدل کم باشه نه از دید آدم. حالا مدل دقیقاً چی رو میبینه؟ اگه از خودش بپرسی احتمالاً یه چیزی سرهم میکنه، پس بهجاش تستش میکنن.
سیستم اول از متن اصلی یه دسته سؤال و جواب درمیآره (تو نمونهٔ نشوندادهشده ۲۴ تا)، بعد هر سؤال رو تو یه context تازه روی متن اصلی امتحان میکنه و اونایی که واقعاً از روی متن جوابپذیر نیستن رو کنار میذاره. این سؤالها عملاً نقش unit test رو برای فشردهسازی بازی میکنن. نویسنده خودش قبول داره که این سنجه بینقص نیست، چون مدل ممکنه از دانش عمومیش جواب بده یا حتی حدس بزنه؛ برای همین متن نمونه رو ساختگی انتخاب کردن.
مرحلهٔ بعد خود فشردهسازیه. یه ایجنت با ابزارهای خوندن متن، شمردن توکن، اعمال diff و اجرای سؤالها میافته به جون مقاله تا وقتی به نظرش دیگه نشه کوتاهترش کرد. ریسکش اینه که ایجنت محافظهکار بازی کنه و تقریباً هیچی کم نکنه، برای همین سیستم میتونه شرط بذاره که حداقل یکی از سؤالها fail بشه؛ اونوقت نتیجهٔ شکست برمیگرده به ایجنت تا فقط همون بخش لازم رو برگردونه. یعنی مرز پایین فشردهسازی رو تجربی پیدا میکنن.
حسابوکتاب هزینه هم جالبه. تو نمونهای که نشون دادن، یه مقالهٔ ۹۹۶ توکنی به ۴۸۰ توکن رسیده و خود این فشردهسازی حدود ۲ دلار خرج برداشته، در حالی که هر بار استفادهٔ بدون کش فقط حدود ۰.۰۰۱ دلار صرفهجویی میکنه. یعنی نقطهٔ سربهسر حدود ۲۰۰۰ بار استفادهست. برای دانشی که قراره مدام لازم شه این خرج درمیآد، برای یه متن یکبارمصرف نه. مدل تستشون GPT-5.6 Sol بوده و متن نمونه («Ferryline») کاملاً ساختگیه تا مطمئن شن مدل از حافظهش جواب نمیده.
نکات کلیدی:
- Knowledge Compressor یه پروتوتایپ از GitHub Nextه که توکن مستندات فنی رو تا حدود نصف کم میکنه
- کیفیت با آزمون کتابباز سنجیده میشه؛ تو نمونهٔ منتشرشده ۲۴ سؤال از متن استخراج شده
- سؤالهایی که از روی متن اصلی جوابپذیر نیستن، قبل از شروع فشردهسازی فیلتر میشن
- برای جلوگیری از محافظهکاری ایجنت، سیستم میتونه شکست حداقل یک سؤال رو الزامی کنه
- نمونه: ۹۹۶ به ۴۸۰ توکن با هزینهٔ حدود ۲ دلار و نقطهٔ سربهسر حدود ۲۰۰۰ بار استفاده




