LLM Wiki v2: چطور یک پایگاه دانش هوشمند بسازیم که خودش سالم بمونه
خلاصهٔ کاملتر
ایدهی اصلی LLM Wiki از کارپاتی اینه که بهجای اینکه هر بار از نو استدلال کنیم، دانش رو انباشته کنیم. RAG (بازیابی و تولید) فقط یادآوری میکنه و فراموش میکنه؛ اما یک ویکی خوب تجمیع میکنه و رشد میکنه. LLM Wiki v2 بر همین پایه بنا شده، با این تفاوت که درسهای حاصل از ساخت و اجرای این الگو در مقیاس واقعی رو هم اضافه کرده.
مهمترین چیزی که در نسخهی اصلی کم بود، چرخهی عمر دانش است. همهی اطلاعات یکسان نیستند؛ یک باگ کشفشدهی هفتهی پیش مهمتر از یکی شش ماه پیشه. برای این کار سه مفهوم کلیدی معرفی میشه: امتیاز اطمینان (confidence score) که نشون میده هر ادعا چقدر پشتیبانی دارد و چقدر تازهست؛ جانشینی (supersession) که وقتی اطلاعات جدید با قدیمی تضاد داره، نسخهی قدیمی رو بهصورت مرتب آرشیو میکنه؛ و فراموشی برنامهریزیشده که اطلاعات کماستفاده رو بهتدریج کماولویت میکنه، نه پاک.
لایهبندی حافظه هم یکی از ایدههای محوری این الگوست. اطلاعات از خام تا پخته در چهار لایه سازماندهی میشن:
- حافظهی کاری: مشاهدات تازه که هنوز پردازش نشدن
- حافظهی رویدادی: خلاصهی سشنها، فشردهشده از مشاهدات خام
- حافظهی معنایی: حقایق تاییدشدهی میانسشنی
- حافظهی رویهای: الگوها و فلوهای کاری که از تکرار استخراج شدن
بهجای صفحات تخت با لینکهای ساده، گراف دانش تایپشده پیشنهاد میشه. LLM هنگام پردازش منابع، موجودیتها (کتابخانه، پروژه، تصمیم، فرد) و روابط تایپشدهی بینشون رو استخراج میکنه. مثلاً رابطهی «A باعث B شد، تاییدشده توسط ۳ منبع، اطمینان ۰.۹» خیلی مفیدتر از یک لینک سادهست. با این ساختار، جستجو از keyword matching به graph traversal ارتقا پیدا میکنه؛ یعنی وقتی میپرسی «ارتقاء Redis چه تأثیری داره؟» LLM از گره Redis شروع میکنه و همهی چیزهای وابسته رو پیدا میکنه.
برای جستجوی مقیاسپذیر، ترکیب سه رویکرد پیشنهاد میشه: BM25 برای تطابق کلیدواژه، جستجوی برداری (vector search) برای شباهت معنایی، و graph traversal برای روابط ساختاری. نتایج با reciprocal rank fusion ترکیب میشن تا بهترین کارایی رو داشته باشن. فایل index.md برای خوانایی انسانی نگه داشته میشه ولی دیگه تنها مسیر جستجو نیست.
بخش اتوماسیون هم مهمه؛ ویکیها معمولاً به این دلیل کنار گذاشته میشن که نگهداریشون خستهکنندهست. این الگو پیشنهاد میکنه همهی کارهای دفتری (ingest خودکار، lint دورهای، فشردهسازی سشن، تشخیص تضاد) بهصورت event-driven اتوماتیک بشن. انسان فقط برای راهنمایی و کیوریشن در حلقه میمونه.
در نهایت، فایل schema (مثل CLAUDE.md یا AGENTS.md) مهمترین فایل سیستمه. این فایل تعریف میکنه چه موجودیتهایی وجود دارن، چطور باید منابع مختلف را ingest کرد، چه وقت صفحهی جدید بسازیم، و چطور تضادها را حل کنیم. این schema با زمان تکامل پیدا میکنه و قابل اشتراکگذاریه.
نکات کلیدی:
- ویکی بدون چرخهی عمر دانش، بهمرور تبدیل به جعبهی آشغال میشه
- امتیاز اطمینان (confidence score) هر ادعا رو از یک متن ساده به یک موجودیت زنده تبدیل میکنه
- گراف دانش تایپشده روابطی رو نشون میده که جستجوی کلیدواژه از دست میده
- ترکیب BM25 + vector search + graph traversal بهترین نتیجهی جستجو رو میده
- اتوماسیون event-driven باعث میشه ویکی زنده بمونه، نه رها بشه
- schema اصلیترین فایل سیستمه و قابل انتقال به دیگران است




