LiteParse؛ پارس سریع و محلی PDF
خلاصهٔ کاملتر
تیم LlamaIndex ابزار متنبازی به اسم LiteParse رو منتشر کرده که فقط روی یه چیز تمرکز داره: پارس سریع و سبک PDF. تو معرفی پروژه اومده که برخلاف سرویسهای ابری، همهچیز محلی روی سیستم خودت اجرا میشه و هیچ وابستگی به LLM یا سرویس ابری نداره. هستهٔ اصلی با Rust نوشته شده و متن رو با کتابخانهٔ PDFium و همراه با مختصات دقیق (bounding box) بیرون میکشه.
خروجی میتونه Markdown، JSON یا متن ساده باشه. حالت Markdown تیترها، جدولها، لیستها، تصاویر و لینکها رو از روی چیدمان فضایی صفحه بازسازی میکنه که برای تغذیهٔ مدلهای زبانی و پایپلاینهای RAG خیلی به کار میاد. سازندهها تأکید میکنن این بازسازی کاملاً مبتنی بر heuristic و قاعدهست، پس روی سندهای پیچیده ممکنه بینقص نباشه — ولی در عوض سریعه.
یه قابلیت کاربردیش دستور is-complex هست: قبل از پارس کامل، با یه پاس ارزون و فقط روی لایهٔ متن چک میکنه که سند اصلاً به OCR یا پردازش سنگینتر نیاز داره یا نه. برای هر صفحه یه حکم و دلیلش (مثل scanned، no-text یا garbled) میده و اگه صفحهای OCR لازم داشته باشه با کد خروجی غیرصفر تموم میشه:
lit parse document.pdf --format markdown -o output.md
lit is-complex document.pdfOCR بهصورت پیشفرض با Tesseract و بدون هیچ نصب اضافهای کار میکنه، ولی میشه هر سرور OCR دیگهای مثل EasyOCR یا PaddleOCR رو با یه API ساده بهش وصل کرد. ورودی هم فقط PDF نیست؛ فایلهای آفیس با LibreOffice و تصاویر بهصورت نیتیو به PDF تبدیل میشن. کتابخونه از Rust، پایتون، نود و تایپاسکریپت و حتی مرورگر با WASM قابل استفادهست و لایسنسش Apache 2.0 هست.
نکات کلیدی:
- پارس محلی و سریع PDF با PDFium، بدون سرویس ابری و بدون LLM
- خروجی Markdown، JSON و متن ساده همراه با bounding box
- تشخیص ارزون پیچیدگی سند قبل از پارس کامل برای مسیردهی یا تخمین هزینه
- OCR داخلی با Tesseract و امکان وصل کردن هر سرور OCR دلخواه
- بایندینگ برای Rust، پایتون، نود و WASM با لایسنس Apache 2.0




