تست دقت OCR مدل نورث میکروویژن
خلاصهٔ کاملتر
North MicroVision، مدل بینایی-زبانی متنبازِ کوهیر با لایسنس Apache 2.0، توی یه تست عملی روی دستخط، معادلات فیزیک، فاکتور چاپی، دستخط فرانسوی و متن روزنامهٔ عربی سنجیده شده. جمعبندی نویسنده اینه که فاصلهٔ بین بهترین و بدترین نتیجهٔ این مدل اونقدر زیاده که برای هر کسی که میخواد ازش تو محیط واقعی استفاده کنه مهمه — مخصوصاً که فقط ۲.۴ میلیارد پارامتر داره و انتظارها باید در همین حد باشه.
واضحترین الگو اینه که چاپی خیلی بهتر از دستنویسه. روی یه فاکتور چاپی با جدول ساختاریافته، مدل همهٔ فیلدها رو درست درآورد، جمعها دقیق خوند و خروجی بدون خطا بود؛ دقیقاً همون کاری که این مدلهای کوچیک این روزها براش استفاده میشن، یعنی بیرون کشیدن داده از رسید و فرم و فاکتور. اما روی یه یادداشت دستنویس چندزبانه، حروف بزرگ رو نادیده گرفت، یه علامت سؤال از خودش اضافه کرد و حتی توی بخش انگلیسی هم چند کلمه رو غلط خوند.
معادلات فیزیکِ دستنویس نتیجهٔ دوگانهای داد: چند معادلهٔ واقعاً سخت مثل بازهٔ فضا-زمان و ضریب لورنتس رو تمیز به LaTeX تبدیل کرد، ولی وسط یه دنبالهٔ طولانی و پُرعلامت، رشتهٔ کار از دستش در رفت و شروع کرد به تکرار خودش — ایرادی که تو مدلهای کوچیک موقع تولید خروجی ساختاریافتهٔ طولانی زیاد دیده میشه.
مرز اصلی اما زبانه. دستخط شکستهٔ فرانسوی روی سربرگ یه پزشک تقریباً بینقص خونده و ترجمه شد و مدل حتی یادداشت دستنویس رو از سربرگ چاپی و مهر جدا کرد. در مقابل اردو اصلاً فهمیده نشد و اندونزیایی هم غلطهای آشکار داشت: «mau» به معنی «خواستن» شد «may» و «kopi» (قهوه) به «roti» (نان) تبدیل شد. یه بنر متراکم و راستبهچپ روزنامهٔ عربی هم عملاً از هم پاشید.
نویسنده میگه برای تیمی که با سند چاپی و ساختاریافته به انگلیسی یا زبانهای اروپایی کار میکنه، این مدل انتخاب معقولیه: کمی بیشتر از ۵ گیگابایت ویرم میگیره، روی یه GPU معمولی راه میافته و لایسنس Apache 2.0 هیچ محدودیتی برای استفادهٔ تجاری نمیذاره. ولی ادعای «چندزبانه» بودنش قید و شرط میخواد، و راه بستن این شکافها fine-tune روی دادهٔ همون زبان یا حوزهست.
نکات کلیدی:
- ۲.۴ میلیارد پارامتر، لایسنس Apache 2.0، وزنها بدون gate روی هاگینگفیس
- کمی بیشتر از ۵ گیگابایت ویرم روی RTX A6000
- فاکتور چاپی با جدول: استخراج کامل و بدون خطا
- اردو فهمیده نشد؛ اندونزیایی «kopi» رو «roti» خوند
- خروجی LaTeX معادلات درست بود ولی در متن طولانی تکراری شد




