نورث میکروویژن، مدل بینایی ۲.۴ میلیاردی کوهیر
خلاصهٔ کاملتر
کوهیر لبز مدل بینایی-زبانی North MicroVision رو منتشر کرده؛ یه مدل ۲.۴ میلیارد پارامتری با لایسنس Apache 2.0 که روی هاگینگفیس با نام CohereLabs/North-Micro-Vision-Instruct در دسترسه و برخلاف خیلی از مدلهای کوهیر، gate نشده. تمرکزش روی خوندنه: OCR، فرم، جدول، نمودار و سند. حرف اصلیش پردازش با رزولوشن اصلیه — یعنی عکس رو قبل از خوندن کوچیک نمیکنه — که برای متن ریز و جدولهای شلوغ فرق بزرگی میسازه.
معماریش سه مرحلهست. اول یه vision encoder عکس رو با همون اندازهٔ واقعی به توکن تصویری تبدیل میکنه. بعد یه multimodal projector — یعنی لایهای که ویژگیهای تصویر رو به همون فضایی میبره که مدل زبانی باهاش کار میکنه — خروجی رو ترجمه میکنه. آخر هم یه مدل زبانی ۲ میلیاردی متن و تصویر رو با هم میخونه. این مدل زبانی ۲۸ لایه داره، با چند لایه sliding window attention (که فقط یه تکهٔ محدود از متن رو میبینه) و بعدش یه لایهٔ full attention، تا مصرف حافظه پایین بمونه.
به گفتهٔ نویسنده، نصبش یه گیر داره: نسخهٔ پایدار transformers هنوز این معماری رو پشتیبانی نمیکنه، پس باید از سورس و از شاخهٔ توسعه نصبش کنی وگرنه مدل اصلاً لود نمیشه. بقیهش همون روال همیشگیه — محیط پایتون جدا، نصب PyTorch و دانلود وزنها از هاگینگفیس. توی تست روی یه RTX A6000، مدلِ کاملاً لودشده کمی بیشتر از ۵ گیگابایت ویرم گرفت؛ یعنی روی هر کارت ۸ گیگ به بالا هم جا میشه.
نتیجهٔ تستها یکدست نیست. یه فاکتور چاپی با جدول و آدرس و جمع کل بینقص استخراج شد و دستخط فرانسوی روی سربرگ هم تقریباً کامل خونده شد؛ مدل حتی متن دستنویس رو از سربرگ و مهر جدا کرد. ولی دستخط انگلیسی چند غلط داشت، خروجی معادلات فیزیک وسط کار تکراری شد، اردو اصلاً فهمیده نشد و یه بنر روزنامهٔ عربی کلاً از هم پاشید. نویسنده میگه نقطهٔ قوت واقعی مدل، سند چاپی و ساختاریافته به زبانهای اروپاییه.
نکات کلیدی:
- ۲.۴ میلیارد پارامتر، لایسنس Apache 2.0، بدون gate روی هاگینگفیس
- مصرف ویرم کمی بیشتر از ۵ گیگابایت روی RTX A6000
- مدل زبانی ۲۸ لایه، ترکیب sliding window attention و full attention
- نصب فقط با transformers از سورس، نه از PyPI
- فاکتور چاپی بینقص؛ اردو و عربی ضعیف




