Count Anything؛ شمارش هر چیزی با راهنمای متنی
خلاصهٔ کاملتر
به گفتهی نویسندهها، مسئلهی شمارش اشیا تو بینایی ماشین خیلی پراکنده مونده. هر مدلی معمولاً فقط برای یه سناریوی خاص ساخته شده — مثلاً شمارش جمعیت، خودرو، سلول، محصولات کشاورزی یا اشیای تصاویر ماهوارهای — و برای همین نمیتونه بین دستهها، دامنههای تصویری مختلف، اندازهها و تراکمهای متفاوت تعمیم پیدا کنه.
تو این مقاله اومده که راهحل، شمارشِ هدایتشده با متن بین دامنههاست: مدل یه تصویر و یه پرسش به زبان طبیعی میگیره و یه مجموعه نقطه برمیگردونه که هر نقطه روی یه نمونه از شیء هدف نشسته، و تعدادشون همون جوابِ شمارشه. این کار شمارشِ مشروط به دسته رو با مکانیابی فضاییِ قابلتفسیر یکی میکنه؛ یعنی فقط یه عدد نمیده، بلکه نشون میده هر شیء کجاست.
برای پشتیبانی از این حالت، نویسندهها دیتاستی به اسم CLOC ساختن که منابع عمومیِ مختلف رو تو یه بنچمارک واحد سامون داده. این دیتاست شش دامنهی تصویری رو پوشش میده: صحنههای عمومی، تصاویر ماهوارهای، بافتشناسی، میکروسکوپ سلولی، کشاورزی و میکروبیولوژی — حدود ۲۲۰ هزار تصویر، ۶۱۹ دسته و ۱۵ میلیون نمونهی شیء.
برخلاف روشهای رایج که بر پایهی نقشهی چگالی کار میکنن، مدل Count Anything از نقاط گسستهی هر نمونه استفاده میکنه و شمارش رو تو دو سطح انجام میده. یه شمارندهی پراکندهی سطحِ ناحیه برای هدفهای بزرگ و پراکنده لنگرگاه میسازه، و یه شمارندهی متراکم سطحِ پیکسل سراغ هدفهای ریز، شلوغ و کممرز میره و نقاط رو متراکم پیشبینی میکنه.
نویسندهها میگن یه استراتژیِ نظارتِ نقطهمحور باعث میشه مدل بتونه از دادههایی با برچسبگذاریِ ناهمگن یاد بگیره، و یه بخش به اسم Complementary Count Fusion خروجی دو شمارنده رو بدون هیچ پارامتر اضافهای با هم ترکیب میکنه. به گفتهی اونها، آزمایشهای گسترده نشون میده این مدل دقت خوب و تعمیم چنددامنهای داره و از روشهای موجودِ شمارشِ دنیای باز بهتر عمل میکنه. کد هم روی GitHub منتشر شده.
نکات کلیدی:
- مدل با یه پرسش متنی، اشیای خواستهشده رو میشمره و جای هرکدوم رو هم نقطهگذاری میکنه
- دیتاست CLOC شش دامنه، ۲۲۰ هزار تصویر، ۶۱۹ دسته و ۱۵ میلیون نمونه داره
- بهجای نقشهی چگالی، از نقاط گسسته و شمارش دوسطحی (ناحیه و پیکسل) استفاده میکنه
- نویسندهها ادعا میکنن از روشهای موجودِ شمارشِ باز بهتره و کدش هم منتشر شده




