LocateAnything انویدیا: تشخیص اشیا با رمزگشایی موازی جعبه
خلاصهٔ کاملتر
مدلهای زبانی-تصویری (VLM) معمولاً مسئلهی مکانیابی و تشخیص شیء را به شکل تولید توکنهای مختصات حل میکنن: هر کادر دوبعدی به چند توکن یکبعدی تبدیل و تقریباً مستقل از هم رمزگشایی میشه. این روش با ساختار بههمپیوستهی هندسهی کادر جور درنمیاد و چون کاملاً ترتیبیه، یک گلوگاه سرعت میسازه.
انویدیا برای حل این مشکل LocateAnything را معرفی کرده؛ چارچوبی یکپارچه برای مکانیابی و تشخیص که روی ایدهی Parallel Box Decoding (PBD) بنا شده. در این روش هر کادر (یا نقطه) یک «واحد اتمی» با طول ثابت در نظر گرفته میشه و کل مجموعه مختصات (x1, y1, x2, y2) در یک قدم موازی پیشبینی میشه. این کار هم هماهنگی هندسی داخل کادر را حفظ میکنه و هم موازیسازی زیادی آزاد میکنه.
مدل سه حالت استنتاج داره: حالت Fast که همهی کادرها را موازی پیشبینی میکنه و برای رباتها و دستگاههای محدود مناسبه؛ حالت Slow که توکنها را ترتیبی و با بیشترین پایداری تولید میکنه و برای برچسبزنی دقیق خوبه؛ و حالت Hybrid که بهصورت پیشفرض Fast است و فقط هنگام بیقاعدگی یا ابهام مکانی به Slow برمیگرده.
بخش دیگر کار داده است. انویدیا مجموعهی LocateAnything-Data را با بیش از ۱۳۸ میلیون نمونهی آموزشی، ۱۲ میلیون تصویر یکتا و ۷۸۵ میلیون کادر گردآوری کرده که شامل تشخیص اشیای عمومی، گراندینگ عناصر رابط کاربری، OCR و چیدمان اسناد میشه.
در نتایج، LocateAnything در حالت Hybrid به ۱۲.۷ کادر در ثانیه میرسه؛ بیش از ۱۰ برابر سریعتر از Qwen3-VL و حدود ۲.۵ برابر سریعتر از Rex-Omni. علاوه بر سرعت، دقتش هم بهتره؛ بهخصوص در آستانههای IoU بالا و در صحنههای شلوغ، و در گراندینگ رابط کاربری و درک اسناد رکوردهای تازهای ثبت کرده.
نکات کلیدی:
- Parallel Box Decoding کل مختصات یک کادر را در یک قدم موازی پیشبینی میکنه
- سه حالت Fast، Slow و Hybrid برای تعادل بین سرعت و دقت
- مجموعهدادهی LocateAnything-Data با بیش از ۱۳۸ میلیون نمونه
- بیش از ۱۰ برابر سریعتر از Qwen3-VL با دقت بالاتر در IoU بالا




