Sol، بهترین مدل بیناییِ OpenAI تا امروز
خلاصهٔ کاملتر
OpenAI هفتهٔ گذشته خانوادهٔ GPT-5.6 رو با سه مدل Sol و Terra و Luna معرفی کرد و تو استریم معرفی، تمرکز اصلی روی computer use بود؛ یعنی مدلی که خودش بین اپلیکیشنهای دسکتاپ میچرخه و باهاشون کار میکنه. تیم Roboflow این سه مدل رو روی بنچمارک VLM خودش اجرا کرده، بنچمارکی که قراره چند هفتهٔ دیگه منتشر بشه و تشخیص شیء، شمارش، OCR و استخراج داده رو میسنجه. به گفتهٔ نویسنده نتیجه روشنه: Sol بهترین مدل بیناییایه که OpenAI تا حالا بیرون داده.
واضحترین جهش تو تشخیص شیءه. GPT-5.5 تو این بنچمارک فقط 13.8 امتیاز mAP@50 گرفته بود، Sol رسیده به 46.2 و Terra و Luna هم با 44.7 و 43.3 پشت سرشن. یه نکتهٔ عملی مهم هم هست: باید از مدل بخوای مختصات رو به شکل XYXY مطلق و برحسب پیکسلِ تصویر برگردونه. فرمت اشتباه حدود 15 امتیاز mAP از دقت کم میکنه. این دقیقاً برعکسِ Gemini 3.5 Flash ـه که با YXYX نرمالشده تو بازهٔ 0 تا 1000 بهترین جواب رو میده.
یه ایراد جالب هم پیدا شده: Sol گاهی جعبههایی برمیگردونه که هیچ همپوشانیای با اشیای واقعی تصویر ندارن و به شکل ردیفهای صاف یا گروههای همفاصله چیده شدن. Roboflow این نمونهها رو با OpenAI درمیون گذاشته و اونا تأیید کردن که Sol روی تصویرهای حدود 2000 در 2000 پیکسل و بزرگتر ناپایدار میشه، مخصوصاً وقتی reasoning effort پایین باشه. بالا بردن reasoning effort کمک میکنه ولی توکن و تأخیر و هزینه رو میبره بالا، پس راهحل عملیتر اینه که تصویر رو قبل از فرستادن به API کوچیک یا کراپ کنی.
تو شمارش، Sol به 73 درصد رسیده در برابر 64.9 درصدِ GPT-5.5، و Terra و Luna هم 67.6 و 66.2 گرفتن؛ یعنی حتی ارزونترین مدلِ خانواده از نسل قبل جلو زده. Sol حتی تو کیسهای سخت مثل شمردن براکتهای فلزیِ روی هم افتاده خوب عمل کرده. ولی OCR تقریباً درجا زده: 90.7 درصد برای Sol در برابر 91.2 درصد برای GPT-5.5، و تو استخراج متنِ هدفمند حتی افت داشته و از 87.6 به 82.5 درصد رسیده.
نقطهٔ ضعف اصلی هزینه و سرعته. Sol برای هر تصویر نزدیک 10 ثانیه وقت میبره و حدود 2.5 سنت خرج برمیداره؛ Terra حدود 6 ثانیه و 1 سنت، و Luna کمی بیش از 5 ثانیه و زیر نیم سنت. نویسنده میگه Gemini 3.5 Flash با 0.8 سنت هنوز تو تشخیص و شمارش صدرنشینه، پس برای کارهای پرحجم انتخاب بهتری میمونه. جمعبندیش اینه که OpenAI حالا بینایی رو جدی گرفته، هرچند Sol هنوز ایرادهای خودشو داره.
نکات کلیدی:
- تشخیص شیء از 13.8 به 46.2 امتیاز mAP@50 رسیده؛ Terra و Luna هم 44.7 و 43.3 گرفتن.
- مختصات باید XYXY مطلق و برحسب پیکسل خواسته بشه؛ فرمت اشتباه حدود 15 امتیاز mAP هزینه داره.
- Sol روی تصویرهای بزرگتر از حدود 2000 در 2000 پیکسل ناپایدار میشه، مخصوصاً با reasoning effort پایین.
- OCR پیشرفتی نداشته: 90.7 درصد در برابر 91.2 درصدِ GPT-5.5، و استخراج متن از 87.6 به 82.5 درصد افت کرده.
- هزینهٔ هر تصویر: Sol حدود 2.5 سنت، Terra حدود 1 سنت، Luna زیر 0.5 سنت، Gemini 3.5 Flash حدود 0.8 سنت.




