SAM 3.1 حالا روی Meta Model API
خلاصهٔ کاملتر
متا تو صفحهی معرفی SAM 3.1 (مخفف Segment Anything Model) میگه این مدل حالا مستقیم روی Meta Model API در دسترسه. SAM 3.1 سه تا کار رو با هم انجام میده: detection (یعنی پیدا کردن اشیا توی تصویر)، segmentation (یعنی مشخص کردن مرز دقیق هر شیء در حد پیکسل) و tracking (یعنی دنبال کردن همون شیء توی فریمهای ویدیو). نکتهی اصلی اینه که دیگه لازم نیست مدل رو خودتون میزبانی یا تنظیم کنین.
به گفتهی متا، بیشتر مدلهای multimodal فقط یه برچسب و یه bounding box (یعنی مستطیلی دور شیء) برمیگردونن و بقیهی کار رو میسپارن به خودتون. SAM 3.1 اما با یه درخواست هم ماسک دقیق شیء رو میده و هم توی ویدیو دنبالش میکنه، طوری که هویت هر شیء بین فریمها حفظ میشه. این مدل zero-shot هست، یعنی بدون دادهی آموزشی، fine-tuning یا مدل اضافه کار میکنه.
استفاده ازش سادهست: یه عبارت اسمی کوتاه که یه چیز رو نام میبره به مدل میدین و مدل برای هر موردی که پیدا کنه یه box و یه mask برمیگردونه. متا میگه SAM 3.1 روی زیرساخت inference مخصوص معماری DETR خودش اجرا میشه، تا از همون روز اول throughput لازم برای محیط production رو داشته باشین.
SAM 3.1 کلید، مستندات، صورتحساب و ساختار درخواست مشترکی با بقیهی مدلهای متا داره. یعنی میتونین توی یه pipeline از Muse Spark برای استدلال و تولید متن، از Muse Voice Transcribe برای تبدیل گفتار به متن و از SAM 3.1 برای کار با تصویر و ویدیو استفاده کنین. API با کلاینتهای سازگار با OpenAI SDK کار میکنه و یه Playground هم برای امتحان مدل روی فایلهای خودتون هست.
نکات کلیدی:
- اسم مدل توی API: sam-3-1
- قیمت برای تصویر: 2.50 دلار به ازای هر 1000 تصویر
- قیمت برای ویدیو: 0.20 دلار به ازای هر 1000 فریم
- zero-shot کار میکنه و به fine-tuning یا دادهی آموزشی نیاز نداره
- با کلاینتهای سازگار با OpenAI SDK قابل استفادهست




