Muse Spark 1.3 متا با کانتکست یکمیلیون توکنی
خلاصهٔ کاملتر
Muse Spark 1.3 تازهترین مدل چندوجهی متاست که برای کارهای عاملی طولانی (یعنی وظیفههایی که مدل خودش چند مرحله رو پشت هم پیش میبره)، کدنویسی و کار با کامپیوتر ساخته شده و پنجرهٔ کانتکست یک میلیون توکنی داره. قیمتش ۱.۲۵ دلار برای هر میلیون توکن ورودی و ۴.۲۵ دلار برای خروجیه. زاکربرگ هم تأیید کرده که مدل بهزودی open weight منتشر میشه، یعنی وزنهاش در اختیار هر کسی که بخواد خودش میزبانیش کنه قرار میگیره.
طبق نمودارهایی که تو تست بهشون ارجاع شده، این مدل تو استفاده از ابزار حرفهای و کار عاملی با کامپیوتر از GPT-5.6 و Opus 5 جلو میزنه و تو کدنویسی عاملی هر سه چسبیده به هم هستن. عدد شاخص اما بازیابی کانتکست بلنده: Muse Spark بالای ۹۰ گرفته درحالیکه بقیه به ۶۰ و ۷۰ افتادن و Opus اصلاً نمرهای ثبت نکرده. نویسنده اضافه میکنه که Opus 5 هنوز تو بخشی از کارهای دانشی جلوتره، پس این یک برد یکدست نیست.
جدیترین آزمون یک اکانت خالی AWS بود با یک دستور: یک سایت انیمیشنی خودبسنده بساز و با S3 برای ذخیرهسازی و CloudFront برای تحویل محتوا منتشرش کن. هیچ راهنمای مرحلهبهمرحلهای در کار نبود و مدل باید کل ترتیب کار رو خودش میچید. ردپای استدلالش نشون میده همزمان روی چند کار مستقل جلو رفته، یعنی موقع ساختن زیرساخت داشته HTML انیمیشن رو هم مینوشته، و آخرش یک URL زندهٔ کارکننده تحویل داده.
تو تست بینایی، مدل یک رشته پیام واتساپ رو درست خونده، هر پیام رو به گویندهٔ درستش نسبت داده و شوخی پشت یک سوءتفاهم رو هم گرفته. تو یک مسئلهٔ ترکیبی شیمی و ریاضی هم pH نهایی یک بافر بعد از اضافه شدن اسید قوی رو با استدلال کامل حساب کرده، از جمله توجیه نادیده گرفتن مرحلهٔ دوم تعادل با اختلاف pKa حدود ۵.۵۵. تست ۷۹ زبانه هم با خط بومی درست جواب داده و کل هزینهٔ آزمونها حدود ۲.۴۹ دلار شده. تنها ایراد گزارششده به خود مدل برنمیگرده: بار سنگین سرورها throttling مکرر ساخته.
نکات کلیدی:
- پنجرهٔ کانتکست یک میلیون توکن، با قیمت ۱.۲۵ دلار ورودی و ۴.۲۵ دلار خروجی بهازای هر میلیون توکن
- زاکربرگ تأیید کرده مدل بهزودی بهصورت open weight منتشر میشه
- نمرهٔ بازیابی کانتکست بلند بالای ۹۰ در برابر ۶۰ تا ۷۰ برای GPT-5.6 و Opus 5
- مدل از یک پرامپت، باکت S3 و توزیع CloudFront رو خودش ساخته و یک URL زنده تحویل داده
- تست ۷۹ زبانه با خط بومی درست جواب داده و کل هزینهٔ آزمونها حدود ۲.۴۹ دلار بوده
- تنها ایراد گزارششده throttling مکرر بهخاطر بار سنگین سرورها بوده، نه ضعف خود مدل




