پولاریس و وگا: دو مدل ویدیویی مرموز
خلاصهٔ کاملتر
تو این مقاله اومده که دو مدل ویدیوسازِ بدون برند با اسمهای رمزی Polaris و Vega تو Artificial Analysis Arena (یعنی همون لیدربوردی که مدلهای تازه رو قبل از معرفی رسمی و ناشناس اونجا تست میکنن) پیدا شدن. فعلاً فقط text-to-video میسازن: کلیپهای حدود ۱۰ ثانیهای، با صدا و رزولوشن 1080p. از تفاوت سبک و کیفیت خروجیها هم برمیآد که این دوتا دو خانوادهٔ مدل جدا از همان، نه دو نسخه از یه سیستم.
همه اول به Meta شک کردن. آزمایشگاه superintelligence این شرکت به سرپرستی Alexander Wang تازگی Muse Image و Muse Glimmer (یه مدل زبانی ایجنتیک متنباز ۳۰ میلیارد پارامتری) رو بیرون داده و گفته بود مدل ویدیویی هم تو راهه. نویسنده میگه این تایمینگ جور درمیآد، ولی هیچجای لیست Artificial Analysis اسم Meta نیومده. گزینههای دیگه Kling 4 از Kuaishou و یه مدل VO تازه از Google هستن.
چیزی که Polaris رو جدا میکنه، ثبات بین کاتهاست. تو یه کلیپ، شخصیت یه سری عدد مینویسه و همون اعداد بعد از هر کات دستنخورده میمونن؛ دقیقاً همونجایی که خیلی از مدلها میلنگن. تو یه تست دیگه، سگی روی شیشه نفس میکشه و بخار گرفتن شیشه و رد کشیدهشدنش درست دراومده، هرچند پوزهٔ سگ اونقدر که باید به شیشه فشرده نمیشه. تو تست بنر و باد هم فیزیک درست اجرا شده و آدم رو الکی تو هوا شناور نکرده.
نقطهٔ قوت Vega دیالوگ چندزبانه با لبخونی هماهنگه. تو یه کلیپ، شخصیت ایتالیایی حرف میزنه و حرکت لبها با صدا سینک میمونه، اون هم توی یه تالار آینه که چند بازتاب همزمان باید هماهنگ بمونن. متن روی تصویر ولی هنوز میلنگه: تو نمونهٔ نقاشیشدن تابلو روی ویترین، حروف تمیز و درست بودن اما بهجای کشیدهشدن یهو ظاهر میشن. با یه پرامپت مشترک بین این دو مدل، خروجی Polaris بهتر ارزیابی شده.
نویسنده جدا از این دو مدل، ابزاری به اسم Stills Lab رو هم معرفی میکنه: یه کتابخونهٔ قابلجستجو از فریمهای فیلم و سریال و موزیکویدیو که برای هر فریم، کد رنگهای پالت و اطلاعات لنز و دوربین ذخیره شده. قابلیت متمایزش جستجوی تصویریه؛ یه عکس آپلود میکنی و فریمهایی با تُن و رنگبندی مشابه تحویل میگیری. یه پلن رایگان داره و یه پلن پولی ارزون.
نکات کلیدی:
- Polaris و Vega فعلاً فقط کلیپ ۱۰ ثانیهای 1080p با صدا و از نوع text-to-video میسازن.
- هیچ شرکتی مالکیتشون رو تأیید نکرده؛ Meta بعد از Muse Image گفته بود مدل ویدیویی نفر بعدیه.
- Muse Glimmer یه مدل ایجنتیک متنباز ۳۰ میلیارد پارامتریه و Muse Spark 1.2 هم قراره متنباز بشه.
- Polaris تو یه تست، شخصیتی با هویت بصری شبیه Batman رو واضح رندر کرده، یعنی گاردریل کپیرایتش شلتره.
- Kling 4 از Kuaishou و مدل VO گوگل دو گزینهٔ بعدی این حدسان.




