FLUX 3؛ یه مدل برای تصویر و ویدیو و صدا
خلاصهٔ کاملتر
بلک فارست لبز FLUX 3 رو با دسترسی زودهنگام معرفی کرده: یه مدل پایهٔ چندوجهی که به جای یادگیری جدا از هر رسانه، تصویر و ویدیو و صدا رو با هم و داخل یه معماری واحد یاد میگیره. استدلال تیم اینه که هیچکدوم از این رسانهها بهتنهایی توصیف کاملی از جهان نمیدن؛ هر کدوم فقط یه تصویر ناقص از همون واقعیت زیرین هستن که یه حسگر متفاوت ثبتش کرده.
به گفتهٔ نویسنده، وقتی همهشون با هم یاد گرفته بشن، قیدهای متقابلشون اطلاعات بیشتری میده: صدا باید با ضربه بخونه، حرکت باید از جرم تبعیت کنه و آینده باید از گذشته دربیاد. مبنای فنی کار روش خودشون یعنی Self-Flow هست که تولید و درک چندوجهی رو تو یه معماری همتراز میکنه، و برای FLUX 3 محاسبات و دادهٔ آموزش بهشکل چشمگیری بزرگتر شده.
تو بخش ویدیو، مدل میتونه تو یه بار تولید کلیپهای تا ۲۰ ثانیه با صدای بومی بسازه. حالتهای کاریش شامل متنبهویدیو، تصویربهویدیو (چه ادامهدادن از یه فریم شروع، چه استفاده از تصویر بهعنوان مرجع)، ویدیوبهویدیو برای بردن یه شخصیت به صحنهٔ جدید، ادامهدادن ویدیو و صدای ورودی، تولید از کیفریم برای گذارهای کنترلشده، دیالوگ چندزبانه و زنجیرهکردن ایجنتی کلیپها برای ساخت سکانسهای چندنماست.
ارزیابیها به تصریح خود تیم مقدماتیان و روی کلیپهای ۱۰ ثانیهای ۷۲۰p با صدا انجام شدن. طبق این نتایج، FLUX 3 در برابر Runway Gen-4.5 تو ۷۷٪ و در برابر Luma Ray 3.2 تو ۹۳٪ مقایسهها ترجیح داده شده، و نسبت به Grok Imagine Video تا ۶۹٪، Kling v3 Pro ۶۰٪ و Seedance 2.0 و Gemini Omni Flash ۵۲٪. نویسنده میگه نقطهٔ قوت فعلی مدل، حالت چهرهٔ آدمها، ربطدادن صدا به رویداد فیزیکی و توانایی چندزبانهست.
جالبتر از همه بخش action هست: درک مدل از جهان به پیشبینی حرکت هم کشیده شده. دو مسیر رو رفتن — یکی جاسازی مستقیم پیشبینی کنش تو خود FLUX 3، و دیگری استفاده از backbone ویدیویی بهعنوان پایهای آگاه از دینامیک که مدلهای تخصصی با دادهٔ کم روش fine-tune بشن. حاصل همکاری با mimic robotics هم مدلی به اسم FLUX-mimic برای دستکاری ماهرانهٔ رباتیه.
برنامهٔ انتشار مرحلهایه: اول ویدیو و صدا از طریق API و دسترسی خصوصی به وزنها، بعد پیشبینی کنش برای شرکای منتخب، بعد تصویر، و در نهایت یه backbone چندوجهی با وزن باز به اسم FLUX 3 Dev. هدف بعدی تیم، یکیکردن پیشبینی ادراک و کنش و زبان تو یه مدل واحده.
نکات کلیدی:
- FLUX 3 یه مدل پایهٔ چندوجهیه که تصویر، ویدیو و صدا رو با هم یاد میگیره
- ساخت ویدیوی تا ۲۰ ثانیه با صدای بومی در یک تولید
- مبتنی بر روش Self-Flow با مقیاس محاسباتی بسیار بزرگتر
- برتری ۷۷٪ نسبت به Runway Gen-4.5 و ۹۳٪ نسبت به Luma Ray 3.2 در ارزیابیهای اولیه
- پیشبینی کنش برای رباتیک با همکاری mimic robotics
- انتشار مرحلهای؛ نسخهٔ open-weight به اسم FLUX 3 Dev هم در راهه




