Seedance 2.5: ویدیوی ۳۰ ثانیهای با ۵۰ تصویر مرجع
خلاصهٔ کاملتر
Seedance 2.5 تازهترین نسخهٔ مدل ویدیوسازی هوش مصنوعیه که از راه Dreamina در دسترسه. مهمترین تغییرش دو تاست: طول هر تولید تا ۳۰ ثانیه رفته بالا و سیستم omni reference حالا تا ۵۰ تصویر مرجع رو همزمان قبول میکنه. نویسنده که یک فیلم کوتاه دو دقیقهای رو تقریباً کامل با همین حالت ۳۰ ثانیهای ساخته، میگه نسبت به نسخهٔ ۲.۰ تو بازیگری و اجرای صحنه یک قدم واقعی جلوتره.
به گفتهٔ نویسنده، حالت ۳۰ ثانیهای بیشتر از چیزی که انتظار داشته به درد صحنههای دیالوگمحور خورده، چون شخصیتها وقت دارن حرفشون رو کامل بزنن و واکنش نشون بدن. نکتهٔ عملیش اینه که تو یک برداشت ۳۰ ثانیهای، حتی وقتی بخشی از کار خراب درمیاد معمولاً چند تکهٔ قابل استفاده باقی میمونه و تدوینگر میتونه همونها رو دربیاره، بهجای اینکه کل کلیپ رو دور بندازه.
کل هویت بصری اون فیلم کوتاه فقط روی سه تصویر مرجع سوار بوده: دو پرترهٔ شخصیت و یک نمای محیط. یک تست جداگانه با یک کمد لباس کامل هم نشون داده مدل میتونه لباس شخصیت رو تو یک تولید چندبار عوض کنه و بازم قابلتشخیص نگهش داره. فقط ترتیب نماها تضمینی نیست؛ وقتی مجموعهای از فریمهای اول به مدل داده شده، نماها درست ساخته شدن ولی نه لزوماً به ترتیب درست.
واضحترین یافتهٔ مقاله اینه که پرامپتهای تنظیمشده برای نسخهٔ ۲.۰ روی ۲.۵ قابل اتکا نیستن و میتونن خروجی گلیچدار بدن. این مدل با پرامپتهای پرکات و تندتند میونهٔ خوبی نداره و صحنههایی که کمی نفس میکشن بهتر درمیان. صدا هم پیشبینیپذیر نیست: مدل ظاهراً از روی تصاویر مرجع حدس میزنه شخصیت باید چه صدایی داشته باشه و یک بار بدون درخواست، لهجهٔ بریتانیایی داده.
دو ایراد هم باقیمونده: مورفینگ و بیثباتی تصویر تو سکانسهای پرحرکت و اکشن که با آپاسکیل هم پاک نمیشه، و سقف رزولوشن 720p که یک مرحله آپاسکیل جداگانه رو عملاً اجباری میکنه. از نظر هزینه، نویسنده تولید اون فیلم کوتاه رو بین ۹۰ تا ۳۵۵ دلار تخمین زده؛ در حالی که نسخهٔ فیلمبرداریشدهش حتی به شکل مستقل و کمخرج، ۲۰ تا ۳۵ هزار دلار آب میخورده.
نکات کلیدی:
- طول تولید تا ۳۰ ثانیه رسیده و برای صحنههای دیالوگمحور بیشترین فایده رو داره
- سیستم omni reference تا ۵۰ تصویر مرجع رو قبول میکنه، ولی سه تصویر هم برای یک فیلم کوتاه کافی بوده
- پرامپتهای نسخهٔ ۲.۰ روی ۲.۵ قابل اتکا نیستن و باید بازنویسی بشن
- لهجه و صدای شخصیت از روی تصاویر مرجع حدس زده میشه و به کلمهبندی پرامپت خیلی حساسه
- خروجی روی 720p قفله و مورفینگ تو صحنههای پرحرکت هنوز حل نشده




