LTX-2.5؛ ویدیو و صدا با هم، روی سیستم خودت
خلاصهٔ کاملتر
LTX-2.5 مدل ویدیوسازی تازهٔ Lightricks ـه که بهجای ساختن کلیپ بیصدا و چسبوندن صدا بهش، تصویر و صدا رو با هم و توی یه پاس تولید میکنه. همین باعث میشه دیالوگ، صدای محیط و اتفاقی که توی تصویر میافته بدون پایپلاین صوتی جداگونه سر جاشون بشینن. ورودیش میتونه پرامپت متنی، یه عکس مرجع یا حتی یه ویدیوی دیگه باشه و از طریق ComfyUI روی سختافزار خودت اجرا میشه.
این نسخه چند چیز تازه داره: تولید multi-shot که سعی میکنه هویت شخصیت، نورپردازی و صدا رو بین چند کات ثابت نگه داره، یه دیکودر ویدیوی دیفیوژنی جدید، و یه چکپوینت distilled (یعنی نسخهٔ تقطیرشده که سریعتره ولی یهکم از کیفیت میزنه) با ۲۲ میلیارد پارامتر. نصبش یه نود سفارشی ComfyUI میخواد بهعلاوهٔ دانلود دستی فایلهای مدل از Hugging Face که gated ـه و باید اول لایسنسش رو قبول کنی.
سختافزار جای دردناک ماجراست. با دقت کامل حدود ۶۶ گیگابایت VRAM مصرف میشه، یعنی عملاً کارت ۸۰ گیگی مثل A100 یا H100 لازمه، چه مال خودت باشه چه اجارهای. نسخههای کوانتایزشده مصرف رو به حدود ۳۰ تا ۳۵ گیگ میرسونن که روی کارت ۴۸ گیگی جا میشه، ولی یه افت کیفیت اضافه هم روش سواره. فقط برای خود فایلها هم باید ۷۰ تا ۸۰ گیگ فضای دیسک خالی داشته باشی.
نویسنده تستهای خودش رو بدون گلچینکردن منتشر کرده و نتیجه با دموهای رسمی فرق داره: توی یه تست، ماشین بهجای جلو رفتن عقب میرفت و چراغ راهنمایی همزمان سبز و زرد بود؛ توی یه تست انیمهای هم جزئیات چهرهٔ شخصیت و یه پاپیون بههم ریخت. الگوی تکراری اینه که سینک صدا معمولاً درست درمیاد ولی جزئیات تصویری و فیزیک حرکت میلنگه. به گفتهٔ نویسنده فعلاً برای آزمایش و پروتوتایپ با بازبینی انسانی خوبه، نه برای خط تولید کاملاً خودکار.
نکات کلیدی:
- تصویر و صدا توی یه پاس تولید میشن، پس نیازی به مدل صوتی جدا و سینک دستی نیست
- دقت کامل حدود ۶۶ گیگابایت VRAM میخواد؛ عملاً کارت ۸۰ گیگی مثل A100 یا H100
- نسخههای کوانتایزشده حدود ۳۰ تا ۳۵ گیگ مصرف دارن و روی کارت ۴۸ گیگی اجرا میشن
- چکپوینت تقطیرشدهٔ ۲۲ میلیارد پارامتری برای سرعت بیشتر، به قیمت کمی کیفیت
- فایلهای مدل روی Hugging Face بهصورت gated هستن و ۷۰ تا ۸۰ گیگ دیسک میخوان
- توی تستهای خام: حرکت معکوس، چراغ راهنمایی دورنگ و بههمریختن جزئیات شخصیت




