تولید محلی تصویر و ویدیو با ComfyUI
خلاصهٔ کاملتر
تو این مقاله اومده که سرویسهای ابری تولید تصویر و ویدیو کیفیت خوبی دارن، ولی چون بهازای هر خروجی پول میگیرن، اون سبک کاری که بر «تولید انبوه و بعد انتخاب» بنا شده رو گرون میکنن. اجرای محلی این معادله رو برعکس میکنه: بعد از خرید سختافزار، نه هزینهٔ هر تصویر هست، نه محدودیت نرخ، و میشه یه جاب دستهای رو کل شب بدون نگاه کردن به کنتور مصرف اجرا کرد.
به گفتهٔ نویسنده گلوگاه اصلی هم توان محاسباتی نیست، حافظهست. کارت گرافیک مجزا با VRAM ثابت روی مدلهای بزرگ به دیوار میخوره و مجبور میشه لایهها رو به رم سیستم پاس بده که سرعت رو بهشدت میندازه. معماری حافظهٔ یکپارچه این دیوار رو دور میزنه؛ تو ورکاستیشن Ryzen AI Halo که مثال زده، ۱۲۸ گیگابایت حافظهٔ LPDDR5X هست و میشه بخش عمدهش (تو یه پیکربندی ۷۵ درصد) رو به GPU اختصاص داد.
خود ComfyUI یه رابط گرهمحوره که روی همون ایمیج توسعهدهنده از قبل نصب بوده، پس درگیری با درایور ROCm لازم نشده. جریان کار اینطوریه: مدل پایه (اینجا Qwen Image) توی پوشهٔ درست ComfyUI گذاشته میشه، حالت توسعهدهنده/API روشن میشه، یه مدل زبانی از روی یه اسکرینشات چند نسخهٔ متفاوت از پرامپت میسازه، و یه اسکریپت این پرامپتها و seedها رو پشت سر هم به API میفرسته و خروجیها رو جمع میکنه.
کنترلنتها هم چیزی رو اضافه میکنن که با پرامپتنویسی ساده بهدست نمیاد: با یه نقشهٔ لبه (مثل Canny) یا یه اسکلت ژست میشه ترکیببندی یا حالت بدن یه تصویر مرجع رو روی سوژهٔ تازهساختهشده منتقل کرد — همون تکنیک پشت محتواهای «همون ژست، سوژهٔ متفاوت». سرعت رندر هم حدود ۱۹ تا ۲۰ ثانیه برای هر تصویر بوده، اونقدر که یه بچ شبانه خیلی زودتر از انتظار تموم شده.
نویسنده در مورد ویدیو محتاطتره: مدلهای open-weight مثل LTX توی همین محیط اجرا میشن و میشه یه خط تولید کامل محلی داشت (مدل زبانی پرامپت مینویسه، مدل تصویر کاندیدا میسازه، مدل ویدیو انیمیتش میکنه)، ولی هنوز از بهترین مدلهای ابری در کیفیت و یکدستی عقبترن. پس برای آزمونوخطای پرحجم و پروتوتایپ صرف میکنه، و برای یه پلان نهایی و صیقلی شاید هنوز مدل ابری ببره.
نکات کلیدی:
- محدودیت اصلی اجرای محلی حافظهست، نه توان پردازشی؛ حافظهٔ یکپارچه سقف VRAM رو برمیداره.
- ComfyUI روی ایمیج توسعهدهندهٔ Ryzen AI Halo از قبل نصبه و نیاز به تنظیم درایور نداره.
- هر تصویر با Qwen Image حدود ۱۹ تا ۲۰ ثانیه رندر شده.
- حالت API اجازه میده پرامپتها و seedها با اسکریپت و بهصورت دستهای اجرا بشن.
- کنترلنت ژست یا ترکیببندی یه تصویر مرجع رو به سوژهٔ جدید منتقل میکنه.
- ویدیوی محلی برای تکرار زیاد خوبه، ولی کیفیتش هنوز به مدلهای ابری برتر نمیرسه.




