نصب Qwen-Image 2.1 روی ComfyUI و سرعتش روی ۴۰۹۰
خلاصهٔ کاملتر
Qwen-Image 2.1 یه مدل تصویر ۷ میلیارد پارامتری از تیم Qwen علیباباست که ساختن عکس از متن، ویرایش با دستور متنی و خروجی شفاف (RGBA، یعنی عکس با کانال آلفا) رو تو یه مدل جمع کرده. روی Hugging Face با اسم Qwen/Qwen-Image-2.1 منتشر شده و به شکل یه pipeline کتابخونهٔ diffusers عرضه شده. اجزای transformer، text encoder و VAE جدا هستن، همون ساختاری که workflowهای ComfyUI انتظارش رو دارن.
نصبش یهکلیکی نیست و باید ComfyUI از قبل نصب باشه. سه دسته فایل رو از تب Files ریپوی Hugging Face دانلود میکنی: وزنهای مدل diffusion (دو تا فایل safetensors) که میرن تو models/diffusion_models، فایلهای text encoder (چهار تا safetensors بهعلاوهٔ config و tokenizer) که میرن تو models/text_encoders، و فایل VAE که از همه کوچیکتره و میره تو models/vae. بعد یه workflow مخصوص این مدل رو باز میکنی و پرامپتت رو مینویسی.
مقاله نقش هر جزء رو هم توضیح میده. مدل diffusion خود نقاشه و عکس رو قدمبهقدم میسازه. text encoder پرامپت رو به عدد تبدیل میکنه تا مدل بفهمه. VAE هم نمایش فشردهٔ داخلی مدل (latent) رو به پیکسلهای نهایی برمیگردونه. تو نود sampler، مقدار CFG (یعنی اینکه مدل چقدر سفتوسخت به پرامپت بچسبه) رو باید نزدیک ۱ بذاری، چون گزارش شده این مدل اونجا بهترین نتیجه رو میده. dtype هم دقت عددی رو تعیین میکنه و دقت پایینتر یعنی سرعت بیشتر و VRAM کمتر، با یه کم افت کیفیت.
مدل وقتی کامل لود بشه حدود ۲۷ تا ۳۰ گیگ VRAM میگیره. پس یه کارت ۲۴ گیگی مثل RTX 4090 لب مرزه و برای رزولوشنهای معمولی جواب میده، ولی با batch بزرگ یا رزولوشن خیلی بالا تنگ میشه. روی ۴۰۹۰، عکس 1024x1024 تو حدود ۷.۵ ثانیه، 2048x2048 و 2688x1536 حدود ۳۰ ثانیه و 3072x3072 حدود ۹۵ ثانیه ساخته شد. 4096x4096 بیشتر از سه دقیقه طول کشید و بافتهای عجیب و آرتیفکت داشت. روی ۳۰۹۰ هم تقریباً دو برابر زمان بذار.
به گفتهٔ نویسنده، نقطهٔ قوت اصلی شفافیت بومیه، مثلاً ققنوسی از آتیش با آلفای واقعی. ترکیب چند عکس مرجع تو یه صحنه (مبلمان، مواد خوراکی)، تنوع فرهنگی و ویرایش با حفظ ژست هم خوب جواب داده. ضعفها تو حالتهای افراطی پیدا میشن: نوشتههای داخل عکس گاهی غلط املایی یا حروف بیمعنی دارن و جزئیات ریز مثل موی گربه یا شکل اصلی ابوالهول همیشه درست درنمیاد. نویسنده میگه دادن بازخورد پشتسرهم یا یه agent که پرامپت رو بهتر کنه، نتیجه رو محسوس بهتر کرده.
نکات کلیدی:
- مدل رو Hugging Face با اسم Qwen/Qwen-Image-2.1 در دسترسه.
- سه دسته فایل لازمه: diffusion_models، text_encoders و vae.
- مصرف VRAM حدود ۲۷ تا ۳۰ گیگه.
- روی 4090 عکس 1024x1024 حدود ۷.۵ ثانیه و 4096x4096 بیشتر از سه دقیقه طول میکشه.
- بهترین نتیجه با CFG نزدیک ۱ گزارش شده.
- رزولوشن 4096x4096 آرتیفکت داره و نوشتههای داخل عکس گاهی غلطن.




