تست عملی Qwen-Image 2.1: ساخت، ویرایش و پسزمینهٔ شفاف با یه مدل
خلاصهٔ کاملتر
Qwen-Image 2.1 یه مدل تصویر با ۷ میلیارد پارامتره که سه کار رو تو یه سیستم انجام میده: ساختن عکس از متن (text-to-image)، ویرایش عکس با دستور متنی، و خروجی RGBA (یعنی عکسی که یه کانال شفافیت هم داره). نویسندهٔ مقاله میگه اهمیتش اینجاست که بیشتر مدلهای اوپنسورس این کارها رو بین چند چکپوینت جدا پخش میکنن. مدل با ComfyUI لوکال اجرا میشه و وقتی کامل لود بشه، حدود ۲۷ تا ۲۹ گیگ VRAM میگیره.
تو تست شفافیت، از مدل یه ققنوس از آتیش و طلای مذاب با پسزمینهٔ خالی خواستن. خروجی از همون بار اول یه پسزمینهٔ واقعاً شفاف داشت، نه یه رنگ ثابت یا لبههای بدبریده. به گفتهٔ نویسنده، بیشتر مدلها بعد از ساخت عکس یه مرحلهٔ جدای حذف پسزمینه لازم دارن. این مرحله دور مو، آتیش و دود لبههای خراب جا میذاره. یعنی برای اسپرایت بازی، المان UI یا عکس محصول، دیگه لازم نیست با ابزار جدا پسزمینه رو پاک کنی.
سختترین تست، ترکیب چند عکس بود. ده تا تیکه مبلمان رو جدا جدا ساختن (مبل، فرش، آباژور، گلدون و...) و بعد هر ده تا رو بهعنوان عکس مرجع به مدل دادن تا یه اتاق نشیمن بچینه. جهت سایهها یکدست بود و سایهٔ گلدون درست روی دیوار افتاده بود. فقط فرش یه کم شلوغ به نظر میاومد. تو یه تست عجیبتر، ده تا مادهٔ اولیهٔ پان (یه خوراکی سنتی جنوب آسیا با برگ تنبول) رو داشتن تو سبک دربار مغول میچیدن. نویسنده معتقده چون این موضوع احتمالاً تو دادههای آموزشی کمه، نتیجهٔ خوبش بیشتر از قدرت تعمیم مدل خبر میده.
تو یه سری پرامپت سریع از جاهای مختلف دنیا، مثل خطاطی مصری، خیابون سنگفرش بلغارستان، پل تاریخی پراگ و شهر قدیمی صنعا، مدل معمولاً زبان تصویری درست هر منطقه رو گرفت. حاشیهٔ طرحدار رواندا و صحنهٔ طلایی لویو خیلی خوب دراومدن، ولی مثلاً تابلوی کاشی ازبکستان خالی و نیمهکاره بود. نویسنده میگه برای کارهای حساس فرهنگی بهتره یه آدم خروجی رو چک کنه.
تو تست ویرایش، از مدل خواستن روی یه پرتره لباس عروس قرمز و جواهر طلا اضافه کنه و یه چیزی رو از دست سوژه برداره. هر سه تا دستور انجام شد، ژست دست نخورد و کیفیت کلی عکس حتی بهتر هم شد. جمعبندی نویسنده اینه که اگه ComfyUI و یه کارت گرافیک پرحافظه داری، این مدل الان گزینهٔ قویه. ولی روی لپتاپ یا کارتهای ۸ تا ۱۲ گیگی اجرا نمیشه و باید GPU اجاره کنی.
نکات کلیدی:
- مدل ۷ میلیارد پارامتریه و ساخت، ویرایش و شفافیت رو تو یه مدل داره.
- خروجی RGBA بومی داره و مرحلهٔ جدای حذف پسزمینه لازم نیست.
- ده تا عکس جدا رو با سایههای یکدست تو یه صحنه ترکیب کرد.
- کیفیت صحنههای فرهنگی بین کشورها یکسان نبود.
- حدود ۲۷ تا ۲۹ گیگ VRAM لازم داره، همردهٔ مدلهایی مثل Flux.




