Hermes با ComfyUI خودش عکس میسازه و بهترش میکنه
خلاصهٔ کاملتر
Hermes یه ایجنت هوش مصنوعیه (یعنی مدلی که خودش چند مرحله کار رو پشت سر هم انجام میده) که یه skill داخلی برای وصل شدن مستقیم به ComfyUI داره؛ همون ابزار محبوب ساخت عکس با مدلهای تصویری. تو این مقاله اومده که Hermes کل چرخهٔ پرامپتنویسی رو خودش جلو میبره: پرامپت میفرسته، عکس رو بررسی میکنه، تصمیم میگیره چی عوض بشه و دوباره میفرسته. هم با اپ دسکتاپ اجرا میشه هم تو ترمینال، و کل کار بدون هیچ API ابری انجام میشه.
تو یه دمو، یه پوستر آموزشی با مراحل شمارهدار اول خیلی خراب دراومد: شمارهها قاطی بودن، کلمهها غلط املایی داشتن و جای بعضی متنها حروف بیمعنی بود. با چند دور تکرار، املا و ساختار واضح بهتر شد، هرچند شمارهگذاری هیچوقت کامل با تعداد آیتمها جور نشد. آخرش کاربر حلقه رو دستی متوقف کرد چون ایجنت هنوز ادامه میداد. یعنی ایجنت خودش نمیدونه کی بس کنه و سقف تکرار یا زمان رو باید خودت بذاری.
توصیهٔ مقاله اینه که قبل از شروع، از ایجنت بخوای راهنمای پرامپتنویسی و negative promptهای شناختهشدهٔ همون مدل رو پیدا کنه (negative prompt یعنی چیزهایی که صریحاً میگی تو عکس نباشه). مدلهایی مثل Qwen الگوهای مستندی دارن و وقتی ایجنت اینا رو از قبل بدونه، تلاش اولش بهتره و زودتر به نتیجه میرسه.
سرعت Qwen Image 2.1 روی 4090: عکس 1024x1024 حدود ۷.۵ ثانیه، 2048x2048 و 2688x1536 حدود ۳۰ ثانیه، 3072x3072 حدود ۹۵ ثانیه و 4096x4096 حدود ۲۱۳ ثانیه. تو این آخری بافت عکس خراب شد، یعنی رزولوشن یه سقف عملی داره. روی 3090 هم این زمانها تقریباً دو برابر میشه. کیفیت هم به موضوع بستگی داشت: روباه قطبی، غواصی تو Great Barrier Reef و عکاسی خیابونی K-pop خوب بودن، ولی متن ریز، رفتار فیزیکی آب و لیوان، موی حیوونها و جزئیات تاریخی ضعیف دراومدن.
جالبترین بخش یه استوریبورد کامل بود. به Hermes گفتن نقش کارگردان رو داشته باشه، داستان یه فیلم فاجعهای معروف رو با یه پیچش تعریف کنه و نتیجه رو روی یه آدرس IP لوکال منتشر کنه. ایجنت خودش داستان رو به شکل گزارش یه سفینهٔ آینده از زبون مهماندار کشتی نوشت، به نُه صحنه تقسیمش کرد، برای هر صحنه عکس ساخت، صحنههای نامفهوم رو دوباره ساخت و کل کارو منتشر کرد. همهش حدود ۳۰ دقیقه طول کشید.
نویسنده میگه این روش برای کسی که پرامپتنویسی بلد نیست، یا برای پروژههای چندتصویری مثل کمیک و اسلاید خیلی بهدرد میخوره. ولی زمان ساخت با رزولوشن تند بالا میره، ایجنت خودش نمیفهمه کی عکس «به اندازهٔ کافی خوبه»، و ضعفهای پایهای خود مدل تصویری هم با تکرار حل نمیشن.
نکات کلیدی:
- Hermes با یه skill داخلی ComfyUI رو مستقیم و کاملاً لوکال کنترل میکنه.
- مدل تصویری دمو Qwen Image 2.1 روی یه 4090 بود.
- عکس 1024x1024 حدود ۷.۵ ثانیه و 4096x4096 حدود ۲۱۳ ثانیه با افت کیفیت.
- استوریبورد نُهصحنهای از یه دستور ساده، حدود ۳۰ دقیقه طول کشید.
- ایجنت خودش نمیدونه کی متوقف بشه و سقف تکرار رو باید آدم تعیین کنه.




