وقتی مدلهای هوش مصنوعی مداد رنگی دست میگیرن
خلاصهٔ کاملتر
تیم TryAI تو این مقاله میگه یه «آرنای نقاشی» ساخته: به مدل یه بوم سفید و یه مجموعه ابزار مداد رنگی میدن و بعد کنار میکشن. مدل خودش رنگ و ضخامت نوک و فشار مداد رو تنظیم میکنه، دستهای از خطها رو میکشه، محو میکنه، پاک میکنه و با ابزار view_canvas کار خودشو میبینه تا تصمیم بگیره چی رو درست کنه. یا از روی یه تصویر مرجع میکشه یا از روی یه توضیح متنی.
نکتهٔ مهم ابزارها اینه که هیچ پُرکردن یکدستی وجود نداره؛ مثل مداد واقعی، سایه و رنگ فقط با لایهلایه کشیدن ساخته میشه. کل این بستر هم متنبازه و هر کسی میتونه با تصویر یا پرامپت دلخواه خودش اجراش کنه.
چهار مدل GPT-5.6 Sol، Claude Fable 5، Grok 4.5 و Gemini 3.6 Flash روی دو تابلوی مونالیزا و شب پرستاره (با امتیاز عینی SSIM) و پنج پرامپت آزاد آزمایش شدن؛ در مجموع ۲۸ نقاشی. سطح استدلال همهٔ مدلها روی «بالا» بوده و زمان اندازهگیریشده شامل فکر کردن خود مدل هم هست.
جالبترین بخش، تفاوت سبک کار با ابزار یکسانه. به گفتهٔ نویسنده، GPT-5.6 Sol حتی یک بار هم ابزارهای تنظیم رنگ و قلم رو صدا نزده و همهچیزو داخل خود دستور کشیدن مشخص کرده. Grok 4.5 دقیقاً برعکس: ۶۵٪ از ۱۳۴۹ فراخوانی ابزارش فقط تنظیم رنگ و فشار بوده. Gemini 3.6 Flash هم وسواسیترین بازبین بود و نزدیک یکسوم فراخوانیهاش دیدن بوم بوده.
اختلاف هزینه چشمگیره: Claude Fable 5 برای هفت نقاشی حدود ۱۶۰ دلار خرج برداشته، یعنی تقریباً ۲۰ برابر GPT-5.6 Sol با ۷.۷۴ دلار، Grok با ۹.۲۱ دلار و Gemini با ۱۲.۸۷ دلار. Grok بیشترین توکن (۳۴ میلیون) رو مصرف کرده ولی چون حدود ۹۸٪ توکنهاش خواندن از کش بوده، ارزون موند.
یافتهٔ اصلی مقاله دربارهٔ خودِ بهبوده: مدلها خیلی زود به سقف میرسن. Claude Fable 5 مونالیزاشو ۲۷ بار بازبینی کرده ولی بعد از پنجمین بازبینی عملاً پیشرفتی نداشته. مهمتر اینکه تو هر هشت اجرای هدفدار، نسخهٔ نهایی از بهترین حالتی که مدل وسط کار بهش رسیده بود ضعیفتر بوده؛ مثلاً Gemini روی مونالیزا تا ۰.۴۴۹ بالا رفته و آخرش به ۰.۳۳۷ برگشته.
نویسنده تأکید میکنه SSIM شباهت ساختاری رو میسنجه، نه زیبایی نقاشی از نگاه آدم؛ برای همین با اینکه Gemini بالاترین عدد خام رو گرفته، از نظر خود تیم خروجیاش نزدیکترین به تصویر مرجع به نظر نمیرسه.
جمعبندی تیم اینه که GPT-5.6 Sol با فاصله بهترین بوده، Grok 4.5 تقریباً بیاستفاده ظاهر شده، Gemini 3.6 Flash بهتر از Grok بوده ولی مقایسهٔ یه مدل Flash با مدلهای پرچمدار خیلی منصفانه نیست، و Claude Fable 5 از نظر کیفیت دوم شد اما با بدترین نسبت هزینه و زمان.
نکات کلیدی:
- محیط آزمایشی TryAI به مدلها ابزار مداد رنگی میده تا روی بوم سفید نقاشی کنن و خودشون کارشون رو ببینن و اصلاح کنن
- ۲۸ نقاشی از چهار مدل: دو تابلوی مرجع با امتیاز SSIM و پنج پرامپت متنی آزاد
- GPT-5.6 Sol از نظر کیفیت بهترین بود؛ Grok 4.5 با وجود ۹۹ گام در هر نقاشی ضعیفترین
- Claude Fable 5 حدود ۱۶۰ دلار خرج برداشت، نزدیک ۲۰ برابر بقیه
- در هر هشت اجرای امتیازدار، خروجی نهایی از بهترین حالت میانهٔ کار ضعیفتر بود
- بازبینی بیشتر به نتیجهٔ بهتر ختم نشد؛ مدلها از نقطهٔ اوج خودشون رد میشن و ادامه میدن




