GPT Image 2.5: دو نسخه تازه از مدل تصویرسازی اوپنایآی
خلاصهٔ کاملتر
اوپنایآی نسخه جدید مدل تصویرسازیش رو با اسم GPT Image 2.5 منتشر کرده، که دنباله GPT Image 2 حساب میشه. این مدل تو دو نسخه میاد: فلر که سریعتر و سبکتره، و سانبرست که سنگینتر ولی کیفیت خروجیش بالاتره. هر دو نسخه از طریق ChatGPT، Codex و API در دسترسان، ولی اوپنایآی رسماً نگفته کدوم نسخه پیشفرض تو ChatGPT و Codex فعاله؛ تستهای عملی نشون میده احتمالاً فلر پیشفرضه.
معماری مدل همون سبک قبلیه: بهجای اینکه فقط بر اساس چیزی که تو دادههای آموزشی زیاد دیده تصویر بسازه (مثل مدلهای دیفیوژن)، سعی میکنه دستور رو دقیقتر دنبال کنه؛ مثلاً اگه بگی لیوان رو تا لبه پر کن، واقعاً همینکارو میکنه، برخلاف مدلهایی مثل میدجرنی که به خاطر دادههای آموزشی معمولاً لیوان رو نصفه پر نشون میدن. نسبت به نسخه قبلی، نویز تصویر کمتر شده ولی هنوز کامل از بین نرفته.
بخش API این امکان رو میده که خود دولوپر مشخص کنه از فلر استفاده کنه یا سانبرست، و جدا از این، یه تنظیم کیفیت هم از سطح پایین تا حداکثر وجود داره؛ یعنی حتی تو یه نسخه هم میشه بین سرعت و کیفیت انتخاب کرد. تو تستها، خروجی داخل ChatGPT و Codex حدود ۱۶۷۲ در ۹۴۱ پیکسل بوده، یعنی زیر ۱۰۸۰p، پس برای چاپ یا نمایش بزرگ معمولاً باید آپاسکیل بشه.
نقطه قوت اصلی این مدل نسبت به رقبایی مثل میدجرنی، دنبال کردن دقیق دستورات و توانایی ویرایش مکالمهایه؛ یعنی میشه چندبار پشت سر هم بهش گفت یه چیزی رو عوض کنه (مثلاً پیر کردن یه چهره یا تغییر نورپردازی) بدون اینکه هماهنگی صحنه از بین بره. طبق تستها، وقتی این مدل با یه هوش مصنوعی زبانی قوی ترکیب بشه که بتونه تحقیق کنه یا خروجی خودشو نقد کنه، ارزش واقعیش بیشتر معلوم میشه، نه وقتی تنها و یهباره ازش تصویر خواسته بشه.
نکات کلیدی:
- GPT Image 2.5 تو دو نسخه فلر (سریع) و سانبرست (باکیفیتتر) عرضه شده
- از طریق ChatGPT، Codex و API در دسترسه؛ پیشفرض احتمالاً فلره
- تنظیم کیفیت از پایین تا حداکثر قابل انتخابه
- خروجی پیشفرض تو ChatGPT حدود ۱۶۷۲x۹۴۱ پیکسل، زیر ۱۰۸۰p
- نقطه قوت اصلیش دنبال کردن دقیق دستورات و ویرایش مکالمهایه، نه صرفاً کیفیت خام




