Ideogram 4 منتشر شد: مدل تصویرساز اوپنویت
خلاصهٔ کاملتر
Ideogram اعلام کرده Ideogram 4 رو منتشر کرده — اولین مدل text-to-image اوپنویت این شرکت که کد inference و وزنهاش حالا عمومیه. تیم سازنده میگه این یه مدل پایهٔ کاملاً جدیده که از صفر آموزش دیده و فاینتیون یا distill هیچ مدل موجودی نیست.
مدل با ۹.۳ میلیارد پارامتر، یه معماری flow-matching روی پایهٔ Diffusion Transformer با ساختار single-stream کاملاً یکپارچهست؛ یعنی توکنهای متن و تصویر تو یه دنبالهٔ واحد کنار هم میشن و از همون ۳۴ لایهٔ ترنسفورمر رد میشن، بدون اینکه شاخهٔ جدا واسه متن و تصویر باشه. یه نکتهٔ معماری جالبش اینه که بهجای انکودر متنی مثل CLIP یا T5، از یه مدل کامل vision-language یعنی Qwen3-VL-8B-Instruct بهعنوان انکودر استفاده میکنه و حالتهای پنهان رو از ۱۳ لایهٔ میانی برمیداره تا درک معنایی چندمقیاسی به دست بیاره.
به گفتهٔ سازنده مهمترین قابلیتش رندر متن داخل تصویره؛ یعنی تابلو، لوگو، کپشن و متن چندخطی رو با دقت بالا مستقیم از پرامپت میسازه. کنترلپذیری بالا هم نکتهٔ دوم ـه: مدل روی کپشنهای ساختاریافتهٔ JSON آموزش دیده، واسه همین میتونی ترکیببندی، استایل، نورپردازی، پالت رنگ، تایپوگرافی و چیدمان مکانی رو از یه پرامپت کنترل کنی. مختصات bounding-box واسه جایگذاری دقیق سوژهها و متن، و کدهای hex رنگ واسه هدایت طرح رنگ تصویر هم پشتیبانی میشه. رزولوشن هم انعطافپذیره، از ۲۵۶ تا ۲۰۴۸ (مضربهای ۱۶) و نسبت ابعاد تا ۶:۱.
نویسنده توضیح میده چرا فقط روی JSON آموزش دادن: اینجوری فرمت پرامپت آموزش و inference یکی میشه و چون هر کپشن همهٔ اشیای تصویر رو صریح اسم میبره، مدل از هر جفت آموزشی نظارت بیشتری میگیره. پرامپت متن ساده هم کار میکنه ولی بهخوبی JSON جواب نمیده. واسه کسایی که نمیخوان دستی JSON بنویسن، یه قابلیت magic prompt هست که با یه LLM پرامپت سادهٔ متنی رو به کپشن ساختاریافتهٔ کامل گسترش میده؛ بهصورت پیشفرض از API میزبانیشدهٔ خود Ideogram استفاده میکنه که رایگانه.
از نظر کارایی، تیم سازنده ادعا میکنه Ideogram 4 بهترین مدل اوپنویت تصویره و تو Design Arena بالاترین مدل اوپنویته که فقط پشت مدلهای اختصاصی GPT و Gemini قرار داره. تو یه ارزیابی کور تایپوگرافی که ده طراح حرفهای داوریش کردن، ۴۷.۹٪ مواقع بهعنوان بهترین انتخاب شده، جلوتر از Nano Banana 2، FLUX.2 و Grok Imagine. نکتهٔ جالب اینه که با همون ۹.۳ میلیارد پارامتر، تو رندر متن از مدلهای خیلی بزرگتری مثل Qwen-Image (۲۰B)، FLUX.2 dev (۳۲B) و HunyuanImage 3.0 (۸۰B) هم جلو زده.
وزنها تو دو نسخهٔ کوانتایز nf4 و fp8 روی Hugging Face گیتشدهان (باید لایسنس رو بپذیری و توکن بگیری)، و لایسنسشون غیرتجاریـه. اسکرین امنیتی پرامپت و خروجی هم از سرویس Hive استفاده میکنه.
نکات کلیدی:
- اولین مدل text-to-image اوپنویت Ideogram، با وزنها و کد inference عمومی
- مدل پایهٔ ۹.۳ میلیارد پارامتری، آموزشدیده از صفر، با معماری single-stream DiT
- از Qwen3-VL-8B-Instruct بهعنوان انکودر متن استفاده میکنه
- نقطهٔ قوت اصلی: رندر متن داخل تصویر و پرامپتدهی ساختاریافته با JSON
- لایسنس غیرتجاری؛ وزنها روی Hugging Face گیتشدهان




