Ideogram 4 منتشر شد: مدل تصویرساز اوپنویت
Ideogram اولین مدل text-to-image اوپنویت خودش به اسم Ideogram 4 رو با وزنها و کد منتشر کرد. این یه مدل پایه ۹.۳ میلیارد پارامتریه که از صفر آموزش دیده، نه فاینتیون چیز دیگه. نقطهٔ قوتش رندر متن داخل تصویر، یه اینترفیس پرامپتدهی ساختاریافته با JSON، و کنترل صریح چیدمان با bounding-box و پالت رنگه. بهگفتهٔ تیم سازنده، تو بنچمارکهای اوپنویت با فاصله جلوتر از بقیهست.
این محتوا بهصورت خودکار با استفاده از هوش مصنوعی تولید شده، و بررسی نهایی اون پیش از استفاده توصیه میشه. مسئولیت استفاده بهعهده کاربر هست. برای مطالعه متن اصلی خبر، اینجا رو کلیک کن
خلاصهٔ کاملتر
Ideogram اعلام کرده Ideogram 4 رو منتشر کرده — اولین مدل text-to-image اوپنویت این شرکت که کد inference و وزنهاش حالا عمومیه. تیم سازنده میگه این یه مدل پایهٔ کاملاً جدیده که از صفر آموزش دیده و فاینتیون یا distill هیچ مدل موجودی نیست.
مدل با ۹.۳ میلیارد پارامتر، یه معماری flow-matching روی پایهٔ Diffusion Transformer با ساختار single-stream کاملاً یکپارچهست؛ یعنی توکنهای متن و تصویر تو یه دنبالهٔ واحد کنار هم میشن و از همون ۳۴ لایهٔ ترنسفورمر رد میشن، بدون اینکه شاخهٔ جدا واسه متن و تصویر باشه. یه نکتهٔ معماری جالبش اینه که بهجای انکودر متنی مثل CLIP یا T5، از یه مدل کامل vision-language یعنی Qwen3-VL-8B-Instruct بهعنوان انکودر استفاده میکنه و حالتهای پنهان رو از ۱۳ لایهٔ میانی برمیداره تا درک معنایی چندمقیاسی به دست بیاره.
خلاصهٔ کاملتر این خبر رو میتونی با داشتن اشتراک ویژه بخونی!
اشتراک رایگان
- دسترسی به خلاصهٔ کوتاه خبر
- ارسال اخبار مورد علاقه به ایمیل شما
- ارسال اخبار مورد علاقه به تلگرام شما
- دسترسی به خلاصهٔ کامل/اختصاصی خبر + نکات کلیدی مقاله
- عدم نمایش تبلیغات
اشتراک ویژه
- دسترسی به خلاصهٔ کوتاه خبر
- ارسال اخبار مورد علاقه به ایمیل شما
- ارسال اخبار مورد علاقه به تلگرام شما
- دسترسی به خلاصهٔ کامل/اختصاصی خبر + نکات کلیدی مقاله
- عدم نمایش تبلیغات




