Gemini Omni 1.1 Flash؛ کنترل حرفهای روی ویدیو
خلاصهٔ کاملتر
گوگل مدل ویدیوسازی تازهش، Gemini Omni 1.1 Flash، رو برای توسعهدهندهها منتشر کرد. به گفتهٔ تیم گوگل، این نسخه از طریق Gemini API توی Google AI Studio آمادهٔ کار حرفهایه و تمرکزش روی کنترلهای تازهست: ادامهدادن یه صحنه، تعیین فریم اول و آخر، پیشنمایش ارزونتر و ارتقای کیفیت تا 4K.
مهمترین قابلیت، scene extension ـه (یعنی ادامهدادن یه ویدیوی موجود از همونجایی که تموم شده). Omni 1.1 موقع ادامهدادن تا ۱۰ ثانیه از فیلم قبلی رو بهعنوان زمینه میبینه، در حالی که مدلهای قبلی فقط به آخرین ثانیه نگاه میکردن. نتیجهش انسجام تصویری و روایی بهتره. هر بار ۱۰ ثانیه اضافه میشه و طول کل ویدیو میتونه تا ۴۰ ثانیه برسه.
توی Gemini API ادامهٔ صحنه با ارجاع به شناسهٔ تولید قبلی انجام میشه:
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[{"type": "text", "text": "Continue the scene."}],
response_format={"resolution": "360p"},
)یعنی بهجای فرستادن دوبارهٔ ویدیو، فقط به تولید قبلی اشاره میکنی و مدل ادامهشو میسازه.
برای اینکه آزمونوخطا گرون درنیاد، میشه پیشنمایش رو با کیفیت 360p ساخت: تا ۶۰٪ سریعتر و یکسومِ هزینهٔ 720p. وقتی نتیجه اوکی شد، خروجی نهایی تا 1080p یا 4K بالا میره. مدل تا سه ثانیه ویدیوی مرجع هم بهعنوان ورودی قبول میکنه تا شخصیتها و حالوهوای تصویر ثابت بمونه، و میشه فریم اول و آخر یه پلان رو مشخص کرد تا حرکت دوربین بینشون پیوسته ساخته بشه.
Omni 1.1 توی Google AI Studio و برای شرکتها از طریق Agent Platform API در دسترسه، و مشترکهای Google AI Plus و Pro و Ultra هم میتونن توی Google Flow ازش استفاده کنن؛ ادامهٔ صحنه به اپ Gemini هم اضافه شده. گوگل میگه Adobe توی Firefly، و همینطور Figma Weave و Runway و GMI Cloud، همین حالا دارن ازش استفاده میکنن.
نکات کلیدی:
- ادامهٔ صحنه با دیدن تا ۱۰ ثانیه از ویدیوی قبلی، در گامهای ۱۰ ثانیهای تا سقف ۴۰ ثانیه
- مدلهای قبلی فقط آخرین ثانیه رو بهعنوان زمینه میدیدن
- پیشنمایش 360p تا ۶۰٪ سریعتر و یکسوم هزینهٔ 720p
- خروجی نهایی تا 1080p و 4K برای کار حرفهای
- ورودی ویدیوی مرجع تا سه ثانیه برای حفظ ثبات شخصیتها




