گوگل نسل تازه‌ای از مدل‌های ویدئوساز خود را با نام Gemini Omni 1.1 Flash معرفی کرد؛ مدلی که به گفته این شرکت با تمرکز بر کنترل‌پذیری، سرعت و کیفیت، برای استفاده حرفه‌ای توسعه‌دهندگان از طریق Gemini API در محیط Google AI Studio آماده شده است.

به گزارش بیانیه رسمی گوگل، Omni 1.1 مجموعه‌ای از ابزارهای خلاقانه برای ساخت، ویرایش و مدیریت جریان‌های کاری ویدئویی را در اختیار توسعه‌دهندگان قرار می‌دهد تا بدون نیاز به چند سامانه مجزا، از مرحله ایده‌پردازی سریع تا خروجی نهایی را در یک پلتفرم طی کنند.

ادامه‌دهی هوشمند صحنه با حافظه ۱۰ ثانیه‌ای

یکی از شاخص‌ترین قابلیت‌های این نسخه، ویژگی Scene Extension یا ادامه‌دهی صحنه است. در این حالت توسعه‌دهنده می‌تواند یک ویدئوی موجود را به مدل بدهد و تولید را دقیقاً از همان نقطه ادامه دهد، بدون آنکه پیوستگی بصری یا روایی از بین برود.

در Omni 1.1، مدل قادر است تا ۱۰ ثانیه از زمینه قبلی ویدئو را تحلیل کند؛ جهشی قابل توجه نسبت به نسخه‌های پیشین که تنها به آخرین فریم یا ثانیه پایانی متکی بودند. همین موضوع باعث ثبات بصری بیشتر، حفظ هویت سوژه‌ها و وفاداری بالاتر به داستان می‌شود. تولید ویدئو در گام‌های ۱۰ ثانیه‌ای انجام می‌شود و طول تجمعی هر پروژه می‌تواند تا ۴۰ ثانیه برسد.

گوگل نمونه‌ای از نحوه فراخوانی این قابلیت در کد را نیز منتشر کرده که در آن توسعه‌دهنده با حفظ همان شناسه تعامل قبلی، دستور ادامه صحنه را ارسال می‌کند و مدل به جای ساختن برشی کاملاً جدید، امتداد طبیعی روایت را تولید می‌کند.

کنترل دقیق نقطه شروع و پایان هر نما

قابلیت کلیدی دیگر، تعیین فریم آغاز و پایان هر نما است. Omni 1.1 می‌تواند میان دو فریم کلیدی تعیین‌شده از سوی کاربر، ویدئویی پیوسته و روان بسازد. این ویژگی به‌ویژه برای حرکت‌های پیچیده دوربین، چرخش‌های نمایشی، زوم‌های نرم و صحنه‌های موزیکال یا رقص کاربرد دارد.

به گفته گوگل، هدف این مدل فراتر از تولید یک کلیپ ساده است؛ بلکه باید مسیر حرکت میان دو نقطه تصویری را با انسجام کامل و بدون پرش طی کند. نمونه‌های نمایش‌داده‌شده شامل نماهای نزدیک، حرکت سریع دوربین و صحنه‌های پویا بوده‌اند که همگی بر توانایی مدل در حفظ پیوستگی تأکید دارند.

پیش‌نمایش سریع 360p و خروجی نهایی تا 4K

برای سرعت بخشیدن به فرآیند آزمون و خطا، گوگل حالت خروجی 360p را برای پیش‌نمایش‌های سبک معرفی کرده است. این حالت تا ۶۰ درصد سریع‌تر از رندر استاندارد 720p انجام می‌شود و تنها یک‌سوم هزینه را دارد. چنین قابلیتی برای نمونه‌سازی سریع، تست استوری‌بورد و اصلاح مکرر پرامپت‌ها بسیار کارآمد است.

داخل خبر (468x60)

در مقابل، برای تحویل نهایی و استفاده حرفه‌ای، Omni 1.1 از خروجی‌های 1080p و 4K نیز پشتیبانی می‌کند. گوگل با نمایش صحنه‌هایی مانند شنای ماهی، دویدن سنجاب و نماهای ماکرو از برگ‌های افرا نشان داده که مدل جدید صرفاً ابزاری برای ایده‌پردازی اولیه نیست و می‌تواند به خروجی‌های پالوده و آماده انتشار نیز برسد.

به این ترتیب یک ابزار واحد می‌تواند هر دو نیاز را پوشش دهد: از رندرهای فوری و کم‌هزینه برای آزمایش تا رندرهای باکیفیت برای محصول نهایی، بدون آنکه جریان کاری به چند سامانه جداگانه تقسیم شود.

ورودی ویدئوی مرجع برای حفظ هویت بصری

ویژگی مهم دیگر، پشتیبانی از ورودی چندوجهی با ویدئوی مرجع است. توسعه‌دهنده می‌تواند تا ۳ ثانیه ویدئو را به عنوان مرجع به مدل بدهد تا زمینه بصری، ظاهر شخصیت‌ها و سبک حرکت حفظ شود.

گوگل برای این قابلیت مثالی ارائه کرده که در آن سه شخصیت با رقص‌های متفاوت در یک فضای مشترک ترکیب شده و خروجی نهایی به صورت یک نمای پیوسته و بدون برش تولید می‌شود. این کاربرد برای پروژه‌هایی با شخصیت‌های ثابت، حرکات تکرارشونده و صحنه‌های ترکیبی اهمیت عملی بالایی دارد.

نحوه دسترسی توسعه‌دهندگان و کاربران

گوگل اعلام کرده است عرضه Gemini Omni 1.1 Flash به‌تدریج در سراسر اکوسیستم توسعه‌دهندگان این شرکت انجام می‌شود. دسترسی اولیه از طریق Google AI Studio فراهم شده و کسب‌وکارها می‌توانند از طریق Gemini Enterprise و Agent Platform API به آن متصل شوند.

مستندات رسمی، راهنماهای پرامپت‌نویسی و نمونه‌کدهای مربوط به قابلیت‌هایی مانند ادامه صحنه، ویدئوی مرجع و ارتقای کیفیت نیز منتشر شده است. علاوه بر این، Omni 1.1 برای مشترکان سرویس‌های Google AI Plus، Pro و Ultra در Google Flow به صورت جهانی فعال شده و قابلیت ادامه صحنه نیز برای همین مشترکان در اپلیکیشن جمنای در دسترس قرار گرفته است.

با این به‌روزرسانی، گوگل گامی دیگر به سمت تولید ویدئوی هوشمند و قابل کنترل برداشته؛ جایی که توسعه‌دهندگان می‌توانند با دقت سینمایی، سرعت بالا و هزینه بهینه، ایده‌های خود را به ویدئوهای حرفه‌ای تبدیل کنند.