گوگل نسل تازهای از مدلهای ویدئوساز خود را با نام Gemini Omni 1.1 Flash معرفی کرد؛ مدلی که به گفته این شرکت با تمرکز بر کنترلپذیری، سرعت و کیفیت، برای استفاده حرفهای توسعهدهندگان از طریق Gemini API در محیط Google AI Studio آماده شده است.
به گزارش بیانیه رسمی گوگل، Omni 1.1 مجموعهای از ابزارهای خلاقانه برای ساخت، ویرایش و مدیریت جریانهای کاری ویدئویی را در اختیار توسعهدهندگان قرار میدهد تا بدون نیاز به چند سامانه مجزا، از مرحله ایدهپردازی سریع تا خروجی نهایی را در یک پلتفرم طی کنند.
ادامهدهی هوشمند صحنه با حافظه ۱۰ ثانیهای
یکی از شاخصترین قابلیتهای این نسخه، ویژگی Scene Extension یا ادامهدهی صحنه است. در این حالت توسعهدهنده میتواند یک ویدئوی موجود را به مدل بدهد و تولید را دقیقاً از همان نقطه ادامه دهد، بدون آنکه پیوستگی بصری یا روایی از بین برود.
در Omni 1.1، مدل قادر است تا ۱۰ ثانیه از زمینه قبلی ویدئو را تحلیل کند؛ جهشی قابل توجه نسبت به نسخههای پیشین که تنها به آخرین فریم یا ثانیه پایانی متکی بودند. همین موضوع باعث ثبات بصری بیشتر، حفظ هویت سوژهها و وفاداری بالاتر به داستان میشود. تولید ویدئو در گامهای ۱۰ ثانیهای انجام میشود و طول تجمعی هر پروژه میتواند تا ۴۰ ثانیه برسد.
گوگل نمونهای از نحوه فراخوانی این قابلیت در کد را نیز منتشر کرده که در آن توسعهدهنده با حفظ همان شناسه تعامل قبلی، دستور ادامه صحنه را ارسال میکند و مدل به جای ساختن برشی کاملاً جدید، امتداد طبیعی روایت را تولید میکند.
کنترل دقیق نقطه شروع و پایان هر نما
قابلیت کلیدی دیگر، تعیین فریم آغاز و پایان هر نما است. Omni 1.1 میتواند میان دو فریم کلیدی تعیینشده از سوی کاربر، ویدئویی پیوسته و روان بسازد. این ویژگی بهویژه برای حرکتهای پیچیده دوربین، چرخشهای نمایشی، زومهای نرم و صحنههای موزیکال یا رقص کاربرد دارد.
به گفته گوگل، هدف این مدل فراتر از تولید یک کلیپ ساده است؛ بلکه باید مسیر حرکت میان دو نقطه تصویری را با انسجام کامل و بدون پرش طی کند. نمونههای نمایشدادهشده شامل نماهای نزدیک، حرکت سریع دوربین و صحنههای پویا بودهاند که همگی بر توانایی مدل در حفظ پیوستگی تأکید دارند.
پیشنمایش سریع 360p و خروجی نهایی تا 4K
برای سرعت بخشیدن به فرآیند آزمون و خطا، گوگل حالت خروجی 360p را برای پیشنمایشهای سبک معرفی کرده است. این حالت تا ۶۰ درصد سریعتر از رندر استاندارد 720p انجام میشود و تنها یکسوم هزینه را دارد. چنین قابلیتی برای نمونهسازی سریع، تست استوریبورد و اصلاح مکرر پرامپتها بسیار کارآمد است.
در مقابل، برای تحویل نهایی و استفاده حرفهای، Omni 1.1 از خروجیهای 1080p و 4K نیز پشتیبانی میکند. گوگل با نمایش صحنههایی مانند شنای ماهی، دویدن سنجاب و نماهای ماکرو از برگهای افرا نشان داده که مدل جدید صرفاً ابزاری برای ایدهپردازی اولیه نیست و میتواند به خروجیهای پالوده و آماده انتشار نیز برسد.
به این ترتیب یک ابزار واحد میتواند هر دو نیاز را پوشش دهد: از رندرهای فوری و کمهزینه برای آزمایش تا رندرهای باکیفیت برای محصول نهایی، بدون آنکه جریان کاری به چند سامانه جداگانه تقسیم شود.
ورودی ویدئوی مرجع برای حفظ هویت بصری
ویژگی مهم دیگر، پشتیبانی از ورودی چندوجهی با ویدئوی مرجع است. توسعهدهنده میتواند تا ۳ ثانیه ویدئو را به عنوان مرجع به مدل بدهد تا زمینه بصری، ظاهر شخصیتها و سبک حرکت حفظ شود.
گوگل برای این قابلیت مثالی ارائه کرده که در آن سه شخصیت با رقصهای متفاوت در یک فضای مشترک ترکیب شده و خروجی نهایی به صورت یک نمای پیوسته و بدون برش تولید میشود. این کاربرد برای پروژههایی با شخصیتهای ثابت، حرکات تکرارشونده و صحنههای ترکیبی اهمیت عملی بالایی دارد.
نحوه دسترسی توسعهدهندگان و کاربران
گوگل اعلام کرده است عرضه Gemini Omni 1.1 Flash بهتدریج در سراسر اکوسیستم توسعهدهندگان این شرکت انجام میشود. دسترسی اولیه از طریق Google AI Studio فراهم شده و کسبوکارها میتوانند از طریق Gemini Enterprise و Agent Platform API به آن متصل شوند.
مستندات رسمی، راهنماهای پرامپتنویسی و نمونهکدهای مربوط به قابلیتهایی مانند ادامه صحنه، ویدئوی مرجع و ارتقای کیفیت نیز منتشر شده است. علاوه بر این، Omni 1.1 برای مشترکان سرویسهای Google AI Plus، Pro و Ultra در Google Flow به صورت جهانی فعال شده و قابلیت ادامه صحنه نیز برای همین مشترکان در اپلیکیشن جمنای در دسترس قرار گرفته است.
با این بهروزرسانی، گوگل گامی دیگر به سمت تولید ویدئوی هوشمند و قابل کنترل برداشته؛ جایی که توسعهدهندگان میتوانند با دقت سینمایی، سرعت بالا و هزینه بهینه، ایدههای خود را به ویدئوهای حرفهای تبدیل کنند.




دیدگاهها (0)
هنوز دیدگاهی ثبت نشده است.