Generar un vídeo corto de IA es una cosa; Conseguir que varias tomas parezcan que realmente pertenecen al mismo vídeo es un problema mucho más difícil. Google está intentando de nuevo con Gemini Omni 1.1 Flash, su último modelo de vídeo generativo destinado a dar a creadores y desarrolladores mucho más control sobre lo que ocurre entre el primer fotograma y el último.
El mayor cambio es cuánto de un vídeo existente puede recordar Gemini cuando le pides que continúe una escena. Omni 1.1 puede consultar hasta 10 segundos de metraje anterior para obtener contexto, en lugar de depender solo del último segundo. Eso debería ayudar a mantener más coherentes a los personajes, los entornos y la dirección general de una escena en lugar de adivinar efectivamente qué debería pasar después.
Tus vídeos de IA no tienen que terminar tan rápido
Google también está dando a los creadores mucho más margen para mantener esas escenas. Los vídeos pueden extenderse en bloques de 10 segundos hasta alcanzar una duración total de 40 segundos. Puede que no suene especialmente largo comparado con un vídeo tradicional, pero abre mucho más espacio para secuencias generadas por IA con un principio, un desarrollo y un final reales.

Los creadores también pueden proporcionar tanto el primer como el último fotograma que desean para una toma. Géminis entonces genera todo lo necesario para conectar ambos. Eso podría ser útil para crear un movimiento de cámara alrededor de un sujeto, hacer zoom suave entre composiciones o construir un clip diseñado para repetirse sin un salto evidente. También se admiten referencias de vídeo. Puedes alimentar a Gemini hasta tres segundos de metraje existente para darle al modelo contexto visual adicional, lo que Google dice que debería ayudar a mantener aspectos como la apariencia de los personajes a través de las escenas generadas.
No necesitas renderizar todo en 4K
No todos los experimentos tienen que empezar con la máxima calidad, y una de las incorporaciones más prácticas de Omni 1.1 reconoce exactamente eso. Los desarrolladores pueden generar previsualizaciones en 360p que Google afirma que son hasta un 60% más rápidas que su salida habitual en 720p, y que cuestan aproximadamente un tercio de lo que salen. Eso facilita probar rápidamente una idea, ajustar prompts o avanzar en varias versiones antes de invertir más tiempo y dinero en el resultado final. Cuando estés satisfecho, Omni 1.1 puede producir metraje a 1080p o escalar el vídeo final hasta 4K.

La empresa ya está poniendo Omni 1.1 Flash a disposición de los desarrolladores a través de la API Gemini en Google AI Studio, mientras que las empresas pueden acceder a él a través de la plataforma Agent empresarial de Google. Tampoco es necesario que estés creando una app para probar algunos de estos trucos. Omni 1.1 se está desplegando globalmente en Google Flow para suscriptores de AI Plus, Pro y Ultra. La extensión de escenas también llegará directamente a los suscriptores dentro de la app Gemini, haciendo que una de las nuevas capacidades más interesantes del modelo sea considerablemente más fácil de probar.