Google ha lanzado Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), una actualización de producción de su modelo nativo de generación y edición de vídeo multimodal. El lanzamiento mueve a Omni de un generador capaz a uno direccionable: la extensión de escena ahora lee hasta 10 segundos del contexto anterior en lugar de un único fotograma final, el primer y último fotograma se pueden fijar para controlar el movimiento de la cámara, los borradores se renderizan en 360p a un tercio del costo de 720p, los finales se escalan a 4K y los videoclips se pueden pasar como referencias para la coherencia de los personajes.
Gemini Omni Flash se basa en tres propiedades que Google distingue de los modelos de video anteriores: multimodalidad nativa (texto, imagen, audio y video procesados juntos), edición conversacional a través de Interactions API y conocimiento mundial heredado de Gemini. La edición tiene estado: pasas anterior_interacción_id y el modelo aplica tu cambio conservando lo que no mencionaste, sin volver a subir el video anterior.
¿Es desplegable?
Está disponible a través de la API de Gemini en Google AI Studio y la plataforma Gemini Enterprise Agent, con Adobe, Figma Weave, GMI Cloud y Runway ya nombrados como usuarios de producción.