A pesar de los recientes avances, los modelos de video generativos aún luchan por representar el movimiento de manera realista. Muchos modelos existentes se centran principalmente en la reconstrucción a nivel de píxeles, lo que a menudo conduce a inconsistencias en coherencia de movimiento. Estas deficiencias se manifiestan como física poco realista, marcos faltantes o distorsiones en secuencias de movimiento complejas. Por ejemplo, los modelos pueden tener dificultades para representar movimientos rotacionales o acciones dinámicas como gimnasia e interacciones de objetos. Abordar estos problemas es esencial para mejorar el realismo de los videos generados por IA, particularmente a medida que sus aplicaciones se expanden a dominios creativos y profesionales.
Meta AI presenta Videojamun marco diseñado para introducir una representación de movimiento más fuerte en los modelos de generación de videos. Al alentar un Representación conjunta de apariencia de aparienciaVideoJam mejora la consistencia del movimiento generado. A diferencia de los enfoques convencionales que tratan el movimiento como una consideración secundaria, VideoJam lo integra directamente en los procesos de capacitación e inferencia. Este marco se puede incorporar a los modelos existentes con modificaciones mínimas, que ofrece una forma eficiente de mejorar la calidad de movimiento sin alterar los datos de capacitación.
Enfoque técnico y beneficios
VideoJam consta de dos componentes principales:
- Fase de entrenamiento: Un video de entrada (x1) y su representación de movimiento correspondiente (D1) ambos están sujetos a ruido y se incrustan en un Representación latente de una sola articulación usando una capa lineal (Ganar+). Un modelo de difusión luego procesa esta representación, y dos capas de proyección lineal predicen tanto la apariencia como los componentes de movimiento (Wout+). Este enfoque estructurado ayuda a equilibrar la fidelidad de la apariencia con la coherencia del movimiento, mitigando la compensación común que se encuentra en modelos anteriores.
- Fase de inferencia (mecanismo interno de guancia): Durante la inferencia, VideoJam presenta Guía internadonde el modelo utiliza sus propias predicciones de movimiento en evolución para guiar la generación de videos. A diferencia de las técnicas convencionales que se basan en señales externas fijas, la guía interna permite que el modelo ajuste dinámicamente su representación de movimiento, lo que lleva a transiciones más suaves y más naturales entre los marcos.
Perspectivas
Las evaluaciones de videojam indican mejoras notables en la coherencia de movimiento en diferentes tipos de videos. Los hallazgos clave incluyen:
- Representación de movimiento mejorada: En comparación con modelos establecidos como Sora y Kling, VideoJam reduce los artefactos como distorsiones de trama y deformaciones de objetos antinaturales.
- Fidelidad de movimiento mejorada: VideoJam logra constantemente puntajes de coherencia de movimiento más altos tanto en evaluaciones automatizadas como en evaluaciones humanas.
- Versatilidad en todos los modelos: El marco se integra de manera efectiva con varios modelos de video previamente capacitados, lo que demuestra su adaptabilidad sin requerir un reentrenamiento extenso.
- Implementación eficiente: VideoJam mejora la calidad del video usando solo Dos capas lineales adicionaleshaciéndolo una solución ligera y práctica.
Conclusión
VideoJam proporciona un enfoque estructurado para mejorar la coherencia del movimiento en los videos generados por IA al integrar el movimiento como un componente clave en lugar de una ocurrencia tardía. Aprovechando un Representación conjunta de apariencia de apariencia y Mecanismo internoel marco permite que los modelos generen videos con mayor consistencia temporal y realismo. Con un mínimo de modificaciones arquitectónicas, VideoJam ofrece un medio práctico para refinar la calidad de movimiento en los modelos de video generativos, lo que los hace más confiables para una variedad de aplicaciones.
Verificar el Papel y Página del proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 75k+ ml de subreddit.
Aswin AK es un pasante de consultoría en MarktechPost. Está persiguiendo su doble título en el Instituto de Tecnología Indio, Kharagpur. Le apasiona la ciencia de datos y el aprendizaje automático, aportando una sólida experiencia académica y una experiencia práctica en la resolución de desafíos de dominio de la vida real.