Comprensión Videos con AI requiere manejo de secuencias de imágenes de manera eficiente. Un desafío importante en los modelos de IA basados en video actuales es su incapacidad para procesar videos como un flujo continuo, faltar importantes detalles de movimiento e interrumpir la continuidad. Esta falta de modelado temporal evita los cambios en el rastreo; Por lo tanto, los eventos e interacciones son parcialmente desconocidos. Los videos largos también dificultan el proceso, con altos gastos computacionales y que requieren técnicas como omitir el marco, que pierde información valiosa y reduce la precisión. La superposición entre los datos dentro de los cuadros tampoco se comprime bien, lo que resulta en redundancia y desperdicio de recursos.
Actualmente, los modelos de video-lenguaje tratan los videos como secuencias de cuadro estático con codificadores de imágenes y proyectores en idioma de visiónque es un desafío para representar el movimiento y la continuidad. Los modelos de lenguaje tienen que inferir relaciones temporales de forma independiente, lo que resulta en una comprensión parcial. El submuestreo de marcos reduce la carga computacional a expensas de eliminar detalles útiles, afectando la precisión. Métodos de reducción de tokens como la compresión de caché de KV recursivo y la selección de marco agregan complejidad sin producir mucha mejora. Aunque los codificadores de video avanzados y los métodos de agrupación ayudan, siguen siendo ineficientes y no escalables, lo que hace que el procesamiento de videos a largo plazo sea intensivo computacionalmente.
Para abordar estos desafíos, investigadores de Nvidia, Universidad de Rutgers, UC Berkeley, MIT, Universidad de Nanjingy Kaist propuesto TORMENTA (Reducción de tokens espacio -temporal para LLM multimodales), Una arquitectura de proyector temporal con sede en Mamba para un procesamiento eficiente de videos largos. A diferencia de los métodos tradicionales, donde las relaciones temporales se infieren por separado en cada marco de video, y se utilizan modelos de lenguaje para inferir las relaciones temporales, TORMENTA Agrega información temporal en el nivel de tokens de video para eliminar la redundancia del cálculo y mejorar la eficiencia. El modelo mejora las representaciones de video con un mecanismo de escaneo espacio -temporal bidireccional al tiempo que mitiga la carga del razonamiento temporal de la LLM.
El marco usa Capas de mamba Para mejorar el modelado temporal, incorporando un módulo de escaneo bidireccional para capturar dependencias a través de dimensiones espaciales y temporales. El codificador temporal procesa las entradas de imagen y video de manera diferente, actuando como un escáner espacial para imágenes para integrar el contexto espacial global y como un escáner espacio -temporal para videos para capturar la dinámica temporal. Durante la capacitación, las técnicas de compresión de tokens mejoraron la eficiencia computacional mientras se mantienen información esencial, lo que permite la inferencia en un solo GPU. El submuestreo de tokens sin capacitación en el tiempo de prueba redujo aún más las cargas computacionales mientras retiene detalles temporales importantes. Esta técnica facilitó el procesamiento eficiente de videos largos sin requerir equipos especializados o adaptaciones profundas.
Se realizaron experimentos para evaluar el TORMENTA Modelo para la comprensión de video. El entrenamiento se realizó utilizando pretrados Siglo Modelos, con un proyector temporal introducido a través de la inicialización aleatoria. El proceso involucrado dos etapas: una etapa de alineacióndonde el codificador de imagen y el LLM se congelaron, mientras que solo el proyector temporal fue entrenado con pares de texto de imagen y un Etapa supervisada de ajuste (Sft) con un conjunto de datos diverso de 12.5 millones de muestras, incluidos los datos de texto, texto de imagen y texto de video. Los métodos de compresión de tokens, incluida la agrupación temporal y espacial, disminuyeron la carga computacional. El último modelo se evaluó en puntos de referencia de videos a largo plazo, como Egoschema, Mvbench, Mlvu, Longvideobenchy Sermeremocon el rendimiento en comparación con otros videos LLM.
Tras la evaluación, Tormenta superó a los modelos existentes, logrando resultados de última generación en puntos de referencia. El módulo mamba mejoró la eficiencia al comprimir los tokens visuales mientras conserva la información clave, reduciendo el tiempo de inferencia hasta hasta 65.5%. La agrupación temporal funcionó mejor en videos largos, optimizando el rendimiento con pocas fichas. Storm también funcionó mucho mejor que la línea de base Vila Modelo, particularmente en tareas que implicaron comprender el contexto global. Los resultados verificaron la importancia de mamba para la compresión de token optimizado, con los aumentos de rendimiento que aumentan junto con la longitud del video de 8 a 128 marcos.
En resumen, el modelo de tormenta propuesto mejoró la comprensión de video largo utilizando un codificador temporal basado en Mamba y una reducción de token eficiente. Habilitó una compresión fuerte sin perder información temporal clave, registrando el rendimiento de última generación en puntos de referencia de larga duración mientras mantiene bajo el cálculo. El método puede actuar como una línea de base para futuras investigaciones, facilitando la innovación en compresión de tokens, alineación multimodal e implementación del mundo real para mejorar la precisión y eficiencia del modelo de video.
Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.
Divyesh es un pasante de consultoría en MarktechPost. Está buscando un BTech en ingeniería agrícola y alimentaria del Instituto Indio de Tecnología, Kharagpur. Es un entusiasta de la ciencia de datos y el aprendizaje automático que quiere integrar estas tecnologías líderes en el dominio agrícola y resolver desafíos.