Liquid AI lanza LFM2.5-VL-3B-DSpark: decodificación especulativa para modelos de visión y lenguaje con una decodificación hasta 3,13 veces más rápida

Liquid AI ha anunciado LFM2.5-VL-3B-DSpark, un borrador de modelo experimental de decodificación especulativa para su modelo de lenguaje visual LFM2.5-VL-3B. El redactor agrega alrededor de 280 millones de parámetros y acelera la decodificación sin cambiar la salida del modelo. El equipo de Liquid AI informa una decodificación hasta 3,13 veces más rápida en el silicio de Apple y hasta 2,66 veces en una NVIDIA H100.

¿Es desplegable? Sí, Weights está disponible en Hugging Face en Safetensors y GGUF, con soporte desde el primer día en SGLang, MLX-VLM y llama.cpp. El equipo de Liquid AI etiqueta el lanzamiento como experimental y se envía bajo la licencia abierta LFM v1.0, que permite el uso comercial gratuito solo para empresas con ingresos anuales inferiores a 10 millones de dólares.

Qué cambia la decodificación especulativa para un VLM

Un modelo estándar genera un token por pase hacia adelante. La decodificación especulativa añade un pequeño redactor que propone varias fichas por delante. Luego, el modelo objetivo grande verifica todo el bloque de una sola vez y conserva las fichas con las que está de acuerdo.

DSpark sigue la receta de los redactores de DSpark del modelo de texto de Liquid AI, descrita en el artículo de DSpark. El redactor lee los estados ocultos del modelo objetivo de varias capas y predice los siguientes k tokens.

El punto clave del diseño: la modalidad no le importa al redactor. Cuando los tokens llegan a las capas ocultas, los parches de texto e imagen son solo tensores. Entonces, el equipo de Liquid AI reutiliza exactamente el mismo algoritmo de inferencia para su modelo de visión y lenguaje.

Redactor Arquitectura y Formación

El redactor es un modelo simplificado de sólo atención. Las ablaciones eligieron 4 capas y un tamaño de bloque de 9. Liquid AI recomienda un tamaño de bloque de 8 o 9 en la inferencia, según el hardware. Las ejecuciones de Apple Silicon usan 8.

ComponenteParámetrosPila de decodificador (4 capas)193,0MHproyección de estado oculto21,0MMCabeza de Markov65,5MNormas + cabeza de confianza6,4kTotal279,5M

El incrustador y el cabezal LM están atados al objetivo, por lo que el dibujante no los transporta. Liquid AI dice que esto aumenta el recuento de parámetros implementados en un 8,9%. La capacitación utilizó datos de ajuste fino supervisados ​​que cubren tareas comunes de visión y lenguaje durante 10 épocas. Todas las ablaciones y el entrenamiento se realizaron exclusivamente en hardware AMD.

Resultados de referencia

La evaluación sigue el punto de referencia MMSpec en 6 tipos de tareas: VQA general, VQA de texto, subtítulos de imágenes, VQA de gráficos, razonamiento complejo y conversación de varios turnos. Todas las ejecuciones utilizaron tamaño de lote 1, temperatura 0 y pesos de 16 bits para el codificador de visión y la red troncal. Los datos se recopilaron en Pipette, la infraestructura pública de evaluación comparativa de dispositivos de Liquid AI.

Aceleración de StackDecode Aceleración de extremo a extremo Tokens aceptados por pasada MLX-VLM, M5 Max MacBook Pro (bloque 8) 2,30 x a 3,13 x 1,56 x a 2,62 x 3,24 a 4,34 llama.cpp, M3 Ultra (bloque 8) 1,57 x a 2,14 x 1,30 x a 1,77 x 3,31 a 4,50 SGLang, 1x H100 80 GB (bloque 9) 2,04x a 2,66×1,64x a 2,27×3,46 a 4,57

Las cifras de decodificación ‘hasta’ y de extremo a extremo a menudo provienen de tareas diferentes. En el M5 Max, la decodificación 3,13x proviene de los subtítulos COCO, mientras que 2,62x de extremo a extremo proviene de MMMU-Pro.

La aceptación se situó en un rango similar en ambas pilas de Apple. Liquid AI interpreta esto como aceptación dependiendo del redactor y la carga de trabajo, no del tiempo de ejecución.

Con una mayor concurrencia, DSpark mantuvo una ventaja de rendimiento en cada nivel medido en un único H100 en SGLang. La brecha se reduce a medida que aumenta la concurrencia.

Calidad y temperatura de salida

Bajo la decodificación codiciosa, el objetivo verifica cada token propuesto, por lo que la salida es idéntica al modelo base. A temperaturas distintas de cero con muestreo coincidente, la decodificación especulativa preserva la distribución de salida del objetivo, como lo demuestran Leviathan et al.

La temperatura afecta la velocidad. Las temperaturas más altas distribuyen la probabilidad entre más tokens candidatos, por lo que el redactor y el objetivo no están de acuerdo con más frecuencia. En las pruebas de Liquid AI, esto redujo la aceptación y el rendimiento.

Por qué las ganancias de extremo a extremo son menores en el borde

La decodificación especulativa sólo acelera la decodificación. La codificación de imágenes y el prerrelleno se ejecutan a la misma velocidad. Un VLM debe codificar la imagen y luego procesar cientos de tokens visuales junto con el mensaje.

En dispositivos perimetrales con menos procesamiento que las GPU del centro de datos, el precarga requiere una mayor proporción de latencia. La IA líquida enmarca esto como la ley de Amdahl: la aceleración total está limitada por la parte que no se acelera. Esto explica casos como TextVQA en el M5 Max, donde una decodificación 2,69 veces más rápida produce 1,56 veces de extremo a extremo.

Cómo ejecutarlo

SGLang requiere v0.5.19 o posterior. Inicie LiquidAI/LFM2.5-VL-3B con –speculative-algorithm DSPARK y apunte –speculative-draft-model-path al redactor. En Apple Silicon, MLX-VLM v0.7.2 o posterior acepta el redactor a través de –draft-model. Actualmente, DSpark en MLX-VLM solo admite muestreo codicioso, por lo tanto, establezca la temperatura en 0. Para llama.cpp, empareje el redactor GGUF con el objetivo LFM2.5-VL-3B-GGUF.

El trabajo de integración es público en las solicitudes de extracción llama.cpp, SGLang y MLX-VLM. La aceleración de modelos cuantificados está fuera del alcance de esta versión.

Conclusiones clave

Un dibujante de 279,5 M agrega un 8,9 % de parámetros al LFM2.5-VL-3B. La decodificación se ejecuta hasta 3,13 veces más rápido en M5 Max, 2,66 veces en H100. La salida es idéntica bajo decodificación codiciosa; distribución preservada durante el muestreo. La codificación de visión y precarga limitan las ganancias de extremo a extremo, especialmente en el borde. Probado únicamente en 16 bits; La aceleración cuantificada aún no está cubierta.

Consulta los Detalles Técnicos. Todo el crédito es para el investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150kML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.