Liquid AI ha publicado puntos de control del modelo preliminar de DSpark para tres modelos de su familia LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B. Cada redactor añade una ruta de decodificación especulativa a un modelo de destino existente. Un borrador de aproximadamente 300 millones de parámetros propone un bloque de nueve tokens candidatos, y el modelo objetivo verifica todo el bloque en una sola pasada. El intercambio es un pequeño aumento de memoria por una gran velocidad de decodificación: hasta 3,18x en un H100 y hasta 2,87x en un MacBook Pro M4 Max. La salida no cambia. Bajo la decodificación codiciosa, la secuencia emitida es idéntica al modelo objetivo que se ejecuta solo, por lo que la precisión del punto de referencia no cambia. Tanto llama.cpp como SGLang tienen soporte desde el primer día.
¿Es desplegable?
Sí, si eres autoanfitrión. Los pesos se envían como Safetensors y GGUF, y los puntos de control del redactor no son atendidos por ningún proveedor de inferencia alojado en Hugging Face en la actualidad. Para ejecutarlos se necesita una compilación SGLang o llama.cpp con soporte DSpark para objetivos LFM2.
Nivel de empresa: la licencia abierta LFM v1.0 permite el uso comercial gratuito solo mientras su entidad se mantenga por debajo de los 10 millones de dólares en ingresos anuales. Están cubiertos los desarrolladores independientes, las empresas emergentes y las PYMES; las empresas más grandes deben comunicarse primero con Liquid AI para obtener una licencia comercial. Industrias: herramientas para desarrolladores, aplicaciones para consumidores que se ejecutan localmente, robótica y sistemas integrados, además de cargas de trabajo de atención médica, finanzas y defensa que mantienen los datos en las instalaciones o en el dispositivo. Aplicaciones: asistentes de codificación locales, agentes en el dispositivo que razonan antes de cada llamada a la herramienta, chat de un solo usuario donde el tamaño del lote es 1 y copilotos fuera de línea en hardware de tipo portátil.
¿Qué son los redactores?
La decodificación especulativa utiliza un modelo pequeño para proponer tokens que un modelo más grande verifica. Cada redactor LFM2.5 tiene aproximadamente 300 M de parámetros: 295,7 M para el objetivo 1.2B-Instruct y 327,7 M para los objetivos 2.6B y 8B-A1B. La columna vertebral consta de 5 capas de atención total con tamaño_oculto=2048, tamaño_intermedio=6144, GQA en 32 cabezas sobre 8 cabezas KV y un tamaño de bloque de 9. El redactor no incluye pesos de vocabulario; La incrustación y la cabeza LM están unidas al objetivo en el momento de la carga. El repositorio de Drafter de 2.6B tiene 655 MB en BF16, que es el costo real de memoria que está agregando.
DSpark combina tres partes. Una columna vertebral paralela estilo DFlash, condicionada a las características del contexto del objetivo, produce estados ocultos para todos los tokens de draft en un solo paso hacia adelante. Una cabeza secuencial liviana, modelada como una cadena de Markov entre tokens vecinos en el rango 256, restaura la dependencia entre tokens y aumenta la aceptación en posiciones de bloque posteriores. Un verificador programado de confianza predice la probabilidad de supervivencia de cada token y elimina los sufijos de baja confianza cuando la verificación costaría más de lo que ahorra.
Los resultados medidos
Liquid AI informa el rendimiento en 1xH100 en BF16 a través de SGLang, y en una MacBook Pro M4 Max a través de llama.cpp con pesos Metal y FP16 GGUF. Ambos utilizan un tamaño de bloque 9, un tamaño de lote 1 y una temperatura 0, en MATH500, HumanEval, MBPP, GSM8K y MT-Bench.
Speedup rastrea la tasa de aceptación, que rastrea qué tan predecible es el resultado. LFM2.5-8B-A1B acepta 8,27 de 10 tokens por paso en MATH500 y solo 4,02 en GSM8K, por lo que el mismo modelo oscila de 3,18x a 1,29x en la misma GPU. En el modelo 1.2B, la aceptación de MT-Bench cae a 3,90 y la ganancia del H100 cae a 1,66x.
El resultado de MoE en el silicio de Apple es la advertencia más clara: LFM2.5-8B-A1B gana sólo 1,18 veces de media en el M4 Max. Liquid AI atribuye esto a la implementación actual de MoE en el backend Metal de llama.cpp y al hecho de que la verificación de k tokens activa más expertos y, por lo tanto, más tráfico de peso, que un solo paso de decodificación.
El caso agente
La ganancia se concentra donde el usuario espera mediante el razonamiento antes de cada llamada a la herramienta. En escenarios de llamada de funciones de múltiples herramientas, Liquid AI informa que DSpark reduce la latencia en un 57 % en promedio para LFM2.5-2.6B. Pruébelo con sus propios rastros: un agente que planifica, llama y replanifica paga el costo de decodificación varias veces por turno de usuario.
En SGLang, lanza el objetivo con el borrador adjunto:
El tamaño del bloque se lee desde el archivo config.json del redactor y la línea de base es el mismo comando sin los tres indicadores –especulativo-*.
Conclusiones clave
Los redactores DSpark agregan ~300 millones de parámetros y una decodificación hasta 3,18 veces más rápida en un H100. La salida codiciosa es idéntica a la línea de base, por lo que la precisión del punto de referencia no cambia. La aceleración sigue la tasa de aceptación y varía según la carga de trabajo, de 1,04x a 3,18x. El MoE en el dispositivo es el punto débil: LFM2.5-8B-A1B gana sólo 1,18 veces en M4 Max. La llamada a función multiherramienta obtiene la mayor ventaja práctica: una latencia un 57 % menor en LFM2.5-2.6B.
Consulte la tarjeta modelo en 8B-A1B y el informe técnico completo. Todo el crédito por esta investigación va a los investigadores de este proyecto.
Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.