La nueva arquitectura híbrida LFM2-24B-A2B de Liquid AI combina atención con convoluciones para resolver los cuellos de botella de escala de los LLM modernos

La carrera de la IA generativa ha sido durante mucho tiempo un juego en el que “cuanto más grande, mejor”. Pero a medida que la industria alcanza los límites del consumo de energía y los cuellos de botella de la memoria, la conversación está pasando del recuento de parámetros en bruto a la eficiencia arquitectónica. El equipo de Liquid AI está liderando esta carga con el lanzamiento de LFM2-24B-A2B, un modelo de 24 mil millones de parámetros que redefine lo que debemos esperar de la IA con capacidad de vanguardia.

https://www.liquid.ai/blog/lfm2-24b-a2b

La arquitectura ‘A2B’: una relación 1:3 para la eficiencia

El ‘A2B’ en el nombre del modelo significa Atención a la Base. En un Transformer tradicional, cada capa utiliza Softmax Attention, que escala cuadráticamente (O(N2)) con la longitud de la secuencia. Esto conduce a cachés KV (valor-clave) masivos que devoran la VRAM.

El equipo de Liquid AI evita esto mediante el uso de una estructura híbrida. Las capas ‘Base’ son bloques de convolución cortos cerrados eficientes, mientras que las capas ‘Atención’ utilizan Atención de consultas agrupadas (GQA).

En la configuración LFM2-24B-A2B, el modelo utiliza una proporción de 1:3:

Capas totales: 40 Bloques de convolución: 30 Bloques de atención: 10

Al intercalar una pequeña cantidad de bloques GQA con una mayoría de capas de convolución cerradas, el modelo conserva la recuperación y el razonamiento de alta resolución de un transformador mientras mantiene el precarga rápido y la baja huella de memoria de un modelo de complejidad lineal.

MoE escaso: 24 mil millones de inteligencia con un presupuesto de 2 mil millones

Lo más importante de LFM2-24B-A2B es su diseño de Mezcla de Expertos (MoE). Si bien el modelo contiene 24 mil millones de parámetros, solo activa 2,3 mil millones de parámetros por token.

Este es un punto de inflexión para la implementación. Debido a que la ruta de parámetros activos es tan reducida, el modelo puede caber en 32 GB de RAM. Esto significa que puede ejecutarse localmente en computadoras portátiles de consumo de alta gama, computadoras de escritorio con GPU integradas (iGPU) y NPU dedicadas sin necesidad de un A100 de nivel de centro de datos. Proporciona efectivamente la densidad de conocimiento de un modelo 24B con la velocidad de inferencia y la eficiencia energética de un modelo 2B.

https://www.liquid.ai/blog/lfm2-24b-a2b

Puntos de referencia: puñetazos

El equipo de Liquid AI informa que la familia LFM2 sigue un comportamiento de escala logarítmico lineal predecible. A pesar de su menor número de parámetros activos, el modelo 24B-A2B supera consistentemente a sus rivales más grandes.

Lógica y razonamiento: en pruebas como GSM8K y MATH-500, rivaliza con modelos densos que duplican su tamaño. Rendimiento: cuando se comparó con una sola NVIDIA H100 usando vLLM, alcanzó un total de 26,8 000 tokens por segundo con 1024 solicitudes simultáneas, superando significativamente a gpt-oss-20b y Qwen3-30B-A3B de Snowflake. Contexto largo: el modelo presenta una ventana de contexto de token de 32k, optimizada para canalizaciones RAG (generación aumentada de recuperación) sensibles a la privacidad y análisis de documentos locales.

Hoja de trucos técnicos

Especificación de propiedadParámetros totales24 mil millonesParámetros activos2,3 mil millonesArquitecturaHíbrido (Conv. cerrada + GQA)Capas40 (30 base / 10 atención)Longitud del contexto32,768 tokensDatos de entrenamiento17 billones de tokensLicenciaLicencia abierta LFM v1.0Soporte nativollama.cpp, vLLM, SGLang, MLX

Conclusiones clave

Arquitectura híbrida ‘A2B’: el modelo utiliza una proporción de 1:3 de atención de consultas agrupadas (GQA) a convoluciones cortas cerradas. Al utilizar capas ‘Base’ de complejidad lineal para 30 de 40 capas, el modelo logra velocidades de precarga y decodificación mucho más rápidas con una huella de memoria significativamente reducida en comparación con los Transformers tradicionales de atención total. Escasa eficiencia de MoE: a pesar de tener 24 mil millones de parámetros totales, el modelo solo activa 2,3 mil millones de parámetros por token. Este diseño de ‘Mezcla dispersa de expertos’ le permite ofrecer la profundidad de razonamiento de un modelo grande mientras mantiene la latencia de inferencia y la eficiencia energética de un modelo de parámetros 2B. Capacidad True Edge: optimizado mediante la búsqueda de arquitectura hardware-in-the-loop, el modelo está diseñado para caber en 32 GB de RAM. Esto lo hace completamente implementable en hardware de consumo, incluidas computadoras portátiles con GPU y NPU integradas, sin requerir una costosa infraestructura de centro de datos. Rendimiento de última generación: LFM2-24B-A2B supera a competidores más grandes como Qwen3-30B-A3B y Snowflake gpt-oss-20b en rendimiento. Los puntos de referencia muestran que alcanza aproximadamente 26,8 000 tokens por segundo en un solo H100, lo que muestra un escalamiento casi lineal y una alta eficiencia en tareas de contexto prolongado hasta su ventana de 32 000 tokens.

Consulta los detalles técnicos y los pesos del modelo. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.