Liquid AI ha lanzado LFM2-24B-A2B, un modelo optimizado para el envío de herramientas locales de baja latencia, junto con LocalCowork, una aplicación de agente de escritorio de código abierto disponible en su Liquid4All GitHub Cookbook. El lanzamiento proporciona una arquitectura implementable para ejecutar flujos de trabajo empresariales completamente en el dispositivo, eliminando las llamadas API y la salida de datos para entornos sensibles a la privacidad.
Configuración de arquitectura y servicio
Para lograr una ejecución de baja latencia en hardware de consumo, LFM2-24B-A2B utiliza una arquitectura de mezcla dispersa de expertos (MoE). Si bien el modelo contiene 24 mil millones de parámetros en total, solo activa aproximadamente 2 mil millones de parámetros por token durante la inferencia.
Este diseño estructural permite que el modelo mantenga una amplia base de conocimientos y al mismo tiempo reduce significativamente la sobrecarga computacional requerida para cada paso de generación. Liquid AI probó el modelo utilizando la siguiente pila de hardware y software:
Hardware: Apple M4 Max, 36 GB de memoria unificada, 32 núcleos GPU. Motor de servicio: servidor llama con atención flash habilitada. Cuantización: formato Q4_K_M GGUF. Huella de memoria: ~14,5 GB de RAM. Hiperparámetros: temperatura establecida en 0,1, top_p en 0,1 y max_tokens en 512 (optimizado para salidas estrictas y deterministas).
Integración de la herramienta LocalCowork
LocalCowork es un agente de IA de escritorio completamente fuera de línea que utiliza el Protocolo de contexto modelo (MCP) para ejecutar herramientas prediseñadas sin depender de las API de la nube ni comprometer la privacidad de los datos, registrando cada acción en un registro de auditoría local. El sistema incluye 75 herramientas en 14 servidores MCP capaces de manejar tareas como operaciones del sistema de archivos, OCR y escaneo de seguridad. Sin embargo, la demostración proporcionada se centra en un subconjunto altamente confiable y seleccionado de 20 herramientas en 6 servidores, cada una de las cuales se prueba rigurosamente para lograr una precisión de más del 80 % en un solo paso y una participación verificada en la cadena de varios pasos.
LocalCowork actúa como la implementación práctica de este modelo. Funciona completamente fuera de línea y viene preconfigurado con un conjunto de herramientas de nivel empresarial:
Operaciones de archivos: listado, lectura y búsqueda en todo el sistema de archivos del host. Escaneo de seguridad: identificación de claves API filtradas e información de identificación personal (PII) dentro de directorios locales. Procesamiento de documentos: ejecución de reconocimiento óptico de caracteres (OCR), análisis de texto, diferenciación de contratos y generación de archivos PDF. Registro de auditoría: registro de cada llamada de herramienta localmente para realizar un seguimiento del cumplimiento.
Puntos de referencia de rendimiento
El equipo de Liquid AI evaluó el modelo frente a una carga de trabajo de 100 indicaciones de selección de herramientas de un solo paso y 50 cadenas de varios pasos (que requieren de 3 a 6 ejecuciones de herramientas discretas, como buscar una carpeta, ejecutar OCR, analizar datos, deduplicar y exportar).
Estado latente
El modelo promedió ~385 ms por respuesta de selección de herramienta. Este tiempo de envío de menos de un segundo es muy adecuado para aplicaciones interactivas con presencia humana donde se necesita retroalimentación inmediata.
Exactitud
Ejecuciones de un solo paso: 80% de precisión. Cadenas de varios pasos: tasa de finalización de un 26 % de un extremo a otro.
Conclusiones clave
Ejecución local que prioriza la privacidad: LocalCowork opera completamente en el dispositivo sin dependencias de API en la nube ni salida de datos, lo que lo hace muy adecuado para entornos empresariales regulados que requieren una estricta privacidad de los datos. Arquitectura MoE eficiente: LFM2-24B-A2B utiliza un diseño de mezcla dispersa de expertos (MoE), activando solo ~2 mil millones de sus 24 mil millones de parámetros por token, lo que le permite caber cómodamente dentro de una huella de RAM de ~14,5 GB usando la cuantificación Q4_K_M GGUF. Latencia inferior a un segundo en hardware de consumo: cuando se compara con una computadora portátil Apple M4 Max, el modelo alcanza una latencia promedio de ~385 ms para el envío de selección de herramientas, lo que permite flujos de trabajo altamente interactivos en tiempo real. Integración de herramientas MCP estandarizadas: el agente aprovecha el protocolo de contexto modelo (MCP) para conectarse sin problemas con herramientas locales, incluidas operaciones del sistema de archivos, OCR y escaneo de seguridad, mientras registra automáticamente todas las acciones en un registro de auditoría local. Fuerte precisión de un solo paso con límites de varios pasos: el modelo logra una precisión del 80 % en la ejecución de herramientas de un solo paso, pero cae a una tasa de éxito del 26 % en cadenas de varios pasos debido a la “confusión entre hermanos” (seleccionando una herramienta similar pero incorrecta), lo que indica que actualmente funciona mejor en un bucle guiado por un ser humano en lugar de como un agente totalmente autónomo.
Consulte el repositorio y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.