Pipeta de código abierto con IA líquida: un conjunto de evaluación comparativa reproducible que mide los modelos en el dispositivo, la cuantificación, el tiempo de ejecución y el hardware juntos

Las tarjetas modelo informan la calidad en condiciones de máxima precisión de clase servidor. Esos números rara vez predicen cómo se comporta el mismo modelo en un teléfono. Esta semana, Liquid AI lanzó Pipette. Es una plataforma de código abierto para comparar modelos básicos en dispositivos de vanguardia, creada en asociación con Artificial Analysis como validador de metodología independiente. Pipette trata el comportamiento en el dispositivo como una propiedad del sistema implementado, no como el modelo de forma aislada. Su unidad de medida es una configuración completa: modelo + cuantificación + tiempo de ejecución + dispositivo. El conjunto de datos de lanzamiento cubre cinco métricas de rendimiento en el dispositivo en más de 1000 configuraciones de modelo × cuantificación × tiempo de ejecución × dispositivo × contexto, que abarcan más de 30 modelos, compilaciones de llama.cpp para macOS, iOS, Windows y Android, y longitudes de contexto de 256 a 8192 tokens. Los resultados iniciales verificados provienen de una MacBook Pro con M5 Max, un iPhone 17 Pro y un Galaxy S26 Ultra. La afirmación práctica es comprobable: dos modelos 350M con la misma cuantificación en el mismo teléfono retienen el 78,4% y el 33,8% del rendimiento de decodificación con 4.096 tokens.

¿Es desplegable?

Sí, Pipette se entrega como infraestructura Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), un conjunto de datos de resultados públicos, un panel alojado y aplicaciones de referencia nativas de iOS y Android. No hay nada en lista de espera. La publicación de los resultados enviados por la comunidad aún se encuentra en versión beta.

Qué empresas: cualquier equipo que envíe un modelo a un hardware que no le pertenece. Los desarrolladores individuales y las nuevas empresas en etapa inicial pueden usar el panel y las aplicaciones sin infraestructura. Los equipos de productos del mercado medio pueden gestionar los clientes a través de una flota de dispositivos internos. Los grandes fabricantes de equipos originales, proveedores de chips y empresas pueden operar todo el proceso detrás de su propio firewall. Industrias: OEM de electrónica de consumo y teléfonos inteligentes, automoción, industria y robótica, dispositivos sanitarios, servicios financieros, defensa; en cualquier lugar donde la latencia, la privacidad o la conectividad fuercen la inferencia en el dispositivo. Aplicaciones: Selección de modelo y cuantificación antes de que se confirme un sprint; Validación de adquisición de hardware y SoC; pruebas de regresión cuando se actualiza un tiempo de ejecución, un sistema operativo o un controlador; planificación de capacidades a lo largo del contexto; verificación independiente de las afirmaciones de desempeño de los proveedores.

Lo que Liquid AI envió

Liquid AI lanzó Pipette en asociación con Artificial Analysis, un validador independiente que revisó y verificó la metodología. La premisa es estrecha y útil: el comportamiento en el dispositivo es una propiedad del sistema implementado, no del modelo de forma aislada.

El conjunto de datos de lanzamiento cubre cinco métricas de rendimiento en el dispositivo en más de 1000 configuraciones de modelo × cuantificación × tiempo de ejecución × dispositivo × contexto. Abarca más de 30 modelos, múltiples formatos de cuantificación, compilaciones de llama.cpp para macOS, iOS, Windows y Android, y longitudes de contexto de 256 a 8192 tokens. Los resultados iniciales publicados provienen de una MacBook Pro con M5 Max, un iPhone 17 Pro y un Galaxy S26 Ultra, con resultados de AMD Ryzen AI Max+ 395 y Radeon 8060S que se publicarán próximamente.

En Pipette, la unidad de medida es una configuración de implementación: modelo + cuantificación + tiempo de ejecución + dispositivo. Luego, un punto de referencia define la métrica y la forma del token, lo que produce un resultado de latencia, rendimiento o memoria. La calidad se rastrea por separado en IFBench, GPQA Diamond y MATH-500. Esos puntajes de calidad actualmente provienen de ejecuciones de evaluación de llama.cpp en sistemas de referencia NVIDIA H100 de 80 GB, luego se comparan con ejecuciones en el dispositivo que comparten el mismo modelo y cuantificación; el número de calidad que se muestra junto al rendimiento del teléfono no se produjo en el teléfono.

Por qué el contexto de implementación cambia la respuesta

Cuatro comparaciones publicadas muestran hasta qué punto una configuración puede influir en una decisión:

La escala de contexto puede divergir en recuentos de parámetros idénticos. En Q4_K_M en el Galaxy S26 Ultra, Granite-4.0-H-350M retiene el 78,4% de su rendimiento de decodificación de 256 a 4096 tokens de entrada, mientras que Granite-4.0-350M retiene solo el 33,8%. La activación escasa compra velocidad, no memoria. Con 2048 tokens de entrada en el mismo teléfono, LFM2.5-8B-A1B decodifica 2,4 veces más rápido que Qwen3.5-4B y 2,6 veces más rápido que Ministral-3-3B-Instruct-2512. Activa 1,500 millones de 8,500 millones de parámetros por token, pero aún alcanza un máximo de 5,29 GiB porque todos los pesos expertos ocupan memoria. La velocidad y la calidad no van juntas. En el iPhone 17 Pro en Q4_K_M, MiniCPM5-1B completa una carga de trabajo de 2048 entradas/256 salidas en 3,47 segundos frente a 4,12 segundos para LFM2.5-1.2B-Instruct, una reducción del 15,8 % en el tiempo transcurrido. En los mismos artefactos, LFM obtiene 9,0 puntos más en MATH-500. Los perfiles de sistema casi idénticos pueden ocultar inversiones a nivel de tareas. En Q4_K_M y 2048 tokens de entrada en M5 Max, Granite-4.1-8B y Ministral-3-8B-Instruct-2512 difieren en un 2,4% en el rendimiento de decodificación y un 1,2% en la RAM máxima. Granite lidera IFBench por 7,3 puntos; Ministral aventaja a GPQA Diamond por 14,0 puntos.

Cómo se producen las medidas

Las carreras de rendimiento siguen una metodología publicada: formas de fichas fijas, decodificación voraz, un calentamiento descartado, cinco repeticiones medidas y activación de preparación. Antes de cada repetición cronometrada, un control específico de la plataforma verifica las condiciones térmicas y de carga; Las ejecuciones fallidas no se publican. Las evaluaciones utilizan un protocolo separado con puntuación determinista y ciega al modelo, y las puntuaciones con pipeta nunca ven la procedencia de la generación. Cada envío registra la versión de referencia, la forma del token, el artefacto del modelo, la cuantificación, la versión y configuración del tiempo de ejecución, y el hardware y el sistema operativo del dispositivo.

Explicador interactivo