Perplexity ha abierto Lily, el motor de inferencia local detrás de Hybrid Compute en Perplexity Computer. Es un tiempo de ejecución de un solo proceso: una capa Rust carga el punto de control e impulsa el ciclo de generación, una API de finalización de chat compatible con OpenAI transmite tokens y los núcleos Metal escritos a mano ejecutan el modelo. Ni PyTorch ni MLX se encuentran en la ruta de ejecución. Lily es deliberadamente estrecha con un modelo, Qwen3.6-35B-A3B, en una familia de hardware y esa estrechez es el argumento del rendimiento.
¿Es desplegable? Sí. Hay una demostración pública independiente en el repositorio pplx-garden. Un servidor de inferencia de Rust and Metal que ofrece generación de texto codicioso a través de una API HTTP mínima compatible con OpenAI. El punto de control de 4 bits es de 19,4 GB, por lo que una Mac Apple Silicon con 32 GB o más de memoria unificada es el piso realista; El producto Hybrid Compute de envío de Perplexity incluye macOS 15+, 24 GB como mínimo y 32 GB para obtener mejores resultados.
¿Por qué especializarse?
La pila predeterminada de Mac es MLX más MLX-LM, que ya incluye una implementación Qwen con trabajo experto agrupado, un núcleo Metal recurrente fusionado y atención compatible con GQA. Pero sus operaciones deben seguir siendo reutilizables en todas las arquitecturas. Lily renuncia a eso y pone la estructura del modelo, los planes de ejecución y la selección del kernel en un solo tiempo de ejecución.
Tres formas de carga de trabajo
Qwen3.6-35B-A3B almacena 35 mil millones de parámetros y activa aproximadamente 3 mil millones por token. Un enrutador califica a 256 expertos y elige ocho, junto con un experto compartido que ve cada token. También combina 10 capas de atención completa utilizando atención de consultas agrupadas (16 cabezales de consulta, dos cabezales KV) con 30 capas Gated DeltaNet. Esto produce tres patrones: grupos de expertos desiguales, atención sobre un caché de KV en crecimiento y una recurrencia de tamaño fijo.
Precarga: mantenga los pesos empaquetados, siga enrutando en la GPU
El punto de control utiliza una cuantificación afín de 4 bits por grupos, cada grupo de 64 pesos comparte una escala y un sesgo bfloat16, aproximadamente 70 GB de pesos bfloat16 comprimidos a 19,4 GB. Las operaciones del tensor de Metal 4 consumen bfloat16, por lo que primero se deben reconstruir los pesos. Lily hace eso un mosaico a la vez dentro del GEMM agrupado, manteniendo los resultados en la memoria del grupo de subprocesos y acumulándolos en FP32, por lo que la matriz expandida nunca llega a la memoria unificada. En la ablación de Perplexity, esa fusión aumentó el precarga de extremo a extremo en un 77,4 % con un aviso de 512 tokens.
Mantener el histograma de enrutamiento, el escaneo de prefijos, la dispersión y el mapa de bloques dentro de un único búfer de comando de GPU agregó un 89 % en 512 tokens al eliminar la sincronización de la CPU dentro de cada capa MoE. Pasar de mosaicos de 16 a 32 filas con cuatro grupos simd agregó un 13,2 % a 2K; un escaneo Gated DeltaNet residente en el registro agregó un 5,6%. Los GEMM expertos representan aproximadamente el 90 % del tiempo de precarga. Las indicaciones largas se ejecutan en fragmentos limitados, por lo que las activaciones temporales no compiten con los pesos y el caché por la memoria.
Decodificar: minimizar los bytes movidos por token
La decodificación del lote 1 casi no tiene reutilización de peso, por lo que el ancho de banda establece el límite. Un paso registrado lanzó 795 granos formando 555 etapas secuenciales; Lily registra dependencias reales en un pase de Metal concurrente para que los núcleos independientes se superpongan. El token seleccionado se escribe directamente en la ranura de entrada residente en la GPU del siguiente paso, eliminando un viaje de ida y vuelta de la CPU por token, y se fusionan cuatro cadenas de kernel para mantener los intermediarios en los registros.
Las lecturas de caché fusionadas aumentaron el ancho de banda clave de 33,8 a 47,9 GB/s y el ancho de banda de valor de 42,0 a 61,8 GB/s. Empaquetado GQA, cuatro cabezales de consulta que comparten un grupo de subprocesos para que cada fila KV se cargue una vez, decodificación mejorada un 23,8 % a 32 K. Un diseño de atención de bloque fijo a 32K y superior mejoró la decodificación un 7,7% a 32K, un 27,4% a 64K y un 40,2% a 128K.
Resultados
En un M5 Max de 40 núcleos y 128 GB en el lote 1, cargando bytes de punto de control idénticos de 4 bits contra la ruta de generación directa más rápida de MLX-LM en diez longitudes de 256 a 128 000 tokens, Lily promedió 4156 tokens/s de precarga frente a 3388 (1,23x) y 170,0 tokens/s de decodificación frente a 126,4 (1,35x). En un mensaje de 4K y un contexto de 4K, alcanzó 5.749,9 y 186,6 tokens/s frente a 4.737,5 y 140,9, y fue más rápido en todos los puntos registrados: precarga de 1,12 a 1,42 veces, decodificación de 1,31 a 1,37 veces. Una verificación forzada por un maestro en 192 posiciones elevó la perplejidad de Lily un 0,04 % más, con la misma ficha mejor clasificada el 96,35 % de las veces.
Conclusiones clave
Lily es un motor Rust + Metal para Qwen3.6-35B-A3B en silicio de Apple, sin PyTorch ni MLX en el camino. Promedia 1,23x de precarga MLX-LM y 1,35x decodificación en un M5 Max de 40 núcleos y 128 GB. Mayores ganancias previas al llenado: enrutamiento experto residente en GPU (+89%) y descuantización fusionados en el GEMM agrupado (+77,4%). Mayores ganancias en decodificación: embalaje GQA (+23,8% a 32K) y atención de bloque fijo (+40,2% a 128K).
Consulte los detalles técnicos aquí y el GitHub Repo aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150kML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.