Contenedor de inferencia de modelos grandes: últimas capacidades y mejoras de rendimiento

Las implementaciones modernas de modelos de lenguaje grande (LLM) enfrentan un desafío creciente de costos y rendimiento impulsado por el crecimiento del recuento de tokens. El recuento de tokens, que está directamente relacionado con el recuento de palabras, el tamaño de la imagen y otros factores de entrada, determina tanto los requisitos computacionales como los costos. Los contextos más largos se traducen en mayores gastos por solicitud de inferencia. Este desafío se ha intensificado a medida que los modelos de frontera ahora admiten hasta 10 millones de tokens para adaptarse a las crecientes demandas contextuales de los sistemas de recuperación de generación aumentada (RAG) y agentes de codificación que requieren bases de código y documentación extensas. Sin embargo, la investigación de la industria revela que una parte importante del recuento de tokens en las cargas de trabajo de inferencia es repetitivo, y los mismos documentos y textos aparecen en numerosas indicaciones. Estos “puntos calientes” de datos representan una oportunidad. Al almacenar en caché el contenido que se reutiliza con frecuencia, las organizaciones pueden lograr reducciones de costos y mejoras de rendimiento para sus cargas de trabajo de inferencia de contexto prolongado.

AWS lanzó recientemente importantes actualizaciones para el contenedor Large Model Inference (LMI), que ofrece mejoras integrales de rendimiento, soporte de modelos ampliado y capacidades de implementación optimizadas para los clientes que alojan LLM en AWS. Estas versiones se centran en reducir la complejidad operativa y al mismo tiempo ofrecer mejoras de rendimiento mensurables en arquitecturas de modelos populares.

Compatibilidad con LMCache: transformando el rendimiento en contextos prolongados

Una de las capacidades más importantes introducidas en las versiones más recientes de LMI es el soporte integral de LMCache, que transforma fundamentalmente la forma en que las organizaciones pueden manejar cargas de trabajo de inferencia de contexto prolongado. LMCache es una solución de almacenamiento en caché de KV de código abierto que extrae y almacena cachés de KV generados por motores LLM modernos, compartiendo estos cachés entre motores y consultas para ayudar a mejorar el rendimiento de la inferencia.

A diferencia de los sistemas tradicionales de almacenamiento en caché de solo prefijos, LMCache reutiliza cachés KV de texto reutilizado, no necesariamente solo prefijos, en una instancia del motor de servicio. El sistema opera a nivel de fragmentos, identificando tramos de texto comúnmente repetidos en documentos o conversaciones y almacenando su caché KV precalculada. Este enfoque permite el almacenamiento de varios niveles que abarca la memoria de la GPU, la memoria de la CPU y los backends de disco/remotos, con almacenamiento en caché inteligente que mantiene un índice interno que asigna secuencias de tokens a entradas KV almacenadas en caché. Las versiones más recientes de LMI introducen la configuración automática de LMCache, lo que agiliza la implementación y optimización de la caché KV. Esta interfaz de código bajo y sin código (LCNC) ayuda a los clientes a habilitar sin problemas esta característica de rendimiento avanzado sin una configuración manual compleja. Al descargar la caché KV de la memoria de la GPU a la RAM de la CPU o al almacenamiento NVMe, LMCache permite un manejo eficiente de escenarios de contexto prolongado al tiempo que ayuda a ofrecer mejoras de latencia.

Las pruebas exhaustivas en varios tamaños de modelos y longitudes de contexto revelan mejoras de rendimiento que ayudan a transformar la experiencia del usuario. Para cargas de trabajo con contexto repetido, LMCache logra un tiempo hasta el primer token (TTFT) más rápido al procesar contextos de tokens multimillonarios. Las organizaciones que implementan LMI pueden configurar la descarga de CPU cuando la RAM de la instancia permite un rendimiento óptimo o usar NVMe con O_DIRECT habilitado para cargas de trabajo que requieren una mayor capacidad de caché. La implementación del enrutamiento fijo basado en sesiones en Amazon SageMaker AI ayuda a maximizar las tasas de resultados de caché, asegurando que las solicitudes de la misma sesión se enruten consistentemente a instancias con contenido almacenado en caché relevante.

Puntos de referencia de rendimiento de LMCache

Las pruebas exhaustivas en varios tamaños de modelos y longitudes de contexto revelan mejoras de rendimiento que mejoran la experiencia del usuario para cargas de trabajo de inferencia de contexto largo. La metodología de prueba adaptó el punto de referencia LMCache Long Doc QA para trabajar con el contenedor LMI, que consta de tres rondas: precalentamiento para la inicialización en frío, una ronda de calentamiento para llenar el almacenamiento de LMCache y una ronda de consulta para medir el rendimiento al recuperar del caché. Las pruebas comparativas se realizaron en instancias p4de.24xlarge (8 × GPU A100, 1,1 TB de RAM, SSD NVMe) utilizando modelos Qwen con 46 documentos de 10 000 tokens cada uno (460 000 tokens en total) y 4 solicitudes simultáneas.

Para cargas de trabajo con contexto repetido, LMCache logra un tiempo hasta el primer token (TTFT) más rápido al procesar contextos de tokens multimillonarios. La descarga de CPU ofrece mejoras de rendimiento con una aceleración de 2,18 veces en la latencia total de solicitudes en comparación con la línea base (52,978 s → 24,274 s) y TTFT 2,65 veces más rápido (1,161 s → 0,438 s). El almacenamiento NVMe con O_DIRECT habilitado se acerca al rendimiento de la CPU (TTFT de 0,741 s) al tiempo que admite capacidad de almacenamiento en caché a escala de TB, logrando una aceleración de 1,84 veces en la latencia total de solicitudes y un TTFT 1,57 veces más rápido. Estos resultados demuestran una reducción de TTFT del 62 % y una reducción de la latencia de solicitud del 54 %, lo que se alinea estrechamente con los puntos de referencia de LMCache publicados. La variación en los porcentajes de mejora probablemente se pueda atribuir al hardware y a diferencias menores de configuración. Estas reducciones de latencia se traducen directamente en ahorros de costos, porque la reducción del 54 % en el tiempo de procesamiento de solicitudes permite que la misma infraestructura maneje más del doble del volumen de solicitudes, lo que efectivamente reduce a la mitad los costos de procesamiento por solicitud.

Las características de rendimiento varían significativamente según el tamaño del modelo debido a las diferencias en los requisitos de memoria caché KV por token. Los modelos más grandes requieren sustancialmente más memoria por token (Qwen2.5-1.5B: 28 KB/token, Qwen2.5-7B: 56 KB/token, Qwen2.5-72B: 320 KB/token), lo que significa que agotan la capacidad de caché KV de GPU en longitudes de contexto mucho más cortas. Qwen 2.5-1.5B puede almacenar caché KV para hasta 2,6 millones de tokens en la memoria de la GPU, mientras que Qwen 2.5-72B alcanza su límite de 480.000 tokens. Esto significa que LMCache ofrece valor en contextos más cortos para modelos más grandes. Un modelo de 72 B puede beneficiarse de la descarga de CPU a partir de alrededor de 500 000 tokens con aceleraciones de 4 a 6 veces, mientras que los modelos más pequeños solo requieren descargas en longitudes de contexto extremas superiores a 2,5 millones de tokens. Las organizaciones que implementan LMI pueden configurar la descarga de CPU cuando la RAM de la instancia permite un rendimiento óptimo o usar NVMe con O_DIRECT habilitado para cargas de trabajo que requieren una mayor capacidad de caché. La implementación de enrutamiento fijo basado en sesiones en SageMaker AI ayuda a maximizar las tasas de resultados de caché, asegurando que las solicitudes de la misma sesión se dirijan consistentemente a instancias con contenido almacenado en caché relevante.

Cómo utilizar LMCache

Existen dos métodos principales para configurar LMCache como se define en la documentación de GitHub. El primero es un enfoque de configuración manual y el segundo es una configuración automatizada disponible en nuevas versiones de LMI.

Configuración manual
Para la configuración manual, los clientes crean su propia configuración de LMCache y la especifican en propiedades, archivos o variables de entorno:

option.lmcache_config_file=/ruta/a/tu/lmcache_config.yaml# OROPTION_LMCACHE_CONFIG_FILE=/ruta/a/tu/lmcache_config.yaml

Este enfoque brinda a los clientes control sobre la configuración de LMCache, de modo que puedan personalizar los backends de almacenamiento de caché, los tamaños de fragmentos y otros parámetros avanzados de acuerdo con sus requisitos específicos.

Configuración automática
Para implementaciones optimizadas, los clientes pueden habilitar la configuración automática de LMCache de manera similar:

option.lmcache_auto_config=Verdadero# OROPTION_LMCACHE_AUTO_CONFIG=Verdadero

La configuración automática genera automáticamente una configuración de LMCache basada en el espacio de CPU/disco disponible en la máquina host. Esta opción de implementación solo admite implementaciones de Tensor Parallelism, supone que /tmp está montado en almacenamiento NVMe para almacenamiento en caché basado en disco y requiere maxWorkers=1. Estas configuraciones se asumen con la configuración automática, que está diseñada para servir un único modelo por instancia de contenedor. Para ofrecer varios modelos o copias de modelos, los clientes deben utilizar los componentes de inferencia de IA de Amazon SageMaker, que facilitan el aislamiento de recursos entre modelos y copias de modelos.

La función de configuración automática agiliza la implementación de la caché KV al aliviar la necesidad de archivos de configuración YAML manuales para que los clientes puedan comenzar rápidamente con la optimización de LMCache.

Recomendaciones de implementación

A partir de resultados integrales de evaluación comparativa y experiencia en implementación, surgen varias recomendaciones para una implementación óptima de LMI:

Configure la descarga de la CPU cuando la RAM de la instancia lo permita, lo que ayuda a ofrecer un rendimiento óptimo para la mayoría de las cargas de trabajo. Utilice NVMe con O_DIRECT habilitado para cargas de trabajo que requieran una mayor capacidad de caché más allá de la RAM disponible. Implemente enrutamiento fijo basado en sesiones en SageMaker AI para ayudar a maximizar las tasas de resultados de la caché y facilitar un rendimiento consistente. Considere la arquitectura del modelo al configurar los umbrales de descarga, ya que los modelos con diferentes configuraciones de cabezales KV tendrán diferentes configuraciones óptimas. Utilice la configuración automática de LMCache para agilizar la implementación y reducir la complejidad operativa.

Rendimiento mejorado con decodificación especulativa EAGLE

Las versiones más recientes de LMI ayudan a ofrecer mejoras de rendimiento mediante la compatibilidad con técnicas de decodificación especulativa EAGLE. El algoritmo de extrapolación para una mayor eficiencia del modelo de lenguaje (EAGLE) acelera la decodificación de modelos de lenguaje grandes al predecir tokens futuros directamente desde las capas ocultas del modelo. Este enfoque genera borradores de tokens que el modelo primario valida en paralelo, lo que ayuda a reducir la latencia general de generación y al mismo tiempo mantiene la calidad de la salida.

Configurar la decodificación especulativa de EAGLE es sencillo y solo requiere la especificación de la ruta del modelo preliminar y la cantidad de tokens especulativos en su configuración de implementación. Esto permite a las organizaciones lograr un mejor rendimiento para las cargas de trabajo de alojamiento de LLM con beneficios para implementaciones de producción de alta concurrencia y modelos centrados en el razonamiento.

Soporte de modelo ampliado y capacidades multimodales

Las versiones más recientes de LMI ayudan a brindar soporte integral para modelos de código abierto de vanguardia, incluidos DeepSeek v3.2, Mistral Large 3, Ministral 3 y la serie Qwen3-VL. Las optimizaciones de rendimiento ayudan a mejorar tanto el rendimiento como el tiempo hasta el primer token (TTFT) para el servicio de modelos a gran escala en estas arquitecturas. Las capacidades multimodales ampliadas incluyen compatibilidad con FlashAttention ViT, que ahora sirve como backend predeterminado para modelos de visión y lenguaje. Las mejoras en la decodificación especulativa de EAGLE brindan soporte para gráficos CUDA de varios pasos y soporte multimodal con Qwen3-VL, lo que permite una inferencia más rápida para cargas de trabajo de lenguaje visual. Con estas mejoras, las organizaciones pueden implementar y escalar modelos básicos (FM) de manera más rápida y eficiente, lo que ayuda a reducir el tiempo de producción y al mismo tiempo reduce la complejidad operativa.

Mejoras en el alojamiento del adaptador LoRA

Las versiones más recientes de LMI aportan mejoras notables para alojar múltiples adaptadores LoRA en SageMaker AI. Los adaptadores LoRA ahora se cargan de forma “lenta”: al crear un componente de inferencia, el componente del adaptador pasa a estar disponible casi de inmediato, pero la carga real de los pesos del adaptador y el registro con el motor de inferencia ocurre en la primera invocación. Este enfoque ayuda a reducir el tiempo de implementación y al mismo tiempo mantiene la flexibilidad para escenarios de múltiples inquilinos.

Ahora se admiten scripts de preprocesamiento de entrada y salida personalizados tanto para los modelos base como para los adaptadores, y cada componente de inferencia que aloja adaptadores LoRA puede tener scripts diferentes. Esto permite una lógica de formato específica del adaptador sin modificar el código de inferencia principal, lo que admite implementaciones multiinquilino donde diferentes adaptadores aplican distintas reglas de formato al mismo modelo subyacente.

Los formateadores de salida personalizados proporcionan un mecanismo flexible para transformar las respuestas del modelo antes de que se devuelvan a los clientes, de modo que las organizaciones puedan estandarizar formatos de salida, agregar metadatos personalizados o implementar una lógica de formato específica del adaptador. Estos formateadores se pueden definir en el nivel del modelo base para aplicarlos a las respuestas de forma predeterminada, o en el nivel del adaptador para anular el comportamiento del modelo base para los adaptadores LoRA. Los casos de uso comunes incluyen agregar marcas de tiempo de procesamiento y metadatos personalizados, transformar texto generado con prefijos o formato, calcular e inyectar métricas personalizadas, implementar esquemas de salida específicos de adaptadores para diferentes aplicaciones cliente y estandarizar formatos de respuesta en implementaciones de modelos heterogéneos.

Comience hoy

Las versiones más recientes de LMI representan importantes avances en las capacidades de inferencia de modelos grandes. Las organizaciones pueden implementar LLM de vanguardia con mayor rendimiento y flexibilidad con lo siguiente:

Compatibilidad integral con LMCache en todas las versiones Decodificación especulativa EAGLE para inferencia acelerada Compatibilidad ampliada con modelos que incluyen capacidades multimodales de vanguardia Alojamiento de adaptador LoRA mejorado

Las opciones configurables del contenedor brindan la flexibilidad de ajustar las implementaciones para necesidades específicas, ya sea optimizando la latencia, el rendimiento o el costo. Con las capacidades integrales del sistema de Amazon SageMaker AI, puede concentrarse en ofrecer soluciones impulsadas por AI que ayuden a impulsar el valor empresarial en lugar de administrar la infraestructura.

Explore estas capacidades hoy cuando implemente sus modelos de IA generativa en AWS y aproveche las mejoras de rendimiento y la experiencia de implementación optimizada para ayudar a acelerar sus cargas de trabajo de producción.

Sobre los autores

Dmitry Soldatkin

Dmitry Soldatkin es arquitecto senior de soluciones de aprendizaje automático en AWS y ayuda a los clientes a diseñar y crear soluciones de IA/ML. El trabajo de Dmitry cubre una amplia gama de casos de uso de ML, con un interés principal en la IA generativa, el aprendizaje profundo y la ampliación del ML en toda la empresa. Ha ayudado a empresas de muchos sectores, incluidos seguros, servicios financieros, servicios públicos y telecomunicaciones. Le apasiona la innovación continua y el uso de datos para impulsar los resultados comerciales.

Sadaf Fardeen

Sadaf Fardeen lidera la carta de optimización de inferencias para SageMaker. Es propietaria de la optimización y el desarrollo de contenedores de inferencia LLM en SageMaker.

Lokeshwaran Ravi

Lokeshwaran Ravi es ingeniero senior de compiladores de aprendizaje profundo en AWS y se especializa en optimización de aprendizaje automático, aceleración de modelos y seguridad de inteligencia artificial. Se centra en mejorar la eficiencia, reducir costos y crear ecosistemas seguros para democratizar las tecnologías de IA, haciendo que el aprendizaje automático de vanguardia sea accesible y tenga impacto en todas las industrias.

Suma Kasa

Suma Kasa es un arquitecto de aprendizaje automático del equipo de servicios de SageMaker que se centra en la optimización y el desarrollo de contenedores de inferencia LLM en SageMaker.Biografía del autor

Daniel Ferguson

Dan Ferguson es arquitecto sénior de soluciones en AWS, con sede en Nueva York, EE. UU. Como experto en servicios de aprendizaje automático, Dan trabaja para ayudar a los clientes en su camino hacia la integración de flujos de trabajo de aprendizaje automático de manera eficiente, efectiva y sostenible.

smouaa

Sheng Mousa

Sheng Mouaa es ingeniero de desarrollo de software en AWS. Trabaja en el equipo de servicio y optimización, centrándose en crear soluciones eficientes y escalables para la inferencia de modelos de lenguaje grandes.