Los modelos de idiomas grandes se basan en arquitecturas de transformadores y aplicaciones de potencia como el chat, la generación de códigos y la búsqueda, pero su creciente escala con miles de millones de parámetros hace que el cálculo eficiente sea cada vez más desafiante. Escalar dichos sistemas mientras se mantiene de baja latencia y alto rendimiento ejerce presión sobre el diseño de algoritmos y la optimización a nivel de sistema. Servir efectivamente a estos modelos ahora requiere una cuidadosa orquestación de la memoria, la comunicación y los recursos de cálculo.
Un desafío crítico en este espacio es cómo la escasez, introducida a través de modelos de mezcla de expertos (MOE), afecta el rendimiento de la inferencia. Estos modelos activan selectivamente un subconjunto de redes de alimentación por entrada, reduciendo la carga computacional. Sin embargo, esta activación selectiva conduce a la subutilización del hardware. Durante la inferencia, los módulos de atención se convierten en cuellos de botella debido al acceso frecuente a la memoria a los cachés de valor clave, mientras que los módulos de FFN se inactivo porque cada uno recibe una pequeña fracción de tokens. Como resultado, la utilización de GPU cae significativamente, especialmente durante la decodificación, creando ineficiencias e inflar los costos operativos.
Mientras que algunos métodos como VLLM y Tensorrt-LLM han intentado abordar la escala de inferencia a través del paralelismo y los núcleos optimizados, estas soluciones permanecen limitadas. Procesan el modelo de manera integral, lo que significa que no pueden ajustar de forma independiente la escala para diferentes componentes. A medida que los modelos MOE crecen en tamaño y dispersión, este enfoque conduce a lotes activos más pequeños por experto, debilitando los beneficios del lote de FFNS. Además, los enfoques de paralelismo tensor y de tubería agregan una sobrecarga de comunicación, especialmente entre los nodos, lo que se convierte en un factor limitante en los entornos de múltiples GPU.
Los investigadores de la Universidad de Bytedance y Pekín han introducido Megascale-Infer, un sistema que repensa la arquitectura de Serving de MOE. En lugar de servir al modelo como un bloque monolítico, los investigadores desagregan la atención y los módulos FFN, desplegándolos en GPU separadas. Esta separación permite estrategias de escala y paralelismo personalizadas adaptadas a las necesidades específicas de cada módulo. Los módulos de atención, que son intensivos en memoria, se replican a las solicitudes agregadas, mientras que los módulos FFN se escalan utilizando el paralelismo experto. El sistema también admite la implementación heterogénea de la GPU, asignando GPU de memoria rentable a las tareas de atención y las GPU optimizadas para las FFN. Esta desagregación mejora drásticamente el uso de recursos y la flexibilidad en la implementación.
Para optimizar aún más el rendimiento, Megascale-Infer emplea una estrategia de paralelismo de tuberías de ping-pong. La idea es descomponer los lotes de las solicitudes en micro-lotes más pequeños que se alternan entre la atención y los módulos FFN, asegurando que ninguno de los componentes quede inactivo. El sistema determina el número óptimo de micro-lotes necesarios para mantener una alta utilización, considerando el tiempo de cálculo, la latencia de comunicación y la configuración de hardware. Por ejemplo, si el tiempo de comunicación es menos de la mitad del tiempo de cómputo, se utilizan al menos tres micro-lotes. Además, el sistema integra una biblioteca de comunicación M2N de alto rendimiento que evita copias innecesarias de datos de GPU a CPU, reduciendo la latencia e inestabilidad. Esta biblioteca reemplaza el enrutamiento tradicional completo con un modelo de recepción de remitente más eficiente diseñado específicamente para el patrón de despacho de tokens de Moe.
Megascale-Infer se probó en múltiples modelos MOE a gran escala, incluidos Mixtral 8 × 22b, DBRX y un modelo personalizado a escala con 317 mil millones de parámetros. En experimentos sobre configuraciones homogéneas que utilizan GPU de amperios NVIDIA, Megascale-Infer mejoró el rendimiento de decodificación por GPU por hasta 2.56 × en comparación con VLLM y 1.28 × sobre TENSORRT-LLM. El modelo escalado logró una ganancia de 7.11 × sobre VLLM y una ganancia de 1.90 × sobre tensorrt-llm. En grupos heterogéneos con GPU H20 para su atención y L40 para FFNS, el sistema logró hasta 3.24 × y 1.86 × mayor rendimiento por dólar que las líneas de base. Su biblioteca de comunicación M2N entregó un rendimiento de hasta 4.2 × mayor y una latencia 68.2% menor que NCCL.
Este artículo presenta un problema claro de GPU subutilizadas durante la inferencia de MOE y ofrece una solución práctica al modularizar la arquitectura. La estrategia de desagregación propuesta, combinada con tuberías de micro-lotes y un protocolo de comunicación personalizado, afecta sustancialmente el servicio de la eficiencia y el costo.
Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.
Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.