A medida que los modelos de lenguaje grandes escalan a ventanas de contexto más largas y atienden a más usuarios simultáneos, la caché de valores clave (KV) se ha convertido en el principal cuello de botella de la memoria en los sistemas de inferencia de producción. Para un modelo de 30 mil millones de parámetros con un tamaño de lote de 128 y una longitud de entrada de 1024 tokens, la caché KV resultante puede ocupar hasta 180 GB de memoria. Como referencia, los parámetros de un modelo de 7 mil millones de parámetros consumen 14 GB de memoria GPU, mientras que la caché KV para el mismo modelo puede requerir alrededor de 72 GB.
La compresión de la caché KV reduce la presión de la memoria, aumenta el tamaño de los lotes y mejora directamente el rendimiento sin volver a entrenar el modelo base. En los últimos dos años, de la investigación han surgido varias estrategias de compresión distintas. Este artículo desglosa los diez más importantes con énfasis en cómo funciona cada uno y dónde encaja en un proceso de inferencia práctica.
Desalojo de tokens con H2O (Heavy Hitter Oracle)
H2O, publicado en NeurIPS 2023, es uno de los métodos fundamentales de desalojo de tokens. Su observación principal es que una pequeña porción de tokens aporta la mayor parte de la masa de puntuación de atención durante la generación y se denominan Heavy Hitters (H2). H2O retiene dinámicamente un equilibrio de tokens recientes y tokens H2, manteniendo un tamaño de caché KV fijo en todas las capas de Transformer. El proceso de selección está impulsado por puntuaciones de atención acumuladas promediadas en todas las consultas y tokens.
La distribución del peso de la atención sigue una ley de potencia, lo que significa que, en la práctica, desalojar tokens con puntuación baja conlleva una pérdida mínima de precisión. H2O es un método de fase de decodificación y no reduce el cálculo previo al llenado, lo que sigue siendo una limitación para las indicaciones de contexto largo. Con un 20% de pesos pesados, H2O mejora el rendimiento con respecto a Hugging Face Accelerate hasta 29 veces en OPT-6.7B y OPT-30B.
StreamingLLM (Retención del receptor de atención)
StreamingLLM está diseñado para escenarios donde los LLM deben manejar flujos de entrada muy largos o infinitos. Su estrategia es mantener siempre los estados KV de los primeros tokens que sirven como receptores de atención y combinarlos con una ventana deslizante de los tokens más recientes hasta el presupuesto de memoria disponible.
La idea es que los tokens iniciales, independientemente de su contenido semántico, funcionan como anclas estructurales que reciben una atención desproporcionadamente alta a lo largo de la generación. Eliminarlos provoca una degradación significativa de la precisión, mientras que conservarlos junto con una ventana reciente estabiliza las salidas. StreamingLLM es rápido y compatible con el hardware, pero no utiliza puntuación de importancia, lo que significa que puede descartar tokens de contexto medio semánticamente críticos. Es más adecuado para aplicaciones de diálogo en streaming donde domina el contexto reciente.
SnapKV (compresión de ventana de observación)
SnapKV aborda específicamente la etapa de precarga, apuntando a escenarios de larga duración. Utiliza una pequeña ventana de observación al final del mensaje para predecir la importancia del token. Los puntajes de atención de las consultas en esta ventana de observación se agregan para votar por posiciones importantes (los pesos pesados) en el prefijo.
A diferencia de H2O, SnapKV emplea una capa de agrupación sobre las puntuaciones de atención de la ventana de observación para seleccionar posiciones KV importantes agrupadas por cabeza de atención, en lugar de utilizar una puntuación de importancia acumulativa plana en toda la secuencia. Esta selección específica del cabezal hace que SnapKV sea más preciso que H2O con el mismo presupuesto de caché. SnapKV se ha convertido en una base ampliamente utilizada para la compresión de la fase previa al llenado y es directamente comparable con H2O en puntos de referencia como LongBench.
PyramidKV / PyramidInfer (asignación piramidal por capas)
Una limitación clave de H2O y SnapKV es que aplican un presupuesto de compresión uniforme en todas las capas de Transformer. PyramidKV aborda esto asignando diferentes tamaños de caché por capa según la estructura del patrón de atención. El sistema complementario, PyramidInfer, lo extiende a la propia fase de precarga.
PyramidInfer descubre que la cantidad de claves y valores cruciales que influyen en la generación futura disminuye capa por capa y los extrae midiendo la coherencia en los pesos de atención entre los tokens recientes. Al calcular menos claves y valores en capas más profundas durante el llenado previo en lugar de podar un caché precalculado, PyramidInfer reduce la memoria en una etapa más temprana del proceso. Los resultados experimentales muestran que PyramidInfer mejora el rendimiento 2,2 veces en comparación con Hugging Face Accelerate, con una reducción de más del 54 % de la memoria de la GPU en la caché KV.
La intuición se alinea con la forma en que la información se canaliza a través de la profundidad de Transformer: las primeras capas necesitan un contexto más rico, mientras que las capas más profundas convergen en un conjunto más pequeño de tokens destacados. Asignar presupuestos de compresión proporcionalmente a la densidad de información real de cada capa es más eficiente que aplicar un presupuesto fijo de manera uniforme.
Cuantización de caché KV — KIVI
KIVI, publicado en ICML 2024, es un algoritmo de cuantificación de caché KV de 2 bits plug-and-play que no requiere ajustes. Cuantiza el caché de claves por canal y el caché de valores por token.
El esquema asimétrico está motivado por las diferencias distributivas observadas: las claves exhiben valores atípicos de canal más grandes, mientras que los valores están mejor representados por token. Con este diseño compatible con el hardware, KIVI permite que modelos como Llama-2, Falcon y Mistral mantengan una calidad de generación comparable al tiempo que reducen la memoria máxima combinada, los pesos de los modelos y la caché KV en 2,6 veces. Esto permite tamaños de lote hasta 4 veces más grandes y aumenta el rendimiento entre 2,35 y 3,47 veces en cargas de trabajo de inferencia reales. La cifra de 2,6× cubre tanto los pesos del modelo como la caché KV juntos: con una precisión de 2 bits, la reducción de la caché KV es más agresiva y es esta reducción la que impulsa el escalado del tamaño del lote.
KVQuant (cuantización calibrada de precisión mixta)
Mientras que KIVI aplica un esquema asimétrico fijo, KVQuant adopta un enfoque calibrado de múltiples componentes para la cuantificación de caché KV de bits bajos. Combina cuantificación de claves por canal, cuantificación de claves previa a RoPE (que evita la cuantificación de claves después de que las incrustaciones posicionales hayan distorsionado la distribución), cuantificación no uniforme ponderada por sensibilidad que define niveles de cuantificación a partir de datos de calibración en lugar de cuadrículas fijas, y una descomposición densa y dispersa que maneja valores atípicos extremos por separado de la distribución masiva.
Esta combinación permite a KVQuant impulsar la cuantificación a anchos de bits muy bajos, incluidos sub-4 bits, con mayor precisión que los esquemas de precisión fija, apuntando a implementaciones que necesitan soportar contextos extremadamente largos (el documento evalúa hasta 10 millones de longitudes de contexto). Para sistemas de producción con cargas de trabajo estables, el costo de calibración se amortiza entre ejecuciones de inferencia.
TurboQuant (cuantización de caché KV en línea casi óptima)
TurboQuant es la última contribución de Google Research a este espacio, aceptada en ICLR 2026. Se enfoca en una debilidad conocida en todos los métodos de cuantificación anteriores: los cuantificadores escalares óptimos de MSE introducen un sesgo sistemático en la estimación interna del producto, que se agrava en los cálculos de atención. TurboQuant aborda esto a través de un proceso de dos etapas.
La primera etapa, PolarQuant (AISTATS 2026), aplica una rotación ortogonal aleatoria a cada clave y vector de valor antes de la cuantificación. Esta rotación redistribuye la varianza de manera uniforme entre todas las coordenadas sin cambiar el contenido matemático, de modo que cada coordenada pueda cuantificarse con precisión con un cuantificador escalar simple calculado analíticamente. No se necesita capacitación ni calibración. La segunda etapa aplica una corrección cuantificada de Johnson-Lindenstrauss (QJL) de 1 bit al residuo de cuantificación, lo que produce un estimador de producto interno imparcial. Juntas, las dos etapas logran una reducción de memoria de al menos 6 veces y un cálculo de atención hasta 8 veces más rápido en las GPU NVIDIA H100 con una precisión de 3 bits, operando dentro de un factor de aproximadamente 2,7 del límite teórico de la información. Debido a que TurboQuant utiliza matrices aleatorias en lugar de aprendidas, se aplica a cualquier modelo en el momento de la inferencia sin preparación fuera de línea.
Atención de consultas múltiples (MQA) y atención de consultas agrupadas (GQA)
MQA y GQA son modificaciones arquitectónicas que reducen la caché KV por diseño en lugar de comprimir una existente. En MQA, todos los encabezados de consulta comparten una única clave y valor, lo que reduce drásticamente el tamaño de la caché. GQA agrupa varios cabezales de consulta para compartir un conjunto más pequeño de cabezales de valores clave, lo que ofrece un punto medio entre la atención total de múltiples cabezales y MQA. Ambos requieren capacitación desde cero o ajustes; sin la capacitación adecuada, su aplicación a modelos previamente entrenados generalmente resulta en un rendimiento degradado.
Desde entonces, GQA se ha convertido en el estándar de facto en los LLM modernos de peso abierto. En Llama 2, solo el modelo 70B usaba GQA; las variantes 7B y 13B usaban atención estándar de múltiples cabezales. Llama 3 amplió el GQA en los tamaños 8B y 70B. Mistral aplicó GQA desde su lanzamiento inicial 7B en septiembre de 2023. Para los profesionales que seleccionan o implementan nuevas familias de modelos, GQA es ahora una expectativa básica en lugar de una optimización opcional.
Atención latente de múltiples cabezas (MLA) – DeepSeek
MLA es la solución arquitectónica de DeepSeek para la memoria caché KV, introducida por primera vez en DeepSeek-V2 (mayo de 2024) y trasladada a DeepSeek-V3 y DeepSeek-R1. Es un mecanismo de atención equipado con compresión de articulaciones de valor clave de bajo rango. En lugar de almacenar tensores de clave y valor de dimensión completa por token, MLA los proyecta en un vector latente comprimido durante la inferencia, almacenando en su lugar la representación latente.
Los resultados son los más espectaculares de cualquier técnica de esta lista. En comparación con el modelo denso de 67 B anterior de DeepSeek, DeepSeek-V2 con MLA reduce la caché KV en un 93,3 % y logra un rendimiento superior en comparación con la atención estándar de múltiples cabezales. Esta no es una mejora marginal: cambia fundamentalmente la economía de la memoria al servir modelos grandes, permitiendo ventanas de contexto significativamente más largas y tamaños de lotes más grandes en el mismo hardware. La investigación también ha demostrado que MLA ofrece constantemente un mayor poder expresivo que GQA con el mismo presupuesto de caché KV, lo que proporciona una base teórica para las ganancias empíricas. Entre los enfoques arquitectónicos, MLA es actualmente el más validado a escala en modelos de peso abierto.
Compresión de caché KV de bajo rango (Palu/LoRC)
La compresión de rango bajo apunta a la dimensión oculta de los tensores KV en lugar de a la longitud de la secuencia o el ancho de bits. Palu es un marco de compresión de caché KV posterior al entrenamiento que reduce el tamaño de la caché mediante una proyección de bajo rango de matrices de peso de clave y valor. Propone una descomposición de rango bajo de cabeza de grupo de grano medio que equilibra la precisión y la sobrecarga de reconstrucción, y utiliza un algoritmo de búsqueda de rango eficiente basado en información de Fisher para asignar automáticamente rangos más grandes a matrices de peso más sensibles y rangos más pequeños a las menos críticas.
Los métodos relacionados en esta familia incluyen LoRC, SVDq, CSKV y ReCalKV, todos los cuales explotan la observación de que las matrices de claves y valores en las cabezas de atención exhiben una estructura significativa de bajo rango, particularmente para contextos más largos. Los métodos de rango bajo son ortogonales tanto a la cuantificación como a la expulsión de tokens y se pueden combinar con cualquiera de ellos para una compresión compuesta. Esta familia sigue estando relativamente poco explorada en comparación con los métodos basados en el desalojo, lo que la convierte en un área activa de investigación.
Conclusiones clave:
El crecimiento de la caché KV es proporcional tanto a la longitud de la secuencia como al tamaño del lote, lo que hace que la compresión sea esencial para un servicio de alto rendimiento. El desalojo de tokens (H2O, StreamingLLM, SnapKV) no requiere capacitación y es compatible con el hardware, pero descarta los tokens de forma permanente; SnapKV selecciona posiciones KV importantes agrupadas por cabeza a través de puntuaciones de atención agrupadas, no puntuaciones acumulativas planas. La cuantificación (KIVI, KVQuant, TurboQuant) reduce la memoria sin eliminar tokens. KIVI logra una reducción máxima de memoria combinada de 2,6 veces (pesos de modelo + caché KV) con una precisión de 2 bits; TurboQuant logra una reducción de memoria 6 veces con una precisión de 3 bits sin calibración, operando cerca del límite teórico de la información. Los métodos de bajo rango (Palu, LoRC, MLA) apuntan a la redundancia de dimensiones ocultas y permanecen poco explorados en relación con el desalojo de tokens. Se deben incorporar soluciones arquitectónicas (GQA, MLA) en el momento de la formación. En Llama 2, sólo el modelo 70B usaba GQA; Llama 3 lo extendió a todos los tamaños. MLA logra una reducción de caché de KV del 93,3 % en DeepSeek-V2. La frontera de la investigación de 2026 se está moviendo hacia la compactación del espacio latente (Attention Matching, 50× compactación) y la compresión basada en el razonamiento (TriAttention, 10,7× reducción de memoria en AIME25 con precisión equivalente).
Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencia de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.