Baidu lanza OCR ilimitado, un modelo 3B que mantiene plana la caché KV para el análisis de documentos largos
La mayoría de los modelos OCR de un extremo a otro se ralentizan a medida que aumenta la producción. Cada token generado se suma a…
La carrera de compresión de caché KV: TurboQuant vs OSCAR vs EpiCache
Los modelos de lenguaje grande (LLM) de contexto largo se enfrentan a un cuello de botella en la memoria que no tiene nada que ver con los pesos del modelo.…
Presentación del almacenamiento en caché de contenedores en Amazon SageMaker AI para un escalado de modelos más rápido
Hoy, nos complace anunciar el almacenamiento en caché de imágenes de contenedores para la inferencia de IA de Amazon SageMaker, el próximo gran avance en nuestro proceso de optimización de…
NVIDIA lanza Nemotron 3.5 ASR: un modelo de transmisión con reconocimiento de caché de 600 M de parámetros que transcribe 40 idiomas locales en tiempo real
El equipo Nemotron Speech de NVIDIA ha lanzado Nemotron 3.5 ASR. Es un modelo de reconocimiento automático de voz (ASR) de transmisión de parámetros de 600M. Un único punto de…
Una implementación de codificación en kvcached para memoria caché Elastic KV, servicio Bursty LLM y uso compartido de GPU multimodelo
importar numpy como np importar matplotlib.pyplot como plt fig, axes = plt.subplots(1, 2, figsize=(14, 4.5)) tk, mk = zip(*mem_kvc); tb, mb = zip(*mem_base) ejes.plot(tk, mk, label=”con kvcached”, linewidth=2, color=”#1f77b4″) ejes.plot(tb,…
Investigadores del MIT, NVIDIA y la Universidad de Zhejiang proponen TriAttention: un método de compresión de caché KV que iguala la atención total con un rendimiento 2,5 veces mayor
El razonamiento de cadena larga es una de las tareas con mayor uso intensivo de cómputo en los modelos de lenguajes grandes modernos. Cuando un modelo como DeepSeek-R1 o Qwen3…
Una guía de codificación de extremo a extremo para NVIDIA KVPress para inferencia LLM de contexto largo, compresión de caché KV y generación de memoria eficiente
En este tutorial, adoptamos un enfoque práctico y detallado para explorar KVPress de NVIDIA y comprender cómo puede hacer que la inferencia de modelos de lenguaje de contexto largo sea…
Google presenta TurboQuant: un nuevo algoritmo de compresión que reduce 6 veces la memoria caché de valores-clave LLM y ofrece una aceleración de hasta 8 veces, todo sin pérdida de precisión
La ampliación de los modelos de lenguaje grande (LLM) está cada vez más limitada por la sobrecarga de comunicación de la memoria entre la memoria de alto ancho de banda…