CHUNKKV: Optimización de la compresión de caché de KV para una inferencia eficiente de contexto largo en LLMS
La eficiente inferencia de contexto largo con LLM requiere la gestión de la memoria de GPU sustancial debido a las altas demandas de almacenamiento del almacenamiento en caché del valor…