Caché KV escalonada para grandes LLM en Amazon SageMaker HyperPod con Curvine
La ejecución de inferencia de modelo de lenguaje grande (LLM) a escala generalmente obliga a una compensación de caché KV: o paga por instancias de GPU de gran tamaño para…