Juntos, AI Open-Sources OSCAR: un sistema de cuantificación de caché KV de 2 bits consciente de la atención para servicios de LLM de contexto prolongado
La inferencia de contexto largo hace que la caché KV sea uno de los principales costos de prestar servicios a los LLM. Durante la decodificación autorregresiva, la caché crece con…