Precompletar y decodificar desagregados para la inferencia de LLM en SageMaker HyperPod
Cuando el prellenado y la decodificación comparten una GPU, los mensajes largos detiene la generación de tokens para cada solicitud simultánea. El prellenado y decodificación desagregados (DPD) elimina esta interferencia…