Decodificación especulativa en CPU: generación de tokens casi 4 veces más rápida con DFlash
aborda el desafío fundamental de la generación lenta y secuencial de tokens en la inferencia de modelos de lenguaje. El soporte de decodificación especulativa de DFlash para CPU se habilitó…