La decodificación especulativa de DFlash elabora bloques de tokens completos en paralelo para lograr un rendimiento hasta 15 veces mayor en NVIDIA Blackwell
Los modelos de lenguaje grandes autorregresivos generan texto un token a la vez. Cada token espera al anterior. Este bucle en serie deja a las GPU modernas infrautilizadas y mantiene…