¿Por qué difusión de texto?
Si bien la comunidad de investigación de IA ha explorado la generación de texto basada en difusión durante años, aplicarla a modelos grandes sigue siendo un desafío. DiffusionGemma cambia esto al cambiar la forma en que los modelos usan el hardware.
La compensación con los modelos tradicionales
La mayoría de los modelos de lenguaje actúan como una máquina de escribir, generando un token a la vez de izquierda a derecha. En la nube, esto es eficiente porque los servidores pueden agrupar miles de solicitudes de usuarios para compartir la carga de hardware. Pero cuando se ejecuta localmente para un solo usuario, este proceso palabra por palabra deja su GPU o TPU dedicada infrautilizada: pasa la mayor parte del tiempo simplemente esperando la siguiente “pulsación de tecla”.
DiffusionGemma revierte esta ineficiencia. En lugar de predecir palabras secuencialmente, redacta simultáneamente un párrafo completo de 256 tokens. Al darle al procesador de la computadora una mayor cantidad de trabajo a la vez, DiffusionGemma utiliza su hardware en todo su potencial. Actualiza la inferencia de su modelo de una única máquina de escribir secuencial a una imprenta masiva que estampa todo el bloque de texto simultáneamente.