Nous Research propone Lighthouse Attention: una atención jerárquica basada en selección solo de entrenamiento que ofrece una aceleración de preentrenamiento de 1,4 a 1,7 veces en un contexto prolongado
Entrenar modelos de lenguaje grandes en secuencias largas tiene un problema bien conocido: la atención es costosa. La atención de producto escalado (SDPA) en el núcleo de cada transformador escala…