Fallos en la matriz de atención

la base para los modelos básicos, que nos permiten tomar modelos previamente entrenados y aplicarlos a una variedad de tareas. Sin embargo, hay un artefacto común en los modelos de transformadores que puede tener impactos perjudiciales en tareas y escenarios específicos. No comprender estas fallas podría hacer que su proyecto tenga un rendimiento sustancialmente inferior o fracase. Por ejemplo, la página GitHub de DINOv2 tiene modelos previamente entrenados con y sin registros. Una tabla con métricas sugiere que los registros, que se introdujeron para corregir este artefacto, no ayudan al modelo de manera significativa. ¿Y por qué añadir complejidad si no hay un aumento en la precisión?

Sin embargo, las métricas que se muestran en la página de DINOv2 son solo para la clasificación de ImageNet, que se sabe que no se ve afectada por estos artefactos. Si utiliza el modelo DINOv2 ViT sin registros para la detección de objetos (como con LOST), su rendimiento probablemente sería sustancialmente peor.

El uso de modelos ViT previamente entrenados sin comprender cuándo los artefactos de alta norma podrían afectar su proyecto podría provocar que su proyecto falle.

Desde que se identificaron estos artefactos, la comunidad de investigación ha desarrollado varios métodos para abordarlos. Las últimas soluciones requieren poco o ningún reentrenamiento e introducen cero latencia adicional en el tiempo de prueba. Estos fenómenos no son exclusivos de los ViT, sino que también ocurren en los LLM. De hecho, uno de los artículos de NeurIPS 2025 analizados aquí propone una solución general a estos artefactos de "sumidero de atención", que modifica la arquitectura del transformador de autoatención. Esta arquitectura modificada ha demostrado ser beneficiosa de muchas maneras y ya se está incorporando al último modelo de Qwen, Qwen3-Next.

Este artículo proporciona una guía completa para:

Registros de transformadores. Los artefactos de alto nivel (o sumideros de atención) a los que se dirigen. Las últimas soluciones basadas en investigaciones para mitigar estos artefactos.

1. Descubrimiento de los artefactos en ViTs con DINOV2

Si bien los ViT han sido fundamentales para marcar el comienzo de la era de los modelos básicos para la visión por computadora, sufren de una anomalía persistente: la aparición de picos de alta norma1. Estos artefactos aparecen en regímenes de entrenamiento tanto supervisados ​​como autosupervisados, siendo el DINO original una excepción notable. En la Figura 1, esto se demuestra en modelos ViT Base entrenados con diferentes algoritmos, que abarcan los autosupervisados ​​(DINO/DINOv2, MAE), los supervisados ​​débilmente (CLIP) y los supervisados ​​(DeiT-III).

Figura 1. Visualización de la última capa de múltiples modelos ViT-B. El DINO original no muestra artefactos; Agregar registros a DINOv2 evita que aparezcan artefactos en los tokens de parche. Figura por autor; Imágenes de entrada generadas a través de NanoBanana.

Estos artefactos exhiben cuatro características clave:

Norma alta: la norma L2 de las fichas de artefactos puede ser de 2 a 10 veces mayor que la norma de fichas promedio, según el método de entrenamiento. Escasez: constituyen una pequeña fracción del total de tokens (aproximadamente 2%) y forman un modo distinto en la distribución (por ejemplo, figuras 3 y 4 en Darcet et al 20241). Localización de parches: aparecen predominantemente en áreas de fondo con poca información o en esquinas de imágenes. Localización de capas: aparecen principalmente en las capas medias y tardías de ViT.

El impacto de los artefactos de alta norma

El impacto en la precisión varía según la tarea. Medimos este impacto observando cuánto mejora el rendimiento después de aplicar las correcciones que se analizan en secciones posteriores. Un resumen de los resultados de Jiang et al. (2025)2 se proporciona a continuación:

ImpactoTareaResultado de mitigación😐Clasificación de ImageNetSin impacto significativo😃Descubrimiento de objetos no supervisados ​​(LOST)Mejora sustancial (20%) en DINOv2 ViT-L/14😊Segmentación de disparo cero+5 mIOU para OpenCLIP ViT-B/14, pero no DINOv2😊Estimación de profundidadMejora marginal con registros de tiempo de prueba (RMSE más bajo)

La causa: dos hipótesis

¿Por qué estos modelos generan artefactos de alta norma? Existen dos hipótesis principales, no contradictorias:

Procesamiento global: los modelos grandes aprenden a identificar tokens redundantes y reutilizarlos como "espacios de almacenamiento" para procesar y recuperar información global. La hipótesis mecanicista: los artefactos son un subproducto de la función Softmax, que obliga a que los pesos de atención sumen 1.

En la atención basada en SoftMax, los pesos de una consulta determinada deben sumar 1:

$$sum_{j} text{Atención}(Q, K_j) = 1$$

Incluso cuando un token de consulta ( i ) no tiene una relación significativa con ningún token clave ( j ), la operación SoftMax lo obliga a distribuir su "masa de atención". Esta masa a menudo se vierte en tokens de fondo específicos con poca información que luego se convierten en sumideros de alta norma.

Se calculan por separado para cada cabeza de atención. Para comprender realmente el problema del sumidero de atención, analizaremos el código de atención. Los diagramas de auto atención también se reproducen en la Figura 2 como referencia.

Figura 2. Actualización de la atención del transformador. El lado izquierdo se acerca a la atención de producto punto escalado (SDPA), mientras que el lado derecho muestra cómo SDPA encaja en la red en una configuración de múltiples cabezales. El cuadro naranja de la izquierda resalta la capa SoftMax, que está normalizada para que la suma a lo largo de la última dimensión sume 1. El cuadro de la derecha ilustra cómo las cabezas permanecen separadas hasta que se aplica la atención. Figura del autor, basada en la Figura 2 de Vaswani et al. (2017)3.

Puede ver un ejemplo del código en DeiT Github Repo de Facebook Research:

class Atención (nn.Module): # … def forward(self, x): # B: tamaño del lote # N: longitud de la secuencia (# tokens) # C: tamaño de incrustación * num_heads B, N, C = x.shape # self.qkv es una capa lineal con sesgo que triplica el tamaño del # tensor – calculando Q=XW_Q, K=XW_K, V=XW_V en una ecuación qkv = self.qkv(x).reshape( B, N, 3, # incluye Q, K y V; esta dimensión se permuta al índice # 0 self.num_heads, C // self.num_heads).permute(2, 0, 3, 1, 4) q, k, v = qkv[0], qkv[1], qkv[2]q = q * self.scale # para estabilidad numérica attn = (q @ k.transpose(-2, -1)) # attn: [B x N x N] attn = attn.softmax(dim=-1) # Creación de artefacto attn = self.attn_drop(attn) # Aumento de entrenamiento de abandono opcional # La siguiente línea multiplica la matriz Y concatena entre cabezas x = (attn @ v).transpose(1, 2).reshape(B, N, C) x = self.proj(x) # otra capa lineal x = self.proj_drop(x) # Retorno de aumento de entrenamiento de abandono opcional x

En los ViT, que carecen de tokens "globales" explícitos (aparte del token [CLS]), el modelo reutiliza los parches de fondo como "sumideros de atención" o "papeleras". Estos tokens agregan información global, su magnitud normal aumenta y su significado semántico local original se pierde.

2. La solución de registro: los transformadores de visión necesitan registros (2024)

Figura 3. Diagrama de ViT con registros. Los tokens de salida de registro no se utilizan para entrenamiento o predicciones, pero proporcionan un espacio dedicado para información global. Figura por autor; Imagen de cachorros creada con NanoBanana.

El equipo detrás de DINOv2 descubrió estos artefactos de alta norma y propuso agregar tokens de "registro" (Darcet et al. 20241). Estos tokens son tokens aprendidos como el token [cls] sin incrustaciones posicionales, pero los tokens de salida correspondientes nunca se utilizan. Eso es todo lo que realmente son, sólo tokens adicionales que no se utilizan directamente para el entrenamiento. Estos tokens de registro se aprenden igual que el token [CLS] y no tienen incrustaciones posicionales. La principal desventaja de este método es que requiere volver a entrenar el modelo. Esta limitación impulsó la búsqueda de soluciones post hoc que pudieran arreglar los modelos existentes.

3. La solución de eliminación de ruido: transformadores de visión con eliminación de ruido (2024)

Yang et al. (2024)4 propusieron transformadores de visión de eliminación de ruido (DVT) para limpiar los tokens de salida post-hoc. Si bien DVT es sinérgico con los registros, introduce un cuello de botella importante, añadiendo aproximadamente 100 segundos de latencia por imagen de 518×518, lo que lo hace poco práctico para aplicaciones en tiempo real.

Contribuciones:

Las TVP mejoran el rendimiento en una variedad de tareas y los autores demostraron que la TVP tenía sinergia con la adición de registros. El artículo amplía nuestra comprensión de que las contribuciones de las incrustaciones posicionales son una causa subyacente de los artefactos de alta norma.

Sin embargo:

Agrega una gran latencia por imagen (alrededor de 100 segundos para imágenes de 518×518)

4. La solución de destilación: registros autodestilados (2025)

El enfoque de Chen et al. 20255 utiliza un paradigma profesor-alumno para entrenar un pequeño subconjunto de pesas y fichas de registro. Los artefactos de alta norma se eliminan de la señal del profesor aplicando un aumento de datos de desplazamientos y volteos aleatorios a las imágenes, lo que permite promediar los artefactos. El modelo docente se mantiene congelado como el ViT original. El modelo de estudiante también se inicializa desde el mismo ViT; sin embargo, se agregan tokens de registro aprendibles adicionales y se ajusta un pequeño subconjunto de pesos.

Contribuciones:

Órdenes de magnitud menos computacionales que el entrenamiento con registros desde cero. Sin latencia adicional en el momento de la prueba.

5. La solución mecanicista: registros de tiempo de prueba (2025)

Jiang et al. (2025)2 introducen un método para realizar una “cirugía” en modelos entrenados para agregar registros sin volver a entrenar. Descubrieron que los artefactos son generados por un conjunto disperso de "neuronas de registro" específicas dentro de las capas de MLP (aproximadamente el 0,02% de todas las neuronas). Al redirigir los valores de estas neuronas MLP internas a nuevos tokens de registro, igualaron el rendimiento de modelos de registro completamente entrenados sin costo de reentrenamiento.

Encuentran las siguientes propiedades de las neuronas que causan artefactos (o "neuronas de registro"):

Escasez: aproximadamente el 0,02% de las neuronas son responsables de la gran mayoría de la energía de los artefactos. Causalidad: la posición de los valores atípicos se puede mover modificando el patrón de activación de las neuronas de registro.

Muestran que estas neuronas de registro agregan información global utilizando sondas lineales: es decir. ven si pueden utilizar las neuronas de registro para la clasificación en ImageNet y CIFAR-10/100. La última salida de los registros se ignora, pero hay tokens de registro dentro de la red donde la red puede usar esa información global. Los autores realizan experimentos para demostrar que establecer las neuronas de registro en cero reduce sustancialmente el rendimiento de las redes del 70,2 % al 55,6 %, lo que sugiere que las redes están utilizando los artefactos para almacenar información y no son solo un artefacto de SoftMax.

Relación entre los artefactos de alta norma de ViT y los sumideros de atención de LLM

Un fenómeno similar a los artefactos de alta norma de ViT (sumideros de atención) se encontró en los LLM en el artículo StreamingLLM (Xiao et al., ICLR 20246). Al ampliar los LLM para su uso en secuencias de transmisión de longitud infinita, notaron que la precisión disminuía significativamente cuando el token inicial ya no encajaba en una ventana deslizante. Descubrieron que estos tokens iniciales tienden a acumular más de la mitad de la puntuación de atención. La caída en la precisión se recuperó si mantenían los valores ( K ) y ( V ) de las 1 a 4 fichas iniciales, mientras deslizaban la ventana sobre las fichas restantes. Proponen que los tokens iniciales se utilicen como receptores de atención debido a la naturaleza secuencial del modelado del lenguaje autorregresivo: son visibles para todos los tokens, mientras que los tokens posteriores solo son visibles para los tokens posteriores. Esto contrasta con los ViT, donde cada token de parche es visible para todos los demás tokens de parche. En los LLM, los sumideros de atención tendían a no verse como un problema, a diferencia de los ViT.

Se pensaba que los sumideros de atención en los LLM servían como anclas sin agregar información global, a diferencia de los ViT; sin embargo, una investigación aún más reciente de Queipo-de-Llano y colegas (Queipo-de-Llano et al 20257), “Attentional Sinks and Compression Valleys”, encuentra que estos sumideros de atención sí contienen información global. Esto sugiere que la solución general que se analiza en la siguiente solución también podría aplicarse a los ViT, aunque no se hayan probado en ellos al momento de escribir este artículo.

7. Eliminación de artefactos con puerta sigmoidal: atención cerrada (2025)

Figura 4. Gu et al.8 demostraron que reemplazar SoftMax con Sigmoid evita la creación de artefactos de alta norma. Esto no implicó ninguna activación fuera del cálculo de la atención.

Una forma de abordar los síntomas de SoftMax podría ser reemplazarlo con un sigmoide. Gu et al. 8 mostró en 2025 que, de hecho, reemplazar SoftMax con sigmoide (no normalizado) puede eliminar el sumidero de atención en el primer token, como se muestra en la Figura 4. Si bien los resultados preliminares muestran alguna mejora potencial en la pérdida de validación, aún no está claro cuáles serán los impactos posteriores que esto tendrá en el rendimiento de LLM y carece de los experimentos sólidos de nuestro próximo artículo.

Figura 5. Qiu et al.9 dejaron intacta la atención de producto puntual escalado (SDPA) y agregaron el sigmoide después de concatenar las cabezas. Esto significa que Softmax probablemente crearía picos de alta norma en el SDPA, pero luego se eliminaría durante el paso de activación.

Qiu et al. hicieron algo diferente en su artículo Gated Attention NeurIPS 20259: dejaron la atención SoftMax intacta, pero luego agregaron la activación después de que se concatenaron los tokens de todas las cabezas, como se muestra en la Figura 5. Descubrieron que agregar la activación elimina los artefactos de alta norma, aunque la atención SoftMax aún crearía tales artefactos antes de la activación dentro de la atención de producto de punto escalado estándar (SDPA). Los beneficios de la Atención Cerrada van más allá de arreglar el artefacto del sumidero de atención, ofreciendo:

Estabilidad de entrenamiento mejorada Eliminación de picos de pérdida de entrenamiento Soporte para mayores tasas de aprendizaje y tamaños de lotes

Usan esta Atención Cerrada en su nuevo modelo Qwen3-Next, aunque también reemplazan parte de la autoatención con DeltaNet Cerrado. Esto podría ser una señal de que nos estamos alejando de soluciones únicas y elegantes, como módulos de autoatención repetidos, y más hacia una colección de trucos o heurísticas que obtienen el mejor rendimiento. En muchos sentidos, esto podría ser similar al cerebro, con su amplia variedad de tipos de neuronas, neurotransmisores y neuroreceptores. Cambios de arquitectura más importantes podrían romper el equilibrio del progreso y requerir gran parte del proceso de ajustar nuevamente la colección de heurísticas.

8. Conclusión

Desde el lejano pasado de 2024, cuando se descubrieron artefactos de alta norma de ViT y sumideros de atención de LLM, la comunidad de investigación ha descubierto muchas soluciones y ha progresado mucho más en la comprensión de estos artefactos. Los artefactos son más similares de lo que se pensaba inicialmente. En ambos casos, SoftMax hace que la atención aumente sustancialmente para algunos tokens, que se utilizan (implícita o explícitamente) como registros que almacenan información global. Eliminar estos registros puede perjudicar el rendimiento una vez aprendidos. Los registros de tiempo de prueba mueven los artefactos de alta norma (o registros implícitos) a registros explícitos, lo que permite que los tokens de parche se limpien de los artefactos. También puede evitar que los registros se formen en primer lugar reemplazando SoftMax con un sigmoide o usando un sigmoide como función de activación después de SoftMax (aunque este último permite artefactos de alta norma dentro del SDPA, pero se eliminan antes de que formen "tokens")

En muchos casos, estos artefactos no causan ningún problema, como ocurre con tareas globales como la clasificación de ViT y la mayoría de las tareas de LLM. Tienen un impacto negativo en las tareas ViT densas, especialmente cuando uno o varios tokens pueden tener un efecto enorme, como la detección de objetos. Las correcciones al menos no empeoran el rendimiento, aunque las correcciones para los LLM, como la atención sigmoidea y la atención cerrada no se han utilizado tan ampliamente y (la atención sigmoidea en particular) podrían ser más difíciles de entrenar. Adoptar el artefacto (copiar los valores KV de los tokens iniciales) parece ser la mejor solución actual para la transmisión de LLM6.

Comparación de estrategias de mitigación

La mejor estrategia de mitigación depende de si ya tiene un modelo entrenado o si planea entrenar desde cero.

MétodoCosto de entrenamientoMecanismoLatenciaAplicado aregistros entrenados1Alto (completo)Agregar tokens aprendidosNingunoViTsDenominación de ruido ViTs4MediaDescomposición de la señalMuy altoViTsAutodestilado5Bajo (ajuste fino)DestilaciónNingunoViTsRegistros de tiempo de prueba2CeroCambio de neuronasNingunoViTsTransmisión LLM6Caché ZeroKV PreservaciónNingunoLLMsSigmoide o Elu+1 Atención8Alto (Completo)Reemplazar SoftMaxNingunoLLMsGated Atención9Alto (Completo)Agregar activación sigmoideMinimalLLMs

Bibliografía

Darcet, T., et al. "Los transformadores de visión necesitan registros". (2024). Jiang, N., et al. "Los transformadores de visión no necesitan registros capacitados". (2025). Vaswani, A., et al. "Atención es todo lo que necesitas". (2017). Yang, et al. "Transformadores de visión eliminadores de ruido". (2024). Chen, Y., et al. "Transformadores de visión con registros autodestilados". NeuroIPS (2025). Xiao, et al. "Modelos de lenguaje de transmisión eficientes con receptores de atención". ICLR (2024). Queipo-de-Llano, et al. “Sumideros atencionales y valles de compresión”. (2025). Gu, et al. "Cuando surge el hundimiento de la atención en los modelos lingüísticos: una visión empírica". ICLR (2025). Qiu, Z., et al. "Atención cerrada para modelos de lenguaje grandes". NeuroIPS (2025).