La perdurable popularidad de la conferencia más prestigiosa de IA
Según todos los indicios, la NeurIPS de este año, la principal conferencia sobre IA del mundo, fue una de las más grandes y activas de su historia. La conferencia de este año se llevó a cabo en el Centro de Convenciones de San Diego en San Diego, California, desde el domingo 30 de noviembre de 2025 hasta el domingo 7 de diciembre de 2025. Como una idea de la escala, NeurIPS 2025 recibió 21,575 presentaciones de artículos válidos. De 2023 (~12,3 mil) a 2025 (~21,6 mil), esto refleja un salto de ~75% a 80% en dos años, aproximadamente un ~30% en promedio anual. La asistencia en persona ha sido igualmente impresionante, que generalmente ha sido las decenas de miles de personas a menudo limitadas por el tamaño del lugar, con ubicaciones anteriores operando cerca del límite superior de lo que el lugar físico puede soportar. El aprendizaje por refuerzo dominó la conversación este año, y el campo está pasando de modelos de escala a ajustarlos para casos de uso específicos. El impulso de la industria pareció centrarse fuertemente en Google, con Google DeepMind en particular surgiendo e impulsando nuevas y refrescantes direcciones de investigación, por ejemplo, el aprendizaje continuo y el aprendizaje anidado, en lugar de simplemente "LLM más grandes". La escala y la intensidad de la conferencia son un reflejo quizás tanto del ritmo del progreso de la IA como del pico cultural de la fiebre del oro de la IA moderna.
Este año, la sala de expositores estaba repleta, con los principales actores de la industria de la tecnología, las finanzas y la infraestructura de inteligencia artificial, todos colocando sus puestos para demostrar sus últimos avances, resaltar los roles abiertos a los delegados talentosos y repartir el siempre codiciado "alijo" de marca: bolígrafos, camisetas, botellas de agua y más. El asistente a la conferencia especialmente afortunado podría incluso recibir una invitación a las "fiestas posteriores" organizadas por la empresa, que se han convertido en un elemento básico de la experiencia NeurIPS y en una oportunidad ideal para descomprimirse, deshacerse de la sobrecarga de información y establecer contactos, desde el Laude Lounge de Konwinski hasta el crucero Model Ship solo por invitación repleto de investigadores de primer nivel. Los patrocinadores Diamante de este año incluyeron Ant Group, Google, Apple, ByteDance, Tesla y Microsoft. La presencia del lado comprador este año fue particularmente fuerte, con firmas líderes como Citadel, Citadel Securities, Hudson River Trading, Jane Street, Jump Trading y The DE Shaw Group representadas. Por el lado de la infraestructura y las herramientas, Lambda mostró su plataforma GPU en la nube, mientras que empresas como Ollama y Poolside destacaron los avances en los tiempos de ejecución locales de LLM y el desarrollo de modelos de frontera.
La NeurIPS Expo mostró muchas demostraciones de IA aplicada igualmente fascinantes. Los aspectos más destacados incluyeron BeeAI, que demuestra cómo los agentes autónomos pueden comportarse de manera confiable en diferentes backends de LLM; un sistema de búsqueda forense multimodal capaz de escanear grandes corpus de vídeo con IA; una demostración de procesamiento LiDAR acelerado por IA que mostró cómo la computación heterogénea puede acelerar drásticamente la percepción 3D; y flujos de trabajo de ingeniería de datos basados en LLM que automatizan la ingesta, la transformación y los controles de calidad. De la EXPO queda claro que la IA avanza a toda máquina hacia los agentes, la inteligencia multimodal, la percepción acelerada y los sistemas de datos automatizados de un extremo a otro.
Podría decirse que la ceremonia del premio NeurIPS al mejor artículo representa un pináculo de la conferencia y una celebración de su trabajo más impactante. Los premios al mejor artículo se otorgan a investigaciones excepcionalmente innovadoras e impactantes que probablemente tengan un efecto inmediato y duradero en el campo de la IA. No hace falta decir que el premio al mejor artículo es un logro profesional importante en un campo de investigación altamente competitivo y en rápido movimiento. Es aún más impresionante si tenemos en cuenta el enorme volumen de artículos enviados a NeurIPS. Destacar entre esa multitud es excepcionalmente difícil.
La anatomía de un mejor artículo de NeurIPS: exploración de los beneficios de la atención cerrada en LLM
Explicación de la compuerta: cómo una pequeña válvula controla grandes modelos neuronales
En el resto de este artículo, profundizaremos en uno de los mejores artículos de NeurIPS de este año: “Atención cerrada para modelos de lenguaje grandes: no linealidad, escasez y atención sin disipadores” del equipo Qwen. Podría decirse que el denso título de este artículo contiene mucha información en un espacio muy pequeño, por lo que, a continuación, descomprimiré el artículo pieza por pieza con el objetivo de brindarles a los científicos de datos en ejercicio un modelo mental claro de activación de la atención y conclusiones concretas del artículo que pueden aplicar inmediatamente a su propio trabajo.
Primero, comenzamos con una comprensión de la puerta, el módulo central que se estudia en el artículo. ¿Qué es exactamente una puerta en el contexto de las redes neuronales? Una puerta no es más que un mecanismo de modulación de señal, una unidad computacional que toma la salida de una transformación existente en la red y la regula amplificando, atenuando o suprimiendo selectivamente partes de la señal de entrada.
En lugar de permitir que cada activación fluya sin cambios a través de la red, una puerta introduce una vía de control aprendida que determina cuánta información transformada debe pasar.
Desde el punto de vista operativo, una puerta calcula un vector de coeficientes, normalmente utilizando una función sigmoidea, softmax u ocasionalmente una función de aplastamiento basada en ReLU, y estos coeficientes se aplican multiplicativamente a otro vector de activaciones que se originan a partir de un cálculo ascendente. Esto tiene el efecto de regular la cantidad de esa entrada que llega aguas abajo, un poco como girar la manija de un grifo de un lado a otro para regular el volumen de agua que pasa. Eso es todo, ahora comprende el control, qué es y cómo se aplica.
Debido a que los pesos de activación suelen ser parámetros que se pueden aprender, la red puede descubrir durante el entrenamiento cómo modular las señales internas de manera que minimicen la pérdida general de la red. De esta manera, la puerta se convierte en un filtro dinámico, ajustando el flujo de información interna en función del contexto de entrada, los parámetros en continua evolución del modelo y los gradientes recibidos durante la optimización.
Un breve recorrido por el carril de la memoria: la larga historia de las puertas
Vale la pena conocer un poco la historia de Gating antes de pasar a las principales contribuciones del artículo. Gating realmente no es nada nuevo, y el artículo de Qwen no inventó este componente estándar; su contribución se encuentra en otra parte y se tratará en breve. De hecho, la activación de puertas ha sido un mecanismo central en las arquitecturas profundas durante muchas décadas. Por ejemplo, las redes de memoria a largo plazo (LSTM), introducidas en 1997, fueron pioneras en el uso sistemático de puertas multiplicativas (las puertas de entrada, olvido y salida) para regular el flujo de información a través del tiempo. Estas puertas actúan como filtros aprendidos que determinan qué señales deben escribirse en la memoria, cuáles deben retenerse y cuáles deben exponerse a capas posteriores. Al controlar el flujo de información de esta manera detallada, los LSTM mitigaron efectivamente la explosión multiplicativa o la desaparición de gradientes que obstaculizaron las primeras redes recurrentes, permitiendo una asignación de crédito estable a largo plazo durante la retropropagación en el tiempo (BPTT).
Aplicación de gating al bloque de atención de LLM
La contribución del equipo de Qwen se centra en aplicar la activación directamente al mecanismo de atención softmax del transformador, un tipo específico de configuración llamada activación de atención. En este artículo, no dedicaré demasiado tiempo al qué de la atención, ya que existen muchos recursos para aprender sobre ello, incluido este curso reciente del equipo de DeepLearning.ai y este artículo anterior que escribí sobre el tema. En un resumen súper breve, la atención es el mecanismo central en la arquitectura del transformador que permite que cada token de secuencia de entrada recopile información contextual de cualquier otro token en la secuencia, lo que permite que los tokens se "comunican" durante el entrenamiento y la inferencia, compartiendo información independientemente de qué tan separados aparezcan en la entrada. A continuación se muestra el gráfico computacional para la popular atención de producto punto escalado (SDPA):
Aunque la activación de la atención se ha utilizado durante muchos años, el equipo de Qwen destaca una brecha sorprendente en nuestro conjunto de conocimientos: como profesionales de la IA, hemos aplicado ampliamente la activación de la atención sin comprender realmente por qué funciona o cómo da forma a la dinámica del aprendizaje. El trabajo del equipo de Qwen muestra que nos hemos estado beneficiando de este módulo durante mucho tiempo sin una explicación rigurosa y sistemática de su efectividad o de las condiciones bajo las cuales funciona mejor. El artículo de Qwen hace precisamente eso y cierra la brecha, y la cita del comité de selección del mejor artículo de NeurIPS menciona:
"Este artículo representa una cantidad sustancial de trabajo que sólo es posible con acceso a recursos informáticos a escala industrial, y el hecho de que los autores compartan los resultados de su trabajo, que mejorará la comprensión de la atención por parte de la comunidad en modelos de lenguaje grandes, es muy encomiable, especialmente en un entorno donde se ha alejado del intercambio abierto de resultados científicos en torno a los LLM".
NeurIPS 2025, declaración del Comité Selecto.
Dada la gran cantidad de dólares que ingresan y el enorme interés comercial en la IA en estos días, es realmente agradable ver que el equipo de Qwen decidió entregar este rico lote de lecciones aprendidas a la comunidad en general, en lugar de mantener estas pepitas de información a puerta cerrada. Al hacerlo, el equipo de Qwen entregó un hermoso artículo repleto de lecciones prácticas y explicaciones claras del por qué detrás de la activación de la atención, todo resumido de una manera que los científicos de datos puedan tomar y aplicar inmediatamente en modelos del mundo real.
El estudio sistemático del equipo de Qwen hace varias contribuciones concretas al conocimiento que se pueden aplicar fácil e inmediatamente para mejorar muchas arquitecturas LLM estándar:
Posicionamiento de la activación: colocar un módulo de activación justo después del cálculo de la matriz de valores proporciona un rendimiento LLM mejorado, mediante la introducción de una no linealidad y el incentivo de la escasez dependiente de la entrada. También estudian parametrizaciones clave del módulo de activación, como el tipo de función de activación (SiLU o sigmoide) y la función de combinación (multiplicación, suma). Disipador de atención y activaciones masivas: la activación puede reducir radicalmente el poder del fenómeno del disipador de atención, donde la mayor parte, si no toda, de la atención en una capa se concentra en un solo token; cubro este fenómeno en detalle más adelante. Al suprimir estas activaciones extremas, el modelo se vuelve mucho más estable numéricamente durante la optimización, eliminando los picos de pérdida que suelen aparecer en carreras de entrenamiento profundas o largas. Esta mayor estabilidad permite que el modelo tolere tasas de aprendizaje sustancialmente más altas, lo que permite un mejor escalamiento sin la divergencia que se observa en los transformadores no controlados. Extensión de la longitud del contexto: la activación también facilita la extensión de la longitud del contexto sin requerir un reentrenamiento completo del modelo. En la práctica, esto significa que un modelo puede entrenarse con una ventana de contexto relativamente corta y luego escalarse a secuencias mucho más largas ajustando retrospectivamente componentes como la base RoPE. Este ajuste reparametriza efectivamente la geometría de incrustación posicional, permitiendo que el modelo opere en longitudes de contexto extendidas (por ejemplo, hasta 32k tokens) mientras preserva la estabilidad y sin degradar las representaciones aprendidas previamente.
Aprovechar la activación para mejorar el rendimiento, la estabilidad del aprendizaje y la mecánica de atención
El equipo de Qwen centra su investigación en cómo la puerta interactúa con el módulo de atención softmax de LLM, con el objetivo de comprender su influencia en la dinámica de aprendizaje del módulo e identificar la ubicación óptima de la puerta, por ejemplo, después de las proyecciones Q, K o V, después del cálculo de la atención o después de las capas densas. La configuración de este estudio se ilustra en el siguiente diagrama a continuación:
Los autores evalúan modelos de red de retroalimentación (FFN) de combinación de expertos: MoE (15 mil millones, 2,54 mil millones activos) y denso (1,7 mil millones). La variante MoE utiliza 128 expertos, los 8 mejores compuertas softmax y expertos detallados. Los modelos se entrenan en subconjuntos de un corpus de alta calidad de tokens 4T que cubre datos multilingües, matemáticos y de conocimiento general, con una longitud de secuencia de 4096. La capacitación utiliza los valores predeterminados de AdamW, con detalles específicos sobre la tasa de aprendizaje y el tamaño del lote proporcionados por experimento. Encuentran que la activación añade una sobrecarga mínima: <2 % de latencia. La evaluación cubre puntos de referencia estándar de pocas posibilidades: HellaSwag, MMLU, GSM8K, HumanEval, C-Eval y CMMLU, además de pruebas de perplejidad en dominios que incluyen inglés, chino, código, matemáticas, derecho y literatura.
La evaluación experimental está organizada para estudiar las siguientes cuestiones de forma sistemática. También agrego las conclusiones clave debajo de cada pregunta de investigación, que aplican igualmente los modelos MoE y FFN probados por los autores:
P1: ¿Dónde es mejor colocar la puerta en el cabezal de atención? ¿Después de las proyecciones K, Q, V? ¿Después de la atención del producto escalado? ¿Después de la concatenación final de atención de múltiples cabezas?
Los autores encuentran que insertar puertas en la salida del módulo de atención de producto escalado (SDPA) o después del mapa de valores (G2) son las ubicaciones más efectivas. Además, la colocación de la atención en SDPA es más efectiva que en G2. Para explicar esto, los autores demuestran que la colocación de la activación en SDPA induce puntuaciones de activación dispersas muy bajas, lo que se correlaciona con un desempeño superior en la tarea. La selección de valor (G2) produce puntuaciones más altas y menos escasas y funciona peor que la selección de salida SDPA (G1). La escasez es clave para el rendimiento. Esto sugiere que la dispersión es más útil cuando la activación depende de la consulta actual, lo que permite que el modelo filtre contexto irrelevante. La puerta decide qué suprimir o amplificar en función de lo que necesita el token actual.
Sus experimentos con la activación independiente de la entrada confirman esto: ofrece ganancias menores a través de una mayor no linealidad, pero carece de la escasez selectiva que proporciona la activación dependiente de consultas.
Este hallazgo anterior se explica mejor mediante un ejemplo. Aunque los mapas K y V técnicamente dependen de la entrada, no están condicionados al token de consulta actual. Por ejemplo, si la consulta es "París", los tokens de valor podrían ser "Francia", "capital", "clima" o "Torre Eiffel", pero cada token de valor solo conoce su propia representación y no lo que pide París. La puerta G2 basa su decisión en los propios tokens de origen, que pueden ser irrelevantes para las necesidades de la consulta. Por el contrario, la activación G1 se calcula a partir de la representación de la consulta, por lo que puede suprimir o amplificar selectivamente el contexto en función de lo que la consulta realmente intenta recuperar. Esto conduce a una activación más escasa y limpia y a un mejor rendimiento para G1, mientras que el equipo de Qwen descubre que G2 tiende a producir puntuaciones más altas y ruidosas y resultados más débiles.
P2: ¿Regulamos la salida mediante la multiplicación por elementos para un control detallado o simplemente aprendemos un escalar que ajusta de forma aproximada la salida?
Los resultados del artículo muestran que la activación multiplicativa de SDPA es mejor que la aditiva. Cuando utilizamos una función de activación en la atención softmax, es mejor multiplicar su salida en lugar de sumarla.
P3: Como la atención en los LLM suele tener múltiples cabezas, ¿compartimos puertas entre cabezas o aprendemos puertas específicas para cada cabeza?
Los autores son inequívocos en cuanto a que la activación debe aprenderse por cabeza en lugar de compartirse entre cabezas. Encuentran que cuando se comparten las puertas, el modelo tiende a producir valores de puerta más grandes y menos selectivos, lo que diluye la especialización a nivel de cabeza y perjudica el rendimiento. Por el contrario, la activación específica de cada cabezal preserva la función única de cada cabezal y produce consistentemente mejores resultados. Curiosamente, los autores afirman que la activación específica del cabezal es la elección de diseño más crítica y que tiene el mayor efecto en el rendimiento, mientras que la granularidad de la elección de la función de activación y activación tiene un impacto menor.
P4: Podemos modular la salida de forma multiplicativa o aditiva. ¿Qué enfoque funciona mejor?
Los resultados del artículo muestran que la activación multiplicativa de SDPA es mejor que la aditiva. Cuando utilizamos una función de activación en la atención softmax, es mejor multiplicar su salida en lugar de sumarla.
P5: ¿Qué función de activación tiene más sentido en el módulo de activación, un sigmoide o un SiLU?
Sigmoid supera a SiLU cuando se utiliza en la configuración de mejor rendimiento, es decir, la activación por elementos aplicada a la salida SDPA (G1). Reemplazar sigmoide con SiLU en esta configuración conduce constantemente a peores resultados, lo que indica que sigmoide es la activación más efectiva para la activación.
Mitigar el flagelo de los sumideros de atención
Una cuestión clave en los LLM es la disminución de la atención, donde el primer token absorbe la mayor parte del peso de la atención y abruma al resto de la secuencia, lo que lleva a activaciones desproporcionadamente grandes que pueden desestabilizar el entrenamiento y distorsionar las representaciones del modelo. Es importante destacar que el equipo de Qwen muestra que la activación puede mitigar este efecto, ya que la activación de salida SDPA reduce las activaciones masivas y el sumidero de atención.
Ampliación de la longitud del contexto cambiando la base de incrustaciones de posición giratoria (RoPE)
Para construir modelos de contexto largo, el equipo de Qwen sigue una estrategia de capacitación de tres etapas, que se detalla a continuación. Esta estrategia de capacitación brinda una visión más fascinante de cómo los laboratorios fronterizos entrenan modelos a gran escala y qué herramientas consideran efectivas:
Base RoPE en expansión: Primero, expanden la base de incrustaciones de posición giratoria (RoPE) de 10k a 1M, lo que aplana la curva de frecuencia posicional y permite una atención estable en una posición mucho más larga. Entrenamiento medio: el equipo de Qwen luego continúa entrenando el modelo para obtener 80 mil millones de tokens adicionales utilizando secuencias de 32k de longitud. Esta fase de continuación (a veces llamada "entrenamiento intermedio") permite que el modelo se adapte naturalmente a la nueva geometría de RoPE sin tener que volver a aprender todo. Extensión YaRN: luego aplican Yet Another RoPE eNhancement (YaRN) para expandir la longitud del contexto hasta 128k, sin capacitación adicional.
Retrocedamos y aclaremos brevemente qué es RoPE y por qué es importante en los LLM. Sin inyectar información posicional, el mecanismo de atención de un Transformer no tiene idea de dónde aparecen los tokens en una secuencia. Como muchas técnicas en IA, existe una intuición geométrica simple y subyacente sobre cómo funcionan, que hace que todo sea realmente claro. Este es ciertamente el caso de las incrustaciones posicionales y RoPE. En una simple analogía 2D, puedes imaginar incrustaciones de tokens como una nube de puntos dispersos en el espacio, sin indicación de su orden o espaciado relativo en la secuencia original.
RoPE codifica la posición rotando cada segmento 2D de la consulta/incrustación de clave en un ángulo proporcional a la posición del token. La incrustación se divide en muchos subvectores 2D, a cada uno de los cuales se le asigna su propia frecuencia de rotación (θ₁, θ₂,…), por lo que diferentes cortes giran a diferentes velocidades. Los cortes de baja frecuencia giran lentamente y capturan una estructura posicional amplia y de largo alcance, mientras que los cortes de alta frecuencia giran rápidamente y capturan relaciones finas y de corto alcance. En conjunto, estas rotaciones de múltiples escalas permiten que la atención infiera distancias relativas entre tokens en contextos tanto locales como globales. Esta es una idea y una implementación hermosas, y métodos como estos me hacen sentir agradecido de trabajar en el campo de la IA.
La idea clave aquí es que el ángulo relativo entre dos incrustaciones rotadas codifica naturalmente su distancia relativa en la secuencia, lo que permite que el mecanismo de atención infiera el orden y el espaciado solo a través de la geometría. Esto hace que la información posicional sea una propiedad de cómo interactúan las consultas y las claves. Por ejemplo, si los tokens están cerca en la secuencia, sus rotaciones serán similares, lo que equivale a un producto escalar grande, lo que otorga un mayor peso de atención. Por el contrario, cuando los tokens están más separados, sus rotaciones difieren más, por lo que el producto escalar entre sus consultas y claves cambia de manera dependiente de la posición, lo que generalmente reduce la atención a los tokens distantes a menos que el modelo haya aprendido que las interacciones de largo alcance son importantes.
YaRN es una forma moderna y flexible de ampliar la ventana de contexto de un LLM sin volver a capacitarse y sin causar las inestabilidades que se observan en RoPE ingenuamente extrapolado. RoPE comienza a fallar a largas distancias porque sus dimensiones rotacionales de mayor frecuencia se enrollan demasiado rápido. Una vez que las posiciones exceden el horizonte de entrenamiento, esas dimensiones producen fases repetidas, lo que significa que las fichas que están muy separadas pueden parecer engañosamente similares en el espacio posicional. Esta fase de alias (o coincidencia) desestabiliza la atención y puede provocar su colapso. YaRN soluciona este problema estirando suavemente el espectro de frecuencias de RoPE, preservando el comportamiento posicional de corto alcance del modelo mientras interpola gradualmente a frecuencias más bajas para posiciones de largo alcance. El resultado es un esquema de incrustación posicional que se comporta naturalmente hasta 32k, 64k o incluso 128k tokens, con mucha menos distorsión que los antiguos métodos NTK o de escala lineal. Una vez que se descubrió que su modelo era estable en 32k, el equipo de Qwen aplicó YaRN para interpolar aún más las frecuencias de RoPE, ampliando la ventana de contexto efectiva a 128k.
En su evaluación, el equipo de Qwen descubrió que dentro de la ventana entrenada de 32k, los modelos activados por SDPA superan ligeramente a la línea de base, lo que indica que la activación mejora la dinámica de la atención sin dañar la estabilidad del contexto a largo plazo, incluso bajo una escala posicional sustancial.
Además, con la extensión YaRN y en el régimen de contexto grande, encuentran que la red cerrada con salida SDPA supera significativamente la línea base entre longitudes de contexto de 64k-128k. Los autores vinculan este aumento del rendimiento con la mitigación del fenómeno de sumidero de atención, en el que suponen que se basa el modelo de referencia para distribuir las puntuaciones de atención entre los tokens. Plantean la hipótesis de que el modelo cerrado de salida SDPA es mucho menos sensible a los cambios inducidos por RoPE y YaRN en el esquema de codificación de posicionamiento y los ajustes de longitud del contexto. La aplicación de YaRN, que no requiere capacitación adicional, puede alterar estos patrones de sumidero aprendidos, lo que lleva a la degradación observada en el rendimiento del modelo base. El modelo cerrado por SDPA, por el contrario, no depende del sumidero de atención para estabilizar la atención.
Codificando nuestra propia implementación de puertas
Antes de concluir, puede resultar instructivo intentar codificar una implementación de una técnica de IA directamente a partir de un artículo, y es una excelente manera de solidificar los conceptos clave. Con este fin, analizaremos una implementación simple en Python de atención de productos punto escalada con puerta softmax.
Primero definiremos nuestros hiperparámetros clave, como la longitud de la secuencia (seq_len), la dimensión oculta del modelo (d_model), el número de cabezas (n_heads) y la dimensión de la cabeza (head_dim).
importar numpy como np np.random.seed(0) # —- Configuración de juguete —- seq_len = 4 # tokens d_model = 8 # modelo dim n_heads = 2 head_dim = d_model // n_heads
A continuación, definimos algunas incrustaciones de tokens (falsos) (aquí simplemente se generan aleatoriamente), junto con nuestros pesos de proyecto inicializados aleatoriamente (no aprendidos para los propósitos de este ejemplo simple).
# Incrustaciones de tokens falsos x = np.random.randn(seq_len, d_model) # [T, D] # —- Pesos de proyección —- W_q = np.random.randn(d_model, d_model) W_k = np.random.randn(d_model, d_model) W_v = np.random.randn(d_model, d_model) W_o = np.random.randn(d_model, d_model) # proyección de salida
Luego definimos los sospechosos habituales, softmax, sigmoide y también un método para dividir la dimensión D en n_heads:
def softmax(logits, eje=-1): logits = logits – np.max(logits, eje=eje, keepdims=True) exp = np.exp(logits) return exp / np.sum(exp, eje=eje, keepdims=True) def sigmoid(z): retorno 1 / (1 + np.exp(-z)) # —- Ayudante: split/concat cabezas —- def split_heads regresa t.reshape(seq_len, n_heads, head_dim).transpose(1, 0, 2) def concat_heads regresa t.transpose(1, 0, 2).reshape(seq_len, d_model)
Ahora podemos profundizar en la implementación central de la puerta y ver exactamente cómo funciona en la práctica. En todos los ejemplos siguientes, utilizamos tensores aleatorios como sustitutos de los parámetros de puerta aprendidos que un modelo real entrenaría de un extremo a otro.
#========================================================== # Pase hacia adelante # =============================================================== def atención_con_puertas(x): # 1) Proyecciones lineales Q = x @ W_q # [T, D] K = x @ W_k V = x @ W_v # —– G4: puerta en consultas (después de W_q) —– G4 = sigmoide(np.random.randn(*Q.shape)) Q = G4 * Q # —– G3: puerta en claves (después de W_k) —– G3 = sigmoide(np.random.randn(*K.shape)) K = G3 * K # —– G2: puerta en Valores (después de W_v) —– G2 = sigmoide(np.random.randn(*V.shape)) V = G2 * V # 2) Dividir en cabezas Qh = split_heads(Q) # [H, T, Dh] Kh = split_heads(K) Vh = split_heads(V) # 3) Atención del producto punto escalado por cabeza escala = np.sqrt(head_dim) puntuaciones = Qh @ Kh.transpose(0, 2, 1) / escala # [H, T, T] attn = softmax(scores, axis=-1) head_out = attn @ Vh # [H, T, Dh] # 4) Cabezas concat multi_head_out = concat_heads(head_out) # [T, D] # —– G1: puerta en cabezas concatenadas (antes de W_o) —– G1 = sigmoide(np.random.randn(*multi_head_out.shape)) multi_head_out = G1 * multi_head_out # 5) Proyección de salida y = multi_head_out @ W_o # [T, D] # —– G5: puerta en salida densa final —– G5 = sigmoide(np.random.randn(*y.shape)) y = G5 * y return { "Q": Q, "K": K, "V": V, "G2": G2, "G3": G3, "G4": G4, "multi_head_out": multi_head_out, "G1": G1, "final_out": y, "G5": G5, } salida = atención_con_puertas(x) print("Forma de salida final:", salida["salida_final"].forma)
El código anterior inserta módulos de activación en cuatro ubicaciones, replicando el posicionamiento en el documento Qwen: el mapa de consulta (G4), el mapa de claves (G3), el mapa de valores (G2) y la salida del módulo SDPA (G1). Aunque el equipo de Qwen recomienda usar solo la configuración G1 en la práctica (colocar una sola puerta en la salida SDPA), incluimos las cuatro aquí a modo de ilustración. El objetivo es mostrar que la activación es simplemente un mecanismo de modulación ligero aplicado a diferentes vías dentro del bloque de atención. Esperemos que esto haga que el concepto general parezca más concreto e intuitivo.
Conclusiones y reflexiones finales
En este artículo, hicimos un recorrido rápido por el concepto de activación para la atención softmax en LLM y cubrimos las lecciones clave aprendidas del artículo de NeurIPS 2025, "Atención controlada para modelos de lenguaje grandes: no linealidad, dispersión y atención libre".
El artículo de Qwen es una hazaña de la IA y un tesoro de hallazgos prácticos que se pueden aplicar inmediatamente para mejorar la mayoría de las arquitecturas LLM contemporáneas. El equipo de Qwen ha realizado un estudio exhaustivo sobre la configuración de las puertas para la atención LLM softmax, arrojando luz sobre este importante componente. No tengo ninguna duda de que la mayoría, si no todos, los laboratorios de inteligencia artificial de vanguardia lucharán furiosamente para actualizar sus arquitecturas de acuerdo con la guía que surge del artículo de Qwen, uno de los mejores artículos de NeurIPS de este año, un logro muy codiciado en el campo. Mientras hablamos, probablemente haya miles de GPU trabajando en el aprendizaje de LLM con configuraciones de módulos de activación inspiradas en las lecciones claras del artículo de Qwen.
Felicitaciones al equipo de Qwen por hacer público este conocimiento en beneficio de toda la comunidad. El código original se puede encontrar aquí si está interesado en incorporar la implementación del equipo Qwen en sus propios modelos o impulsar su investigación más allá (cada gran contribución de investigación genera más preguntas, ¡hay tortugas hasta el final!) para abordar preguntas sin respuesta, como qué dinámica interna cambia cuando se agrega una puerta y por qué esto conduce a la solidez observada en todos los regímenes posicionales.
Descargo de responsabilidad: Los puntos de vista y opiniones expresados en este artículo son exclusivamente míos y no representan los de mi empleador ni los de ninguna organización afiliada. El contenido se basa en reflexiones personales y pensamientos especulativos sobre el futuro de la ciencia y la tecnología. No debe interpretarse como un consejo profesional, académico o de inversión. Estas perspectivas prospectivas tienen como objetivo suscitar el debate y la imaginación, no hacer predicciones con certeza.
📚 Aprendizaje adicional
Alex Heath (2025) – Google's Rise, RL Mania y a Party Boat – Un resumen de primera mano de las conclusiones de NeurIPS 2025, que destaca el aumento del aprendizaje por refuerzo, el impulso de Google/DeepMind y la cultura de las fiestas de conferencias cada vez más extravagante. Publicado en Sources, un boletín que analiza las tendencias de la industria de la IA. Jianlin Su et al. (2024) – RoFormer: Transformador mejorado con incrustación de posición rotativa: el documento RoPE original que introdujo incrustaciones de posición rotativa, ahora utilizado universalmente en LLM. Explica cómo la codificación rotacional preserva la información de posición relativa y aclara por qué cambiar la base de RoPE afecta el comportamiento de atención de largo alcance. Bowen Peng et al. (2023) – YaRN: Extensión de ventana de contexto eficiente de modelos de lenguaje grandes: la referencia principal detrás de la interpolación de YaRN. Este trabajo muestra cómo el ajuste de las frecuencias de RoPE mediante una extrapolación suave puede extender los modelos a más de 128.000 contextos sin necesidad de volver a entrenar. Zihan Qiu et al. (2025) – Atención cerrada para modelos de lenguaje grandes: no linealidad, escasez y atención sin sumidero – El estudio definitivo sobre la activación de la atención softmax, revisado en este artículo. Introduce la activación de salida SDPA (G1), explica por qué la activación sigmoidea introduce no linealidad y escasez, muestra cómo la activación elimina los sumideros de atención y demuestra una generalización superior de la longitud del contexto bajo modificaciones de RoPE/YaRN. Guangxuan Xiao et al. (2023) – StreamingLLM: LM de transmisión eficiente con receptores de atención: el artículo que identifica formalmente el fenómeno del "sumidero de atención": tokens tempranos que atraen una atención desproporcionadamente grande. Explica por qué los transformadores de referencia a menudo centran la atención en el primer token. Mingjie Sun et al. (2024) – Activaciones masivas en modelos de lenguaje grandes: muestra que activaciones ocultas extremadamente grandes en capas específicas se propagan a través del flujo residual y causan distribuciones de atención patológicas. El artículo de Qwen valida empíricamente este vínculo y demuestra cómo la activación suprime las activaciones masivas. Noam Shazeer (2020) – Las variantes de GLU mejoran el transformador: la referencia fundamental para la activación dentro de bloques de alimentación directa (SwiGLU, GEGLU). Los LLM modernos dependen en gran medida de esta familia de activaciones FFN cerradas; el artículo de Qwen conecta este linaje con la entrada en el interior de la atención misma. Hochreiter y Schmidhuber (1997) – LSTM: Memoria a largo plazo: la arquitectura de puertas más antigua e influyente. Los LSTM introducen puertas de entrada, salida y olvido para el paso selectivo de información: el precursor conceptual de todas las estrategias de activación modernas, incluida la activación de salida SDPA en transformadores. Xiangming Gu et al. (2024) – Cuando la atención se hunde en los modelos lingüísticos: proporciona un tratamiento empírico moderno de los sumideros de atención, los sesgos clave y el dominio de tokens tempranos no informativos. Dong et al. (2025) – LongRed: Mitigación de la degradación del texto corto de los LLM de contexto largo: ofrece una derivación matemática (a la que se hace referencia en Qwen) que muestra cómo la modificación de RoPE cambia las distribuciones de atención y la geometría del estado oculto.