Por qué las conexiones residuales de hace una década todavía impulsan toda la IA (y por qué eso es un problema)

1.

Durante la última década, el aprendizaje profundo como campo ha crecido de manera bastante significativa, ya sea la capacidad informática del hardware o el ingenio detrás de las arquitecturas que utilizan ese hardware. Pero si lo piensas por más de un segundo, la arquitectura subyacente se ha mantenido consistente en algunas áreas clave. Hemos visto un cambio masivo de las redes convolucionales a las nuevas arquitecturas Transformer que impulsan los grandes modelos de lenguaje actuales, pero la forma en que estas redes enrutan la información de una capa a otra no ha cambiado mucho.

Recientemente, investigadores de DeepSeek-AI publicaron un artículo titulado “mHC: Hyper-Connections con restricciones múltiples” (Xie et al., 2025b)1 que propone un rediseño completamente nuevo de este sistema de enrutamiento. Para apreciar realmente la solución que se les ocurrió, veamos cómo ha evolucionado la propagación de señales en las últimas generaciones de modelos y por qué los métodos actuales están chocando contra un muro.

2. La columna vertebral: conexiones residuales estándar

En primer lugar, para comprender el problema específico que los autores intentan resolver, debemos hablar de dónde empezó todo: la conexión residual estándar (He et al., 2015)2. Introducida en 2015 con ResNets, la conexión residual es posiblemente una de las opciones de diseño arquitectónico más importantes utilizadas en todos los modelos de IA que existen.

(Fuente: Autor)
Representación visual de la conexión residual.

Matemáticamente, se ve así:

(Fuente: Autor)
xl+1: Activación de salida final de la capa
xl: Activaciones de entrada a la capa.
F(.): Transformaciones aplicadas por la capa

Simplemente significa que la salida final de una capa es la suma de su salida y la entrada que obtuvo originalmente. El componente clave aquí es ese término xl desnudo en el flujo residual, al que llamamos mapeo de identidad. Es importante porque actúa como una vía ininterrumpida para que la señal de gradiente fluya a través de toda la red de principio a fin. Esta propiedad es exactamente lo que evita que los gradientes desaparezcan o exploten durante el entrenamiento y nos permite entrenar exitosamente modelos con cientos de capas y al mismo tiempo garantizar que cada capa aprenda y se actualice de manera efectiva.

2.1 El problema de las conexiones residuales estándar

Pero a medida que los modelos se han vuelto cada vez más masivos, hemos comenzado a alcanzar los límites de este enfoque sencillo.

En un modelo de transformador estándar, podemos imaginar que el flujo residual tiene un ancho fijo, al que podemos referirnos como dimensión C. Cada pieza de contexto, memoria y representación de características debe agruparse en este único vector de dimensión C a medida que avanza por la red. Con el tiempo, a medida que las capas del modelo hacen que la información sea más abstracta y expresiva, el término xl del flujo residual se convierte en el cuello de botella de la información.

Normalmente, si desea aumentar la capacidad de representación del modelo, debe aumentar el tamaño de las capas computacionales o agregar más capas. Pero al hacer eso, también aumenta enormemente los requisitos informáticos para ejecutar el modelo.

2.2 La mejora: hiperconexiones (HC)

Debido a la limitación mencionada anteriormente, los investigadores de ByteDance introdujeron una alternativa al flujo residual vainilla, conocida como Hyper-Connections (Zhu et al., 2024)3.

(Fuente: Autor)
Un diagrama visual del flujo de información en hiperconexiones sin restricciones.

Si los flujos residuales normales son demasiado “delgados”, HC los amplía. En lugar de depender de una única corriente de ancho C, la idea es expandir el ancho de la corriente residual en un factor específico, digamos n. Entonces, lo que tenemos ahora es un vector más amplio compuesto de n corrientes paralelas, lo que da como resultado un ancho total de n×C.

Pero dado que las capas computacionales reales del modelo, como los bloques Atención y MLP, todavía esperan una entrada estándar con dimensiones C únicamente, HC introduce un conjunto de pesos que se pueden aprender para convertir el vector entre el flujo ancho y el estrecho:

Una matriz de mapeo previo: lee del flujo ancho y la condensa al tamaño C. Una matriz de mapeo posterior: toma la salida estrecha de la capa y la expande nuevamente al flujo ancho. Una matriz de mapeo residual: se encuentra directamente en la ruta residual y su propósito es mezclar la información a través de los n flujos paralelos a medida que la señal avanza.

Básicamente, al hacer esto, HC aumenta con éxito la capacidad de la red y hace que el flujo residual sea más expresivo. La matriz de mapeo residual ahora permite que la corriente residual no solo permita que fluya la señal sin perturbaciones, sino también las interacciones entre las dimensiones del canal. Permite que el modelo mantenga una representación interna mucho más rica en múltiples flujos, sin aumentar el costo de cómputo de las capas principales.

2.3 Los defectos de las hiperconexiones

La realidad de la situación, sin embargo, es que si bien HC se ve muy bien en el papel, introduce un par de fallas fatales cuando se intenta ampliarlo al tamaño de nuestros LLM actuales:

Inestabilidad matemática: esa matriz de mapeo residual, aunque expresiva, destruye la propiedad crucial del mapeo de identidad. Como puede aprender cualquier valor, ya no conserva perfectamente la señal original. Una pequeña característica ampliada en una capa se agrava exponencialmente cuando se multiplica en cincuenta capas. De hecho, DeepSeek descubrió que la señal podía amplificarse en un factor asombroso de 3000, provocando gradientes tremendamente erráticos y picos masivos en la pérdida de entrenamiento. El cuello de botella del hardware: ampliar el flujo en un factor de n obliga al hardware de memoria a leer y escribir muchos más datos en cada paso. Dado que el acceso a la memoria, no el cálculo real, es a menudo el mayor cuello de botella en el entrenamiento moderno de IA, esta sobrecarga adicional reduce el rendimiento del entrenamiento y aumenta la huella de memoria de la GPU en un margen sustancial.

Entonces, los investigadores de DeepSeek se quedaron con un problema muy específico: ¿cómo mantener los flujos amplios y expresivos del paradigma HC, sin destruir la estabilidad matemática de la red y sin saturar la memoria de la GPU y las operaciones de E/S?

Echemos un vistazo a cómo resolvieron esto.

3. La solución: hiperconexiones restringidas por múltiples (mHC)

Para resolver estos dos grandes problemas que prevalecen en HC, el equipo de DeepSeek propuso un marco modificado al que denominan hiperconexiones restringidas por colector, o mHC.

La solución se divide en dos partes distintas. Primero, tuvieron que arreglar las matemáticas subyacentes para evitar que la señal explotara o desapareciera. En segundo lugar, tuvieron que realizar una ingeniería de sistemas exhaustiva para asegurarse de que la solución pudiera ejecutarse de manera eficiente en las GPU modernas. Analicemos exactamente cómo hicieron ambos.

3.1 Arreglando las matemáticas: el politopo de Birkhoff

La brillante idea matemática aquí fue tomar esa problemática matriz de mapeo residual sin restricciones y forzarla matemáticamente a comportarse de una manera restringida. Para ello, proyectaron la matriz en un espacio matemático específico conocido como politopo de Birkhoff.

En términos más simples, restringieron la matriz para que se convirtiera en una matriz doblemente estocástica.

Si no está familiarizado con el término, una matriz doblemente estocástica es una matriz donde todos los números no son negativos, y cada fila suma exactamente 1, y cada columna también suma exactamente 1.

(Fuente: Autor)
Ilustración de una matriz doblemente estocástica

Al forzar la matriz residual a este formato específico, los autores se aseguraron de algunas propiedades matemáticas muy beneficiosas:

Preservación de la norma (no más explosiones): Matemáticamente, la norma espectral de una matriz doblemente estocástica tiene un límite de 1, ni más ni menos. Esto significa que no importa lo que aprenda la matriz, físicamente no puede expandir ni disminuir el gradiente. Esto neutraliza el problema de la señal de explosión/desaparición. Cierre composicional (estabilidad profunda): si multiplica una matriz doblemente estocástica por otra matriz doblemente estocástica, el resultado sigue siendo una matriz doblemente estocástica. Esto garantiza que la señal permanezca perfectamente estable incluso cuando se combinan estas matrices en cincuenta o cien capas. Mezcla perfecta: geométricamente, este tipo de matriz actúa como una combinación de múltiples formas diferentes en que se puede mezclar la información. Esto significa que puede mezclar la información a través de esos n flujos paralelos sin amplificar artificialmente la "energía" general de la señal.

Para convertir una matriz regular en una doblemente estocástica durante el entrenamiento, los investigadores utilizaron algo llamado algoritmo Sinkhorn-Knopp (Sinkhorn & Knopp, 1967)5. Durante el paso hacia adelante, el algoritmo primero hace que todos los números de la matriz sean positivos y luego reescala iterativamente las filas y columnas hasta que todos suman 1.

3.2 Reparación del hardware: ingeniería de sistemas incondicional

Resolver las matemáticas en papel es fantástico, pero ejecutar todos estos flujos amplios y cálculos iterativos de Sinkhorn-Knopp suena como una pesadilla para la memoria de la GPU. Para solucionar esto, el equipo de DeepSeek implementó algunas optimizaciones agresivas de infraestructura:

Kernel Fusion: en lugar de ejecutar las operaciones matemáticas una por una (lo que requiere leer y escribir constantemente en la memoria de la GPU), utilizaron un marco llamado TileLang (Wang et al., 2025)6 para escribir núcleos de GPU unificados y personalizados. Esto les permitió fusionar las multiplicaciones de matrices, la normalización y las iteraciones de Sinkhorn-Knopp en una sola operación, evitando la sobrecarga de memoria. Recomputación selectiva: expandir el flujo residual significa que normalmente hay que guardar una gran cantidad de datos intermedios para el paso hacia atrás durante el entrenamiento. Esto, en la práctica, provocaría instantáneamente que las GPU se quedaran sin memoria. Para solucionar este problema, desechan los datos intermedios después del pase hacia adelante. Solo mantienen las entradas mínimas y luego recalculan rápidamente el mHC liviano utilizando los núcleos unificados sobre la marcha durante el paso hacia atrás. Comunicación superpuesta: en un sistema de entrenamiento distribuido (múltiples GPU), debido a que los flujos más amplios causan retrasos en la comunicación entre las GPU, tuvieron que cambiar su sistema de programación. Al modificarlo, ocultaron los retrasos en la comunicación de los flujos amplios ejecutándolos simultáneamente con el cálculo pesado de las capas de atención, de modo que ninguna parte del mHC sea el paso limitante de la velocidad durante el entrenamiento.

Al final, el resultado de toda esta ingeniería de sistemas vale la pena. A pesar de todas las matemáticas adicionales y los flujos más amplios, mHC solo agrega una pequeña sobrecarga de tiempo del 6,7% durante el entrenamiento en comparación con un modelo de referencia estándar.

4. Los resultados: ¿funcionó realmente?

Para ver si todas las matemáticas y la ingeniería de sistemas realmente valieron la pena, el equipo de DeepSeek puso a prueba mHC. Entrenaron varios modelos de lenguaje basados ​​en la arquitectura DeepSeek-V3 (DeepSeek-Ai et al., 2024)4, ampliando hasta un modelo de 27 mil millones de parámetros. Compararon su nuevo marco de mHC directamente con una línea de base residual estándar y el paradigma de HC inestable y sin restricciones. Echemos un vistazo a cómo se desarrollaron los experimentos.

4.1 Restaurar la estabilidad del entrenamiento

La principal motivación detrás de mHC fue mitigar el comportamiento errático de entrenamiento que se observó en HC debido a las matrices de mapeo sin restricciones. Como se muestra a continuación, la norma de gradiente del modelo HC estándar (gráfico b) comienza a desestabilizarse con oscilaciones bruscas en alrededor de 12k pasos, que es exactamente el momento en el que vemos que las gráficas de pérdida de HC y mHC se separan (gráfico a). Debido a las normas de gradiente más suaves y estables con mHC, el modelo finalmente logra una pérdida de entrenamiento final menor en comparación con el HC básico.

(Fuente: Adaptado de Xie et al., 2025, Figura 5)
Gráfico a: Gráfico de pérdida de entrenamiento versus pasos de entrenamiento para tres variantes diferentes del mismo modelo. Demuestra que el modelo habilitado para mHC logró la menor pérdida de entrenamiento.
Gráfico b: Gráfico de la norma de gradiente frente a los pasos de entrenamiento. Muestra las normas de gradiente altamente inestables que obtenemos del HC vainilla frente a las normas suaves y predecibles que obtenemos del mHC.

4.2 Impulsar el rendimiento posterior

Un modelo estable sólo es útil si en realidad es más inteligente. Para demostrar esto, los autores evaluaron la variante 27B en múltiples puntos de referencia posteriores, incluidos MATH, MMLU y tareas de razonamiento como BBH y DROP. Como se esperaba, el modelo habilitado para mHC mostró mejoras de rendimiento constantes en todos los ámbitos y, especialmente, superó al HC sin restricciones en la mayoría de los puntos de referencia. Los puntos de referencia de razonamiento observaron una ganancia particularmente agradable en el rendimiento, lo que indica que los flujos residuales más amplios están contribuyendo activamente a un modelo más expresivo.

(Fuente: Adaptado de Xie et al., 2025, Tabla 4)
mHC supera la línea de base (conexiones residuales normales) y HC sin restricciones en todos los puntos de referencia excepto MATH.

4.3 Escalamiento predecible y robusto

Una prueba importante para cualquier nuevo paradigma arquitectónico de aprendizaje profundo es si obedece o no a las leyes de escala preestablecidas. Algunas opciones de diseño que funcionan para un modelo de parámetros 3B pueden fallar o ser contraproducentes para un modelo de parámetros 27B. Para garantizar esto, los autores trazaron las curvas de escala de cálculo para los modelos de parámetros 3B, 9B y 24B. Los gráficos que se muestran a continuación demuestran claramente que la mejora de la pérdida relativa se mantiene en todas las escalas, lo que valida que mHC es una actualización arquitectónica escalable.

(Fuente: Adaptado de Xie et al., 2025, Figura 6 (a))
Izquierda: Gráfico de la diferencia de pérdida absoluta entre mHC y el valor inicial frente al tamaño del modelo (en FLOP).
Derecha: Gráfico de la diferencia de pérdida relativa entre mHC y el valor inicial frente al tamaño del modelo (en FLOP).

4.4 Domar la explosión de la señal

Como prueba final, los autores también probaron directamente una de sus afirmaciones: que la señal no debería explotar arbitrariamente cuando se apila en varias capas. Para el HC estándar sin restricciones, vimos cómo la señal se puede amplificar en un factor de 3000, lo que altera completamente los gradientes durante el entrenamiento. Para ver si mHC solucionó este problema directamente o no, DeepSeek rastreó la dinámica de propagación de la señal capa por capa en el modelo y los resultados fueron los esperados. Debido a las matrices de mapeo doblemente estocásticas, la ganancia de la señal se limitó a alrededor de 1,6 en todo el modelo, lo que demuestra que la señal se mantuvo estable incluso después de combinarla en múltiples capas.

(Fuente: Adaptado de Xie et al., 2025, Figura 7)
Gráfico a: Gráfico del factor de ganancia de señal frente a capa (por índice). El gráfico casi no muestra ganancia en múltiples capas diferentes, lo que muestra que las matrices doblemente estocásticas mitigan con éxito la explosión de la señal.
Gráfico b: Gráfico del factor de ganancia de señal frente a capa (por índice, compuesto). El gráfico muestra que cuando se combina, la señal gana un factor de aproximadamente 1,6 en la capa 20, que aún permanece saludable y apta para el entrenamiento.

5. Contrafácticos: los “trucos” y las compensaciones

Antes del final, analicemos algunos de los defectos del mHC, ya que cada elección de ingeniería implica una compensación. Si bien mHC es una buena alternativa a la inestabilidad de Hyper-Connections, tiene algunas advertencias que vale la pena mencionar.

El impuesto sobre el tiempo del 6,7 %: DeepSeek señala con orgullo (y con razón) que sus optimizaciones de infraestructura redujeron el tiempo de capacitación a solo el 6,7 % en comparación con un modelo de referencia. Si bien eso suena increíblemente bajo, en la escala de capacitación de un LLM masivo (cientos de miles de millones de parámetros) donde los costos de cómputo de GPU ascienden a decenas de millones de dólares: un aumento del 6,7 % en el tiempo de capacitación se traduce en un costo financiero muy real y muy grande. Pagará una prima por esa capacidad de representación adicional. Enorme complejidad de ingeniería: no se puede simplemente abrir un script PyTorch estándar, escribir la implementación directamente con unas pocas líneas de código y esperar obtener estos resultados eficientes. Para que mHC fuera viable, el equipo de DeepSeek tuvo que escribir núcleos de GPU fusionados de bajo nivel personalizados utilizando TileLang, administrar la memoria manualmente y modificar la programación de su canalización. Esto eleva significativamente la barrera de entrada. Para equipos más pequeños o investigadores sin ingenieros de infraestructura dedicados, implementar mHC de manera eficiente supondrá una sobrecarga enorme. La matemática es una aproximación: sobre el papel, el algoritmo de Sinkhorn-Knopp convierte la matriz de mapeo residual en una matriz doblemente estocástica perfecta. Sin embargo, para obtener un resultado perfecto, técnicamente el algoritmo debe ejecutarse durante un número infinito de iteraciones. Para mantener las cosas rápidas, los investigadores lo limitan a 20 iteraciones. Debido a esta aproximación, la matriz no es matemáticamente perfecta en la práctica. Si fuera perfecto, entonces observaríamos una ganancia de señal perfecta de 1.0, pero no es así. La ganancia de la señal aumenta hasta un máximo de aproximadamente 1,6 entre las capas. Es absolutamente limitado y seguro, es absolutamente limitado y seguro, para esta escala, pero para modelos aún más grandes (los LLM actuales son >500B parámetros), esta aproximación podría alejarse aún más de lo ideal.

6. Conclusión: reflexiones finales y adoptabilidad

Al final del día, el artículo “mHC: Hiperconexiones restringidas por múltiples” es un resultado de investigación bastante sustancial de DeepSeek. Destaca maravillosamente lo que se necesita para superar los límites de los modelos fundamentales actuales: se necesita una comprensión profunda de las matemáticas puras para diagnosticar los defectos teóricos, y se necesita ingeniería de sistemas avanzada para que la solución realmente funcione con silicio físico y sea prácticamente viable.

La conexión residual estándar ha sido increíblemente útil durante la última década, pero a medida que avanzamos hacia la era de los billones de parámetros, necesitamos vías que puedan transportar representaciones mucho más ricas y amplias sin afectar la estabilidad de la red. DeepSeek ha demostrado una de las formas de lograr caminos más amplios y representativos e innovó un aspecto de la arquitectura que antes se pensaba que no cambiaba.

En cuanto a la adoptabilidad, ¿veremos que mHC sea aceptado e implementado rápidamente? Probablemente no. Debido a la gran dependencia de los núcleos de GPU personalizados y la compleja programación de procesos, tiene una barrera bastante pronunciada que probablemente llevará algún tiempo resumirla en un módulo plug-and-play fácil de usar para la comunidad en general. Sin embargo, DeepSeek ya ha demostrado que funciona a escala en su propia lista de modelos altamente competitiva.

Dadas las claras mejoras en los puntos de referencia de razonamiento y la estabilidad del entrenamiento, espero que los laboratorios de IA con buenos recursos comiencen a adoptar y experimentar con mHC en su próxima generación de arquitecturas. Es un gran paso adelante y demuestra que todavía hay mucho espacio para innovar en los componentes más fundamentales de las redes neuronales.

7. Referencias

Xie, Z., Wei, Y., Cao, H., et al. (2025). mHC: Hiperconexiones restringidas por múltiples. DeepSeek-IA. arXiv preimpresión arXiv:2512.24880. Él, K., Zhang, S., Ren, S. y Sun, J. (2016). Aprendizaje residual profundo para el reconocimiento de imágenes. En Actas de la conferencia IEEE sobre visión por computadora y reconocimiento de patrones (págs. 770-778). Zhu, D., Huang, H., Huang, Z., et al. (2024). Hiperconexiones. Preimpresión de arXiv arXiv:2409.19606. (El artículo original de ByteDance que propone HC sin restricciones). Liu, A., Feng, B., Xue, B., et al. (2024). Informe técnico de DeepSeek-V3. arXiv preimpresión arXiv:2412.19437. Sinkhorn, R. y Knopp, P. (1967). Sobre matrices no negativas y matrices doblemente estocásticas. Revista del Pacífico de Matemáticas, 21(2), 343-348. (Las matemáticas fundamentales detrás de la proyección matricial). Wang, L., Cheng, Y., Shi, Y., et al. (2025). TileLang: un modelo de programación en mosaico componible para sistemas de inteligencia artificial. Preimpresión de arXiv arXiv:2504.17577. (El marco utilizado para la fusión del kernel GPU personalizado de mHC).