La difusión de errores de Sakana AI entrena redes de doble flujo compatibles con Dale, alcanzando el 96,7 % de MNIST y el 61,7 % de CIFAR-10 sin retropropagación

La retropropagación domina el aprendizaje profundo, pero utiliza un mecanismo que el cerebro probablemente no pueda. Específicamente, el pase hacia atrás necesita transposiciones exactas de matrices de peso hacia adelante. Éste es el problema del transporte de peso. El nuevo artículo de Sakana AI, Diffusing Blame, aborda esta limitación directamente. El equipo de investigación entrena redes que obedecen el principio de Dale evitando por completo el transporte de peso.

¿Qué es la difusión de errores?

La difusión de errores (ED) es una regla de aprendizaje local, propuesta por primera vez por Kaneko (2000). Cada actualización de peso depende únicamente de tres señales. Se trata de actividad presináptica, un derivado de activación postsináptica y un signo de error global único. En consecuencia, ED nunca transporta pesos directos transpuestos ni utiliza matrices de retroalimentación aleatoria. Esa localidad hace que la DE sea naturalmente compatible con el principio de Dale. Sin embargo, trabajos anteriores demostraron DE solo en clasificación binaria y MNIST.

La arquitectura de doble flujo

Para satisfacer esa limitación, el equipo de investigación dividió cada capa en dos corrientes. Una corriente es excitadora (p) y la otra es inhibidora (n). El pase directo calcula las preactivaciones excitadoras menos inhibidoras para cada flujo:

p_i = φ_i( +p_{i-1} Wpp − n_{i-1} Wnp + pb ) n_i = φ_i( +n_{i-1} Wnn − p_{i-1} Wpn + bn )

Aquí, las cuatro matrices de peso permanecen no negativas en cuanto a elementos. Los sesgos bp y bn son la excepción, ya que no es necesario que sean no negativos. Además, los signos de negación antes de Wnp y Wpn son estructurales, no aprendidos. Por lo tanto, las conexiones entre corrientes siguen siendo inhibidoras mientras que todos los pesos que se pueden aprender permanecen no negativos. Este diseño necesita cuatro submatrices de peso por capa. Como resultado, utiliza aproximadamente 4 veces más parámetros que una red de flujo único. Para la misma arquitectura, eso es aproximadamente 32 millones frente a aproximadamente 8 millones para DFA.

Enrutamiento de errores de módulo

Con esa arquitectura implementada, la extensión principal es el enrutamiento de errores de módulo. Esto eleva la difusión de errores (ED) más allá de la clasificación binaria. Para la unidad oculta i, el equipo de investigación define la ruta r(i) = i mod C. Aquí, C es la dimensión de salida. Luego, esa unidad aprende del componente de error enrutado. En resumen, a cada unidad oculta se le asigna un canal de salida fijo. A diferencia de DFA, cuyas matrices de retroalimentación son aleatorias, ED utiliza esta correspondencia estructurada.

Tres innovaciones de clasificación

Sobre la base de esa ruta, el equipo de investigación agrega tres correcciones para la clasificación de clases múltiples:

Los anchos sigmoideos específicos de la capa utilizan φi(z) = 1/(1 + e−2z/αi). Dado que la derivada sigmoidea controla directamente la señal de error, la atenuación es grave. De hecho, el análisis post-hoc revela una caída de 25× desde la salida hasta la primera capa oculta. Los sigmoideos más anchos mantienen las derivadas más grandes, evitando la saturación prematura. El equipo establece α = 3,0 para capas convolucionales CIFAR-10 y α = 6,0 para capas completamente conectadas. El error de clase centrado en el lote resta la media del mini lote por clase. Esto hace que el error uno contra todos tenga media cero en todo el lote para cada clase. De este modo reduce la supresión persistente causada por el desequilibrio del objetivo 9:1. La inicialización asimétrica aumenta los pesos excitadores 1,5 veces y los pesos inhibidores 0,5 veces. Esto da una relación de escala E/I esperada de 3:1, mientras que la capa de salida permanece simétrica.

[];" cy="" li="" idx="" kind="" ei="" bordes="[];" to="" line="" function="" el="" attrs="" tag="" for="" k="" in="" e.setattribute="" return="" layout="" svg.innerhtml="" top="60," bottom="340;" Layers.foreach="" gap="(bottom" label="" t="el('text'," lx="" y:="" fill:="" t.textcontent="L.label;" svg.appendchild="" i="0;" ln="" :="" alternativo="" nodes.push="" cx:="" cy:="" li:="" idx:="" l.kind="" ei:="" entre="" consecutivo="" under="" capas.length="" a="nodes.filter(function(nd){" nd.li="==" b="nodes.filter(function(nd){" a.foreach="" b.foreach="" x1:="" na.cx="" y1:="" na.cy="" x2:="" nb.cx="" y2:="" nb.cy="" trazo:="" bordes.push="" desde:="" na="" hasta:="" nb="" línea:="" draw="" nodos.foreach="" fill="#1a1a1a" trazo="#3a3a3a" if="" nd.kind="==" nd.cx="" nd.cy="" r:="" c.setattribute="" nodes.indexof="" nd.circle="c;" add="" index="" enrutamiento="" lt="el('text'," lt.textcontent="c" nd.idx="" annotation="" módulo="" note="el('text'," id:="" note.textcontent="enrutamiento: r(i) = i mod C" setnode="" color="" nd.circle.setattribute="" resetvisual="" edge.foreach="" e.line.setattribute="" pulse="" p="el('circle'," x1="" y1="" opacity:="" start="null;" step="" dur="" .5="" facilidadinout="" p.setattribute="" requestanimationframe="" else="" p.remove="" cb="" forwardpass="" document.getelementbyid="" true="" status.innerhtml="Ejecución de <b>pase hacia adelante</b>: cada flujo calcula preactivaciones excitatorias menos inhibidoras, luego un sigmoide de ancho escalado." light="" up="" nodes.filter="" n.li="==0;}).forEach(function(n){" nextlayer="">= Layers.length – 1){ animating = false; document.getElementById('errBtn').disabled = false; status.innerHTML = 'Pase de reenvío completo. Ahora presione Diffuse Error para enrutar la señal de entrenamiento.'; n.li===li+1;}); var done = 0, total = a.length; // pulsa un borde representativo por fuente a.forEach(function(na, k){ var nb = b[k % b.length]; pulse(na.cx, na.cy, nb.cx, nb.cy, '#ffffff', 420, function(){ done++; if (done === total){ b.forEach(function(n){ setNode(n, n.ei === 'n' ? '#9a9a9a' : '#FF7A18'); }); setTimeout(nextLayer, 120); } } }); nodes.filter(function(n){return n.li===layers.length-1;}); var tNode = out[target]; // resaltar la salida objetivo out.forEach(function(n){ setNode(n, n.idx===target ? '#FFC24B' : '#1a1a1a'); }); if (mode === 'ed'){ status.innerHTML = 'Difusión de errores: el error de salida se transmite directamente a las unidades ocultas. La unidad i aprende de la clase r(i) = i mod C. No se utilizan pesos transpuestos.'; var hid = nodes.filter(function(n){ return n.kind === 'hid'; }); src = out[enrutado]; var isTargetChannel = (enrutado === destino); var col = isTargetChannel ? '#FFC24B' : '#7a5a1a'; setNode(h, isTargetChannel ? '#FFC24B' : (h.ei==='n' ? '#9a9a9a' : '#FF7A18')); if (done === hid.length){ animating = false; status.innerHTML = 'Listo. Cada unidad oculta recibió su componente de error enrutado, activado localmente por su propio derivado de activación.'; } }); }); else { status.innerHTML = 'Retropropagación: el error debe viajar capa por capa hacia atrás, usando transposiciones exactas de pesos hacia adelante: el problema de transporte de peso.'; Backprop alcanzó el primero.

Actuación

Con las tres innovaciones, la difusión de errores (ED) alcanza el 96,7 % en MNIST y el 61,7 % en CIFAR-10. Por el contrario, la DE de semillas sin ellos se desploma al 50,4% y al 11,6%. DFA obtiene puntuaciones más altas en ambas tareas, pero viola el principio de Dale, utilizando aproximadamente 2,84 millones de pesos negativos. En particular, esta es la primera vez que ED entrena redes convolucionales. Anteriormente, Fujita (2026) alcanzó ~55,2% en CIFAR-10 utilizando un MLP aplanado. Aun así, el 61,7% sigue estando lejos de los métodos estándar basados ​​en gradientes.

Método MNISTCIFAR-10 Cumple con Dale Notas ED propuesta 96,7 % 61,7 % Sí Todas las ponderaciones no son negativas; primer ED en CNNSeed ED50,4%11,6%SíSin innovaciones; α = 1,0, error sin formato, initDFA simétrico97,6%69,1%NoRetroalimentación aleatoria; ∼2,84 millones de pesos negativos

La reversión de la ablación

Curiosamente, la importancia de las innovaciones cambia entre tareas. En MNIST, eliminar anchos específicos de capas es catastrófico (-71,4 pp), colapsando la precisión hacia el azar. El centrado en lotes apenas importa allí (-0,3 pp). En CIFAR-10, sin embargo, el orden se invierte. La eliminación del error centrado en el lote se convierte en la caída más grande (-47,9 pp), colapsando cuatro de cinco semillas. Esta reversión expone cuellos de botella en la asignación de créditos dependientes de tareas invisibles para una evaluación de referencia única.

Difusión de errores en el aprendizaje por refuerzo

Más allá de la clasificación, el equipo de investigación integra la ED con la optimización de políticas próximas (PPO). Llaman al resultado ED-PPO y lo prueban en locomoción Brax y Craftax. Aquí, el error de salida de la política se dirige a unidades ocultas por canal de salida. Para la red de valor escalar, el error se transmite a todas las unidades. Es importante destacar que ED-PPO elimina por completo las tres innovaciones de clasificación. En cinco cabezas de serie, ED-PPO vence a BP-PPO en HalfCheetah (5494 vs 3520; p <0,001) y iguala a DFA-PPO. En Ant, se mantiene a la par con ambas variantes de PPO. Mientras tanto, en Craftax, DFA-PPO es el método más débil (19,8 frente a BP-PPO 27,0). Por lo tanto, la retroalimentación aleatoria que es suficiente para la clasificación puede fallar en RL abierta.

Casos de uso y ejemplos

Tres escenarios lo concretan:

El hardware neuromórfico y fotónico a menudo codifica físicamente magnitudes sinápticas no negativas. El enrutamiento de señales fijas de ED se asigna limpiamente a dichos sustratos, complementando el trabajo fotónico anterior de DFA. El suelo no negativo empuja el 37,3% de las pesas al suelo (10⁻⁴) después del entrenamiento. Las conexiones inhibidoras de flujo cruzado totalmente conectadas son las que más se eliminan, hasta un 68,8%. Esta escasez implícita sugiere una compresión del modelo "gratuita". La corriente inhibidora dedicada puede ayudar al aprendizaje continuo y abierto. Proporciona un mecanismo estructural para amortiguar grandes desviaciones de gradiente.

Comparación

Cómo se compara la difusión de errores compatible con Dale

Enfoque propuesto frente a otras reglas de aprendizaje biológicamente motivadas y libres de retropropagación. "Compatible con Dale" significa poblaciones excitadoras/inhibitorias separadas con pesos no negativos. Los nombres de los métodos enlazan con fuentes primarias.

Conclusión: la mayoría de las reglas sin retropropagación relajan el principio de Dale, y la mayoría de las redes compatibles con Dale todavía dependen de la retropropagación. Error Diffusion satisface ambos a la vez y es el primero en llevar esa combinación al aprendizaje por refuerzo.

Bosquejo de código mínimo

Las ecuaciones se traducen en un ciclo de actualización compacto e ilustrativo:

importar antorcha def dual_stream_forward(p, n, Wpp, Wnp, Wnn, Wpn, bp, bn, phi): # Todo W >= 0; las señales de corriente cruzada están codificadas de forma inhibidora (principio de Dale) p_next = phi(p @ Wpp – n @ Wnp + bp) # corriente excitatoria n_next = phi(n @ Wnn – p @ Wpn + bn) # retorno de corriente inhibidora p_next, n_next def routed_error(S, H, C): # S: error de salida, forma (B, C) M = torch.zeros(H, C) para i en rango(H): M[i, i % C] = 1.0 # r(i) = i mod C return S @ MT # R = SM^T, forma (B, H) def ed_update(A_p, Z_p, R, phi_deriv): U_p = phi_deriv(Z_p) * R # retorno de unidad postsináptica local A_p.T @ U_p # dWpp ∝ A_p^T U_p, forma (K, H)

Conclusiones clave

Error Diffusion de Sakana AI entrena redes de doble flujo compatibles con Dale sin transporte de peso ni matrices de retroalimentación aleatoria. El enrutamiento de errores de módulo (r(i) = i mod C) escala la regla más allá de la clasificación binaria al 96,7 % MNIST y 61,7 % CIFAR-10. Tres innovaciones de clasificación revierten su importancia entre MNIST y CIFAR-10, exponiendo cuellos de botella en la asignación de créditos que dependen de las tareas. ED-PPO aporta la misma arquitectura al aprendizaje por refuerzo, igualando a DFA-PPO en Brax y superándolo en Craftax. El principio de Dale cuesta entre 0,9 y 7,4 puntos frente a DFA en la clasificación, cuantificando el precio de las ponderaciones no negativas.

Consulte el documento. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.