Razonamiento algorítmico neuronal para transformadores: el marco TransNAR

Las redes neuronales gráficas (GNN), denominadas razonadores algorítmicos neuronales (NAR), han demostrado eficacia para resolver de forma sólida tareas algorítmicas de diferentes tamaños de entrada, tanto dentro como fuera de la distribución. Sin embargo, los NAR siguen siendo formas relativamente limitadas de IA, ya que requieren un formato de entrada rígidamente estructurado y no pueden aplicarse directamente a problemas planteados en formas ruidosas como el lenguaje natural, incluso cuando el problema subyacente es algorítmico. Por el contrario, los modelos de lenguaje basados ​​en Transformer destacan en el modelado de datos de texto ruidosos, pero tienen dificultades con las tareas algorítmicas, especialmente aquellas que requieren una generalización fuera de la distribución. El desafío clave es desarrollar métodos que puedan manejar el razonamiento algorítmico en lenguaje natural manteniendo sólidas capacidades de generalización.

Los investigadores de DeepMind propusieron TransNAR que introduce una arquitectura híbrida que combina las capacidades de comprensión del lenguaje de Transformers con las sólidas capacidades de razonamiento algorítmico de los NAR previamente entrenados basados ​​en GNN. El Transformer utiliza el NAR como una herramienta de alta dimensión para modular sus incrustaciones de tokens. Específicamente, el módulo NAR es un GNN previamente entrenado para ejecutar varios cálculos algorítmicos en entradas basadas en gráficos. A lo largo de su avance, el Transformer puede acceder a las incrustaciones calculadas por la NAR mediante el uso de atención cruzada con pesos de “pegamento” que se pueden aprender. Esta sinergia entre Transformers y NAR tiene como objetivo mejorar las capacidades de razonamiento de los modelos de lenguaje, particularmente para tareas algorítmicas fuera de distribución.

El método TransNAR se basa en varias áreas de investigación: razonamiento algorítmico neuronal, generalización de longitud en modelos de lenguaje, uso de herramientas y multimodalidad. Está inspirado en trabajos que demuestran que los NAR pueden ejecutar múltiples algoritmos simultáneamente y generalizarse mucho más allá de su distribución de entrenamiento. TransNAR utiliza un módulo NAR multitarea previamente entrenado y lo implementa a mayor escala integrándolo con un modelo de lenguaje. TransNAR, que aborda las capacidades limitadas de generalización de longitud de los modelos de lenguaje, combina la comprensión del lenguaje de Transformers con el sólido razonamiento algorítmico de los NAR. Este enfoque híbrido, que utiliza atención cruzada entre los dos módulos, tiene como objetivo mejorar las capacidades de razonamiento, especialmente para tareas algorítmicas fuera de distribución planteadas en lenguaje natural.

La arquitectura TransNAR acepta entradas duales: una especificación de problema algorítmico textual y su representación gráfica correspondiente del punto de referencia CLRS-30. El paso directo del modelo entrelaza capas de Transformer que procesan la entrada de texto con capas NAR que operan en la entrada del gráfico. Fundamentalmente, las capas de Transformer utilizan atención cruzada para condicionar sus incrustaciones de tokens en las incrustaciones de nodos calculadas por el NAR. Esta sinergia permite que el modelo de lenguaje aumente su comprensión con sólidas capacidades de razonamiento algorítmico del módulo NAR previamente entrenado. El modelo se entrena de un extremo a otro con un objetivo de predicción del siguiente token en la salida textual.

Los resultados demuestran las mejoras significativas logradas por el modelo TransNAR con respecto al transformador de referencia. TransNAR supera la línea de base en general y en la mayoría de los algoritmos individuales, tanto dentro como fuera de la distribución. En particular, TransNAR no solo mejora las capacidades de generalización fuera de distribución existentes, sino que también permite dichas capacidades cuando la línea base carece por completo de ellas. El análisis de puntuación de forma revela que conectar a tierra las salidas del transformador en incorporaciones NAR aumenta la proporción de entradas para las cuales el modelo produce salidas con la forma correcta, aliviando un modo de falla específico. Sin embargo, TransNAR todavía tiene problemas con los algoritmos que implican la búsqueda de un índice particular en una lista de entrada, lo que sugiere un modo de falla unificado relacionado con la generalización a límites de índice robustos que no se ven durante el entrenamiento.

Este trabajo presenta TransNAR, una arquitectura híbrida que combina un modelo de lenguaje Transformer con una red neuronal gráfica previamente entrenada NAR. Al basar las capacidades de comprensión del lenguaje del Transformer en el sólido razonamiento algorítmico del NAR, TransNAR puede resolver eficazmente tareas algorítmicas especificadas en lenguaje natural. Las evaluaciones en el punto de referencia CLRS-Text demostraron la superioridad de TransNAR sobre los modelos solo de transformador, tanto en distribución como, fundamentalmente, en regímenes fuera de distribución con tamaños de entrada más grandes.


Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo.

Únete a nuestro Canal de telegramas y LinkedIn Grarriba.

Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..

No olvides unirte a nuestro SubReddit de 44k+ ML


Asjad es consultor interno en Marktechpost. Está cursando B.Tech en ingeniería mecánica en el Instituto Indio de Tecnología, Kharagpur. Asjad es un entusiasta del aprendizaje automático y el aprendizaje profundo que siempre está investigando las aplicaciones del aprendizaje automático en la atención médica.