Los investigadores de Sony proponen Talkhier: un nuevo marco de IA para los sistemas LLM-MA que aborda los desafíos clave en la comunicación y el refinamiento

Multi-agente basado en LLM (LLM-MA) Los sistemas permiten que los agentes del modelo de lenguaje múltiple colaboren en tareas complejas dividiendo las responsabilidades. Estos sistemas se utilizan en robótica, finanzas y codificación, pero enfrentan desafíos en la comunicación y el refinamiento. La comunicación basada en texto conduce a intercambios largos y no estructurados, lo que dificulta el seguimiento de las tareas, mantener la estructura y recordar las interacciones pasadas. Los métodos de refinamiento como los debates y las mejoras basadas en la retroalimentación luchan, ya que las entradas importantes pueden ignorarse o sesgarse debido al orden de procesamiento. Estos problemas limitan la eficiencia de los sistemas LLM-MA en el manejo de problemas de varios pasos.

Actualmente, usan sistemas de múltiples agentes basados ​​en LLM debate, autocuración, y Comentarios de múltiples agentes para manejar tareas complejas. Estas técnicas se vuelven desestructuradas y difíciles de controlar según la interacción basada en texto. Los agentes luchan por seguir subtareas, recuerdan las interacciones anteriores y proporcionan respuestas consistentes. Varias estructuras de comunicación, incluidos los modelos de cadena y árboles, intentan mejorar la eficiencia, pero no tienen protocolos explícitos para estructurar información. Las técnicas de refinamiento de retroalimentación intentan aumentar la precisión pero tienen desafíos con entradas sesgadas o duplicadas, lo que hace que la evaluación sea poco confiable. Sin comunicación sistemática y retroalimentación a gran escala, tales sistemas aún son ineficientes y propensos a errores.

Para mitigar estos problemas, investigadores de Sony Group Corporation, Japón, propuesto Talkhierun marco que mejora la comunicación y la coordinación de tareas en sistemas de múltiples agentes utilizando protocolos estructurados y refinamiento jerárquico. A diferencia de los enfoques estándar, Talkhier describe explícitamente las interacciones de los agentes y la formulación de tareas cada vez más sutilmente, reduciendo el error y la eficiencia. Los agentes ejecutan roles formal, y el sistema se adapta automáticamente a diferentes problemas por el sistema, lo que resulta en una mejor toma de decisiones y coordinación.

Este marco estructura agentes en un gráfico de tal manera que cada nodo es un agente, y los bordes representan rutas de comunicación. Los agentes poseen memoria independiente, lo que les permite contener información pertinente y tomar decisiones basadas en entradas informadas sin usar memoria compartida. La comunicación sigue un proceso formal: los mensajes contienen contenido, información de fondo y salidas intermedias. Los agentes se organizan en equipos con supervisores que monitorean el proceso, y un subconjunto de agentes sirve como miembros y supervisores, lo que resulta en una jerarquía anidada. El trabajo se asigna, evalúa y mejora en una serie de iteraciones hasta que pasa un umbral de calidad, con el objetivo de precisión y minimización de errores.

Tras la evaluación, los investigadores evaluaron Talkhier a través de múltiples puntos de referencia para analizar su efectividad. En el MMLU conjunto de datos, cubriendo escenario moral, física universitaria, Aprendizaje automáticoLógica formal y política exterior de EE. UU., Talkhier, construida en GPT-4Ologró la mayor precisión de 88.38%superando el agente (83.66%) y líneas de base de un solo agente como Reaccionar7@ (67.19%) y GPT-4O-7@ (71.15%)demostrando los beneficios del refinamiento jerárquico. En el conjunto de datos wikiqa, superó a las líneas de base en preguntas de dominio abierto con un Puntaje Rouge-1 de 0.3461 (+5.32%) y un Bertscore de 0.6079 (+3.30%), excesivo AutoGPT (0.3286 Rouge-1, 0.5885 Bertscore). Un estudio de ablación mostró que la eliminación del supervisor de evaluación o la comunicación estructurada redujo significativamente la precisión, confirmando su importancia. TalkHier superó Okg por 17.63% A través de la fidelidad, la fluidez, el atractivo y la violación del recuento de personajes en el conjunto de datos de la cámara para la generación de texto AD, con evaluaciones humanas que validan sus evaluaciones de múltiples agentes. Mientras OpenAI-O1 La arquitectura interna no se reveló, Talkhier publicó puntajes MMLU competitivos y la superó decisivamente en Wikiqa, mostrando flexibilidad entre las tareas y el dominio sobre la votación mayoritaria y los sistemas de múltiples agentes de código abierto.

Al final, el marco propuesto mejoró la comunicación, el razonamiento y la coordinación en Sistemas de agentes múltiples LLM Al combinar un protocolo estructurado con refinamiento jerárquico, lo que resultó en un mejor rendimiento en varios puntos de referencia. La inclusión de mensajes, resultados intermedios e información de contexto aseguró interacciones estructuradas sin sacrificar la retroalimentación de agentes heterogéneos. Incluso con aumento API gastos, Talkhier Establezca un nuevo punto de referencia para la cooperación de múltiples agentes escalable y escalable. Esta metodología puede servir como línea de base en investigaciones posteriores, dirigiendo la mejora en mecanismos de comunicación efectivos e interacciones de bajo costo múltiples, en última instancia, hacia el avance. LLM-Lauguración de sistemas cooperativos basados ​​en.


Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 75k+ ml de subreddit.

🚨 Lectura de lectura recomendada Liberaciones de investigación de IA: un sistema avanzado que integra el sistema de IA del agente y los estándares de cumplimiento de datos para abordar las preocupaciones legales en los conjuntos de datos de IA


Divyesh es un pasante de consultoría en MarktechPost. Está buscando un BTech en ingeniería agrícola y alimentaria del Instituto Indio de Tecnología, Kharagpur. Es un entusiasta de la ciencia de datos y el aprendizaje automático que quiere integrar estas tecnologías líderes en el dominio agrícola y resolver desafíos.