Los agentes de investigación profunda (DR) han ganado popularidad rápidamente tanto en la investigación como en la industria, gracias al progreso reciente en LLM. Sin embargo, los agentes de la DR públicos más populares no están diseñados con los procesos de pensamiento humano y escritura en mente. A menudo carecen de pasos estructurados que apoyan a los investigadores humanos, como la redacción, la búsqueda y el uso de comentarios. Los agentes actuales de DR compilan algoritmos de tiempo de prueba y varias herramientas sin marcos cohesivos, destacando la necesidad crítica de marcos especialmente diseñados que pueden igualar o sobresalir las capacidades de investigación humana. La ausencia de procesos cognitivos inspirados en humanos en los métodos actuales crea una brecha entre la investigación de los humanos y cómo los agentes de IA manejan tareas de investigación complejas.
Los trabajos existentes, como la escalada del tiempo de prueba, utilizan algoritmos de refinamiento iterativo, mecanismos de debate, torneos para la clasificación de hipótesis y sistemas autocríticos para generar propuestas de investigación. Los sistemas de múltiples agentes utilizan planificadores, coordinadores, investigadores y reporteros para producir respuestas detalladas, mientras que algunos marcos permiten modos de copiloto humanos para la integración de retroalimentación. Los enfoques de ajuste de agentes se centran en la capacitación a través de objetivos de aprendizaje multitarea, ajuste supervisado supervisado de componentes y aprendizaje de refuerzo para mejorar las capacidades de búsqueda y navegación. Los modelos de difusión de LLM intentan romper los supuestos de muestreo autorregresivo generando borradores ruidosos completos y renovando iterativamente tokens para resultados de alta calidad.
Los investigadores de Google introdujeron el investigador profundo de la difusión del tiempo de prueba (TTD-DR), inspirados en la naturaleza iterativa de la investigación humana a través de ciclos repetidos de búsqueda, pensamiento y refinación. Conceptualiza la generación de informes de investigación como un proceso de difusión, comenzando con un borrador que sirve como una base actualizada y en evolución para guiar la dirección de la investigación. El borrador sufre un refinamiento iterativo a través de un proceso de “renovación”, informado dinámicamente por un mecanismo de recuperación que incorpora información externa en cada paso. Este diseño centrado en el draft hace que la escritura de informes sea más oportuna y coherente al tiempo que reduce la pérdida de información durante los procesos de búsqueda iterativos. TTD-DR logra resultados de vanguardia en puntos de referencia que requieren búsqueda intensiva y razonamiento de múltiples saltos.
El marco TTD-DR aborda las limitaciones de los agentes de DR existentes que emplean procesos lineales o paralelos. El agente de la red troncal propuesta contiene tres etapas principales: generación del plan de investigación, búsqueda y síntesis iterativa, y generación de informes finales, cada uno que contiene agentes de la unidad LLM, flujos de trabajo y estados de agentes. El agente utiliza algoritmos de autoevolución para mejorar el rendimiento de cada etapa, lo que lo ayuda a encontrar y preservar el contexto de alta calidad. El algoritmo propuesto, inspirado en el reciente trabajo de autoevolución, se implementa en un flujo de trabajo paralelo junto con flujos de trabajo secuenciales y de bucle. Este algoritmo se puede aplicar a las tres etapas de los agentes para mejorar la calidad general de la producción.
En las comparaciones de lado a lado con la investigación profunda de OpenAI, TTD-DR alcanza las tasas de ganancia del 69.1% y 74.5% para las tareas de generación de informes de investigación de forma larga, al tiempo que supera en un 4,8%, 7,7% y 1.7% en tres conjuntos de datos de investigación con respuestas de verdad en forma corta. Muestra un fuerte rendimiento en la ayuda y la amplitud de los puntajes de los arrendatarios automáticos, especialmente en conjuntos de datos de investigación de forma larga. Además, el algoritmo de autoevolución alcanza el 60,9% y el 59,8% de las tasas de ganancias contra la investigación profunda de Operai sobre la investigación de forma larga y el profonsultado. La puntuación de corrección muestra una mejora de 1.5% y 2.8% en conjuntos de datos HLE, aunque el rendimiento en GAIA sigue siendo 4.4% por debajo de OpenAi DR. La incorporación de la difusión con la recuperación conduce a ganancias sustanciales sobre la investigación profunda de OpenAI en todos los puntos de referencia.
En conclusión, Google presenta TTD-DR, un método que aborda las limitaciones fundamentales a través del diseño cognitivo inspirado en humanos. El enfoque del marco conceptualiza la generación de informes de investigación como un proceso de difusión, utilizando un esqueleto de borrador actualizado que guía la dirección de la investigación. TTD-DR, mejorado por algoritmos autoevolutivos aplicados a cada componente de flujo de trabajo, garantiza la generación de contexto de alta calidad a lo largo del proceso de investigación. Además, las evaluaciones demuestran que el rendimiento de vanguardia de TTD-DR en varios puntos de referencia que requieren búsqueda intensiva y razonamiento múltiple de salto, con resultados superiores en informes integrales de investigación de forma larga y tareas de razonamiento concisas de múltiples saltos.
Mira el Papel aquí. No tener en cuenta Consulte nuestra página de tutoriales sobre AI Agent y Agentic AI para varias aplicaciones. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.
Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.
