Los agentes de automatización web se han convertido en un enfoque creciente en la inteligencia artificial, particularmente debido a su capacidad para ejecutar acciones similares a los humanos en entornos digitales. Estos agentes interactúan con sitios web a través de interfaces gráficas de usuario (GUI), imitando comportamientos humanos como hacer clic, escribir y navegar en las páginas web. Este enfoque evita la necesidad de interfaces de programación de aplicaciones dedicadas (API), que a menudo no están disponibles o limitadas en muchas aplicaciones web. En cambio, estos agentes pueden operar universalmente en todos los dominios web, haciéndolos herramientas flexibles para una amplia gama de tareas. La evolución de los modelos de lenguaje grande (LLM) ha permitido a estos agentes no solo interpretar el contenido web sino también razonar, planificar y actuar con una sofisticación creciente. A medida que sus habilidades crecen, también lo hace la necesidad de evaluarlas en más que solo tareas de navegación simples. Los puntos de referencia que alguna vez fueron suficientes para los primeros modelos ya no son capaces de medir la extensión total de las capacidades de los agentes modernos.
A medida que progresan estos agentes web, surge un problema apremiante: su competencia en el manejo de tareas digitales mundanas, intensivas en memoria y de múltiples pasos sigue siendo insuficientemente medida. Muchas tareas que los humanos realizan en sitios web, como recuperar datos de diferentes páginas, realizar cálculos basados en entradas anteriores o aplicar reglas complejas, requieren un esfuerzo cognitivo significativo. Estos no son simplemente desafíos de navegación; Proban la memoria, la lógica y la planificación a largo plazo. Sin embargo, la mayoría de los puntos de referencia se centran en escenarios simplificados, sin reflejar los tipos de tareas digitales que las personas a menudo prefieren evitar. Además, las limitaciones en estos puntos de referencia se hacen más evidentes a medida que los agentes mejoran su rendimiento. Las ambigüedades en las instrucciones o inconsistencias de la tarea en los resultados esperados comienzan a sesgar las evaluaciones. Cuando los agentes generan respuestas razonables pero ligeramente divergentes, se penalizan incorrectamente debido a las vagas definiciones de tareas. Tales defectos dificultan la distinción entre las verdaderas limitaciones del modelo y las deficiencias de referencia.
Los esfuerzos anteriores para evaluar los agentes web se han centrado en puntos de referencia como Webarena. Webarena obtuvo una adopción generalizada debido a su reproducibilidad y capacidad para simular sitios web del mundo real, incluidas las plataformas Reddit, GitLab y de comercio electrónico. Ofreció más de 800 tareas diseñadas para probar la capacidad de un agente para completar los objetivos basados en la web dentro de estos entornos. Sin embargo, estas tareas se centraron principalmente en la navegación general y no desafiaron adecuadamente a los agentes más avanzados. Otros puntos de referencia, como Mind2Web, Gaia y Mmin, contribuyeron explorando tareas web reales o entornos específicos de la plataforma como ServiceNow, pero cada uno vino con compensaciones. Algunos carecían de interactividad, otros no apoyaban la reproducibilidad, y otros estaban demasiado limitados. Estas limitaciones crearon una brecha en la medición del progreso del agente en áreas que requieren una toma de decisiones complejas, memoria a largo plazo y un procesamiento de datos preciso en múltiples páginas web.
Investigadores de la Universidad de Tokio introdujeron Webchorearena. Este marco ampliado se basa en la estructura de Webarena, pero aumenta significativamente la dificultad y la complejidad de la tarea. WebChorearena presenta un total de 532 tareas recientemente seleccionadas, distribuidas en los mismos cuatro sitios web simulados. Estas tareas están diseñadas para ser más exigentes, lo que refleja escenarios en los que los agentes deben participar en tareas como la agregación de datos, el retiro de memoria y el razonamiento de múltiples pasos. Es importante destacar que el punto de referencia se construyó para garantizar una reproducibilidad y estandarización completa, lo que permite comparaciones justas entre los agentes y evitando las ambigüedades encontradas en las herramientas anteriores. La inclusión de diversos tipos de tareas y modalidades de entrada ayuda a simular el uso de la web realista y evalúa a los agentes en una escala más práctica y desafiante.
WebChorearena clasifica sus tareas en cuatro tipos principales. Ciento diecisiete tareas se encuentran en una memoria masiva, lo que requiere que los agentes extraen y recuerden grandes volúmenes de información, como compilar todos los nombres de clientes vinculados a transacciones de alto valor. Las tareas de cálculo, que incluyen 132 entradas, involucran operaciones aritméticas como identificar los meses más altos en función de múltiples puntos de datos. Tareas de memoria a largo plazo número 127 y pruebe la capacidad del agente para conectar información en varias páginas, como recuperar las reglas de precios de un sitio y aplicarlas en otro. Se clasifican 65 tareas adicionales como ‘otras’, incluidas operaciones como asignar etiquetas en GitLab que no se ajustan a los formatos de tareas tradicionales. Cada tarea especifica su modalidad de entrada, con 451 tareas solucionables con cualquier tipo de observación, 69 que requieren solo entrada textual y 12 dependientes exclusivamente en las entradas de imágenes.
Al evaluar el punto de referencia, los investigadores utilizaron tres modelos de idiomas grandes prominentes: GPT-4O, Claude 3.7 Sonnet y Gemini 2.5 Pro. Estos fueron probados junto con dos agentes web avanzados, AgentOccam y BrowsergyM. Los resultados resaltaron la mayor dificultad de WebChorearena en comparación con los puntos de referencia anteriores. GPT-4O, que había alcanzado una precisión del 42.8% en Webarena, administró solo un 6.8% en WebChorearena. Claude 3.7 Sonnet y Gemini 2.5 Pro funcionó mejor, con Gemini alcanzando una precisión máxima del 44.9%. A pesar de ser el mejor desempeño, este resultado aún reflejó brechas significativas en la capacidad al tratar con las tareas más complejas de WebChorearena. El punto de referencia también demostró ser más sensible para detectar las diferencias de rendimiento entre los modelos, por lo que es una herramienta valiosa para la evaluación comparativa de avances continuos en las tecnologías de agentes web.
Varias conclusiones clave de la investigación incluyen:
- WebChorearena incluye 532 tareas: 117 memoria masiva, 132 cálculos, 127 memoria a largo plazo y otros 65.
- Las tareas se distribuyen a través de las compras (117), el administrador de compras (132), Reddit (91), Gitlab (127) y 65 escenarios de sitios cruzados.
- Tipos de entrada: 451 tareas se pueden solucionar con cualquier entrada, 69 requieren entrada textual y 12 necesidad de entrada de imagen.
- GPT-4O obtuvo solo 6.8% en WebChorearena en comparación con el 42.8% en Webarena.
- Gemini 2.5 Pro logró el puntaje más alto con 44.9%, lo que indica limitaciones actuales en el manejo de tareas complejas.
- WebChorearena proporciona un gradiente de rendimiento más claro entre modelos que Webarena, mejorando el valor de evaluación comparativa.
- Se utilizaron un total de 117 plantillas de tareas para garantizar la diversidad y la reproducibilidad en aproximadamente 4.5 instancias por plantilla.
- El punto de referencia exigió más de 300 horas de anotación y refinamiento, lo que refleja su rigurosa construcción.
- Las evaluaciones utilizan la coincidencia de cadenas, la coincidencia de URL y las comparaciones de estructura HTML para evaluar la precisión.
En conclusión, esta investigación destaca la disparidad entre el dominio general de la navegación y las habilidades cognitivas de orden superior necesarias para las tareas basadas en la web. El recién introducido WebChorearena se erige como un punto de referencia robusto y detallado diseñado específicamente para empujar a los agentes web a territorios donde deben confiar en el razonamiento, la memoria y la lógica. Reemplaza la ambigüedad con la estandarización, y sus tareas imitan el trabajo pesado digital que los agentes deben aprender a manejar si van a ser realmente útiles para automatizar las actividades del mundo real.
Mira el Papel, Página de Github y Página del proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto.
🆕 ¿Sabías? MarktechPost es la plataforma de medios AI de más rápido crecimiento, remunerada por más de 1 millón de lectores mensuales. Reserve una llamada de estrategia para discutir los objetivos de su campaña. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 95k+ ml de subreddit y suscribirse a Nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.