Los agentes de uso de computadoras se han limitado a los primitivos. Hacen clic, escriben, se desplazan. Las largas cadenas de acción amplifican los errores de conexión a tierra y los pasos desperdiciados. Los investigadores de Apple presentan UltraCUA, un modelo básico que crea un espacio de acción híbrido que permite a un agente intercalar acciones GUI de bajo nivel con llamadas a herramientas programáticas de alto nivel. El modelo elige el movimiento más barato y fiable en cada paso. El enfoque mejora el éxito y reduce los pasos en OSWorld y las transferencias a WindowsAgentArena sin capacitación específica de Windows.
¿Qué acción híbrida cambia?
La acción híbrida trata las herramientas como acciones de primera clase. Una llamada a una herramienta encapsula una operación de varios pasos como una función única con una firma clara y una cadena de documentación. Todavía existe un clic o una pulsación de tecla cuando no hay una ruta programática disponible. El agente aprende a alternar entre ambos modos. El objetivo es reducir los errores en cascada y reducir el número de pasos. El equipo de investigación posiciona esto como un puente entre las CUA solo para GUI y los marcos de agentes centrados en herramientas.
Adquisición de herramientas a escala
UltraCUA construye su biblioteca de herramientas con un proceso automatizado. El sistema extrae atajos de teclado y comandos de la documentación del software. El sistema integra implementaciones de código abierto de kits de herramientas de agentes. El sistema también utiliza agentes de codificación para sintetizar nuevas herramientas. Cada herramienta es una interfaz invocable que oculta una larga secuencia GUI. El equipo de investigación informa cobertura en 10 dominios de escritorio con 881 herramientas. Los grupos más grandes incluyen VS Code con 135 herramientas y LibreOffice Writer con 123 herramientas. Thunderbird y GIMP también tienen una cobertura profunda.
Tareas y trayectorias sintéticas verificables.
La formación requiere una supervisión fundamentada y recompensas estables. UltraCUA utiliza un motor sintético dual. Una primera canalización del evaluador compone verificadores atómicos para navegadores, archivos, imágenes y estado del sistema, luego genera tareas que satisfacen esas comprobaciones. Un primer canal de instrucciones explora el sistema operativo y propone tareas alineadas con el contexto que luego se verifican. El resultado son 17.864 tareas verificables en 10 dominios como Chrome, LibreOffice, GIMP, VS Code, system, Thunderbird, VLC y flujos de trabajo de múltiples aplicaciones. Chrome tiene 2.826 tareas. La suite LibreOffice suma 5.885 tareas. Las tareas multiaplicación llegan a 2.113.
Una implementación de múltiples agentes produce trayectorias híbridas exitosas. El planificador utiliza OpenAI o3 para la toma de decisiones. El terrestre utiliza GTA1-7B para una localización visual precisa. La implementación arroja alrededor de 26,8 mil trayectorias exitosas que muestran cuándo usar una herramienta y cuándo actuar en la GUI. Estas trayectorias son el núcleo de la fase supervisada.
Enfoque de entrenamiento
La formación tiene dos etapas. La etapa 1 es un ajuste fino supervisado. Los modelos se entrenan durante 3 épocas a una tasa de aprendizaje de 2e-5 en las trayectorias exitosas. La pérdida se aplica por turnos para evitar sobreponderar los primeros pasos. La etapa 2 es el aprendizaje por refuerzo en línea. Los modelos entrenan durante 150 pasos a una tasa de aprendizaje de 1e-6 en tareas verificadas que se muestrean por dificultad. La optimización de la política sigue una variante de GRPO con un clip más alto y elimina la regularización de KL y las recompensas de formato. La recompensa combina resultados escasos de la tarea con un término de uso de herramienta. Los experimentos utilizan GPU NVIDIA H100. El contexto se mantiene cerca de 32K controlando la cantidad de herramientas expuestas.
Resultados en OSWorld
UltraCUA mejora el éxito en las escalas 7B y 32B. Con presupuestos de 15 pasos, UltraCUA-32B alcanza un 41,0 por ciento de éxito. OpenCUA-32B alcanza el 29,7 por ciento. La ganancia absoluta es de 11,3 puntos. UltraCUA-7B alcanza el 28,9 por ciento. UI-TARS-1.5-7B alcanza el 23,4 por ciento. Las ganancias persisten con presupuestos de 50 pasos. Un desglose por dominio muestra aumentos consistentes en Chrome, Writer, VS Code y tareas entre aplicaciones. Los pasos promedio disminuyen con respecto a las líneas de base. Estos cambios indican una mejor selección de acciones en lugar de sólo más intentos.
Transferencia multiplataforma en WindowsAgentArena
UltraCUA se entrena solo con datos de OSWorld basados en Ubuntu. Luego, el modelo se evalúa en WindowsAgentArena. UltraCUA-7B alcanza un 21,7 por ciento de éxito. Esto supera UI-TARS-1.5-7B con un 18,1 por ciento y una línea base Qwen2 entrenada con datos de Windows con un 13,5 por ciento. El resultado sugiere que las estrategias de acción híbridas aprendidas en una plataforma se transfieren a otras plataformas. El artículo destaca esto como una generalización de la plataforma de tiro cero.
Conclusiones clave
UltraCUA formaliza un espacio de acción híbrido que permite a un único agente alternar entre primitivas GUI y llamadas a herramientas programáticas, lo que reduce las largas cadenas de acción propensas a errores. El equipo de investigación amplía una biblioteca de herramientas reutilizables a través de un proceso automatizado y la combina con un motor de datos sintéticos, lo que genera más de 17 000 tareas de uso de computadora verificables para capacitación y evaluación. La capacitación sigue una receta de dos etapas: ajuste fino supervisado en trayectorias híbridas exitosas y luego aprendizaje de refuerzo en línea en tareas verificables, que optimiza cuándo llamar a las herramientas versus actuar en la GUI. En OSWorld, UltraCUA informa una mejora relativa promedio del 22 por ciento con respecto a los modelos base y un 11 por ciento menos de pasos, lo que indica ganancias en confiabilidad y eficiencia. El modelo 7B alcanza un 21,7 por ciento de éxito en WindowsAgentArena sin formación específica de Windows, lo que muestra una generalización multiplataforma de la política de acción híbrida.
UltraCUA traslada los agentes de uso de computadoras de cadenas de acción primitivas y frágiles a una política de acción híbrida, integrando primitivas de GUI con llamadas a herramientas programáticas, lo que reduce la propagación de errores y el conteo de pasos. Escala las herramientas a través de un proceso automatizado y las combina con un motor de datos sintéticos que genera más de 17 000 tareas verificables, lo que permite un ajuste fino supervisado y un aprendizaje de refuerzo en línea sobre señales basadas en tierra. Los resultados informados incluyen una mejora relativa del 22 por ciento en OSWorld con un 11 por ciento menos de pasos y un 21,7 por ciento de éxito en WindowsAgentArena sin capacitación específica de Windows, lo que indica una transferencia de la política entre plataformas.
Consulte el documento aquí. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.
🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.