Un equipo de investigadores de UC Berkeley ha lanzado CUA-Lite, una plataforma abierta para agentes de uso informático (CUA). El argumento detrás de esto es infraestructural más que centrado en el modelo: entrenar y comparar una CUA requiere cuatro piezas: agentes, entornos, rastreos y un marco para evaluarlos y entrenarlos, y los cuatro están actualmente fragmentados en repositorios separados con interfaces incompatibles. CUA-Lite los coloca detrás de un espacio de acción, un esquema de datos y un comando, en computadoras de escritorio, navegadores y dispositivos móviles.
¿Es desplegable? Sí. La pila se instala con uv sync –all-extras en Python 3.12, y sus espacios aislados livianos se ejecutan en cualquier host Docker sin /dev/kvm, por lo que las instancias en la nube, los ejecutores de CI y los contenedores anidados funcionan.
El impuesto a las máquinas virtuales y cómo Lite.OSWorld lo elimina
La contribución más concreta es Lite.OSWorld. OSWorld proporciona un escritorio Ubuntu fiel, pero se envía como una máquina virtual QEMU/KVM completa por tarea, lo que requiere una virtualización anidada que la mayoría de las infraestructuras administradas no exponen. CUA-Lite reproduce el mismo conjunto de tareas y los mismos evaluadores en un escritorio GNOME dentro de un contenedor Docker simple.
La fidelidad es la preocupación obvia cuando se cambia una máquina virtual por un contenedor, y el equipo la aborda directamente: en 13 modelos, las puntuaciones de Lite.OSWorld coinciden con las de las máquinas virtuales de OSWorld, por lo que una puntuación o una señal de entrenamiento obtenida en el contenedor se transfiere de nuevo al punto de referencia real. La misma base ahora incluye una familia de sandboxes: Lite.ScaleCUA, Lite.CUAGym y Lite.CUAWorld, el último expandiéndose a aproximadamente 40 aplicaciones, incluidas Blender, QGIS y VS Code. En total, la plataforma afirma tener más de 30.000 tareas verificables.
Un esquema para datos, un adaptador por modelo
La segunda capa de CUA-Lite es LiteSample, un único esquema de aprendizaje supervisado compartido en todos los entornos, agentes y tipos de tareas, que se envía como simple parquet plus imágenes. Se han preprocesado y publicado de forma gratuita en Hugging Face más de diez conjuntos de datos CUA existentes, incluidos Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey y Multimodal-Mind2Web. Junto a esos corpus se encuentran nuevos conjuntos de datos de implementación generados al hacer pasar un modelo de maestro de vanguardia a través de las zonas de pruebas, para su destilación en estudiantes más pequeños.
Debido a que las familias de modelos esperan andamiajes diferentes, el marco incluye un adaptador por modelo que incluye un LiteSample unificado en el formato de entrenamiento propio de cada modelo, incluido el colapso del historial para que varios pasos compartan un paso hacia adelante.
Eval, SFT y RL detrás de un comando
Los agentes y los entornos se encuentran en lite.gym: capturas de pantalla arriba, acciones abajo, con un espacio de acción por plataforma. Más de 10 agentes están integrados en GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI y otros, y más de 15 puntos de referencia integrados, que abarcan conexión a tierra (ScreenSpot-Pro, OSWorld-G), escritorio (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), navegador (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) y móviles (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Intercambiar –model-id y –env-id en scripts/rollout.py es toda la interfaz.
El mismo bucle sirve para entrenar. Para SFT, el archivo README documenta el ajuste fino de Qwen3-VL-2B-Instruct en las trayectorias de escritorio Lite.ScaleCUA, elevando el retorno medio del episodio de 0,138 a 0,237 en la división de evaluación lite.osworld de 332 tareas, una única configuración informada en dos GPU, no un resultado reproducido de forma independiente. Para RL, los lanzamientos puntuados en el entorno impulsan las actualizaciones de GRPO además de Slime, con un ejemplo trabajado de MobileGym que cubre 416 tareas móviles en 28 aplicaciones.
Explicador interactivo
Conclusiones clave
CUA-Lite unifica agentes, entornos, seguimientos y capacitación bajo un espacio de acción y un esquema LiteSample. Lite.OSWorld ejecuta tareas de OSWorld sin VM en Docker a 0,9 GB frente a 4,1 GB, aproximadamente 4,6 veces más escritorios paralelos. Las puntuaciones en el contenedor coinciden con las de OSWorld VM en 13 modelos, por lo que la señal de entrenamiento se transfiere al punto de referencia real. Más de 30.000 tareas verificables, más de 15 puntos de referencia, más de 10 agentes y más de 20 conjuntos de datos publicados de forma gratuita en Hugging Face. Se puede implementar en cualquier host Docker, pero el repositorio aún no incluye una licencia explícita: verifique los términos antes de su uso comercial.
Consulte la página del proyecto, el repositorio de GitHub y los conjuntos de datos en Hugging Face. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.