Google AI lanza Android Bench: un marco de evaluación y una tabla de clasificación para LLM en desarrollo de Android

Google ha lanzado oficialmente Android Bench, una nueva tabla de clasificación y marco de evaluación diseñado para medir el rendimiento de los modelos de lenguajes grandes (LLM) específicamente en tareas de desarrollo de Android. El conjunto de datos, la metodología y el conjunto de pruebas se han hecho de código abierto y están disponibles públicamente en GitHub.

Metodología de referencia y diseño de tareas

Los puntos de referencia de codificación generales a menudo no logran capturar las dependencias y matices específicos de la plataforma del desarrollo móvil. Android Bench aborda esto seleccionando un conjunto de tareas provenientes directamente de repositorios públicos de GitHub de Android del mundo real.

Los escenarios evaluados cubren distintos niveles de dificultad, que incluyen:

Resolver cambios importantes en las versiones de Android. Tareas específicas de dominio, como redes en dispositivos Wear OS. Migración de código a la última versión de Jetpack Compose (el moderno conjunto de herramientas de Android para crear interfaces de usuario nativas).

Para garantizar una evaluación independiente del modelo, el marco solicita a un LLM que solucione un problema informado y luego verifica la solución utilizando prácticas de prueba estándar para desarrolladores:

Pruebas unitarias: pruebas que verifican bloques de código pequeños y aislados (como una única función o clase) sin necesidad del marco de Android. Pruebas de instrumentación: pruebas que se ejecutan en un dispositivo o emulador físico de Android para verificar cómo interactúa el código con el sistema Android y las API reales.

Mitigar la contaminación de datos

Un desafío importante para los desarrolladores que evalúan los puntos de referencia públicos es la contaminación de los datos. Esto ocurre cuando un LLM está expuesto a las tareas de evaluación durante su proceso de capacitación, lo que hace que el modelo memorice las respuestas en lugar de demostrar capacidades genuinas de razonamiento y resolución de problemas.

Para garantizar la integridad de los resultados de Android Bench, el equipo de Google implementó varias medidas preventivas:

Revisión manual de las trayectorias de los agentes: los desarrolladores revisan el razonamiento paso a paso y las rutas de acción que sigue el modelo para llegar a una solución, asegurándose de que esté resolviendo el problema de forma activa. Integración de cadenas canarias: una cadena de texto única e identificable está incrustada en el conjunto de datos de referencia. Esto actúa como una señal para los rastreadores web y los raspadores de datos utilizados por las empresas de inteligencia artificial para excluir explícitamente estos datos de futuras ejecuciones de entrenamiento de modelos.

Resultados iniciales de la tabla de clasificación de Android Bench

Para la versión inicial, el punto de referencia mide estrictamente el rendimiento del modelo base, omitiendo intencionalmente flujos de trabajo agentes complejos o el uso de herramientas.

La puntuación representa el porcentaje promedio de 100 casos de prueba resueltos con éxito en 10 ejecuciones independientes para cada modelo. Debido a que los resultados de LLM pueden variar entre ejecuciones, los resultados incluyen un intervalo de confianza (IC) con un valor p <0,05. El CI proporciona el rango de rendimiento esperado, lo que indica la confiabilidad estadística de la puntuación del modelo.

En esta primera versión, los modelos completaron con éxito entre el 16% y el 72% de las tareas.

ModeloPuntuación (%)Rango CI (%)FechaGemini 3.1 Pro Vista previa72.465.3 — 79.82026-03-04Claude Opus 4.666.658.9 — 73.92026-03-04GPT-5.2-Codex62.554.7 — 70.32026-03-04Claude Opus 4.561.953.9 — 69.62026-03-04Gemini 3 Pro Preview60.452.6 — 67.82026-03-04Claude Sonnet 4.658.451.1 — 66.62026-03-04Claude Sonnet 4.554.245.5 — 62.42026-03-04Vista previa de Flash Gemini 342.036.3 — 47.92026-03-04Flash Gemini 2.516.110.9 — 21.92026-03-04

Nota: Puede probar todos los modelos evaluados para sus propios proyectos de Android utilizando claves API en la última versión estable de Android Studio.

Conclusiones clave

Enfoque especializado sobre los puntos de referencia generales: Android Bench aborda las deficiencias de los puntos de referencia de codificación genéricos midiendo específicamente qué tan bien los LLM manejan las complejidades, API y dependencias únicas del ecosistema de Android. Basado en escenarios del mundo real: en lugar de pruebas algorítmicas aisladas, el punto de referencia evalúa modelos comparándolos con desafíos reales extraídos de repositorios públicos de GitHub. Las tareas incluyen resolver cambios importantes en la API, migrar el código de la interfaz de usuario heredado a Jetpack Compose y manejar redes específicas del dispositivo (por ejemplo, en Wear OS). Pruebas verificables e independientes del modelo: la generación de código se evalúa en función de la funcionalidad, no de la metodología. El marco verifica automáticamente las correcciones propuestas por el LLM utilizando prácticas de ingeniería estándar de Android: pruebas unitarias aisladas y pruebas de instrumentación basadas en emuladores. Medidas estrictas contra la contaminación: para garantizar que los modelos realmente razonen en lugar de regurgitar datos de entrenamiento memorizados, el punto de referencia emplea revisiones manuales de las rutas de razonamiento de los agentes y utiliza “cadenas canarias” para evitar que los rastreadores web de IA ingieran el conjunto de datos de prueba. Rendimiento de referencia establecido: la primera versión de la tabla de clasificación se centra exclusivamente en el rendimiento del modelo base sin herramientas agentes externas. Gemini 3.1 Pro Preview actualmente lidera con una tasa de éxito del 72,4 %, lo que destaca una amplia variación en las capacidades LLM actuales (que oscilan entre el 16,1 % y el 72,4 % en los modelos probados).

Consulte el repositorio y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.