Meta FAIR presenta los modelos de preferencia de investigación (RPM) de IA: clasificación de experimentos de aprendizaje automático antes de gastar horas de GPU

Los agentes de investigación de IA ya pueden proponer, implementar y calificar sus propios experimentos de aprendizaje automático. La generación de ideas es barata; la verificación no lo es. La capacitación de un candidato puede consumir de horas a días de tiempo de GPU, por lo que un agente propone muchos más candidatos de los que puede permitirse ejecutar. Cuáles se ejecutan es la verdadera palanca para el progreso de la investigación.

Un equipo de investigación de FAIR en Meta, la Universidad de Oxford y el University College London formaliza esa palanca como preferencia de investigación e introduce modelos de preferencia de investigación (RPM) de IA. Un RPM clasifica a los candidatos no ejecutados y elige uno para ejecutar. Nunca pronostica una puntuación absoluta; el equipo encontró que los modelos de lenguaje no eran confiables para predecir métricas o resultados de ejecución.

¿Es desplegable? Parcialmente. Los RPM utilizan LLM congelados previamente entrenados sin ajustes finos, el andamio AIRA-dojo y el punto de referencia AIRS-Bench son de código abierto y la columna vertebral Qwen3.6-27B son pesos abiertos.

Dónde se ubica el RPM en el bucle del agente

AIRA-dojo es una búsqueda de árbol evolutivo: selección de padres codiciosos, operadores de borrador/mejora/depuración, nodo de puntuación de validación más alta devuelto al final. El RPM interviene únicamente en la creación infantil. En lugar de generar un hijo y ejecutarlo, el agente aplica el operador 15 veces en paralelo para generar 15 candidatos no ejecutados y luego los compara por pares en un torneo eliminatorio. Sólo se ejecuta al ganador. Cada comparación se basa en nodos de contexto recopilados mediante un recorrido BFS del árbol explorado, cada uno de los cuales se muestra con la puntuación de validación que obtuvo.