Los investigadores de AI2 están cambiando el juego de evaluación comparativa al introducir la evaluación comparativa de fluidos que mejora la evaluación a lo largo de varias dimensiones

Un equipo de investigadores del Instituto Allen de Inteligencia Artificial (AI2), la Universidad de Washington y CMU introduce la evaluación comparativa de fluidos, un método adaptativo de evaluación LLM que reemplaza la precisión estática con IRT de 2 parámetros Estimación de habilidad y Impulsado por la información pesquera selección de artículos. Al hacer solo las preguntas más informativas para la capacidad actual de un modelo, produce curvas de capacitación más suaves, retrasa la saturación de referencia, mejora la validez externa en presupuestos pequeños y filtra elementos mal etiquetados.

La evaluación comparativa de fluidos reemplaza la precisión estática con un procedimiento adaptativo a tierra psicometría. Un modelo de IRT logístico de dos parámetros mapea las respuestas a un latente capacidad puntaje y selecciona cada elemento siguiente por Maximizar la información de Fisher en la estimación de habilidad actual del modelo. En seis puntos de referencia populares y múltiples puntos de control de modelos, mejora validez (distancia de rango más pequeña), reduce la varianza (Variación total normal normalizada más baja), retrasos de saturación (más curvas de entrenamiento monotónico), y Evita artículos mal etiquetados por ~ 100 × en comparación con el muestreo aleatorio con igual presupuesto.

¿Qué problema resuelve la evaluación comparativa de fluidos?

Los subconjuntos estáticos y la precisión simple combinan la calidad del elemento y la dificultad del elemento, inflan la varianza paso a paso y la saturación de referencia temprana (las curvas de entrenamiento se aplanan mientras el modelo aún mejora). Reframas de evaluación comparativa de fluidos ambos agregación y selección: anotar en un espacio de habilidad latente y adaptar el subconjunto de elementos a la capacidad actual, en lugar de tratar todos los elementos por igual o arreglarlos a priori.

¿Cómo funciona?

1) habilidad, no precisión

Encajar Logística de 2 parámetros (2PL) Modelo IRT sobre respuestas históricas de LM: para ítems j Con la discriminación AJ y la dificultad BJ, la probabilidad de un modelo con capacidad θi Respuestas correctamente es

p (uij = 1) = logistic (aj (θi −bj))

En la evaluación, estime el MAPA habilidad θ^i para el candidato LM maximizando la probabilidad 2PL sobre sus respuestas correctas/incorrectas observadas en los ítems administrados. Los artículos están ponderados por su discriminación y dificultad, a diferencia de la precisión que pesa todo por igual

2) Selección de elementos dinámicos a través de la información de Fisher

En cada paso Tseleccione el siguiente elemento QJ que Maximiza la información de Fisher en la estimación de la capacidad actual θ^

I (θi, aj, bj) = aj2 logistic (aj (θi −bj)) (1 -logistic (aj (θi −bj))))

Los elementos de alta información minimizan la varianza de la estimación de habilidad. A medida que avanza la capacitación, los artículos más informativos cambiar de fácil a duroentonces el subconjunto administrado evoluciona con la capacidad del modelo.

¿Qué significa “mejor evaluación” aquí?

El fluido evalúa cuatro dimensiones con métricas concretas:

  • Validez: Acuerdo externo con clasificación de modelo “verdadero”; medido por distancia media de rango (más bajo es mejor).
  • Diferencia: Variación total normalizada de la curva de entrenamiento a través de los puntos de control (más bajo es mejor).
  • Saturación: monotonicidad (Correlación de rango de Spearman entre el índice de punto de control y el rendimiento previsto; más alto es mejor).
  • Eficiencia: calidad en Presupuestos de artículos pequeños.

¿Qué tan fuertes son los resultados?

En seis puntos de referencia (por ejemplo, ARC-C, GSM8K, HELLASWAG, MMLU, LIERDFORQA, WINOGRANDE) y SEIS LMS con 61–94 puntos de control cada uno:

  • Validez: En el subconjunto más pequeño (AP-10), la distancia de rango media cae de 20.0 → 10.1; en AP-50, 15.2 → 8.8.
  • Diferencia: Variación total se encoge notablemente; p.ej, 28.3 → 10.7 (AP-10) y 19.1 → 6.5 (AP-50).
  • Saturación: La monotonicidad mejora de 0.48 → 0.76 (AP-10) y 0.62 → 0.86 (AP-50).
  • Eficiencia de un presupuesto pequeño: Con 10 artículosEl fluido mejora la distancia de rango medio por 9.9 vs. aleatorio; en 500 artículosla mejora es 0.8—Consistente con rendimientos decrecientes a medida que crece el presupuesto.

En las carreras previas, el espacio de precisión a menudo parece plano hasta tarde en el entrenamiento, pero El espacio de habilidad continúa aumentandoretrasando la saturación aparente (por ejemplo, monotonicidad Helaswag 0.91 → 0.99 para aleatorio versus fluido).

Fluido también Evita artículos mal etiquetados: En MMLU-Redux con presupuestos de 100 ítems, artículos mal etiquetados por sesión de sesión desde 0.75 (aleatorio) a 0.01 (Fluido): aproximadamente dos órdenes de magnitud menos.

Aislar las ablaciones de donde provienen las ganancias: La agregación IRT aumenta validezpero solo selección dinámica bajan diferencia; “ARD al azar” puede incluso superar la varianza del azar en grandes presupuestos, lo que subraya la selección como la palanca clave.

¿Se detiene temprano cuando confía?

Sí. Soporte de fluido parada dinámica usando el error estándar de la estimación de la habilidad; Terminar cuando SE cae por debajo de la brecha de habilidad promedio entre LMS adyacente de rango en la tabla de clasificación Open LLM. En la práctica, los elementos requeridos varían ampliamente sobre el entrenamiento (≈20 temprano,> 80 a mitad de carrera), mostrando por qué Los presupuestos fijos son subóptimos.

¿Dónde encaja en la pila de evaluación?

El fluido es refinamiento: No inventa nuevas tareas; él re-pescados y reordres Elementos existentes para maximizar la información contra una métrica de habilidad latente. Generaliza más allá del pretratamiento a la capacitación posterior y a otras modalidades, suponiendo suficientes respuestas para adaptarse/actualizar un modelo IRT. A medida que mejoran los modelos, Los parámetros de IRT deben actualizarse Para resolver la dificultad entre los elementos que anteriormente eran “demasiado difíciles”, de lo contrario, la parte superior de la escala se comprime.

Resumen

La evaluación comparativa de fluidos hace que la evaluación de LLM sea eficiente y estable con calificación modelos en el espacio de habilidades y seleccionando elementos mediante información de Fisher, produciendo una varianza más baja, una mejor validez de rango y una saturación retrasada con muchas menos preguntas. Las compensaciones están operativas: mantenga nuevas matrices de respuesta, reenvíen periódicamente los parámetros IRT y garantice una binarización confiable correcta/incorrecta para las tareas abiertas. A medida que estas prácticas se estandarizan, el fluido se convierte en un valor predeterminado práctico para las evals de pretrenesa y post-entrenamiento en el circuito en los puntos de referencia en evolución.


Mira el Papel, Página de Github y Detalle técnico. No dude en ver nuestro Página de Github para tutoriales, códigos y cuadernos. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.

[Recommended Read] 🧵 NVIDIA AI Open-Sources Vipe (motor de pose de video): una herramienta de anotación de video 3D potente y versátil para AI espacial


Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias en Ciencias de Datos de la Universidad de Padova. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca por transformar conjuntos de datos complejos en ideas procesables.