Desde pesas iguales hasta pesos inteligentes: el enfoque de OTPO para una mejor alineación de LLM

Contexto

Han evolucionado de herramientas de búsqueda básicas a asistentes de IA que codifican, escriben e investigan. Ahora están accesibles a través de aplicaciones de teléfonos inteligentes a través de API de Internet, lo que pone una poderosa IA a la mano de todos. Estos sistemas se están convirtiendo en una parte integral de nuestra vida diaria. Las personas utilizan asistentes de IA para buscar consejos para las relaciones personales, verificación de hechos para formar opiniones (aunque establece claramente que puede cometer errores), planes de dieta y próximos destinos de vacaciones.

A medida que se lanzan modelos más y más poderosos, surge la cuestión de la confianza y los modelos se analizan más para asegurarse de que las respuestas producidas por ellos sean confiables y alineadas con los valores humanos. Estas no son preguntas nuevas. Tradicionalmente, los modelos están ajustados en los datos de preferencia humana (generalmente contiene información, respuesta elegida, respuesta rechazada) antes de lanzarlos para uso público. La alineación y la seguridad del modelo han sido áreas principales de investigación, y se han desarrollado múltiples algoritmos para capacitar al modelo de alineación. Entre todos los algoritmos de entrenamiento de alineación, el más popular es la optimización de preferencia directa (DPO) debido a su simplicidad y eficiencia.

Pero DPO tiene una limitación fundamental. Al calcular la probabilidad de una respuesta, utiliza el mismo peso para cada palabra o token presente en la respuesta, aunque los humanos naturalmente dan más importancia o peso a palabras significativas. Por ejemplo, veamos la siguiente interacción del usuario con LLM.

Usuario: ¿Cuál es la capital de Francia?
LLM: La capital de Francia es París, y es una ciudad hermosa con muchas atracciones.

En esta interacción, a los humanos se preocupan principalmente por la precisión de “París” en lugar de los florecimientos estilísticos, sin embargo, el DPO estándar da el mismo peso a cada token, lo que permite que menos contenido relevante diluya la señal de aprendizaje.

Ha habido múltiples intentos de solucionar los problemas de DPO. Se introdujeron algoritmos como Simpo y Sampo para abordar diferentes problemas. En esta publicación, veremos otro algoritmo publicado en mayo de 2025 en “Opino TEsquema de ponderación de token basado en Ransport para mejorar PAGreferencia Optimización (OTPO). ” Esta publicación explica las ideas centrales detrás de su trabajo y construye una base para comprender la alineación de LLM con las preferencias humanas.

Por qué falla la ponderación de token igual

Para comprender por qué es importante la ponderación de la ficha, primero debemos examinar cómo DPO realmente procesa los tokens. Por lo general, los modelos previamente capacitados se entrenan con billones de parámetros, luego se ajustan y luego se entrenan aún más utilizando DPO en datos de preferencias humanas para alinearse con las preferencias humanas antes de ser liberados al público.
DPO opera calculando las diferencias de probabilidad del registro entre las respuestas elegidas y rechazadas a nivel de token. Para cada ejemplo de entrenamiento con una respuesta elegida Y_W y la respuesta rechazada Y_L, DPO calcula su valor objetivo. El núcleo de DPO se encuentra en su fórmula de función de pérdida:

Imagen de Papel dpo

PI_THETA (πθ) es el modelo que se optimizará, Pi_reference (π_ref) es un modelo de referencia, y π ∗ (y | x) denota la probabilidad de respuesta y dada la entrada del usuario x.

π ∗ (y | x) se descompone en cálculos de nivel de token. Para una respuesta elegida con tokens [t₁, t₂, ..., tₙ]la probabilidad de registro se convierte en:

log π ∗ (y | x) = σᵢ log π (tᵢ | x, t₁ … tᵢ₋₁)

Cada token contribuye con su probabilidad de registro individual a la probabilidad de secuencia general, y no existe un mecanismo para soportar el contenido importante más que el relleno. Veamos un ejemplo de datos de preferencia.

Aporte: ¿Cuál es la capital de Francia?
Preferido: La capital de Francia es París.
Rechazado: La capital de Francia es Italia, que en realidad es incorrecta.

DPO calcula las probabilidades de registro para cada token por igual.
Chosen: log P("The") + log P("capital") + log P("of") + log P("France") + log P("is") + log P("Paris") + log P(".")

Rejected: log P("The") + log P("capital") + ... + log P("Italy") + ... + log P("incorrect") + log P(".")

La diferencia de hecho crítica se encuentra en “París” frente a “Italia”, pero DPO da el mismo peso a los artículos, preposiciones y las fichas fácticamente cruciales. Este tratamiento de token uniforme crea un desajuste entre lo que se centra la optimización y lo que a los humanos realmente les importa.

El modelo recibe una señal de aprendizaje igual de tokens semánticamente cruciales (“París”) e intrascendentes (“que”, “en realidad”). Esto conduce a la trampa de verbosidad, las secuencias más largas acumulan más masa de probabilidad logarítmica a través del recuento de tokenses, por lo que DPO puede recompensar inadvertidamente la verbosidad sobre la calidad.

Cuando las tokens semánticamente cruciales se promedian con las estilísticas, las señales de aprendizaje se vuelven poco confiables, lo que lleva a un aprendizaje de preferencias subóptimas. Estos problemas se pueden resolver si tenemos una mejor manera de dar más peso a los tokens relevantes al calcular la probabilidad de la respuesta. Eso es exactamente lo que hace Otpo.

Ponderación de token óptimo basado en el transporte (OTPO)

Ahora que entendemos el problema de ponderación del token de DPO, veamos cómo OTPO lo resuelve utilizando la teoría de transporte óptima. OTPO ve la optimización de preferencias como un problema de transporte, ¿cuánto esfuerzo se necesita para transformar una respuesta en otra?

La idea clave es ¿cuál es el esfuerzo mínimo necesario para cambiar “la capital de Francia es París” en “la capital de Francia es Italia”? La mayoría de los tokens siguen siendo los mismos, pero “París” → “Italia” requiere una transformación semántica significativa ya que son conceptos completamente diferentes.

OTPO formula esto como un problema de transporte óptimo donde las fuentes son tokens en la respuesta elegida, los objetivos son tokens en la respuesta rechazada y los costos de transporte reflejan la similitud semántica entre los pares de tokens. Los tokens semánticamente similares (como “París” y “Londres”) tienen bajos costos de transporte, mientras que las fichas distantes (como “París” y “Apple”) tienen altos costos.

El algoritmo calcula una solución de transporte óptima que nos dice cómo mover la masa de probabilidad entre las respuestas con un costo total mínimo. Los pares de tokens que participan en gran medida en este transporte, especialmente aquellos que requieren transformaciones semánticas costosas, reciben pesos más altos en el cálculo de pérdidas finales. Esto significa que OTPO enfoca automáticamente el aprendizaje en los tokens que más importan para las preferencias humanas, resolviendo el problema de igual ponderación de DPO.

Matemáticas detrás de Otpo

Ahora vamos a sumergirnos en la base matemática de OTPO. El algoritmo tiene tres componentes principales, construyendo una matriz de costos, resolver el problema de transporte óptimo y calcular las pérdidas de token ponderadas.

Paso 1: Costo Matrix Construction

OTPO comienza construyendo una matriz de costos que mide la distancia semántica entre cada par de tokens. Para la token i-th en la respuesta elegida (w) y j-th token en la respuesta rechazada (l) el costo es

METRO[i][j] = (H[w][i]- H[l][j] ) ²

Donde h[w][i] y H[l][j] son las representaciones ocultas de la última capa de tokens del modelo. Esta distancia euclidiana captura la similitud semántica. Tokens similares como “París” y “Londres” tienen un bajo costo, mientras que las fichas distantes como “París” y “Apple” tienen un alto costo.

Paso 2: Problema de transporte óptimo

OTPO formula la ponderación del token como una optimización óptima de transporte desequilibrada:

Imagen de Papel otpo

Aquí γ es el plan de transporte (lo que estamos resolviendo) que alinea los tokens entre las respuestas elegidas y rechazadas. Ω Controla la regularización de la entropía. Los términos de KL aseguran que las distribuciones marginales de γ estén cerca de los pesos uniformes ingenuos de DPO. La solución γ* nos dice cómo transportar de manera óptima la masa de probabilidad entre los tokens elegidos y rechazados.

Paso 3: COMPUTAR PESOS DE TOKEN

De la solución de transporte óptima, obtenemos pesos a nivel de token sumando a lo largo de las dimensiones:

Imagen de Papel otpo

Aquí, γ (I, J) representa el peso asignado a cada par de tokens (I, J) de la respuesta elegida (W) y rechazada (R). Finalmente, estos pesos se aplican en el DPO para reemplazar la ponderación uniforme. Diferencia de recompensa con el esquema de ponderación.

Imagen de Papel otpo

Resultados y limitaciones del experimento

OTPO se probó en una variedad de tareas pero en un entorno controlado. Cuando se aplicó a las tareas de resumen, mostró una mejora de aproximadamente el 8,5% sobre otros métodos. Cuando se probó para los sesgos de longitud en el conjunto de datos de ultragrafía con modelos más pequeños como LLAMA-3–8B, OTPO estaba produciendo respuestas más cortas. Estas pruebas iniciales proporcionan evidencia de que OTPO ayuda a reducir la verbosidad y mejorar la calidad de las respuestas que tienen más probabilidades de ser elegidos por los humanos.

La prueba no fue lo suficientemente exhaustiva como para presentar el número de precisión en todo el dominio. Hubo resultados mixtos en diferentes conjuntos de datos. OTPO requiere un costoso cálculo de la métrica de costos y el plan de transporte. Además, el LLM como juez se utilizó para calcular la calidad de la respuesta, que fue escaneada manualmente por algunas personas. Estos métodos son buenos solo pero dependen totalmente de los revisores que podrían estar fácilmente sesgados hacia ciertos conjuntos de datos.

Conclusión

La alineación de LLM ha sido un tema importante de investigación, y OTPO ofrece resultados prometedores en un entorno controlado. Si bien este enfoque no es perfecto, la introducción de la selección de tokens ponderada establece las bases para un modelado de preferencias de grano más fino en las tareas de alineación.

Referencias:

  1. Optimización de políticas directas (DPO). https://arxiv.org/pdf/2305.18290
  2. Esquema de ponderación de token basado en el transporte óptimo. https://arxiv.org/pdf/2505.18720
  3. Eliminar la dependencia de la longitud sesgada de la optimización de preferencia directa (SAMPO). https://arxiv.org/pdf/2406.10957