Ajuste de refuerzo en Amazon Bedrock: mejores prácticas

Puede utilizar el ajuste fino de refuerzo (RFT) en Amazon Bedrock para personalizar Amazon Nova y los modelos de código abierto compatibles definiendo cómo se ve "bueno", sin necesidad de grandes conjuntos de datos etiquetados. Al aprender de señales de recompensa en lugar de ejemplos estáticos, RFT ofrece ganancias de precisión de hasta un 66 % sobre los modelos base con un costo y complejidad de personalización reducidos. Esta publicación cubre las mejores prácticas para RFT en Amazon Bedrock, desde el diseño de conjuntos de datos, la estrategia de función de recompensa y el ajuste de hiperparámetros para casos de uso como generación de código, extracción estructurada y moderación de contenido.

En esta publicación, exploramos dónde RFT es más efectivo, utilizando el conjunto de datos de razonamiento matemático GSM8K como ejemplo concreto. Luego, analizamos las mejores prácticas para la preparación de conjuntos de datos y el diseño de funciones de recompensa, mostramos cómo monitorear el progreso del entrenamiento utilizando métricas de Amazon Bedrock y concluimos con pautas prácticas de ajuste de hiperparámetros informadas por experimentos en múltiples modelos y casos de uso.

Casos de uso de RFT: ¿Dónde puede brillar RFT?

El ajuste fino de refuerzo (RFT) es una técnica de personalización de modelos que mejora el comportamiento del modelo básico (FM) mediante señales de recompensa. En comparación con el ajuste fino supervisado (SFT), no entrena directamente las respuestas correctas (pares de E/S etiquetados). En cambio, RFT utiliza un conjunto de datos de entradas y una función de recompensa. La función de recompensa puede estar basada en reglas u otro modelo de calificador capacitado, o un modelo de lenguaje grande (LLM) como juez. Durante el entrenamiento, el modelo genera respuestas de los candidatos y la función de recompensa califica cada respuesta. Según la recompensa, las ponderaciones del modelo se actualizan para aumentar la probabilidad de generar respuestas que reciban una recompensa alta. Este ciclo iterativo de respuestas de muestra, respuestas de puntuación y ponderaciones de actualización dirige el modelo para aprender qué comportamientos conducen a mejores resultados. RFT es particularmente valioso cuando el comportamiento deseado puede evaluarse, pero es difícil de demostrar, ya sea porque no es práctico seleccionar datos etiquetados o porque los ejemplos estáticos por sí solos no pueden capturar el razonamiento que exige una tarea. Destaca en dos áreas principales:

Tareas en las que una regla o prueba puede verificar la corrección automáticamente Tareas subjetivas en las que otro modelo puede evaluar eficazmente la calidad de la respuesta

Las tareas de la primera categoría son generación de código que debe pasar pruebas, razonamiento matemático con respuestas verificables, extracción de datos estructurados que deben coincidir con esquemas estrictos o llamadas a API/herramientas que deben analizarse y ejecutarse correctamente. Debido a que los criterios de éxito pueden traducirse directamente en señales de recompensa, el modelo puede descubrir estrategias más sólidas que las que podría enseñar un pequeño conjunto de ejemplos etiquetados. Este patrón se conoce como Aprendizaje por refuerzo con recompensas verificables (RLVR).

Además, RFT se adapta a tareas subjetivas como moderación de contenido, chatbots, escritura creativa o resúmenes que carecen de una corrección fácilmente cuantificable. Un modelo de juez, guiado por una rúbrica de evaluación detallada, puede servir como función de recompensa. Califica los resultados según criterios que no serían prácticos de codificar como pares de entrenamiento estáticos. Este enfoque se conoce como aprendizaje por refuerzo con retroalimentación de IA (RLAIF).

Para RFT en Amazon Bedrock, puede implementar enfoques basados ​​en reglas y modelos como una función AWS Lambda personalizada, que es la función de recompensa que Amazon Bedrock llama durante el ciclo de entrenamiento.

En el siguiente diagrama se muestra una comparación de estos dos enfoques:

Los siguientes son algunos casos de uso comunes que se pueden abordar mediante RLVR, RLAIF o una combinación de ambos.

Caso de uso Señal de recompensa Generación de código para servicios de producción Tasas de aprobación de pruebas unitarias, linting y verificaciones de tiempo de ejecución Orquestación de herramientas y API Finalización exitosa de tareas de un extremo a otro (como flujos de reserva, canales de recuperación de datos) Razonamiento algorítmico y matemático complejo Respuestas finales correctas y/o pasos de verificación intermedios Extracción y transformación de datos estructurados Validación de esquemas, coincidencias exactas, penalizaciones por resultados con formato incorrecto Síntesis SQL/consultas sobre bases de datos Resultados de consultas que coinciden con las respuestas esperadas o que satisfacen las propiedades de tiempo de ejecución Combinación de flujos de trabajo agentes de RLVR y RLAIF; RLVR para la corrección de llamadas de herramientas; RLAIF para la finalización de la tarea final, por ejemplo, medido como utilidad, corrección o solidez

GSM8K: Uso de RFT para mejorar las soluciones de cálculos matemáticos

Para ilustrar cómo funciona en la práctica el ajuste fino del refuerzo, podemos examinar un ejemplo concreto: mejorar la capacidad de un modelo para resolver problemas de razonamiento matemático. RFT es útil para problemas matemáticos porque las soluciones a menudo se pueden verificar objetivamente, lo que permite diseñar señales de recompensa claras que guían el modelo hacia un razonamiento correcto y resultados estructurados. Veamos un ejemplo del conjunto de datos GSM8K (Grade School Math 8K):

Tina gana $18,00 la hora. Si trabaja más de 8 horas por turno, tiene derecho a recibir horas extras, que se pagan con su salario por hora + la mitad de su salario por hora. Si trabaja 10 horas todos los días durante 5 días, ¿cuánto dinero gana?

Veamos cómo sería una respuesta ideal:

Necesito encontrar el salario total por 5 días de turnos de 10 horas. Como ella trabaja más de 8 horas diarias, tendré que dividir cada día en horas regulares y horas extra, calcular la tasa de horas extra (1,5 veces las regulares) y luego multiplicarla por 5 días. Tarifa de horas extras: $18,00 + (1/2 × $18,00) = $27,00/hora Ganancias diarias (10 horas): Regular (8 horas): 8 × $18 = $144 Horas extras (2 horas): 2 × $27 = $54 Total diario: $198 Total por 5 días: 5 × $198 = $990 boxed{990}

Aquí vemos que el problema se divide en pasos lógicos y muestra caminos de razonamiento claros, no sólo respuestas finales. Además, nos gustaría que el modelo respondiera en este formato específico y que la respuesta coincidiera exactamente con la solución real del terreno. Otros métodos de ajuste, como SFT, luchan con el razonamiento matemático porque aprenden principalmente a hacer coincidir patrones con datos de entrenamiento en lugar de razonar verdaderamente. Estos modelos pueden memorizar plantillas de soluciones, pero a menudo fallan cuando se les presentan variaciones novedosas de un problema.

Debido a que podemos usar RFT para definir funciones de recompensa, las respuestas exactas como la respuesta anterior de $990 se pueden evaluar objetivamente y al mismo tiempo asignar crédito parcial por los pasos de razonamiento intermedios correctos. Esto permite que el modelo descubra enfoques de solución válidos mientras aprende a seguir la estructura requerida y, en muchos casos, logra un rendimiento sólido con conjuntos de datos relativamente pequeños (alrededor de 100 a 1000 ejemplos).

Mejores prácticas para preparar su conjunto de datos

RFT requiere conjuntos de datos cuidadosamente preparados para lograr resultados efectivos. En Amazon Bedrock, los datos de entrenamiento RFT se proporcionan como un archivo JSONL, y cada registro sigue el formato de finalización del chat OpenAI.

Pautas para el tamaño del conjunto de datos

RFT admite conjuntos de datos de entre 100 y 10 000 muestras de entrenamiento, aunque los requisitos varían según la complejidad de la tarea y el diseño de la función de recompensa. Las tareas que implican razonamiento complejo, dominios especializados o amplios ámbitos de aplicación generalmente se benefician de conjuntos de datos más grandes y una función de recompensa sofisticada. Para la experimentación inicial, comience con un pequeño conjunto de datos (100 a 200 ejemplos) para validar que sus indicaciones y función de recompensa produzcan señales de aprendizaje significativas y que el modelo base pueda lograr mejoras de recompensa mensurables. Tenga en cuenta que, para ciertos dominios, solo la personalización en conjuntos de datos pequeños puede generar una generalización limitada y mostrar resultados inconsistentes en las variaciones de indicaciones. Las implementaciones típicas que utilizan entre 200 y 5000 ejemplos proporcionan una generalización más sólida y un rendimiento más consistente en las variaciones de indicaciones. Para tareas de razonamiento más complejas, dominios especializados o funciones de recompensa sofisticadas, entre 5.000 y 10.000 ejemplos pueden mejorar la solidez de diversas entradas.

Para obtener más información sobre los requisitos del conjunto de datos, consulte la documentación de Amazon Bedrock.

Principios de calidad del conjunto de datos

La calidad de los datos de tu entrenamiento determina fundamentalmente los resultados del RFT. Considere los siguientes principios al preparar su conjunto de datos:

1. Distribución inmediata
Asegúrese de que el conjunto de datos refleje la gama completa de indicaciones que encontrará el modelo en producción. Un conjunto de datos sesgado puede conducir a una generalización deficiente o a un comportamiento de entrenamiento inestable.

2. Capacidad del modelo base
RFT supone que el modelo base demuestra una comprensión básica de la tarea. Si el modelo no puede lograr una recompensa distinta de cero en sus indicaciones, la señal de aprendizaje será demasiado débil para un entrenamiento eficaz. Un paso de validación simple es generar varias respuestas a partir del modelo base (como temperatura ≈ 0,6) y confirmar que las salidas producen señales de recompensa significativas.

3. Diseño de aviso claro
Las indicaciones deben comunicar claramente las expectativas y limitaciones. Las instrucciones ambiguas conducen a señales de recompensa inconsistentes y a un aprendizaje degradado. La estructura de avisos también debe alinearse con el análisis de la función de recompensa. Por ejemplo, exigir respuestas finales después de un marcador específico o hacer cumplir bloques de código para tareas de programación, así como la estructura de indicaciones con la que el modelo base está familiarizado desde el entrenamiento previo.

4. Respuestas de referencia confiables
Cuando sea posible, incluya una respuesta de referencia que represente el patrón de salida deseado, el formato y los criterios de corrección. Las respuestas de referencia anclan el cálculo de la recompensa y reducen el ruido en la señal de aprendizaje. Por ejemplo, las tareas matemáticas pueden incluir una respuesta numérica correcta, mientras que las tareas de codificación pueden incluir pruebas unitarias o pares de entrada-salida.

También es una buena práctica validar las respuestas de referencia confirmando que una respuesta alineada con la verdad fundamental recibe la puntuación de recompensa máxima.

5. Señales de recompensa consistentes dentro de los datos.

Debido a que RFT se basa completamente en señales de recompensa para guiar el aprendizaje, la calidad de esas señales es fundamental. Su conjunto de datos y su función de recompensa deberían trabajar juntos para producir puntuaciones consistentes y bien diferenciadas. Esto significa que las respuestas fuertes obtienen puntuaciones más altas que las débiles en entradas similares. Si la función de recompensa no puede distinguir claramente entre respuestas buenas y malas, o si resultados similares reciben puntuaciones muy variables, el modelo podría aprender los patrones incorrectos o no lograr mejorar en absoluto.

En la siguiente sección aprenderá qué tener en cuenta al escribir su función de recompensa.

Preparando su función de recompensa

Las funciones de recompensa son fundamentales para RFT porque evalúan y califican las respuestas del modelo, asignando recompensas más altas a los resultados preferidos y recompensas más bajas a los menos deseables. Esta retroalimentación guía al modelo hacia un comportamiento mejorado durante el entrenamiento. Para tareas objetivas como el razonamiento matemático, una respuesta del candidato que produce la respuesta correcta puede recibir una recompensa de 1, mientras que una respuesta incorrecta recibe 0. Una respuesta con un rastreo de razonamiento parcialmente correcto y una respuesta final incorrecta puede obtener una recompensa de 0,8 (dependiendo de cuánto desee penalizar una respuesta final incorrecta). Para tareas subjetivas, la función de recompensa codifica las cualidades deseadas. Por ejemplo, en un resumen podría capturar fidelidad, cobertura y claridad. Para obtener más información sobre cómo configurar su función de recompensa, consulte configuración de funciones de recompensa para los modelos de Amazon Nova.

Diseño de recompensas por tareas verificables.

Para tareas que se pueden verificar de manera determinista, como el razonamiento matemático o la codificación, el enfoque más simple es verificar la corrección mediante programación. Las funciones de recompensa eficaces suelen evaluar tanto las restricciones de formato como los objetivos de rendimiento. Las comprobaciones de formato garantizan que las respuestas se puedan analizar y evaluar de forma fiable. Las métricas de rendimiento determinan si el resultado es correcto. Las recompensas se pueden implementar mediante señales binarias (correctas comparadas con incorrectas) o puntuación continua según la tarea.

Para tareas de razonamiento matemático estilo GSM8K, las funciones de recompensa también deben tener en cuenta cómo los modelos expresan respuestas numéricas. Los modelos pueden formatear números con comas, símbolos de moneda, porcentajes o incrustar respuestas dentro de texto explicativo. Para abordar esto, las respuestas deben normalizarse eliminando los caracteres de formato y aplicando una extracción flexible que priorice los formatos estructurados antes de recurrir a la coincidencia de patrones. Este enfoque garantiza que los modelos sean recompensados ​​por su razonamiento correcto en lugar de penalizados por sus elecciones de formato estilístico. Puede encontrar la implementación completa de la función de recompensa para GSM8K en el repositorio de GitHub de amazon-bedrock-samples.

Diseño de recompensas para tareas no verificables.

Tareas como resúmenes, escritura creativa o alineación semántica requieren un juez de LLM para aproximarse a las preferencias subjetivas. En este contexto, la indicación del juez actúa efectivamente como función de recompensa, definiendo qué comportamientos se recompensan y cómo se califican las respuestas. Un mensaje práctico para el juez debe definir claramente el objetivo de la evaluación e incluir una rúbrica de puntuación concisa con escalas numéricas que reflejen las cualidades en las que el modelo debe mejorar.

Las indicaciones de los jueces también deben devolver resultados estructurados, por ejemplo, JSON o formatos etiquetados que contengan la puntuación final y el razonamiento opcional, de modo que los valores de recompensa se puedan extraer de manera confiable durante el entrenamiento y al mismo tiempo mantener la observabilidad de cómo se evaluó cada respuesta. Se puede ver un ejemplo de una función de recompensa que utiliza comentarios de IA en este script de función de recompensa de PandaLM en GitHub.

Combinando recompensas verificables con comentarios de IA

Las funciones de recompensa por tareas verificables también se pueden aumentar con retroalimentación de IA para evaluar la calidad de la solución más allá de la corrección numérica. Por ejemplo, un LLM como juez puede evaluar la cadena de razonamiento, verificar cálculos intermedios o evaluar la claridad de las explicaciones, proporcionando una señal de recompensa que captura tanto la corrección como la calidad del razonamiento.

Iterando sobre el diseño de recompensas

Las funciones de recompensa a menudo requieren iteración. Las primeras versiones pueden producir señales ruidosas o, durante el ciclo de entrenamiento, el modelo puede aprender a explotar la función de recompensa para generar una recompensa alta sin aprender el comportamiento deseado. Es esencial perfeccionar la lógica de recompensa basada en el comportamiento de entrenamiento observado. Antes de lanzar trabajos de capacitación completos, también es una buena práctica probar las funciones de recompensa de forma independiente utilizando indicaciones de muestra y resultados conocidos para garantizar que la lógica de puntuación produzca señales de recompensa estables y significativas.

Evaluación del progreso del entrenamiento: señales de que el modelo está aprendiendo

Una vez que su conjunto de datos y su función de recompensa estén listos, puede iniciar la capacitación RFT utilizando la API de Amazon Bedrock o mediante la consola. El flujo de trabajo exacto depende de su entorno de desarrollo preferido. El tema Crear y administrar trabajos de ajuste fino para modelos de Amazon Nova en la Guía del usuario de Amazon Bedrock proporciona instrucciones paso a paso para ambos enfoques. Una vez que comienza la capacitación, es fundamental monitorear las métricas de capacitación. Estas señales indican si la función de recompensa es significativa y si el modelo está aprendiendo comportamientos útiles en lugar de sobreajustarse o colapsar en estrategias triviales. La siguiente imagen muestra las métricas de entrenamiento de una de nuestras sesiones de entrenamiento GSM8K que muestran una dinámica de entrenamiento saludable.

Las recompensas de entrenamiento trazan la puntuación promedio de recompensa en cada paso del entrenamiento. Se espera variación porque las indicaciones de entrada en un lote se muestrean aleatoriamente, por lo que la dificultad en los lotes difiere. Además, el modelo explora diferentes estrategias que conducen a la variación. Lo que importa es la tendencia general: las recompensas aumentan de aproximadamente 0,5 a alrededor de 0,8-0,9, lo que indica que el modelo está convergiendo para recibir recompensas más altas. Las recompensas de validación proporcionan una señal más clara porque se calculan en un conjunto de datos reservado. Aquí vemos una gran mejora durante los primeros ~40 pasos seguidos de una meseta alrededor de 0,88, lo que sugiere que el modelo está generalizando en lugar de memorizando ejemplos de entrenamiento. Las recompensas de validación que siguen de cerca las recompensas de entrenamiento suelen ser una señal de que no se está produciendo un sobreajuste.

La duración del episodio de entrenamiento mide la duración promedio de la respuesta. La caída de aproximadamente 625 tokens a ~400 tokens sugiere que el modelo está aprendiendo a alcanzar respuestas correctas de manera más eficiente, produciendo razonamientos menos redundantes a medida que avanza el entrenamiento. La entropía de políticas mide en qué medida el modelo explora diferentes estrategias de respuesta durante el entrenamiento. Los valores en el rango de 0,8 a 1,1 indican una exploración saludable. Si la entropía colapsara hacia cero, sugeriría que el modelo había convergido prematuramente, pero una entropía sostenida implica que el modelo aún está explorando y mejorando.

Directrices de ajuste de hiperparámetros

En esta sección, cubrimos pautas prácticas de ajuste de hiperparámetros para Amazon Bedrock RFT. Estas recomendaciones se basan en una serie de experimentos internos que realizamos en múltiples modelos y casos de uso. Esto incluye tareas de razonamiento como GSM8K y otras cargas de trabajo estructuradas y generativas. Si bien los valores efectivos variarán según la tarea, los patrones observados en estos experimentos proporcionan puntos de partida útiles al configurar trabajos RFT. Para obtener más información sobre los hiperparámetros que puede configurar antes de iniciar un trabajo de personalización RFT, consulte los documentos oficiales de boto3.

Recuento de época

La duración del entrenamiento y epochCount requieren ajustes según el tamaño del conjunto de datos y el comportamiento del modelo. Los conjuntos de datos más pequeños a menudo muestran una mejora continua durante 6 a 12 épocas, mientras que los conjuntos de datos más grandes pueden lograr un rendimiento óptimo en 3 a 6 épocas. Esta relación no es lineal y un seguimiento cuidadoso de las métricas de validación sigue siendo esencial para evitar el sobreajuste y al mismo tiempo garantizar una adaptación suficiente del modelo.

Tamaño de lote

Este parámetro controla cuántas solicitudes se procesan antes de que el modelo actualizado genere una nueva ronda de respuestas candidatas (implementos). Por ejemplo, con un tamaño de lote de 128, el modelo procesa, actualiza y genera nuevas implementaciones para 128 mensajes a la vez hasta que haya trabajado con todo el conjunto de datos. El número total de rondas de implementación es igual al tamaño del conjunto de datos (filtrado) dividido por el tamaño del lote.
Un tamaño de lote de 128 funciona bien para la mayoría de los casos de uso y modelos. Auméntelo si la pérdida es errática o la recompensa no mejora. Disminúyalo si las iteraciones toman demasiado tiempo.

Tasa de aprendizaje

En Amazon Bedrock RFT, realizamos RFT con parámetros eficientes utilizando adaptadores de adaptación de rango bajo (LoRA) con un rango de 32. En una variedad de casos de uso, una tasa de aprendizaje de 1e-4 ha producido consistentemente resultados sólidos. En el siguiente experimento, barrimos las tasas de aprendizaje en siete órdenes de magnitud en Qwen3-1.7B usando el conjunto de datos GSM8K (1K muestras de entrenamiento, 256 muestras de prueba), ejecutando una única época con un tamaño de lote 64, tamaño de grupo 16 y rango LoRA 1. Como se muestra en la siguiente figura, la tasa de aprendizaje óptima de LoRA alcanza un máximo alrededor de 1e-4 a 1e-3, aproximadamente un orden de magnitud mayor que el ajuste fino completo (FFT). Incluso con un rango de 1, LoRA alcanza aproximadamente el 5,5% de la mejor recompensa de validación de FFT aproximadamente al mismo tiempo. En la práctica, la RFT basada en LoRA tiende a ser más indulgente y funciona bien en una gama más amplia de tasas de aprendizaje que la FFT, aunque ambos enfoques pueden colapsar fuera de sus rangos óptimos. Recomendamos monitorear de cerca las curvas de recompensa y reducir la tasa de aprendizaje si comienzan a oscilar o colapsar.

Longitud del mensaje y duración de la respuesta

maxPromptLength define la longitud máxima permitida para la solicitud de entrada en el conjunto de datos. Las indicaciones que superan este límite se filtran durante el entrenamiento. Si su conjunto de datos contiene mensajes inusualmente largos u otros valores atípicos, establezca un valor apropiado que excluya los valores atípicos y conserve la mayoría de las muestras. De lo contrario, puede configurarlo con la duración del mensaje más largo de su conjunto de datos. Por otro lado, inferenceMaxTokens define la longitud máxima de respuesta para cualquier implementación o respuesta generada durante el entrenamiento de RL. Puede utilizar este argumento para controlar si el modelo resultante genera resultados detallados o respuestas concisas. Le recomendamos que elija un valor según los requisitos de su tarea. Un valor excesivamente grande puede aumentar el tiempo de entrenamiento, mientras que un valor demasiado pequeño podría degradar el rendimiento del modelo. Para las tareas que no requieren un razonamiento complejo, normalmente es suficiente establecer la longitud máxima de respuesta en 1024. Por el contrario, para tareas desafiantes como la codificación o la generación de formato largo, es preferible utilizar un límite superior más grande (más de 4096).

Intervalo de evaluación y parada temprana

Nuestro servicio RFT proporciona dos características que optimizan la eficiencia de la capacitación y la calidad del modelo. EarlyStopping (habilitado de forma predeterminada) detiene automáticamente el entrenamiento cuando las mejoras en el rendimiento se estabilizan, lo que evita el sobreajuste y reduce los costos de cálculo innecesarios. El sistema monitorea continuamente las métricas de validación y finaliza la capacitación después de detectar que es poco probable que futuras iteraciones produzcan mejoras significativas. Mientras tanto, evalInterval determina con qué frecuencia el modelo evalúa su desempeño en el conjunto de datos de validación durante el entrenamiento. Este hiperparámetro se calcula automáticamente como min(10, data_size/batch_size), manteniendo al menos una evaluación por época y manteniendo una frecuencia razonable. Para conjuntos de datos donde el tamaño de datos excede significativamente 10 × tamaño de lote, las evaluaciones generalmente ocurren cada 10 pasos, lo que proporciona suficiente granularidad de monitoreo sin una sobrecarga excesiva.

Métricas RFT y su significado

Amazon Bedrock expone varias métricas de capacitación a través de Amazon CloudWatch y la consola de Amazon Bedrock que le brindan una idea clara de si su trabajo de RFT está progresando como se esperaba. Comprender qué representa cada métrica y qué anomalías observar marca la diferencia entre detectar un problema temprano y esperar horas hasta que finalice una ejecución fallida.

Recompensas de formación y validación.

La recompensa de entrenamiento es la recompensa promedio de los episodios en los que estás entrenando. La recompensa de validación es la misma métrica en un conjunto de indicaciones que no aportan gradientes. En una carrera saludable, la recompensa del tren debería aumentar de manera constante desde el principio, y la recompensa de validación aumentará más lentamente pero en la misma dirección general.

Duración de los episodios de capacitación y validación

Estos codifican la cantidad promedio de tokens generados por respuesta. Utilice esto para detectar piratería de verbosidad. Si las longitudes aumentan mientras las recompensas aumentan, el modelo ha aprendido que más tiempo = mejor, independientemente de la calidad. En tareas de razonamiento (como Cadena de pensamiento (CoT)), un aumento gradual es saludable (aprender a pensar), pero un pico vertical repentino generalmente indica un bucle o falla. En algunos casos, verás una disminución gradual, y eso también está bien. Eso podría significar que el modelo inicialmente estaba explorando más para llegar a la respuesta, pero luego descubre trayectorias más cortas pero gratificantes.

Entropía política

La entropía de las políticas mide la confianza que tiene el modelo en sus resultados. Una entropía alta significa que el modelo es incierto y aún está explorando, mientras que una entropía baja significa que converge en respuestas consistentes. Durante una carrera de entrenamiento saludable, se esperaría una suave disminución desde la línea de base inicial hasta una meseta estable a medida que el modelo aprende. Una caída brusca a cerca de cero es una señal de advertencia: normalmente significa que el modelo se ha derrumbado y ha repetido una única respuesta en lugar de razonar a través de problemas. En el otro extremo, una línea plana con un valor persistentemente alto sugiere que el modelo está ignorando por completo la señal de recompensa y no está aprendiendo de la retroalimentación.

Norma de gradiente

La magnitud (norma L2) de los gradientes aplicados al modelo en cada actualización. En una racha estable fluctúa dentro de una banda razonable, con picos ocasionales; El crecimiento sostenido o los picos extremos pueden indicar problemas con la tasa de aprendizaje, la escala de recompensas o la estabilidad numérica.

Errores comunes

Incluso los trabajos RFT bien configurados pueden encontrarse con modos de falla que no siempre son obvios solo a partir de las métricas. Los dos más comunes son la piratería de recompensas (donde el modelo aprende a jugar con la función de recompensa en lugar de mejorar en la tarea real) y la inestabilidad de la recompensa, donde una alta variación en la señal de recompensa socava el proceso de aprendizaje. Ambos son recuperables, pero más fáciles de abordar si sabes qué buscar.

Hackear recompensas

Esto ocurre cuando la política aprende a explotar las debilidades en la función de recompensa para maximizar las puntuaciones sin mejorar la calidad. Verá que las recompensas del entrenamiento aumentan de manera constante mientras que los puntajes de la evaluación humana se degradan o se estabilizan. Para mitigar esto, asegúrese de que la función de recompensa capture todos los aspectos del comportamiento que desea codificar mediante ajustes. De lo contrario, observe las generaciones del modelo e repita la función de recompensa. Utilice penalizaciones de longitud estrictas en la función de recompensa si es necesario.

Variación e inestabilidad de la recompensa

Incluso con una buena recompensa promedio, una alta fluctuación en las puntuaciones de entradas similares crea una señal ruidosa que desestabiliza el entrenamiento. Esto se manifiesta en curvas de recompensa inestables y métricas de pérdidas tremendamente oscilantes. La primera línea de defensa es la normalización rigurosa: estandarizar las recompensas (media cero, variación unitaria) dentro de cada lote, recortar los valores atípicos extremos y garantizar que la inferencia de recompensas sea determinista (sin abandonos), de modo que el optimizador reciba una señal de aprendizaje consistente y estable.

Conclusión

En esta publicación, demostramos cómo aplicar el ajuste fino de refuerzo (RFT) en Amazon Bedrock para mejorar el rendimiento del modelo mediante capacitación basada en comentarios. Utilizando el conjunto de datos de razonamiento matemático GSM8K como ejemplo concreto, mostramos dónde es más efectivo RFT, cómo estructurar conjuntos de datos de entrenamiento y cómo diseñar funciones de recompensa que evalúen de manera confiable los resultados del modelo. También exploramos cómo monitorear el progreso del entrenamiento utilizando las métricas de entrenamiento de Bedrock y proporcionamos pautas prácticas de ajuste de hiperparámetros informadas por experimentos en múltiples modelos y casos de uso. Juntos, estos componentes forman la base central para ejecutar flujos de trabajo RFT exitosos. Cuando los conjuntos de datos están bien estructurados, las funciones de recompensa capturan la noción correcta de calidad y las métricas de capacitación se monitorean cuidadosamente. RFT puede mejorar significativamente el rendimiento del modelo tanto en tareas verificables (como razonamiento, codificación y extracción estructurada) como en tareas subjetivas utilizando retroalimentación de IA.

Próximos pasos

¿Listo para comenzar a personalizar con RFT en Amazon Bedrock? Inicie sesión en la consola de Amazon Bedrock o revise los documentos oficiales de la API de AWS y cree su primer trabajo de capacitación RFT utilizando los modelos de código abierto que se ajustaron para este caso de uso.

Para empezar:

Explore la documentación: visite las guías y tutoriales completos: cree un trabajo de ajuste fino de refuerzo Pruebe los cuadernos de muestra: acceda a ejemplos listos para ejecutar en el repositorio GitHub de ejemplos de AWS Experimente con sus propias cargas de trabajo: aplique las prácticas de preparación de conjuntos de datos, diseño de recompensas y ajuste de hiperparámetros que se tratan en esta publicación a sus propios casos de uso.

Reconocimiento

Gracias a las contribuciones del equipo de científicos aplicados de Amazon Bedrock, Zhe Wang y Wei Zhu, cuyo trabajo experimental sirvió como base para muchas de las mejores prácticas enumeradas en esta publicación de blog.

Sobre los autores

Nick McCarthy

Nick McCarthy es arquitecto senior de soluciones especializado en IA generativa en el equipo de Amazon Bedrock, con sede en la oficina de AWS en Nueva York. Ayuda a los clientes a personalizar sus modelos GenAI en AWS. Ha trabajado con clientes en una amplia gama de industrias, incluidas la atención médica, las finanzas, los deportes, las telecomunicaciones y la energía, ayudándolos a acelerar los resultados comerciales mediante el uso de la inteligencia artificial y el aprendizaje automático. Tiene una licenciatura en Física y una maestría en Aprendizaje Automático de la UCL, Londres.

Shreyas Subramanian

Shreyas Subramanian es un científico de datos principal y ayuda a los clientes mediante el uso de IA generativa y aprendizaje profundo para resolver sus desafíos comerciales utilizando servicios de AWS como Amazon Bedrock y AgentCore. El Dr. Subramanian contribuye a la investigación de vanguardia en aprendizaje profundo, IA agente, modelos básicos y técnicas de optimización con varios libros, artículos y patentes a su nombre. En su puesto actual en Amazon, el Dr. Subramanian trabaja con varios líderes científicos y equipos de investigación dentro y fuera de Amazon, ayudando a guiar a los clientes a aprovechar mejor los algoritmos y técnicas de última generación para resolver problemas críticos para el negocio. Fuera de AWS, el Dr. Subramanian es un revisor experto de artículos sobre IA y financiación a través de organizaciones como Neurips, ICML, ICLR, NASA y NSF.

Sapana Chaudhary

Sapana Chaudhary es científica aplicada II en Amazon Web Services (AWS), donde trabaja en el aprendizaje por refuerzo posterior al entrenamiento de grandes modelos de lenguaje. Su investigación se sitúa en la intersección del aprendizaje por refuerzo, la solidez y los modelos de lenguaje, con el objetivo de hacer que los sistemas de inteligencia artificial sean más fiables y fiables para tareas posteriores, ya sea mediante optimización restringida, ajustes precisos conscientes de los riesgos o razonamiento verificable. Sapana tiene un doctorado de la Universidad Texas A&M (TAMU). Fuera del trabajo, le gusta caminar, cocinar, pintar y fotografiar.

Jennifer Zhu

Jennifer Zhu es gerente de ciencias aplicadas en AWS, donde dirige los servicios de personalización de modelos, incluido el ajuste de refuerzo en Amazon Bedrock. En AWS, Jennifer trabaja en el perfeccionamiento y la destilación de LLM, centrándose en la creación de infraestructura de nivel de producción para la posformación de modelos a escala. Jennifer tiene un doctorado de la Universidad de Cornell y una maestría de la Universidad de San Francisco. Fuera del trabajo, le gusta leer libros y ver partidos de tenis.