Los modelos Foundation ofrecen un rendimiento impresionante desde el primer momento para tareas generales, pero muchas organizaciones necesitan modelos para consumir su conocimiento empresarial. La personalización del modelo lo ayuda a cerrar la brecha entre la IA de uso general y sus necesidades comerciales específicas al crear aplicaciones que requieren experiencia en un dominio específico, imponer estilos de comunicación, optimizar para tareas especializadas como generación de código, razonamiento financiero o garantizar el cumplimiento de las regulaciones de la industria. El desafío radica en cómo personalizar de forma eficaz. El ajuste fino supervisado tradicional ofrece resultados, pero solo si tiene miles de ejemplos cuidadosamente etiquetados que muestran no solo la respuesta final correcta, sino también el camino de razonamiento completo para llegar a ella. Para muchas aplicaciones del mundo real, especialmente aquellas tareas en las que existen múltiples rutas de solución válidas, la creación de estas demostraciones detalladas paso a paso a veces puede resultar costosa y llevar mucho tiempo.
En esta publicación, exploramos el ajuste de refuerzo (RFT) para los modelos de Amazon Nova, que puede ser una poderosa técnica de personalización que aprende a través de la evaluación en lugar de la imitación. Cubriremos cómo funciona RFT, cuándo usarlo versus ajustes supervisados, aplicaciones del mundo real desde la generación de código hasta el servicio al cliente, y opciones de implementación que van desde Amazon Bedrock completamente administrado hasta flujos de trabajo agentes de múltiples turnos con Nova Forge. También aprenderá orientación práctica sobre la preparación de datos, el diseño de funciones de recompensa y las mejores prácticas para lograr resultados óptimos.
Un nuevo paradigma: aprender por evaluación en lugar de imitación
¿Qué pasaría si pudieras enseñarle a un automóvil no solo a aprender todos los caminos en un mapa, sino también a aprender a navegar si se toma un giro equivocado? Esa es la idea central detrás del ajuste de refuerzo (RFT), una técnica de personalización de modelos que nos complace incorporar a los modelos de Amazon Nova. RFT cambia el paradigma del aprendizaje por imitación al aprendizaje por evaluación. En lugar de proporcionar miles de ejemplos etiquetados, usted proporciona indicaciones y define qué hace que una respuesta final sea correcta mediante casos de prueba, resultados verificables o criterios de calidad. Luego, el modelo aprende a optimizar esos criterios a través de retroalimentación iterativa, descubriendo su propio camino hacia las soluciones correctas.
RFT admite la personalización del modelo para la generación de código y el razonamiento matemático al verificar los resultados automáticamente, eliminando la necesidad de proporcionar un razonamiento detallado paso a paso. Hicimos que RFT esté disponible en todos nuestros servicios de IA para encontrarlo en cualquier lugar de su viaje hacia la IA: comience de manera simple con la experiencia totalmente administrada disponible en Amazon Bedrock, obtenga más control con SageMaker Training Jobs, escale a una infraestructura avanzada con SageMaker HyperPod o desbloquee capacidades de vanguardia con Nova Forge para conversaciones de varios turnos y entornos de aprendizaje de refuerzo personalizados.
En diciembre de 2025, Amazon lanzó la familia Nova 2, los primeros modelos de Amazon con capacidades de razonamiento integradas. A diferencia de los modelos tradicionales que generan respuestas directamente, los modelos de razonamiento como Nova 2 Lite descomponen el problema paso a paso, realizando pasos de pensamiento intermedios antes de producir respuestas finales. Este proceso de pensamiento extendido refleja cómo los humanos abordan tareas analíticas complejas. Cuando se combina con RFT, esta capacidad de razonamiento se vuelve particularmente poderosa: RFT puede optimizar no solo la respuesta que produce el modelo, sino también cómo razona a través de los problemas, enseñándole a descubrir caminos de razonamiento más eficientes y al mismo tiempo reduciendo el uso de tokens. A partir de hoy, RFT solo se admite en casos de uso de solo texto.
Casos de uso del mundo real
RFT sobresale en escenarios en los que se pueden definir y verificar resultados correctos, pero no es práctico crear demostraciones detalladas de soluciones paso a paso a escala. A continuación se detallan algunos de los casos de uso en los que RFT puede ser una buena opción:
Generación de código: desea un código que no solo sea correcto, sino también eficiente, legible y que maneje los casos extremos con elegancia, como cualidades que pueda verificar mediante programación mediante la ejecución de pruebas y métricas de rendimiento. Servicio al cliente: debe evaluar si las respuestas son útiles, mantener la voz de su marca y lograr el tono adecuado para cada situación. Se trata de decisiones que no pueden reducirse a reglas simples, pero que pueden ser evaluadas por un juez de IA capacitado en sus estándares de comunicación. Otras aplicaciones: moderación de contenido, donde el contexto y los matices importan; tareas de razonamiento de varios pasos como análisis financiero o revisión de documentos legales; y uso de herramientas, donde necesita enseñar a los modelos cuándo y cómo llamar a las API o consultar bases de datos. En cada caso, puede definir y verificar los resultados correctos mediante programación, incluso cuando no pueda demostrar fácilmente el proceso de razonamiento paso a paso a escala. Problemas con mucha exploración: los casos de uso como juegos y estrategia, asignación de recursos y programación se benefician de los casos en los que el modelo utiliza diferentes enfoques y aprende de la retroalimentación. Escenarios de datos etiquetados limitados: casos de uso en los que hay disponibles conjuntos de datos etiquetados limitados, como aplicaciones de dominio específico con pocos ejemplos anotados por expertos, nuevos dominios de problemas sin patrones de solución establecidos, tareas costosas de etiquetar (diagnóstico médico, análisis legal). En estos casos de uso, RFT ayuda a optimizar las recompensas calculadas a partir de las funciones de recompensa.
Cómo funciona RFT
RFT opera a través de un proceso automatizado de tres etapas (que se muestra en la Figura 1):
Etapa 1: Generación de respuestas: el modelo de actor (el modelo que está personalizando) recibe mensajes de su conjunto de datos de entrenamiento y genera múltiples respuestas por mensaje, generalmente de 4 a 8 variaciones. Esta diversidad le da al sistema una variedad de respuestas para evaluar y aprender.
Etapa 2: Cálculo de la recompensa: en lugar de comparar las respuestas con ejemplos etiquetados, el sistema evalúa la calidad mediante funciones de recompensa. Tienes dos opciones:
Aprendizaje reforzado a través de recompensas verificables (RLVR): calificadores basados en reglas implementados como funciones AWS Lambda, perfectos para tareas objetivas como la ejecución de código o la verificación de problemas matemáticos donde puede verificar la corrección mediante programación. Aprendizaje reforzado a partir de comentarios de IA (RLAIF): jueces basados en IA que evalúan las respuestas según los criterios que usted configura, ideales para tareas subjetivas como evaluar la utilidad, la creatividad o la adherencia a la voz de la marca.
Etapa 3: Entrenamiento del modelo de actor: el sistema utiliza los pares de respuesta rápida puntuados para entrenar su modelo a través de un algoritmo de aprendizaje por refuerzo, como la Optimización de políticas relativas al grupo (GRPO), optimizado para modelos de lenguaje. El modelo aprende a maximizar la probabilidad de generar respuestas de alta recompensa mientras minimiza las respuestas de baja recompensa. Este proceso iterativo continúa hasta que el modelo alcanza el rendimiento deseado.
Figura 1: Ilustración de cómo funciona un solo paso de RFT
Beneficios clave de RFT
Los siguientes son los beneficios clave de RFT:
No se requieren conjuntos de datos masivos y etiquetados: RFT solo necesita indicaciones y una forma de evaluar la calidad. Si utiliza Bedrock RFT, puede incluso aprovechar los registros de invocación de API de Bedrock existentes como datos RFT, eliminando la necesidad de conjuntos de datos especialmente creados. Optimizado para resultados verificables: a diferencia del ajuste supervisado que requiere demostraciones explícitas de cómo alcanzar respuestas correctas, RFT está optimizado para tareas en las que se pueden definir y verificar resultados correctos, pero pueden existir múltiples rutas de razonamiento válidas. Uso reducido de tokens: al optimizar el proceso de razonamiento del modelo, RFT puede reducir la cantidad de tokens necesarios para realizar una tarea, lo que reduce tanto el costo como la latencia en la producción. Seguro y monitoreado: sus datos patentados nunca abandonan el entorno seguro de AWS durante el proceso de personalización y obtiene monitoreo en tiempo real de las métricas de capacitación para realizar un seguimiento del progreso y garantizar la calidad.
Niveles de implementación: de simple a complejo
Amazon ofrece múltiples rutas de implementación para reforzar el ajuste con los modelos Nova, que van desde experiencias totalmente administradas hasta infraestructura personalizable. Si sigue este enfoque escalonado, podrá adaptar su implementación de RFT a sus necesidades específicas, experiencia técnica y nivel de control deseado.
Roca Amazónica
Amazon Bedrock proporciona un punto de entrada a RFT con una experiencia totalmente administrada que requiere experiencia mínima en aprendizaje automático. A través de la consola o API de Amazon Bedrock, puede cargar sus indicaciones de capacitación, configurar su función de recompensa como AWS Lambda e iniciar su trabajo de ajuste de refuerzo con solo unos pocos clics. Bedrock maneja automáticamente todo el aprovisionamiento de infraestructura, la orquestación de la capacitación y la implementación de modelos. Este enfoque funciona bien para casos de uso sencillos en los que es necesario optimizar criterios específicos sin administrar la infraestructura. El flujo de trabajo simplificado hace que RFT sea accesible para equipos sin ingenieros de ML dedicados y, al mismo tiempo, ofrece potentes capacidades de personalización. Bedrock RFT admite enfoques RLVR (recompensas basadas en reglas) y RLAIF (retroalimentación basada en IA), con herramientas integradas de monitoreo y evaluación para rastrear la mejora de su modelo. Para comenzar, consulte el repositorio GitHub de Amazon Nova RFT.
Personalización del modelo sin servidor de Amazon SageMaker
La personalización del modelo sin servidor de Amazon SageMaker AI está diseñada específicamente para profesionales de ML que están listos para ir más allá de la ingeniería rápida y RAG, y hacia el ajuste de LLM para casos de uso especializados de alto impacto. Ya sea que el objetivo sea mejorar el razonamiento complejo, la generación de código de dominio específico u optimizar los LLM para flujos de trabajo agentes que incluyen planificación, llamada de herramientas y reflexión, la oferta de SageMaker elimina las barreras tradicionales de infraestructura y experiencia que ralentizan la experimentación. En esencia, el servicio ofrece técnicas avanzadas de aprendizaje por refuerzo como GRPO con RLVR/RLAIF a los desarrolladores sin requerir una configuración compleja de RL, junto con un conjunto de evaluación integral que va mucho más allá de las métricas de precisión básicas. Como complemento a esto, la generación de datos sintéticos asistida por IA, el seguimiento de experimentos integrado y el soporte completo de linaje y seguimiento de auditoría completan un proceso de personalización de nivel de producción. La flexibilidad de implementación permite a los equipos enviar modelos optimizados a puntos finales de SageMaker, Amazon Bedrock o infraestructura personalizada, lo que la convierte en una solución sin servidor de extremo a extremo convincente para equipos que buscan acelerar sus ciclos de personalización de modelos y desbloquear todo el potencial de modelos como Amazon Nova en aplicaciones del mundo real.
Trabajos de formación de SageMaker
Para los equipos que necesitan más control sobre el proceso de capacitación, los trabajos de capacitación de Amazon SageMaker ofrecen un término medio flexible con computación administrada y capacidad para modificar múltiples hiperparámetros. También puede guardar puntos de control intermedios y utilizarlos para crear flujos de trabajo de entrenamiento iterativos, como encadenar trabajos de ajuste fino supervisado (SFT) y RFT para refinar progresivamente su modelo. Tiene la flexibilidad de elegir entre LoRA y enfoques de entrenamiento de rango completo, con control total sobre los hiperparámetros. Para la implementación, puede elegir entre Amazon Bedrock para una inferencia totalmente administrada o puntos de enlace de Amazon SageMaker donde controla los tipos de instancias, el procesamiento por lotes y el ajuste del rendimiento. Este nivel es ideal para ingenieros de aprendizaje automático y científicos de datos que necesitan una personalización más allá de Amazon Bedrock pero que no requieren una infraestructura dedicada. Los trabajos de capacitación de SageMaker también se integran perfectamente con el ecosistema más amplio de inteligencia artificial de Amazon SageMaker para el seguimiento de experimentos, el registro de modelos y los procesos de implementación. Amazon Nova RFT en SageMaker Training Job utiliza archivos de recetas YAML para configurar trabajos de capacitación. Puede obtener recetas base desde el repositorio de recetas de SageMaker HyperPod.
Mejores prácticas:
Formato de datos: utilice el formato JSONL con un objeto JSON por línea. Respuestas de referencia: incluya valores reales que su función de recompensa comparará con las predicciones del modelo. Comience poco a poco: comience con 100 ejemplos para validar su enfoque antes de escalar. Campos personalizados: agregue cualquier metadato que su función de recompensa necesite para su evaluación. Función de recompensa: diseño para lograr velocidad y escalabilidad con AWS Lambda. Para comenzar con el trabajo RFT de Amazon Nova en Trabajos de capacitación de Amazon SageMaker, consulte los cuadernos SFT y RFT.
HiperPod SageMaker
SageMaker HyperPod ofrece una infraestructura de nivel empresarial para cargas de trabajo RFT a gran escala con clústeres persistentes basados en Kubernetes optimizados para la capacitación distribuida. Este nivel se basa en todas las funciones disponibles en SageMaker Training Jobs, incluida la gestión de puntos de control, flujos de trabajo de capacitación iterativos, LoRA y opciones de capacitación de rango completo, e implementación flexible, a una escala mucho mayor con recursos informáticos dedicados y configuraciones de red especializadas. La implementación de RFT en HyperPod está optimizada para un mayor rendimiento y una convergencia más rápida a través de algoritmos de aprendizaje por refuerzo asincrónicos de última generación, donde los servidores de inferencia y los servidores de entrenamiento funcionan de forma independiente a toda velocidad. Estos algoritmos tienen en cuenta esta asincronía e implementan técnicas de vanguardia utilizadas para entrenar modelos básicos. HyperPod también proporciona filtros de datos avanzados que le brindan un control granular sobre el proceso de entrenamiento y reducen las posibilidades de fallas. Obtendrá control granular sobre los hiperparámetros para maximizar el rendimiento y el rendimiento. HyperPod está diseñado para equipos de plataformas de aprendizaje automático y organizaciones de investigación que necesitan ampliar los límites de RFT a escala. Amazon Nova RFT utiliza archivos de recetas YAML para configurar trabajos de capacitación. Puede obtener recetas base desde el repositorio de recetas de SageMaker HyperPod.
Para obtener más información, consulte la evaluación basada en RFT para comenzar con el trabajo RFT de Amazon Nova en Amazon SageMaker HyperPod.
Forja Nova
Nova Forge proporciona capacidades avanzadas de capacitación en retroalimentación de refuerzo diseñadas para profesionales y equipos de investigación de IA en la creación de aplicaciones agentes sofisticadas. Al liberarse de la interacción de un solo turno y de las limitaciones de tiempo de espera de Lambda, Nova Forge permite flujos de trabajo complejos de múltiples turnos con entornos personalizados que se ejecutan en su propia VPC. Esta arquitectura le brinda control total sobre la generación de trayectorias, funciones de recompensa e interacción directa con capacidades de servidores de inferencia y entrenamiento esenciales para aplicaciones de inteligencia artificial de vanguardia que los niveles RFT estándar no pueden admitir. Nova Forge utiliza Amazon SageMaker HyperPod como plataforma de capacitación además de proporcionar otras funciones, como la combinación de datos con conjuntos de datos seleccionados de Amazon Nova junto con puntos de control intermedios.
Características clave:
Compatibilidad con conversaciones de varios turnos Funciones de recompensa con un tiempo de ejecución de >15 minutos Algoritmos adicionales y opciones de ajuste Modificaciones personalizadas de recetas de entrenamiento Técnicas de IA de última generación
Cada nivel de esta progresión se basa en el anterior y ofrece un camino de crecimiento natural a medida que su RFT necesita evolucionar. Comience con Amazon Bedrock para los experimentos iniciales, pase a los trabajos de capacitación de SageMaker a medida que perfecciona su enfoque y gradúe a HyperPod o Nova Forge usando HyperPod para casos de uso especializados. Esta arquitectura flexible garantiza que pueda implementar RFT al nivel de complejidad que se ajuste a sus necesidades actuales y, al mismo tiempo, proporciona un camino claro a seguir a medida que esas necesidades crecen.
Enfoque sistemático para el ajuste fino del refuerzo (RFT)
El ajuste fino de refuerzo (RFT) mejora progresivamente los modelos previamente entrenados a través de iteraciones de aprendizaje estructuradas y basadas en recompensas. El siguiente es un enfoque sistemático para implementar RFT.
Paso 0: evaluar el desempeño inicial
Antes de iniciar RFT, evalúe si su modelo funciona a un nivel mínimamente aceptable. RFT requiere que el modelo pueda producir al menos una solución correcta entre varios intentos durante el entrenamiento.
Requisito clave: las políticas relativas al grupo requieren diversidad de resultados en múltiples implementaciones (generalmente de 4 a 8 generaciones por mensaje) para aprender de manera efectiva. El modelo necesita al menos un éxito o al menos un fracaso entre los intentos para poder distinguir entre ejemplos positivos y negativos para el refuerzo. Si todas las implementaciones fallan constantemente, el modelo no tiene ninguna señal positiva de la cual aprender, lo que hace que RFT sea ineficaz. En tales casos, primero debe utilizar el ajuste fino supervisado (SFT) para establecer capacidades de tareas básicas antes de intentar RFT. En los casos en los que los modos de falla se deben principalmente a la falta de conocimiento, también en esos casos la SFT podría ser un punto de partida más efectivo, mientras que si los modos de falla se deben a un razonamiento deficiente, entonces la RFT podría ser una mejor opción para optimizar la calidad del razonamiento.
Paso 1: identificar el conjunto de datos y la función de recompensa correctos
Seleccione o cree un conjunto de datos de indicaciones que representen los escenarios que encontrará su modelo en producción. Más importante aún, diseñe una función de recompensa que:
Crisply sigue lo que rastrean sus métricas de evaluación: su función de recompensa debe medir directamente las mismas cualidades que le interesan en producción. Capta lo que necesita del modelo: ya sea corrección, eficiencia, cumplimiento del estilo o una combinación de objetivos.
Paso 2: depurar e iterar
Supervise las métricas de capacitación y la implementación de modelos durante todo el proceso de capacitación.
Métricas de entrenamiento a tener en cuenta:
Tendencias de recompensa a lo largo del tiempo (en general, deberían aumentar) Divergencia de políticas (KL) con respecto al modelo base Duración de la generación a lo largo del tiempo
Análisis de implementación del modelo:
Muestreo y revisión de los resultados generados a intervalos regulares. Seguimiento de cómo evoluciona el comportamiento del modelo a lo largo de los pasos de entrenamiento.
Problemas comunes y soluciones
Problemas que se pueden resolver directamente en la función de recompensa:
Corrección del formato: agregue penalizaciones de recompensa por resultados con formato incorrecto Mezcla de idiomas: penalice los cambios de idioma no deseados Longitud de generación: recompense las longitudes de respuesta adecuadas para su caso de uso
Problemas que requieren mejoras en el conjunto de datos/indicaciones:
Cobertura limitada: cree un conjunto de indicaciones más completo que cubra diversas dificultades. Falta de diversidad de exploración: asegúrese de que las indicaciones permitan que el modelo explore diversos escenarios y casos extremos.
RFT es un proceso iterativo. Utilice información valiosa de cada ejecución de entrenamiento para perfeccionar su función de recompensa, ampliar su conjunto de indicaciones o ajustar los hiperparámetros antes de la siguiente iteración.
Funciones clave de RFT y cuándo elegir qué
Esta sección describe las características clave de RFT a través de un desglose sistemático de sus componentes y capacidades principales para una optimización efectiva del modelo.
Rango completo comparado con LoRA
RFT admite dos enfoques de capacitación con diferentes compensaciones de recursos. El entrenamiento de rango completo actualiza todos los parámetros del modelo durante el entrenamiento, lo que proporciona el máximo potencial de adaptación del modelo pero requiere más recursos computacionales y memoria. La adaptación de rango bajo (LoRA) ofrece un ajuste fino eficiente en los parámetros que actualiza solo un pequeño subconjunto de parámetros a través de capas de adaptadores livianas mientras mantiene congelada la mayor parte del modelo.
LoRA requiere significativamente menos recursos computacionales y da como resultado artefactos de modelo más pequeños. Es importante destacar que los modelos LoRA implementados en Amazon Bedrock admiten la inferencia bajo demanda: no necesita instancias dedicadas y solo paga por los tokens que utiliza. Esto convierte a LoRA en un excelente punto de partida predeterminado: puede iterar y validar rápidamente su modelo personalizado sin costos iniciales de infraestructura. A medida que su demanda de tráfico crece o los requisitos de alto rendimiento justifican la inversión, puede realizar la transición a una capacitación de rango completo con instancias de rendimiento aprovisionadas dedicadas para obtener el máximo rendimiento y la menor latencia.
Razonamiento comparado con no razonamiento
RFT admite modelos tanto de razonamiento como de no razonamiento, cada uno de ellos optimizado para diferentes tipos de tareas. Los modelos de razonamiento generan pasos de pensamiento intermedios explícitos antes de producir respuestas finales, lo que los hace ideales para tareas analíticas complejas como la resolución de problemas matemáticos, la deducción lógica de varios pasos y la generación de código donde mostrar el proceso de razonamiento agrega valor. Puede configurar niveles de esfuerzo de razonamiento: alto para una capacidad máxima de razonamiento o bajo para una sobrecarga mínima. Los modelos sin razonamiento brindan respuestas directas sin mostrar pasos de razonamiento intermedios, optimizando la velocidad y el costo. Son más adecuados para tareas como preguntas y respuestas al estilo chat-bot, en las que desea una ejecución más rápida sin la sobrecarga de razonamiento, aunque esto puede dar como resultado resultados de menor calidad en comparación con el modo de razonamiento. La elección depende de los requisitos de su tarea: utilice el modo de razonamiento cuando los pasos intermedios de pensamiento mejoren la precisión y necesite el máximo rendimiento en problemas complejos. Utilice el modo de no razonamiento cuando priorice la velocidad y la rentabilidad sobre las posibles mejoras de calidad que proporciona el razonamiento explícito.
Cuándo utilizar RFT en comparación con SFT
Método Cuándo funciona mejor Fortalezas Limitaciones Ajuste fino supervisado (SFT) Tareas bien definidas con resultados deseados claros, por ejemplo, “Dado X, el resultado correcto es Y”. • Enseña directamente conocimientos factuales (por ejemplo, “París es la capital de Francia”) • Ideal cuando tiene pares de respuesta rápida de alta calidad • Proporciona formato consistente y estructuras de salida específicas • Requiere ejemplos explícitos y etiquetados para cada comportamiento deseado • Puede tener problemas con tareas que involucran soluciones ambiguas o múltiples válidas Ajuste fino de refuerzo (RFT) Escenarios donde se puede definir una función de recompensa, incluso si solo existe una solución válida • Optimiza tareas de razonamiento complejas • Genera sus propios datos de entrenamiento de manera eficiente. reduciendo la necesidad de muchos ejemplos etiquetados por humanos • Permite equilibrar objetivos en competencia (precisión, eficiencia, estilo) • Necesita que el modelo produzca al menos una solución correcta entre varios intentos (normalmente de 4 a 8) • Si el modelo falla constantemente en generar soluciones correctas, RFT por sí solo no será efectivo
Estudio de caso: optimización del índice de referencia de análisis financiero (FinQA) con RFT
En este estudio de caso, guiaremos a los usuarios a través de un estudio de caso de ejemplo de FinQA, un punto de referencia de análisis financiero, y lo usaremos para demostrar la optimización lograda en las respuestas. En este ejemplo utilizaremos 1000 muestras del conjunto de datos públicos de FinQA.
Paso 1: preparación de datos
Prepare el conjunto de datos en un formato que sea compatible con el esquema RFT como se menciona RFT en Nova. Los datos RFT siguen el formato conversacional OpenAI. Cada ejemplo de entrenamiento es un objeto JSON que contiene. Para nuestro conjunto de datos FinQA, el formato posterior de un punto de datos de ejemplo en train.jsonl se verá como se muestra a continuación:
Campos obligatorios:
mensajes: conjunto de turnos de conversación con roles de sistema, usuario y, opcionalmente, asistente. respuesta_referencia: resultados esperados o criterios de evaluación para el cálculo de recompensas.
Campos opcionales:
id: identificador único para herramientas de seguimiento y deduplicación: conjunto de definiciones de funciones disponibles para el modelo. Campos de metadatos personalizados: cualquier metadato adicional que se utilizará al calcular las recompensas (por ejemplo, task_id, dificultad_level, dominio).
Paso 2: crear la función de recompensa y calificación
La función de recompensa es el componente central que evalúa las respuestas del modelo y proporciona señales de retroalimentación para el entrenamiento. Debe implementarse como una función de AWS Lambda que acepte respuestas del modelo y devuelva puntuaciones de recompensa. Actualmente, las funciones de AWS Lambda tienen una limitación de tiempo de ejecución de hasta 15 minutos. Ajuste el tiempo de espera de la función Lambda según sus necesidades.
Mejores prácticas:
Las siguientes son las recomendaciones para optimizar su implementación de RFT:
Comience poco a poco: comience con 100-200 ejemplos y algunas épocas de entrenamiento. Línea de base con SFT primero: si las puntuaciones de recompensa son consistentemente bajas, realice SFT antes que RFT. Diseñe funciones de recompensa eficientes: ejecútelas en segundos y minimice las llamadas API externas. Supervise activamente: realice un seguimiento de las puntuaciones de recompensa promedio y esté atento al sobreajuste. Optimice la calidad de los datos: garantice ejemplos diversos y representativos.
Paso 3: iniciar el trabajo RFT
Una vez que tengamos los datos preparados, iniciaremos RFT utilizando trabajos de capacitación de SageMaker. Las dos entradas clave para iniciar el trabajo RFT son el conjunto de datos de entrada (input_data_s3) y la función de recompensa Lambda ARN. Aquí utilizamos el contenedor RFT y la receta RFT como se define en el siguiente ejemplo. El siguiente es un fragmento de cómo puede iniciar el trabajo RFT: rft_training_job =rft_launcher(train_dataset_s3_path, recompensa_lambda_arn)
Función:
Nota: Para reducir el costo de este experimento, puede establecer el recuento de instancias en 2 en lugar de 4 para LoRA.
Paso 4: Iniciar el trabajo de evaluación RFT
Una vez que se completa el trabajo de RFT, también puede tomar el punto de control generado después de RFT y usarlo para evaluar el modelo. Este punto de control luego se puede usar en una receta de evaluación, anulando el modelo base y ejecutado en nuestro contenedor de evaluación. El siguiente es un fragmento de cómo puede utilizar el punto de control generado para la evaluación. Tenga en cuenta que el mismo código también se puede utilizar para ejecutar una evaluación de referencia antes de la evaluación del punto de control.
La función se puede llamar usando el siguiente comando:
Para uso de referencia:
Para uso posterior a la evaluación RFT:
Función:
Paso 5: monitorear las métricas de RFT e iterar en consecuencia
Una vez que se inician los trabajos, puede monitorear el progreso del trabajo en los registros de Amazon CloudWatch para los trabajos de capacitación de SageMaker para ver las métricas específicas de RFT. También puede monitorear los registros de CloudWatch de su función Lambda de recompensa para verificar cómo están funcionando las implementaciones y las recompensas. Es una buena práctica validar que la función Lambda de recompensa calcule las recompensas como se esperaba y no entre en el "pirateo de recompensas" (maximizando la señal de recompensa de maneras no deseadas que no se alinean con el objetivo real).
Revise las siguientes métricas clave:
Métricas de distribución de recompensas críticas: estas métricas (crítico/recompensas/media, crítica/recompensas/máximo, crítico/recompensas/mínimo) ayudan a encontrar cómo se ve la forma de la recompensa y si las recompensas están en un camino de aumento gradual. Métricas de comportamiento exploratorio del modelo: estas métricas nos ayudan a comprender la naturaleza exploratoria del modelo. Un actor/entropía más alto indica una mayor variación de políticas y la capacidad del modelo para explorar caminos más nuevos.
Conclusión
Con RFT puede realizar la personalización del modelo a través del aprendizaje basado en evaluaciones, lo que requiere solo indicaciones y criterios de calidad en lugar de conjuntos de datos masivos y etiquetados. Para una implementación completamente administrada, comience con Amazon Bedrock. Si necesita un control más flexible, vaya a Trabajos de formación de SageMaker. Para cargas de trabajo a escala empresarial, SageMaker HyperPod proporciona la infraestructura necesaria. Alternativamente, explore Nova Forge para aplicaciones agentes de múltiples turnos con entornos de aprendizaje de refuerzo personalizados.