Los modelos de lenguaje grande (LLM) ahora impulsan los agentes conversacionales, las herramientas creativas y los sistemas de soporte de decisiones más avanzados. Sin embargo, su producción bruta a menudo contiene imprecisiones, desalineamientos de políticas o frases inútiles, cuestiones que socavan la confianza y limitan la utilidad en el mundo real. El ajuste fino de refuerzo (RFT) se ha convertido en el método preferido para alinear estos modelos de manera eficiente, utilizando señales de recompensa automatizadas para reemplazar el costoso etiquetado manual.
En el corazón del RFT moderno se encuentran las funciones de recompensa. Están creados para cada dominio a través de funciones de recompensa verificables que pueden calificar generaciones de LLM a través de un fragmento de código (aprendizaje por refuerzo con recompensas verificables o RLVR) o con LLM como juez, donde un modelo de lenguaje separado evalúa las respuestas de los candidatos para guiar la alineación (aprendizaje por refuerzo con retroalimentación de IA o RLAIF). Ambos métodos proporcionan puntuaciones al algoritmo RL para impulsar al modelo a resolver el problema en cuestión. En esta publicación, analizamos en profundidad cómo RLAIF o RL con LLM como juez funcionan eficazmente con los modelos de Amazon Nova.
¿Por qué RFT con LLM como juez en comparación con RFT genérico?
El ajuste fino del refuerzo puede utilizar cualquier señal de recompensa, reglas sencillas hechas a mano (RLVR) o un LLM que evalúe los resultados del modelo (LLM-as-a-judge o RLAIF). RLAIF hace que la alineación sea mucho más flexible y poderosa, especialmente cuando las señales de recompensa son vagas y difíciles de elaborar manualmente. A diferencia de las recompensas RFT genéricas que se basan en una puntuación numérica contundente, como la coincidencia de subcadenas, un juez de LLM razona en múltiples dimensiones (corrección, tono, seguridad, relevancia) y proporciona comentarios conscientes del contexto que capturan sutilezas y matices específicos del dominio sin un reentrenamiento específico de la tarea. Además, los jueces de LLM ofrecen explicabilidad incorporada a través de fundamentos (por ejemplo, "La respuesta A cita estudios revisados por pares"), proporcionando diagnósticos que aceleran la iteración, identifican modos de falla directamente y reducen desalineaciones ocultas, algo que las funciones de recompensa estáticas no pueden hacer.
Implementación de LLM como juez: seis pasos críticos
Esta sección cubre los pasos clave involucrados en el diseño e implementación de funciones de recompensa de LLM como juez.
Seleccione la arquitectura del juez
La primera decisión crítica es seleccionar la arquitectura de su juez. LLM-as-a-juez ofrece dos modos de evaluación principales: evaluación basada en rúbricas (basada en puntos) y evaluación basada en preferencias, cada una adecuada para diferentes escenarios de alineación.
Criterios Evaluación basada en rúbricas Evaluación basada en preferencias Método de evaluación Asigna una puntuación numérica a una sola respuesta usando criterios predefinidos Compara dos respuestas candidatas una al lado de la otra y selecciona la superior Medición de calidad Mediciones de calidad absoluta Calidad relativa a través de comparación directa Se prefiere cuando existen dimensiones de evaluación claras y cuantificables (precisión, integridad, cumplimiento de seguridad) El modelo de política debe explorar libremente sin restricciones de datos de referencia Requisitos de datos Solo requiere una ingeniería rápida y cuidadosa para alinear el modelo para recompensar las especificaciones Requiere al menos una respuesta muestra para comparación de preferencias Generalizabilidad Mejor para datos fuera de distribución, evita sesgos en los datos Depende de la calidad de las respuestas de referencia Estilo de evaluación Refleja los sistemas de puntuación absoluta Refleja la evaluación humana natural a través de la comparación Punto de partida recomendado Comience aquí si los datos de preferencia no están disponibles y el RLVR no es adecuado Usar cuando haya datos comparativos disponibles
Define tus criterios de evaluación
Una vez que haya seleccionado su tipo de juez, articule las dimensiones específicas que desea mejorar. Unos criterios de evaluación claros son la base de una formación eficaz de RLAIF.
Para jueces basados en preferencias:
Escriba indicaciones claras que expliquen qué hace que una respuesta sea mejor que otra. Sea explícito sobre las preferencias de calidad con ejemplos concretos. Ejemplo: "Prefiera respuestas que citen fuentes autorizadas, utilicen un lenguaje accesible y aborden directamente la pregunta del usuario".
Para jueces basados en rúbricas:
Recomendamos utilizar puntuación booleana (aprobado/reprobado) para jueces basados en rúbricas. La puntuación booleana es más confiable y reduce la variabilidad de los jueces en comparación con las escalas detalladas del 1 al 10. Defina criterios claros de aprobación/reprobación para cada dimensión de evaluación con características específicas y observables.
Selecciona y configura tu modelo de juez
Elija un LLM con suficiente capacidad de razonamiento para evaluar su dominio de destino, configurado a través de Amazon Bedrock y llamado mediante una función de recompensa de AWS Lambda. Para dominios comunes como matemáticas, codificación y capacidades conversacionales, los modelos más pequeños pueden funcionar bien con una ingeniería cuidadosa y rápida.
Nivel de modelo Preferido por confiabilidad de costos Modelo Amazon Bedrock Grande/Pesado Razonamiento complejo, evaluación matizada, puntuación multidimensional Alto Muy Alto Amazon Nova Pro, Claude Opus, Claude Sonnet Medio/Ligero Dominios generales como matemáticas o codificación, costo-rendimiento equilibrado Bajo-Medio Moderado-Alto Amazon Nova 2 Lite, Claude Haiku
Refina el mensaje de tu modelo de juez
Su indicación de juez es la base de la calidad de la alineación. Diseñelo para producir resultados estructurados y analizables con dimensiones de puntuación claras:
Formato de salida estructurado: especifique JSON o formato analizable para una extracción sencilla. Reglas de puntuación claras: defina exactamente cómo se debe calcular cada dimensión. Manejo de casos extremos: aborde escenarios ambiguos (por ejemplo, "Si la respuesta está vacía, asigne una puntuación de 0") Comportamientos deseados: establezca explícitamente comportamientos a fomentar o desalentar
Alinear los criterios de los jueces con las métricas de evaluación de la producción
Su función de recompensa debe reflejar las métricas que utilizará para evaluar el modelo final en producción. Alinee su función de recompensa con los criterios de éxito de la producción para permitir modelos diseñados para los objetivos correctos.
Flujo de trabajo de alineación:
Defina criterios de éxito de producción (por ejemplo, precisión, seguridad) con umbrales aceptables. Asigne cada criterio a dimensiones específicas de puntuación del juez. Valide que las puntuaciones del juez se correlacionen con sus métricas de evaluación. Pruebe al juez en muestras representativas y casos extremos.
Creación de una función Lambda de recompensa sólida
Los sistemas RFT de producción procesan miles de evaluaciones de recompensas por paso de capacitación. Cree una función Lambda de recompensa resistente para ayudar a proporcionar estabilidad en el entrenamiento, uso eficiente de la computación y comportamiento confiable del modelo. Esta sección cubre cómo crear una función Lambda de recompensa que sea resistente, eficiente y lista para producción.
Estructuración de puntuación de recompensa compuesta
No confíe únicamente en los jueces de LLM. Combínelos con componentes de recompensa rápidos y deterministas que detecten fallas obvias antes de costosas evaluaciones de jueces:
Componentes principales
Componente Propósito Cuándo usarlo Corrección del formato Verificar la estructura JSON, los campos obligatorios y el cumplimiento del esquema Siempre: detecta resultados con formato incorrecto de inmediato. Comentarios baratos e instantáneos. Penalizaciones por extensión Desalentar respuestas demasiado detalladas o concisas Cuando la longitud de la salida es importante (por ejemplo, resúmenes) Coherencia del lenguaje Verificar que las respuestas coincidan con el idioma de entrada Crítico para aplicaciones multilingües Filtros de seguridad Comprobaciones basadas en reglas para contenido prohibido Siempre: evita que contenido inseguro llegue a producción
Preparación de la infraestructura
Implemente un retroceso exponencial: maneja los límites de velocidad de la API de Amazon Bedrock y las fallas transitorias con elegancia Estrategia de paralelización: utilice ThreadPoolExecutor o patrones asíncronos para paralelizar las llamadas de los jueces entre implementaciones para reducir la latencia Evite retrasos en el inicio en frío de Lambda: establezca un tiempo de espera de Lambda adecuado (se recomiendan 15 minutos) y una simultaneidad aprovisionada (~100 para configuraciones típicas) Manejo de errores: agregue un manejo integral de errores que devuelva recompensas neutrales/ruidosas (0,5) en lugar de fallar en todo el paso de capacitación
Pruebe su función Lambda de recompensa para mayor resiliencia
Validar la consistencia y calibración de los jueces:
Consistencia: pruebe al juez en las mismas muestras varias veces para medir la variación de la puntuación (debe ser baja para una evaluación determinista) Comparación entre jueces: compare puntuaciones entre diferentes modelos de jueces para identificar puntos ciegos en la evaluación Calibración humana: muestree periódicamente implementaciones para revisión humana para detectar la deriva de los jueces o errores sistemáticos Pruebas de regresión: cree un “conjunto de pruebas de jueces” con ejemplos conocidos buenos/malos para probar el comportamiento de los jueces en regresión
RFT con LLM como juez: flujo de trabajo de capacitación
El siguiente diagrama ilustra el proceso de capacitación completo de un extremo a otro, desde la evaluación inicial hasta la validación del juez y la implementación de producción. Cada paso se basa en el anterior, creando una canalización resistente que equilibra la calidad de la alineación con la eficiencia computacional al tiempo que previene activamente la piratería de recompensas y respalda el comportamiento del modelo listo para producción.
Estudio de caso del mundo real: automatización de la revisión de contratos legales
En esta sección, nos referimos a un caso de uso del mundo real con un socio líder de la industria legal. La tarea es generar comentarios de riesgos, evaluaciones y acciones sobre la documentación legal respecto de las pólizas y contratos anteriores como documentos de referencia.
Desafío
Partner estaba interesado en resolver el problema de automatizar el proceso de revisión, evaluación y señalización de riesgos en documentos contractuales legales. Específicamente, querían evaluar nuevos contratos potenciales en comparación con las pautas y regulaciones internas, contratos anteriores y leyes del país relacionadas con el contrato.
Solución
Formulamos este problema como uno en el que proporcionamos un documento de destino (el "contrato" que necesita evaluación) y un documento de referencia (el documento básico y el contexto) y esperamos que el LLM genere un JSON con múltiples comentarios, tipos de comentarios y acciones recomendadas a tomar en función de la evaluación. El conjunto de datos original disponible para este caso de uso era relativamente pequeño e incluía contratos completos junto con anotaciones y comentarios de expertos legales. Usamos LLM como juez usando el modelo GPT OSS 120b como juez y un mensaje de sistema personalizado durante RFT.
Flujo de trabajo RFT
En la siguiente sección cubrimos detalles de los aspectos clave en el flujo de trabajo RFT para este caso de uso.
Función Lambda de recompensa para LLM como juez
Los siguientes fragmentos de código presentan los componentes clave de la función Lambda de recompensa.
Nota: el nombre de la función Lambda debe tener "SageMaker", por ejemplo, "arn:aws:lambda:us-east-1:123456789012:function:MyRewardFunctionSageMaker"
a) Comience por definir un objetivo de alto nivel
b) Definir el enfoque de evaluación
c) Describir las dimensiones de la puntuación con especificaciones claras sobre cómo se debe calcular una puntuación en particular.
d) Definir claramente el formato de salida final a analizar
e) Crear un controlador Lambda de alto nivel, que proporcione suficiente subproceso múltiple para una inferencia más rápida
Despliegue de la función Lambda
Utilizamos los siguientes permisos y configuraciones de AWS Identity and Access Management (IAM) en la función Lambda. Se requieren las siguientes configuraciones para las funciones Lambda de recompensa. El entrenamiento RFT puede fallar si falta alguno de ellos.
a) Permisos para la función de ejecución de IA de Amazon SageMaker
Su función de ejecución de Amazon SageMaker AI debe tener permiso para invocar su función Lambda. Agregue esta política a su función de ejecución de IA de Amazon SageMaker:
b) Permisos para el rol de ejecución de la función Lambda
La función de ejecución de su función Lambda necesita permisos básicos de ejecución de Lambda y permisos para invocar el modelo juez de Amazon Bedrock.
Nota: Esta solución sigue el modelo de responsabilidad compartida de AWS. AWS es responsable de proteger la infraestructura que ejecuta los servicios de AWS en la nube. Usted es responsable de proteger su código de función Lambda, configurar permisos de IAM, implementar controles de acceso y cifrado, administrar la seguridad y privacidad de los datos, configurar el monitoreo y el registro, y verificar el cumplimiento de las regulaciones aplicables. Siga el principio de privilegio mínimo al determinar el alcance de los permisos para ARN de recursos específicos. Para obtener más información, consulte Seguridad en AWS Lambda y Amazon SageMaker AI Security en la documentación de AWS.
c) Agregar simultaneidad aprovisionada
Publique una versión de Lambda y para permitir que la función escale sin fluctuaciones en la latencia, agregamos algo de simultaneidad aprovisionada. 100 fueron suficientes en este caso, sin embargo, aquí hay más margen para mejorar los costes.
d) Establezca el tiempo de espera de Lambda en 15 minutos
Personalización de la configuración del entrenamiento
Lanzamos el SDK de Nova Forge que se puede utilizar durante todo el ciclo de vida de personalización del modelo, desde la preparación de datos hasta la implementación y el monitoreo. Nova Forge SDK elimina la necesidad de buscar las recetas adecuadas o el URI del contenedor para técnicas específicas.
Puede usar el SDK de Nova Forge para personalizar los parámetros de entrenamiento de dos maneras: proporcionar una receta YAML completa usando receta_path o pasar campos específicos usando anulaciones para cambios selectivos. Para este caso de uso, utilizamos anulaciones para ajustar la configuración de implementación y del entrenador, como se muestra en la siguiente sección.
Resultados
RFT con Amazon Nova 2 Lite logró una puntuación agregada de 4,33 (el rendimiento más alto en todos los modelos evaluados) y al mismo tiempo mantuvo una validación perfecta del esquema JSON. Esto representa una mejora significativa, lo que demuestra que RFT puede producir modelos especializados listos para producción que superan a las alternativas más grandes de uso general.
Evaluamos modelos utilizando una configuración de comentario único "lo mejor de k", donde cada modelo generaba múltiples comentarios por muestra y calificamos el resultado de mayor calidad. Este enfoque establece un límite superior de rendimiento y permite una comparación justa entre modelos que producen resultados únicos versus múltiples.
Figura 1: Puntuaciones de validación del esquema JSON (escala de 0 a 1; cuanto más alto, mejor)
Figura 2: Puntajes agregados de los jueces de LLM (escala de 1 a 5, cuanto más alto, mejor)
Conclusiones clave:
RFT logró el rendimiento más alto entre los modelos evaluados en este estudio.
Amazon Nova 2 Lite con RFT logró una puntuación total de 4,33, superando a Claude Sonnet 4.5 y Claude Haiku 4.5, y al mismo tiempo logró una validación perfecta del esquema JSON.
Elimina artefactos de entrenamiento innecesarios
Durante las iteraciones de SFT, observamos comportamientos problemáticos, incluida la generación de comentarios repetitivos y predicciones de caracteres Unicode poco naturales. Estos problemas, probablemente causados por sobreajuste o desequilibrios en el conjunto de datos, no aparecieron en los puntos de control de RFT. Las mejoras basadas en recompensas de RFT naturalmente desalientan tales artefactos, produciendo resultados más sólidos y confiables.
Fuerte generalización a nuevos criterios de jueces.
Cuando evaluamos los modelos RFT utilizando un mensaje de juez modificado (alineado pero no idéntico a la función de recompensa de entrenamiento), el rendimiento se mantuvo sólido. Esto demuestra que RFT aprende patrones de calidad generalizables en lugar de sobreajustar criterios de evaluación específicos. Esta es una ventaja fundamental para la implementación en el mundo real donde los requisitos evolucionan.
Consideraciones de cálculo
RFT requirió entre 4 y 8 implementaciones por muestra de capacitación, lo que aumentó los costos de computación en comparación con SFT. Esta sobrecarga se amplifica cuando se utilizan configuraciones de esfuerzo de razonamiento distintas de cero. Sin embargo, para aplicaciones de misión crítica donde la calidad de la alineación afecta directamente los resultados comerciales, como la revisión de contratos legales, el cumplimiento financiero o la documentación de atención médica, las ganancias de rendimiento justifican los costos de computación adicionales.
Conclusión
El ajuste fino de refuerzo (RFT) con LLM como juez representa un enfoque poderoso para alinear los LLM para aplicaciones de dominios específicos. Como se demuestra en nuestro estudio de caso de revisión de contratos legales, esta metodología ofrece mejoras significativas tanto con respecto a los modelos base como a los enfoques tradicionales de ajuste supervisado (SFT), y RFT logra las puntuaciones agregadas más altas en todas las dimensiones de la evaluación. Para los equipos que crean sistemas de inteligencia artificial de misión crítica donde la calidad de la alineación impacta directamente los resultados comerciales, RFT con LLM como juez ofrece un camino convincente a seguir. La explicabilidad, la flexibilidad y el rendimiento superior de la metodología la hacen particularmente valiosa para dominios complejos como la revisión legal (o servicios financieros o atención médica) donde los matices sutiles importan.
Las organizaciones que estén considerando este enfoque deberían comenzar poco a poco: validar el diseño de sus jueces en puntos de referencia seleccionados, verificar la resiliencia de la infraestructura y escalar gradualmente mientras monitorean la piratería de recompensas. Con una implementación adecuada, RFT puede transformar modelos base capaces en sistemas altamente especializados y listos para producción que entreguen consistentemente resultados alineados y confiables.
Referencias:
Guía para desarrolladores de Amazon Nova para Amazon Nova 2 Nova Forge SDK: ajuste fino de refuerzo de GitHub (RFT) con modelos de Amazon Nova
Descargo de responsabilidad:
El caso de uso de revisión de contrato legal descrito en esta publicación es solo para fines de demostración técnica. El análisis de contratos generado por IA no sustituye al asesoramiento jurídico profesional. Consulte a un asesor legal calificado para asuntos legales.