Ajuste de refuerzo con LLM-as-a-juez | Inteligencia artificial

Los modelos de lenguaje grande (LLM) ahora impulsan los agentes conversacionales, las herramientas creativas y los sistemas de soporte de decisiones más avanzados. Sin embargo, su producción bruta a menudo contiene imprecisiones, desalineamientos de políticas o frases inútiles, cuestiones que socavan la confianza y limitan la utilidad en el mundo real. El ajuste fino de refuerzo (RFT) se ha convertido en el método preferido para alinear estos modelos de manera eficiente, utilizando señales de recompensa automatizadas para reemplazar el costoso etiquetado manual.

En el corazón del RFT moderno se encuentran las funciones de recompensa. Están creados para cada dominio a través de funciones de recompensa verificables que pueden calificar generaciones de LLM a través de un fragmento de código (aprendizaje por refuerzo con recompensas verificables o RLVR) o con LLM como juez, donde un modelo de lenguaje separado evalúa las respuestas de los candidatos para guiar la alineación (aprendizaje por refuerzo con retroalimentación de IA o RLAIF). Ambos métodos proporcionan puntuaciones al algoritmo RL para impulsar al modelo a resolver el problema en cuestión. En esta publicación, analizamos en profundidad cómo RLAIF o RL con LLM como juez funcionan eficazmente con los modelos de Amazon Nova.

¿Por qué RFT con LLM como juez en comparación con RFT genérico?

El ajuste fino del refuerzo puede utilizar cualquier señal de recompensa, reglas sencillas hechas a mano (RLVR) o un LLM que evalúe los resultados del modelo (LLM-as-a-judge o RLAIF). RLAIF hace que la alineación sea mucho más flexible y poderosa, especialmente cuando las señales de recompensa son vagas y difíciles de elaborar manualmente. A diferencia de las recompensas RFT genéricas que se basan en una puntuación numérica contundente, como la coincidencia de subcadenas, un juez de LLM razona en múltiples dimensiones (corrección, tono, seguridad, relevancia) y proporciona comentarios conscientes del contexto que capturan sutilezas y matices específicos del dominio sin un reentrenamiento específico de la tarea. Además, los jueces de LLM ofrecen explicabilidad incorporada a través de fundamentos (por ejemplo, "La respuesta A cita estudios revisados ​​por pares"), proporcionando diagnósticos que aceleran la iteración, identifican modos de falla directamente y reducen desalineaciones ocultas, algo que las funciones de recompensa estáticas no pueden hacer.

Implementación de LLM como juez: seis pasos críticos

Esta sección cubre los pasos clave involucrados en el diseño e implementación de funciones de recompensa de LLM como juez.

Seleccione la arquitectura del juez

La primera decisión crítica es seleccionar la arquitectura de su juez. LLM-as-a-juez ofrece dos modos de evaluación principales: evaluación basada en rúbricas (basada en puntos) y evaluación basada en preferencias, cada una adecuada para diferentes escenarios de alineación.

Criterios Evaluación basada en rúbricas Evaluación basada en preferencias Método de evaluación Asigna una puntuación numérica a una sola respuesta usando criterios predefinidos Compara dos respuestas candidatas una al lado de la otra y selecciona la superior Medición de calidad Mediciones de calidad absoluta Calidad relativa a través de comparación directa Se prefiere cuando existen dimensiones de evaluación claras y cuantificables (precisión, integridad, cumplimiento de seguridad) El modelo de política debe explorar libremente sin restricciones de datos de referencia Requisitos de datos Solo requiere una ingeniería rápida y cuidadosa para alinear el modelo para recompensar las especificaciones Requiere al menos una respuesta muestra para comparación de preferencias Generalizabilidad Mejor para datos fuera de distribución, evita sesgos en los datos Depende de la calidad de las respuestas de referencia Estilo de evaluación Refleja los sistemas de puntuación absoluta Refleja la evaluación humana natural a través de la comparación Punto de partida recomendado Comience aquí si los datos de preferencia no están disponibles y el RLVR no es adecuado Usar cuando haya datos comparativos disponibles

Define tus criterios de evaluación

Una vez que haya seleccionado su tipo de juez, articule las dimensiones específicas que desea mejorar. Unos criterios de evaluación claros son la base de una formación eficaz de RLAIF.

Para jueces basados ​​en preferencias:

Escriba indicaciones claras que expliquen qué hace que una respuesta sea mejor que otra. Sea explícito sobre las preferencias de calidad con ejemplos concretos. Ejemplo: "Prefiera respuestas que citen fuentes autorizadas, utilicen un lenguaje accesible y aborden directamente la pregunta del usuario".

Para jueces basados ​​en rúbricas:

Recomendamos utilizar puntuación booleana (aprobado/reprobado) para jueces basados ​​en rúbricas. La puntuación booleana es más confiable y reduce la variabilidad de los jueces en comparación con las escalas detalladas del 1 al 10. Defina criterios claros de aprobación/reprobación para cada dimensión de evaluación con características específicas y observables.

Selecciona y configura tu modelo de juez

Elija un LLM con suficiente capacidad de razonamiento para evaluar su dominio de destino, configurado a través de Amazon Bedrock y llamado mediante una función de recompensa de AWS Lambda. Para dominios comunes como matemáticas, codificación y capacidades conversacionales, los modelos más pequeños pueden funcionar bien con una ingeniería cuidadosa y rápida.

Nivel de modelo Preferido por confiabilidad de costos Modelo Amazon Bedrock Grande/Pesado Razonamiento complejo, evaluación matizada, puntuación multidimensional Alto Muy Alto Amazon Nova Pro, Claude Opus, Claude Sonnet Medio/Ligero Dominios generales como matemáticas o codificación, costo-rendimiento equilibrado Bajo-Medio Moderado-Alto Amazon Nova 2 Lite, Claude Haiku

Refina el mensaje de tu modelo de juez

Su indicación de juez es la base de la calidad de la alineación. Diseñelo para producir resultados estructurados y analizables con dimensiones de puntuación claras:

Formato de salida estructurado: especifique JSON o formato analizable para una extracción sencilla. Reglas de puntuación claras: defina exactamente cómo se debe calcular cada dimensión. Manejo de casos extremos: aborde escenarios ambiguos (por ejemplo, "Si la respuesta está vacía, asigne una puntuación de 0") Comportamientos deseados: establezca explícitamente comportamientos a fomentar o desalentar

Alinear los criterios de los jueces con las métricas de evaluación de la producción

Su función de recompensa debe reflejar las métricas que utilizará para evaluar el modelo final en producción. Alinee su función de recompensa con los criterios de éxito de la producción para permitir modelos diseñados para los objetivos correctos.

Flujo de trabajo de alineación:

Defina criterios de éxito de producción (por ejemplo, precisión, seguridad) con umbrales aceptables. Asigne cada criterio a dimensiones específicas de puntuación del juez. Valide que las puntuaciones del juez se correlacionen con sus métricas de evaluación. Pruebe al juez en muestras representativas y casos extremos.

Creación de una función Lambda de recompensa sólida

Los sistemas RFT de producción procesan miles de evaluaciones de recompensas por paso de capacitación. Cree una función Lambda de recompensa resistente para ayudar a proporcionar estabilidad en el entrenamiento, uso eficiente de la computación y comportamiento confiable del modelo. Esta sección cubre cómo crear una función Lambda de recompensa que sea resistente, eficiente y lista para producción.

Estructuración de puntuación de recompensa compuesta

No confíe únicamente en los jueces de LLM. Combínelos con componentes de recompensa rápidos y deterministas que detecten fallas obvias antes de costosas evaluaciones de jueces:

Componentes principales

Componente Propósito Cuándo usarlo Corrección del formato Verificar la estructura JSON, los campos obligatorios y el cumplimiento del esquema Siempre: detecta resultados con formato incorrecto de inmediato. Comentarios baratos e instantáneos. Penalizaciones por extensión Desalentar respuestas demasiado detalladas o concisas Cuando la longitud de la salida es importante (por ejemplo, resúmenes) Coherencia del lenguaje Verificar que las respuestas coincidan con el idioma de entrada Crítico para aplicaciones multilingües Filtros de seguridad Comprobaciones basadas en reglas para contenido prohibido Siempre: evita que contenido inseguro llegue a producción

Preparación de la infraestructura

Implemente un retroceso exponencial: maneja los límites de velocidad de la API de Amazon Bedrock y las fallas transitorias con elegancia Estrategia de paralelización: utilice ThreadPoolExecutor o patrones asíncronos para paralelizar las llamadas de los jueces entre implementaciones para reducir la latencia Evite retrasos en el inicio en frío de Lambda: establezca un tiempo de espera de Lambda adecuado (se recomiendan 15 minutos) y una simultaneidad aprovisionada (~100 para configuraciones típicas) Manejo de errores: agregue un manejo integral de errores que devuelva recompensas neutrales/ruidosas (0,5) en lugar de fallar en todo el paso de capacitación

Pruebe su función Lambda de recompensa para mayor resiliencia

Validar la consistencia y calibración de los jueces:

Consistencia: pruebe al juez en las mismas muestras varias veces para medir la variación de la puntuación (debe ser baja para una evaluación determinista) Comparación entre jueces: compare puntuaciones entre diferentes modelos de jueces para identificar puntos ciegos en la evaluación Calibración humana: muestree periódicamente implementaciones para revisión humana para detectar la deriva de los jueces o errores sistemáticos Pruebas de regresión: cree un “conjunto de pruebas de jueces” con ejemplos conocidos buenos/malos para probar el comportamiento de los jueces en regresión

RFT con LLM como juez: flujo de trabajo de capacitación

El siguiente diagrama ilustra el proceso de capacitación completo de un extremo a otro, desde la evaluación inicial hasta la validación del juez y la implementación de producción. Cada paso se basa en el anterior, creando una canalización resistente que equilibra la calidad de la alineación con la eficiencia computacional al tiempo que previene activamente la piratería de recompensas y respalda el comportamiento del modelo listo para producción.

Estudio de caso del mundo real: automatización de la revisión de contratos legales

En esta sección, nos referimos a un caso de uso del mundo real con un socio líder de la industria legal. La tarea es generar comentarios de riesgos, evaluaciones y acciones sobre la documentación legal respecto de las pólizas y contratos anteriores como documentos de referencia.

Desafío

Partner estaba interesado en resolver el problema de automatizar el proceso de revisión, evaluación y señalización de riesgos en documentos contractuales legales. Específicamente, querían evaluar nuevos contratos potenciales en comparación con las pautas y regulaciones internas, contratos anteriores y leyes del país relacionadas con el contrato.

Solución

Formulamos este problema como uno en el que proporcionamos un documento de destino (el "contrato" que necesita evaluación) y un documento de referencia (el documento básico y el contexto) y esperamos que el LLM genere un JSON con múltiples comentarios, tipos de comentarios y acciones recomendadas a tomar en función de la evaluación. El conjunto de datos original disponible para este caso de uso era relativamente pequeño e incluía contratos completos junto con anotaciones y comentarios de expertos legales. Usamos LLM como juez usando el modelo GPT OSS 120b como juez y un mensaje de sistema personalizado durante RFT.

Flujo de trabajo RFT

En la siguiente sección cubrimos detalles de los aspectos clave en el flujo de trabajo RFT para este caso de uso.

Función Lambda de recompensa para LLM como juez

Los siguientes fragmentos de código presentan los componentes clave de la función Lambda de recompensa.

Nota: el nombre de la función Lambda debe tener "SageMaker", por ejemplo, "arn:aws:lambda:us-east-1:123456789012:function:MyRewardFunctionSageMaker"

a) Comience por definir un objetivo de alto nivel

# Evaluación de revisión de contratos: puntuación no ponderada Usted es un revisor de contratos experto que evalúa los comentarios generados por IA. Su objetivo PRINCIPAL es evaluar qué tan bien cada comentario previsto identifica problemas en las cláusulas del contrato de TargetDocument y si esos problemas están justificados por las pautas de referencia.

b) Definir el enfoque de evaluación

## Enfoque de evaluación Para cada muestra, recibe: – **TargetDocument**: el texto del contrato que se está revisando (el documento bajo evaluación) – **Referencia**: pautas/estándares de referencia utilizados para la revisión (los criterios de evaluación) – **Predicción**: uno o más comentarios del modelo de IA **Importante**: SystemPrompt muestra qué instrucciones recibió el modelo. Considere si el modelo siguió estas instrucciones al evaluar la calidad de la predicción. **CRÍTICO**: Cada comentario debe identificar un problema, brecha o preocupación específica EN EL MISMO TEXTO DEL CONTRATO DE TARGETDOCUMENT. El campo text_excerpt del comentario debe citar el lenguaje del contrato problemático del TargetDocument, NO citar el texto de las pautas de referencia. La Referencia justifica POR QUÉ la cláusula del contrato es problemática, pero el problema debe existir EN el contrato. Evalúe CADA comentario previsto de forma independiente. Los comentarios deben señalar problemas en las cláusulas del contrato, no simplemente citar requisitos de referencia.

c) Describir las dimensiones de la puntuación con especificaciones claras sobre cómo se debe calcular una puntuación en particular.

## Dimensiones de puntuación (por comentario) **ORDEN DE EVALUACIÓN**: Evalúe en esta secuencia: (1) TargetDocument_Grounding, (2) Reference_Consistency, (3) Procesabilidad ### 1. TargetDocument_Grounding **Evalúa**: (a) Si text_excerpt cita el texto del contrato de TargetDocument, y (b) Si el comentario es relevante para el text_excerpt citado **OBLIGATORIO**: text_excerpt debe citar el texto del contrato de TargetDocument. Si text_excerpt cita Referencia, la puntuación DEBE ser 1. – **5**: text_excerpt cita correctamente el texto del contrato de TargetDocument Y el comentario identifica un problema altamente relevante, válido y notable en ese texto citado – **4**: text_excerpt cita correctamente el texto del contrato de TargetDocument Y el comentario identifica un problema válido y relevante en ese texto citado – **3**: text_excerpt cita correctamente el texto del contrato de TargetDocument Y el comentario es algo relevante para ese texto citado, pero la preocupación tiene una validez moderada – **2**: text_excerpt cita correctamente el texto del contrato de TargetDocument PERO el comentario tiene poca relevancia para el texto citado, o la preocupación es cuestionable – **1**: text_excerpt NO cita el texto del contrato de TargetDocument (cita la referencia en su lugar, o no hay una cita real), O el comentario es irrelevante para el texto citado ### 2. Reference_Consistency… …

d) Definir claramente el formato de salida final a analizar

## Cálculo de puntuación **Comment_Score** = Promedio simple de las tres dimensiones: – Comment_Score = (TargetDocument_Grounding + Reference_Consistency + Actionability) / 3 **Aggregate_Score** = Promedio de todos los valores de Comment_Score para la muestra ## Formato de salida Para cada muestra, evalúe TODOS los comentarios previstos y proporcione: “`json { "comments": [ { "comment_id": "…", "TargetDocument_Grounding": {"score": X, "justification": "…", "supporting_evidence": "Verifique que text_excerpt cite el texto real del contrato de TargetDocument y que el comentario sea relevante"}, "Reference_Consistency": {"score": X, "justification": "…", "supporting_reference": "Cita de una referencia que justifique la preocupación O explique un razonamiento significativo"}, "Actionability": {"score": X, "justification": "Evaluar si la acción es clara, se basa en TargetDocument y Reference, y es relevante para el comentario"}, "Comment_Score": X.XX } ], "Aggregate_Score": { "score": X.XX, "total_comments": N, "rationale": "…" } } “`

e) Crear un controlador Lambda de alto nivel, que proporcione suficiente subproceso múltiple para una inferencia más rápida

def lambda_handler(evento, contexto): puntuaciones: Lista[RewardOutput] =[]muestras = evento max_workers = len(muestras) print(f"Evaluando {len(muestras)} elementos con {max_workers} subprocesos…") con ThreadPoolExecutor(max_workers=max_workers) como ejecutor: futuros = [executor.submit(judge_answer, muestra) para muestra en muestras] puntuaciones = [future.result() para futuro en futuros] print(f"Completado {len(scores)} evaluaciones") devuelve [asdict(score) para puntaje en puntajes]

Despliegue de la función Lambda

Utilizamos los siguientes permisos y configuraciones de AWS Identity and Access Management (IAM) en la función Lambda. Se requieren las siguientes configuraciones para las funciones Lambda de recompensa. El entrenamiento RFT puede fallar si falta alguno de ellos.

a) Permisos para la función de ejecución de IA de Amazon SageMaker

Su función de ejecución de Amazon SageMaker AI debe tener permiso para invocar su función Lambda. Agregue esta política a su función de ejecución de IA de Amazon SageMaker:

{ "Versión": "2012-10-17", "Declaración": [ { "Efecto": "Permitir", "Acción": [ "lambda:InvokeFunction" ], "Recurso": "arn:aws:lambda:region:account-id:function:function-name" } ] }

b) Permisos para el rol de ejecución de la función Lambda

La función de ejecución de su función Lambda necesita permisos básicos de ejecución de Lambda y permisos para invocar el modelo juez de Amazon Bedrock.

Nota: Esta solución sigue el modelo de responsabilidad compartida de AWS. AWS es responsable de proteger la infraestructura que ejecuta los servicios de AWS en la nube. Usted es responsable de proteger su código de función Lambda, configurar permisos de IAM, implementar controles de acceso y cifrado, administrar la seguridad y privacidad de los datos, configurar el monitoreo y el registro, y verificar el cumplimiento de las regulaciones aplicables. Siga el principio de privilegio mínimo al determinar el alcance de los permisos para ARN de recursos específicos. Para obtener más información, consulte Seguridad en AWS Lambda y Amazon SageMaker AI Security en la documentación de AWS.

Consola de AWS IAM que muestra los permisos de roles con las políticas AWSLambdaBasicExecutionRole y BedrockAccess adjuntas

c) Agregar simultaneidad aprovisionada

Publique una versión de Lambda y para permitir que la función escale sin fluctuaciones en la latencia, agregamos algo de simultaneidad aprovisionada. 100 fueron suficientes en este caso, sin embargo, aquí hay más margen para mejorar los costes.

Panel de administración de versiones de AWS Lambda que muestra 10 versiones publicadas, con las versiones 27 y 28 enumeradas en la página 1

d) Establezca el tiempo de espera de Lambda en 15 minutos

Panel de configuración general de AWS Lambda que muestra 128 MB de memoria, 512 MB de almacenamiento efímero y un tiempo de espera de 15 minutos

Personalización de la configuración del entrenamiento

Lanzamos el SDK de Nova Forge que se puede utilizar durante todo el ciclo de vida de personalización del modelo, desde la preparación de datos hasta la implementación y el monitoreo. Nova Forge SDK elimina la necesidad de buscar las recetas adecuadas o el URI del contenedor para técnicas específicas.

Puede usar el SDK de Nova Forge para personalizar los parámetros de entrenamiento de dos maneras: proporcionar una receta YAML completa usando receta_path o pasar campos específicos usando anulaciones para cambios selectivos. Para este caso de uso, utilizamos anulaciones para ajustar la configuración de implementación y del entrenador, como se muestra en la siguiente sección.

# Iniciar entrenamiento con anulaciones de recetas resultado = personalizador.train( job_name="my-rft-run", rft_lambda_arn="", overrides={ # Configuración de entrenamiento "max_length": 64000, "global_batch_size": 64, "reasoning_effort": Ninguno, # Datos "shuffle": False, # Rollout "type": "off_policy_async", "age_tolerance": 2, "proc_num": 6, "number_spawn": 8, "max_new_tokens": 16000, "set_random_seed": True, "temperature": 1, "top_k": 0, "lambda_concurrency_limit": 100, # Entrenador "max_steps": 516, "save_steps": 32, "save_top_k": 17, "refit_freq": 4, "clip_ratio_high": 0,28, "ent_coeff": 0,0, "loss_scale": 1, }, )

Resultados

RFT con Amazon Nova 2 Lite logró una puntuación agregada de 4,33 (el rendimiento más alto en todos los modelos evaluados) y al mismo tiempo mantuvo una validación perfecta del esquema JSON. Esto representa una mejora significativa, lo que demuestra que RFT puede producir modelos especializados listos para producción que superan a las alternativas más grandes de uso general.

Evaluamos modelos utilizando una configuración de comentario único "lo mejor de k", donde cada modelo generaba múltiples comentarios por muestra y calificamos el resultado de mayor calidad. Este enfoque establece un límite superior de rendimiento y permite una comparación justa entre modelos que producen resultados únicos versus múltiples.

Gráfico de barras horizontales que compara las puntuaciones de rendimiento relativas de cinco modelos de IA, con Nova 2.0-lite (RFT) y Nova 2.0-lite (SFT) empatados en la puntuación más alta de 1,00

Figura 1: Puntuaciones de validación del esquema JSON (escala de 0 a 1; cuanto más alto, mejor)

Gráfico de barras horizontales que compara las puntuaciones absolutas de rendimiento de cinco modelos de IA, con Nova 2.0-lite (RFT) con la puntuación más alta, 4,33 sobre 5,00.

Figura 2: Puntajes agregados de los jueces de LLM (escala de 1 a 5, cuanto más alto, mejor)

Conclusiones clave:

RFT logró el rendimiento más alto entre los modelos evaluados en este estudio.

Amazon Nova 2 Lite con RFT logró una puntuación total de 4,33, superando a Claude Sonnet 4.5 y Claude Haiku 4.5, y al mismo tiempo logró una validación perfecta del esquema JSON.

Elimina artefactos de entrenamiento innecesarios

Durante las iteraciones de SFT, observamos comportamientos problemáticos, incluida la generación de comentarios repetitivos y predicciones de caracteres Unicode poco naturales. Estos problemas, probablemente causados ​​por sobreajuste o desequilibrios en el conjunto de datos, no aparecieron en los puntos de control de RFT. Las mejoras basadas en recompensas de RFT naturalmente desalientan tales artefactos, produciendo resultados más sólidos y confiables.

Fuerte generalización a nuevos criterios de jueces.

Cuando evaluamos los modelos RFT utilizando un mensaje de juez modificado (alineado pero no idéntico a la función de recompensa de entrenamiento), el rendimiento se mantuvo sólido. Esto demuestra que RFT aprende patrones de calidad generalizables en lugar de sobreajustar criterios de evaluación específicos. Esta es una ventaja fundamental para la implementación en el mundo real donde los requisitos evolucionan.

Consideraciones de cálculo

RFT requirió entre 4 y 8 implementaciones por muestra de capacitación, lo que aumentó los costos de computación en comparación con SFT. Esta sobrecarga se amplifica cuando se utilizan configuraciones de esfuerzo de razonamiento distintas de cero. Sin embargo, para aplicaciones de misión crítica donde la calidad de la alineación afecta directamente los resultados comerciales, como la revisión de contratos legales, el cumplimiento financiero o la documentación de atención médica, las ganancias de rendimiento justifican los costos de computación adicionales.

Conclusión

El ajuste fino de refuerzo (RFT) con LLM como juez representa un enfoque poderoso para alinear los LLM para aplicaciones de dominios específicos. Como se demuestra en nuestro estudio de caso de revisión de contratos legales, esta metodología ofrece mejoras significativas tanto con respecto a los modelos base como a los enfoques tradicionales de ajuste supervisado (SFT), y RFT logra las puntuaciones agregadas más altas en todas las dimensiones de la evaluación. Para los equipos que crean sistemas de inteligencia artificial de misión crítica donde la calidad de la alineación impacta directamente los resultados comerciales, RFT con LLM como juez ofrece un camino convincente a seguir. La explicabilidad, la flexibilidad y el rendimiento superior de la metodología la hacen particularmente valiosa para dominios complejos como la revisión legal (o servicios financieros o atención médica) donde los matices sutiles importan.

Las organizaciones que estén considerando este enfoque deberían comenzar poco a poco: validar el diseño de sus jueces en puntos de referencia seleccionados, verificar la resiliencia de la infraestructura y escalar gradualmente mientras monitorean la piratería de recompensas. Con una implementación adecuada, RFT puede transformar modelos base capaces en sistemas altamente especializados y listos para producción que entreguen consistentemente resultados alineados y confiables.

Referencias:

Guía para desarrolladores de Amazon Nova para Amazon Nova 2 Nova Forge SDK: ajuste fino de refuerzo de GitHub (RFT) con modelos de Amazon Nova

Descargo de responsabilidad:

El caso de uso de revisión de contrato legal descrito en esta publicación es solo para fines de demostración técnica. El análisis de contratos generado por IA no sustituye al asesoramiento jurídico profesional. Consulte a un asesor legal calificado para asuntos legales.

Sobre los autores

Hemanth Kumar Jayakumar es científico aplicado en Amazon AGI, donde trabaja en aprendizaje por refuerzo y modelos básicos. Traduce las últimas investigaciones de ML en soluciones escalables, desbloqueando la especialización de dominios de modelos básicos para los clientes. Fuera del trabajo, a Hemanth le gusta viajar y hacer senderismo.

Daniel Suarez Souto es Arquitecto de Soluciones en Amazon Web Services, especializado en Inteligencia Artificial. Ayuda a los clientes a acelerar la adopción de la IA y a crear sistemas de IA seguros y escalables de extremo a extremo, convirtiendo los casos extremos del mundo real en patrones reutilizables que ayudan a los clientes a moverse más rápido. En su tiempo libre, a Daniel le gusta jugar fútbol, ​​correr y hacer senderismo.

Ajit Kumar KP es arquitecto senior de soluciones de socios de IA generativa en AWS, donde trabaja con clientes y socios empresariales que implementan soluciones de IA en la nube. Aporta una profunda experiencia en cerrar la brecha entre la ingeniería de plataformas y la IA a escala empresarial, habiendo creado soluciones de visión por computadora en el borde y soluciones AIML y IA generativa en la nube. A Ajit le gusta leer biografías y practicar deportes en su tiempo libre.

Bharathan Balaji es científico aplicado senior en Amazon Web Services y trabaja en aprendizaje por refuerzo y servicios de modelos básicos. Su trabajo se centra en desarrollar capacidades de IA que ayuden a los clientes a transformar sus negocios.