Cómo uniopen personalizó Amazon Nova según sus políticas de moderación minorista para la implementación de producción

uniopen es una plataforma de membresía y comunicación digital lanzada por Uni-President Enterprises Group de Taiwán, que conecta a los clientes con el comercio electrónico, los beneficios de membresía y otras experiencias minoristas a través de canales web, tabletas y dispositivos móviles.

A través de esos canales, uniopen aplica una política de moderación que clasifica cada interacción en dos ejes. La primera es qué comportamiento ocurrió (nueve categorías) y la segunda es a qué tema se refiere el comportamiento (marca, otro o prohibido). Ambos deben ser correctos para que una decisión de moderación sea útil, y ambos son específicos del negocio de Uniopen en lugar de algo que se pueda esperar que un modelo de propósito general aprenda de manera inmediata.

En esta publicación, mostramos cómo el equipo adaptó Amazon Nova 2 Lite a estas políticas de moderación específicas de la empresa mediante ajustes supervisados ​​en Amazon SageMaker AI y una optimización final de la salida a nivel de solicitud. El enfoque de AWS mantuvo los datos de corrección, la capacitación administrada, la evaluación y los controles de implementación en un flujo de trabajo repetible. La disponibilidad del modelo varía según la región de AWS. Consulte Modelos admitidos por región de AWS en Amazon Bedrock.

La Figura 1 muestra las experiencias web, tabletas y móviles cubiertas por esta política de moderación.

Figura 1: experiencia digital de Uniopen en canales web, tabletas y dispositivos móviles

En todos estos canales, la misma taxonomía de moderación y criterios de publicación ayudan al equipo a tomar decisiones coherentes a medida que cambian los formatos y temas de interacción.

Descripción general de la solución

La arquitectura separa la ruta de moderación de la producción de la corrección, la capacitación, la evaluación y la implementación. Amazon Nova 2 Lite maneja las solicitudes de moderación principales. Amazon Nova 2 Pro admite la generación de correcciones candidatas para errores informados, pero un revisor humano debe verificar cada corrección antes de que pueda ingresar al conjunto de capacitación. Con esta separación, el equipo puede mejorar el comportamiento específico del dominio sin tratar las etiquetas generadas como verdad básica.

Amazon Simple Storage Service (Amazon S3) almacena el conjunto de correcciones verificadas y los datos de entrenamiento. Amazon DynamoDB realiza un seguimiento de las configuraciones de modelos activos y candidatos. Argo Workflows en Amazon Elastic Kubernetes Service (Amazon EKS) organiza una optimización, evaluación e implementación rápidas, y Argo CD aplica configuraciones aprobadas a la producción. Amazon Simple Notification Service (Amazon SNS) y Amazon CloudWatch notifican a los operadores cuando falla una puerta física o un candidato necesita atención. Estos componentes administrados de AWS mantienen los datos, la capacitación, el estado de configuración y los controles operativos en un flujo de trabajo gobernado.

Los controles responsables de IA complementan la personalización del modelo. La revisión humana sigue siendo obligatoria para casos ambiguos y para correcciones reutilizadas como datos de entrenamiento. Los conjuntos de pruebas fijos y las comprobaciones de regresión impiden la promoción automática cuando la calidad disminuye. Los equipos también pueden aplicar filtros de contenido de Amazon Bedrock Guardrails a las entradas y salidas, monitorear errores en categorías de comportamiento y temas, minimizar los datos retenidos de los clientes y revalidar los umbrales a medida que cambian las políticas de moderación.

La Figura 2 muestra cómo un error informado se convierte en una corrección verificada por humanos, ingresa al conjunto de correcciones de Amazon S3 y desencadena el flujo de trabajo de evaluación e implementación.

Flujo de trabajo que conecta usuarios, modelos de Amazon Nova, Amazon S3, DynamoDB y Argo Workflows en Amazon EKS.

Figura 2: Circuito de retroalimentación verificado por humanos para mejorar continuamente la moderación del contenido minorista

El usuario primero consulta la configuración activa de Amazon Nova 2 Lite. Cuando el usuario informa un error, el flujo de trabajo de corrección crea una etiqueta candidata, obtiene verificación humana y escribe el ejemplo aprobado en Amazon S3. El flujo de trabajo de orquestación lee el conjunto de correcciones, crea una solicitud de candidato o un modelo personalizado, lo evalúa y actualiza DynamoDB solo después de que el candidato pasa las puertas requeridas.

La Figura 3 amplía la ruta de decisión de puerta dura y blanda que controla si un candidato se detiene, espera la aprobación humana o pasa a producción.

Flujo de decisiones para detener, promocionar automáticamente o enviar a un candidato a la aprobación humana.

Figura 3: Flujo de evaluación de puerta dura y blanda utilizado para controlar el modelo y promover la promoción

Dos tipos de controles controlan la promoción: puertas duras y puertas suaves. Las puertas duras son pruebas de regresión que hay que pasar. Las puertas blandas son señales de advertencia, como baja confianza o una caída en el rendimiento para una clase específica.

Una falla en la puerta física detiene el flujo de trabajo y envía una alerta. A los candidatos que pasan la puerta dura se les verifican los indicadores de la puerta suave. Si no se detecta ninguna advertencia, el candidato puede ser promovido automáticamente. Si se activa una advertencia de puerta suave, el candidato permanece pendiente y requiere revisión y aprobación del administrador antes de la implementación.

Enfoque de evaluación

Una ventana de conversación es un segmento delimitado de una conversación con un cliente que se trata como un ejemplo de capacitación o evaluación. Las tres configuraciones se evaluaron en el mismo conjunto de prueba de 737 ventanas de conversación. El conjunto de datos de ajuste contenía 3391 ventanas de entrenamiento. El equipo comparó el modelo de referencia, el modelo ajustado y el modelo ajustado optimizado rápidamente en este conjunto de pruebas consistente.

La macro por comportamiento F1 mide la coherencia con la que el modelo clasifica los nueve comportamientos de moderación como grupo. Cada comportamiento contribuye por igual a la puntuación, por lo que un buen desempeño en categorías comunes o más fáciles no puede ocultar un desempeño débil en categorías más difíciles. Para uniopen, esto es importante porque el sistema de moderación debe funcionar en todo el conjunto de políticas, no solo en el comportamiento más frecuente.

La macro de tipo de sujeto F1 mide la coherencia con la que el modelo identifica el tipo de tema involucrado: marca, otro o prohibido. Cada tipo de materia contribuye igualmente a la puntuación. Esto es importante porque una decisión de moderación es más útil cuando el sistema no sólo detecta un comportamiento relevante para las políticas sino que también comprende correctamente a qué entidad se refiere el comportamiento. Juntas, las dos métricas muestran la detección de políticas y la comprensión del tema en la misma escala de 0 a 1.

Rendimiento de referencia

El modelo base estableció una línea de base útil, pero aún mostró una brecha significativa en el aprendizaje de la taxonomía de moderación específica de Uniopen. Sin ajustes finos, Amazon Nova 2 Lite logró una macro F1 por comportamiento de 0,5852 y una macro F1 de tipo de sujeto de 0,4162. Estos puntajes muestran que el modelo aún no había aprendido lo suficientemente bien la taxonomía de moderación específica de Uniopen para su uso en producción.

Personalización de la IA de Amazon SageMaker

Luego, el equipo personalizó Amazon Nova 2 Lite mediante ajustes supervisados ​​con adaptación de bajo rango (LoRA) en Amazon SageMaker AI. El ajuste fino permitió que el modelo aprendiera de ejemplos de tareas específicas en lugar de depender únicamente de instrucciones rápidas. La Figura 4 muestra el trabajo de capacitación de IA de Amazon SageMaker completado y la configuración registrada utilizada para la ejecución de personalización.

Figura 4: Trabajo de ajuste fino supervisado por Amazon SageMaker AI para Amazon Nova 2 Lite

El registro del trabajo de capacitación captura el modelo base, la técnica de personalización, la ubicación de los datos de capacitación, el tiempo de ejecución y el progreso para auditoría y repetibilidad. El ajuste fino produjo la mayor ganancia de rendimiento. La macro F1 por comportamiento aumentó de 0,5852 a 0,8364, mientras que la macro F1 de tipo de sujeto aumentó de 0,4162 a 0,8302. La métrica de tipo de sujeto superó su objetivo de producción, mientras que la clasificación de comportamiento se acercó a su objetivo.

Optimización inmediata

Después del ajuste, el equipo realizó un cambio a nivel de solicitud para simplificar la salida del modelo de JSON a un formato basado en líneas y aclarar cómo se deben devolver múltiples comportamientos. Este cambio no requirió capacitación adicional del modelo.

La optimización rápida aumentó la macro F1 por comportamiento de 0,8364 a 0,8550 y la macro F1 de tipo de sujeto de 0,8302 a 0,8491. Con este paso final, ambas métricas superaron sus objetivos de producción de 0,8500 y 0,8200, respectivamente.

Resultados

La Tabla 1 resume el rendimiento de la línea base de Amazon Nova 2 Lite, el modelo optimizado de IA de Amazon SageMaker y el modelo optimizado de avisos.

Tabla 1: Rendimiento de clasificación en las etapas de optimización

Métrica Línea base Ajustada (JSON) Solicitud optimizada (LF) Objetivo de producción Por comportamiento Macro F1 0,5852 0,8364 0,8550 ≥ 0,8500 Tipo de sujeto Macro F1 0,4162 0,8302 0,8491 ≥ 0,8200

Las dos métricas expusieron diferentes debilidades en cada etapa. La línea de base necesitaba mejoras tanto en la detección de comportamiento como en la comprensión del sujeto. El ajuste fino de la IA de Amazon SageMaker produjo la mayor ganancia, especialmente en la macro de tipo de sujeto F1, lo que muestra el valor de los ejemplos de dominios específicos para la taxonomía de uniopen. Luego, la optimización inmediata llevó ambas métricas por encima de sus objetivos de producción sin otra ejecución de capacitación. El uso de ambas métricas como puertas de liberación evitó que una mejora en una dimensión ocultara una regresión en la otra.

Una vez que ambas métricas superaron sus objetivos de publicación, uniopen pudo dirigir la moderación de rutina a la ruta personalizada y mantener la revisión humana enfocada en casos ambiguos. Este modelo operativo reduce la escalada innecesaria y al mismo tiempo preserva un punto de decisión humana para contenido incierto o sensible a políticas.

Próximos pasos

El equipo continuará utilizando la macro F1 por comportamiento y la macro tipo sujeto F1 como puertas de producción. Recopilará nuevos casos de límites del tráfico real y los utilizará para decidir si la próxima mejora debe ser un cambio rápido u otro ciclo de ajuste específico. El mismo patrón de evaluación puede extenderse a escenarios adicionales de moderación minorista mientras los revisores humanos permanecen centrados en casos ambiguos.

Conclusión

Los resultados de Uniopen muestran cómo una evaluación relevante para el negocio puede identificar dónde un modelo básico necesita adaptación. El ajuste supervisado abordó las brechas de clasificación específicas del dominio y la optimización rápida capturó ganancias adicionales sin otra ejecución de capacitación. El patrón repetible es medir, identificar la dimensión más débil, aplicar el cambio objetivo y promover solo cuando pase cada puerta de liberación.

Para explorar los servicios y técnicas de esta publicación, visite la página del servicio Amazon SageMaker AI, lea la documentación de ajuste fino de Amazon Nova y revise Solicitar a Amazon Nova 2 la moderación de contenido. Para conocer las medidas de seguridad de producción, consulte la documentación de Amazon Bedrock Guardrails.

Sobre los autores

Félix Chin

Felix es Gerente de Ingeniería en UNI-PCSC y se especializa en inteligencia artificial, búsqueda, comercio electrónico, tecnologías en la nube e ingeniería de plataformas. Su trabajo cubre sistemas AWS escalables, servicios backend distribuidos, mensajería en tiempo real y confiabilidad de la plataforma. También se centra en la aplicación de la IA a las experiencias de productos y a los flujos de trabajo de ingeniería de software, incluidos los agentes de codificación, la evaluación y la automatización.

Jia-You Lin (Chris)

Jia-You Lin (Chris)

Jia-You es un ingeniero de software y nube con experiencia en infraestructura de nube, FinOps, aprendizaje automático e IA generativa. Con experiencia en investigación interdisciplinaria que abarca la atención médica y el comportamiento humano, Chris cree en el poder de la automatización y la simplicidad, creando soluciones prácticas y elegantes que reducen la complejidad y permiten que las personas se centren en lo que importa.

Ray Wang

Ray Wang

Ray es arquitecto senior de soluciones en AWS. Con 15 años de experiencia en la industria de TI, Ray se dedica a crear soluciones modernas en la nube, especialmente en NoSQL, big data, aprendizaje automático e IA generativa. Como un emprendedor hambriento, aprobó los 12 certificados AWS y 4 Anthropic para hacer que su campo técnico no solo sea profundo sino amplio. Le encanta leer y ver películas de ciencia ficción en su tiempo libre.

David Hung

David Hung

David es gerente técnico de cuentas en Amazon Web Services y se especializa en AWS Enterprise Support para clientes de las industrias minorista y de iGaming. Con 5 años de experiencia en tecnología de la nube, a David le apasiona ayudar a los clientes empresariales a maximizar el valor de sus inversiones en la nube. Sus áreas de especialización incluyen gestión financiera en la nube, observabilidad y soluciones de inteligencia artificial generativa, donde colabora estrechamente con los clientes para impulsar la excelencia operativa y la innovación en AWS.

Linpo Guo

Linpo es arquitecto de aprendizaje profundo en AWS. Antes de AWS, pasó años creando algoritmos de búsqueda y recomendación. Ahora trabaja en soluciones de inteligencia artificial (arquitectura de sistemas algorítmicos e implementación de producción) para clientes en industrias como las finanzas y el comercio electrónico.