Los modelos de lenguajes grandes (LLM) funcionan bien en tareas generales, pero tienen dificultades con trabajos especializados que requieren comprender datos propietarios, procesos internos y terminología específica de la industria. El ajuste supervisado (SFT) adapta los LLM a estos contextos organizacionales. SFT se puede implementar a través de dos metodologías distintas: Ajuste fino eficiente en parámetros (PEFT), que actualiza solo un subconjunto de parámetros del modelo, ofreciendo un entrenamiento más rápido y costos computacionales más bajos mientras mantiene mejoras de rendimiento razonables; SFT de rango completo, que actualiza todos los parámetros del modelo en lugar de un subconjunto e incorpora más conocimiento de dominio que PEFT.
Las OFV de rango completo a menudo enfrentan un desafío: el olvido catastrófico. A medida que los modelos aprenden patrones de dominios específicos, pierden capacidades generales, incluido el seguimiento de instrucciones, el razonamiento y el conocimiento amplio. Las organizaciones deben elegir entre experiencia en el dominio e inteligencia general, lo que limita la utilidad del modelo en los casos de uso empresarial.
Amazon Nova Forge soluciona el problema. Nova Forge es un nuevo servicio que puede utilizar para crear sus propios modelos de frontera utilizando Nova. Los clientes de Nova Forge pueden comenzar su desarrollo desde los primeros puntos de control del modelo, combinar datos propietarios con datos de capacitación seleccionados por Amazon Nova y alojar sus modelos personalizados de forma segura en AWS.
En esta publicación, compartimos los resultados de la evaluación integral de Nova Forge realizada por el equipo de ciencias aplicadas de AWS China mediante una desafiante tarea de clasificación de la voz del cliente (VOC), comparada con modelos de código abierto. Trabajando con más de 16.000 muestras de comentarios de clientes en una compleja jerarquía de etiquetas de cuatro niveles que contiene 1.420 categorías de hojas, demostramos cómo el enfoque de combinación de datos de Nova Forge proporciona dos ventajas:
Mejoras en el rendimiento de las tareas en el dominio: lograr mejoras del 17 % en la puntuación F1. Capacidades generales preservadas: mantener puntuaciones de MMLU (comprensión masiva del lenguaje multitarea) casi basales y capacidades de seguimiento de instrucciones después del ajuste.
El desafío: clasificación de los comentarios de los clientes en el mundo real
Considere un escenario típico en una gran empresa de comercio electrónico. El equipo de experiencia del cliente recibe miles de comentarios de clientes diariamente con comentarios detallados que abarcan la calidad del producto, experiencias de entrega, problemas de pago, usabilidad del sitio web e interacciones de servicio al cliente. Para operar de manera eficiente, necesitan un LLM que pueda clasificar automáticamente cada comentario en categorías procesables con alta precisión. Cada clasificación debe ser lo suficientemente específica para dirigir el problema al equipo correcto: logística, finanzas, desarrollo o servicio al cliente, y desencadenar el flujo de trabajo adecuado. Esto requiere especialización en el dominio.
Sin embargo, este mismo LLM no opera de forma aislada. En toda su organización, los equipos necesitan el modelo para:
Generar respuestas orientadas al cliente que requieren habilidades de comunicación generales. Realizar análisis de datos que requieren razonamiento matemático y lógico. Redactar documentación siguiendo pautas de formato específicas.
Esto requiere capacidades generales amplias: seguimiento de instrucciones, razonamiento, conocimiento en todos los dominios y fluidez conversacional.
Metodología de evaluación
Descripción general de la prueba
Para probar si Nova Forge puede ofrecer tanto especialización de dominio como capacidades generales, diseñamos un marco de evaluación dual que mide el rendimiento en dos dimensiones.
Para un rendimiento específico de un dominio, utilizamos un conjunto de datos de Voz del Cliente (VOC) del mundo real derivado de opiniones reales de clientes. El conjunto de datos contiene 14.511 muestras de capacitación y 861 muestras de prueba, que reflejan datos empresariales a escala de producción. El conjunto de datos emplea una taxonomía de cuatro niveles donde el Nivel 4 representa las categorías de hojas (objetivos de clasificación final). Cada categoría incluye una explicación descriptiva de su alcance. Categorías de ejemplo:
Nivel 1 Nivel 2 Nivel 3 Nivel 4 (categoría hoja) Instalación: configuración de la aplicación Guía de configuración inicial Proceso de configuración Experiencia de configuración sencilla: características del proceso de instalación y nivel de complejidad Uso: experiencia de hardware Rendimiento de visión nocturna Luz baja Calidad de imagen Claridad de visión nocturna: el modo de visión nocturna produce imágenes en condiciones de poca luz u oscuridad Uso: experiencia de hardware Funcionalidad de giro, inclinación y zoom Capacidad de rotación Rotación de 360 grados: la cámara puede girar 360 grados completos, brindando una cobertura panorámica completa Política y costo posventa Política de devolución y cambio Devolución ejecución del proceso Devolución del producto completada: Devolución del producto iniciada y completada por el cliente debido a problemas de funcionalidad
El conjunto de datos muestra un desequilibrio de clases extremo, típico de los entornos de comentarios de los clientes del mundo real. La siguiente imagen muestra la distribución de clases:
Como resultado, el conjunto de datos plantea un desafío importante a la precisión de la clasificación.
Para evaluar las capacidades de propósito general, utilizamos la división del conjunto de pruebas públicas del punto de referencia MMLU (Massive Multitask Language Understanding) (todos los subconjuntos). La prueba abarca materias de humanidades, ciencias sociales, ciencias duras y otras áreas que es importante aprender para algunas personas. En esta publicación, MMLU sirve como proxy para la retención de capacidad general. Lo usamos para medir si el ajuste supervisado mejora el rendimiento del dominio a costa de degradar los comportamientos fundamentales del modelo y para evaluar la eficacia de la combinación de datos de Nova para mitigar el olvido catastrófico.
Descripción del artículo Muestras totales 15 372 opiniones de clientes Jerarquía de etiquetas Clasificación de 4 niveles, 1420 categorías en total Conjunto de capacitación 14 511 muestras Conjunto de pruebas 861 muestras MMLU Comparación de todos (división de pruebas) 14 000 muestras
Evaluación de tareas en el dominio: voz de la clasificación del cliente
Para comprender cómo se desempeña Nova Forge en escenarios empresariales reales, primero evaluamos la precisión del modelo en la tarea de clasificación de VOC antes y después del ajuste fino supervisado. Con este enfoque, podemos cuantificar las ganancias en la adaptación del dominio y al mismo tiempo establecer una línea de base para el análisis de solidez posterior.
Evaluación del modelo base
Comenzamos con una evaluación del modelo base para evaluar el rendimiento listo para usar en la tarea de clasificación de COV sin ningún ajuste específico de la tarea. Esta configuración establece la capacidad inherente de cada modelo para manejar una clasificación altamente granular bajo estrictas restricciones de formato de salida. El siguiente mensaje se utiliza para la tarea de clasificación de COV:
# Definición de rol
Eres un riguroso sistema de clasificación de la experiencia del cliente. Su única responsabilidad es asignar los comentarios de los usuarios a la taxonomía de etiquetas existente en el nivel 1 al nivel 4 (L1-L4). Debe seguir estrictamente la estructura de taxonomía predefinida y no debe crear, modificar ni inferir ninguna etiqueta nueva.
## Principios operativos
### 1. Alineación estricta de la taxonomía
Todas las clasificaciones deben basarse completamente en la taxonomía de etiquetas proporcionada y adherirse estrictamente a su estructura jerárquica.
### 2. Descomposición de retroalimentación utilizando principios MECE
Un solo comentario de un usuario puede contener uno o varios problemas. Debe analizar cuidadosamente todos los problemas descritos y descomponer los comentarios en múltiples segmentos que no se superpongan, siguiendo el principio MECE (Mutuamente Exclusivo, Colectivamente Exhaustivo):
– **Singularidad semántica**: cada segmento describe solo un problema, función, servicio o punto de contacto (por ejemplo, precio, rendimiento o interfaz de usuario).
– **Independencia**: Los segmentos no deben superponerse en significado.
– **Cobertura completa**: Toda la información del comentario original debe conservarse sin omisiones.
### 3. Sin expansión de taxonomía
No debe inventar, inferir ni modificar ninguna etiqueta o nivel de taxonomía.
## Taxonomía de etiquetas
La siguiente sección proporciona la taxonomía de la etiqueta: {categoría de etiqueta}. Utilice esta taxonomía para realizar la clasificación L1-L4 para la retroalimentación VOC original. No se permite ninguna expansión de taxonomía.
## Instrucciones de tarea
Recibirá un comentario del usuario: {comentario del usuario}. Los usuarios pueden provenir de diferentes regiones y usar diferentes idiomas. Debe comprender con precisión el lenguaje y la intención del usuario antes de asignar etiquetas.
Consulte los ejemplos proporcionados para conocer el formato de etiquetado esperado.
## Formato de salida
Devuelve los resultados de la clasificación únicamente en formato JSON. Para cada segmento de comentarios, genere el texto original junto con las etiquetas y opiniones L1 a L4 correspondientes. No genere ni reescriba contenido.
“`json
[
{
"contenido": "",
"L1": "",
"L2": "",
"L3": "",
"L4": "",
"emoción": ""
}
]
“`
Para la evaluación del modelo base, seleccionamos:
Modelo Precisión Retirada F1-Score Nova 2 Lite 0,4596 0,3627 0,387 Qwen3-30B-A3B 0,4567 0,3864 0,394
Las puntuaciones F1 revelan que Nova 2 Lite y Qwen3-30B-A3B demuestran un rendimiento comparable en esta tarea específica de dominio, y ambos modelos alcanzaron puntuaciones F1 cercanas a 0,39. Estos resultados también resaltan la dificultad inherente de la tarea: incluso los modelos con bases sólidas luchan con la clasificación de etiquetas detallada cuando no se proporcionan datos específicos del dominio.
Ajuste supervisado
Luego aplicamos un ajuste fino supervisado (SFT) de parámetros completos utilizando los datos de COV del cliente. Todos los modelos se ajustan utilizando el mismo conjunto de datos y configuraciones de entrenamiento comparables para una comparación justa.
Infraestructura de formación:
Comparación del rendimiento de tareas en el dominio
Modelo Datos de entrenamiento Precisión Recuperación F1-Score Nova 2 Lite Ninguno (valor de referencia) 0,4596 0,3627 0,387 Nova 2 Lite Solo datos del cliente 0,6048 0,5266 0,5537 Qwen3-30B Solo datos del cliente 0,5933 0,5333 0,5552
Después de realizar ajustes únicamente en los datos del cliente, Nova 2 Lite logra una mejora sustancial en el rendimiento, con F1 aumentando de 0,387 a 0,5537, una ganancia absoluta de 17 puntos. Este resultado coloca al modelo Nova en el nivel superior para esta tarea y hace que su rendimiento sea comparable al del modelo de código abierto Qwen3-30B perfeccionado. Estos resultados confirman la eficacia de SFT de parámetros completos de Nova para cargas de trabajo de clasificación empresarial complejas.
Evaluación de capacidades generales: punto de referencia MMLU
Los modelos ajustados para la clasificación de VOC a menudo se implementan más allá de una sola tarea y se integran en flujos de trabajo empresariales más amplios. Es importante preservar las capacidades de propósito general. Los puntos de referencia estándar de la industria, como MMLU, proporcionan un mecanismo eficaz para evaluar capacidades de propósito general y detectar olvidos catastróficos en modelos ajustados.
Para el modelo Nova optimizado, Amazon SageMaker HyperPod ofrece recetas de evaluación listas para usar que agilizan la evaluación MMLU con una configuración mínima.
Modelo Datos de entrenamiento VOC F1-Score MMLU precisión Nova 2 Lite Ninguno (valor de referencia) 0,38 0,75 Nova 2 Lite Solo datos del cliente 0,55 0,47 Nova 2 Lite 75 % del cliente + 25 % Datos de Nova 0,5 0,74 Qwen3-30B Solo datos del cliente 0,55 0,0038
Cuando Nova 2 Lite se ajusta utilizando únicamente los datos del cliente, observamos una caída significativa en la precisión de MMLU de 0,75 a 0,47, lo que indica la pérdida de capacidades de uso general. La degradación es aún más pronunciada en el modelo Qwen, que pierde en gran medida la capacidad de seguir instrucciones después de un ajuste fino. Un ejemplo de salida degradada del modelo Qwen:
{ "predicción": "[n {n "contenido": "x^5 + 3x^3 + x^2 + 2x en Z_5",n "A": "0",n "B": "1",n "C": "0,1",n "D": "0,4",n "emoción": "neutral"n }n]" }
Este comportamiento también está relacionado con el diseño de indicaciones de VOC, donde el conocimiento de la categoría se internaliza mediante un ajuste supervisado, un enfoque común en los sistemas de clasificación a gran escala.
En particular, cuando se aplica la mezcla de datos de Nova durante el ajuste fino, Nova 2 Lite conserva un rendimiento general cercano al inicial. La precisión de MMLU se mantiene en 0,74, sólo 0,01 por debajo de la línea de base original, mientras que VOC F1 aún mejora en 12 puntos (0,38 → 0,50). Esto valida que la combinación de datos de Nova es un mecanismo práctico y eficaz para mitigar el olvido catastrófico y al mismo tiempo preservar el rendimiento del dominio.
Hallazgos clave y recomendaciones prácticas
Esta evaluación muestra que cuando el modelo base proporciona una base sólida, el ajuste fino supervisado de todos los parámetros en Amazon Nova Forge puede generar ganancias sustanciales para tareas complejas de clasificación empresarial. Al mismo tiempo, los resultados confirman que el olvido catastrófico es una preocupación real en los flujos de trabajo de ajuste de producción. El solo ajuste de los datos del cliente puede degradar las capacidades de propósito general, como seguir instrucciones y razonar, limitando la usabilidad de un modelo en escenarios comerciales más amplios.
La capacidad de combinación de datos de Nova Forge proporciona una estrategia de mitigación eficaz. Al combinar los datos de los clientes con conjuntos de datos seleccionados por Nova durante el ajuste, los equipos pueden preservar capacidades generales cercanas a la base y al mismo tiempo seguir logrando un sólido rendimiento específico del dominio.
Según estos hallazgos, recomendamos las siguientes prácticas al utilizar Nova Forge:
Utilice ajustes supervisados para maximizar el rendimiento en el dominio para tareas complejas o altamente personalizadas. Aplique la combinación de datos de Nova cuando se espera que los modelos admitan múltiples flujos de trabajo de propósito general en producción, para reducir el riesgo de olvidos catastróficos.
Juntas, estas prácticas ayudan a equilibrar la personalización del modelo con la solidez de la producción, lo que permite una implementación más confiable de modelos optimizados en entornos empresariales.
Conclusión
En esta publicación, demostramos cómo las organizaciones pueden crear modelos de IA especializados sin sacrificar la inteligencia general con las capacidades de combinación de datos de Nova Forge. Dependiendo de sus casos de uso y objetivos comerciales, Nova Forge puede ofrecer otros beneficios, incluidos puntos de control de acceso en todas las fases del desarrollo del modelo y realización de aprendizaje reforzado con funciones de recompensa en su entorno. Para comenzar con sus experimentos, consulte la Guía para desarrolladores de Nova Forge para obtener documentación detallada.
Sobre los autores
Yuan Wei es científico aplicado en Amazon Web Services y trabaja con clientes empresariales en pruebas de conceptos y asesoramiento técnico. Se especializa en modelos de lenguaje grande y modelos de visión-lenguaje, con un enfoque en la evaluación de técnicas emergentes bajo restricciones de datos, costos y sistemas del mundo real.
Xin Hao es especialista sénior en comercialización de IA/ML en AWS y ayuda a los clientes a lograr el éxito con los modelos de Amazon Nova y las soluciones de IA generativa relacionadas. Tiene una amplia experiencia práctica en computación en la nube, IA/ML e IA generativa. Antes de unirse a AWS, Xin pasó más de 10 años en el sector de fabricación industrial, incluida la automatización industrial y el mecanizado CNC.
Sharon Li es arquitecta de soluciones especializada en IA/ML en Amazon Web Services (AWS) con sede en Boston, Massachusetts. Con una pasión por aprovechar la tecnología de vanguardia, Sharon está a la vanguardia del desarrollo e implementación de soluciones innovadoras de IA generativa en la plataforma en la nube de AWS.