Explorando el razonamiento autodestilado para el ajuste supervisado con Amazon Nova

Cuando ajusta un modelo mediante el ajuste fino supervisado (SFT), crear rastros de razonamiento de cadena de pensamiento (CoT) de alta calidad para sus datos de entrenamiento a menudo no es práctico y puede resultar prohibitivamente costoso. Como resultado, puede optar por omitir el razonamiento durante SFT y entrenar solo con entradas y salidas. Sin embargo, el razonamiento es una capacidad clave de la familia de modelos Amazon Nova 2 y se ha demostrado que mejora significativamente el rendimiento de predicción en Nova y otros modelos de frontera, a menudo con mejoras de rendimiento en problemas difíciles como codificación y matemáticas. Con la personalización de Amazon Nova 2, puede utilizar el poder de los modelos de pensamiento en sus dominios específicos a través de técnicas como SFT y Reinforcement Fine-Tuning (RFT). Para SFT, un requisito clave para desbloquear estos beneficios es la disponibilidad de rastros dorados de CoT en el conjunto de datos de SFT, es decir, rastros de pensamiento de un modelo docente sólido que se ha validado y limpiado aún más.

En esta publicación, exploramos una idea para generar tokens de pensamiento para conjuntos de datos que carecen de rastros de razonamiento en la personalización de SFT. Primero examinamos el problema de la supresión del razonamiento, luego presentamos el razonamiento autodestilado (SDR), lo validamos en tres puntos de referencia y brindamos recomendaciones prácticas. SDR reutiliza la cadena de pensamiento del modelo básico de Amazon Nova 2 Lite como sustituto de conjuntos de datos sin razonamiento. A través de nuestros experimentos hacemos algunas observaciones sobre el impacto de la introducción de SDR, desde mejorar el desempeño objetivo hasta mitigar el olvido catastrófico. Esto está en línea con un creciente cuerpo de trabajo que está descubriendo la importancia de destilar información de un modelo en sí mismo durante el entrenamiento, también conocido como autodestilación.

La siguiente figura ilustra cómo se compara SDR con SFT básico y la fusión de modelos entre el rendimiento objetivo y la retención matemática. La fusión de modelos es un enfoque sencillo para conservar las habilidades adquiridas previamente, que toma un punto de control de SFT y lo fusiona nuevamente con el modelo base (antes de SFT). Sin embargo, la fusión a menudo se produce a expensas de renunciar a ganancias obtenidas en el punto de control de SFT debido a un olvido catastrófico que se manifiesta como una compensación entre el desempeño objetivo y el general. Por otro lado, el SDR mitiga este problema con un rendimiento objetivo similar o mejor que el SFT puro (sin fusión), al tiempo que conserva la mayor parte del rendimiento general.

Debido al olvido catastrófico, observamos que las SFT en un conjunto de datos pueden llevar a que se pierdan por completo los conocimientos previos. Por ejemplo, encontramos que el SFT básico hace que el rendimiento en matemáticas caiga del 70 por ciento (base) al 6 por ciento en promedio (Tabla 2). Con SDR, podemos recuperarlo casi por completo. El razonamiento autodestilado nos permite conservar las capacidades del modelo base sin comprometer el rendimiento objetivo y, en muchos casos, también mejora el rendimiento objetivo. La fusión de modelos es una solución común para mitigar el olvido catastrófico, pero SDR logra esta retención de manera más efectiva.

SDR proporciona regularización durante el entrenamiento al aumentar el conjunto de datos con los rastros de razonamiento propios del modelo. No requiere un modelo de profesor independiente ni una interpolación post hoc. Este enfoque no requiere anotaciones humanas, es aplicable a conjuntos de datos SFT existentes independientemente del dominio y es más eficaz que la fusión de modelos para preservar tanto el rendimiento general como el objetivo.

En comparación con la fusión de modelos, la autodestilación produce un rendimiento matemático casi idéntico (70 por ciento en comparación con 68 por ciento), al tiempo que mejora el rendimiento objetivo en más de un 6,5 por ciento en promedio al mismo tiempo. Este hallazgo se alinea con investigaciones recientes que defienden la autodestilación como un mecanismo poderoso para mitigar el olvido catastrófico.

Antecedentes: las SFT en conjuntos de datos sin tokens de razonamiento pueden provocar la pérdida de la capacidad de razonamiento

Antes de presentar el enfoque, es importante comprender por qué la SFT en conjuntos de datos sin rastros de razonamiento conduce a una degradación del rendimiento del modelo. Esta sección examina el problema de la supresión del razonamiento, cuantifica el impacto del razonamiento en el desempeño objetivo y analiza la fusión de modelos como un mecanismo de recuperación existente.

El problema de la supresión del razonamiento

El entrenamiento SFT en conjuntos de datos sin razonamiento con el modo de razonamiento activo conduce a un problema crítico: el modelo pierde su capacidad de razonar durante la inferencia, incluso cuando activa explícitamente el modo de razonamiento. Nuestra hipótesis es que este fenómeno ocurre porque el objetivo de entrenamiento calcula la pérdida tanto en los tokens de razonamiento como en los de salida juntos. Cuando los datos de entrenamiento contienen solo pares de entrada y salida sin pasos de razonamiento intermedios, el modelo no recibe ninguna señal de supervisión para generar trazas de razonamiento coherentes. La función de pérdida penaliza efectivamente los tokens que no contribuyen directamente al resultado final, entrenando al modelo para eludir sus mecanismos de razonamiento. Este comportamiento ejemplifica el aprendizaje abreviado, donde los modelos se basan en correlaciones espurias en lugar de aprender patrones de razonamiento sólidos.

Cuantificar el impacto del razonamiento

A pesar del problema de la supresión, activar el razonamiento tanto durante el entrenamiento como durante la inferencia produce beneficios significativos en el desempeño objetivo. Para confirmar una comparación justa, mantenemos la coherencia entre los entornos de entrenamiento e inferencia: comparando el razonamiento activo durante el entrenamiento y la inferencia versus el razonamiento desactivado durante el entrenamiento y la inferencia. Nuestros experimentos revelan que activar el razonamiento durante el entrenamiento y la inferencia conduce a una mejora significativa. La siguiente tabla demuestra este efecto en el conjunto de datos de LLaVA CoT con diferentes pesos de fusión LoRA (adaptación de bajo rango).

Peso de fusión Rendimiento objetivo (razonamiento activado) Rendimiento objetivo (razonamiento desactivado) Delta 0,0 (base) 12,30 % 12,30 % 0 % 0,3 34,38 % 35,28 % -0,9 % 0,5 60,51 % 48,80 % +11,7 % 0,7 66,67 % 54,05 % +12,6 % 1,0 (fusión completa) 65,17% 47,90% +17,3%

Tabla 1: Impacto del razonamiento y la fusión del peso en el desempeño objetivo. Los modos de razonamiento de inferencia y entrenamiento se mantienen consistentes.

La fusión de modelos como mecanismo de recuperación

Nuestro enfoque recomendado actual para abordar el problema de la supresión del razonamiento para casos de uso de SFT sin tokens de razonamiento es utilizar la fusión de modelos como mecanismo para recuperar la habilidad de razonamiento. De manera similar a cómo la fusión de modelos puede restaurar las capacidades matemáticas o de codificación después de un ajuste fino de un dominio específico, encontramos que la capacidad de razonamiento se puede recuperar mediante la interpolación ponderada entre el modelo ajustado y el modelo base. Esta recuperación está fuertemente correlacionada con la restauración de las métricas generales de desempeño (como los puntos de referencia de matemáticas y codificación), lo que sugiere que el razonamiento es una capacidad fundamental que subyace a múltiples habilidades posteriores.

Para comprender esto mejor, utilizamos los siguientes puntos de referencia en este experimento:

ToolACE: punto de referencia de llamada de herramientas (muestras de 10.000). Evalúa la capacidad del modelo para generar llamadas a funciones correctas con nombres y valores de argumentos adecuados dada una consulta del usuario y definiciones de herramientas disponibles. Contexto corto (aproximadamente 2K tokens). Puntuado según una tasa de éxito estricta (coincidencia exacta del nombre de la función y todos los argumentos). Requiere una salida estructurada precisa y una inferencia del valor de los argumentos.

CoCoHD: extracción estructurada de contexto largo (730 muestras). Evalúa la extracción de 10 campos de metadatos (título, cámara, comité, miembros, fechas) de las transcripciones de audiencias del Congreso de EE. UU. en formato JSON. Contexto largo (entre 35.000 y 85.000 caracteres). Se puntúa según la superposición de clave/valor entre el JSON previsto y el objetivo. Requiere analizar documentos muy largos y producir resultados estructurados que se ajusten al esquema. Extraído de GitHub.

GovReport: resumen abstractivo de contexto largo (17.000 muestras). Evalúa la generación de resúmenes en texto plano de 250 a 450 palabras de informes del gobierno de EE. UU. (GAO, CRS). Contexto largo (entrada de 35.000 a 85.000 caracteres). Puntuado en ROUGE-L (la subsecuencia común más larga se superpone con el resumen de referencia). Requiere sintetizar densos documentos políticos en narrativas concisas y fácticas. Extraído de HuggingFace.

Factura-OCR: comprensión de documentos multimodal (aproximadamente 500 muestras, imagen y texto). Evalúa la extracción de campos estructurados de imágenes de facturas escaneadas. Contexto breve (imagen única y mensaje). Puntuado en ANLS (similitud promedio normalizada de Levenshtein). Requiere reconocimiento visual de texto y extracción a nivel de campo de diversos diseños de documentos. Extraído de Kaggle.

CaptionGen: subtítulos de vídeo (1800 muestras, vídeo y texto). Evalúa la generación de subtítulos descriptivos para videoclips. Contexto variable (fotogramas de vídeo y aviso). Calificado mediante evaluación automatizada (probablemente juez CIDEr/METEOR o LLM). Requiere comprensión temporal a través de cuadros de video y generación de lenguaje natural. Extraído de HuggingFace.

Investigamos si el razonamiento surge con la fusión de modelos. En un punto de referencia de seguimiento de instrucciones, contamos la cantidad de tokens de razonamiento en un modelo que se entrena sin razonamiento. El eje x muestra el peso de fusión entre el modelo personalizado y el modelo base, donde 0,0 corresponde al modelo base y 1,0 es el modelo SFT sin fusión.

Gráfico de recuento de tokens de razonamiento versus ponderación de fusión entre el modelo base y personalizado

Implicaciones para la personalización

Estos hallazgos tienen implicaciones importantes si implementa modelos personalizados. En primer lugar, mantener el mismo modo de razonamiento durante el entrenamiento y la inferencia es fundamental para un rendimiento óptimo. En segundo lugar, sin intervención, las OFV de dominios específicos pueden degradar significativamente las capacidades de razonamiento general. En tercer lugar, la fusión de modelos ofrece una solución post-hoc, pero requiere un ajuste cuidadoso del peso de la fusión para equilibrar objetivos en competencia. Estas compensaciones nos motivaron a desarrollar un enfoque de capacitación que preserve la capacidad de razonamiento sin requerir intervenciones post hoc.

Papel del razonamiento en las OFV

Las trazas de razonamiento en SFT cumplen tres funciones críticas que conectan los paradigmas de ajuste fino de refuerzo (RFT), regularización y autodestilación.

En primer lugar, los rastros de razonamiento actúan como una regularización implícita de la política al restringir el modelo ajustado para que se mantenga cerca de la política del modelo base. Esto evita el olvido catastrófico y la degradación de la capacidad de una manera similar a la regularización de KL en RLHF. En segundo lugar, el razonamiento proporciona supervisión del proceso, análoga a la configuración de recompensas paso a paso en RFT, en lugar de simplemente supervisión de resultados. Esto conduce a una generalización más sólida. En tercer lugar, la autodestilación, en la que un modelo aprende de sus propias predicciones, ha demostrado ser eficaz en ámbitos que van desde las redes nacidas de nuevo hasta la IA constitucional. Los rastros de razonamiento ofrecen una autosupervisión particularmente rica al capturar el proceso de resolución de problemas del modelo en lugar de solo los resultados finales, como se demuestra en investigaciones recientes sobre aprendizaje continuo.

Trabajos recientes muestran que los modelos ajustados eficaces mantienen la proximidad al modelo base en el espacio de parámetros, y nuestro enfoque utiliza esta información aplicando las propias trazas de razonamiento del modelo base como objetivos de entrenamiento, creando una señal de aprendizaje consistente con las representaciones internas del modelo y al mismo tiempo proporcionando una supervisión densa a nivel de token durante todo el proceso de razonamiento.

Razonamiento autodestilado

Proponemos un enfoque eficaz que utiliza razonamiento autodestilado (SDR) para la personalización de SFT en conjuntos de datos sin rastros de razonamiento. El proceso funciona en tres etapas. Primero, utiliza el modelo de razonamiento base (como Amazon Nova 2 Lite) para generar seguimientos de razonamiento para cada ejemplo en el conjunto de datos SFT. A continuación, aumenta los datos de entrenamiento anteponiendo los rastros de razonamiento generados a los resultados originales. Finalmente, ajusta el modelo con el modo de razonamiento activado, proporcionando supervisión tanto del razonamiento como de los tokens de salida.

SDR ofrece varias ventajas para su flujo de trabajo SFT. El costo de anotación es cero porque no se requiere ningún esfuerzo humano para crear los rastros de razonamiento. Los rastros de razonamiento son consistentes con el propio enfoque de resolución de problemas del modelo base. La técnica se adapta a conjuntos de datos SFT existentes independientemente del dominio y le brinda flexibilidad para utilizar diferentes modelos de docentes.

Construcción de pistas de razonamiento para SFT

Consultamos a Amazon Bedrock para obtener rastros de razonamiento para un conjunto de datos determinado. Hay dos enfoques para construir razonamientos en cadena de pensamiento, cada uno con diferentes compensaciones.

razonamiento básico

Este enfoque genera rastros de razonamiento de manera directa, donde el modelo produce naturalmente su razonamiento dada solo la pregunta. Esto imita cómo razonaría el modelo durante la inferencia. La plantilla de aviso es:

Piensa en esta pregunta con naturalidad y muestra tu razonamiento: {user_text} Formatea tu respuesta con etiquetas para el razonamiento y etiquetas para la respuesta final. Utilice un estilo de razonamiento coherente.

Razonamiento guiado

Este enfoque utiliza la disponibilidad de respuestas reales para guiar la generación del razonamiento hacia atrás. Al proporcionar tanto la pregunta como la respuesta, le pedimos al modelo que reconstruya el razonamiento plausible que las conecta, de manera similar a los enfoques de aprendizaje retrospectivo. La plantilla de aviso es:

Generar razonamiento natural para resolver esta pregunta. Actúa como si aún no supieras la respuesta. Pregunta: {user_text} Respuesta a la que llegar: {assistant_content} Formatee su respuesta con etiquetas para el razonamiento y etiquetas para la respuesta final. Escribe un razonamiento natural que conduzca a esta respuesta sin asumir que lo sabes de antemano. Utilice un estilo de razonamiento coherente.

Para verificar que el modelo no filtre accidentalmente la respuesta en el rastro de razonamiento (lo que introduciría ruido), realizamos un paso de filtrado secundario que elimina las menciones de la respuesta para obtener el rastro de razonamiento final.

Canal de implementación

El siguiente código muestra cómo implementar el razonamiento guiado mediante la API de Amazon Bedrock Converse. La canalización lee sus datos de entrenamiento SFT, genera rastros de razonamiento de cadena de pensamiento (CoT) y ensambla el conjunto de datos final con bloques de contenido de razonamiento.

Configuración y generación de avisos de CoT

import json, re, boto3, time MODEL_ID = "amazon.nova-lite-v1:0" bedrock = boto3.client("bedrock-runtime", region_name="us-east-1") COT_SYSTEM = """Usted es un evaluador experto. Proporcione una cadena de pensamiento detallada que explique por qué la respuesta real dada es correcta y tiene sentido.""" COT_USER_TEMPLATE = """Dado el contexto de la tarea y anotación de verdad fundamental, proporcione una cadena de pensamiento **Contexto original del sistema:** {system_prompt} **Solicitud de usuario original:** {user_prompt} **Anotación de verdad fundamental:** “`json {ground_truth} “` SÓLO proporcione su justificación dentro de las etiquetas."""

Invoque Amazon Bedrock y reúna el conjunto de datos final

# Invocar Bedrock para cada solicitud de CoT para solicitud en cot_requests: respuesta = bedrock.converse( modelId=MODEL_ID, system=[{"text": req["system"]}], message=[{"role":"user", "content":[{"text":req["query"]}]}], inferenceConfig={"maxTokens":4096,"temperature":0.3,"topP": 0.9,"topK": 50}) salida = respuesta["salida"]["mensaje"]["contenido"][0]["text"] time.sleep(2) # límite de velocidad # Analizar etiquetas y crear un conjunto de datos SFT para idx, elemento en enumerate(original_data): tags = extract_xml_tag(inference[idx], "justification") Reasoning_block = {"reasoningContent": {"reasoningText": {"text": "Basado en el contexto proporcionado, pensemos" " paso a paso " + etiquetas[0].strip()}}} sft_dataset.append({ "schemaVersion": "bedrock-conversation-2024", "system": elemento["sistema"], "mensajes": [elemento["mensajes"][0], {"rol": "asistente", "contenido": [bloque_razonamiento, texto_original]}]})

Parámetros de configuración de inferencia

temperatura: 0,3 La baja aleatoriedad produce rastros de razonamiento consistentes y deterministas adecuados para los datos de entrenamiento. topP: 0,9 Muestreo de núcleo que retiene la masa de probabilidad superior del 90 por ciento. Equilibra la coherencia con la diversidad suficiente para evitar repeticiones degeneradas. topK: 50 Limita los candidatos simbólicos a los 50 primeros en cada paso. Evita que aparezcan tokens improbables en los rastros de razonamiento y, al mismo tiempo, mantiene el flujo del lenguaje natural.

Entrada de muestra (sin razonamiento)

{"schemaVersion": "bedrock-conversation-2024", "system": [{"text": "Usted es un experto legal…"}], "messages": [ {"role": "user", "content": [{"text": "Revise esta cláusula: La empresa no revelará datos a terceros."}]}, {"role": "assistant", "content": [{"text": "[{"comment_id": "001", "gravedad": "Media", "comentario": "Agregar excepciones de confidencialidad estándar…", …}]"}]}]}

Resultado de muestra (con razonamiento antepuesto)

{"role": "assistant", "content": [ {"reasoningContent": {"reasoningText": {"text": "Según el contexto proporcionado, pensemos paso a paso: 1. Corrección: la anotación identifica correctamente un problema con la cláusula sugiriendo excepciones estándar de confidencialidad… 2. Gravedad: Mediana es apropiada porque… 3. Categoría: Privacidad encaja porque la protección de datos es una preocupación central de privacidad… 6. Referencias: std-clauses.pdf valida la necesidad de excepciones."}}}, {"text": "[{"comment_id": "001", …}]"}]}

Nuestros experimentos (discutidos en la siguiente sección) demuestran que este enfoque conduce a mejoras significativas tanto en el rendimiento del dominio objetivo como en la preservación de la capacidad general, validando la hipótesis de que el razonamiento autodestilado proporciona un sesgo inductivo valioso durante el ajuste.

experimentos

Realizamos experimentos en tres puntos de referencia que no tienen razonamiento.

MedMCQA es un conjunto de datos de estilo Preguntas y respuestas que contiene 10.000 muestras de capacitación. CoCoHD es un conjunto de datos de audiencias del Congreso que tiene un contexto extenso (de 20 a 60 mil tokens) y tiene la tarea de producir un JSON con campos específicos. Invoice-OCR es un conjunto de datos multimodal que tiene imágenes de facturas y requiere una salida JSON con los campos de la imagen.

La siguiente tabla resume nuestros resultados de DEG en tres puntos de referencia. Cada columna captura una dimensión específica de la configuración experimental: el modelo se refiere al conjunto de datos utilizado para el ajuste fino (o el modelo base Nova 2 Lite cuando no se aplica ningún ajuste fino). Reasoning Traces indica qué modelo generó los rastros de la cadena de pensamiento antepuestos a los datos de entrenamiento. "Ninguno" significa que no se agregó ningún razonamiento al conjunto de datos. Training Reasoning especifica si el modo de razonamiento se habilitó durante el proceso de entrenamiento de SFT. El razonamiento de inferencia especifica si el modo de razonamiento estaba habilitado en el momento de la predicción. La fusión indica si la fusión del modelo (interpolación ponderada entre el punto de control ajustado y el modelo base) se aplicó después del entrenamiento para recuperar las capacidades generales perdidas. Target informa la precisión en el punto de referencia específico del dominio para el que se ajustó el modelo. Matemáticas ↑ (control) informa la precisión en un punto de referencia matemático utilizado como métrica de control para medir el olvido catastrófico. El modelo base obtiene una puntuación del 70 por ciento, por lo que cualquier caída significativa indica que se ha perdido la capacidad de razonamiento general durante el ajuste.

Conjunto de datos Rastreos de razonamiento Entrenamiento Razonamiento Razonamiento de inferencia Objetivo de fusión

Matemáticas ↑

(control)

Nova 2 Lite Ninguno No No – 55,60% 12,90% Nova 2 Lite Ninguno No Sí – 55,40% 70% MedMCQA Ninguno No Sí Sí 60,50% 8,30% MedMCQA Ninguno No Sí No 63,80% 0% MedMCQA Nova 2 Lite Básico Sí Sí No 66,60% 67,90% MedMCQA Nova 2 Lite Guiado Sí Sí No 65,70% 59,60% Nova 2 Lite Ninguno No No – 45% 12,90% Nova 2 Lite Ninguno No Sí – 45% 70% CoCoHD Ninguno No Sí Sí 59,30% 70% CoCoHD Ninguno No Sí No 61,30% 6,30% CoCoHD Nova 2 Lite Básico Sí Sí No 55,40% 73,80% CoCoHD Nova 2 Lite Supervisado Sí Sí No 61,30% 65,80% Nova 2 Lite Ninguno No No – 82,10% 12,90% Nova 2 Lite Ninguno No Sí – 81,40% 70% Factura-OCR Ninguno No Sí Sí 82,30% 70,80% Factura-OCR Ninguno No Sí No 88,10% 9,60% Factura-OCR Nova 2 Lite Básico Sí Sí No 86,10% 67,10% Factura-OCR Nova 2 Lite Supervisado Sí Sí No 87,90% 67,90%

Tabla 2: Resultados del DEG en tres puntos de referencia. Las filas están agrupadas por conjunto de datos. Todas las filas SDR utilizan el peso de combinación 1.0 (no es necesario fusionar).

SFT con rastros de razonamiento parciales o faltantes

Los datos de razonamiento pueden ser costosos o difíciles de seleccionar y, como resultado, a menudo nos encontramos con situaciones en las que solo una parte del conjunto de datos SFT contiene razonamiento. Para comprender mejor cómo se comporta SFT en esta situación, a continuación realizamos un estudio de ablación. También exploramos cómo los DEG pueden ayudar en esta situación como una alternativa rentable y de bajos gastos generales.

Entrenamiento SFT con rastros de razonamiento solo parciales

En este estudio, examinamos el efecto de SFT cuando solo un subconjunto del conjunto de datos contiene razonamiento, que simula escenarios comunes del mundo real para muchos usuarios. Realizamos ablaciones con rastros de razonamiento para LoRA SFT en muestras de entrenamiento de 10.000 del punto de referencia LLaVA CoT. El punto de referencia de evaluación para esto es MathVista, donde el modelo base tiene problemas (12,3 por ciento) principalmente debido a inconsistencias de formato y LoRA SFT muestra una gran mejora (34,4 por ciento).

Punto de referencia matemático (de control): olvido catastrófico

El punto de referencia de Matemáticas (control) mide si el modelo conserva la capacidad de razonamiento matemático general después de SFT. Este es un hallazgo notable: sin el llenado previo de SDR, la capacidad matemática general colapsa del 68 % al 3 % a medida que se reduce el porcentaje de datos de razonamiento en el entrenamiento. Con DEG, se mantiene estable entre 65 y 72 por ciento, independientemente de la cantidad de datos de razonamiento que incluya.

Gráfico que muestra que la precisión del control matemático se mantiene estable con SDR versus colapsa sin SDR a medida que disminuyen los datos de razonamiento

Información clave

Sin SDR: Reducir los datos de razonamiento por debajo del 75 por ciento provoca un olvido catastrófico en el control de matemáticas: 66,6 por ciento a 21,7 por ciento a 3,3 por ciento a 2,5 por ciento. El modelo pierde por completo su capacidad matemática general.

Con SDR: Matemáticas (control) se mantiene estable entre 64 y 72 por ciento en todos los porcentajes de datos, incluso con 0 por ciento de datos de razonamiento. El precarga de SDR evita por completo el olvido catastrófico.

Fichas de razonamiento medianas en inferencia

Este gráfico muestra el presupuesto de tokens gastado en rastros de razonamiento durante la inferencia. Los modelos DEG producen más fichas de razonamiento (400–860). Los modelos entrenados con menos o igual a (≤) 25 por ciento de datos de razonamiento y sin relleno previo producen cero tokens de razonamiento. Esto significa que han perdido por completo la capacidad de razonar paso a paso.

Gráfico de tokens de razonamiento medianos en la inferencia entre porcentajes de datos de razonamiento de entrenamiento, con y sin relleno previo de SDR

Información clave

SDR enseña comportamiento de razonamiento: incluso con un 0 por ciento de datos de razonamiento en el entrenamiento, el llenado previo de SDR hace que el modelo produzca 859 tokens de razonamiento medianos. Sin DEG menor o igual a (≤) 25 por ciento de datos de razonamiento, el modelo produce cero tokens. Ha olvidado cómo razonar.

Comparación del modelo base: el modelo base de Amazon Nova 2 Lite produce 1254 tokens de razonamiento medianos. Después de SFT con 100 por ciento de datos de razonamiento, esto cae a 367 y el modelo se vuelve más eficiente (menos tokens para la misma o mejor precisión).

MathVista (objetivo): razonamiento activado versus desactivado

Este gráfico compara la precisión de MathVista con el razonamiento habilitado y deshabilitado en el momento de la inferencia. Permitir el razonamiento por inferencia tiene el mayor impacto. Aproximadamente duplica el rendimiento independientemente de la composición de los datos de entrenamiento.

Gráfico que compara la precisión de MathVista con el razonamiento habilitado y deshabilitado en composiciones de datos de entrenamiento

Información clave

El razonamiento continuo durante la inferencia ofrece sistemáticamente entre un 35 y un 47 por ciento de precisión, en comparación con un 14-22 por ciento con el razonamiento apagado. Esto es aproximadamente una mejora del doble.

Mejor configuración: 50 por ciento de datos de razonamiento más precarga de SDR logra un 45,2 por ciento de MathVista con un 70,4 por ciento de control matemático, evitando olvidos y maximizando el rendimiento objetivo.

Sin razonamiento inferencial, el rendimiento cae a niveles cercanos al modelo base (aproximadamente 15-22 por ciento), independientemente de la composición del entrenamiento. El modelo necesita el paso de razonamiento para funcionar bien en este punto de referencia. Una observación notable aquí es que el entrenamiento con SDR prefill (es decir, con el razonamiento habilitado) da como resultado un mejor rendimiento de la evaluación incluso con el razonamiento deshabilitado durante el tiempo de inferencia. Por ejemplo, cuando solo el 75 por ciento del conjunto de datos carece de supervisión CoT, el prellenado de SDR aumenta el rendimiento de la evaluación en más de 5 puntos porcentuales incluso con el razonamiento deshabilitado en la inferencia (16,4 por ciento a 21,3 por ciento), lo que indica que el SDR tiene un impacto en la forma en que el modelo resuelve una tarea incluso cuando el razonamiento está deshabilitado.

Conclusiones y recomendaciones

Nuestros experimentos en tres puntos de referencia (MedMCQA, CoCoHD, Invoice-OCR) y una ablación en conjuntos de datos de razonamiento parcial (LLaVA-CoT) convergen en un hallazgo consistente: el razonamiento autodestilado (SDR) ofrece un enfoque de costo cero que simultáneamente mejora el rendimiento objetivo y preserva las capacidades generales, sin requerir la fusión de modelos.

El punto de partida de estas conclusiones es que el razonamiento es frágil en el caso de las SFT convencionales. El entrenamiento con datos sin rastros de razonamiento provoca la supresión del razonamiento: el modelo toma atajos hacia la respuesta y pierde habilidades generales, con la precisión matemática colapsando del 70 por ciento al 0 por ciento. La fusión de modelos recupera parcialmente estas habilidades, pero introduce una compensación entre el rendimiento objetivo y general que es difícil de ajustar y agrega un paso de combinación de puntos de control al proceso de capacitación.

Los DEG eliminan esta compensación. Al aumentar el conjunto de datos con los propios rastros de razonamiento del modelo base, SDR conserva el rendimiento general en Matemáticas ≈ 68 por ciento, al tiempo que ofrece una ganancia relativa de más del 6,5 por ciento en el rendimiento objetivo sobre los mejores puntos de control de fusión de modelos, sin costo de anotación adicional. El enfoque se mantiene incluso cuando el modelo base es débil en el dominio objetivo: en MedMCQA, donde el modelo base obtiene una puntuación del 55,6 por ciento, SDR eleva la precisión objetivo en aproximadamente tres puntos porcentuales (63,8 por ciento a 66,6 por ciento) y recupera Matemáticas del 0 por ciento al 67,9 por ciento. En otras palabras, SDR funciona tanto cuando el modelo base tiene una habilidad de dominio latente para desbloquear como cuando no la tiene.

El beneficio se extiende al entrenamiento de razonamiento mixto, donde sólo una fracción de las muestras SFT contienen rastros de razonamiento. Este es un entorno común en el mundo real, ya que es costoso conservar los datos de razonamiento y nuestra ablación LLaVA-CoT muestra que también es frágil. La capacidad general se mantiene con una cobertura de razonamiento del 75 por ciento (Matemáticas, 66,6 por ciento), pero colapsa drásticamente por debajo de esa cifra: con un 50 por ciento, Matemáticas cae al 21,7 por ciento, del 25 por ciento al 3,3 por ciento y del 0 por ciento al 2,5 por ciento. La precisión del objetivo se mueve de manera no monótona a través de estas mezclas, por lo que no existe un punto de dilución seguro. Al completar previamente los rastros faltantes con Nova 2 Lite se elimina el precipicio por completo: las matemáticas se mantienen en el rango del 65 al 71 por ciento en todas las combinaciones, y el 50 por ciento de SDR alcanza una precisión objetivo del 45,2 por ciento, superior al 34,4 por ciento observado con un razonamiento 100 por ciento escrito por humanos. La ganancia también se transfiere a la inferencia sin razonamiento, de modo que los equipos pueden parchear sus conjuntos de datos una vez y mantener su ruta de servicio existente.

Una advertencia da forma a la recomendación sobre qué maestro utilizar. Un maestro más fuerte no siempre es mejor: los rastros de Amazon Nova 2 Pro (versión preliminar) mejoran la precisión de los objetivos, pero provocan una caída proporcional en el rendimiento general, lo que coincide con hallazgos anteriores de que una gran brecha entre estudiantes y maestros perjudica la destilación. Los seguimientos generados por Lite ofrecen el resultado más equilibrado entre el objetivo y el rendimiento general y son los valores predeterminados que recomendamos.

En conjunto, estos resultados apuntan a un camino práctico para el profesional: utilizar SDR con trazas de la misma familia (Amazon Nova 2 Lite para clientes de Amazon Nova 2 Lite) como receta SFT predeterminada, aplicarlo como complemento siempre que la cobertura de razonamiento esté por debajo de aproximadamente el 75 por ciento y reservar variantes de razonamiento guiado o de maestro más sólido para los casos en los que el modelo base es débil en el dominio objetivo y el costo de capacidad general es aceptable. La implicación más amplia es que la SDR es un sesgo inductivo útil para entornos de aprendizaje continuo donde con el tiempo llegan nuevas habilidades y es necesario preservar las aprendidas previamente. Combinarlo con la mezcla de datos y la fusión de luces es el siguiente paso natural a explorar.

Guía de decisión para profesionales

Utilice esta guía para determinar cuándo utilizar el razonamiento autodestilado (SDR), la fusión de modelos o el SFT estándar en función de la composición de sus datos y las limitaciones de latencia.

Recomendación de escenario 1 Trabajo SFT nuevo o predeterminado sin razonamiento, pero viendo una regresión en el rendimiento general. Si es sensible a la latencia: utilice la combinación de modelos para recuperar la regresión del rendimiento general. Si las restricciones de latencia se adaptan al razonamiento: utilice SDR con seguimientos de razonamiento generados por Nova 2 Lite. Esto proporciona el mejor equilibrio entre el rendimiento objetivo y la preservación de la capacidad general (a menudo mayor que con la fusión de modelos). 2 El modelo base es débil en el dominio objetivo. Considere el razonamiento guiado para proporcionar una señal adicional durante la generación de seguimiento. 3 El conjunto de datos ya tiene un razonamiento parcial (≥ 50%). Recomendamos entrenar con el razonamiento activado. Las huellas existentes son suficientes para preservar las habilidades generales. 4 El conjunto de datos tiene < 50 % de rastros de razonamiento. Si las restricciones de latencia permiten el razonamiento durante la inferencia, complete previamente los rastros faltantes con el razonamiento de Nova 2 Lite (una sola vez, fuera de línea). Sin esto, el rendimiento general colapsará. 5 No necesita capacidades generales. Los datos de razonamiento tienen un impacto mínimo en el rendimiento objetivo. SFT estándar está bien. 6 Aprendizaje continuo o preservación de múltiples habilidades Considere combinar SDR con combinación de datos y un peso de fusión pequeño (o nulo) para lograr la mejor retención de las habilidades aprendidas previamente. 7 Aún desea utilizar la fusión de modelos. Recomendamos utilizar un peso de fusión menor cuando se aplica SDR. Los DEG ya proporcionan la regularización que la fusión estaba compensando.

Para obtener más información sobre los modelos de Amazon Nova y las opciones de personalización, consulte la documentación de Amazon Bedrock. Para comenzar con la personalización de SFT, consulte la guía de personalización del modelo de Amazon Bedrock. Si tiene preguntas o desea compartir su experiencia con SDR, comuníquese con su equipo de cuentas de AWS.

Sobre los autores

Rushil Anirudh

Rushil Anirudh

Rushil es un científico aplicado en el equipo de Forge, donde trabaja en la ciencia detrás de SFT: hacer que LoRA y el ajuste completo sean más precisos y confiables para la personalización de modelos de frontera. Su investigación abarca modelos generativos que abarcan la visión y el lenguaje, la solidez de los modelos y la cuantificación de la incertidumbre. Fuera del trabajo, normalmente busca buena comida en el Área de la Bahía o lee historia y ciencia ficción de primer contacto.

Shiva Mahalingam

Shiva Mahalingam

Shiva es arquitecto senior de soluciones en el segmento de ingeniería, construcción, bienes raíces y transporte (ECRT) en AWS. Trabaja con clientes empresariales para diseñar e implementar arquitecturas nativas de la nube, centrándose en datos para agentes, personalización de modelos y soluciones de IA agente. Ayuda a las organizaciones a navegar por las complejidades del ajuste, la ingeniería rápida y la adaptación de dominios para desbloquear el valor empresarial de sus datos. Le apasiona permitir que los clientes pasen de la experimentación a cargas de trabajo de IA listas para producción en AWS. Cuando no está trabajando, escucha música y toca instrumentos de percusión.

anupam dewan

anupam dewan

Anupam es un arquitecto senior de soluciones que trabaja en el equipo de Amazon Nova y le apasiona la IA generativa y sus aplicaciones del mundo real. Se centra en la personalización de Nova y Amazon Nova Forge, ayudando a las empresas a aprovechar el verdadero potencial de los LLM con poder de personalización. También le apasiona enseñar ciencia de datos y análisis y ayudar a las empresas a crear LLM que funcionen para sus negocios. Fuera del trabajo, puedes encontrarlo haciendo senderismo, haciendo voluntariado o disfrutando de la naturaleza.