Esta publicación está coescrita por Paul Burchard e Igor Halperin de Artificial Genius.
La proliferación de grandes modelos lingüísticos (LLM) presenta una paradoja significativa para industrias altamente reguladas como los servicios financieros y la atención médica. La capacidad de estos modelos para procesar información compleja y no estructurada ofrece un potencial transformador para el análisis, el cumplimiento y la gestión de riesgos. Sin embargo, su naturaleza probabilística inherente conduce a alucinaciones, información plausible pero objetivamente incorrecta.
En sectores gobernados por estrictos requisitos de auditabilidad y precisión, el comportamiento no determinista de la IA generativa estándar es una barrera para la adopción en sistemas de misión crítica. Para un banco o un hospital, el determinismo no es sólo un objetivo; los resultados deben ser precisos, relevantes y reproducibles.
En esta publicación, nos complace mostrar cómo Artificial Genius, socio ISV de AWS, utiliza Amazon SageMaker AI y Amazon Nova para resolver este desafío. Al introducir una tercera generación de modelos de lenguaje, están entregando una solución que es probabilística en la entrada pero determinista en la salida, lo que ayuda a permitir una adopción segura y de nivel empresarial.
Para entender la solución, veamos cómo ha evolucionado la IA:
Primera generación (década de 1950): los investigadores utilizaron la lógica simbólica para construir modelos deterministas basados en reglas. Si bien eran seguros, estos modelos carecían de fluidez y no podían escalar. Segunda generación (década de 1980 hasta el presente): el cambio a modelos probabilísticos (que culminó en la arquitectura Transformer) generó una fluidez increíble. Sin embargo, debido a que estos modelos predicen el siguiente token basándose en la probabilidad, sufren de modos de falla ilimitados (alucinaciones) que son difíciles de eliminar. Tercera generación (el enfoque del genio artificial): en lugar de una nueva generación que reemplace a la anterior, estamos pasando de la rigidez de la lógica simbólica y la imprevisibilidad de los modelos probabilísticos hacia una arquitectura híbrida. Este enfoque utiliza el poder generativo de Amazon Nova para comprender el contexto, pero aplica una capa determinista para verificar y producir resultados. Es la convergencia de fluidez y factualidad.
La solución: un enfoque paradójico de la generación
Es matemáticamente difícil evitar que los modelos generativos estándar tengan alucinaciones porque el proceso generativo extrapolativo en sí mismo causa errores. Artificial Genius aborda esto utilizando el modelo de forma estrictamente no generativa. En este paradigma, la gran información de probabilidad aprendida por el modelo se utiliza sólo de forma interpolativa en la entrada. Esto permite que el modelo comprenda las innumerables formas en que se puede expresar una información o una pregunta sin depender de la probabilidad para generar la respuesta. Para crear esta capacidad de tercera generación, Artificial Genius utiliza SageMaker AI para realizar una forma específica de ajuste de instrucciones en los modelos base de Amazon Nova.
Este método patentado elimina eficazmente las probabilidades de salida. Mientras que las soluciones estándar intentan garantizar el determinismo reduciendo la temperatura a cero (lo que a menudo no resuelve el problema central de las alucinaciones), Artificial Genius entrena posteriormente el modelo para inclinar las probabilidades logarítmicas de las predicciones del siguiente token hacia unos o ceros absolutos. Este ajuste obliga al modelo a seguir una única instrucción del sistema: no inventes respuestas que no existen.
Esto crea una laguna matemática donde el modelo conserva su comprensión genial de los datos pero opera con el perfil de seguridad requerido para las finanzas y la atención médica.
Más allá de RAG
La generación aumentada de recuperación (RAG) se cita con frecuencia como la solución para la precisión, pero sigue siendo un proceso generativo y crea incrustaciones de vectores fijos que pueden no ser relevantes para consultas posteriores. El enfoque de tercera generación mejora RAG al incorporar de manera efectiva el texto de entrada y la consulta del usuario en una integración unificada. Esto ayuda a garantizar que el procesamiento de datos sea intrínsecamente relevante para la pregunta específica formulada, lo que ofrece mayor fidelidad y relevancia que los métodos estándar de recuperación de vectores.
Entregando valor usando flujos de trabajo agentes
Para ayudar a las empresas a maximizar el valor de sus datos no estructurados, Artificial Genius empaqueta este modelo en una plataforma agente-servidor estándar de la industria, disponible a través de AWS Marketplace.
A diferencia de los agentes de segunda generación, que corren el riesgo de agravar los errores cuando se combinan en flujos de trabajo, la confiabilidad inherente de este modelo de tercera generación permite una automatización compleja y de alta fidelidad. Las indicaciones utilizadas para crear estos flujos de trabajo siguen la estructura de un documento de requisitos del producto (PRD). A través de esta estructura, los expertos en el dominio (que tal vez no sean ingenieros de inteligencia artificial) pueden formular consultas en lenguaje natural mientras mantienen un control estricto sobre el resultado.
El producto ofrece además indicaciones de forma libre sobre la especificación del flujo de trabajo. Para ello se utiliza el modelo Amazon Nova Premier, que es especialmente capaz de traducir indicaciones de formato libre al formato PRD. Aunque Nova Premier es un modelo generativo, que requiere un ser humano involucrado para verificar su salida, este es el único punto de control humano en el flujo de trabajo agente.
Definición de la consulta no generativa
La principal laguna matemática empleada aquí es el uso de un modelo generativo estrictamente no generativo. Esto significa que el modelo no utiliza probabilidades para adivinar el siguiente token de una respuesta, sino que extrae o verifica información basándose únicamente en el contexto de entrada. Si bien las respuestas cortas (como fechas o nombres) obviamente no son generativas, también es posible generar secuencias largas de forma determinista. Por ejemplo, pedir una cita directa de un documento para justificar una respuesta anterior es una tarea no generativa. Los siguientes son ejemplos de cómo Artificial Genius estructura estas interacciones (el mensaje del sistema que contiene instrucciones contra las alucinaciones no se muestra en estos giros JSON):
Respuesta corta no generativa y con capacidad de respuesta:
Pregunta de seguimiento con respuesta, no generativa y de respuesta larga
Estos son sólo ejemplos ilustrativos. Los productos del modelo de lenguaje de tercera generación se entregarán con recetas para ayudar a comprender cómo construir consultas no generativas para satisfacer todas las necesidades prácticas de procesamiento del lenguaje natural. Con este entendimiento, exploremos la implementación técnica de la creación de un canal de ajuste fino no generativo utilizando Amazon Nova en SageMaker AI.
Arquitectura de referencia de AWS
La arquitectura que se muestra en el diagrama anterior utiliza un enfoque simplificado para personalizar los modelos básicos. Utiliza trabajos de SageMaker Training para el entrenamiento de modelos y Amazon Bedrock para la implementación.
Almacenamiento de datos: los datos de capacitación (preguntas y respuestas sintéticas) se almacenan en Amazon Simple Storage Service (Amazon S3). Capacitación: los trabajos de capacitación de SageMaker proporcionan recursos informáticos para ajustar el modelo base de Nova utilizando el método de ajuste de instrucciones con ajuste fino supervisado (SFT). Implementación: el modelo ajustado se importa a Amazon Bedrock mediante la función de creación de modelo personalizado. Inferencia: las aplicaciones interactúan con el modelo a través de los puntos finales de Amazon Bedrock utilizando la función de inferencia bajo demanda de Amazon Bedrock para crear un modelo personalizado, lo que ayuda a garantizar un bucle seguro y escalable.
Este diseño separa las preocupaciones de desarrollo de la inferencia de producción y, al mismo tiempo, mantiene un linaje de datos claro, esencial para las pistas de auditoría en los servicios financieros.
Implementación técnica: una guía paso a paso para el ajuste fino no generativo
Como se indicó anteriormente, la construcción de un modelo de lenguaje de tercera generación implica los siguientes pasos:
Comienza con un modelo básico de segunda generación. La primera tarea es seleccionar un buen modelo base. Como verá, la familia Amazon Nova incluye candidatos ideales para servir como esta base. El modelo base debe entrenarse posteriormente para que siga una única instrucción del sistema: no invente respuestas. Por supuesto, muchas personas lo han intentado antes, pero ahora entendemos por las matemáticas que esto sólo es posible para preguntas no generativas. Por eso, es importante comprender, a nivel práctico, qué tipos de preguntas son generativas y cuáles no generativas. Debido a que el post-entrenamiento le da al modelo de lenguaje una capacidad de propósito general, su éxito depende fundamentalmente de la construcción de un conjunto de datos altamente diverso y de alta calidad que ejerza plenamente esta capacidad general. Artificial Genius ha producido un generador de preguntas y respuestas sintético y no generativo patentado, que incluye preguntas con y sin respuesta. Este generador de datos sintéticos será la base de cualquier modelo de lenguaje personalizado de tercera generación producido por clientes empresariales. Finalmente, SageMaker AI ofrece una plataforma posterior a la capacitación rentable y capaz que permite la producción eficiente de modelos finales, que se explorarán en detalle.
Repasemos estos pasos con más detalle.
Elegir el modelo de base adecuado
Al construir un modelo de lenguaje de tercera generación, queremos centrarnos en la confiabilidad y la seguridad. Algunos modelos básicos, creados para diferentes casos de uso, tienen otras capacidades que los distraen y los hacen menos adecuados para un uso no generativo.
Un ejemplo importante es que algunos modelos básicos están optimizados para su uso como asistentes de chat, lo que puede dificultar su persuasión para que brinden respuestas concisas en lugar de detalladas y discursivas. Corregir tal tendencia puede requerir un entrenamiento posterior adicional más allá de seguir las instrucciones de no alucinación. La familia de modelos Amazon Nova está diseñada para lograr un sólido equilibrio entre rendimiento, rentabilidad y velocidad, lo que los convierte en candidatos ideales para aplicaciones empresariales y, dentro de la familia Nova, el modelo Nova Lite tiende naturalmente a proporcionar respuestas nítidas y concisas. Por lo tanto, Nova Lite es un modelo base ideal para este propósito.
Otro desarrollo reciente relevante es la adición de características posteriores a la inferencia a los modelos lingüísticos de segunda generación, a menudo basados en cadenas de pensamiento (CoT) o en métodos de aprendizaje por refuerzo. Estas características, si bien tienen utilidad, interfieren con la creación de un modelo no generativo de tercera generación. Por ejemplo, al aplicar esta metodología al modelo DeepSeek/Llama3, que incluye cadena de pensamiento, fue necesario realizar una inyección rápida incluyendo los tokens internos del modelo directamente en los datos de entrenamiento para desactivar estas funciones adicionales. Afortunadamente, Amazon Nova Lite no tiene funciones posteriores a la inferencia.
Diseño de una tarea de seguimiento de instrucciones posterior al entrenamiento
Luego se puede aplicar un entrenamiento posterior, como SFT, al modelo base para entrenarlo para que siga una instrucción antialucinaciones incluida en el mensaje del sistema. Esta instrucción podría ser, por ejemplo: Si la pregunta no se puede responder desde el documento, responda "Desconocido".
Si esto suena obvio (se ha intentado muchas veces antes), recuerde que esta idea aparentemente obvia solo funciona en combinación con el principio matemático no obvio y contraintuitivo de usar el modelo generativo de una manera estrictamente no generativa.
Creación de datos post-entrenamiento antialucinatorios de alta calidad
Artificial Genius ha creado un generador de preguntas y respuestas sintético y no generativo patentado que está diseñado para ejercitar la capacidad del modelo para responder correctamente o negarse a responder una gran variedad de preguntas no generativas. El generador sintético de preguntas y respuestas de Artificial Genius se basa en investigaciones previas sobre la generación sintética de preguntas y respuestas para el ámbito financiero, pero se centra en producir la mayor variedad de preguntas y respuestas puramente no generativas y en ampliar en múltiplos las dimensiones de diversidad del texto de entrada, las preguntas y las respuestas. Construir un generador sintético de preguntas y respuestas adecuado para esta tarea es un esfuerzo de ingeniería importante. Pero con el generador sintético de preguntas y respuestas de Artificial Genius como base, las tareas posteriores a la capacitación específicas del cliente se pueden combinar con él para crear modelos de lenguaje personalizados de tercera generación.
Superar la CoT post inferencia
La cadena de pensamiento (CoT) es una técnica de estimulación que mejora el desempeño de LLM en tareas de razonamiento complejas al alentar al modelo a generar un razonamiento intermedio paso a paso antes de llegar a una respuesta final. Si bien a menudo es beneficioso, descubrimos que un comportamiento innato similar al de CoT en el modelo inicial deepseek-ai/DeepSeek-R1-Distill-Llama-8B era contraproducente. Generó pasos de razonamiento detallados y no deterministas en lugar de los resultados factuales concisos requeridos, y provocó que el modelo intentara largas excursiones de razonamiento para responder todas las preguntas, incluso aquellas que no tenían respuesta. Para resolver esto, el equipo desarrolló una novedosa técnica de metainyección rápida. Este enfoque implica reformatear los datos de entrenamiento para finalizar preventivamente el proceso CoT del modelo. Utilizando el mismo formato JSON que en los ejemplos anteriores, los datos se estructuraron de la siguiente manera:
Al inyectar el token (destinado únicamente para uso interno del modelo) inmediatamente antes de la respuesta verdadera en cada ejemplo de entrenamiento, el modelo aprendió a asociar la finalización de su proceso interno directamente con el inicio del resultado final correcto. Esto efectivamente cortocircuitó el razonamiento detallado no deseado en el momento de la inferencia, obligando al modelo a producir solo la respuesta determinista deseada.
Esta técnica es un poderoso ejemplo del uso del formato de datos como herramienta para controlar y dar forma al comportamiento innato de un modelo.
Ajuste fino de Amazon Nova para obtener el máximo rendimiento
La técnica SFT elegida para la tarea sin alucinaciones es la Adaptación de bajo rango (LoRA) porque preserva más fielmente la comprensión del lenguaje de un modelo básico, simplemente colocando un adaptador parametrizado encima. Otros métodos de ajuste, que cambian directamente los parámetros del modelo base, corren el riesgo de degradar esta capacidad. Como es bien sabido en la literatura de investigación sobre SFT, el mayor obstáculo a superar es evitar el sobreajuste. Existen muchas técnicas para evitar el sobreajuste con SFT basado en LoRA, que están respaldadas por las recetas de ajuste proporcionadas en SageMaker AI:
Regularización: este es el método más general para evitar el sobreajuste. Las recetas de SageMaker para LoRA SFT admiten un método de regularización: abandono de LoRA. La literatura de investigación sugiere que el valor óptimo es alrededor del 50% de abandono, y los experimentos confirman la optimización de ese valor. Reducción de parámetros: esta es una forma de fuerza bruta de evitar el sobreajuste, pero con la desventaja de correr el riesgo de un ajuste insuficiente. Las recetas de SageMaker para LoRA SFT admiten un método de reducción de parámetros, reduciendo el rango de LoRA al reducir el parámetro alfa de LoRA. En este caso, no ayuda reducir este parámetro porque hacerlo no ajusta más que reduce el sobreajuste. Debido a que nuestro objetivo es crear una capacidad de propósito general, es mejor mantener el recuento de parámetros sin procesar lo más alto posible, no reducirlo. Detención anticipada: a menudo, el entrenamiento mejorará inicialmente el error de validación, pero después de algunos pasos, comenzará a sobreajustarse, con el error de entrenamiento disminuyendo pero el error de validación volviendo a aumentar. Aunque SageMaker AI no admite la detención anticipada automática, puede realizarla manualmente verificando el curso del error de validación en una ejecución de entrenamiento sobreadaptada más larga y luego limitando manualmente la cantidad de épocas hasta el punto en que se minimice el error de validación. Esto se puede lograr utilizando la serie temporal de errores de validación para cada época devuelta por SageMaker AI. Mayor cantidad y diversidad de datos de entrenamiento: debido a que el objetivo es entrenar una capacidad de propósito general, es decir, evitar alucinaciones, cuanto mayor sea la cantidad y diversidad de los datos de entrenamiento, menos posibilidades tendrá el modelo de sobreajustarse a los datos específicos en los que está entrenado. Debido a que los datos de entrenamiento se generan sintéticamente, se pueden producir cantidades combinatorias (es decir, exponenciales) de distintos ejemplos de entrenamiento según sea necesario. Este último método es el más eficaz para esta tarea de propósito general, pero requiere una construcción cuidadosa del generador de datos sintéticos para ayudar a garantizar la capacidad de escalar a una cantidad y diversidad suficientes de datos de entrenamiento.
Al reunir todas estas técnicas (regularización de abandono de LoRA del 50 %, maximizar en lugar de minimizar el número de parámetros de LoRA, para evitar un ajuste insuficiente involuntario, detención anticipada manual basada en el seguimiento de las métricas de validación de una ejecución más larga y aumentar el tamaño del conjunto de datos de entrenamiento sintético a 30.000 ejemplos), podemos obtener una tasa de alucinaciones del 0,03 % para la versión personalizada de Artificial Genius de Nova Lite.
Para ayudarlo a ver el impacto de varias opciones de hiperparámetros, que podrían ser útiles para otros clientes que usan SageMaker para realizar ajustes, las siguientes tablas muestran algunos resultados cuantitativos de la exploración del espacio de hiperparámetros para esta tarea. Las opciones de hiperparámetros importantes en cada caso están resaltadas en negrita. Se utilizó el mismo conjunto de datos de prueba de 10.000 ejemplos, independientemente del número de ejemplos de entrenamiento, para medir las tasas de alucinaciones finales reales en los casos en que se muestra ese número. Para los otros casos, que se sobreajustaron al detenerse demasiado tarde, solo se muestran los puntos de control de error de validación.
Abandono de LoRA LoRA alfa Épocas de entrenamiento (o puntos de control de validación) Ejemplos de entrenamiento Tasa de aprendizaje de LoRA Tasa de alucinaciones (o errores de validación) 50 % 128 3 10 000 32 7,5 % 50 % 192 2–4 10 000 28 1,0 %–3,9 % 50 % 32 2–4 10 000 24 1,5%–2,6% 1% 32 2–4 10.000 24 1,6%–4,0% 50% 192 2 2.500 28 3,3% 50% 192 2 10.000 28 0,17% 50% 192 2 30.000 16 0,03%
De estos resultados empíricos se desprende claramente que la cantidad y diversidad de los datos de entrenamiento fue el factor más importante para superar el sobreajuste, junto con la parada temprana.
Cómo configurar y ejecutar trabajos de ajuste en SageMaker
AWS tiene recursos que explican cómo aprovechar SageMaker para realizar ajustes, como la publicación técnica del blog, Métodos avanzados de ajuste en Amazon SageMaker AI.
Para las empresas interesadas en combinar el ajuste de su dominio específico con la tecnología antialucinaciones de Artificial Genius, el ajuste personalizado está disponible previa solicitud, en colaboración con AWS y Artificial Genius.
Un análisis cuantitativo del desempeño y la verificabilidad.
El éxito de la metodología de ajuste fino no generativo se validó mediante un marco de evaluación riguroso que produjo resultados claros y cuantitativos.
El marco de evaluación
Se estableció un marco de evaluación multifacético para medir el desempeño en comparación con los objetivos centrales del proyecto:
Reducción de alucinaciones: esta fue la métrica principal, cuantificada midiendo el porcentaje de respuestas que contenían información inventada cuando el modelo se probó en un conjunto de preguntas sin respuesta. Capacidades de inferencia compleja: el rendimiento del modelo se evaluó en función de su capacidad para responder correctamente o negarse a responder una variedad de preguntas no generativas sobre una variedad de texto de entrada, incluidas preguntas complejas que requieren la comprensión y combinación de información de múltiples partes distantes del texto de entrada. Métricas para entornos regulados: la tasa de alucinaciones es inequívoca y sencilla de calcular: es el porcentaje de preguntas sin respuesta que fueron respondidas con cualquier cosa excepto la no respuesta indicada. Si se desea, esta tasa de alucinaciones se puede interpretar como una puntuación F1 o ROUGE.
Lecciones aprendidas y reflexiones
A continuación se presentan varias ideas clave que sirven como mejores prácticas para implementar una IA confiable en entornos regulados:
La ingeniería de datos es primordial: el éxito de un ajuste altamente especializado depende abrumadoramente de la calidad y el diseño inteligente de los datos de entrenamiento para evitar el sobreajuste. La inclusión estratégica de ejemplos negativos (preguntas sin respuesta) es una técnica crítica y muy eficaz para mitigar las alucinaciones. Equilibrar la capacidad con el control: para la IA empresarial, el objetivo principal suele ser limitar de forma inteligente las amplias capacidades de un modelo para ayudar a garantizar la confiabilidad, en lugar de liberar todo su potencial generativo. El determinismo y la auditabilidad son características que deben diseñarse, no asumirse. Adopte un enfoque iterativo: el desarrollo del aprendizaje automático aplicado es un proceso iterativo. El equipo comenzó con un modelo, identificó un defecto de comportamiento (CoT no deseado), diseñó una solución centrada en datos (metainyección) y, finalmente, comparó y seleccionó un modelo base superior (Amazon Nova). Esto resalta la necesidad de flexibilidad y validación empírica en cada etapa de desarrollo.
Conclusión: El camino a seguir para una IA confiable en las finanzas
La metodología detallada en este artículo representa un marco viable y eficiente en datos para crear LLM deterministas y no alucinantes para tareas empresariales críticas. Al utilizar ajustes no generativos en modelos básicos potentes como Amazon Nova dentro de los trabajos de capacitación de Amazon SageMaker, las organizaciones pueden diseñar sistemas de inteligencia artificial que cumplan con las estrictas demandas de precisión, auditabilidad y confiabilidad. Este trabajo proporciona una solución para más que servicios financieros; Ofrece un modelo transferible para cualquier industria regulada (incluida la legal, la de atención médica y la de seguros) donde los conocimientos impulsados por la IA deben ser verificables y totalmente rastreables. El camino a seguir implica ampliar esta solución a una gama más amplia de casos de uso, explorar tipos de tareas no generativas más complejas e investigar técnicas como la destilación de modelos para crear modelos de trabajadores altamente optimizados y rentables que sirvan como cerebros para cargas de trabajo agentes. Al priorizar la confianza diseñada sobre la generación sin restricciones, este enfoque allana el camino para la adopción responsable e impactante de la IA en los sectores más críticos del mundo.
Contribución: Un agradecimiento especial a Ilan Gleiser, quien fue especialista principal en GenAI en el equipo de AWS WWSO Frameworks y nos ayudó con este caso de uso.