Esta publicación de blog se basa en un trabajo desarrollado conjuntamente con Flo Health.
La ciencia de la salud avanza rápidamente. Mantener contenido médico preciso y actualizado tiene un impacto directo en la vida, las decisiones de salud y el bienestar de las personas. Cuando alguien busca información de salud, a menudo se encuentra en su punto más vulnerable, lo que hace que la precisión no sólo sea importante, sino que potencialmente salve vidas.
Flo Health crea miles de artículos médicos cada año, brindando a millones de usuarios en todo el mundo información médicamente creíble sobre la salud de la mujer. Verificar la precisión y relevancia de esta vasta biblioteca de contenido es un desafío importante. El conocimiento médico evoluciona continuamente y la revisión manual de cada artículo no sólo requiere mucho tiempo sino que también es propensa a errores humanos. Es por eso que el equipo de Flo Health, la compañía detrás de Flo, la aplicación líder en salud femenina, está utilizando IA generativa para facilitar la precisión del contenido médico a escala. A través de una asociación con el Centro de innovación de IA generativa de AWS, Flo Health está desarrollando un enfoque innovador, denominado también “Solución de optimización de revisión y revisión de contenido automatizado médico” (MACROS) para verificar y mantener la precisión de su extensa biblioteca de información de salud. Esta solución impulsada por IA es capaz de:
Procesar eficientemente grandes volúmenes de contenido médico basado en fuentes científicas creíbles. Identificar posibles imprecisiones o información desactualizada basada en recursos científicos creíbles. Proponer actualizaciones basadas en las últimas investigaciones y directrices médicas, así como incorporar comentarios de los usuarios.
El sistema impulsado por Amazon Bedrock permite a Flo Health realizar revisiones de contenido médico y evaluaciones de revisión a escala, lo que garantiza una precisión actualizada y respalda una toma de decisiones de atención médica más informada. Este sistema realiza un análisis de contenido detallado y proporciona información completa sobre el cumplimiento de las normas y directrices médicas para que los expertos médicos de Flo las revisen. También está diseñado para una integración perfecta con la infraestructura tecnológica existente de Flo, facilitando actualizaciones automáticas cuando corresponda.
Esta serie de dos partes explora el viaje de Flo Health con la IA generativa para la verificación de contenido médico. La Parte 1 examina nuestra prueba de concepto (PoC), incluida la solución inicial, las capacidades y los primeros resultados. La parte 2 cubre el enfoque en los desafíos de escala y la implementación en el mundo real. Cada artículo es independiente y muestra colectivamente cómo la IA transforma la gestión de contenidos médicos a escala.
Objetivos de prueba de concepto y criterios de éxito
Antes de sumergirnos en la solución técnica, establecimos objetivos claros para nuestro sistema de revisión de contenido médico PoC:
Objetivos clave:
Validar la viabilidad del uso de IA generativa para la verificación de contenido médico Determinar los niveles de precisión en comparación con la revisión manual Evaluar el tiempo de procesamiento y las mejoras de costos
Métricas de éxito:
Precisión: recuperación del contenido del 90 % Eficiencia: reducción del tiempo de detección de horas a minutos según la pauta Reducción de costos: reducción de la carga de trabajo de revisión de expertos Calidad: mantenimiento de los estándares editoriales y la precisión médica de Flo Velocidad: 10 veces más rápido que el proceso de revisión manual
Para verificar que la solución cumpla con los altos estándares de contenido médico de Flo Health, los expertos médicos y los equipos de contenido de Flo Health trabajaron estrechamente con especialistas técnicos de AWS a través de sesiones de revisión periódicas, brindando comentarios críticos y experiencia médica para mejorar continuamente el rendimiento y la precisión del modelo de IA. El resultado es MACROS, nuestra solución personalizada para la verificación de contenido médico asistida por IA.
Descripción general de la solución
En esta sección, describimos cómo la solución MACROS utiliza Amazon Bedrock y otros servicios de AWS para automatizar la revisión y revisión de contenido médico.
Figura 1. Descripción general de la solución de optimización y revisión de contenidos médicos automatizados
Como se muestra en la Figura 1, la solución desarrollada admite dos procesos principales:
Revisión y revisión de contenido: permite cumplir con los estándares médicos y el estilo de los artículos médicos existentes a escala dadas las reglas y pautas personalizadas preespecificadas y propone una revisión que se ajuste a los nuevos estándares médicos, así como a las pautas de estilo y tono de Flo. Optimización de reglas: MACROS acelera el proceso de extracción de nuevas pautas (médicas) de la investigación (médica), preprocesándolas en el formato necesario para la revisión del contenido, además de optimizar su calidad.
Ambos pasos se pueden realizar a través de la interfaz de usuario (UI), así como a través de la llamada API directa. El soporte de la interfaz de usuario permite a los expertos médicos ver directamente las estadísticas de revisión de contenido, interactuar con los cambios y realizar ajustes manuales. El soporte de llamadas API está destinado a la integración en la canalización para una evaluación periódica.
Arquitectura
La Figura 2 muestra la arquitectura de MACROS. Consta de dos partes principales: backend y frontend.
Figura 2. Arquitectura MACROS
A continuación, se presenta el flujo de los principales componentes de la aplicación:
1. Los usuarios comienzan recopilando y preparando contenido que debe cumplir con los estándares y reglas médicas.
2. En el segundo paso, los datos se proporcionan como archivos PDF, TXT o texto a través de la interfaz de usuario de Streamlit alojada en Amazon Elastic Container Service (ECS). La autenticación para la carga de archivos se realiza a través de Amazon API Gateway
3. Alternativamente, los archivos JSON personalizados de Flo Health se pueden cargar directamente en el depósito de Amazon Simple Storage Service (S3) de la pila de soluciones.
4. La interfaz alojada en ECS tiene permisos de AWS IAM para organizar tareas mediante AWS Step Functions.
5. Además, el contenedor ECS tiene acceso al S3 para enumerar, descargar y cargar archivos, ya sea a través de una URL prefirmada o boto3.
6. Opcionalmente, si el archivo de entrada se carga a través de la interfaz de usuario, la solución invoca el servicio AWS Step Functions que inicia la funcionalidad de preprocesamiento alojada en una función AWS Lambda. Este Lambda tiene acceso a Amazon Textract para extraer texto de archivos PDF. Los archivos se almacenan en S3 y también se devuelven a la interfaz de usuario.
7-9. Alojadas en AWS Lambda, las funciones Rule Optimizer, Content Review y Revision se organizan a través de AWS Step Function. Tienen acceso a Amazon Bedrock para obtener capacidades de IA generativa para realizar la extracción de reglas a partir de datos no estructurados, revisión y revisión de contenido, respectivamente. Además, tienen acceso a S3 a través del SDK de boto3 para almacenar los resultados.
10. La función Compute Stats AWS Lambda tiene acceso a S3 y puede leer y combinar los resultados de revisiones individuales y ejecuciones de revisión.
11. La solución aprovecha Amazon CloudWatch para el monitoreo del sistema y la administración de registros. Para implementaciones de producción que tratan con contenido médico crítico, las capacidades de monitoreo podrían ampliarse con métricas y alarmas personalizadas para proporcionar información más granular sobre el rendimiento del sistema y los patrones de procesamiento de contenido.
Mejoras futuras
Si bien nuestra arquitectura actual utiliza AWS Step Functions para la orquestación del flujo de trabajo, estamos explorando el potencial de Amazon Bedrock Flows para futuras iteraciones. Bedrock Flows ofrece capacidades prometedoras para optimizar los flujos de trabajo impulsados por IA, simplificando potencialmente nuestra arquitectura y mejorando la integración con otros servicios de Bedrock. Esta alternativa podría proporcionar una gestión más fluida de nuestros procesos de IA, especialmente a medida que escalamos y evolucionamos nuestra solución.
Revisión y revisión de contenido.
En el núcleo de MACROS se encuentra su funcionalidad de revisión y revisión de contenido con los modelos básicos de Amazon Bedrock. El bloque de revisión y revisión de contenido consta de cinco componentes principales: 1) la etapa de filtrado opcional, 2) fragmentación, 3) revisión, 4) revisión y 5) posprocesamiento, como se muestra en la Figura 3.
Figura 3. Revisión de contenido y proceso de revisión
Así es como MACROS procesa el contenido médico subido:
Filtrado (opcional): el viaje comienza con un paso de filtrado opcional. Esta función inteligente comprueba si el conjunto de reglas es relevante para el artículo, lo que potencialmente ahorra tiempo y recursos en procesamientos innecesarios. Fragmentación: el texto fuente se divide en párrafos. Este paso crucial facilita la evaluación de buena calidad y ayuda a prevenir revisiones no deseadas de textos no relacionados. La fragmentación se puede realizar utilizando heurísticas, como puntuación o divisiones basadas en expresiones regulares, así como utilizando modelos de lenguaje grande (LLM) para identificar fragmentos de texto semánticamente completos. Revisión: Cada párrafo o sección se somete a una revisión exhaustiva de las normas y directrices pertinentes. Revisión: solo los párrafos marcados como no adherentes pasan a la etapa de revisión, agilizando el proceso y manteniendo la integridad del contenido adherente. La IA sugiere actualizaciones para alinear los párrafos no adherentes con las últimas pautas y los requisitos de estilo de Flo. Postprocesamiento: finalmente, los párrafos revisados se integran perfectamente nuevamente en el texto original, lo que da como resultado un documento actualizado y adherente.
El paso de filtrado se puede realizar mediante un LLM adicional a través de una llamada de Amazon Bedrock que evalúa cada sección por separado con la siguiente estructura de indicaciones:
Figura 4. Paso de filtrado simplificado basado en LLM
Además, los enfoques que no son de LLM pueden ser factibles para respaldar el paso de Filtrado:
Codificar las reglas y los artículos en vectores de incrustación densos y calcular la similitud entre ellos. Al establecer el umbral de similitud, podemos identificar qué conjunto de reglas se considera relevante para el documento de entrada. De manera similar, la superposición directa a nivel de palabras clave entre el documento y la regla se puede identificar utilizando métricas BLEU o ROUGE.
La revisión de contenido, como ya se mencionó, se lleva a cabo por secciones de texto en función de un grupo de reglas y conduce a respuestas en formato XML, como por ejemplo:
Aquí, 1 indica adherencia y 0 – no adherencia del texto a las reglas especificadas. El uso del formato XML ayuda a lograr un análisis confiable de la salida.
Este paso de revisión itera sobre las secciones del texto para garantizar que el LLM preste atención a cada sección por separado, lo que condujo a resultados más sólidos en nuestra experimentación. Para facilitar una mayor precisión en la detección de secciones no adherentes, el usuario también puede utilizar el modo de llamada múltiple, donde en lugar de una llamada de Amazon Bedrock que evalúa el cumplimiento del artículo con respecto a todas las reglas, tenemos una llamada independiente por regla.
El paso de Revisión recibe el resultado de la Revisión (secciones no adherentes y los motivos de la no adherencia), así como las instrucciones para crear la revisión en un tono similar. Luego sugiere revisiones de las oraciones no adherentes en un estilo similar al texto original. Finalmente, el paso de posprocesamiento combina el texto original con nuevas revisiones, asegurándose de que no se modifiquen otras secciones.
Los diferentes pasos del flujo requieren diferentes niveles de complejidad del modelo LLM. Si bien las tareas más simples, como la fragmentación, se pueden realizar de manera eficiente con un modelo relativamente pequeño como la familia de modelos Claude Haiku, las tareas de razonamiento más complejas, como la revisión y revisión de contenido, requieren modelos más grandes como Claude Sonnet o la familia de modelos Opus para facilitar un análisis preciso y la generación de contenido de alta calidad. Este enfoque escalonado para la selección de modelos optimiza tanto el rendimiento como la rentabilidad de la solución.
Modos de funcionamiento
La función Revisión y revisión de contenido funciona en dos modos de interfaz de usuario: Procesamiento detallado de documentos y Procesamiento de documentos múltiples, cada uno de los cuales atiende a diferentes escalas de gestión de contenido. El modo de procesamiento detallado de documentos ofrece un enfoque granular para la evaluación de contenido y se muestra en la Figura 5. Los usuarios pueden cargar documentos en varios formatos (PDF, TXT, JSON o pegar texto directamente) y especificar las pautas con las que se debe evaluar el contenido.
Figura 5. Ejemplo de procesamiento de documentos detallado
Los usuarios pueden elegir entre conjuntos de reglas predefinidas, aquí, vitamina D, salud mamaria y síndrome premenstrual y trastorno disfórico (PMS y PMDD), o ingresar pautas personalizadas. Estas pautas personalizadas pueden incluir reglas como "El título del artículo debe ser médicamente exacto", así como ejemplos de contenido que cumplen y no cumplen con las reglas.
Los conjuntos de reglas garantizan que la evaluación se alinee con estándares médicos específicos y la guía de estilo única de Flo. La interfaz permite realizar ajustes sobre la marcha, lo que la hace ideal para revisiones exhaustivas de documentos individuales. Para operaciones a mayor escala, se debe utilizar el modo de procesamiento de documentos múltiples. Este modo está diseñado para manejar numerosos archivos JSON personalizados simultáneamente, imitando cómo Flo integraría MACROS en su sistema de gestión de contenidos.
Extracción de reglas y directrices a partir de datos no estructurados.
No siempre se dispone inmediatamente de directrices viables y bien preparadas. A veces se proporcionan en archivos no estructurados o es necesario encontrarlos. Con la función Rule Optimizer, podemos extraer y perfeccionar pautas prácticas de múltiples documentos complejos.
Rule Optimizer procesa documentos PDF sin formato para extraer texto, que luego se divide en secciones significativas según los encabezados de los documentos. Este contenido segmentado se procesa a través de Amazon Bedrock mediante indicaciones del sistema especializado, con dos modos distintos: estilo/tonalidad y modo médico.
El modo Estilo/tonalidad se centra en extraer las pautas sobre cómo se debe escribir el texto, su estilo, qué formatos y palabras se pueden o no utilizar.
Rule Optimizer asigna una prioridad para cada regla: alta, media y baja. El nivel de prioridad indica la importancia de la regla, guiando el orden de revisión del contenido y centrando la atención en las áreas críticas primero. Rule Optimizer incluye una interfaz de edición manual donde los usuarios pueden refinar el texto de las reglas, ajustar las clasificaciones y administrar las prioridades. Por lo tanto, si los usuarios necesitan actualizar una regla determinada, los cambios se almacenan para uso futuro en Amazon S3.
El modo Médico está diseñado para procesar documentos médicos y está adaptado a un lenguaje más científico. Permite agrupar reglas extraídas en tres clases:
Pautas sobre condiciones médicas Pautas específicas para tratamientos Cambios en los consejos y tendencias en salud
Figura 6. Mensaje de optimización de reglas médicas simplificadas
La Figura 6 proporciona un ejemplo de un mensaje de optimización de reglas médicas, que consta de tres componentes principales: configuración de roles: experto en IA médica, descripción de lo que constituye una buena regla y, finalmente, el resultado esperado. Identificamos la cualidad suficientemente buena para una regla si es:
Claro, inequívoco y procesable Relevante, consistente y conciso (máximo dos oraciones) Escrito con voz activa Evita jerga innecesaria
Consideraciones y desafíos de implementación
Durante el desarrollo de nuestro PoC, identificamos varias consideraciones cruciales que beneficiarían a otros que implementen soluciones similares:
Preparación de datos: Esto surgió como un desafío fundamental. Aprendimos la importancia de estandarizar los formatos de entrada tanto para el contenido médico como para las pautas, manteniendo al mismo tiempo estructuras de documentos consistentes. La creación de diversos conjuntos de pruebas sobre diferentes temas médicos resultó esencial para una validación integral. Gestión de costos: monitorear y optimizar los costos rápidamente se convirtió en una prioridad clave. Implementamos el seguimiento del uso de tokens y optimizamos el diseño rápido y el procesamiento por lotes para equilibrar el rendimiento y la eficiencia. Cumplimiento normativo y ético: Dada la naturaleza sensible del contenido médico, eran fundamentales estrictas salvaguardias regulatorias y éticas. Establecimos prácticas de documentación sólidas para las decisiones de IA, implementamos un estricto control de versiones para pautas médicas y una supervisión médica humana continua de expertos para las sugerencias generadas por IA. Las regulaciones sanitarias regionales se consideraron cuidadosamente durante su implementación. Integración y escalamiento: recomendamos comenzar con un entorno de prueba independiente mientras planifica la futura integración del sistema de gestión de contenido (CMS) a través de puntos finales API bien diseñados. Construir teniendo en cuenta la modularidad resultó valioso para futuras mejoras. A lo largo del proceso, enfrentamos desafíos comunes, como mantener el contexto en artículos médicos extensos, equilibrar la velocidad de procesamiento con la precisión y facilitar un tono consistente en las revisiones sugeridas por IA. Optimización de modelos: la capacidad de selección de modelos diversos de Amazon Bedrock resultó particularmente valiosa. A través de su plataforma, podemos elegir modelos óptimos para tareas específicas, lograr rentabilidad sin sacrificar la precisión y actualizar sin problemas a modelos más nuevos, todo ello manteniendo nuestra arquitectura existente.
Resultados preliminares
Nuestra prueba de concepto arrojó resultados sólidos en las métricas de éxito críticas, lo que demuestra el potencial de la revisión de contenido médico asistida por IA. La solución superó las mejoras de velocidad de procesamiento objetivo y al mismo tiempo mantuvo una precisión del 80 % y una recuperación de más del 90 % en la identificación de contenido que requiere actualizaciones. En particular, el sistema impulsado por IA aplicó pautas médicas de manera más consistente que las revisiones manuales y redujo significativamente la carga de tiempo de los expertos médicos.
Conclusiones clave
Durante la implementación, descubrimos varios conocimientos fundamentales para optimizar el rendimiento de la IA en el análisis de contenido médico. La fragmentación del contenido fue esencial para una evaluación precisa de documentos extensos, y la validación experta de las reglas de análisis ayudó a los expertos médicos a mantener la precisión clínica. Lo más importante es que el proyecto confirmó que la colaboración entre humanos y la IA (no la automatización total) es clave para una implementación exitosa. Los comentarios periódicos de los expertos y las métricas de rendimiento claras guiaron los perfeccionamientos y mejoras incrementales del sistema. Si bien el sistema agiliza significativamente el proceso de revisión, funciona mejor como herramienta de aumento, ya que los expertos médicos siguen siendo esenciales para la validación final, creando un enfoque híbrido más eficiente para la gestión de contenido médico.
Conclusión y próximos pasos
Esta primera parte de nuestra serie demuestra cómo la IA generativa puede hacer que el proceso de revisión de contenido médico sea más rápido, más eficiente y escalable, manteniendo al mismo tiempo una alta precisión. Estén atentos a la Parte 2 de esta serie, donde cubrimos el viaje de producción, profundizando en los desafíos y las estrategias de escalamiento. ¿Está listo para llevar sus iniciativas de IA a producción?
Sobre los autores
Liza (Elizaveta) Zinovyeva, Ph.D., es científica aplicada en el Centro de innovación de IA generativa de AWS y tiene su sede en Berlín. Ayuda a clientes de diferentes industrias a integrar la IA generativa en sus aplicaciones y flujos de trabajo existentes. Le apasionan los temas de IA/ML, finanzas y seguridad del software. En su tiempo libre, le gusta pasar tiempo con su familia, los deportes, aprender nuevas tecnologías y realizar pruebas de mesa.
Callum Macpherson es científico de datos en el Centro de innovación de IA generativa de AWS, donde la IA de vanguardia se combina con la transformación empresarial del mundo real. Callum se asocia directamente con los clientes de AWS para diseñar, construir y escalar soluciones de IA generativa que abran nuevas oportunidades, aceleren la innovación y generen un impacto mensurable en todas las industrias.
Arefeh Ghahvechi es estratega senior de IA en el Centro de innovación GenAI de AWS y se especializa en ayudar a los clientes a obtener valor rápidamente de las tecnologías de IA generativa al unir la innovación y la implementación. Identifica oportunidades de IA de alto impacto al tiempo que desarrolla las capacidades organizativas necesarias para una adopción a escala en empresas e iniciativas nacionales.
Nuno Castro es Gerente Sr. de Ciencias Aplicadas. Tiene 19 años de experiencia en el campo en industrias como finanzas, manufactura y viajes, y lideró equipos de aprendizaje automático durante 11 años.
Dmitrii Ryzhov es gerente senior de cuentas en Amazon Web Services (AWS), y ayuda a las empresas nativas digitales a desbloquear el potencial comercial a través de la IA, la IA generativa y las tecnologías de la nube. Trabaja en estrecha colaboración con los clientes para identificar iniciativas comerciales de alto impacto y acelerar la ejecución mediante la orquestación del soporte estratégico de AWS, incluido el acceso a la experiencia, los recursos y los programas de innovación adecuados.
Nikita Kozodoi, PhD, es científica aplicada senior en el Centro de innovación de IA generativa de AWS y trabaja en la frontera de la investigación y los negocios de IA. Nikita crea e implementa soluciones generativas de inteligencia artificial y aprendizaje automático que resuelven problemas del mundo real e impulsan el impacto comercial para los clientes de AWS en todas las industrias.
Aiham Taleb, PhD, es científico aplicado sénior en el Centro de innovación de IA generativa y trabaja directamente con clientes empresariales de AWS para aprovechar Gen AI en varios casos de uso de alto impacto. Aiham tiene un doctorado en aprendizaje de representación no supervisado y tiene experiencia en la industria que abarca diversas aplicaciones de aprendizaje automático, incluida la visión por computadora, el procesamiento del lenguaje natural y las imágenes médicas.