Impulsando el descubrimiento científico: BYOKG y GraphRAG para la investigación farmacéutica inteligente

En la investigación farmacéutica, los científicos enfrentan un desafío fundamental: acceder y conectar la gran cantidad de conocimiento científico disperso en sistemas dispares. Desde la literatura publicada y las notas internas de laboratorio hasta las bases de datos genómicas, los conocimientos críticos permanecen atrapados en silos, lo que dificulta que los investigadores establezcan conexiones integrales y generen hipótesis prometedoras. Esta fragmentación ralentiza el proceso de descubrimiento de fármacos. También se corre el riesgo de que se pierda valioso conocimiento institucional a medida que los investigadores hacen la transición, lo que en última instancia afecta la capacidad de la industria para investigar y desarrollarse de manera eficiente. La necesidad de una solución que pueda cerrar de manera inteligente estas brechas de conocimiento manteniendo al mismo tiempo la integridad científica se ha vuelto cada vez más importante.

El desafío: datos dispersos en sistemas fragmentados

En las principales compañías farmacéuticas, los investigadores enfrentan un desafío crítico en el descubrimiento de fármacos en etapas tempranas, donde los métodos tradicionales arrojan sólo una tasa de éxito del 5 por ciento y la detección inicial lleva más de seis meses. Los científicos luchan por conectar conocimientos enterrados en sistemas fragmentados como PubMed, notas internas de laboratorio y bases de datos genómicas, mientras compiten contra competidores y limitaciones de tiempo. La naturaleza dispersa de los datos genera trabajo redundante y oportunidades perdidas. También dificulta el seguimiento de la evidencia necesaria para la aprobación regulatoria. Cuando los investigadores se marchan, a menudo se llevan consigo valiosos conocimientos tácitos, lo que compromete aún más la memoria institucional necesaria para realizar descubrimientos revolucionarios.

Desafíos en el descubrimiento de fármacos en etapas tempranas:

Tasa de éxito y eficiencia del tiempo deficientes: solo una tasa de acierto del 5 por ciento con más de 6 meses de tiempo de evaluación por intento. Sistemas de conocimiento fragmentados: conocimientos críticos dispersos en PubMed, notas de laboratorio y bases de datos, lo que genera conexiones perdidas. Pérdida de memoria institucional: el conocimiento valioso desaparece cuando los investigadores se van, rompiendo la continuidad de los esfuerzos de investigación.

Estos desafíos en conjunto crean un cuello de botella importante en el proceso de descubrimiento de fármacos, lo que genera ineficiencias, oportunidades perdidas y posibles retrasos en el desarrollo de tratamientos que salvan vidas. Nuestra solución aborda estos cuellos de botella yendo más allá de los métodos tradicionales: la IA basada en gráficos respalda la investigación farmacéutica mediante la creación de un entorno de conocimiento interconectado. Con Amazon Neptune Analytics, los investigadores ahora pueden formular preguntas complejas en lenguaje natural y recibir información instantánea respaldada por evidencia extraída de un gráfico de conocimiento unificado que conecta todo, desde interacciones compuestas hasta expresiones genéticas y estudios clínicos. Este enfoque no sólo proporciona respuestas. Revela el razonamiento completo detrás de cada resultado al mostrar rutas de citas detalladas y pasos transversales de gráficos. Al exponer cómo el sistema navega a través de artículos de investigación y puntos de datos interconectados, hace que el descubrimiento científico sea más transparente y reproducible.

Al combinar gráficos e IA generativa, los científicos investigadores no solo recuperan información. Pueden amplificar el razonamiento, preservar la memoria institucional y sacar a la luz ideas que de otro modo permanecerían enterradas. También les ayuda a generar mejores hipótesis, avanzar más rápido y confiar en los resultados, porque cada conocimiento viene acompañado de contexto y pruebas. En un campo donde el costo del retraso se mide tanto en dólares como en vidas, este cambio es más que útil. Cambia la forma en que se realiza la investigación.

En esta publicación, exploramos cómo la generación aumentada de recuperación basada en gráficos (GraphRAG) está transformando la investigación científica al combinar bases de datos de gráficos con IA generativa. Con este enfoque, se pueden acelerar los procesos de descubrimiento sin comprometer la integridad científica.

Al integrar Amazon Neptune Analytics para el procesamiento de gráficos de alto rendimiento con Amazon Bedrock, los investigadores pueden crear sistemas sofisticados que no solo comprendan relaciones científicas complejas sino que también proporcionen interfaces intuitivas de lenguaje natural. La arquitectura GraphRAG ayuda a mejorar la calidad de las respuestas generadas por IA al atravesar de manera inteligente gráficos de conocimiento para identificar rutas de información relevantes. Esto garantiza que las respuestas estén firmemente ancladas en datos científicos verificados.

Lo que hace que esta solución sea poderosa para la investigación científica es su capacidad para comprender y conectar relaciones intrincadas entre entidades, desde plantas y compuestos hasta proteínas, genes y sus efectos asociados sobre la salud. Con esta comprensión integral, los investigadores pueden descubrir conocimientos de manera más eficiente y tomar decisiones basadas en datos con mayor confianza.

Descripción general de la solución

La solución reinventa el proceso de investigación a través de un enfoque Bring Your Own Knowledge Graph (BYOKG) mejorado con capacidades GraphRAG. Un gráfico de conocimiento es una representación estructurada de información que muestra las relaciones entre diferentes entidades como una red de nodos y bordes interconectados. Impulsado por Amazon Neptune, integra diversas entidades científicas (plantas, compuestos, genes, proteínas y efectos sobre la salud) en una red de conocimiento unificada que une datos de fuentes públicas como PubMed y Gene Ontology con conjuntos de datos patentados. Los canales de ingesta automatizados y los algoritmos de gráficos enriquecen continuamente el gráfico, lo que ayuda a los investigadores a descubrir relaciones biológicas complejas y conocimientos que antes estaban ocultos en silos de datos desconectados.

Utilizando Neptune Analytics y Amazon Bedrock, la solución combina algoritmos gráficos con consultas en lenguaje natural para hacer que la exploración científica sea tanto analítica como intuitiva. Los investigadores pueden hacer preguntas complejas en inglés sencillo y recibir respuestas basadas en evidencia derivadas del recorrido de gráficos, completas con citas de fuentes y rutas visuales. Las herramientas de visualización interactiva ayudan aún más a mejorar la transparencia y la comprensión, permitiendo a los usuarios explorar relaciones, rastrear hipótesis hasta conclusiones y validar resultados con evidencia clara y verificable. Esto acelera el descubrimiento y fortalece el rigor científico en todos los dominios.

Arquitectura de la solución

Nuestra solución ayuda a los investigadores a descubrir rápidamente artículos de revistas médicas relevantes sobre enfermedades y temas. El conjunto de datos incluye los artículos de revistas HCLS proporcionados por el subconjunto de acceso abierto de PMC con licencias CC BY y CC0, metadatos de revistas proporcionados por el Centro Nacional de Información Biotecnológica (NCBI) a través del paquete Bio.Entrez, jerarquías de ontología de enfermedades y códigos ICD10 que se han extraído utilizando la API de enlace ICD-10-CM dentro de Amazon Comprehend Medical. Aunque se le proporciona el conjunto de datos final, la siguiente arquitectura describe el flujo utilizado para crear el conjunto de datos.

El siguiente diagrama ilustra la carga de datos en Amazon Neptune Analytics utilizando servicios como Amazon Bedrock y Amazon Comprehend para extraer datos de revistas médicas.

La siguiente imagen representa el gráfico final, que contiene estos tipos de nodos:

enfermedad: Representa una enfermedad dentro de la Ontología de Enfermedad. La Ontología de Enfermedades proporciona un mapeo para ayudarnos a comprender qué enfermedades son subclases de otras enfermedades. autor: Representa un autor de una revista en particular. diario: Representa un diario. journalChunk: representa una parte de una revista determinada. Los fragmentos se determinaron mediante la estrategia de fragmentación predeterminada proporcionada a través de las bases de conocimiento de Amazon Bedrock. icd10: Representa un código ICD-10, que es una clasificación estandarizada de problemas médicos. Los bordes entre los nodos icd10 y los nodos Journal y JournalChunk se crearon mediante el enlace Amazon Comprehend Medical ICD-10-CM.

Gráfico de conocimiento que muestra los tipos de nodos de enfermedad, autor, revista, journalChunk e icd10 conectados por bordes

Debido a que utilizamos nuestro propio modelo de datos de gráficos, utilizamos el kit de herramientas BYOKG-RAG para implementar consultas en lenguaje natural sobre el gráfico. El siguiente diagrama ilustra los componentes de BYOKG.

Diagrama que muestra los componentes del kit de herramientas BYOKG-RAG

Requisitos previos

Antes de comenzar, asegúrese de tener los siguientes requisitos previos:

Interfaz de línea de comandos de AWS (AWS CLI) versión 2.11.0 o posterior instalada y configurada (guía de instalación) Acceso a los siguientes servicios de AWS: Amazon Neptune Analytics Amazon Bedrock (modelo Claude 4.5 Sonnet) Amazon SageMaker Amazon Simple Storage Service (Amazon S3) Rol de Amazon Comprehend Medical IAM con los siguientes permisos: NeptuneAnalyticsFullAccess AWSServiceRoleForAmazonNeptuneAnalytics AmazonS3ReadOnlyAccess AmazonBedrockFullAccess ComprehendMedicalFullAccess Python 3.9 o posterior Graphrag_toolkit versión 1.0.0 o posterior Entorno Jupyter Notebook

Resumen de costos de la solución

Aproximación del costo (por hora) para ejecutar esta demostración:

Gráfico de Neptune Analytics, 16 mNCU, sin modo de espera, conectividad pública: 0,48 $/hora. Notebook SageMaker Jupyter, t3.medium con 5 GB de volumen EBS: $0,05/hora para computación más $0,70/hora para almacenamiento. Almacenamiento S3, estándar, 161 MB – 0,161 GB × $0,023 = $0,0037 por mes. Amazon Bedrock: el costo de Amazon Bedrock depende del uso del modelo y del consumo de tokens. Para obtener la información más actualizada, consulte la página de precios.

Configurar Neptune Analytics

Comencemos a implementar su solución GraphRAG configurando Neptune Analytics. Los siguientes pasos lo guiarán a través de la importación de datos, la creación de gráficos y la configuración del cuaderno para construir la base de su gráfico de conocimiento:

Cree un depósito S3: aws s3 mb s3://amzn-s3-bucket-name. Copie el conjunto de datos en sus propios depósitos mediante la CLI de AWS:

aws s3 sync s3://aws-neptune-customer-samples-us-east-1/sample-notebooks/vector-graph-hybrid-search/graph-data/ s3://amzn-s3-bucket-name/

Cree un gráfico de Neptune Analytics utilizando la API CreateGraphUsingImportTask para importar desde la ubicación de Amazon S3 que copió en el primer paso. Para obtener detalles sobre cómo hacer esto, consulte la Guía del usuario de Neptune Analytics. Establezca la memoria aprovisionada mínima y máxima en 16. Mientras se crea el gráfico, cree un Neptune Notebook asociado con el gráfico. El portátil facilita la consulta e interacción con el gráfico, así como la configuración y ejecución del kit de herramientas GraphRAG. Para obtener detalles sobre cómo crear un Neptune Notebook, consulte la Guía del usuario de Neptune Analytics. Descargue el cuaderno de muestra y cárguelo en su entorno Jupyter.

Cuaderno GraphRAG de muestra cargado en el entorno SageMaker Jupyter

En este cuaderno, demostramos un enfoque modular para construir un sistema de generación aumentada de recuperación (RAG) sobre un gráfico de conocimiento de atención médica, utilizando el paquete Python Graphrag-Toolkit y el modelo Amazon Bedrock Anthropic Claude 4.5 Sonnet. Esta solución admite consultas en lenguaje natural y vinculación de entidades dentro de un gráfico de conocimiento, combinando la generación avanzada de modelos de lenguaje con la recuperación de datos de gráficos estructurados.

Componentes clave

Inicialización del modelo de lenguaje
Comenzamos inicializando el generador de modelos de lenguaje basado en Amazon Bedrock que impulsa nuestras respuestas de lenguaje natural.

de graphrag_toolkit.byokg_rag.llm import BedrockGenerator def init_llm_generator(model_name="us.anthropic.claude-3-5-sonnet-20240620-v1:0", region_name="us-west-2"): return BedrockGenerator( model_name=model_name, region_name=region_name ) llm_generator = init_llm_generator()

Configuración del vinculador de gráficos de conocimientoEl KGLinker se inicializa pasando el almacén de gráficos y el generador de modelos de lenguaje. Actúa como la interfaz principal para consultar el gráfico y generar respuestas.

desde graphrag_toolkit.byokg_rag.graph_connectors importar KGLinker def init_kg_linker(graph_store, llm_generator): devolver KGLinker(graph_store=graph_store, llm_generator=llm_generator) kg_linker = init_kg_linker(graph_store, llm_generator)

Generar respuestas a partir de consultas.
Con kg_linker, podemos plantear preguntas en lenguaje natural y obtener respuestas generadas aumentadas por el contexto del gráfico de conocimiento.

def generate_kg_response(kg_linker, question, Schema, Graph_context="No proporcionado. Utilice el esquema anterior para comprender el gráfico."): return kg_linker.generate_response( question=question, esquema=schema, graph_context=graph_context ) # Ejemplo de respuesta de uso = generate_kg_response(kg_linker, question, esquema) print(response)

Vinculación de entidades para una recuperación mejorada
Para mejorar la extracción de información y vincular texto en lenguaje natural a entidades gráficas, utilizamos un índice de cadena difusa combinado con EntityLinker.

de graphrag_toolkit.byokg_rag.indexing importar FuzzyStringIndex de graphrag_toolkit.byokg_rag.graph_retrievers importar EntityLinker def init_and_link_entities(graph_store, artefactos): string_index = FuzzyStringIndex() string_index.add(graph_store.nodes()) retriever = string_index.as_entity_matcher() entidad_linker = EntityLinker(retriever=retriever) entidades_vinculadas = entidad_linker.link(artifacts["entity-extraction"], return_dict=False) linked_answers = entidad_linker.link(artifacts["borrador-generación-de-respuesta"], return_dict=False) return entidad_linker, entidades_vinculadas, respuestas_vinculadas entidad_linker, entidades_vinculadas, respuestas_vinculadas = init_and_link_entities(graph_store, artefactos)

Resumen

Esta estructura modular separa limpiamente los siguientes componentes:

Inicialización del modelo de lenguaje grande (LLM) (usando Amazon Bedrock). Interfaz de gráfico de conocimiento (KGLinker). PNL (consulta en lenguaje natural). Vinculación de entidades en nodos de gráficos.

La estructura modular permite una experimentación flexible y una extensión sencilla para diferentes dominios o conjuntos de datos.

La integración de un comparador de cadenas difusas facilita el reconocimiento sólido de entidades, lo cual es importante en contextos de datos de atención médica complejos o ruidosos.

Al combinar los modelos de lenguaje avanzados de Amazon Bedrock con consultas y enlaces de gráficos estructurados, esta solución forma una base sólida para la respuesta a preguntas contextualizadas y la recuperación de información a través de gráficos de conocimiento.

Beneficios de la solución y métricas de rendimiento

Los siguientes indicadores clave de rendimiento de nuestra implementación de la solución demuestran cómo esta solución GraphRAG puede crear valor mensurable y una ventaja competitiva para las organizaciones de investigación farmacéutica:

Aceleración del cronograma de investigación: GraphRAG reduce los ciclos de investigación de seis meses a tres semanas, lo que brinda un aumento de eficiencia del 87 por ciento. Esto respalda la prueba rápida de hipótesis y avances científicos más rápidos. Optimización de la tasa de éxito: GraphRAG redujo los ciclos de investigación en nuestra implementación de seis meses a tres semanas. La solución funciona con algoritmos gráficos avanzados. El análisis entre dominios facilita direcciones de investigación más efectivas y una implementación óptima de recursos. Aumentos en la eficiencia del flujo de trabajo: las métricas clave muestran mejoras mensurables en nuestras pruebas: una reducción del 70 por ciento en el tiempo de revisión, un acceso a los datos un 85 por ciento más rápido y un uso del conocimiento mejorado un 90 por ciento. Los equipos pueden centrarse en prioridades de investigación estratégicas. Validación basada en datos: el seguimiento y la visualización avanzados facilitan la transparencia total de la investigación. Las vías de datos claras fortalecen el cumplimiento normativo y mejoran la comunicación científica. Integración inteligente de conocimientos: el sistema escala e integra de manera eficiente nuevas fuentes de datos con un impacto mínimo en los recursos. Una colaboración mejorada preserva el conocimiento institucional vital. Habilitación del liderazgo de la industria: los ciclos de innovación acelerados mantienen el rigor científico al tiempo que aceleran la entrada a la industria. Esto ayuda a crear ventajas competitivas sostenibles y posiciones de liderazgo en la industria.

Limpiar

Para evitar incurrir en cargos adicionales, limpie los recursos creados en esta publicación.

Elimine el gráfico de Neptune Analytics siguiendo estos pasos o ejecutando el siguiente comando CLI.
Nota: Reemplace g-sample con el gráfico creado.
aws neptune-graph delete-graph –graph-id g-sample Elimine el cuaderno de gráficos creado en la Consola de administración de AWS seleccionando la instancia, eligiendo el menú Acciones y seleccionando la opción Eliminar.

Eliminar el cuaderno gráfico Neptune de la consola SageMaker

Elimine el depósito de S3 creado siguiendo estos pasos o ejecutando el comando CLI.
Nota: Reemplace amzn-s3-bucket-name con el nombre del depósito creado.
aws s3 rb s3://amzn-s3-bucket-name –force

Conclusión

La integración de la tecnología GraphRAG con Amazon Neptune Analytics y Amazon Bedrock representa un avance significativo en la metodología de investigación científica. Los investigadores ahora pueden conectar fuentes de datos previamente aisladas, interactuar con conjuntos de datos complejos mediante consultas en lenguaje natural y visualizar relaciones intrincadas. Esta solución puede generar un impacto inmediato y mensurable para las organizaciones de investigación al reducir los tiempos del ciclo de investigación hasta en un 87 por ciento y aumentar cinco veces las tasas de aciertos de descubrimiento. No sólo acelera el ritmo de los descubrimientos sino que también ayuda a mejorar la calidad y credibilidad de los hallazgos científicos. Esta solución respalda avances científicos rápidos, lo que podría conducir a resultados que eran inalcanzables dentro de los plazos de investigación tradicionales. Las organizaciones que adoptan soluciones de IA generativa no solo están mejorando sus procesos de investigación. Se están posicionando a la vanguardia de la innovación científica, listos para abordar los desafíos más complejos de nuestro tiempo con mayor velocidad y precisión.

Sobre los autores

Jazmín Rasheed Syed

Jazmín Rasheed Syed

Jasmine es gerente sénior de soluciones de clientes en AWS y se centra en acelerar la generación de valor para los clientes en su viaje hacia la nube y la IA mediante la adopción de mejores prácticas, mecanismos y soluciones impulsadas por la IA para transformar su negocio a escala. Se asocia con clientes para identificar casos de uso de IA/ML de alto impacto y les ayuda a pasar más rápido de la experimentación a la producción. Jasmine es una líder experimentada y orientada a resultados con más de 22 años de experiencia en seguros, venta minorista y CPG, y medios y entretenimiento. Aporta una capacidad única para cerrar la brecha entre las capacidades de IA de vanguardia y los resultados comerciales del mundo real, permitiendo a las organizaciones aprovechar todo el potencial de la IA generativa, el aprendizaje automático y la toma de decisiones basada en datos.

Jagadish Maripi

Jagadish Maripi

Jagadish es arquitecto de soluciones en AWS con más de 20 años de experiencia diseñando aplicaciones empresariales e implementando prácticas de DevOps. Le apasiona ayudar a los clientes a crear arquitecturas seguras y escalables y acelerar la entrega a través de la automatización y patrones modernos nativos de la nube. Le gusta compartir conocimientos y explorar tecnologías emergentes con la comunidad en general.

Ramprasath S

Ramprasath S

Ramprasath es arquitecto sénior de IA aplicada en AWS y se especializa en IA generativa a escala empresarial y flujos de trabajo agentes. Convierte desafíos complejos de aprendizaje automático y nube en soluciones listas para producción, con una profunda experiencia en Amazon Bedrock, SageMaker y orquestación de múltiples agentes. Le apasiona la seguridad de la IA, la evaluación de modelos y compartir las mejores prácticas con la comunidad de AWS.

Óscar Hernández

Óscar Hernández

Oscar es ejecutivo de cuentas sénior en AWS y se centra en impulsar la adopción de cargas de trabajo de IA y la estrategia de nube para empresas globales. Trabaja con líderes ejecutivos para identificar oportunidades de IA de alto impacto y crear hojas de ruta tecnológicas a largo plazo que brinden valor comercial sostenido. Con más de 15 años de experiencia en tecnología empresarial y de nube, Oscar se especializa en ayudar a los clientes a navegar por los rápidos cambios tecnológicos y acelerar las implementaciones de producción de IA a escala.