Un equipo de investigadores de China ha lanzado AntAngelMed, un gran modelo de lenguaje médico de código abierto que el equipo describe como el más grande y capaz de su tipo disponible actualmente.
¿Qué es AntAngelMed?
AntAngelMed es un modelo de lenguaje de dominio médico con 103 mil millones de parámetros totales, pero no activa todos esos parámetros durante la inferencia. En su lugar, utiliza una arquitectura de mezcla de expertos (MoE) con una proporción de activación de 1/32, lo que significa que solo 6,1 mil millones de parámetros están activos en un momento dado al procesar una consulta.
Es útil saber cómo funcionan las arquitecturas MoE. En un modelo denso estándar, cada parámetro participa en el procesamiento de cada token. En un modelo MoE, la red se divide en muchas subredes “expertas” y un mecanismo de enrutamiento selecciona sólo un pequeño subconjunto de ellas para manejar cada entrada. Esto le permite tener un recuento total de parámetros muy grande, que generalmente se correlaciona con una sólida capacidad de conocimiento, mientras mantiene el costo de cálculo real de la inferencia proporcional al recuento más pequeño de parámetros activos.
AntAngelMed hereda este diseño de Ling-flash-2.0, un modelo base desarrollado por inclusionAI y guiado por lo que el equipo llama Leyes de escalamiento de Ling. Las optimizaciones específicas superpuestas incluyen: granularidad experta refinada, una proporción de expertos compartida ajustada, mecanismos de equilibrio de atención, enrutamiento sigmoideo sin pérdida auxiliar, una capa MTP (Predicción de múltiples tokens), QK-Norm y Partial-RoPE (Incrustación de posición rotativa aplicada a un subconjunto de cabezas de atención en lugar de a todas). Según el equipo de investigación, estas opciones de diseño juntas permiten que los modelos MoE de activación pequeña ofrezcan una eficiencia hasta 7 veces mayor en comparación con arquitecturas densas de tamaño similar, lo que significa que con solo 6,1 mil millones de parámetros activados, AntAngelMed puede igualar el rendimiento de un modelo denso de aproximadamente 40 mil millones. Por otra parte, a medida que la longitud de salida crece durante la inferencia, la ventaja de velocidad relativa también puede alcanzar 7 veces o más sobre modelos densos de tamaño comparable.
Canal de capacitación
AntAngelMed utiliza un proceso de capacitación de tres etapas diseñado para superponer la comprensión del lenguaje general a una profunda adaptación al dominio médico.
La primera etapa es la capacitación previa continua sobre corpus médicos a gran escala, incluidas enciclopedias, textos web y publicaciones académicas. Esta fase se basa en el punto de control Ling-flash-2.0, lo que le da al modelo una sólida base de razonamiento general antes de que comience la especialización médica.
La segunda etapa es el ajuste fino supervisado (SFT), donde el modelo se entrena en un conjunto de datos de instrucciones de múltiples fuentes. Este conjunto de datos combina tareas de razonamiento general (matemáticas, programación, lógica) para preservar las capacidades de cadena de pensamiento, junto con escenarios médicos como preguntas y respuestas entre médico y paciente, razonamiento de diagnóstico y casos de seguridad y ética.
La tercera etapa es el aprendizaje por refuerzo utilizando el algoritmo GRPO (optimización de políticas relativas a grupos), combinado con modelos de recompensa para tareas específicas. GRPO, presentado originalmente en el artículo de DeepSeekMath, es una variante de PPO que estima líneas de base a partir de puntuaciones grupales en lugar de un modelo crítico separado, lo que lo hace computacionalmente más liviano. Aquí, las señales de recompensa están diseñadas para moldear el comportamiento modelo hacia la empatía, respuestas clínicas estructuradas, límites de seguridad y razonamiento basado en evidencia, todo con el objetivo de reducir las alucinaciones en cuestiones médicas.
Rendimiento de inferencia
En el hardware H20, AntAngelMed supera los 200 tokens por segundo, lo que, según informa el equipo de investigación, es aproximadamente 3 veces más rápido que un modelo denso de 36 mil millones de parámetros. Con la extrapolación de YaRN (Yet Another RoPE extensioN), admite una longitud de contexto de 128 KB, lo suficientemente larga como para manejar documentos clínicos completos, historiales de pacientes extendidos o diálogos médicos de varios turnos.
El equipo de investigación también ha publicado una versión cuantificada del modelo para el 8PM. Cuando esta cuantificación se combina con la optimización de decodificación especulativa de EAGLE3, el rendimiento de inferencia en una concurrencia de 32 mejora significativamente con respecto al FP8 solo: 71 % en HumanEval, 45 % en GSM8K y 94 % en Math-500. Estos puntos de referencia miden tareas de codificación y razonamiento matemático, no tareas médicas directamente, pero sirven como indicadores de la estabilidad del rendimiento general del modelo en todos los tipos de resultados.
Resultados de referencia
En HealthBench, el punto de referencia de evaluación médica de código abierto de OpenAI que utiliza diálogos médicos simulados de múltiples turnos para medir el desempeño clínico del mundo real, AntAngelMed ocupa el primer lugar entre todos los modelos de código abierto y también supera una variedad de modelos patentados superiores, con una ventaja particularmente significativa en el subconjunto HealthBench-Hard.
En MedAIBench, un sistema de evaluación mantenido por el Centro Piloto Nacional de la Industria Médica de Inteligencia Artificial de China, AntAngelMed se ubica en el nivel más alto, con puntuaciones particularmente sólidas en preguntas y respuestas sobre conocimientos médicos y en las categorías de ética y seguridad médicas.
En MedBench, un punto de referencia para los LLM de atención médica chinos que cubre 36 conjuntos de datos seleccionados de forma independiente y aproximadamente 700.000 muestras en cinco dimensiones (respuesta a preguntas sobre conocimientos médicos, comprensión del lenguaje médico, generación de lenguaje médico, razonamiento médico complejo y seguridad y ética), AntAngelMed ocupa el primer lugar en general.
Explicador visual de Marktechpost
Conclusiones clave
AntAngelMed es un LLM médico de código abierto con 103B de parámetros que activa solo 6,1B de parámetros en el momento de la inferencia utilizando una arquitectura MoE con una relación de activación de 1/32 heredada de Ling-flash-2.0. Utiliza un proceso de capacitación de tres etapas: capacitación previa continua sobre corpus médicos, SFT con datos de instrucción clínica y general combinados, y aprendizaje de refuerzo basado en GRPO para razonamiento de seguridad y diagnóstico. En hardware H20, el modelo supera los 200 tokens/s y admite una longitud de contexto de 128 KB mediante extrapolación de YaRN, aproximadamente 3 veces más rápido que un modelo denso de 36 B comparable. AntAngelMed ocupa el primer lugar entre los modelos de código abierto en HealthBench de OpenAI, supera varios modelos propietarios y encabeza las tablas de clasificación de MedAIBench y MedBench. El modelo está disponible en Hugging Face, ModelScope y GitHub; Los pesos del modelo son Apache 2.0, el código es MIT y también se lanza una versión cuantificada del FP8.
Consulte los pesos de los modelos en HF, GitHub Repo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros