Conozca AntAngelMed: un modelo de lenguaje médico de código abierto con parámetros 103B construido sobre una arquitectura MoE con relación de activación de 1/32

Un equipo de investigadores de China ha lanzado AntAngelMed, un gran modelo de lenguaje médico de código abierto que el equipo describe como el más grande y capaz de su tipo disponible actualmente.

¿Qué es AntAngelMed?

AntAngelMed es un modelo de lenguaje de dominio médico con 103 mil millones de parámetros totales, pero no activa todos esos parámetros durante la inferencia. En su lugar, utiliza una arquitectura de mezcla de expertos (MoE) con una proporción de activación de 1/32, lo que significa que solo 6,1 mil millones de parámetros están activos en un momento dado al procesar una consulta.

Es útil saber cómo funcionan las arquitecturas MoE. En un modelo denso estándar, cada parámetro participa en el procesamiento de cada token. En un modelo MoE, la red se divide en muchas subredes “expertas” y un mecanismo de enrutamiento selecciona sólo un pequeño subconjunto de ellas para manejar cada entrada. Esto le permite tener un recuento total de parámetros muy grande, que generalmente se correlaciona con una sólida capacidad de conocimiento, mientras mantiene el costo de cálculo real de la inferencia proporcional al recuento más pequeño de parámetros activos.

AntAngelMed hereda este diseño de Ling-flash-2.0, un modelo base desarrollado por inclusionAI y guiado por lo que el equipo llama Leyes de escalamiento de Ling. Las optimizaciones específicas superpuestas incluyen: granularidad experta refinada, una proporción de expertos compartida ajustada, mecanismos de equilibrio de atención, enrutamiento sigmoideo sin pérdida auxiliar, una capa MTP (Predicción de múltiples tokens), QK-Norm y Partial-RoPE (Incrustación de posición rotativa aplicada a un subconjunto de cabezas de atención en lugar de a todas). Según el equipo de investigación, estas opciones de diseño juntas permiten que los modelos MoE de activación pequeña ofrezcan una eficiencia hasta 7 veces mayor en comparación con arquitecturas densas de tamaño similar, lo que significa que con solo 6,1 mil millones de parámetros activados, AntAngelMed puede igualar el rendimiento de un modelo denso de aproximadamente 40 mil millones. Por otra parte, a medida que la longitud de salida crece durante la inferencia, la ventaja de velocidad relativa también puede alcanzar 7 veces o más sobre modelos densos de tamaño comparable.

https://modelscope.cn/models/MedAIBase/AntAngelMed

Canal de capacitación

AntAngelMed utiliza un proceso de capacitación de tres etapas diseñado para superponer la comprensión del lenguaje general a una profunda adaptación al dominio médico.

La primera etapa es la capacitación previa continua sobre corpus médicos a gran escala, incluidas enciclopedias, textos web y publicaciones académicas. Esta fase se basa en el punto de control Ling-flash-2.0, lo que le da al modelo una sólida base de razonamiento general antes de que comience la especialización médica.

La segunda etapa es el ajuste fino supervisado (SFT), donde el modelo se entrena en un conjunto de datos de instrucciones de múltiples fuentes. Este conjunto de datos combina tareas de razonamiento general (matemáticas, programación, lógica) para preservar las capacidades de cadena de pensamiento, junto con escenarios médicos como preguntas y respuestas entre médico y paciente, razonamiento de diagnóstico y casos de seguridad y ética.

La tercera etapa es el aprendizaje por refuerzo utilizando el algoritmo GRPO (optimización de políticas relativas a grupos), combinado con modelos de recompensa para tareas específicas. GRPO, presentado originalmente en el artículo de DeepSeekMath, es una variante de PPO que estima líneas de base a partir de puntuaciones grupales en lugar de un modelo crítico separado, lo que lo hace computacionalmente más liviano. Aquí, las señales de recompensa están diseñadas para moldear el comportamiento modelo hacia la empatía, respuestas clínicas estructuradas, límites de seguridad y razonamiento basado en evidencia, todo con el objetivo de reducir las alucinaciones en cuestiones médicas.

Rendimiento de inferencia

En el hardware H20, AntAngelMed supera los 200 tokens por segundo, lo que, según informa el equipo de investigación, es aproximadamente 3 veces más rápido que un modelo denso de 36 mil millones de parámetros. Con la extrapolación de YaRN (Yet Another RoPE extensioN), admite una longitud de contexto de 128 KB, lo suficientemente larga como para manejar documentos clínicos completos, historiales de pacientes extendidos o diálogos médicos de varios turnos.

El equipo de investigación también ha publicado una versión cuantificada del modelo para el 8PM. Cuando esta cuantificación se combina con la optimización de decodificación especulativa de EAGLE3, el rendimiento de inferencia en una concurrencia de 32 mejora significativamente con respecto al FP8 solo: 71 % en HumanEval, 45 % en GSM8K y 94 % en Math-500. Estos puntos de referencia miden tareas de codificación y razonamiento matemático, no tareas médicas directamente, pero sirven como indicadores de la estabilidad del rendimiento general del modelo en todos los tipos de resultados.

Resultados de referencia

En HealthBench, el punto de referencia de evaluación médica de código abierto de OpenAI que utiliza diálogos médicos simulados de múltiples turnos para medir el desempeño clínico del mundo real, AntAngelMed ocupa el primer lugar entre todos los modelos de código abierto y también supera una variedad de modelos patentados superiores, con una ventaja particularmente significativa en el subconjunto HealthBench-Hard.

En MedAIBench, un sistema de evaluación mantenido por el Centro Piloto Nacional de la Industria Médica de Inteligencia Artificial de China, AntAngelMed se ubica en el nivel más alto, con puntuaciones particularmente sólidas en preguntas y respuestas sobre conocimientos médicos y en las categorías de ética y seguridad médicas.

En MedBench, un punto de referencia para los LLM de atención médica chinos que cubre 36 conjuntos de datos seleccionados de forma independiente y aproximadamente 700.000 muestras en cinco dimensiones (respuesta a preguntas sobre conocimientos médicos, comprensión del lenguaje médico, generación de lenguaje médico, razonamiento médico complejo y seguridad y ética), AntAngelMed ocupa el primer lugar en general.

Explicador visual de Marktechpost

Guía Técnica
AntAngelMed

1/7

01 — Descripción general
¿Qué es AntAngelMed?
Desarrollado conjuntamente por el Centro de Información de Salud de la provincia de Zhejiang, Ant Healthcare y Zhejiang Anzhen’er Medical AI Technology Co., Ltd.

103BParámetros totales

6.1BActivo en la inferencia

128KLongitud del contexto

AntAngelMed es un LLM de dominio médico construido sobre una arquitectura MoE con una relación de activación de 1/32. Con 103 mil millones de parámetros totales y solo 6,1 mil millones activos en el momento de la inferencia, iguala el rendimiento de aproximadamente 40 mil millones de modelos densos a una fracción del costo de cómputo.

Los pesos de los modelos se publican en Apache 2.0. El repositorio de código tiene licencia del MIT.

02 — Arquitectura
Arquitectura y modelo base del MoE
Construido sobre Ling-flash-2.0 por inclusionAI, guiado por las leyes de escalamiento de Ling.

AntAngelMed utiliza un MoE con una relación de activación de 1/32 con optimizaciones en todos los componentes principales. Estas opciones permiten que los modelos MoE de activación pequeña ofrezcan una eficiencia de hasta 7 veces en comparación con arquitecturas densas de tamaño similar y, a medida que aumenta la longitud de salida, las aceleraciones relativas pueden alcanzar 7 veces o más.

Componentes arquitectónicos clave:

Granularidad experta
Proporción de expertos compartida
Enrutamiento sigmoideo
Sin pérdida auxiliar
Capa MTP
Norma QK
Cuerda parcial
Extrapolación de YaRN
Equilibrio de atención

03 — Entrenamiento
Canal de capacitación de tres etapas
Diseñado para superponer la comprensión del lenguaje general a una profunda adaptación al dominio médico.

Etapa 01
Pre-entrenamiento continuo
Construido sobre Ling-flash-2.0, capacitado en corpus médicos a gran escala (enciclopedias, textos web y publicaciones académicas) para inyectar dominio profundo y conocimiento mundial.

Etapa 02
Ajuste Supervisado (SFT)
Datos de instrucción de múltiples fuentes que combinan tareas generales (matemáticas, programación, lógica) para la cadena de pensamiento, además de escenarios médicos (preguntas y respuestas médico-paciente, razonamiento diagnóstico, seguridad/ética) para la adaptación clínica.

Etapa 03
Aprendizaje por refuerzo a través de GRPO
Optimización de políticas relativas al grupo con modelos de recompensa para tareas específicas. Da forma al comportamiento modelo hacia la empatía, la claridad estructural, los límites de seguridad y el razonamiento basado en evidencia para reducir las alucinaciones.

04 — Inferencia
Rendimiento de inferencia
Comparativas de hardware en H20 y mejoras de rendimiento a partir de la optimización de FP8 + EAGLE3.

>200 toneladas/s
En hardware H20. Aproximadamente 3 veces más rápido que un modelo denso 36B comparable.

7 veces eficiencia
MoE versus denso en tamaño equivalente. La aceleración aumenta aún más a medida que aumenta la longitud de salida.

+71% / +45% / +94%
El rendimiento de FP8 + EAGLE3 aumenta con respecto a FP8 solo en HumanEval / GSM8K / Math-500 con simultaneidad 32.

Contexto de 128K
Compatible mediante extrapolación de YaRN. Maneja documentos clínicos completos y diálogos extendidos de varios turnos.

05 — Puntos de referencia
Resultados de referencia
Evaluado a través de tres puntos de referencia médicos autorizados de LLM.

Resultado del alcance del punto de referencia HealthBenchOpenAI Diálogos médicos simulados de múltiples turnos para un desempeño clínico en el mundo real. #1 de código abierto; supera a varios modelos propietarios. Mayor ventaja en HealthBench-Hard. MedAIBenchNat’l AI Medical Pilot Facility Punto de referencia de la autoridad china que cubre preguntas y respuestas sobre conocimientos y ética y seguridad médicas. Nivel superior. Más sólido en conocimientos, preguntas y respuestas y ética/seguridad médica. MedBenchChinese Healthcare Domain 36 conjuntos de datos, ~700.000 muestras en 5 dimensiones clínicas. #1 en general en las 5 dimensiones.

06 — Inicio rápido
Corre con transformadores de cara abrazada
Requiere trust_remote_code=True para el código de enrutamiento MoE.
desde transformadores importe AutoModelForCausalLM, AutoTokenizer modelo = AutoModelForCausalLM.from_pretrained( “MedAIBase/AntAngelMed”, device_map=”auto”, trust_remote_code=True, ) tokenizer = AutoTokenizer.from_pretrained(“MedAIBase/AntAngelMed”) mensajes = [
{“role”: “system”, “content”: “You are AntAngelMed, a helpful medical assistant.”},
{“role”: “user”, “content”: “What should I do if I have a headache?”}
]
texto = tokenizer.apply_chat_template( mensajes, tokenize=False, add_generación_prompt=True) entradas = tokenizer([text]return_tensors=”pt”, return_token_type_ids=False).to(model.device) salida = model.generate(**inputs, max_new_tokens=16384) salida = [o[len(i):] para i, o en zip(inputs.input_ids, out)]print(tokenizer.batch_decode(out, skip_special_tokens=True)[0])

También es compatible con: vLLM v0.11.0 (tensor paralelo de 4 GPU), SGLang con FlashAttention-3 y vLLM-Ascend para NPU Huawei Ascend 910B.

07 — Acceso
Recursos y enlaces
Pesos del modelo Apache 2.0 – Repositorio de código MIT – Variante cuantificada del FP8 disponible por separado.

Desarrollado por el Centro de información sanitaria de la provincia de Zhejiang, Ant Healthcare y Zhejiang Anzhen’er Medical AI Technology Co., Ltd.
Cobertura de Marktechpost – marktechpost.com

Conclusiones clave

AntAngelMed es un LLM médico de código abierto con 103B de parámetros que activa solo 6,1B de parámetros en el momento de la inferencia utilizando una arquitectura MoE con una relación de activación de 1/32 heredada de Ling-flash-2.0. Utiliza un proceso de capacitación de tres etapas: capacitación previa continua sobre corpus médicos, SFT con datos de instrucción clínica y general combinados, y aprendizaje de refuerzo basado en GRPO para razonamiento de seguridad y diagnóstico. En hardware H20, el modelo supera los 200 tokens/s y admite una longitud de contexto de 128 KB mediante extrapolación de YaRN, aproximadamente 3 veces más rápido que un modelo denso de 36 B comparable. AntAngelMed ocupa el primer lugar entre los modelos de código abierto en HealthBench de OpenAI, supera varios modelos propietarios y encabeza las tablas de clasificación de MedAIBench y MedBench. El modelo está disponible en Hugging Face, ModelScope y GitHub; Los pesos del modelo son Apache 2.0, el código es MIT y también se lanza una versión cuantificada del FP8.

Consulte los pesos de los modelos en HF, GitHub Repo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros