Microsoft AI lanza MAI-Cyber-1-Flash: un modelo cibernético de 5B parámetros activos que lleva MDASH al 95,95% en CyberGym

Microsoft AI ha lanzado MAI-Cyber-1-Flash, su primer modelo creado específicamente para la ciberdefensa. El modelo no se envía como terminal independiente. Se ejecuta dentro de MDASH, el arnés de escaneo agente multimodelo de Microsoft.

MAI-Cyber-1-Flash es un transformador con autoatención y escasas capas de mezcla de expertos. Lleva un total de 137 B de parámetros con 5 B activos y una longitud de contexto de 256 k. Las entradas y salidas son solo texto.

Es un ajuste especializado en ciberseguridad de MAI-Code-1-Flash, el modelo de codificación agente ligero ya integrado en GitHub Copilot y VS Code. El comunicado lo describe como derivado del linaje MAI-Thinking-1.

Puntos de referencia

CyberGym es un conjunto público de 1.507 tareas de reproducción de vulnerabilidades del mundo real extraídas de 188 proyectos OSS-Fuzz. Microsoft evaluó la configuración predeterminada de nivel 1 de CyberGym, que proporciona una fuente vulnerable y una descripción de alto nivel.

MDASH ejecuta MAI-Cyber-1-Flash junto con GPT-5.4 obtiene una puntuación del 95,95%. Microsoft enmarca esto aproximadamente 12 puntos por encima del Mythos de Anthropic, y la tabla de lanzamiento sitúa a los cuatro sistemas competidores entre el 83,2% y el 85,6%.

Cuando Microsoft detalló por primera vez MDASH en mayo de 2026, el arnés obtuvo una puntuación del 88,45% en CyberGym utilizando solo modelos disponibles de forma generalizada. Esta ya era la puntuación más alta en la clasificación pública, unos cinco puntos por delante del siguiente participante con un 83,1%. El equipo de investigación afirma claramente la mejora: al reemplazar el 80% de los modelos existentes en MDASH, el arnés pasó del 88,4% al 95,95%.

Por qué la ruta es el producto real

MDASH gestiona más de 100 agentes especializados a través de cinco etapas: preparar, escanear, validar, deduplicar y probar. Los agentes auditores señalan los hallazgos, los agentes polemistas discuten la explotabilidad (usando el desacuerdo como señal) y la etapa de prueba ejecuta entradas de activación con ASan para objetivos C/C++.

Para controlar los costos del modelo de frontera a escala, MAI-Cyber-1-Flash maneja hasta el 90% de las tareas MDASH, escalando el 10% más difícil a GPT-5.4. Este enrutamiento genera un ahorro de costos del 50 % con respecto a la configuración anterior de GPT-5.4, 5.4 mini y 5.3 codex.

MDASH fue desarrollado por el equipo de Seguridad de Código Autónomo (ACS) de Microsoft, que incluye miembros del equipo Atlanta, ganador del DARPA AI Cyber ​​Challenge. En mayo, el trabajo asistido por MDASH generó 16 CVE (incluidos cuatro fallos críticos de ejecución remota de código) en la pila de autenticación y redes de Windows. Retrospectivamente, recuperó el 96 % de los 28 casos de MSRC en clfs.sys y el 100 % de los 7 casos en tcpip.sys durante un período de cinco años.

Actuación

El equipo de investigación presenta resultados independientes de un arnés terminal liviano:

BenchmarkMAI-Cyber-1-FlashCVEBench0.314CyberSecEval4: amenaza Intel0.553CyberSecEval4: análisis de malware0.33CRSBench0.651 (POV=1200)ExploitGym: kernel/espacio de usuario/navegador0/0/0

Los ceros rectos en ExploitGym son deliberados, no un defecto. El equipo de Microsoft afirma que el modelo fue entrenado para realizar tareas defensivas, como corregir errores, y no tareas ofensivas, como implementar malware. Un modelo 5B activo que no puede generar exploits pero que puede impulsar un proceso de descubrimiento del 95,95 % es exactamente el artefacto que necesita un producto exclusivo para defensores.

como usarlo

Conclusiones clave

MAI-Cyber-1-Flash tiene 137B en total / 5B activos, un escaso ajuste de MoE de MAI-Code-1-Flash con contexto de 256k. El 95,95 % en CyberGym es una puntuación del sistema: MDASH más el nuevo modelo más GPT-5.4, frente al 88,45 % en mayo de 2026. Maneja hasta el 90 % de las tareas MDASH, escalando el 10 % difícil a GPT-5.4 para un supuesto recorte de costos del 50 %. Las puntuaciones de ExploitGym son 0/0/0 por diseño: el modelo corrige errores, no escribe exploits. El acceso está cerrado

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.