Cisco Foundation AI lanza Antares: modelos abiertos 350M y 1B que localizan vulnerabilidades conocidas dentro de bases de código reales

Cisco Foundation AI ha lanzado Antares, una familia de modelos de lenguaje pequeño (SLM) de seguridad creados para una tarea de seguridad limitada. La tarea es la localización de vulnerabilidades. Dada una descripción de la vulnerabilidad y un repositorio, busque los archivos que contienen la falla.

Dos modelos son de peso abierto y están disponibles ahora en Hugging Face, Antares-350M y Antares-1B. Ambos son Apache 2.0. El equipo de Cisco también envió Vulnerability Localization Benchmark (VLoc Bench), una evaluación agente de 500 tareas, bajo la misma licencia.

El resultado principal no es un nuevo estado de la técnica. Es que un modelo 1B llega a 0.209 Archivo F1. GPT-5.5 alcanza 0,229 y un modelo de peso abierto 753B alcanza 0,186.

El problema que Antares pretende abordar

La seguridad del software depende de conectar el conocimiento externo de la vulnerabilidad al código fuente interno. Ese conocimiento reside en bases de datos públicas, avisos y enumeraciones de debilidades comunes. El código reside en repositorios grandes, modulares y ricos en dependencias.

Conectar los dos es caro. Los desarrolladores buscan código desconocido, siguen convenciones de nomenclatura, inspeccionan rutas de llamadas y comparan archivos candidatos. El planteamiento de Cisco es que este primer paso de clasificación es donde se concentra el costo.

Antares no reemplaza la cadena de herramientas de seguridad de las aplicaciones. Cisco es explícito al respecto. Los equipos de desarrollo aún necesitan escaneo de dependencias, escaneo de secretos, pruebas dinámicas, comprobaciones de contenedores, modelado de amenazas y revisión de expertos.

Comprender los modelos

Antares consta de tres transformadores solo decodificadores en los parámetros 350M, 1B y 3B. Los tres se inicializan desde los puntos de control de IBM Granite 4.0. Comparten un tokenizador y una arquitectura: atención de consultas agrupadas, SwiGLU MLP, RMSNorm, RoPE e incrustaciones de entrada/salida compartidas.

ModeloParamsBase checkpointContextLayers / ocultas / cabezas KVStatusAntares-350M350MGranite 4.0 350M32K28 / 1024 / 4Pesas abiertasAntares-1B1.6BGranite 4.0 1B128K40 / 2048 / 4Pesas abiertasAntares-3B3BGranite 4.0 Micro128KNo publicadoNo publicado

Cómo funciona el bucle del agente

Antares no se evalúa como un modelo de secuencia independiente. Se ejecuta dentro de un bucle restringido con tres herramientas.

El modelo recibe una descripción de categoría CWE y nada más. Sin texto de aviso, sin sugerencias de archivos, sin detalles de gravedad. Luego emite comandos de terminal de solo lectura contra un entorno limitado de Docker con la red deshabilitada. La salida del comando se trunca a 2000 caracteres antes de ingresar la transcripción.

El presupuesto es de 15 llamadas a terminales por tarea. El modelo termina llamando a submit_vulnerable_files con una lista clasificada, o submit_no_vulnerability_found. La presentación en sí no cuenta contra el presupuesto.

El resultado es una lista clasificada de rutas de archivos más el seguimiento de exploración que lo produjo.

Qué mide VLoc Bench

VLoc Bench extrae 500 tareas de 290 repositorios únicos del mundo real. Las fuentes son avisos de seguridad públicos de GitHub en seis ecosistemas: npm, pip, Maven, Go, Rust y Composer. Cubre 147 categorías CWE únicas y el 78% de las entradas llevan identificadores CVE asignados.

La verdad fundamental se deriva del parche de seguridad. Los archivos modificados en la solución son etiquetas, con pruebas, documentos y configuración excluidos.

El benchmark tiene dos fases:

La fase A le da al modelo la instantánea vulnerable y califica el Archivo F1. La fase B proporciona la instantánea parcheada y obtiene una tasa de verdadero negativo, probando si el modelo genera una falsa alarma en el código fijo.

Resultados: el entrenamiento para tareas específicas supera la escala de parámetros

El patrón en los datos es un precipicio de capacidad, no una curva de escala.

Antares-3B alcanza 0,223 Archivo F1, justo por debajo de GPT-5.5 (xhigh) en 0,229. Antares-1B alcanza 0,209, por encima de GLM-5.2 en los parámetros 753B, que obtiene una puntuación de 0,186. Antares-350M alcanza 0,135, por encima de Gemma-4-31B en 0,101 y Gemini 2.5 Flash en 0,102.

Antares-1B también registra la recuperación más alta de todos los sistemas evaluados con 0,224.

Las herramientas de análisis estático se ejecutaron bajo la misma evaluación. Semgrep obtiene una puntuación de 0,086 en el archivo F1, CodeQL obtiene una puntuación de 0,023 y Horusec obtiene una puntuación de 0,020. La lectura de Cisco es que los escáneres basados ​​en reglas recuperan algunos archivos vulnerables pero no pueden inspeccionar de forma adaptativa el contexto del repositorio.

De dónde viene la capacidad

Los puntos de control básicos de Granite 4.0 no entrenados obtienen una puntuación de 0,001, 0,000 y 0,000 Archivo F1 bajo el mismo protocolo. Tienen capacidad de invocación de herramientas y aún producen resultados degenerados dentro de un bucle agente.

El ajuste fino supervisado hace el trabajo pesado. Eleva las tres escalas a 0,108, 0,188 y 0,198. El corpus SFT consta de un 71,5 % de razonamiento sobre ciberseguridad, un 15,4 % de trayectorias de búsqueda de código y un 13,1 % de investigación profunda y razonamiento general. Todos los rastros de razonamiento provienen de un solo maestro, GPT-OSS-120B, para evitar cambios en la distribución entre maestros.

Luego, GRPO añade entre un 11% y un 25%, con la mayor ganancia relativa de 350 millones. Las recompensas son verificables y se calculan mediante programación a partir del texto de la trayectoria, sin ningún modelo de recompensa aprendido. Los componentes cubren la calidad de la localización, el comportamiento de envío, el cumplimiento del uso de herramientas, la exploración y las sanciones por resultados malformados.

El efecto de la varianza puede importar más que la media. GRPO reduce la desviación estándar entre ejecuciones entre un 42% y un 65%. Una ejecución de evaluación de GRPO es una estimación más confiable que una ejecución de SFT.

También existe una división dependiente de la escala en la estrategia aprendida. Después de GRPO, los modelos 350M y 1B utilizan entre un 87% y un 89% de comandos de búsqueda y envían más archivos. El modelo 3B se establece en un 52 % de búsqueda y un 37 % de lectura, y envía menos archivos con mayor precisión. La recompensa nunca prescribió ninguna de las dos políticas.

Despliegue

Conclusiones clave

Antares-1B alcanza 0.209 File F1 en VLoc Bench, por encima de GLM-5.2 en parámetros 753B y Gemini 3 Pro. Los puntos de control básicos de Granite 4.0 obtienen una puntuación de ~0,000 según el mismo protocolo, por lo que el entrenamiento posterior proporciona esencialmente toda la capacidad. GRPO agrega entre un 11% y un 25% al ​​archivo F1 y reduce la variación entre ejecuciones entre un 42% y un 65%, lo que es más importante para los análisis de CI repetibles. Un barrido completo de 500 tareas cuesta menos de 1 dólar en un H100, frente a 12,50 dólares para el GLM-5.2 y 141 dólares para el GPT-5.5. La variante más potente, Antares-3B, no se ha publicado y Antares no ha publicado cifras de falsas alarmas de la Fase B.

Consulte los modelos en Hugging Face, Benchmark, GitHub Repo y el informe técnico mencionado.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.