Sakana AI ha lanzado Fugu-Cyber (el ID del modelo es fugu-cyber-v1.0), una incorporación especializada en ciberseguridad a su familia de orquestación Fugu. No se trata simplemente de un nuevo modelo de frontera. Es un tercer punto final en el orquestador Fugu, ajustado por razones de seguridad. Sakana lanzó ese orquestador un mes antes.
Sakana informa una tasa de éxito del 86,9 % en CyberGym y del 72,1 % en CTI-REALM. Describe esos resultados como comparables a modelos de frontera centrados en lo cibernético como GPT-5.5-Cyber y Claude Mythos Preview.
Lo que realmente miden los dos puntos de referencia
Las dos evaluaciones se ubican en extremos opuestos de un flujo de trabajo de seguridad:
CyberGym es un punto de referencia de UC Berkeley de 1507 vulnerabilidades del mundo real en 188 proyectos OSS-Fuzz. En su tarea principal, un agente recibe una descripción de la vulnerabilidad y un código base sin parches. Debe escribir una prueba de concepto que bloquee la compilación previa al parche, pero no la posterior al parche. Ese paso de verificación es lo que hace que el punto de referencia sea difícil de superar. CTI-REALM es el punto de referencia de ingeniería de detección de código abierto de Microsoft. Microsoft seleccionó 37 informes públicos de amenazas de fuentes que incluyen Datadog Security Labs, Palo Alto Networks y Splunk. Un agente debe mapear técnicas MITRE ATT&CK, explorar telemetría, iterar consultas KQL y emitir reglas Sigma validadas. La puntuación cubre los puntos finales de Linux, el servicio Azure Kubernetes y la nube de Azure.
Juntos, el par abarca “encontrar y probar el error” y “convertir información en una detección”. Ese encuadre es la parte más defendible del anuncio de Sakana.
Donde el 86,9% se sienta contra el campo
El contexto importa más que el número.
Cuando los investigadores de CyberGym publicaron sus primeros resultados, la mejor combinación agente-modelo alcanzó aproximadamente el 20%. Anthropic informó un 83,1 % para Claude Mythos Preview en el marco del Proyecto Glasswing en abril de 2026. OpenAI informó un 85,6 % para su GPT-5.5-Cyber actualizado, frente al 81,8 % para GPT-5.5. El 86,9% de Sakana es, por lo tanto, un pequeño paso más allá de la frontera reportada, no un salto.
CTI-REALM es una historia diferente. La propia evaluación de Microsoft colocó las tres configuraciones principales, todas Claude, en una banda de 0,624 a 0,685. El 72,1% de Fugu-Cyber se situaría por encima de esa banda. Una advertencia es importante. CTI-REALM se califica como una recompensa de trayectoria entre 0 y 1. No es una tasa de aprobación/rechazo. De todos modos, Sakana lo llama tasa de éxito.
‘ + d.sub + ‘
‘; si(d.barras){ d.barras.forEach(función(b){ h += ‘
‘+b[0] + ‘ ‘+b[3] + ‘‘ + ‘‘+b[1].toFixed(1) + ‘%
‘ + ‘
‘; }); } si(d.barras2){ h += ‘
‘ + d.bars2title + ‘
‘; d.bars2.forEach(función(b){ h += ‘
‘+b[0] + ‘‘+b[1].toFixed(1) + ‘%
‘ + ‘
‘; }); } if(d.rows){ h += ‘FIELDVALUE’; d.rows.forEach(función(r){ h += ” + r[0] + ” +r[1] + ”; }); h += ”; } if(d.lista){ h += ”; d.list.forEach(function(x){ h += ” + x + ”; }); h += ”; } if(d.nota){ h += ‘
‘ + d.nota + ‘
‘; } salida.innerHTML = h; setTimeout(function(){ var f = out.querySelectorAll(‘.fill’); for(var i=0;i= txt.length){ clearInterval(timer); render(k); } }, 22); } var btns = document.querySelectorAll(‘.cmd’); para(var i=0;i