SecCodePLT: una plataforma unificada para evaluar riesgos de seguridad en Code GenAI

Los modelos de IA de generación de código (Code GenAI) se están volviendo fundamentales en el desarrollo de software automatizado que demuestra capacidades de escritura, depuración y razonamiento sobre código. Sin embargo, su capacidad para generar código de forma autónoma genera preocupaciones sobre las vulnerabilidades de seguridad. Estos modelos pueden introducir sin darse cuenta código inseguro, que podría explotarse en ataques cibernéticos. Además, su uso potencial para ayudar a actores malintencionados a generar scripts de ataque añade otra capa de riesgo. El campo de investigación ahora se centra en evaluar estos riesgos para garantizar la implementación segura del código generado por IA.

Un problema clave con Code GenAI radica en la generación de código inseguro que puede introducir vulnerabilidades en el software. Esto es problemático porque los desarrolladores pueden, sin saberlo, utilizar código generado por IA en aplicaciones que los atacantes pueden explotar. Además, los modelos corren el riesgo de ser utilizados como armas con fines maliciosos, como facilitar ataques cibernéticos. Los puntos de referencia de evaluación existentes deben evaluar de manera integral los riesgos duales de la generación de código inseguro y la facilitación de ataques cibernéticos. En cambio, a menudo enfatizan la evaluación de los resultados del modelo a través de medidas estáticas, que no llegan a probar las amenazas de seguridad del mundo real que plantea el código impulsado por IA.

Los métodos disponibles para evaluar los riesgos de seguridad de Code GenAI, como CYBERSECEVAL, se centran principalmente en el análisis estático. Estos métodos se basan en reglas predefinidas o juicios LLM (Large Language Model) para identificar posibles vulnerabilidades en el código. Sin embargo, las pruebas estáticas pueden generar imprecisiones en la evaluación de los riesgos de seguridad, produciendo falsos positivos o negativos. Además, muchos puntos de referencia prueban modelos solicitando sugerencias sobre ciberataques sin requerir que el modelo ejecute ataques reales, lo que limita la profundidad de la evaluación de riesgos. Como resultado, estas herramientas no abordan la necesidad de realizar pruebas dinámicas en el mundo real.

El equipo de investigación de Virtue AI, la Universidad de California (Los Ángeles, Santa Bárbara y Berkeley) y la Universidad de Illinois presentaron SCEdoODAPLTuna plataforma integral diseñada para llenar los vacíos en los métodos actuales de evaluación de seguridad para Code GenAI. SCEdoODAPLT evalúa los riesgos de la codificación insegura y la asistencia en ataques cibernéticos mediante el uso de una combinación de datos verificados por expertos y métricas de evaluación dinámicas. A diferencia de los puntos de referencia existentes, SCEdoODAPLT evalúa el código generado por IA en escenarios del mundo real, lo que permite una detección más precisa de amenazas a la seguridad. Esta plataforma está preparada para mejorar los métodos estáticos mediante la integración de entornos de prueba dinámicos, donde se solicita a los modelos de IA que generen ataques ejecutables y completen tareas relacionadas con el código en condiciones de prueba.

El SCEdoODAPLT La metodología de la plataforma se basa en un proceso de creación de datos de dos etapas. En la primera etapa, los expertos en seguridad crean manualmente muestras iniciales basadas en las vulnerabilidades enumeradas en la Enumeración de debilidades comunes (CWE) de MITRE. Estos ejemplos contienen código inseguro y parcheado y casos de prueba asociados. La segunda etapa utiliza mutadores basados ​​en LLM para generar datos a gran escala a partir de estas muestras de semillas, preservando el contexto de seguridad original. La plataforma emplea casos de prueba dinámicos para evaluar la calidad y seguridad del código generado, garantizando la escalabilidad sin comprometer la precisión. Para la evaluación de ciberataques, SCEdoODAPLT configura un entorno que simula escenarios del mundo real donde se solicita a los modelos que generen y ejecuten scripts de ataque. Este método supera los enfoques estáticos al requerir que los modelos de IA produzcan ataques ejecutables, lo que revela más sobre sus riesgos potenciales en escenarios reales de ciberataques.

El desempeño de SCEdoODAPLT ha sido evaluado extensamente. En comparación con CYBERSECEVAL, SCEdoODAPLT ha demostrado un rendimiento superior en la detección de vulnerabilidades de seguridad. Notablemente, SCEdoODAPLT logró casi el 100% de precisión en relevancia de seguridad y fidelidad de instrucciones, mientras que CYBERSECEVAL registró solo 68% en relevancia de seguridad y 42% en fidelidad de instrucciones. Los resultados resaltaron que SCEdoODAPLTEl proceso de prueba dinámico proporcionó información más confiable sobre los riesgos que plantean los modelos de generación de código. Por ejemplo, SCEdoODAPLT pudo identificar fallas de seguridad no triviales en Cursor, un agente de codificación de última generación, que falló en áreas críticas como la inyección de código, el control de acceso y la prevención de fuga de datos. El estudio reveló que Cursor falló completamente en algunas CWE (enumeraciones de debilidades comunes) críticas, lo que subraya la eficacia de SCEdoODAPLT en la evaluación de la seguridad del modelo.

Un aspecto clave del éxito de la plataforma es su capacidad para evaluar modelos de IA más allá de simples sugerencias de código. Por ejemplo, cuando SCEdoODAPLT se aplicó a varios modelos de última generación, incluido GPT-4o, reveló que los modelos más grandes como GPT-4o tendían a ser más seguros, logrando una tasa de codificación segura del 55%. Por el contrario, los modelos más pequeños mostraron una mayor tendencia a producir código inseguro. Además, SCEdoODAPLTEl entorno del mundo real para la utilidad en ataques cibernéticos permitió a los investigadores probar la capacidad de los modelos para ejecutar ataques completos. La plataforma demostró que, si bien algunos modelos, como Claude-3.5 Sonnet, tenían una fuerte alineación de seguridad con tasas de rechazo de más del 90% para generar scripts maliciosos, otros, como GPT-4o, presentaban mayores riesgos con tasas de rechazo más bajas, lo que indica su capacidad para ayudar. en el lanzamiento de ciberataques.

En conclusión, SCEdoODAPLT mejora sustancialmente los métodos existentes para evaluar los riesgos de seguridad de los modelos de IA de generación de código. Al incorporar evaluaciones dinámicas y pruebas en escenarios del mundo real, la plataforma ofrece una visión más precisa y completa de los riesgos asociados con el código generado por IA. A través de pruebas exhaustivas, la plataforma ha demostrado su capacidad para detectar y resaltar vulnerabilidades de seguridad críticas que los puntos de referencia estáticos existentes no logran identificar. Este avance señala un paso crucial para garantizar el uso seguro de Code GenAI en aplicaciones del mundo real.


Mira el Papel, Conjunto de datos HFy Página del proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de telegramas y LinkedIn Grarriba. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa.. No olvides unirte a nuestro SubReddit de más de 50.000 ml.

[Upcoming Live Webinar- Oct 29, 2024] La mejor plataforma para ofrecer modelos optimizados: motor de inferencia Predibase (promocionado)


Nikhil es consultor interno en Marktechpost. Está cursando una doble titulación integrada en Materiales en el Instituto Indio de Tecnología de Kharagpur. Nikhil es un entusiasta de la IA/ML que siempre está investigando aplicaciones en campos como los biomateriales y la ciencia biomédica. Con una sólida experiencia en ciencia de materiales, está explorando nuevos avances y creando oportunidades para contribuir.