Actualización del marco de seguridad de Frontier

Nuestra próxima versión del FSF establece protocolos de seguridad más sólidos en el camino hacia AGI

La IA es una herramienta poderosa que está ayudando a desbloquear nuevos avances y lograr avances significativos en algunos de los mayores desafíos de nuestro tiempo, desde el cambio climático hasta el descubrimiento de fármacos. Pero a medida que avanza su desarrollo, las capacidades avanzadas pueden presentar nuevos riesgos.

Es por eso que el año pasado presentamos la primera versión de nuestro Marco de seguridad fronterizo: un conjunto de protocolos para ayudarnos a adelantarnos a posibles riesgos graves provenientes de potentes modelos fronterizos de IA. Desde entonces, hemos colaborado con expertos de la industria, el mundo académico y el gobierno para profundizar nuestra comprensión de los riesgos, las evaluaciones empíricas para probarlos y las mitigaciones que podemos aplicar. También hemos implementado el Marco en nuestros procesos de seguridad y gobernanza para evaluar modelos de frontera como Gemini 2.0. Como resultado de este trabajo, hoy publicamos un Marco de seguridad de Frontier actualizado.

Las actualizaciones clave del marco incluyen:

Recomendaciones de nivel de seguridad para nuestros niveles de capacidad crítica (CCL), que ayudan a identificar dónde se necesitan los mayores esfuerzos para frenar el riesgo de exfiltración. Implementar un procedimiento más consistente sobre cómo aplicamos las mitigaciones de implementación. Delinear un enfoque líder en la industria para el riesgo de alineación engañosa.

Recomendaciones para mayor seguridad

Las mitigaciones de seguridad ayudan a evitar que actores no autorizados extraigan pesos de modelos. Esto es especialmente importante porque el acceso a los pesos del modelo permite eliminar la mayoría de las protecciones. Dado lo que está en juego mientras miramos hacia una IA cada vez más poderosa, equivocarse podría tener graves implicaciones para la seguridad y la protección. Nuestro Marco inicial reconoció la necesidad de un enfoque escalonado de la seguridad, que permitiera la implementación de mitigaciones con diferentes fortalezas que se adaptaran al riesgo. Este enfoque proporcionado también garantiza que logremos el equilibrio adecuado entre mitigar los riesgos y fomentar el acceso y la innovación.

Desde entonces, nos hemos basado en una investigación más amplia para desarrollar estos niveles de mitigación de seguridad y recomendar un nivel para cada una de nuestras CCL.* Estas recomendaciones reflejan nuestra evaluación del nivel mínimo apropiado de seguridad que el campo de la IA fronteriza debe aplicar a dichos modelos en una CCL. Este proceso de mapeo nos ayuda a aislar dónde se necesitan las mitigaciones más fuertes para reducir el mayor riesgo. En la práctica, algunos aspectos de nuestras prácticas de seguridad pueden exceder los niveles básicos recomendados aquí debido a nuestra sólida postura de seguridad general.

Esta segunda versión del Marco recomienda niveles de seguridad particularmente altos para las CCL dentro del ámbito de la investigación y el desarrollo (I+D) del aprendizaje automático. Creemos que será importante para los desarrolladores de IA de vanguardia tener una seguridad sólida para escenarios futuros cuando sus modelos puedan acelerar y/o automatizar significativamente el desarrollo de la IA. Esto se debe a que la proliferación incontrolada de tales capacidades podría desafiar significativamente la capacidad de la sociedad para gestionar y adaptarse cuidadosamente al rápido ritmo del desarrollo de la IA.

Garantizar la seguridad continua de los sistemas de IA de vanguardia es un desafío global compartido y una responsabilidad compartida de todos los desarrolladores líderes. Es importante destacar que lograr esto es un problema de acción colectiva: el valor social de las mitigaciones de seguridad de cualquier actor individual se reducirá significativamente si no se aplican ampliamente en todo el campo. Desarrollar el tipo de capacidades de seguridad que creemos que pueden ser necesarias llevará tiempo, por lo que es vital que todos los desarrolladores de IA de vanguardia trabajen colectivamente para lograr mayores medidas de seguridad y acelerar los esfuerzos hacia estándares industriales comunes.

Procedimiento de mitigaciones de implementación

También describimos mitigaciones de implementación en el Marco que se centran en prevenir el uso indebido de capacidades críticas en los sistemas que implementamos. Hemos actualizado nuestro enfoque de mitigación de implementación para aplicar un proceso de mitigación de seguridad más riguroso a los modelos que alcanzan una CCL en un dominio de riesgo de uso indebido.

El enfoque actualizado implica los siguientes pasos: primero, preparamos un conjunto de mitigaciones iterando sobre un conjunto de salvaguardas. Al hacerlo, también desarrollaremos un caso de seguridad, que es un argumento evaluable que muestra cómo los riesgos severos asociados con las CCL de un modelo se han minimizado a un nivel aceptable. Luego, el órgano de gobierno corporativo correspondiente revisa el caso de seguridad y la implementación de disponibilidad general se produce solo si se aprueba. Finalmente, continuamos revisando y actualizando las salvaguardas y el caso de seguridad después de la implementación. Hemos realizado este cambio porque creemos que todas las capacidades críticas justifican este proceso de mitigación exhaustivo.

Enfoque ante el riesgo de alineación engañosa

La primera versión del Marco se centró principalmente en el riesgo de uso indebido (es decir, los riesgos de que los actores de amenazas utilicen capacidades críticas de modelos implementados o exfiltrados para causar daño). Sobre la base de esto, hemos adoptado un enfoque líder en la industria para abordar de manera proactiva los riesgos de una alineación engañosa, es decir, el riesgo de que un sistema autónomo socave deliberadamente el control humano.

Un enfoque inicial a esta pregunta se centra en detectar cuándo los modelos podrían desarrollar una capacidad básica de razonamiento instrumental que les permita socavar el control humano a menos que existan salvaguardas. Para mitigar esto, exploramos el monitoreo automatizado para detectar el uso ilícito de capacidades de razonamiento instrumental.

No esperamos que el monitoreo automatizado siga siendo suficiente en el largo plazo si los modelos alcanzan niveles aún más fuertes de razonamiento instrumental, por lo que estamos emprendiendo activamente (y alentando firmemente) más investigaciones que desarrollen enfoques de mitigación para estos escenarios. Si bien aún no sabemos qué tan probable es que surjan tales capacidades, creemos que es importante que el campo se prepare para esa posibilidad.

Conclusión

Continuaremos revisando y desarrollando el Marco a lo largo del tiempo, guiados por nuestros Principios de IA, que describen aún más nuestro compromiso con el desarrollo responsable.

Como parte de nuestros esfuerzos, continuaremos trabajando en colaboración con socios de toda la sociedad. Por ejemplo, si evaluamos que un modelo ha alcanzado un CCL que representa un riesgo material y absoluto para la seguridad pública en general, nuestro objetivo es compartir información con las autoridades gubernamentales correspondientes, lo que facilitará el desarrollo de una IA segura. Además, el último Marco describe una serie de áreas potenciales para futuras investigaciones, áreas en las que esperamos colaborar con la comunidad de investigación, otras empresas y el gobierno.

Creemos que un enfoque abierto, iterativo y colaborativo ayudará a establecer estándares comunes y mejores prácticas para evaluar la seguridad de futuros modelos de IA y al mismo tiempo garantizar sus beneficios para la humanidad. Los Compromisos de Seguridad de la IA de la Frontera de Seúl marcaron un paso importante hacia este esfuerzo colectivo, y esperamos que nuestro Marco de Seguridad de la Frontera de Seúl actualizado contribuya aún más a ese progreso. De cara al AGI, lograr esto correctamente significará abordar cuestiones de gran trascendencia, como los umbrales de capacidad y las mitigaciones correctos, que requerirán la participación de la sociedad en general, incluidos los gobiernos.