¿Qué hace que una prueba de seguridad de IA sea buena? Los expertos explican por qué incluso las mejores técnicas pueden no ser lo suficientemente potentes

Los agentes de inteligencia artificial siguen apareciendo en lugares donde no deberían estar. En junio, un modelo experimental de OpenAI obtuvo acceso no autorizado a archivos no públicos en un sitio web del gobierno australiano para el programa Medicare de la nación. Desde entonces, los investigadores han encontrado señales de agentes sospechosos de IA investigando la Biblioteca y Archivos de Canadá, mientras que otra investigación vinculó a los agentes de OpenAI con más de 16.000 escaneos de un servicio de estadísticas de las Naciones Unidas.

Aún hay más ejemplos que provienen del interior de las empresas de IA. OpenAI reveló recientemente seis casos de comportamiento preocupante del modelo, y Anthropic también admitió que sus modelos obtuvieron acceso no autorizado a los sistemas de tres organizaciones durante las pruebas.

De hecho, todos estos incidentes ocurrieron durante las pruebas. Al mismo tiempo, los agentes de IA parecen saber que están siendo observados durante estas pruebas y pueden cubrir sus huellas. Es por eso que algunos expertos, incluido Dario Amodei, director ejecutivo de Anthropic, dicen que necesitamos mejores pruebas para garantizar que la IA funcione de una manera con la que nos sintamos cómodos.

Sobre el apoyo al periodismo científico

Si está disfrutando de este artículo, considere apoyar nuestro periodismo galardonado suscribiéndose. Al comprar una suscripción, ayudas a garantizar el futuro de historias impactantes sobre los descubrimientos y las ideas que dan forma a nuestro mundo actual.

Las empresas de IA y los investigadores en el campo suelen referirse a este problema como de “alineación”. Un modelo “desalineado” es un modelo inseguro o deshonesto.

“Ahora mismo, antes de su lanzamiento, probamos el modelo terminado desde el exterior”, afirma Marius Hobbhahn. “Eso no funciona en el estudio de la alineación, especialmente como desalineación, [evaluation] La conciencia y otras enfermedades relacionadas persisten”. Hobbhahn es director ejecutivo y fundador de Apollo Research, una organización de seguridad de inteligencia artificial que trabaja con OpenAI, Anthropic y Google DeepMind para probar sus modelos en busca de riesgos.

Hobbhahn añade que las normas actuales para las pruebas de seguridad son insuficientes. “Creo que sin evaluaciones integradas, deberíamos depositar muy poca confianza en los resultados de seguridad actuales”, afirma.

Pero cambiar cuándo y dónde se prueban los modelos no es sencillo. Antes de poder diseñar una prueba, debe decidir qué se considera una calificación aprobatoria, y eso no es obvio.

“El problema que tenemos para encontrar la prueba ideal es: necesitamos saber cómo es la alineación perfecta (y cómo es lo bueno) y desafortunadamente aún no tenemos una buena teoría para eso”, dice Jack Hopkins, un investigador independiente de seguridad de IA en Londres, que anteriormente trabajó en Anthropic.

Diferentes personas tienen diferentes opiniones sobre lo que es y lo que no es un comportamiento seguro y aceptable para un modelo de IA. E incluso cuando existe consenso (la idea de que los modelos no deberían engañar a los usuarios ni tergiversar lo que están haciendo, por ejemplo), puede resultar difícil precisar lo que eso significa en la práctica.

“Es muy difícil captar todo [the] formas en las que un modelo podría engañarte porque él mismo no necesariamente sabe que te está engañando”, dice Hopkins.

Hobbhahn está de acuerdo. “Con la ciencia actual, normalmente no podemos demostrar con gran seguridad que no existe un comportamiento peligroso”, afirma. “Lo que podemos decir es: ‘Nos esforzamos por encontrarlo y fracasamos’. Esto es un problema”.

Aún así, para poder identificar problemas de seguridad y evitarlos antes de que aparezcan, el campo necesita desesperadamente mejores pruebas. Hobbhahn sugiere que las evaluaciones deberían realizarse junto con el desarrollo de un modelo, examinando el proceso de capacitación en sí, incluido cómo se recompensan los modelos y qué comportamiento producen a lo largo del camino.

Eso significaría probar modelos en diferentes puntos de control durante el entrenamiento en lugar de probar una versión casi final. Los investigadores también tendrían que asegurarse de que las pruebas realmente funcionen. Una forma de hacerlo es compararlos con modelos que los investigadores ya saben que están desalineados: si la prueba no puede detectar los problemas en un modelo conocido, sostiene Hobbhahn, hay pocas razones para creer que podría funcionar mejor en uno nuevo.

Las pruebas también deben continuar una vez que los modelos se estén utilizando internamente, e incluir cualquier intento de encontrar formas de evitar cualquier sistema de monitoreo que se supone que debe detectar a los malos actores. Hobbhahn dice que a los evaluadores independientes se les debería dar acceso a nivel de empleado para realizar ese trabajo en lugar de probar un sistema en gran parte terminado desde afuera. Los resultados de estas pruebas, afirma, deberían publicarse posteriormente.

Pero incluso las mejores pruebas podrían no ser lo suficientemente buenas, considera Hopkins, porque los modelos siempre están cambiando de capacidades.

“Creo que lo que podemos hacer es acercarnos arbitrariamente a la perfección en lo que respecta a las pruebas”, afirma. “Pero el problema de acercarse sólo arbitrariamente y dejar este pequeño espacio donde el modelo puede actuar de acuerdo con la letra de la ley pero no con el espíritu [of it] es que si el modelo se vuelve realmente inteligente y poderoso, el impacto efectivo de esa pequeña brecha se amplifica”.