Las preocupaciones sobre la seguridad de la IA volvieron a surgir esta semana cuando una nueva investigación encontró que los chatbots más populares de gigantes tecnológicos, incluidos ChatGPT de OpenAI y Gemini de Google, aún pueden dar respuestas restringidas o dañinas con mucha más frecuencia de lo que sus desarrolladores quisieran.
Según un estudio publicado en International Business Times, se podría incitar a los modelos a producir resultados prohibidos el 62% de las veces con algún verso ingeniosamente escrito.
Es curioso que algo tan inofensivo como el verso (una forma de autoexpresión que podríamos asociar con cartas de amor, Shakespeare o tal vez la vergüenza de la escuela secundaria) termine cumpliendo una doble función para las hazañas de seguridad.
Sin embargo, los investigadores responsables del experimento dijeron que el encuadre estilístico es un mecanismo que les permite eludir protecciones predecibles.
Su resultado refleja advertencias anteriores de personas como los miembros del Centro para la Seguridad de la IA, que han estado hablando sobre el comportamiento impredecible del modelo de manera de alto riesgo.
Un problema similar surgió a finales del año pasado cuando el modelo Claude de Anthropic demostró ser capaz de responder a indicaciones camufladas de amenazas biológicas incrustadas en historias de ficción.
En ese momento, MIT Technology Review describió la preocupación de los investigadores por las “indicaciones del durmiente”, instrucciones enterradas dentro de un texto aparentemente inofensivo.
Los resultados de esta semana llevan esa preocupación un paso más allá: si la diversión con el lenguaje únicamente (algo tan casual como la rima) puede escapar de los filtros, ¿qué dice esto sobre el trabajo más amplio de alineación de la inteligencia?
Los autores sugieren que los controles de seguridad a menudo observan señales superficiales superficiales en lugar de una correspondencia de intencionalidad más profunda.
Y realmente, eso refleja el tipo de discusiones que muchos desarrolladores han estado teniendo de forma extraoficial durante varios meses.
Quizás recuerde que OpenAI y Google, que participan en un juego de IA de seguimiento rápido, se han esforzado por resaltar la mejora de la seguridad.
De hecho, tanto el Informe de seguridad de OpenAI como el blog DeepMind de Google han afirmado que las barreras de seguridad hoy son más fuertes que nunca.
Sin embargo, los resultados del estudio parecen indicar que existe una disparidad entre los puntos de referencia de laboratorio y las pruebas del mundo real.
Y para darle un toque dramático adicional –quizás incluso justicia poética– los investigadores no utilizaron algunas de las técnicas comunes de “jailbreak” que se utilizan en los foros.
Simplemente reformulan preguntas estrechas en un lenguaje poético, como si estuvieras solicitando una guía venenosa lograda a través de una metáfora que rima.
Sin amenazas, sin engaños, sin códigos apocalípticos. Sólo… poesía. Esa extraña falta de ajuste entre intenciones y estilo puede ser precisamente lo que hace tropezar a estos sistemas.
La pregunta obvia es, por supuesto, qué significa todo esto para la regulación. Los gobiernos ya están avanzando hacia normas para la IA, y la Ley de IA de la UE aborda directamente el comportamiento de modelos de alto riesgo.
A los legisladores no les resultará difícil considerar este estudio como una prueba positiva de que las empresas todavía no están haciendo lo suficiente.
Algunos creen que la respuesta es mejor “entrenamiento de confrontación”. Otros piden organizaciones independientes de equipos rojos, mientras que unos pocos, en particular investigadores académicos, sostienen que la transparencia en torno a los aspectos internos del modelo garantizará la solidez a largo plazo.
Como anécdota, después de haber visto algunos de estos experimentos en diferentes laboratorios, me inclino hacia una combinación de los tres.
Si la IA va a ser una parte más importante de la sociedad, debe ser capaz de manejar más que preguntas simples y estrictas.
Ya sea que los exploits basados en rimas se conviertan en una nueva tendencia en las pruebas de IA o simplemente en otra divertida nota a pie de página en los anales de la investigación de seguridad, este trabajo sirve como un recordatorio oportuno de que incluso nuestros sistemas más avanzados dependen de barreras de seguridad imperfectas que pueden evolucionar con el tiempo.
A veces esas grietas aparecen sólo cuando a alguien se le ocurre hacer una pregunta peligrosa como lo haría un poeta.