OpenAI admite que su agente se volvió deshonesto y pirateó la startup de IA Hugging Face

Un agente autónomo de OpenAI se volvió deshonesto y pirateó la infraestructura de otra startup de inteligencia artificial (IA), dijo el fabricante de ChatGPT en una publicación de blog.

El agente, que funcionaba con algunos de los modelos más avanzados de OpenAI, se volvió loco durante una prueba de seguridad. Se liberó del confinamiento (un protocolo que utilizan los laboratorios de inteligencia artificial para aislar las pruebas de Internet en general) y accedió a Internet. Una vez en línea, el agente intentó piratear Hugging Face, una startup de inteligencia artificial que aloja modelos y conjuntos de datos de código abierto.

La infracción se produce cuando OpenAI y otras nuevas empresas de inteligencia artificial se esfuerzan por utilizar su tecnología para la ciberseguridad. Esos esfuerzos han sido recibidos con cautela por los expertos en ciberseguridad y por la administración Trump, que anteriormente ha tratado de restringir quién podría tener acceso a estos modelos por motivos de seguridad nacional.

Sobre el apoyo al periodismo científico

Si está disfrutando de este artículo, considere apoyar nuestro periodismo galardonado suscribiéndose. Al comprar una suscripción, ayudas a garantizar el futuro de historias impactantes sobre los descubrimientos y las ideas que dan forma a nuestro mundo actual.

La admisión de OpenAI se produjo después de que Hugging Face, en una publicación de blog la semana pasada, dijera que había sido objetivo de un ataque dirigido por IA que era “diferente a todo lo que habíamos manejado antes”. Hugging Face dijo que su propia IA había sido fundamental para detectar e investigar la infracción.

“La campaña fue dirigida por un marco de agente autónomo (que parecía estar construido sobre un arnés de investigación de seguridad agente; el LLM usado aún no se conoce) ejecutando muchos miles de acciones individuales a través de un enjambre de entornos limitados de corta duración, con comando y control auto-migratorio organizado en servicios públicos. Esto coincide con el escenario de “atacante agente” que la industria ha estado pronosticando”, escribió Hugging Face.

En su propia publicación del martes, OpenAI dijo que había descubierto que su agente estaba detrás del ataque “después de investigar”. El agente fue conducido por modelos que incluyen GPT-5.6 Sol y otro modelo inédito y sin nombre. OpenAI dijo que trabajaría con Hugging Face para investigar más a fondo el incidente.

“Consideramos que este incidente es un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación, y estamos respondiendo en consecuencia”, escribió OpenAI.

Los modelos de IA lograron identificar y explotar de forma autónoma las debilidades en el entorno de prueba de OpenAI, y finalmente encontraron la llamada “vulnerabilidad de día cero”: se trata de una falla de seguridad desconocida en el software que un actor puede explotar sin que el propietario del software lo sepa. Eso llevó al agente a Internet.

OpenAI dijo en su publicación que también agregaría más protecciones a sus entornos de capacitación. “Este incidente apunta a la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y el monitoreo durante las pruebas internas”, escribió la compañía.

Esta es una historia en desarrollo y puede actualizarse.

Es hora de defender la ciencia

Si te ha gustado este artículo, me gustaría pedirte tu apoyo. Científico americano ha servido como defensor de la ciencia y la industria durante 180 años, y ahora mismo puede ser el momento más crítico en esos dos siglos de historia.

he sido un Científico americano suscriptor desde que tenía 12 años y me ayudó a moldear mi forma de ver el mundo. Ciencia-Am Siempre me educa y me deleita, e inspira una sensación de asombro por nuestro vasto y hermoso universo. Espero que también lo haga por ti.

Si te suscribes a Científico americanousted ayuda a garantizar que nuestra cobertura se centre en investigaciones y descubrimientos significativos; que tenemos los recursos para informar sobre las decisiones que amenazan a los laboratorios en todo Estados Unidos; y que apoyemos a los científicos tanto en ciernes como en activo en un momento en el que con demasiada frecuencia el valor de la ciencia misma pasa desapercibido.

A cambio, obtiene noticias esenciales, podcasts cautivadores, infografías brillantes, boletines informativos imperdibles, vídeos imprescindibles, juegos desafiantes y los mejores escritos e informes del mundo científico. Incluso puedes regalarle a alguien una suscripción.

Nunca ha habido un momento más importante para que nos levantemos y demostremos por qué la ciencia es importante. Espero que nos apoyes en esa misión.