¿Los modelos de IA actúan como amenazas internas? Las simulaciones de Anthrope dicen que sí
La última investigación de Anthrope investiga una frontera de seguridad crítica en la inteligencia artificial: la aparición de comportamientos de amenazas internos de modelo de lenguaje grande (LLM) Agentes. El…