ADVERTENCIA DE CONTENIDO: Esta publicación contiene ejemplos de texto tóxico y sesgado generado por LLM.
Esta publicación proporciona una inmersión profunda en investigaciones recientes sobre sesgos, toxicidad y jailbreak de modelos de lenguaje grandes (LLM), especialmente ChatGPT y GPT-4. Analizaré las pautas éticas que las empresas utilizan actualmente en el desarrollo de LLM y los enfoques que utilizan para tratar de protegerse contra la generación de contenido no deseado. Luego revisaré artículos de investigación recientes que estudian la generación de contenido tóxico, el jailbreak y los prejuicios desde múltiples ángulos: género, raza, medicina, política, lugar de trabajo y ficción.
El sesgo se refiere al prejuicio a favor o en contra de un grupo, persona o cosa específica, mientras que la toxicidad se refiere al contenido irrespetuoso, vulgar, grosero o que promueve el daño. Los LLM son parciales y tienen la capacidad de generar contenido tóxico porque están capacitados con grandes cantidades de datos de Internet, que desafortunadamente representan tanto el lado bueno como el malo de la humanidad, incluidos todos nuestros prejuicios y toxicidad. Afortunadamente, los desarrolladores de LLM como OpenAI y Google han tomado medidas para reducir las posibilidades de que los LLM produzcan contenido abiertamente sesgado o tóxico. Sin embargo, como veremos, eso no significa que los modelos sean perfectos; de hecho, los LLM amplifican los sesgos existentes y mantienen la capacidad de generar contenido tóxico a pesar de las salvaguardias.
El proceso de “jailbreaking” se refiere a darle a un LLM indicaciones particularmente desafiantes o provocativas para explotar los sesgos existentes del modelo y la capacidad existente para la generación de contenido tóxico, con el fin de obtener resultados de LLM que violen las políticas de contenido de la empresa. Los investigadores que estudian el jailbreak lo hacen para alertar a las empresas sobre las vulnerabilidades de LLM, de modo que las empresas puedan fortalecer las salvaguardas que han implementado y hacer que sea menos probable que los modelos sean liberados en el futuro. La investigación sobre jailbreak es similar a hackeo éticoen el que los piratas informáticos descubren debilidades del sistema para repararlas, lo que da como resultado una seguridad mejorada del sistema.
Cualquiera que esté interesado en los LLM desde una perspectiva personal o profesional puede beneficiarse de la lectura de este artículo, incluidos los entusiastas de la IA que tengan…