Anuncio de un conjunto completo y abierto de codificadores automáticos dispersos para la interpretabilidad de modelos de lenguaje.
Para crear un modelo de lenguaje de inteligencia artificial (IA), los investigadores construyen un sistema que aprende de grandes cantidades de datos sin guía humana. Como resultado, el funcionamiento interno de los modelos lingüísticos suele ser un misterio, incluso para los investigadores que los entrenan. La interpretabilidad mecanicista es un campo de investigación centrado en descifrar este funcionamiento interno. Los investigadores en este campo utilizan codificadores automáticos dispersos como una especie de “microscopio” que les permite ver el interior de un modelo de lenguaje y tener una mejor idea de cómo funciona.
Hoy anunciamos Gemma Scope, un nuevo conjunto de herramientas para ayudar a los investigadores a comprender el funcionamiento interno de Gemma 2, nuestra familia liviana de modelos abiertos. Gemma Scope es una colección de cientos de codificadores automáticos dispersos (SAE) abiertos y disponibles gratuitamente para Gemma 2 9B y Gemma 2 2B. También estamos abriendo Mishax, una herramienta que creamos y que permitió gran parte del trabajo de interpretabilidad detrás de Gemma Scope.
Esperamos que el lanzamiento de hoy permita una investigación de interpretabilidad más ambiciosa. Investigaciones adicionales tienen el potencial de ayudar en el campo a construir sistemas más robustos, desarrollar mejores salvaguardias contra las alucinaciones de modelos y proteger contra los riesgos de agentes autónomos de IA como el engaño o la manipulación.
Pruebe nuestra demostración interactiva de Gemma Scope, cortesía de Neuronpedia.
Interpretar lo que sucede dentro de un modelo de lenguaje.
Cuando le haces una pregunta a un modelo de lenguaje, convierte tu entrada de texto en una serie de “activaciones”. Estas activaciones mapean las relaciones entre las palabras que ingresó, lo que ayuda al modelo a establecer conexiones entre diferentes palabras, que utiliza para escribir una respuesta.
A medida que el modelo procesa la entrada de texto, las activaciones en diferentes capas de la red neuronal del modelo representan múltiples conceptos cada vez más avanzados, conocidos como “características”.
Por ejemplo, las primeras capas de un modelo podrían aprender a recordar hechos como que Michael Jordan juega baloncesto, mientras que las capas posteriores pueden reconocer conceptos más complejos como la factualidad del texto.