Generalización de débil a fuerte

Todavía existen diferencias importantes entre nuestra configuración empírica actual y el problema fundamental de alinear modelos sobrehumanos. Por ejemplo, puede ser más fácil para los modelos futuros imitar errores humanos débiles que para los modelos fuertes actuales imitar los errores de los modelos débiles actuales, lo que podría dificultar la generalización en el futuro.

Sin embargo, creemos que nuestra configuración captura algunas dificultades clave para alinear futuros modelos sobrehumanos, lo que nos permite comenzar a hacer avances empíricos en este problema hoy. Hay muchas direcciones prometedoras para el trabajo futuro, incluida la solución de las disanalogías en nuestra configuración, el desarrollo de mejores métodos escalables y el avance de nuestra comprensión científica de cuándo y cómo debemos esperar una buena generalización de débil a fuerte.

Creemos que esta es una oportunidad emocionante para que la comunidad de investigación de ML avance en la alineación. Para impulsar más investigaciones en esta área,

  • estamos liberando código fuente abierto para que sea más fácil comenzar hoy con experimentos de generalización de débil a fuerte.
  • Estamos lanzando un Programa de subvenciones de 10 millones de dólares para que estudiantes de posgrado, académicos y otros investigadores trabajen ampliamente en la alineación de la IA sobrehumana. Estamos especialmente entusiasmados de apoyar la investigación relacionada con la generalización de débil a fuerte.

Descubrir cómo alinear los futuros sistemas de IA sobrehumanos para que sean seguros nunca ha sido más importante, y ahora es más fácil que nunca lograr avances empíricos en este problema. Estamos emocionados de ver qué avances descubren los investigadores.