OpenAI publicó un nuevo método de seguridad previo a la implementación llamado Simulación de implementación. La idea es directa. Antes de enviar un modelo, primero simule su despliegue. Reproduzca conversaciones pasadas a través del nuevo modelo candidato. Luego estudia cómo se comporta en contextos realistas.
OpenAI ya utiliza conocimientos del método durante el desarrollo del modelo. Ha informado sobre mitigaciones y decisiones de implementación, y ha sacado a la luz puntos ciegos en las evaluaciones tradicionales.
Comprender la simulación de implementación
La simulación de implementación es un método para simular una implementación futura antes de que suceda. OpenAI hace esto reproduciendo conversaciones anteriores con un nuevo modelo candidato. La repetición preserva la privacidad.
La técnica es simple en esencia. Tome conversaciones recientes del despliegue. Elimine la respuesta del asistente original del modelo anterior. Regenere esa respuesta con el modelo candidato que se lanzará. Luego evalúe las terminaciones en busca de nuevos modos de falla.
A partir de esas conclusiones, OpenAI estima la frecuencia de comportamiento no deseado en el tiempo de implementación. La misma medición se puede realizar después del lanzamiento en tráfico real. Esto hace que las previsiones previas al despliegue se puedan comprobar más adelante.
Hay un piso. El enfoque no puede medir comportamientos que ocurren menos de una vez en 200.000 mensajes. Se centra en riesgos no puntuales, no en los acontecimientos más raros.