Funciones de recompensa personalizadas para el aprendizaje reforzado en varios turnos con Amazon Nova Forge
En el aprendizaje por refuerzo (RL) de múltiples turnos, su función de recompensa personalizada decide qué aprende realmente el modelo. Una recompensa sutilmente incorrecta puede enseñar silenciosamente algo incorrecto mientras…