REBEL: un algoritmo RL de aprendizaje por refuerzo que reduce el problema de RL a resolver una secuencia de problemas de regresión de recompensa relativa en conjuntos de datos recopilados iterativamente
Inicialmente diseñada para tareas de control continuo, la optimización de políticas próximas (PPO) se ha utilizado ampliamente en aplicaciones de aprendizaje por refuerzo (RL), incluido el ajuste de modelos generativos.…