Aprendizaje por refuerzo distribuido para una optimización escalable de políticas de alto rendimiento
sobre los problemas del mundo real es difícil El aprendizaje por refuerzo parece sencillo en entornos controlados: estados bien definidos, recompensas densas, dinámica estacionaria, simulación ilimitada. La mayoría de los…