CALM: Asignación de créditos con modelos de lenguaje para la conformación automatizada de recompensas en el aprendizaje por refuerzo
El aprendizaje por refuerzo (RL) es un área fundamental del aprendizaje automático que permite a los agentes aprender de sus interacciones dentro de un entorno al recibir retroalimentación como recompensa.…