Investigadores de NVIDIA y la Universidad de Maryland proponen ODIN: una técnica de desenredado de recompensas que mitiga la piratería en el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF)
El conocido chatbot basado en inteligencia artificial (IA), es decir, ChatGPT, que se ha construido sobre la arquitectura transformadora de GPT, utiliza la técnica de aprendizaje reforzado a partir de…