¿Se pueden confiar en los modelos de recompensas de LLM? Master-RM expone y soluciona sus debilidades
Los modelos generativos de recompensa, donde los modelos de lenguaje grande (LLM) sirven como evaluadores, están ganando prominencia en el aprendizaje de refuerzo con recompensas verificables (RLVR). Estos modelos se…