HuggingFace presenta TextEnvironments: un orquestador entre un modelo de aprendizaje automático y un conjunto de herramientas (funciones de Python) que el modelo puede llamar para resolver tareas específicas
El ajuste fino supervisado (SFT), el modelado de recompensas (RM) y la optimización de políticas próximas (PPO) son parte de TRL. En esta biblioteca completa, los investigadores brindan herramientas para…