¿Los LLM realmente pueden juzgar con razonamiento? Los investigadores de Microsoft y Tsinghua introducen modelos de razonamiento de recompensas para escalar dinámicamente el calculador de tiempo de prueba para una mejor alineación
El aprendizaje de refuerzo (RL) ha surgido como un enfoque fundamental en la capacitación de LLM, utilizando señales de supervisión de la retroalimentación humana (RLHF) o las recompensas verificables (RLVR).…