Tag: Tsinghua

¿Los LLM realmente pueden juzgar con razonamiento? Los investigadores de Microsoft y Tsinghua introducen modelos de razonamiento de recompensas para escalar dinámicamente el calculador de tiempo de prueba para una mejor alineación

El aprendizaje de refuerzo (RL) ha surgido como un enfoque fundamental en la capacitación de LLM, utilizando señales de supervisión de la retroalimentación humana (RLHF) o las recompensas verificables (RLVR).…

LLMS ahora puede aprender sin etiquetas: los investigadores de la Universidad de Tsinghua y el laboratorio de AI de Shanghai introducen el aprendizaje de refuerzo de tiempo de prueba (TTRL) para permitir modelos de lenguaje autoevolución utilizando datos no etiquetados

A pesar de los avances significativos en las capacidades de razonamiento a través del aprendizaje de refuerzo (RL), la mayoría de los modelos de idiomas grandes (LLM) siguen dependiendo fundamentalmente…