Mejore la precisión de las llamadas de herramientas de su agente con SFT y DPO en Amazon SageMaker AI
Los agentes de IA pueden manejar de forma autónoma tareas complejas de varios pasos, pero su efectividad depende de llamar a las herramientas adecuadas para recuperar información o tomar medidas.…
Cómo utilizar AgentTrove: transmisión de 1,7 millones de seguimientos agentes y creación de un conjunto de datos SFT ShareGPT limpio en Python
def is_success(row): res = (row.get(“resultado”) o “”).lower() if res in (“resuelto”, “éxito”, “aprobado”, “aprobado”, “correcto”): devuelve True rw = row.get(“recompensa”) intenta: devuelve float(rw) >= 1.0 excepto (TypeError, ValueError): devuelve False…
Hugging Face lanza TRL v1.0: una pila unificada posterior a la capacitación para flujos de trabajo SFT, modelado de recompensas, DPO y GRPO
Hugging Face ha lanzado oficialmente TRL (Transformer Reinforcement Learning) v1.0, lo que marca una transición fundamental para la biblioteca de un repositorio orientado a la investigación a un marco estable…
Prefijo-RFT: un marco de aprendizaje automático unificado para combinar el ajuste superior (SFT) y el refuerzo de refuerzo (RFT)
Los modelos de lenguaje grande se refinan típicamente después de pretrarse utilizando ajuste fino (SFT) supervisado o refuerzo de ajuste fino (RFT), cada uno con fuerzas y limitaciones distintas. SFT…
OpentHoughts: una tubería de curación de datos SFT de ajuste fino escalable para modelos de razonamiento
La creciente complejidad de la curación de datos de razonamiento Los modelos de razonamiento recientes, como Deepseek-R1 y O3, han mostrado un rendimiento sobresaliente en áreas matemáticas, codificadas y científicas,…
Qwen AI presenta QWEN2.5-Max: un gran MOE LLM previamente en datos masivos y post-entrenado con recetas SFT y RLHF curadas
El campo de la inteligencia artificial está evolucionando rápidamente, con un aumento de los esfuerzos para desarrollar modelos lingüísticos más capaces y eficientes. Sin embargo, la escala de estos modelos…
ORPO: Optimización de preferencias sin el paso de ajuste fino supervisado (SFT)
Un método de alineación mucho más económico que funciona tan bien como DPO Generado con DALL-E En la actualidad existen muchos métodos para alinear los modelos de lenguaje grandes (LLM)…
NousResearch lanzó Nous-Hermes-2-Mixtral-8x7B: un LLM de código abierto con versiones SFT y DPO
En los modelos de lenguaje e inteligencia artificial, los usuarios a menudo enfrentan desafíos al entrenar y utilizar modelos para diversas tareas. Es evidente la necesidad de un modelo versátil…