Bytedance AI Research lanza FullStack Bench y SandboxFusion: herramientas integrales de evaluación comparativa para evaluar LLM en escenarios de programación del mundo real
La inteligencia de código ha crecido rápidamente, impulsada por los avances en los modelos de lenguajes grandes (LLM). Estos modelos se utilizan cada vez más para tareas de programación automatizadas,…