Harvey ha lanzado Harvey Tenet, su primer modelo post-entrenado, como avance de la investigación a partir de hoy. Tenet es una base de Kimi K3 post-entrenada con Fireworks a través del aprendizaje de refuerzo asincrónico en trabajos legales a largo plazo. El corpus de capacitación combinó datos sintéticos, datos legales disponibles públicamente y datos de expertos humanos. Harvey afirma que no se utilizaron datos de clientes. En comparación con el modelo K3 base, Tenet completa casi el doble de tareas pendientes en Harvey’s Legal Agent Benchmark (LAB) y un 20% más en LAB: Contratos, lo que aumenta la tasa de aprobación total en 9 y 2 puntos porcentuales respectivamente. Harvey informa lo último en LAB: contratos y segundo lugar en LAB. Las ganancias también se transfirieron, sin capacitación, a los agentes APEX de Mercor y a Redline Bench de Crosby. El objetivo declarado es doble: construir inteligencia jurídica de vanguardia en modelos abiertos y brindar a las firmas de abogados un camino para poseer sus propios modelos especializados.
¿Es desplegable?
Todavía no, Harvey Tenet es una vista previa de la investigación anunciada el 20 de agosto de 2026. Harvey no ha publicado pesos, una tarjeta modelo ni un punto final API. El modelo base es de peso abierto; Tenet en sí es el punto de control de Harvey, y la compañía dice que el trabajo pasará “de la investigación a la producción” dentro de los productos de Harvey con el tiempo. Lo que hoy se comercializa es la receta, no el artefacto.
Nivel de empresa: solo Enterprise. El acceso se realiza a través de la plataforma de Harvey, que se vende a bufetes de abogados, firmas medianas y equipos legales internos. Un laboratorio con una pila RL podría reproducir el método; La capacitación utilizó aproximadamente 150 GPU NVIDIA B300 durante dos meses. Industrias: servicios legales, asuntos legales internos corporativos, capital privado y banca de inversión (diligencia de fusiones y adquisiciones), además de sectores regulados donde el volumen de contratos impulsa los costos: seguros, servicios financieros, atención médica, energía. Aplicaciones: memorandos de diligencia debida de fusiones y adquisiciones en salas de datos, redacción, revisión y revisión de contratos, extracción estructurada de hasta 10 000 documentos y búsqueda de precedentes sobre el conocimiento acumulado de una empresa.
Lo que dicen los números
En comparación con el modelo K3 básico, Tenet completa casi el doble de tareas pendientes en Harvey’s Legal Agent Benchmark (LAB) y un 20% más en LAB: Contratos, lo que eleva la tasa de aprobación total en 9 y 2 puntos porcentuales respectivamente. Harvey informa lo último en LAB: contratos y el segundo lugar en LAB, utilizando puntuaciones del modelo base de Vals.
El resultado más interesante es la transferencia. Tenet también mejora sustancialmente en APEX Agents (derecho corporativo) de Mercor y Redline Bench de Crosby (ninguno de los cuales se vio durante la capacitación) al tiempo que mantiene el desempeño en puntos de referencia de conocimiento, incluidos LegalBench, CUAD, MAUD y PRBench de Scale. La formación como agente no erosionó el razonamiento jurídico de los libros de texto.
El costo se cooptimiza en lugar de negociarse. Los pesos abiertos reducen el precio por token; La configuración de recompensas que prefiere trayectorias más cortas con igual calidad reduce el consumo de tokens. Harvey informa mejoras significativas en la calidad a un costo estable.
como fue entrenado
La capacitación utilizó aprendizaje de refuerzo asincrónico en entornos legales aislados construidos como tareas LAB: una instrucción estilo socio con un promedio de aproximadamente 50 palabras, una cuestión de cliente de documentos clave y periféricos, y una rúbrica experta de criterios atómicos de aprobación/rechazo: aproximadamente 50 por tarea, cientos en el extremo. Un solo lanzamiento puede superar las 1000 vueltas.
Los lanzamientos son calificados por LLM como juez; Las ablaciones se realizaron en Kimi 2.6. La recompensa combina la fracción de criterios de rúbrica satisfechos, un recuento holístico de problemas legales resueltos y una bonificación por aprobación total. La política se optimiza con GSPO utilizando una LoRA de rango 64 en toda la red K3, ocho grupos de tareas de ocho implementaciones por paso del optimizador, en ~1750 entornos y >10 000 implementaciones por época. Fireworks co-creó implementaciones de entrenamiento e implementación a nivel de kernel, con token-in-token-out y reproducción de enrutador, para mantener un gran MoE alineado numéricamente a lo largo del entrenamiento y la inferencia.