Las evaluaciones de LLM se basan en vibraciones: construí la capa faltante que decide qué se envía
TL;DR una implementación funcional completa en Python puro, con números de referencia reales. La mayoría de los equipos evalúan las respuestas del LLM leyéndolas y adivinando. Eso se rompe en…