¿Cómo se compara una API de búsqueda web cuando lo que se está probando puede leer la clave de respuestas? Un agente de búsqueda tiene una herramienta de búsqueda. Si las etiquetas doradas se encuentran en un conjunto de datos público, el agente puede descargarlas a mitad de la evaluación y omitir la recuperación por completo. Un problema similar surge cuando las respuestas ya están codificadas en la memoria paramétrica del modelo: una respuesta correcta ya no demuestra que la búsqueda web haya funcionado. La respuesta de Keenable es NEEDLE, un punto de referencia de código abierto en vivo que reconstruye su conjunto de consultas a partir de fuentes públicas nuevas en lugar de congelar una. Las consultas de noticias se regeneran cada hora a partir de canales RSS y Google Trends; Las consultas financieras, académicas, legales y de entidades raras se regeneran diariamente a partir de registros de SEC XBRL, arXiv, Europe PMC, CourtListener y agentes públicos. Quince API de búsqueda se ejecutan con el mismo texto de consulta bajo un protocolo, y cada puntaje se lee con el último, un motor Oracle agrupado que marca lo que todo el campo logró encontrar.
¿Es reproducible?
Sí, como un instrumento de evaluación de código abierto más que como un producto. Needle es una CLI de Python instalada con sincronización UV y controlada por dos subcomandos por punto de referencia, generar y ejecutar. Necesita una clave OpenRouter para juzgar y una clave API por motor probado, y se ejecuta en una computadora portátil o en CI. Permite recrear todos los flujos de consultas que se utilizan además de los juicios de calidad de clasificación.
¿Qué mide la AGUJA?
NEEDLE significa Noticias, Todos los días, Expertos, Evaluación profunda y legal. Cada vertical modela la intención de un agente diferente. News proyecta el elemento más reciente de ~124 feeds RSS seleccionados y Google Trends en una consulta de palabras clave. Finanzas solicita datos de registro de Wikidata y GLEIF más cifras del 10-Q de un solo trimestre de SEC XBRL. Scholar convierte un artículo en cuatro estilos de consulta: un título degradado, un detalle de solo texto completo, una pista en lenguaje natural y una descripción confusa en la punta de la lengua. Muestras de cola profunda de consultas de palabras raras de lanzamientos públicos de trayectoria de agentes, incluidos DeepResearchGym, OpenResearcher y LRAT. Legal reúne opiniones recientes de CourtListener en 14 tribunales federales y secciones del eCFR.
La puntuación se divide en la misma línea. Las noticias y la cola profunda no tienen un único resultado correcto, por lo que un juez de LLM califica cada resultado de 0 a 4 y el arnés informa nDCG@5 con una penalización por URL duplicada. Informes financieros respuesta-recuerdo@5: ¿el hecho llega al agente dentro de un fragmento del top 5? Académico y legal son tareas de elementos conocidos calificadas por coincidencia de identificador.
El techo es la parte interesante.
Cada motor recibe el mismo texto de consulta. El corredor emite una llamada a la vez, por lo que los percentiles de latencia son comparables y ningún motor realiza una carga simultánea. La evaluación se realiza según la clasificación, los títulos y los fragmentos del propio motor. Las páginas nunca se recuperan y los resultados nunca se reclasifican. La evidencia se recorta a 2000 caracteres para todos y el juez no ve el nombre del motor.
El número más interesante es el límite máximo. Para cada consulta, NEEDLE agrupa los resultados devueltos por cada motor en un motor Oracle sintético y luego ordena el conjunto combinado por relevancia. Eso crea un límite empírico basado en lo que todo el campo pudo recuperar.
Por lo tanto, la brecha con lo último es un límite superior en la calidad de la búsqueda agencial tal como está hoy. Una gran brecha significa que existieron mejores resultados, pero ninguno de los motores logró destacarlos o clasificarlos bien. Una puntuación final débil significa algo diferente: incluso después de agrupar a todos los proveedores, el punto de referencia encontró poca evidencia sólida. En otras palabras, NEEDLE puede distinguir un problema de clasificación de un problema de recuperación compartido por todo el mercado.
Dónde se encuentra realmente el campo
Los números a continuación son promedios publicados de 7 días para la ventana que finaliza el 28 de agosto de 2026.
Las finanzas están cerca de resolverse: Exa 0,910, Keenable 0,872, Perplexity 0,871, Google 0,847, frente a un máximo de 0,965. Scholar se extiende, Keenable 0,774 a Tavily 0,310 contra un techo de 0,869, porque las consultas de título se pueden responder a partir de metadatos y las consultas de cuerpo no. La cola profunda es la más difícil y la más cercana al tráfico de agentes reales: Exa lidera con 0,557 de final, Keenable le sigue con 0,470, Bing se sitúa en 0,199. La brecha entre la calidad entregada y la calidad alcanzable se amplía a medida que las consultas se acercan a cómo buscan realmente los agentes.
La latencia es otra métrica importante aquí, porque los agentes llaman a la búsqueda docenas de veces por tarea. Misma ventana: Keenable-realtime 193 ms p50 / 284 ms p95, Exa 1.876 / 2.955, Bing 2.767 / 9.381.
Conclusiones clave
NEEDLE regenera consultas cada hora para noticias y diariamente para las otras cuatro verticales, por lo que no hay un conjunto fijo para sobreajustar. Cinco verticales, 15 API de búsqueda, un protocolo: el mismo texto de consulta, el mismo límite de evidencia de 2000 caracteres, una solicitud a la vez. Cada tabla de clasificación se compara con lo último, un motor de oráculo conjunto que marca el techo que alcanzó todo el campo. En consultas de entidades raras procedentes de registros de agentes reales, el motor superior alcanza el 0,557 de ese límite; En cuanto a las finanzas, la mayoría de los motores se agrupan entre 0,77 y 0,91. El código es MIT, las ejecuciones se ejecutan en acciones públicas de GitHub y los artefactos por ejecución se envían a un conjunto de datos de Hugging Face.
Consulte el panel en vivo, el repositorio de GitHub, el informe técnico y los artefactos archivados. Todo el crédito es para los investigadores de este proyecto.
Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.