Proxy-Pointer RAG: Eliminación de la extracción derrochadora de entidades y relaciones en gráficos de conocimiento

En mi artículo sobre cómo resolver la expansión de entidades y relaciones en gráficos de conocimiento, analicé cómo la arquitectura Proxy-Pointer puede optimizar la búsqueda de entidades y relaciones adecuadas. Esto, sin embargo, es sólo la segunda parte de un problema mayor en la ingesta de gráficos. El paso más importante (y mucho más costoso) es identificar esas entidades (NER) y relaciones en primer lugar.

Los gráficos de conocimiento están diseñados para responder consultas complejas de agregación y de múltiples saltos entre entidades y relaciones sobre documentos similares: contratos de proveedores, manuales de cumplimiento, acuerdos de crédito, términos y condiciones globales, etc. Estos documentos suelen tener más de 100 páginas con un texto denso que supera los 500 000 caracteres. Las empresas frecuentemente absorben miles de contratos similares de los mismos proveedores y clientes.

Para hacer eso, cada uno de estos documentos pasa a través de un poderoso LLM para NER y extracción de relaciones, quemando millones de tokens incluso antes de que pueda ocurrir la ingesta real del gráfico. El proceso debe repetirse a veces, ya que la extracción de contexto largo a menudo sufre una menor consistencia de recuperación y una mayor variación de extracción.

Sin embargo, el hecho crucial es que los documentos legales, como los contratos, tienen una estructura muy similar en todas las organizaciones, incluso en todas las industrias. Y están llenos de texto repetitivo denso, horarios, exhibiciones, etc., la mayoría de los cuales son de poco valor para NER, pero de todos modos aún deben ser vistos por un LLM.

Pero ¿y si pudiéramos explotar esta previsibilidad estructural? ¿Qué pasaría si pudiéramos predecir el valor de una sección antes de enviarla al LLM, reduciendo drásticamente los costos de ingesta al ignorar estratégicamente el ruido?

En este artículo, exploraremos un enfoque novedoso para minimizar el contenido visto por el LLM. Al aprovechar los conceptos estructurales de Proxy-Pointer RAG e introducir una métrica predictiva llamada Graphability Indexing, podemos omitir selectivamente secciones de bajo rendimiento de documentos densos. Estoy ilustrando esto utilizando tres acuerdos de crédito corporativos masivos del mundo real (Emerson, AT&T y Texas Roadhouse) para demostrar cómo esta metodología puede reducir los costos de extracción, en comparación con los procesos de extracción de documentos completos, sin sacrificar la integridad del Gráfico de conocimiento resultante.

Resumen rápido: ¿Qué es Proxy-Pointer?

Proxy-Pointer es una técnica RAG consciente de la estructura que ofrece precisión quirúrgica en documentos complejos como informes anuales, acuerdos de crédito, etc. al costo del Vector RAG estándar. El RAG vectorial estándar divide los documentos en fragmentos ciegos, los incrusta y recupera la K superior por similitud de coseno. Incluso con superposición y fragmentación semántica, este no es un método confiable para la extracción de relaciones en KG empresariales, ya que los fragmentos fragmentan el contexto de un documento, lo que hace que la extracción sea propensa a alucinaciones.

En cambio, Proxy-Pointer trata un documento como un árbol de bloques semánticos (secciones) independientes. El contexto está encapsulado dentro de cada sección y, por lo tanto, son buenos candidatos para la extracción de relaciones. Además, es mucho más probable que un LLM identifique con precisión las entidades y relaciones de una sección en una sola pasada, en lugar de un documento completo de 100 páginas, lo que hace innecesarios los escaneos repetidos.

Técnicamente, Proxy-Pointer aprovecha cinco técnicas de ingeniería de costo cero para RAG: un árbol de estructura esquelética del documento, inyección de ruta de navegación, fragmentación guiada por estructura, filtrado de ruido y contexto basado en puntero. Aprovecharemos algunos de estos conceptos junto con algunos nuevos aquí. Puede consultar el artículo aquí para obtener más información sobre Proxy-Pointer.

Métodos existentes para la optimización NER.

Antes de analizar el enfoque Proxy-Pointer, veamos algunos de los enfoques de optimización existentes adoptados por las organizaciones.

PNL tradicional/modelos preentrenados (p. ej., spaCy): un primer enfoque común es utilizar canalizaciones de PNL tradicionales y livianas como spaCy junto con un LLM en un enfoque de embudo. Estos modelos son extremadamente rápidos y económicos, están previamente entrenados para reconocer entidades estándar (personas, organizaciones, ubicaciones, fechas) y se utilizan para escanear un documento en busca de regiones de puntos críticos de entidades. Luego, los puntos de acceso se escanean de manera enfocada utilizando un LLM. Sin embargo, la densidad de entidades no necesariamente se correlaciona con la densidad de relaciones. Por ejemplo, los textos administrativos estándar como 'Avisos' o 'Anexos' finales pueden estar repletos de entidades estándar (nombres, direcciones, fechas) sin contener ninguna relación jurídica estructural. También tienen dificultades con entidades corporativas personalizadas (como SOFR de plazo ajustado o préstamos Swing Line) y no son adecuados para extraer las relaciones complejas y anidadas necesarias para un gráfico de conocimiento legal altamente restringido. Además, el ajuste continuo de estos modelos para lograr la precisión necesaria requiere mucho esfuerzo de anotación manual y costos de computación. Escaneo previo de LLM (modelos de enrutador más pequeños): otro enfoque es utilizar un LLM más pequeño y económico para escanear previamente fragmentos rápidamente y decidir si contienen relaciones valiosas, antes de enviar solo los fragmentos de alto valor a un modelo de razonamiento grande para una extracción profunda. Si bien es más barato por token, todavía estamos obligando a un modelo a leer cada palabra de un documento de 500.000 caracteres. Y esto también supone un desperdicio de escaneo doble de grandes partes del documento.

Enfoque de puntero proxy

Como se mencionó anteriormente, Proxy-Pointer aprovecha las siguientes propiedades de los gráficos de conocimiento:

Los gráficos se crean para un dominio/área funcional y, por lo tanto, almacenan contenido de documento similar. Un gráfico de adquisiciones absorberá múltiples contratos de proveedores (y también muchos contratos del mismo proveedor), un gráfico de finanzas tendrá muchos documentos de prestamista y crédito, documentos de cumplimiento, etc. Los documentos comparten una estructura de referencia similar: secciones, cronogramas, anexos, etc. Y solo una fracción del contenido es suficiente para la extracción significativa de entidades y relaciones. El desafío es identificar ese contenido.

Utilizamos esta previsibilidad para los siguientes pasos:

Cree e implemente un índice de graficabilidad de referencia: comience con un índice de referencia para un tipo de documento (por ejemplo, acuerdos de crédito). Las secciones se clasifican en graficabilidad muy alta, alta, media, baja y muy baja. La calificación de graficabilidad está determinada por la densidad relacional (el volumen de conexiones comerciales procesables (bordes) en relación con el tamaño de la sección) en lugar de por el recuento de entidades sin procesar (nodos). Esto evita que secciones genéricas pero densas como Avisos o Anexos se clasifiquen como altas. Con base en esta metodología, el pago de obligaciones se clasifica como de muy alta graficabilidad mientras que los Deberes de Agente o Ley Aplicable se clasifican como tramos de bajo rendimiento. Sin embargo, hay una excepción importante. Si bien la mayoría de las secciones se evalúan según la densidad relacional, los fundamentos ontológicos como 'Subsidiarias' se anclan como 'Muy Alto' porque sus pocas aristas definen la jerarquía corporativa crítica que hereda el resto de las reglas del contrato. Esto preserva el valor del índice como mapa de calor empresarial en lugar de uno puramente técnico basado en la densidad de entidades o relaciones. Creación de árbol de estructura: creamos un árbol de estructura de un documento que enumera la jerarquía de secciones como nodos, junto con el título de la sección. Enriquecer y ajustar: caminamos por el árbol, no por el texto. Usamos los primeros documentos para refinar y reforzar el índice. Extraiga el contenido de cada sección según los números de línea. Utilice el título de la sección para encontrar el índice de rendimiento previsto. A continuación, el LLM escanea todas las secciones del documento y, en función de las relaciones y entidades extraídas, realiza una evaluación real del índice de rendimiento de cada sección. Cuando las calificaciones previstas y reales no coinciden, se marcan para revisión humana (por ejemplo, la clasificación real dice "Baja", pero la calificación prevista del índice es "Mediana"). En función de los aportes humanos de las PYME, se ajustan las clasificaciones en el índice. Ruta y derivación: siguiendo el proceso anterior, podríamos obtener un índice de graficabilidad enriquecido después de algunos documentos. A partir de entonces, las secciones de alto rendimiento (Muy Alto, Alto, Medio) se envían al LLM para una extracción profunda de NER. Las secciones Baja y Muy Baja se evitan de forma segura. Nuevas secciones: cada documento tendrá algunas secciones que no se encuentran en el índice y que se marcarán como brechas de cobertura. Estos se escanean obligatoriamente en busca de NER, para evitar perder relaciones relevantes. Tras la revisión humana de estos, los que se consideran genéricos y que ocurren con frecuencia se pueden agregar al índice, mientras que los personalizados, como la configuración de reemplazo de referencia, se pueden ignorar. Lograr la estabilización. Después de unas pocas iteraciones, esperamos que los desajustes en las predicciones caigan a casi cero, y que el volumen de “Nuevas Secciones” se estabilice en no más del 20-25% (que representan cláusulas administrativas o muy personalizadas), permitiendo que el sistema procese con confianza corpus de documentos masivos con el equilibrio adecuado de rigor y eficiencia.

El índice de graficabilidad debe mantenerse para cada tipo de documento y posiblemente incluso podría ser específico para grandes proveedores y socios individuales de quienes podemos estar ingiriendo cientos de documentos similares en un año.

Veamos esto en acción con un experimento.

La configuración experimental

Para validar esta hipótesis, configuré un experimento utilizando tres acuerdos de crédito corporativos masivos y disponibles públicamente que usé anteriormente en mi artículo sobre Comparación de contratos eficiente usando Proxy-Pointer. Como puede ver, todos son de diferentes empresas (e industrias), por lo que los documentos no comparten una estructura y formato idénticos.

Emerson Electric Co. (~228 000 caracteres) AT&T Inc. (~214 000 caracteres) Texas Roadhouse, Inc. (TRroadhouse) (~434 000 caracteres)

Índice de graficabilidad inicial

Nuestro objetivo es construir y validar iterativamente un índice de graficabilidad predictivo. Comenzamos con un índice de referencia fundamental que relaciona las secciones comunes de los acuerdos de crédito con su densidad relacional esperada:

{ "document_type": "credit_agreement", "very_high_graphability": [ "Litigios", "Cuestiones Ambientales", "Filiales", "Pago de Obligaciones", "Mantenimiento de Propiedades", "Fusiones y Ventas de Activos", "Calendario de Compromisos", "Sanciones y Anticorrupción", "Designación de Prestatarios Filiales", "Definiciones", "Eventos de Incumplimiento", "Sucesores y Asigna" ], "high_graphability": [ "Garantía de la empresa", "La instalación", "Cartas de crédito de la instalación", "Existencia y poder corporativo", "Autorización corporativa", "Información financiera", "Cumplimiento de las leyes", "Uso de los ingresos", "Agente organizador y de sindicación", "Oficinas de pago en euromonedas", "Prestamistas morosos" ], "medium_graphability": [ "Préstamos de línea oscilante", "Adelantos de ofertas competitivas", "Extensiones de crédito", "Designación de un prestatario subsidiario", "Agente sucesor", "Indemnización de financiamiento", "Cuentas de aceleración y garantía", "Colateral" ], "low_graphability": [ "Términos contables", "Cambios en las tasas de interés", "Método de pago", "Avisos telefónicos", "Interrupción del mercado", "Moneda del fallo", "Cambio de Circunstancias", "Confidencialidad" ], "very_low_graphability": [ "Sin exenciones", "Contrapartes e integración", "Ley aplicable", "Renuncia a juicio con jurado", "Sin deber fiduciario", "Notificación de proceso", "Varios", "Comunicaciones electrónicas", "Anexo", "Índice" ] }

Los ejecutaríamos en 3 fases. Primero, ejecute el acuerdo de Emerson para calcular los ahorros iniciales. Cualquier sección genérica descubierta (deltas) descubierta en Emerson se volvería a incluir en el índice. Luego ejecutaríamos el índice enriquecido contra AT&T, incluiríamos cualquier caso extremo final en el índice, si fuera necesario, y utilizaríamos el índice completamente refinado contra el acuerdo masivo de TRoadhouse para medir la reducción final. El objetivo es que cuando analicemos el acuerdo TRoadhouse, veamos significativamente menos desajustes que los dos anteriores a medida que el índice se estabilice.

Criterios de evaluación

Para cada sección, mediremos la graficabilidad prevista del índice con la calificación real evaluada por el LLM en función de las relaciones y entidades encontradas. En nuestro informe, clasificaremos los resultados en tres grupos:

Alineación perfecta: el índice predijo con precisión la calificación de graficabilidad de la sección.

Desviaciones menores: el índice predijo un rendimiento (p. ej., Medio) que difería ligeramente de la evaluación manual (p. ej., Bajo).

Brechas de cobertura/nuevas secciones: la sección era exclusiva del documento y aún no existía en nuestro índice predictivo.

Resultados y enriquecimiento iterativo

Comencemos con la Fase 1: Emerson

Fase 1: Acuerdo de crédito de Emerson (prueba de la línea de base)

Analizamos las 95 secciones de este acuerdo con nuestro índice de referencia. En esta ejecución inicial, 66 de 95 secciones (70,0%) coincidieron perfectamente. El índice mapeó con precisión las disposiciones estándar, como "Fusiones y ventas de activos", como altamente graficables, al tiempo que identificó correctamente los "Términos contables" y los Anexos estándar estándar como de bajo rendimiento. No hubo discrepancias entre las calificaciones reales y previstas del índice.

Sin embargo, encontramos que 29 secciones (~30%) se marcaron como Sección Nueva y, por lo tanto, se identificaron como Brechas de Cobertura. Tras una revisión, se encontró que, si bien muchas eran cláusulas administrativas muy específicas (por ejemplo, “Anticipos prorrateados”, “Notificación de anticipos”) y, por lo tanto, se dejaron correctamente como espacios en blanco, varias secciones genéricas (como “Tipos de anticipos”, “Cumplimiento de ERISA” y “Fechas de pago de intereses; base de intereses y tarifas”) deberían agregarse al índice. En función de su rendimiento real evaluado, agregué estas cláusulas específicas a los niveles "Medio" y "Bajo" del índice de graficabilidad y enriquecí la línea de base para la siguiente fase.

El resultado más importante es que incluso con este índice de referencia sin procesar, el índice predijo con éxito como ruido 36.880 caracteres de texto, que comprenden un rendimiento "bajo" y "muy bajo". Y, por lo tanto, podría haber resultado en una reducción del 16,10 % en la carga útil de procesamiento del LLM si no se hubieran enrutado al LLM.

La calidad del partido y la eficiencia de la predicción del rendimiento se resumen a continuación:

Calificaciones coincidentesNúmero de seccionesTotal de caracteres% del documento totalMuy alto1361,36026.79%Alto1383,04036.26%Medio1727,84012.16%Bajo1512,8005.59%Muy bajo824,08010.51%Calificación no coincidente000.00%Nuevo Sección2919,9208.70%TOTAL95229,040100.00%

A continuación se muestran algunas filas de la tabla base de comparación por secciones:

Encabezado de sección de ID de nodo Aprox. Caracteres Entidades (Est.) Relaciones (Est.) Calificación real Calificación prevista (Coincidencia de índice) Calidad de coincidencia 0002 Sección 1.01 Definiciones 44 400 252 402 Muy alta Muy alta (Definiciones) 🟢 0003 Sección 1.02 Términos y determinaciones contables 320 4 4 Baja Baja (Términos contables) 🟢 0004 Sección 1.03 Tipos de Anticipos 800 19 2 Bajo Nuevo Tramo ⚪ 0006 Tramo 2.01 La Instalación 2,320 27 21 Alto Alto (La Instalación) 🟢 0007 Tramo 2.02 Anticipos Tatuables 3,840 56 19 Muy Alto Nuevo Tramo ⚪

Finalmente aquí hay algunos ejemplos de extracción:

– **Garantía de la Empresa (Muy Alta)**: – *Entidades*: Garante, Agente, Obligaciones – *Relaciones*: [Garante]-(garantiza)->[Obligaciones], [Garante]-(indemniza)->[Agente] – **Fusiones y Ventas de Activos (Muy Alta)**: – *Entidades*: Prestatario, Activos, Comprador – *Relaciones*: [Prestatario]-(vende)->[Activos], [Prestatario]-(se fusiona_con)->[Comprador] – **Adelantos prorrateados (muy altos)**: – *Entidades*: Anticipo, Prestamista, Prestatario – *Relaciones*: [Prestamista]-(hace)->[Adelanto], [Prestatario]-(recibe)->[Adelanto] – **Método de pago (Bajo)**: – *Entidades*: Agente, Cuentas, Fondos – *Relaciones*: Ninguna (instrucciones de procedimiento puramente administrativas con mínimas ventajas relacionales activas)

Fase 2: Acuerdo de crédito de AT&T (refinamiento)

A continuación, implementamos el índice enriquecido contra el Acuerdo de Crédito de AT&T. El documento contenía 77 secciones que abarcaban aproximadamente 214.000 caracteres.

Los resultados mostraron una mejora significativa. 55 de 77 secciones (71,4%) lograron una alineación perfecta, que es casi idéntica a la de Emerson. Además, hubo 4 secciones que no coincidían, donde las calificaciones de graficabilidad reales y previstas no coincidían. Esto es sólo alrededor del 5% y, por lo tanto, no se ajusta en el índice para evitar un sobreajuste en función de cada documento. Sólo 18 secciones (23,4%) resultaron en brechas de cobertura, lo que representó una mejora con respecto al 30% de Emerson. Y todos fueron considerados Ruido Procesal/A medida desde el punto de vista de KG: cálculo de períodos de tiempo, extensión de la fecha de terminación, subordinación, etc. Estas son secciones de bajo o muy bajo rendimiento desde la perspectiva de NER y deben agregarse al índice para evitar que el LLM las escanee en busca de un nuevo documento. Sin embargo, para comprobar la solidez del experimento, no los agregué al índice para ver cómo se desempeña el índice existente en comparación con el documento TRoadhouse.

Los ahorros potenciales en el LLM aumentaron dramáticamente. Debido a que el índice identificó con seguridad grandes regiones del documento como de bajo rendimiento (por ejemplo, determinación de la tasa de interés, aumento de costos, etc. además del índice y los anexos finales), el sistema marcó 72,763 caracteres como que no valía la pena escanear. Siguiendo este índice en producción, se podría lograr una reducción del 33,94 % en la carga de procesamiento y, al mismo tiempo, extraer todas las ventajas relacionales de alto valor del documento.

La calidad del partido y la eficiencia de la predicción del rendimiento se resumen a continuación:

Calificaciones coincidentesNúmero de seccionesTotal de caracteres% del documento totalMuy alto553,52024.96%Alto941,84019.51%Medio1520,0009.33%Bajo1210,9605.11%Muy bajo1461,80328.83%Calificación no coincidente44,8802.28%Nuevo Sección1821,3979.98%TOTAL77214,400100.00%

Algunas de las filas de la tabla de análisis de calificación de la sección son las siguientes:

Encabezado de sección de ID de nodo Aprox. Caracteres Entidades (Est.) Relaciones (Est.) Calificación real Calificación prevista (Coincidencia de índice) Calidad de coincidencia 0017 SECCIÓN 2.12. Pagos y Cómputos 1,520 21 5 Baja Baja (Pagos y Cómputos) 🟢 0018 SECCIÓN 2.13. Impuestos 3,360 14 10 Medio Medio (Impuestos) 🟢 0019 SECCIÓN 2.14. Pagos compartidos, etc. 800 8 6 Bajo Bajo (Pagos compartidos) 🟢 0020 SECCIÓN 2.15. Constancia de Deuda 640 10 2 Baja Baja (Constancia de Deuda) 🟢 0021 SECCIÓN 2.16. Uso de los Ingresos 320 8 4 Alto Alto (Uso de los Ingresos) 🟢 0022 SECCIÓN 2.17. Incremento de los Compromisos Agregados 2.800 22 9 Mediano Nuevo Tramo ⚪ 0023 ARTÍCULO 2.18. Prórroga Fecha de Terminación 3,120 20 25 Media Nueva Sección ⚪ 0024 SECCIÓN 2.20. Reemplazo de Prestamistas 1,920 19 12 Medio Medio (Reemplazo de Prestamistas) 🟢 0025 ARTÍCULO 2.21. Configuración de reemplazo de referencia 12,560 61 31 Alto Alto (Configuración de reemplazo de referencia) 🟢

Y aquí hay algunos ejemplos de extracción:

– **Ciertos términos definidos (muy altos)**: – *Entidades*: tasa base, margen, SOFR – *Relaciones*: IS_A, PART_OF, CONTROLS, ROLE_OF, REFERENCES (Las definiciones forman la columna vertebral de la ontología, creando una normalización de entidades canónicas y una herencia semántica robusta) – **Condiciones precedentes (medianas)**: – *Entidades*: fecha de cierre, certificados, aprobaciones – *Relaciones*: [Prestamista]-(requiere)->[Certificados], [Agente]-(recibe)->[Aprobaciones] – **Términos contables; Disposiciones interpretativas (bajas)**: – *Entidades*: PCGA, principios de contabilidad – *Relaciones*: Ninguna (disposiciones puramente administrativas e interpretativas con mínimas ventajas relacionales activas

Fase 3: Acuerdo de crédito TRoadhouse (la prueba final)

Aunque utilizamos sólo el primer documento para enriquecer el índice de graficabilidad, probemos el acuerdo de crédito de TRoadhouse y veamos el resultado. Antes de hacer eso, es pertinente considerar algunas diferencias, no sólo entre los documentos, sino también entre el dominio y la industria. Emerson y AT&T son proveedores de telecomunicaciones y servicios públicos de primera línea muy grandes, mientras que Texas Roadhouse es una cadena de restaurantes de tamaño mediano. Los acuerdos de Emerson y AT&T se leen como un documento de tesorería corporativa soberana basado en calificaciones de agencias de crédito, mientras que el acuerdo de Texas Roadhouse es altamente personalizado, construido específicamente en torno al arrendamiento de restaurantes. En términos de tamaño, con 434.000 caracteres, este documento tiene casi el tamaño de los dos anteriores combinados, con más de 100 secciones en el árbol de estructura. En otras palabras, si el índice de graficabilidad funciona bien aquí, la premisa de que la estructura del documento puede considerarse un predictor preciso del rendimiento de entidades y relaciones quedará probada más allá de toda duda.

Y aquí están los resultados. El índice tuvo un desempeño excepcionalmente bueno. 81 de 102 secciones (79,4%) coincidían perfectamente con el índice. No hubo secciones donde la calificación real no coincidiera con la prevista. El modelo categorizó perfectamente secciones cruciales como “Cartas de crédito” y “Convenios afirmativos/negativos” estándar como de alto rendimiento, lo que debería desencadenar una extracción total. Las 21 secciones restantes (20,6%), clasificadas como Brechas de cobertura, eran una mezcla de cláusulas administrativas de bajo rendimiento (por ejemplo, redondeo, pagos erróneos) y ruido procesal (por ejemplo, divisiones, compromisos, etc.).

Sin embargo, el verdadero impacto estuvo en la eficiencia de la carga útil. Además de los Anexos, se identificaron varias secciones de bajo rendimiento, como términos contables, redondeo, agente administrativo, etc. Los Anexos fueron analizados en base a su valor individual. Si bien algunas listas, como Gravámenes e Inversiones, coincidieron con la calificación del índice de Alta, otras, como las LC existentes, se clasificaron como brechas.

El total Bajo + Muy Bajo confirma un ahorro neto del 38% al seguir las predicciones y omitir esas secciones por completo. Esto afirma la viabilidad del enfoque.

Aquí está la tabla de eficiencia del procesamiento de rendimiento:

Calificaciones coincidentesNúmero de seccionesTotal de caracteres% del documento totalMuy alto11128,84029.64%Alto1230,3206.98%Medio2025,0005.75%Bajo179,5202.19%Muy bajo21155,00035.66%Calificación no coincidente000.00%Nuevo Sección2185,96019.78%TOTAL102434,640100.00%

A continuación se muestran algunos ejemplos de calificaciones de secciones:

Encabezado de sección de ID de nodo Aprox. Chars Entidades (Est.) Relaciones (Est.) Calificación real Calificación prevista (Coincidencia de índice) Calidad de concordancia 0104 7.14 Convenios financieros 720 12 1 Muy alta Muy alta (Convenios financieros) 🟢 0105 8.01 Eventos de incumplimiento 3200 30 21 Medio Medio (Eventos de incumplimiento) 🟢 0108 Artículo 9: AGENTE ADMINISTRATIVO (Agregado) 4,880 2 0 Bajo Bajo (Deberes del Agente) 🟢 0119 Artículo 10: VARIOS (Agregado) 18,000 2 0 Muy Bajo Muy Bajo (Varios) 🟢 0144 Anejo 2.01A Compromisos 4,000 2 0 Muy Alto Muy Alto (Compromiso) Anexo) 🟢 0145 Anexo 2.01BL/C Compromisos 2,000 2 0 Muy Bajo Nueva Sección ⚪ 0146 Anexo 2.03 Cartas de Crédito Existentes 3,000 3 0 Muy Bajo Nueva Sección ⚪ 0147 Anexo 5.01 Jurisdicciones 6,000 2 0 Muy Bajo Nueva Sección ⚪ 0159 Anexo 5.06 Litigios 5.000 2 5 Muy Alto Muy Alto (Litigios) 🟢 0161 Anejo 5.09 Ambiental 8.000 2 5 Muy Alto Muy Alto (Asuntos Ambientales) 🟢 0163 Anejo 5.13 Subsidiarias 40.000 2 5 Muy Alto Muy Alto (Subsidiarias) 🟢

Y finalmente unos cuantos ejemplos de extracción:

– **Convenios financieros (muy alto)**: – *Entidades*: Prestatario, índice de apalancamiento, índice de cobertura de cargo fijo – *Relaciones*: [Prestatario]-(mantiene)->[Relación de apalancamiento] – **Inversiones y gravámenes (alto)**: – *Entidades*: Prestatario, gravamen, propiedad, inversiones permitidas – *Relaciones*: [Prestatario]-(concede)->[Gravamen], [Prestatario]-(realiza)->[Inversiones permitidas] – **Términos definidos (muy altos)**: – *Entidades*: Término ajustado SOFR, tasa base, prestamista moroso – *Relaciones*: IS_A, PART_OF, CONTROLS, ROLE_OF, REFERENCES (Las definiciones forman la columna vertebral de la ontología, creando una normalización de entidad canónica y robusta herencia semántica)

Conclusión

Los canales de Knowledge Graph actuales son fundamentalmente ineficientes. Obligamos a los costosos LLM a escanear corpus empresariales completos a pesar de que solo una fracción de esos documentos contiene inteligencia relacional significativa.

Este artículo demostró que la estructura del documento en sí misma puede servir como un fuerte predictor del rendimiento de la extracción de gráficos.

Al combinar la comprensión estructural de Proxy-Pointer con Graphability Indexing, podemos cambiar la ingesta de KG del escaneo semántico de fuerza bruta al enrutamiento estructural dirigido. En lugar de procesar repetidamente acuerdos completos de 500.000 caracteres, el sistema aprende qué regiones de una familia de documentos producen constantemente entidades y relaciones valiosas, y cuáles son en gran medida ruido repetitivo. Podemos simplemente ignorar el ruido por completo, sin utilizar soluciones alternativas como un LLM más pequeño para reducir costos.

A través de tres grandes acuerdos crediticios del mundo real de diferentes industrias, el índice se estabilizó rápidamente después de solo unas pocas iteraciones y logró consistentemente importantes reducciones de carga útil al tiempo que preservaba la extracción relacional de alto valor.

Más importante aún, esto apunta a realinear nuestra visión de la arquitectura de extracción. En lugar de tratar los documentos como flujos de texto plano, Proxy-Pointer los trata como árboles semánticos estructurados capaces de predecir dónde es probable que exista conocimiento significativo incluso antes de que comience la extracción.

A medida que los sistemas empresariales GraphRAG escalan a través de millones de contratos, presentaciones, políticas y acuerdos, este tipo de ingesta consciente de la estructura puede ayudar a hacer que la construcción de Knowledge Graph a gran escala sea operativamente sostenible.

Repositorio de código abierto

Proxy-Pointer es completamente de código abierto (licencia MIT) y se puede acceder a él desde el repositorio de Proxy-Pointer Github. Puede instalarlo con un solo comando pip utilizando el instalador del paquete.

Clona el repositorio. Pruebe sus propios documentos. Déjame saber tus pensamientos.

Conéctese conmigo y comparta sus comentarios en www.linkedin.com/in/partha-sarkar-lets-talk-AI

Los acuerdos de crédito utilizados aquí están disponibles públicamente en SEC.gov. El código y los resultados de las pruebas comparativas son de código abierto bajo la licencia MIT. Las imágenes utilizadas en este artículo se generan con Google Gemini.