A medida que las organizaciones adoptan análisis impulsados por IA, el valor de una respuesta en lenguaje natural (Text2SQL) es tan bueno como el contexto empresarial detrás de ella. Estamos entrando en una fase en la que la riqueza semántica (descripciones y relaciones de tablas y columnas) debe fluir directamente desde donde se creó en los catálogos de datos y herramientas semánticas ascendentes hacia los productos de IA que sirven a los usuarios finales. Productos como Amazon Quick ya no pueden funcionar de forma aislada. Necesitan consumir y razonar de forma nativa sobre las definiciones, relaciones y metadatos de gobernanza que los equipos de datos seleccionan en sistemas como AWS Glue Data Catalog y Databricks Unity Catalog. Este cambio de metadatos aislados a una IA conectada y con reconocimiento de catálogos es lo que permite el análisis inteligente a escala.
El desafío: salvar la última milla
La inversión está hecha.
Los equipos de datos empresariales han hecho el trabajo duro. Han invertido mucho en plataformas de catálogos ascendentes como AWS Glue, Databricks Unity Catalog, Snowflake Horizon, Collibra y dbt. En estas plataformas, definen meticulosamente descripciones de tablas, semántica de columnas, relaciones de claves primarias y externas, términos de glosario y definiciones de métricas.
Sin embargo, cuando se trata de permitir a los usuarios finales (como gerentes de ventas, directores de marketing y líderes financieros) IA lista para producción y paneles confiables, sigue existiendo una brecha significativa.
Tres desafíos complejos
Cuando los curadores de datos (ingenieros de inteligencia empresarial, líderes de análisis y analistas senior) necesitan habilitar a sus usuarios comerciales en Amazon Quick, enfrentan tres desafíos complejos:
Capacidad de descubrimiento limitada: con miles de tablas en catálogos empresariales, descubrir los activos upstream correctos que estén seleccionados y aprobados para la generación de informes es un problema de aguja en un pajar. No hay forma de describir lo que necesita y hacer que el sistema lo encuentre. Fragmentación semántica y recreación manual: los metadatos enriquecidos que ya existen en sentido ascendente (descripciones comerciales en tablas y columnas, y relaciones de claves primarias y externas) no fluyen. Los curadores deben recrear activos desde cero, redefinir descripciones y conciliar definiciones manualmente. ¿Significa “ingresos” brutos o netos? ¿“Cliente activo” significa una compra dentro de los 30 o 90 días? Estas definiciones existen en sentido ascendente pero requieren un reingreso manual. Tiempo para obtener información en semanas, no en horas: la combinación de descubrimiento manual y recreación manual significa que el tiempo desde los datos hasta la información procesable se extiende de horas a semanas. Peor aún, cuando las definiciones ascendentes cambian, la semántica creada manualmente en Quick Datasets se vuelve obsoleta, lo que provoca una deriva semántica que erosiona la confianza en las respuestas y los paneles de la IA con el tiempo.
la brecha
El problema no es aguas arriba. Los metadatos existen. La gobernanza está definida. Las relaciones están mapeadas.
El problema es el último kilómetro: traducir ese rico contexto del catálogo en una experiencia curada y consumible que ofrezca respuestas de IA fundamentadas y paneles de control deterministas en los que los usuarios finales puedan confiar.
Presentamos la experiencia del catálogo Agentic en Amazon Quick
Hoy anunciamos la experiencia Agentic Catalog en Amazon Quick, un flujo de trabajo impulsado por IA que ayuda a los curadores de datos a definir rápidamente sus límites de contexto, heredar la semántica ascendente y permitir a los usuarios finales realizar preguntas y respuestas fundamentadas y paneles confiables a escala.
En el centro de esta experiencia se encuentra Quick Agent, enfocado a tareas de descubrimiento, creación y herencia dentro del contexto del catálogo. Utiliza el contexto semántico de la conexión del catálogo para resumir todo el catálogo de un vistazo, involucrar al cliente en una conversación en lenguaje natural, mostrar las tablas y relaciones más relevantes según el caso de uso del cliente y evaluar la preparación de los metadatos. Luego, con una única confirmación conversacional, crea automáticamente conjuntos de datos y temas generados por catálogo con metadatos específicos heredados del catálogo ascendente.
Sin configuración manual. Sin cambio de contexto. Sin semanas de configuración.
como funciona
Descubrimiento de recursos del lenguaje natural
En lugar de desplazarse por miles de tablas para encontrar las adecuadas, los curadores utilizan un lenguaje natural. Con Agentic Catalog Experience, los curadores describen lo que necesitan:
Curador: "Soy analista senior en el equipo de finanzas. Necesito tablas para informes de ingresos trimestrales y análisis de costos".
Quick Agent busca en todo su catálogo para mostrar las tablas más relevantes al instante, utilizando todos los metadatos disponibles, incluidas descripciones comerciales, etiquetas, clasificaciones Oro/Plata/Bronce, puntajes de calidad, puntajes de estado de las tablas y términos del glosario. No más navegación manual. No más conjeturas.
Creación masiva de conjuntos de datos agentes
Después de que el curador selecciona sus tablas, Quick Agent crea representaciones de catálogo (conjuntos de datos) a escala en un único flujo de trabajo guiado. Su catálogo ascendente sigue siendo la fuente de verdad porque la ruta de creación predeterminada es Consulta directa. Los conjuntos de datos con semántica heredada se marcan con una insignia clara de "Semántica heredada" y sus metadatos son de solo lectura. Los autores pueden actualizar los metadatos heredados a pedido eligiendo el botón de sincronización para mantenerse alineados con su catálogo.
Agente rápido: "Creando 6 conjuntos de datos generados por catálogo ahora: ingresos_por_región creados (DirectQuery, metadatos de solo lectura), centros_de costos creados y gl_transacciones creadas".
Herencia semántica y relacional.
Quick Agent transfiere metadatos específicos de su catálogo a los activos que crea. Hoy en día, la herencia se centra deliberadamente en dos áreas clave para evitar el ruido y mantener limpios los conjuntos de datos:
Definiciones de tablas y columnas para conjuntos de datos: las descripciones comerciales y las definiciones de columnas se heredan directamente en los conjuntos de datos creados, de modo que los curadores y los usuarios finales tengan el contexto semántico que necesitan. Relaciones de clave primaria y externa con los temas: el agente detecta relaciones y las utiliza para sugerir y crear construcciones de conjuntos de datos múltiples (temas) con uniones de esquemas de estrella y copo de nieve preconfiguradas.
Nota: Si bien todos los metadatos disponibles (clasificaciones Oro/Plata, puntajes de calidad, etiquetas y puntajes de estado) se utilizan durante el descubrimiento para encontrar las tablas correctas, la herencia en conjuntos de datos se limita intencionalmente a las definiciones de tablas y columnas actuales. Planeamos agregar más tipos de metadatos a los conjuntos de datos con el tiempo.
Agente rápido: "Detecté 3 relaciones entre estas tablas y creé un tema llamado 'Modelo de ingresos financieros' con las uniones de esquema en estrella preconfiguradas. Las definiciones de tablas y columnas se han heredado del catálogo ascendente".
Consumo inmediato
Los conjuntos de datos y temas seleccionados están listos para su uso de inmediato:
Haga preguntas: inicie una conversación de preguntas y respuestas con sus nuevos conjuntos de datos. El agente de IA utiliza descripciones comerciales, términos de glosario y puntajes de calidad heredados para brindar respuestas fundamentadas. Cree paneles: cree visualizaciones deterministas con un contexto semántico completo ya implementado. Comparta con usuarios finales: agregue conjuntos de datos a un espacio y compártalos con usuarios comerciales para realizar preguntas y respuestas de autoservicio.
Después de la creación, los metadatos vinculados a estos conjuntos de datos y temas se ingresan en el almacén semántico de Amazon Quick, que impulsa la reclasificación y el contexto unificado para preguntas y respuestas basadas en IA. Pasar de la conexión del catálogo a la primera pregunta comercial lleva minutos, no semanas.
Arquitectura: consumidor, no catálogo
Un principio de diseño clave sustenta esta experiencia: Amazon Quick es un consumidor de metadatos de catálogos ascendentes, no un catálogo dedicado en sí. Esto significa:
Sin duplicación de datos: los conjuntos de datos generados por catálogos utilizan DirectQuery. No se copian ni mueven datos. Metadatos consumidos para el contexto: la semántica heredada es de solo lectura en Amazon Quick y fluye hacia el almacén semántico para impulsar la reclasificación y la conexión a tierra de las respuestas de IA. Su catálogo ascendente sigue siendo la fuente autorizada. Sincronización semántica manual: los autores pueden actualizar los metadatos heredados a pedido eligiendo el botón de sincronización. La sincronización automática programada está en la hoja de ruta. Extensibilidad con transparencia: los conjuntos de datos generados por catálogos muestran la semántica heredada como de solo lectura (marcada como representaciones de catálogo). Si un autor elige editar un conjunto de datos, Amazon Quick proporciona una notificación clara de que la edición crea un conjunto de datos personalizado y que la sincronización semántica ya no se aplica. Esto brinda a los autores control total y al mismo tiempo preserva la integridad del catálogo de forma predeterminada.
Catálogos soportados hoy
Plataforma de catálogo Autenticación AWS Glue Catálogo de datos AWS Identity and Access Management (IAM) Función ARN Databricks Unity Catalog OAuth 2.0/Token de acceso personal
Próximamente habrá soporte para plataformas de catálogo adicionales.
lo que se hereda
La herencia de metadatos se centra intencionalmente en mantener los conjuntos de datos limpios y listos para producción:
En conjuntos de datos (definiciones de tablas y columnas)
Tabla de descripciones comerciales y técnicas. Descripciones de columnas y nombres para mostrar. Tipos de datos y nulidad. Glosario de términos y sinónimos.
En temas (relaciones)
Relaciones de clave primaria y externa. Definiciones de relaciones y cardinalidad. Modelos de esquemas de estrella y copo de nieve.
La experiencia del usuario final
Esto es lo que esto significa para los usuarios empresariales posteriores:
Un gerente de ventas pregunta: "¿Cuáles fueron nuestras ventas del cuarto trimestre por región?"
Detrás de escena, el agente de IA:
Busca conjuntos de datos generados por catálogos utilizando descripciones comerciales y términos de glosario. Identifica la tabla sales.revenue_by_product (Oro, 98 por ciento de calidad). Aplica uniones preconfiguradas del tema para combinar dimensiones relevantes. Respeta las reglas de enmascaramiento de información de identificación personal (PII) de los metadatos del catálogo. Devuelve una respuesta confiable y fundamentada en segundos.
No se requiere configuración manual del conjunto de datos. El curador definió el límite del contexto una vez con Quick Agent y cada usuario final se beneficia de inmediato.
Contexto empresarial unificado
La experiencia del catálogo Agentic no existe de forma aislada. Combinado con las capacidades más amplias de la plataforma de Amazon Quick (incluida la integración con Slack, Outlook, documentos y bases de conocimiento), los usuarios finales obtienen el contexto empresarial completo:
Datos estructurados de catálogos a través de conjuntos de datos generados por catálogos. Contexto no estructurado de documentos, mensajes de correo electrónico y conversaciones. Reglas de negocio a partir de términos de glosario y definiciones de métricas.
Este contexto unificado permite respuestas de IA listas para producción, basadas en la semántica y los datos específicos de su organización.
Conexión al catálogo de datos de AWS Glue
Para comenzar con la experiencia de Agentic Catalog, cree una conexión de origen de datos a su catálogo de datos de AWS Glue en Amazon Quick. Después de establecer la conexión, Quick Agent lo guía a través del descubrimiento, la exploración de esquemas y la creación de temas en un único flujo de trabajo conversacional. En este tutorial, nos conectamos a un catálogo de datos de Glue y creamos un tema de análisis financiero.
En Amazon Quick, cree una nueva fuente de datos. En la lista de tipos de conexión, seleccione Catálogo de datos de Glue (disponible en vista previa) y luego elija Siguiente. Esta conexión es para los metadatos. Con él, Amazon Quick puede consumir las definiciones de tablas y columnas y las relaciones que sus equipos ya han seleccionado en AWS Glue.
Figura 1: Selección del tipo de conexión del catálogo de datos de Glue en Amazon Quick
Una conexión de Glue Data Catalog funciona junto con una conexión de Amazon Athena. Glue proporciona los metadatos y Athena proporciona la ruta de consulta a los datos en Amazon Simple Storage Service (Amazon S3). Cree también la fuente de datos de Athena, para que Amazon Quick pueda ejecutar consultas en los datos subyacentes. Después de crear ambos, la página Fuentes de datos muestra las dos entradas una al lado de la otra: la fuente de Glue Data Catalog para los metadatos y la fuente de Athena para los datos.
Figura 2: El catálogo de datos de Glue y las fuentes de datos de Athena enumeradas juntas
Abra la página de detalles de la fuente de datos de GDC-Demo. En Conexiones de datos, puede ver la fuente de datos de Athena vinculada que utiliza Amazon Quick para consultar los datos. Elija Explorar datos para iniciar Quick Agent con alcance en esta fuente de datos.
Figura 3: Inicio de Quick Agent desde la página de detalles de la fuente de datos
El panel Quick Agent se abre en el lado derecho de la pantalla, con un alcance automático en la fuente de datos del catálogo de datos de Glue. Se selecciona el modo "Datos específicos", con "GDC-Demo" fijado como límite de contexto. Como resultado, el Agente muestra solo metadatos de esta conexión de catálogo específica.
Figura 4: Quick Agent con ámbito de conexión de catálogo específico
Pídale al Agente que explore su catálogo. El Agente resume los catálogos y bases de datos disponibles de un vistazo, para que pueda ver rápidamente lo que está seleccionado en su Catálogo de datos de Glue. Para esta publicación, utilizamos la base de datos "fa-demo" como ejemplo, un esquema en estrella de demostración de Finance Analytics para análisis bancario. Este tutorial ilustra cómo funciona la característica y no es un escenario exacto, por lo que puede aplicar los mismos pasos a su propio catálogo.
Figura 5: El Agente que resume los catálogos y bases de datos disponibles
Pídale al Agente que explore la base de datos de fa-demo. El Agente identifica un esquema en estrella clásico con 7 tablas: 2 tablas de hechos (fact_transactions y fact_loans) y 5 tablas de dimensiones (dim_account, dim_date_transactions, dim_date_loans, dim_merchant y dim_txn_category). Todos se almacenan como tablas externas en Amazon S3. El Agente reconoce que el esquema cubre transacciones de cuentas de clientes y carteras de préstamos, con dimensiones de soporte para comerciantes, categorías de transacciones y jerarquías de fechas.
Figura 6: El agente identifica las tablas de hechos y dimensiones en la base de datos de demostración fa-demo
Pídale al Agente que cree un diagrama de esquema en estrella para la demostración fa. El Agente analiza las tablas, identifica las relaciones de clave primaria y externa y presenta un modelo de datos lógico completo con un resumen del esquema. Destaca que dim_account es la dimensión conformada compartida que conecta ambas tablas de hechos. Elija Crear conjuntos de datos y tema para permitir que el Agente cree todo automáticamente.
Figura 7: El modelo de datos lógico generado para el esquema fa-demo
El Agente crea un Tema completamente configurado con todos los Conjuntos de Datos y relaciones implementadas. En este ejemplo, crea el tema "Análisis financiero" con los siete conjuntos de datos de la base de datos de demostración fa-demo y 6 uniones de esquemas en estrella preconfigurados. Cada conjunto de datos lleva su descripción comercial heredada y las relaciones de unión entre las tablas de hechos y dimensiones se validan automáticamente. El tema está listo de inmediato para preguntas y respuestas en lenguaje natural, por lo que puede hacer preguntas como "¿Cuál es el monto total de la transacción por categoría de comerciante?" o “Muéstrame préstamos morosos por clasificación de riesgo”.
Figura 8: El tema de análisis financiero completamente configurado
Ahora, veamos cómo funciona en acción el tema de análisis financiero creado a partir del catálogo de datos de Glue. Con el tema fijado como contexto, los usuarios finales pueden hacer preguntas en un lenguaje sencillo y obtener respuestas fundamentadas al instante. Por ejemplo, un usuario puede preguntar "Monto total de la transacción por categoría de comerciante" y el Agente devuelve un desglose clasificado con aspectos destacados clave. Luego, el usuario puede hacer un seguimiento de "Préstamos morosos por clasificación de riesgo" para ver un resumen del nivel de riesgo con información valiosa. Debido a que los conjuntos de datos y las relaciones se heredaron del catálogo, cada respuesta está respaldada por el esquema confiable, las uniones y las definiciones comerciales definidas en sentido ascendente. Este es el poder de la experiencia de Agentic Catalog: los curadores definen el límite del contexto una vez y cada usuario final puede explorar los datos de forma conversacional desde allí.
Figura 9: Hacer preguntas en lenguaje natural sobre el tema de análisis financiero
Conexión al catálogo de Databricks Unity
La misma experiencia funciona con Databricks Unity Catalog. A continuación se muestra un ejemplo rápido que muestra el flujo completo, desde la configuración de la conexión hasta la creación de conjuntos de datos y un tema.
Cree un origen de datos de Databricks Unity Catalog y luego elija Explorar datos para iniciar Quick Agent. El Agente resume el catálogo y con una sola confirmación crea los Datasets y un Topic con las uniones de esquema en estrella ya configuradas.
Figura 10: Creación de conjuntos de datos y un tema del catálogo de Databricks Unity
Una vez que el tema esté listo, los usuarios finales pueden hacer preguntas complejas que abarquen varias tablas relacionadas. En este ejemplo, el Agente responde "Las 5 marcas principales por ingresos por región" uniéndose a través de las relaciones de Tema y arroja un resultado visual fundamentado.
Figura 11: Responder una pregunta de varias tablas a través de relaciones de temas
El resultado
Los curadores brindan datos confiables, contexto empresarial completo y paneles y respuestas de IA listos para producción en una fracción del tiempo. Los usuarios finales obtienen respuestas fundamentadas en las que pueden confiar, respaldadas por datos estándar con linaje semántico completo.
Desde semanas de configuración manual hasta minutos de conversación guiada.
Esa es la experiencia de Agentic Catalog en Amazon Quick.