Del lago de datos al análisis listo para IA: presentación de una nueva fuente de datos con S3 Tables en Amazon Quick

Hoy en día, las organizaciones buscan cada vez más combinar análisis e inteligencia artificial para acelerar el conocimiento y la toma de decisiones. Amazon Quick, un servicio unificado de análisis e inteligencia de decisiones impulsado por IA, reúne visualización de datos, interacción de lenguaje natural y automatización impulsada por agentes en una experiencia única y gobernada. Con esto, los usuarios empresariales pueden explorar datos, generar conocimientos y tomar medidas sin necesidad de experiencia especializada en aprendizaje automático (ML).

Al mismo tiempo, las arquitecturas de datos modernas están evolucionando hacia lagos de datos escalables construidos en formatos de tablas abiertas como Apache Iceberg, que ofrecen rendimiento, rentabilidad y gobernanza mejorados. Sin embargo, el análisis de datos a gran escala a menudo requiere trasladarlos a almacenes de datos o sistemas OLAP, lo que introduce latencia, costos adicionales y complejidad operativa. Aunque los modos de consulta existentes, como Direct Query y SPICE (motor de cálculo en memoria, paralelo y súper rápido) con almacenes de datos, abordan la mayoría de las necesidades de análisis, los clientes continúan buscando una forma más fluida de analizar grandes conjuntos de datos en tiempo real directamente desde sus lagos de datos.

Para solucionar este problema, Amazon Quick presenta Amazon S3 Tables (tablas de Apache Iceberg) como una nueva fuente de datos. Con esta característica, los clientes pueden consultar y visualizar directamente las tablas de Apache Iceberg almacenadas en un depósito de tablas de Amazon S3 sin la necesidad de capas de datos intermedias. Este enfoque proporciona opciones arquitectónicas adicionales, especialmente cuando los clientes requieren reducir el movimiento de datos, mejorar el rendimiento y mantener una única fuente de verdad segura y gobernada.

En esta publicación, exploramos cómo Amazon Quick y S3 Tables funcionan juntos para permitir análisis casi en tiempo real y optimizar las arquitecturas de datos modernas.

Beneficios de conectarse directamente con S3 Tables:

Los modos Direct Query y SPICE para tablas S3, una nueva característica de Amazon Quick, permiten el consumo directo de tablas Apache Iceberg en el depósito de tablas de Amazon S3 sin requerir capas de consulta intermedias. Esta característica es beneficiosa para las empresas que buscan implementar una arquitectura de datos moderna utilizando el formato de tabla abierta Apache Iceberg para tratar su lago de datos como una "fuente central de verdad", lo que permite análisis de alto rendimiento sin una canalización de datos compleja y la sobrecarga de mover datos entre sistemas dispares.

Los beneficios clave incluyen:

Arquitectura optimizada
Elimina la necesidad de almacenes de datos separados o capas OLAP al permitir la consulta directa de datos en el lago de datos, lo que reduce la complejidad operativa y la sobrecarga de infraestructura. Información casi en tiempo real
Minimiza el movimiento de datos y las dependencias de canalización, garantizando que los paneles y análisis reflejen los datos más actuales disponibles. Rendimiento escalable
Admite la consulta de conjuntos de datos a gran escala almacenados en el depósito de tablas de Amazon S3 sin requerir curación, replicación o restricciones de tamaño de datos, lo que permite una escalabilidad perfecta.

Descripción general de la solución

Con este nuevo lanzamiento, Amazon Quick ahora admite consultas de lagos de datos mediante el modo SPICE o Direct Query. En esta publicación, nos centramos en el modo de consulta directa, aunque puedes elegir el modo SPICE al crear tu conjunto de datos.

Esta solución permite análisis y toma de decisiones casi en tiempo real para AnyCompany Corp., una organización global de servicios financieros que maneja transacciones con tarjeta en múltiples regiones. Los datos de las transacciones se generan a partir de diversas fuentes, incluidos sistemas de puntos de venta, aplicaciones de banca móvil, dispositivos de pago habilitados para IoT y pasarelas en línea. Para abordar la necesidad de detección de fraude, monitoreo de la tasa de aprobación y acceso rápido a información procesable, la solución utiliza una combinación de ingesta de datos en streaming, lagos de datos en formato de tabla abierta y análisis impulsados ​​por IA.

Los eventos de transacción se transmiten a Amazon Kinesis Data Streams y se entregan mediante Amazon Data Firehose en un depósito de tablas de Amazon S3. Con el conector nativo S3 Tables de Quick, los usuarios empresariales pueden consultar el lago de datos casi en tiempo real y analizar datos mediante interacciones de lenguaje natural, eliminando la dependencia del procesamiento por lotes. Puede utilizar este enfoque unificado para descubrir conocimientos como tendencias de fraude regionales y tasas de aprobación al instante, mejorando la visibilidad operativa y respaldando decisiones más rápidas basadas en datos.

Descripción general de la arquitectura

La arquitectura se compone de cuatro capas principales: ingesta, almacenamiento, consultas y análisis de datos. Para esta publicación, nos centramos en la capa de consulta y análisis. Los eventos de transacciones de los sistemas de pago distribuidos se incorporan en tiempo real mediante Amazon Kinesis Data Streams, lo que proporciona una capa de transmisión escalable y de baja latencia. Estos eventos se entregan continuamente a un depósito de tablas de Amazon S3 en formato Apache Iceberg, formando un lago de datos de alto rendimiento que admite cargas de trabajo analíticas y de transmisión. Si bien tradicionalmente los datos se podían consultar a través de Amazon Athena, Amazon Quick permite consultas directas, casi en tiempo real, de tablas S3 y permite el análisis del lenguaje natural impulsado por IA. Los usuarios empresariales pueden explorar conjuntos de datos en vivo, generar visualizaciones y obtener información (como identificar regiones con altas tasas de fraude en la última hora) sin necesidad de experiencia técnica. Esta arquitectura mantiene las decisiones informadas por los datos más actualizados, lo que respalda acciones comerciales rápidas y precisas.

Requisitos previos

Para seguir esta publicación, asegúrese de tener lo siguiente en su lugar:

Su canal de vapor, incluidas las capas de almacenamiento e ingesta de datos, ya está configurado y sus datos están disponibles en un depósito de tablas de Amazon S3. Una suscripción a Amazon Quick Enterprise.

Pasos de implementación

Estos son los pasos para brindar a los usuarios comerciales acceso a sus tablas de Apache Iceberg mediante cargas de trabajo conversacionales y analíticas de Amazon Quick:

Paso 1: Habilite el acceso a datos de S3 Tables para Amazon Quick

Comencemos configurando Amazon Quick para acceder a las tablas S3, de modo que puedan descubrirse automáticamente al crear la fuente de datos.

Seleccione el nombre de su cuenta en la esquina superior derecha y seleccione Administrar cuenta. En el menú de navegación de la izquierda, en Permisos, elija Recursos de AWS. En la sección Permitir acceso y detección automática para estos recursos, seleccione Tablas de Amazon S3. Elija Seleccionar depósitos de tablas de S3, luego elija el depósito de tablas de S3 relevante que contenga los datos de muestra para este blog y haga clic en Finalizar. (Para esta publicación, utilizamos el depósito s3table-datasamples). Asegúrese de que la opción del depósito Amazon S3 esté seleccionada y luego elija Guardar.

Este paso agrega el permiso requerido a su función de Amazon Quick y permite que sus instancias de Amazon Quick descubran con éxito los datos específicos del depósito de la tabla S3 mientras crean una fuente de datos.

Paso 2: cree una fuente de datos de Amazon Quick utilizando tablas S3

Ahora, creemos una fuente de datos de Amazon Quick que apunte al depósito s3table-datasamples. Este depósito contiene dos tablas: dimensión del cliente y eventos_transacción. La tabla de dimensiones del cliente está basada en archivos e incluye información ficticia del cliente bancario, mientras que transaction_events representa datos ficticios de transacciones de tarjetas de crédito asociadas con esos clientes.

Elija Amazon Quick en la esquina superior izquierda para navegar a la página de inicio de Quick. En el menú, seleccione Conjuntos de datos, luego vaya a la pestaña Fuentes de datos y elija Crear fuente de datos. En la siguiente pantalla, seleccione Tablas de Amazon S3 (tablas de Apache Iceberg) como tipo de fuente de datos y luego elija Siguiente. Ingrese un nombre de fuente de datos (por ejemplo, CustomerTrxn-S3Tables) y proporcione el ARN del depósito de la tabla S3. En este ejemplo, es el ARN del depósito s3table-datasamples. Elija Crear fuente de datos.

Verifique que la fuente de datos se haya creado correctamente.

Paso 3: cree un conjunto de datos en Amazon Quick

En este paso, utilizamos la fuente de datos creada anteriormente para crear un conjunto de datos.

Seleccione la fuente de datos (CustomerTrxn-S3Tables) creada en el paso anterior y elija Crear conjunto de datos. Elija el espacio de nombres que se completa automáticamente para su fuente de datos, luego seleccione una tabla de la lista y haga clic en Editar/Vista previa de datos.
En este ejemplo, el espacio de nombres s3table-data contiene dos tablas. Comenzamos con la tabla de dimensiones del cliente. En la pestaña Vista previa, revise los datos extraídos de las tablas S3. Para agregar otra tabla, seleccione Agregar datos en el menú. En este ejemplo, agregaremos la tabla transacciones_eventos. En la pantalla Agregar datos, seleccione Fuente de datos en la lista desplegable. Elija CustomerTrxn-S3Tables en la lista Seleccionar una fuente de datos y luego elija Seleccionar. En la lista de tablas, seleccione eventos_transacción y elija Seleccionar.

Una las dos tablas seleccionando el ícono más (+) al lado de la tabla customer_master y seleccionando Unirse. Configure la unión usando la columna customer_id: seleccione la opción Unión interna. Elija transaction_events como la tabla correcta. Seleccione customer_id de las tablas izquierda y derecha como claves de unión. Proporcione un nombre para la combinación (por ejemplo, TrxnJoin) para ayudar a identificarla cuando trabaje con varias tablas. Asigne un nombre al conjunto de datos en la esquina superior izquierda (por ejemplo, CxTrxn_S3TableData). Asegúrese de que el modo Consulta directa esté seleccionado en la esquina superior derecha. Esto es importante para utilizar completamente el acceso a datos casi en tiempo real desde S3 Tables. Alternativamente, puede elegir el modo SPICE si prefiere actualizaciones de datos programadas en lugar de acceso casi en tiempo real. Elija Guardar y publicar.

Paso 4: interactuar con el conjunto de datos mediante el chat rápido de Amazon

Ahora comencemos a chatear con este conjunto de datos para recopilar información utilizando lenguaje natural. Para ello, utilizamos el chat predeterminado llamado "Mi asistente".

En la página de inicio de Amazon Quick, elija Agentes de chat en el panel de navegación izquierdo y luego Mi asistente. Elija Chat junto a Mi asistente. En Todos los datos y aplicaciones, elija Agregar y seleccione Conjuntos de datos. Luego seleccione el conjunto de datos CxTrxn_S3TableData. Elija Guardar. En el panel de chat, ingrese “Mostrar el número total de transacciones realizadas en lo que va de este mes” y presione Enviar. Observe la respuesta del chat que muestra el recuento total de transacciones del mes actual. A continuación, pidamos al agente que lo desglose por días. En el panel de chat, ingrese "desglosarlo por día usando la marca de tiempo de ingesta" y presione Enviar. Revisar el desglose diario proporcionado por el agente. En nuestro ejemplo, del 1 al 17 de abril.

Paso 5: Demostrar la interacción del usuario en tiempo real con la transmisión de datos

A continuación, probamos la capacidad de respuesta del chat casi en tiempo real mediante la transmisión de nuevos datos de transacciones. En esta demostración, utilizamos AWS Lambda como productor de Kinesis Data Stream y luego almacenamos los datos entrantes en un depósito de tablas S3 como tablas S3, en formato Apache Iceberg usando Firehose. A medida que se transmiten nuevos datos, los recuentos de transacciones se actualizarán automáticamente dentro del chat sin que el usuario final tenga que realizar ninguna acción. Esto demuestra un acceso fluido a los datos casi en tiempo real, sin intervención manual ni arquitectura compleja. Ejecutamos esta función Lambda varias veces para transmitir nuevos datos de eventos transaccionales.

Si está interesado en crear su propia fuente de transmisión para esta demostración, puede consultar la documentación oficial de AWS o las publicaciones relevantes de AWS para obtener orientación detallada.

Ahora revisemos los datos transmitidos recientemente en nuestro agente de chat.

Vuelva a Mi Asistente en la misma sesión de chat, ingrese un nuevo mensaje "Mostrar el número total de transacciones realizadas hasta el momento en este mes, incluir todos los datos de transmisión recientes y desglosarlos por marca de tiempo de ingesta". y presione Enviar. My Assistant consulta el conjunto de datos CxTrxn_S3TableData mediante consulta directa y devuelve los registros recientemente ingeridos del 18 de abril. Esto demuestra que los datos transmitidos recientemente están disponibles sin necesidad de una actualización manual del conjunto de datos.

Limpieza

Si ya no necesita los recursos implementados como parte de esta solución y desea evitar costos continuos, le recomendamos que limpie y elimine los componentes relevantes eliminando todos los recursos relacionados con Amazon Quick y cancelando la suscripción a su cuenta de Amazon Quick.

Conclusión

En esta publicación, exploramos cómo la nueva fuente de datos Amazon S3 Tables de Amazon Quick permite análisis casi en tiempo real y al mismo tiempo optimiza las arquitecturas de datos modernas. Al consultar las tablas de Apache Iceberg directamente en Amazon S3, elimina capas intermedias, reduce el movimiento de datos y preserva una única fuente de verdad gobernada. Además, puede utilizar experiencias de chat en lenguaje natural, como Mi Asistente, para acceder a información actualizada sin esfuerzo, sin actualizaciones manuales ni gastos técnicos.

El resultado es una experiencia de análisis unificada impulsada por IA donde los datos, los conocimientos y las acciones se combinan a la perfección casi en tiempo real. Las organizaciones pueden moverse más rápido, tomar mejores decisiones y aprovechar todo el valor de sus datos, manteniendo al mismo tiempo arquitecturas más simples, escalables y rentables. Si su caso de uso es un escenario analítico típico procedente de actualizaciones de datos programadas y no requiere acceso casi en tiempo real, el modo SPICE sigue siendo una opción adecuada. Para obtener más detalles sobre esta característica, consulte Creación de un conjunto de datos mediante tablas de Amazon S3.

Para discusiones adicionales y ayuda para obtener respuestas a sus preguntas, consulte Amazon Quick Community.

Sobre los autores

Raji Sivasubramaniam es arquitecto principal de soluciones en AWS y se especializa en IA agente. Se centra en ayudar a las organizaciones Fortune 100 y 500 a nivel mundial a implementar soluciones empresariales de extremo a extremo en IA agente, inteligencia empresarial, gestión de datos y análisis avanzado. Raji aporta una profunda experiencia en atención médica, con una amplia experiencia en la navegación de diversos conjuntos de datos, incluidos mercados administrados, selección de médicos y análisis de pacientes, para impulsar una toma de decisiones de alto impacto basada en datos.

Emily Zhu es gerente senior de productos en Amazon Quick, responsable de toda la pila de datos estructurados, que abarca la arquitectura de datos gobernados y de escala empresarial, motores de consulta analíticos y conversacionales de alto rendimiento, y la capa semántica y ontológica que otorga a los datos un significado real a escala. Le apasiona cómo una estrategia de datos sólida desbloquea la estrategia de IA y tiene la misión de hacer que la pila de datos estructurados sea la base para experiencias conversacionales y analíticas en Quick Suite.

Priya Kakarla es una arquitecta de soluciones especializada centrada en análisis modernos y soluciones basadas en inteligencia artificial, con experiencia en industrias que incluyen atención médica, finanzas y organizaciones nativas digitales. Le apasiona ayudar a las organizaciones a desbloquear el valor de sus datos a través de enfoques escalables, intuitivos y basados ​​en agentes. Priya, conocida por su sólida mentalidad de dar prioridad al cliente, se dedica a ofrecer soluciones innovadoras y personalizadas que se alinean con los objetivos comerciales e impulsan resultados mensurables. Fuera del trabajo, le gusta viajar, explorar diversas cocinas y pasar tiempo con familiares y amigos.