Muchas empresas utilizan la IA. Pocos saben cómo construir una plataforma de datos empresariales nativa de IA.

ya han adoptado la IA para mejorar la productividad diaria en los últimos años. La IA se ha convertido rápidamente en parte de los flujos de trabajo empresariales:

Creación de chatbots internos para responder preguntas sobre recursos humanos, TI o políticas. Usar ChatGPT o Microsoft Copilot para buscar y resumir documentos. Ayudar a los desarrolladores con la generación y depuración de código. Redacción de informes, correos electrónicos, notas de reuniones y presentaciones comerciales.

Sin duda, estas aplicaciones han mejorado la productividad individual. Pero si creemos que ahí termina el potencial de la IA, nos estamos perdiendo las partes importantes. La realidad es que muchas empresas se detienen aquí y no logran aprovechar las capacidades más transformadoras de la IA.

La IA puede hacer mucho más. En mi opinión, una de sus aplicaciones más poderosas radica en transformar el ecosistema de datos empresariales.

Más allá del chatbot: lo que realmente hacen los agentes de IA

Los equipos de datos de muchas organizaciones dedican una cantidad significativa de tiempo todos los días a responder preguntas de los usuarios empresariales. Por ejemplo, si es un analista de datos que trabaja para una plataforma de comercio electrónico, puede recibir toneladas de preguntas de empresas como: "¿Qué categorías de productos contribuyeron más al crecimiento de los ingresos en el sudeste asiático el último trimestre?"

Como analista de datos, esto es lo que suele hacer:

Pregunta comercial ↓ Escribir SQL ↓ Exportar datos ↓ Crear gráficos ↓ Explicar hallazgos

Ahora, le entregas esto a un agente de IA y el flujo de trabajo se convierte en:

La empresa pregunta ↓ El agente recupera información semántica ↓ Genera SQL ↓ Devuelve explicación

En la superficie, el usuario empresarial todavía está conversando con la IA lanzando una pregunta para obtener una respuesta. Se parece mucho a chatear con un bot, ¿no? Pero trabajar con un agente de IA es fundamentalmente diferente a chatear con un chatbot.

¿Qué es un agente de IA?

Un agente de IA es un sistema autónomo que percibe su entorno, toma decisiones y realiza acciones concretas para lograr un objetivo.

La diferencia clave entre un agente de IA y un chatbot es que un agente de IA puede realizar acciones en lugar de simplemente generar respuestas. Mientras que los chatbots responden principalmente a preguntas a través de conversaciones, los agentes de IA ejecutan tareas de varios pasos, interactúan con software y herramientas, toman decisiones y trabajan para completar un objetivo específico de forma autónoma.

Para ser más específicos, las diferencias clave entre ellos son:

Aunque los usuarios empresariales pueden sentir que simplemente están conversando con el agente de IA, detrás de escena el agente está ocupado ejecutando una serie de acciones: recuperar contexto relevante, generar y ejecutar consultas SQL, interpretar los resultados y luego entregar una respuesta pulida.

En el mundo de los datos, estos agentes de IA suelen denominarse agentes de datos. Se centran en recuperar, consultar, analizar y explicar datos empresariales a través de interacciones de lenguaje natural. La mayoría de las plataformas de datos, como Microsoft Fabric, Snowflake y Databricks, tienen agentes de datos integrados. Por ejemplo, Fabric tiene el agente de datos Fabric, Snowflake tiene Cortex Analyst y Databricks tiene AI/BI Genie. Si no desea estar vinculado a una plataforma específica, puede elegir Julius AI o Tellius, que pueden conectarse a la mayoría de las plataformas de datos convencionales, ya sea de forma nativa o indirecta.

Los agentes de datos están diseñados para actuar como analistas de datos de IA. Reducen el trabajo repetitivo de extraer datos, escribir consultas de rutina y generar informes estándar para que los analistas dediquen menos tiempo a realizar tareas repetitivas de recuperación de datos e informes, y más tiempo a trabajos que requieren juicio humano y pensamiento crítico. Los usuarios empresariales también se benefician. Reciben soporte analítico las 24 horas del día, los 7 días de la semana, sin esperas, y el agente puede obtener información de manera proactiva en lugar de requerir que alguien explore los datos manualmente.

¿Se ve hermosa? Pero en la práctica, simplemente confiar en agentes de datos a menudo lleva a una organización a los siguientes problemas:

Terminología empresarial ambigua Razonamiento de varios pasos Reglas empresariales Respuestas inconsistentes Calidad de recuperación Manejo de casos extremos que se encuentran fuera de capas semánticas predefinidas Mantenerse al día cuando cambian los esquemas de datos Mantener la precisión en diferentes contextos empresariales

Estas no son pequeñas molestias. Por ejemplo, cuando el usuario empresarial escribe "¿Cuál es el porcentaje de crecimiento de los ingresos en el sudeste asiático en el último trimestre?", sería muy frustrante si el agente respondiera sin proporcionar datos o proporcionara un número incorrecto.

Cuando un agente de datos hace algo mal, no sólo frustra a los usuarios. Para empeorar las cosas, puede introducir información errónea en una decisión empresarial.

¿El resultado final? Depender únicamente de los agentes de datos no es suficiente. El verdadero camino a seguir debería ser conectar plataformas de datos con arquitecturas de inteligencia artificial empresarial.

Dónde encaja la IA en la plataforma de datos

Un flujo de trabajo típico de una plataforma de datos empresariales se ve así: los ingenieros de datos diseñan la arquitectura, implementan la creación de canales ETL y almacenes de datos y gestionan el gobierno de los datos. Los usuarios empresariales plantean preguntas relacionadas con el negocio, los analistas de datos crean informes o paneles de BI. Luego, los usuarios empresariales utilizan el panel para realizar análisis y generar información.

Diseño del autor, generación de gráficos por Claude

Este flujo de trabajo se ha ejecutado durante décadas y ha apoyado y empoderado eficazmente a muchas empresas. Luego llegó la IA. La gente empieza a pensar:

¿Por qué los usuarios empresariales siguen haciendo las mismas preguntas? ¿Por qué los ingenieros de datos pasan horas validando trabajos de ETL? ¿Por qué los analistas investigan manualmente los cambios de KPI?

Rápidamente, la IA se integra en la plataforma de datos. Se utilizan agentes de datos. Se introduce la codificación agente. Luego vienen nuevas preguntas:

¿Por qué confiamos en las respuestas generadas por IA sin medir su calidad? ¿Por qué la IA se vuelve menos confiable a medida que las reglas comerciales se vuelven más complejas?

Estos no son problemas aislados. Son síntomas de una plataforma de datos tradicional que fue diseñada para almacenar y generar informes de datos en lugar de colaborar con la IA.

Tal vez sea hora de repensar la arquitectura en sí en lugar de tratar la IA como una aplicación complementaria a la plataforma de datos existente.

Para el tema de la arquitectura de IA, todavía no existe una respuesta estándar. Puede que nunca haya una respuesta estándar. La arquitectura de IA se puede personalizar según la industria, la escala empresarial, la estrategia comercial y el nivel de madurez de la tecnología de datos/IA.

En mi opinión, las organizaciones deberían incluir al menos los tres componentes clave de la IA en su flujo de trabajo de datos: agente de datos, agente de control de calidad de la IA y gobernanza y observabilidad de la IA.

Diseño del autor, generación de gráficos por Claude

La IA empresarial no elimina la necesidad de una ingeniería de datos sólida implementada por humanos. En cambio, la IA puede mejorarlo. No importa cuán inteligentes sean los agentes de IA, antes de que puedan responder preguntas comerciales o validar la calidad de los datos, la plataforma de datos subyacente ya debe ser confiable y escalable. En un artículo anterior, ¿Qué podemos hacer cuando la memoria se convierte en el nuevo cuello de botella en la ingeniería de datos?, analicé uno de los desafíos que todo ingeniero de datos enfrentaría al procesar conjuntos de datos a gran escala y proporcioné varias soluciones prácticas para diferentes escenarios.

Volvamos a los problemas que enfrentan la mayoría de los agentes de datos:

Terminología empresarial ambigua Razonamiento de varios pasos Reglas empresariales Respuestas inconsistentes Calidad de recuperación Manejo de casos extremos que se encuentran fuera de capas semánticas predefinidas Mantenerse al día cuando cambian los esquemas de datos Mantener la precisión en diferentes contextos empresariales

Para resolver estos problemas, podemos utilizar los SDK de AI Agent para crear sistemas autónomos desde cero o ampliar las capacidades que los agentes de datos existentes no ofrecen de forma inmediata. Las herramientas más populares del mercado incluyen LangGraph, Microsoft Agent Framework o Google ADK. Hablaré de cómo crear un agente de datos en mi próximo artículo.

Cómo la IA está transformando la garantía de calidad de los datos

Imagínese que está trabajando para una empresa de atención médica. Cada día, necesita procesar millones de registros de pacientes: resultados de laboratorio, reclamaciones de seguros, notas clínicas, registros de recetas. Cuando llegan los datos, debe asegurarse de que sus canalizaciones los ingieran, transformen y carguen correctamente porque no se trata solo de paneles de control limpios; Más importante aún, se trata de seguridad del paciente, cumplimiento normativo y precisión financiera. Entonces preparas la lista para verificar:

Recuento de filas (¿eliminamos registros durante la ingestión?) Verificaciones NULL (¿están vacíos los campos obligatorios?) Detección de duplicados (¿se ingresa el mismo registro dos veces?) Validación de esquema (¿tipos de datos correctos, nombres de columnas correctos?) Verificaciones de rango (¿es realista una lectura de presión arterial de 999?) Validación de formato (¿los campos de fecha siguen AAAA-MM-DD? ¿Los campos de correo electrónico son en realidad correos electrónicos?) Integridad referencial (¿existe una ID de paciente en la tabla de reclamaciones en la tabla de pacientes?) Comprobaciones de frescura (¿Los datos de hoy realmente llegaron a tiempo?)

Según esta lista, usted define reglas, programa trabajos para ejecutar estas comprobaciones y recibe alertas cuando algo falla. Principalmente utiliza consultas de validación basadas en SQL, configuraciones de reglas YAML o JSON y monitores de panel que muestran tasas de aprobación/rechazo. Su flujo de trabajo funciona hasta que deja de funcionar. ¿Por qué? Porque sólo captan lo que ya sabes buscar. Si no anticipó un modo de falla, no existe una regla para ello. Por lo tanto, debes cambiar las reglas manualmente. Pero para un entorno con enormes conjuntos de datos o con datos que cambian con frecuencia, el mantenimiento de la biblioteca de reglas se convierte en una pesadilla.

El control de calidad impulsado por IA no reemplaza los controles tradicionales. En cambio, agrega una capa que aprende.

Tradicionalmente, usted sigue el proceso para completar el control de calidad de sus datos.

Definir reglas ↓ Ejecutar comprobaciones ↓ Recibir alertas de aprobación/rechazo ↓ Investigar manualmente

Pero cuando entrega su trabajo de control de calidad a los modelos de IA, estos aprenden cómo se ven los datos normales a partir de patrones históricos en lugar de depender únicamente de reglas predefinidas. Detectan anomalías como cambios sutiles en la distribución, correlaciones inusuales entre campos, derivas de datos emergentes que indican un problema en el oleoducto aguas arriba. Estas anomalías aún no han sido agregadas a la lista de verificación por adelantado. En el ejemplo de la atención médica, el control de calidad impulsado por IA podría detectar los resultados de laboratorio de una clínica específica que de repente tiene valores de prueba 10 veces más altos que su promedio histórico. El control de calidad tradicional le daría un pase porque el conjunto de datos tiene el mismo formato, rangos válidos, sin NULL ni duplicados. Pero AI lo señala porque no parece correcto comparado con lo que esa clínica siempre ha producido. Integrado con IA, todo el flujo de trabajo de control de calidad se convierte en:

Aprender patrones ↓ Detectar anomalías ↓ Superficie con contexto ↓ Explicar posible causa

Al igual que los agentes de datos, también hay algunas herramientas de control de calidad basadas en inteligencia artificial disponibles para respaldar el control de calidad empresarial. Las herramientas populares incluyen Great Expectations (basada principalmente en reglas, con extensibilidad para la detección de anomalías a través de expectativas e integraciones personalizadas), Soda (que combina comprobaciones basadas en reglas con detección de anomalías impulsada por ML a través de Soda Cloud), Databricks Lakehouse Monitoring (perfiles nativos y detección de deriva para datos y características del modelo ML) y AWS Glue Data Quality (recomendaciones de reglas de calidad automatizadas y detección de anomalías dentro del ecosistema de Glue).

Por ejemplo, si desea combinar su control de calidad original basado en reglas con IA para la detección de anomalías en los datos de la empresa de atención médica, puede utilizar el siguiente método.

from soda.scan import Scan from soda.contracts.contract import Contrato from soda.contracts.check import AnomalyCheck, SchemaCheck, UserDefinedCheck # Comprobaciones tradicionales: reglas que usted define tradicional_contract = Contrato( checks=[ SchemaCheck( name="Schema validation", fail_if_missing_columns=["patient_id", "diagnosis_code", "lab_result"]), UserDefinedCheck( name="No hay registros de pacientes duplicados por día", query=""" SELECCIONE ID_paciente, fecha_admisión, COUNTDESDE registros_de_paciente GRUPO POR id_paciente, fecha_admisión TENIENDO CUENTA> 1 """, fail_if_rows_returned=True ) ] ) # Comprobaciones impulsadas por IA: detección de anomalías basada en patrones aprendidos ai_contract = Contract( checks=[ AnomalyCheck( name="Anomalía: cambio de distribución de resultados de laboratorio", metric="mean(lab_result)", anomaly_detection="ml", sensibilidad=0.8, fail_if_anomaly_severity="critical" ), AnomalyCheck( name="Anomalía: códigos de diagnóstico faltantes", metric="missing_count(diagnosis_code)", anomaly_detection="ml", fail_if_anomaly_severity="warning" ), AnomalyCheck( name="Anomalía: registrar volumen por fuente", metric="row_count", anomaly_detection="ml", group_by=["data_source"], # monitorea el volumen de cada hospital de forma independiente fail_if_anomaly_severity="critical" ) ] ) # Ejecute el escaneo scan = Scan() scan.set_data_source_name("healthcare_db") scan.add_contracts([traditional_contract, ai_contract]) scan.set_verbose(True) scan.execute()

Además de la detección de anomalías sin umbrales predefinidos y la investigación de la causa raíz, los métodos de control de calidad impulsados ​​por IA tienen capacidades de comprensión contextual y reconocimiento de patrones en múltiples dimensiones. Los modelos de IA pueden volver a aprender continuamente lo que significa "normal" en lugar de esperar a que alguien actualice los umbrales manualmente. Con estas características, la IA mejora enormemente la eficiencia y precisión de los flujos de trabajo de control de calidad de los datos.

La IA puede equivocarse. ¿Cómo confiamos en él?

Mucha gente piensa que la gobernanza de la IA significa seguridad: acceso basado en roles, enmascaramiento de datos e información confidencial almacenada de forma segura. Pero una vez que la IA esté completamente integrada en su sistema empresarial, la gobernanza se trata de algo más amplio: ¿puede explicar y respaldar cada respuesta que brinde su IA?

Imagine que es administrador de cartera en una empresa de inversión. Un día le preguntó a un agente de datos: "¿Qué fondos superaron sus objetivos ESG el último trimestre?" El agente extrajo datos, ejecutó los números y devolvió una respuesta. Un mes después, hiciste la misma pregunta pero obtuviste una respuesta diferente. En el último mes, nadie cambió la consulta ni actualizó los datos. Y nadie sabía qué se movía dentro del agente y por qué.

Ahora la gobernanza de la IA importa. A diferencia del gobierno de TI o el gobierno de datos tradicionales, el gobierno y la observabilidad de la IA generalmente se centran en las siguientes áreas:

Versiones rápidas

El control de versiones mediante avisos significa tratar los avisos como cualquier otro artefacto de software. De manera similar al proceso en ingeniería de software, los ingenieros de inteligencia artificial almacenan las versiones de los mensajes en Git, etiquetan las versiones y registran qué versión estaba activa cuando se ejecutó una consulta. Entonces, cuando el administrador de cartera pregunta por qué la respuesta del mes pasado es diferente, lo primero que debe mirar es si la pregunta cambió. Si fue así, tienes tu explicación. Si no fue así, necesitas profundizar más. Es importante para los agentes de datos porque un pequeño cambio de redacción puede cambiar los resultados sin que nadie se dé cuenta.

Detección de alucinaciones

Los agentes de datos alucinan y es peligroso porque un número alucinado parece un número real. Es por eso que la detección de alucinaciones es una de las áreas más candentes en las que investigan muchos expertos en inteligencia artificial.

Cuando toma la detección de alucinaciones para los agentes de datos, puede verificar los resultados con los datos de origen. Los métodos incluyen validación de ejecución de SQL, base de resultados y puntuación de confianza.

Rastreo

El rastreo es la capa de “qué sucedió”, que registra cada paso que dio la aplicación de IA. Si desea rastrear a un agente de datos, puede utilizar herramientas para registrar la pregunta del usuario, cómo se interpretó, qué SQL se generó, qué tablas se consultaron, qué resultados se obtuvieron y cómo se compuso la respuesta final. Las herramientas de seguimiento de LLM incluyen LangSmith, Weights & Biases y Phoenix, que se utilizan comúnmente junto con plataformas de datos.

Escucha

El seguimiento es seguimiento más tiempo. Así como monitorea las canalizaciones de datos en busca de actualizaciones y anomalías, monitorea los agentes de IA para detectar cambios de comportamiento. Usted monitorea sus herramientas de inteligencia artificial mediante señales. Por ejemplo, puede monitorear señales como la tasa de éxito de las consultas, la latencia de las respuestas, la tasa de rechazo de las respuestas y las tendencias de comentarios de los usuarios para un agente de datos. Como estas señales son fundamentales para que usted pueda determinar si su agente es realmente bueno en su trabajo, el sistema de monitoreo de IA es igualmente importante que el sistema de control de calidad potenciado por IA. Los dos sistemas de monitoreo deberían alimentar la misma pila de observabilidad.

Seguridad

Además de las cuestiones de seguridad tradicionales discutidas por la gobernanza de datos, existen preocupaciones específicas planteadas por los agentes de datos de IA: inyección de consultas, exfiltración de datos mediante solicitudes y permisos excesivos.

Inyección de consultas: cuando un usuario escribe una pregunta, el agente genera una consulta que tiene la posibilidad de introducir comandos destructivos. La solución a este problema es utilizar consultas parametrizadas, imponer la ejecución de solo lectura y bloquear cualquier declaración que intente modificar datos en lugar de ejecutar la consulta generada directamente. Exfiltración de datos mediante mensajes: un usuario podría crear un mensaje que engañe al agente para que extraiga datos confidenciales y los envíe a algún lugar al que no debería ir. La solución es realizar listas de permitidos de llamadas de herramientas y escaneo de resultados que permitan al agente solo hacer lo que usted ha permitido explícitamente y verificar todo lo que sale del sistema. Exceso de permisos: los agentes de IA pueden ejecutarse con una cuenta de servicio amplia que lo ve todo. Por lo tanto, existe el riesgo de que proporcionen datos al usuario a los que no debería tener acceso. La solución es pasar el contexto de seguridad del usuario final a la capa de datos para que cada consulta generada respete los permisos reales del usuario.

Comentarios humanos

Sólo los comentarios de los usuarios le ayudarán a encontrar el margen de mejora que nunca anticipó. Hay muchas formas de recopilar comentarios.

La retroalimentación humana es importante porque los usuarios reales harán preguntas que nunca habías anticipado. Para recopilar comentarios, el método más simple es permitir que los usuarios aprueben o desaprueben cada respuesta, con un campo de comentarios opcional. Pero cuando la gobernanza y la observabilidad de la IA se configuran correctamente en la arquitectura de IA empresarial, se puede sacar más provecho del sistema. Si un usuario marca una respuesta como incorrecta, el sistema puede capturar el seguimiento completo para que los ingenieros de IA puedan investigar. La retroalimentación mejora el conjunto de datos de evaluación, identifica términos comerciales confusos, resalta consultas en las que el agente tiene dificultades constantemente y le indica dónde invertir en ingeniería rápida con el tiempo.

La gobernanza y la observabilidad suenan burocráticas. Pero en la práctica, diferencian una demostración de algo en lo que puedes confiar y sobre lo que puedes tomar decisiones. Como los tres componentes clave de una arquitectura de datos empresariales impulsada por la IA, los agentes de datos, el control de calidad potenciado por la IA y la gobernanza de la IA trabajan juntos para construir un colaborador confiable con los humanos.