Fórmula 1® (F1) atrae a una audiencia de más de 800 millones de fanáticos en todo el mundo a través de plataformas digitales, F1 TV, redes sociales, venta de entradas y productos durante todo el año. Las carreras ocurren cada dos semanas. Las ventanas de participación de los fanáticos se miden en minutos y las decisiones comerciales deben moverse a la velocidad de la red. Detrás de escena, la plataforma de tecnología de marketing (MarTech) de la F1, Customer 360, captura las interacciones en todos estos puntos de contacto para impulsar la personalización, la segmentación y la estrategia comercial.
Sin embargo, la plataforma enfrentó un desafío operativo importante. Según Chris Roberts, director de TI en la Fórmula 1, "Nuestra plataforma MarTech es el sistema nervioso que impulsa la participación de los fanáticos de la F1. Pero cada nueva fuente de datos requería de 6 a 8 semanas de ingeniería manual. Teníamos un trabajo pendiente de 18 meses solo para integrar 12 nuevas fuentes". La empresa generaba datos más rápido de lo que el equipo de ingeniería podía conectar. Como resultado, Matt Kemp, jefe de operaciones de datos de F1, se dispuso a mejorar la eficiencia y la calidad de los datos. "La ingesta manual de fuentes de datos requiere mucho tiempo, crea variaciones en la solución y, en última instancia, genera problemas de integridad de los datos. Quería una solución que fuera repetible, sólida y confiable. AWS trabajó en retrospectiva desde nuestras necesidades para implementar una solución agente que funcionara de extremo a extremo, aplicando lógica de negocios en cada paso".
A principios de 2026, F1 y AWS trabajaron juntos para construir Data Accelerator, una solución que utiliza IA agente en Amazon Bedrock AgentCore para transformar la plataforma de datos MarTech de F1 de un sistema mantenido manualmente a un patrimonio de datos unificado, observable y autoadministrado. En esta publicación, mostramos cómo el Acelerador de datos redujo la incorporación de fuentes de datos de hasta 8 semanas a aproximadamente 40 minutos de generación de código más horas de implementación. También identificó y corrigió anomalías en las fuentes de datos en la producción, realizó un seguimiento de las operaciones de la plataforma de datos y el linaje de agentes en una sola ventana, y abrió una puerta de entrada para que analistas, ingenieros y científicos colaboraran. "Por primera vez, tenemos visibilidad de extremo a extremo en toda la plataforma MarTech con linaje de datos y análisis de causa raíz, no solo paneles llenos de alertas", dice Roberts.
El desafío
La plataforma Customer 360 de F1 incorpora datos de socios de venta de entradas, integraciones de streaming, feeds de activación de patrocinadores, redes sociales y sistemas de mercancías. Al operar un conjunto de datos de esta amplitud y velocidad, surgieron tres áreas de fricción que el equipo se propuso resolver. En primer lugar, incorporar cada nueva fuente de datos fue un esfuerzo en gran medida manual: los ingenieros escribieron asignaciones de esquemas, construyeron canales de ingesta, configuraron controles de calidad de datos, definieron clasificaciones del Reglamento General de Protección de Datos (GDPR) y establecieron políticas de gobernanza a mano. Este proceso tomó de 6 a 8 semanas por fuente. En segundo lugar, la plataforma tenía que seguir el ritmo de los feeds ascendentes en constante evolución. Los proveedores cambiaban con frecuencia los nombres de las columnas, agregaban campos o reestructuraban y reprogramaban cargas útiles sin previo aviso. Esos cambios a menudo surgieron en el peor momento posible, como a mitad de un fin de semana de carrera o durante el lanzamiento de una campaña de misión crítica. En tercer lugar, la visibilidad estaba fragmentada. Los registros estaban dispersos entre servicios sin un linaje de datos unificado. Cuando una parte interesada cuestionó una métrica, los ingenieros pasaron horas rastreando manualmente el problema en las rutas de Amazon Simple Storage Service (Amazon S3), las tablas de control de Amazon Redshift, los registros de Airflow y las salidas de DBT.
Descripción general de la solución
El Acelerador de datos abordó estos desafíos a través de cinco líneas de trabajo realizadas simultáneamente:
Incorporación de fuentes de datos agentes mediante Amazon Bedrock AgentCore, alojando agentes en sus contenedores de tiempo de ejecución. Detección y corrección automatizadas de la evolución del esquema. Acceso unificado a datos a través de Amazon SageMaker Unified Studio. Observabilidad de extremo a extremo con herramienta de análisis de causa raíz (RCA) y gráfico de contexto. Identificación automatizada de una falla en el panel de observabilidad y operación agente si pudieran solucionarse con cambios de código.
Un sexto flujo de trabajo optimizó los algoritmos de resolución de identidad del cliente que unifican los puntos de contacto de los fanáticos en todos los canales. Las siguientes secciones describen cada flujo de trabajo en detalle.
Incorporación de fuentes de datos agentes
La pieza central del Acelerador de datos es un conjunto de agentes de plataforma que toman un Documento de requisitos comerciales (BRD) con información limitada sobre la fuente de datos y producen un proceso de incorporación completamente listo para producción. Esto incluye código de infraestructura, transformaciones de datos, políticas de gobernanza y clasificación GDPR sin que un humano escriba una sola línea de texto estándar. Los agentes trabajan en dos fases:
Fase 1: Generación de configuración
Cuando es necesario incorporar una nueva fuente de datos, un miembro del equipo carga un BRD en un depósito de Amazon S3. La carga activa una función AWS Lambda, que invoca Amazon Bedrock AgentCore Runtime, una capacidad de Amazon Bedrock AgentCore. El agente lee el BRD y genera un conjunto de archivos de configuración. Luego accede a GitHub a través de una aplicación GitHub para enviar estos archivos como una solicitud de extracción al repositorio de Git estandarizado y accede a Jira a través de su API REST para crear un ticket que haga referencia al PR. Todas las conversaciones y acciones de los agentes se rastrean en Amazon CloudWatch a través de la observabilidad integrada de AgentCore. El ingeniero asignado revisa, ajusta si es necesario y aprueba.
Flujo de trabajo de la fase 1: una carga de BRD hace que el agente genere archivos de configuración y abra una solicitud de extracción
Fase 2: Generación completa del pipeline
Una vez que se aprueban los archivos de configuración, un humano activa la siguiente etapa. El agente toma la configuración aprobada y genera tres solicitudes de extracción independientes:
Código de infraestructura y aplicación de AWS Glue. Marco de transformación DBT. Políticas de gobernanza que incluyen el etiquetado GDPR.
Los tres RP se vinculan a un único ticket de Jira para su trazabilidad. Los ingenieros revisan cada uno de ellos en los repositorios de infraestructura, DBT y gobernanza y los aprueban.
Flujo de trabajo de la fase 2: el agente genera solicitudes de extracción de infraestructura, transformación y gobernanza
Clasificación RGPD automatizada
Lo que lo distingue de un generador de código básico es la clasificación GDPR integrada. El agente analiza de forma proactiva cada columna de datos, determina si contiene datos personales, datos personales confidenciales o datos seudónimos y los etiqueta con la categoría GDPR adecuada. Estas etiquetas se publican directamente en el registro de gobernanza de SageMaker Unified Studio, lo que brinda al equipo de cumplimiento visibilidad inmediata sin ciclos de revisión manual.
Arquitectura de habilidades modular
El sistema no es un gráfico de agentes estrechamente acoplado. Un único agente opera con definiciones de habilidades modulares, cada una de las cuales encapsula una capacidad distinta: mapeo de esquemas e inferencia de tipos de datos, validación de la calidad de los datos, aplicación de la gobernanza y clasificación de datos confidenciales. En tiempo de ejecución, el agente evalúa los requisitos entrantes y activa las habilidades relevantes, componiéndolas mediante un proceso de razonamiento de múltiples pasos. Pass-0 maneja la gestión de tokens mediante la depuración, Pass-1 resume los resultados de la herramienta y Pass-2 acumula una evaluación general, refinando la precisión y la integridad de forma progresiva en lugar de depender de una respuesta única. Las nuevas capacidades se envían como nuevos módulos de habilidades sin cambiar el ciclo central del agente, lo que mantiene la arquitectura mantenible y componible a medida que crece la plataforma.
El resultado es que el tiempo de incorporación se redujo de 6 a 8 semanas a aproximadamente 40 minutos de generación de código más horas de implementación y revisión. Los agentes de IA ahora manejan el 95% del trabajo de forma autónoma.
Evolución automatizada del esquema
Incorporar nuevas fuentes de datos es un desafío, pero mantener saludables las integraciones existentes es otro. Los proveedores ascendentes modifican con frecuencia sus estructuras de datos, desde cambiar el nombre de una columna hasta crear un nuevo campo. Anteriormente, el equipo de F1 descubrió estos cambios cuando fallaba una tubería, a menudo durante un fin de semana de carrera en vivo. La misma arquitectura de agente que maneja la incorporación ahora monitorea continuamente los cambios en el esquema ascendente. Cuando un proveedor modifica su estructura de datos, el agente lo detecta mediante activadores basados en eventos mediante AWS Lambda y Amazon EventBridge. Evalúa el impacto aguas abajo, identificando qué ductos se ven afectados y qué consumidores dependen de los campos modificados. Luego genera las actualizaciones de código necesarias en todos los repositorios afectados y crea un ticket de Jira con contexto completo y relaciones públicas vinculadas. Los ingenieros reciben una notificación que explica qué cambió, describe el impacto y presenta una solución propuesta para su revisión. La resolución de un extremo a otro ahora lleva horas en lugar de días.
Flujo de trabajo agente de evolución de esquemas
Acceso unificado a datos con Amazon SageMaker Unified Studio
Antes de Data Accelerator, trabajar con datos de Customer 360 requería navegar por múltiples entornos desconectados. Los ingenieros de datos seleccionaron canalizaciones en una sola cuenta. Los científicos de datos que querían modelar el comportamiento de los fanáticos necesitaban acceso a una cuenta separada, y los analistas operaban completamente en un tercer mundo. Nadie compartió herramientas ni contexto, y pasar de una pregunta a una respuesta requirió días de coordinación antes de que pudiera comenzar cualquier análisis.
La solución utiliza Amazon SageMaker Unified Studio como base para un marco de malla de datos donde una cuenta de gobierno central gestiona el descubrimiento y el acceso a datos entre múltiples equipos de productores. El factor clave: la gobernanza está codificada como configuración declarativa, no como operaciones manuales de consola. Una única definición de fuente de datos publica simultáneamente datos en el catálogo y proporciona el control de acceso necesario para que los consumidores se suscriban. Esto significa que los agentes pueden incorporar de forma segura nuevos productos de datos de extremo a extremo, desde el almacenamiento hasta el catálogo y el acceso gobernado, porque el marco impone restricciones de seguridad por construcción. No es necesario que ningún ser humano revise las políticas de IAM ni las subvenciones de AWS Lake Formation. La plataforma garantiza la corrección estructural. Esto es lo que hace posible la “única puerta de entrada”.
Los ingenieros de datos seleccionan y gobiernan conjuntos de datos en un solo lugar, y los científicos de datos encuentran esos mismos conjuntos de datos en el mismo entorno: gobernados, documentados y listos para modelar. Un científico de datos que construye un modelo de segmentación de fans u optimiza el algoritmo de identidad del cliente no necesita saber dónde residen los datos, quién es el propietario de la canalización o qué prefijo S3 usar. Abren Unified Studio, encuentran los conjuntos de datos seleccionados de Customer 360 y comienzan a modelar. Obtienen cuadernos compartidos, herramientas consistentes y acceso gobernado, porque la gobernanza declarativa hizo posible el autoservicio seguro sin sacrificar el control. La curación y el consumo finalmente conviven.
Observabilidad de extremo a extremo con RCA y gráfico de contexto
Una plataforma de datos es tan confiable como la capacidad del equipo para responder una pregunta: ¿son correctos los datos en este momento? Antes del Acelerador de datos, responder esa pregunta significaba iniciar sesión en Apache Airflow, verificar las rutas de Amazon S3, consultar las tablas de control de Amazon Redshift y leer registros de DBT. "Nadie tuvo una visión completa. Cuando una parte interesada preguntó, '¿por qué este número parece incorrecto?' la respuesta siempre fue: "danos unas horas". El panel de observabilidad cambia eso por completo”, añade Roberts.
La capa de observabilidad presenta el linaje completo de datos desde la ingestión de S3 Raw hasta las capas procesadas y las etapas de Amazon Redshift DBT como un único gráfico interactivo, codificado por colores para el estado. Los usuarios hacen clic en cualquier nodo para profundizar en fuentes y tablas individuales, cada una de las cuales muestra el estado de aprobación/falla, el tiempo de la última ejecución y la duración. Si una tubería falla, la visualización del linaje muestra exactamente dónde ocurrió la interrupción y qué datos posteriores se ven afectados.
El análisis de causa raíz (RCA) es una herramienta de agente dentro de la plataforma de F1 que lee los registros del sistema e identifica puntos de falla en todo el conjunto de datos. Por sí solo, RCA puede decirle qué falló. Ampliamos la herramienta RCA pasando por el contexto empresarial y la topología del sistema, codificada como JSON. Un archivo faltante en S3 podría ser el error, pero con el gráfico de contexto, RCA le indica que el proveedor ascendente reprogramó su ventana de entrega, razón por la cual el archivo no estaba allí cuando se ejecutó la canalización. Esa es la diferencia entre saber qué falló y entender por qué.
Por primera vez, la F1 tiene linaje completo, análisis de causa raíz causal y definiciones de contexto empresarial en un solo lugar, y el panel se actualiza automáticamente cada 15 minutos.
Visualización del linaje de datos que muestra el estado de la canalización en todas las fuentes y etapas.
Panel de observabilidad con detalles de fallas.
Resolución de identidad del cliente
El flujo de trabajo final optimizó los algoritmos que resuelven la identidad del cliente en los puntos de contacto de los fanáticos de la F1. Un solo aficionado puede interactuar a través de la aplicación, comprar entradas en el sitio web, mirar F1 TV y participar en las redes sociales. Unificar esas interacciones en una única identidad sin fusiones falsas ni coincidencias perdidas es lo que hace posible una personalización efectiva dentro de la Plataforma de Personalización de Fans (FPP).
La F1 ya tenía un proceso de resolución de identidad en funcionamiento, pero fue lento y tuvo dificultades para escalar con el creciente volumen de interacciones de los fanáticos en todos los canales. En lugar de rediseñar la tubería o reemplazar componentes, el equipo se centró en optimizar el rendimiento computacional del algoritmo de resolución existente. Al perfilar los cuellos de botella en la ejecución y ajustar la lógica de coincidencia, el compromiso redujo el tiempo de procesamiento en un 50 %, manteniendo al mismo tiempo todo el proceso de resolución y sus integraciones posteriores completamente intactos. No se cambiaron procesos, no se hicieron concesiones de precisión: el mismo algoritmo ahora se ejecuta en la mitad del tiempo en la escala de producción de la F1.
Con una resolución más rápida, la F1 puede incorporar cualquier fuente de datos nueva y recopilar datos de nuevos clientes en la mitad del tiempo actual. Una resolución más rápida significa perfiles unificados más actualizados, lo que a su vez significa una personalización más oportuna y relevante en todos los canales de marketing.
"El objetivo es entregar el mensaje correcto al fanático correcto en el momento correcto, ya sea a través de correo electrónico, la aplicación F1, venta de entradas o redes sociales. Ahora que podemos incorporar fuentes en horas y resolver identidades más rápido, podemos ofrecer las experiencias personalizadas que nuestros fanáticos esperan en todos los canales de marketing", dice Kemp.
Seguridad y gobernanza por diseño
El Acelerador de datos funciona según el principio que propone la IA y los humanos revisan. Los agentes se ejecutan en Amazon Bedrock AgentCore con memoria a largo plazo, reteniendo el contexto entre las invocaciones. El desarrollo utilizó Kiro para el desarrollo estructurado basado en especificaciones y Amazon Bedrock (Claude Sonnet 4.6) como modelo básico. La columna vertebral basada en eventos utiliza AWS Lambda para la computación, Amazon EventBridge para el enrutamiento, Amazon Managed Workflows for Apache Airflow (MWAA) para la orquestación del flujo de trabajo y Amazon S3 como capa de datos sin procesar. Todo el acceso al modelo de IA se rige a través del AI Gateway de F1 para un control de acceso unificado, gestión de costos y registro de auditoría. Pero la arquitectura es sólo la mitad de la historia. La postura de seguridad es lo que hace que esto esté listo para la producción.
La postura de seguridad incluye:
Privilegio mínimo: permisos detallados, tokens de corta duración con vencimiento en una hora, acceso limitado a repositorios y recursos específicos. Registro de auditoría completo: cada acción se registra y se atribuye a su cumplimiento. Revisión humana: cada Pull Request generado pasa por la aprobación del ingeniero. Pruebas automatizadas: los agentes generan pruebas integrales para sus propios cambios. Capacidades de reversión: los problemas que surgieron después de la fusión se pueden revertir inmediatamente. Aislamiento de red: todo el sistema se ejecuta dentro de subredes privadas en Amazon Virtual Private Cloud (Amazon VPC) sin acceso directo a Internet. Credenciales cifradas: todos los secretos almacenados en reposo en el almacén de parámetros de AWS Systems Manager.
“Lo que nos dio confianza para incluir IA agente en nuestros canales de datos de producción fue lo que llamamos 'Humano al mando'. Los agentes hacen el trabajo pesado, pero los humanos toman las decisiones. Cada cambio pasa por el mismo proceso de revisión que ya utilizan nuestros ingenieros, por lo que la adopción fue inmediata”. dice Roberts.
el impacto
El Acelerador de Datos generó un impacto mensurable en todas las operaciones MarTech de la F1:
Incorporación de fuentes de datos: reducida de 6 a 8 semanas a aproximadamente 40 minutos de generación de código más horas de implementación y revisión. Trabajo autónomo: los agentes de IA manejan el 95% de las tareas de incorporación sin intervención humana. Time-to-value: aproximadamente 99% de reducción. Evolución del esquema: resolución de un extremo a otro en horas en lugar de días. Trabajo pendiente de integración: trabajo pendiente de 18 meses solucionado en semanas. Los ingenieros de datos que antes dedicaban su tiempo a escribir código de ingestión repetitivo y a buscar rupturas de esquemas ahora se centran en iniciativas estratégicas que hacen avanzar el negocio. Velocidad de implementación: un solo desarrollador llevó la solución agente desde la prueba de concepto hasta el lanzamiento de producción en 4 meses.
Se mejoró la confiabilidad, la coherencia y la integridad de los datos de la plataforma MarTech, al tiempo que se redujeron los gastos operativos: "El Acelerador de datos no solo aceleró las cosas. Cambió la forma en que operamos. Nuestros ingenieros de datos pasaron de escribir código de ingesta repetitivo a centrarse en iniciativas estratégicas. Los problemas se pueden identificar y solucionar antes de que nuestros usuarios finales se den cuenta". dice Kemp.
Conclusión
El éxito del Acelerador de datos se reduce a tres principios: reunirse con los desarrolladores donde ya trabajan, mantenerlos al mando e incorporar una gobernanza como la clasificación GDPR desde el primer día en lugar de implementarla después. Estos principios dieron forma a una solución en la que F1 se asoció con AWS para utilizar IA agente en Amazon Bedrock AgentCore para transformar las operaciones de datos de MarTech. Al combinar la incorporación automatizada de fuentes de datos, la detección de la evolución del esquema y el acceso unificado a los datos a través de Amazon SageMaker Unified Studio, F1 redujo el tiempo de incorporación en aproximadamente un 99 % y eliminó un retraso en la integración de 18 meses en semanas.
El enfoque es deliberadamente replicable. Cualquier organización que se ocupe de la incorporación de datos de múltiples fuentes, la volatilidad de los esquemas y los requisitos de gobernanza puede aplicar la misma arquitectura a su propio entorno. Los agentes son independientes del dominio y saben cómo incorporar, clasificar y monitorear. El dominio es intercambiable.
Empezando
Para obtener más información sobre los servicios de AWS utilizados en esta solución:
Expresiones de gratitud
Este resultado es el resultado de años de mejoras incrementales en la plataforma MarTech, logradas a través de una estrecha asociación entre la F1 y AWS. Muchos contribuyentes de ambas organizaciones han dado forma a la arquitectura y fortalecido las bases que hicieron posible el Acelerador de datos. Agradecemos a los siguientes líderes de opinión y desarrolladores por su dedicación y experiencia: Paula Marenco Aguilar, Nadeen Nilanka, Taye Aduewa, Marton Juhasz, Deepak Gulia, Alex Goff, Nick Morgan y Seshadri Senthamaraikannan.