Esta publicación es en coautoría con el equipo de OneAdvanced.
La implementación de agentes de IA en una arquitectura de AWS soberana del Reino Unido requiere decisiones cuidadosas sobre el alojamiento de modelos, la residencia de datos y la orquestación de agentes. OneAdvanced, un proveedor de software empresarial con sede en el Reino Unido que atiende a más de 10.000 clientes, necesitaba ofrecer capacidades de inteligencia artificial y al mismo tiempo asegurarse de que ningún dato saliera del Reino Unido. En ese momento, los modelos específicos que querían, Llama 4 Maverick y Llama Guard 4, aún no estaban disponibles a través de servicios administrados en la región del Reino Unido. OneAdvanced tomó un camino diferente: autoalojamiento de modelos de lenguaje grande (LLM) de peso abierto en la infraestructura de AWS que controlan totalmente.
En esta publicación, describimos cómo OneAdvanced creó una solución de inteligencia artificial soberana del Reino Unido utilizando Llama 4 Maverick y Llama Guard 4 en Amazon SageMaker AI. La solución combina una canalización de generación aumentada de recuperación (RAG) respaldada por Amazon Aurora PostgreSQL-Compatible Edition con la extensión pgvector, más de 50 agentes especializados impulsados por Strands Agents SDK y una capa de herramientas que se ejecuta en Amazon Elastic Container Service (Amazon ECS). Analizamos la arquitectura, las decisiones clave de implementación y los resultados.
El desafío: soberanía de datos y alojamiento de modelos
OneAdvanced proporciona soluciones de software como servicio (SaaS) centradas en el sector a organizaciones de los sectores sanitario, jurídico y muchos otros sectores regulados. Sus clientes manejan datos confidenciales a diario, incluidos registros de pacientes, expedientes de casos legales y documentación de cumplimiento. Estos clientes esperan que las herramientas de IA cumplan con estrictos estándares de privacidad, seguridad y residencia de datos.
Como explica Andrew Henderson, CTO de OneAdvanced, en el vídeo de lanzamiento de OneAdvanced AI:
"La soberanía de los datos, particularmente en el Reino Unido, es un requisito estricto para muchos de nuestros clientes, especialmente aquellos en el sector público y en industrias altamente reguladas. Necesitan saber exactamente dónde están sus datos, quién tiene acceso a ellos y que residen dentro del marco legal y regulatorio del Reino Unido para respaldar el cumplimiento y la confianza total".
OneAdvanced inicialmente creó un prototipo con Amazon Bedrock y obtuvo resultados rápidos en un sprint de dos semanas: finalización del chat, un agente de Amazon Bedrock para consultar la legislación del Reino Unido, integración de datos de Snowflake y generación de gráficos.
Sin embargo, para cumplir con sus requisitos de soberanía, OneAdvanced necesitaba alojar modelos exclusivamente en sus propias cuentas de AWS con sede en el Reino Unido. En el momento del compromiso, los modelos que querían, Llama 4 Maverick y Llama Guard 4, aún no estaban disponibles a través de los servicios administrados de AWS en la región del Reino Unido. El autohospedaje significó implementar, servir y escalar estos modelos mientras se creaba una solución de nivel de producción a su alrededor. Esto incluía moderación de contenido, recuperación de documentos, orquestación de agentes y un creador de agentes sin código para usuarios no técnicos.
Descripción general de la solución
El siguiente diagrama muestra la arquitectura de alto nivel de la solución OneAdvanced AI.
Figura 1: Arquitectura de alto nivel de la solución de IA soberana del Reino Unido OneAdvanced
Esta arquitectura permitió a OneAdvanced lograr la soberanía total de los datos en el Reino Unido y una rápida implementación de agentes, respaldando su certificación ISO 42001 para el gobierno de la IA y al mismo tiempo manteniendo un control total sobre su infraestructura de servicio de modelos.
La solución consta de cuatro componentes. vLLM sirve Llama 4 Maverick (FP8) y Llama Guard 4 en Amazon SageMaker AI, ejecutándose en instancias p5.48xlarge en la región de Londres (eu-west-2). Más de 50 agentes de Strands se ejecutan en Amazon ECS, cada uno con su propio indicador del sistema, configuración de herramientas y formulario de entrada opcional, con la configuración del agente almacenada en Amazon DynamoDB. Los documentos cargados en Amazon Simple Storage Service (Amazon S3) se convierten en rebajas, se fragmentan y se incrustan en pgvector para su recuperación. Llama Guard 4 verifica las entradas del usuario en busca de contenido dañino antes de que la solicitud llegue al modelo principal.
Una solicitud típica fluye así: el usuario envía un mensaje y Llama Guard lo verifica en busca de contenido dañino (evaluado antes del modelo de inferencia principal). La solicitud se dirige al agente de Strands correspondiente en Amazon ECS. El agente llama a herramientas y recupera documentos relevantes de pgvector y Amazon S3 según sea necesario, o invoca herramientas especializadas, incluida la búsqueda web.
Requisitos previos
Para autohospedar un modelo de IA en AWS, necesita los siguientes recursos y habilidades:
Una cuenta de AWS con acceso a instancias p5.48xlarge en su región de destino. Para obtener información sobre cómo solicitar una cuota de instancia de GPU, consulte la Guía para desarrolladores de IA de Amazon SageMaker. Conocimiento intermedio de implementación de contenedores en Amazon ECS y gestión de almacenamiento con Amazon S3. Para comenzar, consulte la Guía para desarrolladores de Amazon ECS. Acceso a los pesos del modelo de IA elegido (Llama 4 Maverick y Llama Guard 4 requieren la aceptación de la licencia en Hugging Face). Experiencia con marcos de aprendizaje automático (ML) basados en Python y orquestación de contenedores. Una base de datos PostgreSQL con la extensión pgvector habilitada para la búsqueda de similitudes de vectores.
Implementación de modelos en Amazon SageMaker AI
OneAdvanced presta servicios a Llama 4 Maverick (meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8) y Llama Guard 4 (meta-llama/Llama-Guard-4-12B) mediante vLLM en puntos finales de IA de Amazon SageMaker. Se implementan en instancias p5.48xlarge en la región de Londres, utilizando modelos Hugging Face con AWS Deep Learning Containers.
Las ventanas de contexto más largas impulsaron el cambio a instancias P5. OneAdvanced apunta a longitudes de contexto de token de 120 000 a 128 000 para admitir casos de uso como análisis de documentos grandes y conversaciones de varios turnos. Durante el asesoramiento con AWS, las pruebas de carga con vLLM en instancias P5 validaron que la infraestructura podía manejar sus requisitos de rendimiento. OneAdvanced comenzó en instancias p4d.24xlarge y pasó a p5.48xlarge para producción, aprovechando también los descuentos de instancias reservadas en cómputo GPU.
Llama Guard 4 reemplazó una implementación anterior de Llama Guard 3 después de que OneAdvanced observara altas tasas de falso rechazo con la versión anterior. El modelo de protección se ejecuta en serie antes que el modelo principal, examinando las entradas del usuario en busca de contenido dañino antes de que comience la inferencia.
Creación de más de 50 agentes con el SDK de Strands Agents
Un aspecto distintivo de la solución OneAdvanced es su biblioteca de agentes: más de 50 agentes para tareas específicas que abarcan atención médica, legal, recursos humanos, marketing, logística y más. Los agentes incluyen un asistente de respuesta a incidentes de atención, un generador de boletines de seguridad clínica, un generador de esquemas de trabajo para educación, una simulación de escenario operativo, un asistente de revisión de desempeño, una herramienta de comparación de documentos y un agente arquitecto de AWS, entre muchos otros. OneAdvanced pasó de ser su primer agente a tener más de 50 en solo tres semanas, y la mayoría de los agentes se crearon en menos de un día.
OneAdvanced evaluó varios marcos agentes, incluidos LangChain, LangGraph y otros, antes de elegir Strands Agents SDK. La decisión se redujo a algunos factores: Strands adopta un enfoque basado en el modelo sin definiciones rígidas de flujo de trabajo, admite interacciones por turnos y estilo entrevista, y permitió a OneAdvanced pasar rápidamente de la idea al agente implementado. Como explica Nick Heap, ingeniero de software principal de OneAdvanced:
"Después de la evaluación, Strands se destacó como el claro pionero del proyecto. Su conjunto integral de herramientas no solo cumplió con nuestros requisitos sino que también ofreció una solución preparada para el futuro que se alineaba estrechamente con nuestra visión interna".
Cada agente se define con un mensaje del sistema, un conjunto de herramientas y un formulario de entrada estructurado opcional. Los agentes se colocan en contenedores y se implementan en Amazon ECS, con la configuración del tiempo de ejecución almacenada en Amazon DynamoDB. Los usuarios navegan por el catálogo de agentes y seleccionan el que se adapta a su tarea.
OneAdvanced también creó un generador de agentes sin código que los no desarrolladores pueden usar para crear y configurar agentes a través de una interfaz visual. Los usuarios definen la personalidad del agente, diseñan formularios de entrada con campos de arrastrar y soltar, escriben mensajes del sistema con referencias a los campos del formulario (usando una sintaxis @ para inyectar valores del formulario) y seleccionan de una biblioteca de herramientas disponibles. Este diseño hace que la creación de agentes sea accesible para gerentes de productos, médicos y analistas de negocios sin necesidad de escribir código.
Los agentes utilizan una biblioteca de herramientas compartida que incluye calculadora, creación de gráficos, lector de contenido de archivos, generador de diagramas de sirena, búsqueda de conocimiento personal y de organizaciones, consulta de hojas de cálculo (incluida la integración de Snowflake), consulta de archivos de texto, búsqueda de leyes del Reino Unido y búsqueda web (opción por organización y por consulta de usuario). Por ejemplo, un agente puede consultar una base de datos de Snowflake y luego generar un gráfico a partir de los resultados en una única interacción.
OneAdvanced también utiliza subagentes y patrones agentes avanzados para mantener la ventana de contexto en interacciones complejas. Un patrón de diseño notable es el agente estilo entrevista. Algunos agentes, como el asistente de Pensamiento Estratégico, hacen preguntas estructuradas antes de brindar asesoramiento: "Pregunta 1 de 3: ¿Qué puntos débiles específicos pretende abordar su solución de IA?" Esto crea contexto a través de turnos en lugar de esperar que los usuarios proporcionen todo por adelantado. Las interacciones enfocadas y guiadas producen mejores resultados que las indicaciones abiertas.
oleoducto RAG
El sistema RAG brinda a los agentes acceso a colecciones de documentos tanto personales como organizacionales. Los usuarios cargan documentos a través de la interfaz de administración de archivos en un espacio personal o en un espacio de organización compartido en Amazon S3. Los documentos se convierten en rebajas y se dividen en segmentos de 2048 tokens antes de incrustarlos en pgvector para la búsqueda de similitud de vectores. Para documentos más largos, el resumen recursivo maneja el contenido que excede el tamaño del fragmento.
Para las incrustaciones, OneAdvanced utiliza el modelo intfloat/multilingual-e5-large-instruct, elegido por su sólido soporte multilingüe y capacidades de seguimiento de instrucciones. En lugar de adoptar un marco RAG disponible en el mercado, OneAdvanced construyó su propio sistema de recuperación, llamado internamente "Llamadex", lo que les brinda control total sobre el oleoducto. Inicialmente eligieron pgvector por su simplicidad y la velocidad que ofrecía para llegar a producción. A medida que la solución madura, OneAdvanced está revisando esta estrategia para evaluar alternativas.
Cuando un agente necesita responder una pregunta basada en documentos cargados, llama a la herramienta de recuperación adecuada, "Búsqueda de conocimiento personal" o "Búsqueda de conocimiento de la organización", que consulta pgvector y devuelve fragmentos relevantes junto con referencias de origen. Los usuarios pueden ver exactamente qué documentos se utilizaron para generar una respuesta, lo que respalda la transparencia y la confianza.
Seguridad e IA responsable
La seguridad atraviesa cada capa de la solución OneAdvanced AI, una consecuencia directa de atender a los clientes que manejan datos confidenciales a diario en sectores como el de la salud y el legal.
La infraestructura se ejecuta en la región AWS de Londres. Ningún dato de usuario sale del Reino Unido. No se conservan ni se utilizan consultas ni respuestas de usuarios para la capacitación del modelo. Como escribió Nick Heap:
"Un servicio de IA que sólo está alojado en el Reino Unido y los datos no se utilizan para entrenar el modelo de IA y los ingenieros de OneAdvanced no tienen acceso a los datos".
Los documentos cargados en espacios personales y organizacionales están completamente aislados y ni siquiera el personal de OneAdvanced puede leerlos. Llama Guard 4 analiza las entradas de los usuarios en busca de contenido dañino antes de que lleguen al modelo principal. Los controles de privacidad se pueden personalizar a nivel organizacional. En cuanto a la infraestructura, Amazon GuardDuty proporciona detección de amenazas en la capa de almacenamiento de documentos de Amazon S3.
OneAdvanced posee la certificación ISO 42001 para el gobierno de la IA, una certificación que, según informan, se encuentra entre las primeras organizaciones en el Reino Unido y Europa en lograrla. También son signatarios del Pacto de IA de la UE, lo que refleja un enfoque proactivo hacia la IA responsable en todos sus productos y operaciones.
Resultados
A través del compromiso de asesoramiento de AWS, OneAdvanced pasó del prototipo a la producción de una solución de inteligencia artificial soberana del Reino Unido. OneAdvanced implementó Llama 4 Maverick en instancias P5 en la región de Londres, brindándoles control total sobre la infraestructura de servicio de modelos sin que los datos salgan del Reino Unido. Construyeron y enviaron más de 50 agentes de Strands en solo tres semanas, cubriendo casos de uso en atención médica, legal, recursos humanos, marketing y más. La solución ha estado en producción desde julio de 2025 y ha prestado servicio a los clientes durante más de un año. Cumplió con sus métricas de desempeño objetivo. OneAdvanced la lanzó públicamente como la primera IA soberana privada para empresas del Reino Unido, sin que se retengan, entrenen ni registren datos de usuario. El compromiso recibió una puntuación de satisfacción del cliente de 5/5.
"Realmente apreciamos y disfrutamos el compromiso. Aprendimos mucho, lo que nos ayudó a lanzar una oferta única al mercado impulsada y respaldada por nuestro socio estratégico. Muchas gracias a todos los involucrados directa e indirectamente".
— Alex Savage, jefe de integración, OneAdvanced
Conclusión y próximos pasos
En esta publicación, mostramos cómo OneAdvanced creó una solución de IA soberana del Reino Unido mediante el autohospedaje de Llama 4 Maverick y Llama Guard 4 en Amazon SageMaker AI, orquestando más de 50 agentes especializados con Strands Agents SDK en Amazon ECS y basando las respuestas en documentos de clientes a través de un canal RAG respaldado por pgvector. El resultado es una solución de IA de producción que cumple con estrictos requisitos de soberanía de datos y al mismo tiempo ofrece capacidades prácticas de IA a clientes empresariales en industrias reguladas.
OneAdvanced ha implementado recientemente un marco de evaluación utilizando LLM-as-a-juez con análisis de sentimiento para la mejora continua de la calidad. Su hoja de ruta también incluye sistemas backend para ayudar a los usuarios a perfeccionar sus indicaciones y ejecutar modelos LLM paralelos durante las transiciones de versiones para mantener la estabilidad para los usuarios finales.
Si está considerando un enfoque similar, comience evaluando sus requisitos de soberanía de datos e identificando qué modelos necesita autohospedar. OneAdvanced comenzó con un prototipo de dos semanas en Amazon Bedrock para validar sus casos de uso antes de comprometerse con una infraestructura autohospedada. Para obtener más información sobre la implementación de modelos en Amazon SageMaker AI, consulte la Guía para desarrolladores de Amazon SageMaker AI. Para comenzar con flujos de trabajo agentes, visite el SDK de Strands Agents en GitHub.
Para leer más sobre el viaje de OneAdvanced en la construcción de su solución de IA, consulte la publicación de Nick Heap La carrera de la IA y cómo adoptamos plenamente la velocidad en el blog de carreras de OneAdvanced.
Si tiene un caso de uso similar y desea explorar la implementación soberana de IA en AWS, comuníquese con su equipo de cuentas de AWS.