La creación de aplicaciones de IA con Amazon Bedrock presenta desafíos de rendimiento que afectan la escalabilidad de sus aplicaciones. La inferencia global entre regiones en la región de AWS af-south-1 cambia eso. Ahora puede invocar modelos de la región de Ciudad del Cabo mientras Amazon Bedrock enruta automáticamente las solicitudes a regiones con capacidad disponible. Sus aplicaciones obtienen tiempos de respuesta consistentes, sus usuarios obtienen experiencias confiables y sus registros de Amazon CloudWatch y AWS CloudTrail permanecen centralizados en af-south-1.
La inferencia global entre regiones con Anthropic Claude Sonnet 4.5, Haiku 4.5 y Opus 4.5 en Amazon Bedrock en la región de Ciudad del Cabo (af-south-1) le brinda acceso a la familia de modelos Claude 4.5. Los clientes sudafricanos ahora pueden utilizar perfiles de inferencia global para acceder a estos modelos con mayor rendimiento y resiliencia. La inferencia global entre regiones enruta solicitudes a regiones comerciales admitidas en todo el mundo, optimizando los recursos y permitiendo un mayor rendimiento, particularmente valioso durante los momentos de mayor uso. La característica admite el almacenamiento en caché de avisos de Amazon Bedrock, la inferencia por lotes, Amazon Bedrock Guardrails, las bases de conocimientos de Amazon Bedrock y más.
En esta publicación, analizamos cómo la inferencia global entre regiones enruta las solicitudes y dónde residen sus datos, luego le mostramos cómo configurar los permisos requeridos de AWS Identity and Access Management (IAM) e invocar los modelos Claude 4.5 utilizando el perfil de inferencia global Nombre de recurso de Amazon (ARN). También cubrimos cómo solicitar aumentos de cuota para su carga de trabajo. Al final, tendrá una implementación funcional de la inferencia global entre regiones en af-south-1.
Comprender la inferencia entre regiones
La inferencia entre regiones es una característica poderosa que las organizaciones pueden utilizar para distribuir sin problemas el procesamiento de inferencia en múltiples regiones. Esta capacidad le ayuda a obtener un mayor rendimiento mientras construye a escala, lo que permite que sus aplicaciones de IA generativa sigan siendo receptivas y confiables incluso bajo cargas pesadas.
Un perfil de inferencia en Amazon Bedrock define un modelo básico (FM) y una o más regiones a las que puede enrutar solicitudes de invocación de modelo. Los perfiles de inferencia operan sobre dos conceptos clave:
Región de origen: la región desde la que se realiza la solicitud de API. Región de destino: una región a la que Amazon Bedrock puede enrutar la solicitud de inferencia.
La inferencia entre regiones opera a través de la red segura de AWS con cifrado de extremo a extremo tanto para los datos en tránsito como en reposo. Cuando un cliente envía una solicitud de inferencia desde una región de origen, la inferencia entre regiones enruta de forma inteligente la solicitud a una de las regiones de destino configuradas para el perfil de inferencia a través de la red administrada de Amazon Bedrock.
La distinción clave es que, si bien el procesamiento de inferencia (el cálculo transitorio) puede ocurrir en otra Región, los datos en reposo (incluidos registros, bases de conocimiento y configuraciones almacenadas) están diseñados para permanecer dentro de su Región de origen. Las solicitudes viajan a través de la red global de AWS administrada por Bedrock. Los datos transmitidos durante la inferencia entre regiones se cifran y permanecen dentro de la red segura de AWS. La información confidencial está diseñada para permanecer protegida durante todo el proceso de inferencia, independientemente de qué región maneje la solicitud, y las respuestas cifradas se devuelven a su aplicación en su región de origen.
Amazon Bedrock proporciona dos tipos de perfiles de inferencia entre regiones:
Inferencia geográfica entre regiones: Amazon Bedrock selecciona automáticamente la región comercial óptima dentro de una geografía definida (EE. UU., UE, Australia y Japón) para procesar su solicitud de inferencia. (Recomendado para casos de uso con necesidades de residencia de datos). Inferencia global entre regiones: la inferencia global entre regiones mejora aún más la inferencia entre regiones al permitir el enrutamiento de solicitudes de inferencia a regiones comerciales admitidas en todo el mundo, optimizando los recursos disponibles y permitiendo un mayor rendimiento del modelo. (Recomendado para casos de uso que no tienen necesidades de residencia de datos).
Monitoreo y registro
Con la inferencia global entre regiones de af-south-1, sus solicitudes se pueden procesar en cualquier lugar de la infraestructura global de AWS. Sin embargo, los registros de Amazon CloudWatch y AWS CloudTrail se registran en af-south-1, lo que simplifica el monitoreo al mantener sus registros en un solo lugar.
Seguridad de datos y cumplimiento
La seguridad y el cumplimiento son una responsabilidad compartida entre AWS y cada cliente. La inferencia global entre regiones está diseñada para mantener la seguridad de los datos. Los datos transmitidos durante la inferencia entre regiones están cifrados por Amazon Bedrock y están diseñados para permanecer dentro de la red segura de AWS. La información confidencial permanece protegida durante todo el proceso de inferencia, independientemente de qué región procese la solicitud. Los clientes son responsables de configurar sus aplicaciones y políticas de IAM de manera adecuada y de evaluar si la inferencia global entre regiones cumple con sus requisitos específicos de seguridad y cumplimiento. Debido a que la inferencia global entre regiones dirige las solicitudes a regiones comerciales admitidas en todo el mundo, debe evaluar si este enfoque se alinea con sus obligaciones regulatorias, incluida la Ley de Protección de Información Personal (POPIA) y otros requisitos específicos del sector. Recomendamos consultar con sus equipos legales y de cumplimiento para determinar el enfoque adecuado para sus casos de uso específicos.
Implementar inferencia global entre regiones
Para utilizar la inferencia global entre regiones con los modelos Claude 4.5, los desarrolladores deben completar los siguientes pasos clave:
Utilice el ID del perfil de inferencia global: al realizar llamadas API a Amazon Bedrock, especifique el ID del perfil de inferencia global del modelo Claude 4.5 (por ejemplo, global.anthropic.claude-opus-4-5-20251101-v1:0). Esto funciona con las API InvokeModel y Converse. Configurar permisos de IAM: conceda permisos de IAM para acceder al perfil de inferencia y a los FM en posibles regiones de destino. En la siguiente sección, proporcionamos más detalles. También puede leer más sobre los requisitos previos para los perfiles de inferencia.
Implementar la inferencia global entre regiones con los modelos Claude 4.5 es sencillo y solo requiere algunos cambios en el código de su aplicación existente. El siguiente es un ejemplo de cómo actualizar su código en Python:
Si utiliza la API de Amazon Bedrock InvokeModel, puede cambiar rápidamente a un modelo diferente cambiando el ID del modelo, como se muestra en los ejemplos de código del modelo Invoke.
Requisitos de política de IAM para la inferencia global entre regiones
La inferencia global entre regiones requiere tres permisos específicos porque el mecanismo de enrutamiento abarca múltiples ámbitos: su perfil de inferencia regional, la definición de FM en su región de origen y la definición de FM a nivel global. Sin estos tres, el servicio no puede resolver el modelo, validar su acceso y enrutar solicitudes entre regiones. El acceso a los modelos Anthropic requiere el envío de un caso de uso antes de invocar un modelo. Este envío se puede completar a nivel de cuenta individual o de forma centralizada a través de la cuenta de administración de la organización. Para enviar su caso de uso, utilice la API PutUseCaseForModelAccess o seleccione un modelo Anthropic del catálogo de modelos en la Consola de administración de AWS para Amazon Bedrock. Se requieren permisos de AWS Marketplace para habilitar modelos y se pueden limitar a ID de productos específicos cuando sea compatible.
El siguiente ejemplo de política de IAM proporciona control granular:
La política consta de tres partes. La primera declaración otorga acceso al perfil de inferencia regional en af-south-1, de modo que los usuarios puedan invocar el perfil de inferencia global entre regiones especificado desde Sudáfrica. La segunda declaración proporciona acceso al recurso FM regional, que el servicio necesita para comprender qué modelo se solicita dentro del contexto regional. La tercera declaración otorga acceso al recurso FM global, lo que permite que funcione el enrutamiento entre regiones.
Al implementar estas políticas, verifique que los tres ARN estén incluidos:
El ARN del perfil de inferencia regional sigue el patrón arn:aws:bedrock:af-south-1::inference-profile/global. . Esto otorga acceso al perfil de inferencia global en su región de origen. La FM regional utiliza arn:aws:bedrock:af-south-1::foundation-model/ . Esto otorga acceso a la definición del modelo en af-south-1. El FM global requiere arn:aws:bedrock:::foundation-model/ . Esto otorga acceso al modelo en todas las regiones; tenga en cuenta que este ARN omite intencionalmente los segmentos de región y cuenta para permitir el enrutamiento entre regiones.
El ARN de FM global no tiene ninguna región o cuenta especificada, lo cual es intencional y necesario para la funcionalidad entre regiones.
Nota importante sobre las políticas de control de servicios (SCP): si su organización utiliza SCP específicas de una región, verifique que "aws:RequestedRegion": "unspecified" no esté incluido en la lista de regiones denegadas, porque las solicitudes de inferencia global entre regiones utilizan este valor de región. Las organizaciones que utilicen SCP restrictivos que denieguen múltiples regiones, excepto las específicamente aprobadas, deberán permitir explícitamente este valor para habilitar la funcionalidad de inferencia global entre regiones.
Si su organización determina que la inferencia global entre regiones no es adecuada para determinadas cargas de trabajo debido a la residencia de datos o los requisitos de cumplimiento, puede desactivarla mediante uno de dos enfoques:
Eliminar permisos de IAM: elimine una o más de las tres declaraciones de política de IAM requeridas. Debido a que la inferencia global entre regiones requiere que las tres declaraciones funcionen, eliminar una de estas declaraciones hace que las solicitudes al perfil de inferencia global devuelvan un error de acceso denegado. Implemente una política de denegación explícita: cree una política de denegación que se dirija específicamente a perfiles de inferencia globales entre regiones utilizando la condición "aws:RequestedRegion": "unspecified". Este enfoque documenta claramente su intención de seguridad y la denegación explícita tiene prioridad incluso si las políticas de permiso se agregan accidentalmente más adelante.
Solicitar aumentos en el límite para la inferencia global entre regiones
Al utilizar perfiles de inferencia globales entre regiones de af-south-1, puede solicitar aumentos de cuota a través de la consola de cuotas de servicios de AWS. Debido a que se trata de un límite global, las solicitudes deben realizarse en su región de origen (af-south-1).
Antes de solicitar un aumento, calcule su cuota requerida utilizando la tasa de avance de su modelo. Para Sonnet 4.5 y Haiku 4.5, los tokens de salida tienen una tasa de consumo cinco veces mayor (cada token de salida consume 5 tokens de su cuota), mientras que los tokens de entrada mantienen una proporción de 1:1. Su consumo total de tokens por solicitud es:
Para solicitar un aumento de límite:
Inicie sesión en la consola de AWS Service Quotas en af-south-1. En el panel de navegación, elija servicios de AWS. Busque y elija Amazon Bedrock. Busque cuotas de inferencia globales entre regiones específicas (por ejemplo, tokens de inferencia de modelo global entre regiones por minuto para Claude Sonnet 4.5 V1). Seleccione la cuota y elija Solicitar aumento a nivel de cuenta. Ingrese el valor de cuota que desee y envíe la solicitud.
Conclusión
La inferencia global entre regiones también trae la familia de modelos Claude 4.5 a la región de Ciudad del Cabo, brindándole acceso a las mismas capacidades disponibles en otras regiones. Puede compilar con Sonnet 4.5, Haiku 4.5 y Opus 4.5 desde su región local mientras la infraestructura de enrutamiento maneja la distribución de manera transparente. Para comenzar, actualice sus aplicaciones para utilizar el ID del perfil de inferencia global, configure los permisos de IAM adecuados y supervise el rendimiento a medida que sus aplicaciones utilizan la infraestructura mundial de AWS. Visite la consola de Amazon Bedrock y explore cómo la inferencia global entre regiones puede mejorar sus aplicaciones de IA. Para obtener más información, consulte los siguientes recursos:
Sobre los autores
Christian Kamwangala es arquitecto de soluciones especializado en IA/ML e IA generativa en AWS, donde se asocia con clientes empresariales para diseñar, optimizar e implementar soluciones de IA de nivel de producción. Su experiencia radica en la optimización de la inferencia: equilibrar el rendimiento, el costo y la latencia para implementaciones a gran escala. Fuera del trabajo, le gusta explorar la naturaleza y pasar tiempo con familiares y amigos.
Jarryd Konar es ingeniero sénior de soporte en la nube en AWS, con sede en Ciudad del Cabo, Sudáfrica. Se especializa en ayudar a los clientes a diseñar, optimizar y operar IA/ML y cargas de trabajo de IA generativa en la nube. Jarryd trabaja en estrecha colaboración con los clientes para implementar las mejores prácticas en toda la cartera de servicios de IA/ML de AWS, convirtiendo requisitos técnicos complejos en soluciones prácticas y escalables. Le apasiona construir sistemas de IA sostenibles y seguros que empoderen tanto a los clientes como a los equipos.
Melanie Li PhD, es arquitecta sénior de soluciones especializada en IA generativa en AWS con sede en Sydney, Australia, donde se centra en trabajar con los clientes para crear soluciones utilizando herramientas de IA/ML de última generación. Ha participado activamente en múltiples iniciativas de IA generativa en APJ, aprovechando el poder de los LLM. Antes de unirse a AWS, el Dr. Li ocupó puestos de ciencia de datos en las industrias financiera y minorista.
Saurabh Trikande es gerente senior de productos de Amazon Bedrock y Amazon SageMaker Inference. Le apasiona trabajar con clientes y socios, motivado por el objetivo de democratizar la IA. Se centra en los desafíos principales relacionados con la implementación de aplicaciones complejas de IA, la inferencia con modelos multiinquilino, la optimización de costos y hacer más accesible la implementación de modelos generativos de IA. En su tiempo libre, Saurabh disfruta hacer senderismo, aprender sobre tecnologías innovadoras, seguir TechCrunch y pasar tiempo con su familia.
Jared Dean es arquitecto principal de soluciones de IA/ML en AWS. Jared trabaja con clientes de todos los sectores para desarrollar aplicaciones de aprendizaje automático que mejoren la eficiencia. Está interesado en todo lo relacionado con la inteligencia artificial, la tecnología y la barbacoa.