Las organizaciones de Tailandia, Malasia, Singapur, Indonesia y Taiwán ahora pueden acceder a Anthropic Claude Opus 4.6, Sonnet 4.6 y Claude Haiku 4.5 a través de la inferencia global entre regiones (CRIS) en Amazon Bedrock, lo que ofrece modelos básicos a través de una arquitectura de inferencia distribuida globalmente diseñada para escalar. Global CRIS ofrece tres ventajas clave: cuotas más altas, rentabilidad y enrutamiento inteligente de solicitudes para capacidad de inferencia en todas las regiones comerciales de AWS para permitir casos de uso de IA como chatbots, agentes de codificación autónomos y sistemas de análisis financiero para los clientes.
En esta publicación, nos complace anunciar la disponibilidad de Global CRIS para clientes en Tailandia, Malasia, Singapur, Indonesia y Taiwán, ofrecer un recorrido por los pasos de implementación técnica y cubrir las mejores prácticas de gestión de cuotas para maximizar el valor de sus implementaciones de inferencia de IA. También brindamos orientación sobre las mejores prácticas para implementaciones de producción.
Inferencia global entre regiones
CRIS es una poderosa capacidad de Amazon Bedrock que las organizaciones pueden utilizar para distribuir sin problemas el procesamiento de inferencia en múltiples regiones de AWS. Esta capacidad le ayuda a lograr un mayor rendimiento mientras construye a escala, lo que ayuda a garantizar que sus aplicaciones de IA generativa sigan siendo receptivas y confiables incluso bajo cargas pesadas.
Se accede a CRIS a través de perfiles de inferencia, que operan sobre dos conceptos clave:
Región de origen: la región desde la que realiza la solicitud de API. Región de destino: una región a la que Amazon Bedrock puede enrutar la solicitud de inferencia.
CRIS opera a través de la red segura de AWS con cifrado de extremo a extremo tanto para los datos en tránsito como en reposo. Cuando envía una solicitud de inferencia desde una región de origen, CRIS enruta de forma inteligente la solicitud a una de las regiones de destino configuradas para el perfil de inferencia a través de la red administrada de Amazon Bedrock. La solicitud de inferencia viaja a través de la red global de AWS a través de Bedrock y las respuestas se devuelven a su aplicación en la región de origen.
La distinción clave es que, si bien el procesamiento de inferencia (el cálculo transitorio) puede ocurrir en otra región, los datos en reposo (incluidos registros, bases de conocimiento y configuraciones almacenadas) permanecen exclusivamente dentro de su región de origen. Amazon Bedrock proporciona dos tipos de perfiles de inferencia entre regiones: CRIS geográfico (que enruta dentro de una geografía específica, como EE. UU., UE, APAC, Australia y Japón) y CRIS global (que enruta a regiones comerciales admitidas en todo el mundo). Los clientes de Tailandia, Malasia, Singapur, Taiwán e Indonesia ahora pueden acceder a Claude Opus 4.6, Sonnet 4.6 y Haiku 4.5 a través de Global CRIS, que enruta las solicitudes entre regiones para lograr un mayor rendimiento y una resiliencia integrada durante los picos de tráfico.
Por qué CRIS global para Tailandia, Malasia, Singapur, Taiwán e Indonesia
A medida que las organizaciones pasan de asistentes de IA conversacionales a agentes autónomos que planifican, ejecutan y coordinan flujos de trabajo complejos, las implementaciones de IA de producción requieren una infraestructura más resiliente y escalable. Global CRIS ofrece Claude Opus 4.6, Sonnet 4.6 y Haiku 4.5 a través de una arquitectura de alta disponibilidad diseñada para satisfacer las demandas de este cambio hacia sistemas autónomos a escala de producción. A medida que los agentes autónomos manejan cada vez más las operaciones comerciales, coordinan redes logísticas y automatizan los flujos de trabajo financieros en casos de uso para clientes en Tailandia, Malasia, Singapur, Taiwán e Indonesia, la confiabilidad de la infraestructura impacta directamente la continuidad de estos sistemas autónomos de toma de decisiones. CRIS global enruta las solicitudes de inferencia a través de una mayor capacidad de inferencia en las regiones de AWS de todo el mundo, lo que reduce la probabilidad de que sus aplicaciones experimenten una limitación del servicio durante los picos de tráfico. Esta capacidad de enrutamiento ofrece resiliencia incorporada, lo que permite que sus aplicaciones agentes mantengan la continuidad operativa incluso cuando cambian los patrones de demanda.
Configuración de regiones de origen en Tailandia, Malasia, Singapur, Taiwán e Indonesia
En el lanzamiento, los clientes de Tailandia, Malasia, Singapur, Taiwán e Indonesia pueden llamar a los perfiles de Global CRIS desde las siguientes regiones de origen:
Región de origen Regiones comerciales de AWS Disponibilidad Enrutamiento CRIS global Asia Pacífico (Singapur) ap-southeast-1 Disponible ahora Rutas a más de 20 regiones comerciales de AWS admitidas a nivel mundial Asia Pacífico (Yakarta) ap-southeast-3 Disponible ahora Rutas a más de 20 regiones comerciales de AWS admitidas a nivel mundial Asia Pacífico (Taipei) ap-east-2 Disponible ahora Rutas a más de 20 regiones comerciales de AWS admitidas a nivel mundial Asia Pacífico (Tailandia) ap-southeast-7 Disponible ahora Rutas a más de 20 regiones comerciales de AWS compatibles a nivel mundial Asia Pacífico (Malasia) ap-southeast-5 Disponible ahora Rutas a más de 20 regiones comerciales de AWS compatibles a nivel mundial
Una vez invocado entre bastidores, Global CRIS gestionará el enrutamiento de solicitudes a cualquier región comercial de AWS admitida.
Requisitos previos
Antes de utilizar Global CRIS, debe configurar permisos de IAM que permitan el enrutamiento entre regiones para sus solicitudes de inferencia.
Configurar permisos de IAM
Antes de poder invocar modelos de Claude a través de Global CRIS, debe configurar permisos de IAM que tengan en cuenta la arquitectura de enrutamiento entre regiones. La siguiente sección recorre la estructura de la política y explica por qué se requieren tres declaraciones separadas.
Complete los siguientes pasos para configurar los permisos de IAM para Global CRIS. La política de IAM otorga permiso para invocar modelos de Claude a través de Global CRIS. La política requiere tres declaraciones porque CRIS enruta solicitudes entre regiones: usted llama al perfil de inferencia en su región de origen (Singapur o Yakarta), que luego invoca el modelo básico en cualquier región de destino que seleccione CRIS. La tercera declaración utiliza "aws:RequestedRegion": "unspecified" para otorgar los permisos necesarios para que Global CRIS enrute sus solicitudes entre regiones.
Reemplace con su ID de cuenta de AWS y ajuste la región de origen si usa Yakarta (ap-southeast-3) en lugar de Singapur (ap-southeast-1).
Es importante tener en cuenta que si las políticas de control de servicios (SCP) de su organización niegan el acceso a regiones no especificadas, Global CRIS no funcionará. Recomendamos validar su configuración de SCP antes de implementar cargas de trabajo de producción que dependen del enrutamiento global.
Si su organización restringe las llamadas a la API de AWS a regiones específicas, asegúrese de que su SCP incluya "no especificado" en la lista de regiones aprobadas. El siguiente ejemplo muestra cómo configurar un SCP que permita el enrutamiento CRIS global. Agregue su región de origen para CRIS global (Singapur ap-southeast-1 o Yakarta ap-southeast-3) junto con otras regiones que utiliza su organización:
Con los permisos de IAM configurados, puede comenzar a invocar modelos de Claude a través de Global CRIS utilizando perfiles de inferencia y la API de Converse.
Usar perfiles de inferencia entre regiones
Los perfiles de inferencia globales se identifican por lo global. prefijo en su identificador de modelo: una convención de nomenclatura que puede utilizar para distinguir los perfiles de enrutamiento global de los ID de modelo regionales o de una sola región. Utilice estos ID de perfil de inferencia al realizar llamadas API en lugar de los ID de modelo estándar:
Modelo ID del modelo base ID del perfil de inferencia global Claude Sonnet 4.6 anthropic.claude-sonnet-4-6 global.anthropic.claude-sonnet-4-6 Claude Opus 4.6 anthropic.claude-opus-4-6-v1 global.anthropic.claude-opus-4-6-v1 Claude Sonnet 4.5 anthropic.claude-sonnet-4-5-20250929-v1:0 global.anthropic.claude-sonnet-4-5-20250929-v1:0 Claude Haiku 4.5 anthropic.claude-haiku-4-5-20251001-v1:0 global.anthropic.claude-haiku-4-5-20251001-v1:0
Tanto la API de InvokeModel como la de Converse admiten perfiles de inferencia entre regiones. Recomendamos utilizar la API de Converse: este enfoque proporciona una interfaz simplificada y un formato de solicitud/respuesta consistente en diferentes modelos básicos, para que pueda cambiar entre modelos sin tener que reescribir el código de integración.
Haz tu primera llamada API
Comenzar con Global CRIS requiere solo unos pocos cambios en el código de su aplicación existente. El siguiente fragmento de código demuestra cómo invocar Claude Opus 4.6 usando Global CRIS en Python con el SDK de boto3:
Si es la primera vez que trabaja con una capacidad entre regiones, es posible que espere que el enrutamiento de solicitudes a múltiples regiones complique su configuración de monitoreo. Con Global CRIS, ese no es el caso. Sus métricas de Amazon CloudWatch, registros de CloudWatch y registros de auditoría de AWS CloudTrail permanecen en su región de origen, incluso cuando las solicitudes de inferencia se procesan en otro lugar. Sus paneles, alarmas y registros de auditoría existentes continúan funcionando exactamente como lo hacen hoy.
Para obtener más información sobre la API de Converse y los parámetros disponibles, consulte la Referencia de la API de Amazon Bedrock. Sobre la base de esta base, exploremos estrategias de administración de cuotas para asegurarnos de que su implementación pueda escalar con la demanda.
Gestión de cuotas
A medida que su aplicación pasa del prototipo a la producción, comprender y administrar las cuotas de servicio se vuelve fundamental para mantener un rendimiento constante. Esta sección cubre cómo funcionan las cuotas, cómo monitorear su uso y cómo solicitar aumentos cuando sea necesario.
La siguiente figura muestra la página Cuotas de servicio de Amazon Bedrock en la consola de AWS, donde puede ver los valores de cuota aplicados a nivel de cuenta para los perfiles de inferencia de CRIS global.
Comprender las cuotas y planificar la escala
Comprender las cuotas y planificar la escala es el primer paso para garantizar que su implementación de Global CRIS pueda manejar el tráfico de producción sin limitaciones. Amazon Bedrock aplica cuotas de servicios para facilitar la asignación justa de recursos y la estabilidad del sistema. Esta consideración se vuelve crítica a medida que su aplicación pasa del prototipo a la producción. Para Global CRIS, las cuotas se miden en dos dimensiones, cada una de las cuales tiene un propósito distinto en la gestión de la capacidad:
Tokens por minuto (TPM): la cantidad máxima de tokens (entrada + salida) que se pueden procesar por minuto Solicitudes por minuto (RPM): la cantidad máxima de solicitudes de inferencia que se pueden realizar por minuto
Las cuotas predeterminadas varían según el modelo y se asignan por región de origen. Puede ver sus cuotas actuales en la consola de Cuotas de servicio de AWS navegando a las cuotas de servicio de Amazon Bedrock en su región de origen (Singapur o Yakarta).
Tenga en cuenta que Amazon Bedrock utiliza una tasa de consumo de tokens que pesa más los tokens de salida que los tokens de entrada al calcular el consumo de cuota. La tasa de quemado es de 5:1: los tokens de salida consumen cinco veces más cuota que los tokens de entrada porque generar tokens requiere más cálculo que procesar la entrada.
Consumo de cuota = Tokens de entrada + (Tokens de salida × 5)
Por ejemplo, si su solicitud utiliza 10 000 tokens de entrada y genera 5000 tokens de salida:
Consumo total de cuota = 10.000 + (5.000 × 5) = 35.000 tokens
La solicitud consume 35 000 tokens de su cuota de TPM para fines de limitación. Al planificar los requisitos de capacidad y solicitar aumentos de cuota, debe tener en cuenta esta tasa de avance en sus cálculos. Si su aplicación procesa solicitudes con este mismo patrón de token a 100 solicitudes por minuto, el consumo total de cuota sería de 3 500 000 TPM (100 solicitudes × 35 000 tokens por solicitud). Cuando trabaje con su administrador de cuentas de AWS en solicitudes de aumento de cuota, proporcione el volumen de solicitudes esperado, los tokens de entrada promedio por solicitud y los tokens de salida promedio por solicitud para que puedan calcular la asignación de cuota adecuada utilizando este multiplicador de consumo.
Gestionar cuotas de forma eficaz
Recomendamos configurar alarmas de CloudWatch con una utilización de la cuota del 70 % al 80 % para solicitar aumentos antes de alcanzar los límites de limitación. Las métricas de CloudWatch InputTokenCount y OutputTokenCount rastrean su consumo en tiempo real, mientras que la métrica InvocationClientErrors indica la limitación cuando aumenta, lo que proporciona señales de alerta temprana para la planificación de la capacidad. Para obtener orientación detallada sobre las métricas disponibles y cómo configurar el monitoreo para sus cargas de trabajo de Bedrock, consulte Monitoreo del rendimiento de Amazon Bedrock.
Para cargas de trabajo que no dependen del tiempo, Claude Haiku 4.5 admite la inferencia por lotes con un ahorro de costos del 50 %. Las solicitudes por lotes se procesan de forma asíncrona en un plazo de 24 horas y no cuentan para su cuota de TPM en tiempo real.
Solicitar aumentos de cuota
Considere los siguientes factores al determinar si necesita aumentos de cuota: escala de carga de trabajo (solicitudes por minuto durante el tráfico pico), proporción de tokens de producción (la generación de alta producción consume la cuota más rápido) y proyecciones de crecimiento (representan las necesidades de escalamiento de 6 a 12 meses). Si su carga de trabajo requiere cuotas que superan los límites predeterminados, puede solicitar aumentos a través de la consola de cuotas de servicio de AWS.
Complete los siguientes pasos para solicitar aumentos de cuota a través de la consola de AWS Service Quotas:
Inicie sesión en la Consola de administración de AWS para las cuotas de servicios de AWS en su región de origen. Navegue hasta los servicios de AWS y seleccione Amazon Bedrock. Busque tokens de inferencia de modelos globales entre regiones por minuto para su modelo específico. Seleccione la cuota y elija Solicitar aumento a nivel de cuenta. Ingrese el valor de su cuota deseada con la justificación del aumento. Envíe la solicitud de revisión de AWS.
Planifique con anticipación cuando solicite aumentos de cuota para ayudar a garantizar que la capacidad esté disponible antes de su lanzamiento o eventos de escalamiento. Para implementaciones a gran escala o lanzamientos urgentes, recomendamos trabajar con el equipo de su cuenta de AWS para ayudar a garantizar una planificación de capacidad adecuada y una revisión acelerada. Con las estrategias de gestión de cuotas implementadas, exploremos cómo elegir entre Opus 4.6, Sonnet 4.6 y Haiku 4.5 para sus casos de uso específicos.
Migración de Claude 3.x a Claude 4.5 / 4.6
La migración de Claude 3.x a Claude 4.5 / 4.6 representa un salto tecnológico sustancial para las organizaciones que utilizan las versiones Opus, Sonnet o Haiku. La arquitectura de razonamiento híbrido de Claude introduce mejoras sustanciales en la integración de herramientas, la gestión de la memoria y las capacidades de procesamiento de contexto.
Para obtener más orientación técnica sobre implementación, consulte la publicación del blog de AWS, Migración de Claude Sonnet 3.x de Anthropic a Claude Sonnet 4.x en Amazon Bedrock, que proporciona las mejores prácticas esenciales que también son válidas para la migración al nuevo modelo Claude Sonnet 4.6. Además, la documentación de migración de Anthropic ofrece estrategias de optimización específicas del modelo y consideraciones para la transición a los modelos Claude 4.5/4.6.
Mejores prácticas
Considere las siguientes técnicas de optimización para maximizar el rendimiento y minimizar los costos de sus cargas de trabajo:
1. Solicitar almacenamiento en caché para contexto repetido
El almacenamiento en caché rápido ofrece hasta un 90 % de reducción de costos en tokens almacenados en caché y hasta un 85 % de mejora de la latencia para cargas de trabajo que utilizan repetidamente el mismo contexto. El sistema de caché solicita más de 500 tokens, contenido de documentación, ejemplos breves y definiciones de herramientas. Primero estructure las solicitudes con contenido estático, seguido de consultas dinámicas. Consulte Solicitar almacenamiento en caché para una inferencia de modelos más rápida Guía del usuario para obtener detalles de implementación.
2. Estrategia de selección de modelo
Considere la complejidad de las tareas, los requisitos de latencia, las limitaciones de costos y las necesidades de precisión al elegir entre modelos. Recomendamos Claude Opus 4.6 para las tareas más complejas que requieren inteligencia de frontera, como razonamiento complejo de varios pasos, agentes autónomos sofisticados y análisis de precisión crítica. Claude Sonnet 4.6 es ideal para problemas complejos que requieren planificación y ejecución de agentes. Claude Haiku 4.5 ofrece un rendimiento cercano a la frontera a un costo menor, lo que lo hace óptimo para operaciones de gran volumen y experiencias sensibles a la latencia. Para arquitecturas multiagente, considere usar Opus 4.6 o Sonnet 4.6 como orquestador y Haiku 4.5 para trabajadores de ejecución paralela.
3. Pensamiento adaptativo y extendido para tareas complejas
Claude Opus 4.6 apoya el pensamiento adaptativo, una evolución del pensamiento extendido que le da a Claude la libertad de pensar si determina que se requiere razonamiento. Puedes guiar la cantidad de pensamiento que asigna Claude utilizando el parámetro de esfuerzo, optimizando tanto el rendimiento como la velocidad. Sonnet 4.6 y Haiku 4.5 admiten el pensamiento extendido, donde el modelo genera pasos de razonamiento intermedios mediante la descomposición del problema, la autocorrección y la exploración de múltiples caminos de solución. Estas capacidades de pensamiento ofrecen mejoras en la precisión en tareas de razonamiento complejas, así que habilítelas de forma selectiva cuando las mejoras en la precisión justifiquen el uso de cuota adicional.
4. Pruebas de carga para validación de cuotas
Ejecute pruebas de carga antes del lanzamiento de la producción para medir el consumo de cuota real en condiciones de tráfico pico. Configure su cliente de prueba con el modo de reintento adaptativo (Config(retries={'mode': 'adaptive'})) para manejar la limitación durante la prueba, use herramientas como Locust o boto3 con subprocesos para simular solicitudes simultáneas y supervise las métricas de CloudWatch durante la prueba de carga para observar los patrones de consumo de TPM y RPM. Una prueba con 20 subprocesos simultáneos que realizan solicitudes continuas revelará rápidamente si la asignación de su cuota coincide con la carga esperada.
Resumen y próximos pasos
La inferencia global entre regiones en Amazon Bedrock ofrece los modelos Claude Opus 4.6, Sonnet 4.6 y Haiku 4.5 a organizaciones en Tailandia, Malasia, Singapur, Taiwán e Indonesia con dos ventajas clave: ahorro de costos en comparación con los perfiles regionales y enrutamiento inteligente en más de 20 regiones de AWS para máxima disponibilidad y escala.
Esta infraestructura permite la producción de aplicaciones de IA en todo el sudeste asiático, desde servicio al cliente en tiempo real hasta análisis financiero y asistentes de codificación autónomos. Claude Opus 4.6 proporciona inteligencia para las cargas de trabajo empresariales más exigentes, Sonnet 4.6 ofrece un rendimiento equilibrado para casos de uso de producción diaria y Haiku 4.5 permite operaciones rentables de gran volumen. Para arquitecturas multiagente, combine estos modelos para optimizar tanto la calidad como la economía.
Lo alentamos a comenzar hoy con la inferencia global entre regiones en sus aplicaciones. Complete los siguientes pasos para comenzar:
Inicie sesión en la consola de Amazon Bedrock en cualquiera de las regiones de origen enumeradas anteriormente, por ejemplo, Singapur (ap-southeast-1) o Yakarta (ap-southeast-3). Configure los permisos de IAM utilizando la plantilla de política proporcionada en esta publicación. Realice su primera llamada API utilizando el ID del perfil de inferencia global. Implemente el almacenamiento en caché rápido para ahorrar costos en contextos repetidos.
Para más información: