Comience con OpenAI GPT-5.6 Sol, Terra y Luna en Amazon Bedrock

Esta publicación está coescrita con Chris Dickens de OpenAI.

Los desarrolladores que crean codificación agente, razonamiento a largo plazo y cargas de trabajo de inferencia de gran volumen quieren modelos de frontera que puedan llamar a través de API familiares, sin operar una infraestructura de modelo separada. OpenAI GPT-5.6 Sol, Terra y Luna ahora están disponibles de forma general en Amazon Bedrock. Los tres modelos cubren cargas de trabajo, desde agentes de codificación autónomos y razonamiento a largo plazo hasta inferencias de gran volumen sensibles a la latencia, y se ejecutan con la seguridad, el procesamiento regional y los controles de costos de AWS.

Puede acceder a los tres modelos a través de la API OpenAI Responses en el punto final de Bedrock-Mantle. Sol es el modelo de razonamiento emblemático, Terra equilibra el rendimiento y el costo para el trabajo de producción diario y Luna está optimizado para una inferencia rápida y de bajo costo, de modo que pueda ajustar la capacidad y el costo adecuados para cada carga de trabajo. Los precios coinciden con las tarifas propias de OpenAI y el uso cuenta para sus compromisos existentes de AWS.

En esta publicación, le mostramos cómo seleccionar un modelo, ejecutar su primera inferencia a través de la API de Responses, reducir el costo con el almacenamiento en caché rápido y medir el uso de tokens almacenados en caché, conectar el agente de codificación OpenAI Codex y planificar cuotas y escalamiento. Sus indicaciones y completaciones no se utilizan para entrenar ningún modelo y no se comparten con el proveedor del modelo.

La familia GPT-5.6 en Amazon Bedrock

GPT-5.6 introduce un sistema de nombres de OpenAI donde el número identifica la generación y los nombres Sol, Terra y Luna identifican niveles de capacidad duraderos que pueden avanzar a su propia cadencia. La siguiente tabla resume las especificaciones clave para cada modelo en Amazon Bedrock.

Modelo ID de modelo Más adecuado para regiones de AWS Sol openai.gpt-5.6-sol Codificación autónoma, investigación de seguridad, análisis científico y razonamiento profundo de varios pasos Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio) Terra openai.gpt-5.6-terra Cargas de trabajo de producción de uso general que equilibran el razonamiento, el rendimiento y los costos Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio), Oeste de EE. UU. (Oregón) Luna openai.gpt-5.6-luna Alto volumen, cargas de trabajo sensibles a la latencia, como clasificación, resumen y enrutamiento Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio), Oeste de EE. UU. (Oregón)

Los tres modelos admiten entrada de texto e imágenes, salida de texto, una ventana de contexto de 272 000 tokens y la API de Respuestas. También admiten esfuerzo de razonamiento nulo, bajo, medio, alto, xalto y máximo, por lo que puede cambiar de modelo sin cambiar su integración API.

Accediendo a GPT-5.6 a través del punto final del lecho rocoso-manto

Puede acceder a los modelos GPT-5.6 a través de la API OpenAI Responses en el punto final de Bedrock-Mantle. La URL base es https://bedrock-mantle.{region}.api.aws y la API de respuestas se ofrece en /openai/v1/responses. Reemplace {región} con una región de AWS compatible, como us-east-1. Esta ruta openai/v1 es específica de los modelos OpenAI. El punto final funciona con los SDK de OpenAI Python y TypeScript. Para ejecutar una aplicación SDK de OpenAI existente en Amazon Bedrock, reemplace la URL base de OpenAI con el punto final de Bedrock-Mantle, utilice el ID de modelo de Amazon Bedrock correspondiente y autentíquese con una clave API de Amazon Bedrock o credenciales de AWS.

Seguridad y manejo de datos

Cada llamada de modelo se ejecuta según sus políticas de AWS Identity and Access Management (IAM), dentro de su nube privada virtual (VPC) y se registra en AWS CloudTrail. La inferencia dentro de la región mantiene las solicitudes dentro de la región de AWS que usted especifica, lo que ayuda a los equipos a cumplir con los requisitos de residencia de datos.

GPT-5.6 Sol, Terra y Luna son modelos de terceros de OpenAI, disponibles en Amazon Bedrock y sujetos a los términos de OpenAI. Para estos modelos de OpenAI, el tráfico marcado por el clasificador se retiene hasta por 30 días para la detección automatizada de abuso fuera de línea. AWS almacena y procesa las entradas y salidas retenidas y no las comparte con el proveedor del modelo a menos que usted opte por participar. Usted controla la configuración de retención a través del modo de retención de datos.

Comience con GPT-5.6 en Amazon Bedrock

Complete los siguientes pasos para comenzar a usar GPT-5.6 en Amazon Bedrock.

Requisitos previos

Para utilizar los modelos GPT-5.6, necesita una cuenta de AWS con permisos para ejecutar inferencias en el punto final del manto de roca. Una forma de otorgarlos es adjuntar la política administrada de AWS AmazonBedrockMantleInferenceAccess a su entidad principal de IAM. Otorga el acceso de lectura y creación de inferencias que necesitan los ejemplos de esta publicación, incluidos bedrock-mantle:CreateInference y bedrock-mantle:CallWithBearerToken.

Instale el SDK de OpenAI Python, versión 2.45.0 o posterior:

instalación de pip "openai>=2.45.0"

Te autenticas con una clave API. Hay dos opciones para autenticar el SDK de OpenAI.

Clave de corto plazo de actualización automática: el cliente BedrockOpenAI nativo del SDK de OpenAI toma un proveedor de tokens que genera una clave de corto plazo a partir de sus credenciales de AWS y la actualiza antes de cada solicitud. Los ejemplos de esta publicación utilizan este cliente.

de aws_bedrock_token_generator importar provide_token de openai importar BedrockOpenAI región = "us-east-1" cliente = BedrockOpenAI( aws_region=región, bedrock_token_provider=lambda: provide_token(región=región), )

Clave a corto plazo de una variable de entorno: establezca la clave en AWS_BEARER_TOKEN_BEDROCK y pásela al cliente. Debido a que esta clave no se actualiza, caduca después de 12 horas como máximo. Para producción, utilice la opción de actualización automática o almacene la clave en AWS Secrets Manager.

importar sistema operativo desde openai importar cliente OpenAI = OpenAI( base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1", api_key=os.environ["AWS_BEARER_TOKEN_BEDROCK"],)

Ejecute su primera inferencia con la API de Respuestas

Usando el cliente BedrockOpenAI del paso anterior, llame a GPT-5.6 Terra a través de la API de Respuestas. La API de Respuestas utiliza un único campo de entrada y devuelve el texto generado en texto_salida.

respuesta = client.responses.create( model="openai.gpt-5.6-terra", input="Explicar los beneficios del almacenamiento en caché rápido para cargas de trabajo agentes.", max_output_tokens=512, store=False, ) print(response.output_text)

Para mover una aplicación OpenAI SDK existente a GPT-5.6 en Amazon Bedrock, actualice la URL base y el ID del modelo.

Controlar el esfuerzo de razonamiento

Los modelos GPT-5.6 pueden gastar tokens de razonamiento adicionales en tareas complejas de varios pasos antes de responder, lo que mejora los resultados pero aumenta la latencia y el costo. Establezca el nivel con el parámetro de razonamiento. Sol, Terra y Luna no admiten ninguno, bajo, medio, alto, xalto y máximo. Haga coincidir el nivel con la tarea.

respuesta = client.responses.create( model="openai.gpt-5.6-sol", input="Un tren sale a las 3 PM a 60 km/h. Otro sale una hora más tarde a " "90 km/h desde la misma estación. ¿Cuándo lo alcanza el segundo?", razonamiento={"effort": "high"}, ) print(response.output_text)

herramientas de llamada

GPT-5.6 admite llamadas a herramientas, lo que permite que el modelo solicite herramientas que usted defina y use sus resultados para completar una solicitud. El siguiente ejemplo demuestra la llamada a la herramienta del lado del cliente, donde su aplicación ejecuta la herramienta y devuelve el resultado al modelo. Define una herramienta get_weather y completa un viaje de ida y vuelta. El modelo solicita la herramienta, su aplicación la ejecuta y devuelve el resultado, y el modelo produce la respuesta final.

import json tools = [ { "type": "function", "name": "get_weather", "description": "Obtener el clima actual para una ubicación determinada", "parameters": { "type": "object", "properties": { "location": { "type": "string", "description": "Ciudad y país (por ejemplo, Seattle, EE. UU.)", }, "unit": { "type": "string", "enum": ["celsius", "fahrenheit"], "descripción": "Unidad de temperatura", }, }, "requerido": ["ubicación"], }, } ] # Paso 1: Enviar la solicitud del usuario con la definición de la herramienta. input_list = [{"role": "user", "content": "¿Cómo está el clima en Seattle?"}] respuesta = client.responses.create( model="openai.gpt-5.6-terra", input=input_list, tools=tools, ) # Paso 2: Llevar el resultado del modelo (incluido cualquier elemento de razonamiento) al siguiente turno. input_list += respuesta.output # Paso 3: Ejecute cada función solicitada y agregue su resultado. para el elemento en respuesta.salida: if item.type == "function_call": args = json.loads(item.arguments) result = { "ubicación": args["ubicación"], "temperatura": 64, "condición": "Parcialmente nublado", } input_list.append( { "type": "function_call_output", "call_id": item.call_id, "output": json.dumps(resultado), } ) # Paso 4: Solicitar al modelo la respuesta final, incorporando el resultado de la herramienta. respuesta_final = cliente.respuestas.create( modelo="openai.gpt-5.6-terra", entrada=lista_entrada, herramientas=herramientas,) imprimir(respuesta_final.texto_salida)

Debido a que los modelos GPT-5.6 razonan antes de responder, pase los elementos de salida del modelo (que pueden incluir el razonamiento) en la siguiente solicitud, como lo hace el ejemplo anterior cuando agrega respuesta.salida a la lista de entrada.

Para implementaciones de producción, utilice Amazon Bedrock Guardrails para implementar salvaguardas personalizadas según sus casos de uso y políticas de IA responsables.

Pruebe GPT-5.6 en la consola

Los modelos GPT-5.6 se ejecutan en el motor de inferencia de próxima generación, que tiene una nueva experiencia de consola Amazon Bedrock optimizada para el punto final Bedrock-Mantle y sus API compatibles con OpenAI y Anthropic.

Esta experiencia se basa en proyectos. Usted crea un proyecto, asigna modelos, configura claves API y evalúa modelos uno al lado del otro antes de escribir el código de la aplicación. Complete los siguientes pasos para probar GPT-5.6 sin salir de la consola:

Abra la nueva consola de Amazon Bedrock en una región donde los modelos estén disponibles, como EE. UU. Este (Norte de Virginia). Si está en la consola existente, elija Pruebe la nueva consola Bedrock. Cree un proyecto o abra uno existente. En el catálogo de modelos, revise los modelos GPT, Claude y de peso abierto disponibles. Puede comparar hasta tres modelos uno al lado del otro en cuanto a capacidades, modalidades, ventana de contexto, precios y disponibilidad regional. Elija un modelo GPT-5.6 para agregarlo a su proyecto. Inicie una evaluación, ingrese un mensaje y revise la respuesta del modelo. Puede seleccionar hasta tres modelos para comparar respuestas al mismo mensaje.

La siguiente captura de pantalla muestra el catálogo de modelos de la nueva consola Amazon Bedrock, donde puede buscar y comparar GPT-5.6 y otros modelos.

Reduzca los costos con el almacenamiento en caché de avisos GPT-5.6

Las cargas de trabajo agentes y de varios pasos repiten gran parte de su contexto entre llamadas. Las instrucciones del sistema, las definiciones de herramientas y los archivos de referencia a menudo permanecen iguales, mientras que solo cambian las últimas entradas. GPT-5.6 admite el almacenamiento en caché rápido en dos modos en Amazon Bedrock. El almacenamiento en caché implícito está activado de forma predeterminada, por lo que las solicitudes elegibles se almacenan en caché automáticamente sin cambios en el código. El almacenamiento en caché explícito le permite marcar puntos de interrupción de la caché para un control preciso sobre qué partes de un mensaje se almacenan en caché. En ambos modos, el almacenamiento en caché rápido reduce el costo de procesar repetidamente el contexto compartido a medida que crece el volumen de solicitudes.

Con un punto de interrupción de caché, se marca el final de un prefijo de mensaje reutilizable. En una solicitud posterior que comparte ese prefijo, Amazon Bedrock reutiliza el contexto procesado y cada llamada paga el precio completo solo por el nuevo trabajo. La entrada almacenada en caché se factura con un descuento del 90 % en comparación con los tokens de entrada sin caché, y los tokens escritos en caché se facturan a 1,25 veces la tasa de entrada sin caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock. El contenido almacenado en caché permanece disponible para su reutilización durante al menos 30 minutos, tiempo suficiente para cubrir la ráfaga de llamadas que genera una sola ejecución de agente. Cada punto de interrupción requiere un prefijo de al menos 1024 tokens y puede configurar hasta cuatro puntos de control de caché por solicitud. Si un prefijo es más corto que el mínimo, la solicitud aún se realiza correctamente, pero no se almacena nada en caché y cached_tokens permanece en cero.

Almacenamiento en caché explícito con puntos de interrupción de caché

Para almacenar en caché un prefijo, agregue un Prompt_cache_breakpoint al bloque de contenido que finaliza la sección reutilizable y configure Prompt_cache_options en modo explícito. Establecer una Prompt_cache_key consistente en todas las solicitudes las enruta al mismo caché y mejora la confiabilidad de las coincidencias. En el siguiente ejemplo, la instrucción del sistema se almacena en caché y la pregunta del usuario aparece después del punto de interrupción para que pueda cambiar sin invalidar el prefijo almacenado en caché. La misma solicitud se envía dos veces para mostrar una escritura en caché seguida de una lectura en caché.

# Reemplace con las instrucciones reales del sistema y el contenido de referencia. # El prefijo almacenado en caché debe tener al menos 1024 tokens o no se almacenará nada en caché. system_prompt = "Usted es un agente de soporte técnico para Ejemplo Corp….(1,024+ tokens)…" def preguntar(pregunta): return client.responses.create( model="openai.gpt-5.6-terra", Prompt_cache_key="support-agent:system-prompt-v1", Prompt_cache_options={"mode": "explicit"}, input=[ { "type": "message", "role": "desarrollador", "content": [ { "type": "input_text", "text": system_prompt, # Almacena en caché todo hasta este punto de interrupción (la instrucción del sistema): {"mode": "explicit"}, } ], }, { "type": "message", "role": "user", "content": [{"type": "input_text", "text": question}], }, ], ) # Primero llamada: escribe el prefijo en la caché. first = preguntar("¿Cómo configuro el inicio de sesión único?") print("write:", first.usage.input_tokens_details.cache_write_tokens) # Segunda llamada con el mismo prefijo y clave de caché: lea el prefijo del caché. segundo = preguntar("¿Cómo restablezco una contraseña?") print("leer: ", second.usage.input_tokens_details.cached_tokens) print(segundo.output_text)

System_prompt aquí es un marcador de posición abreviado. Reemplácelo con contenido real de al menos 1024 tokens. Con un prefijo lo suficientemente grande, la primera llamada informa un cache_write_tokens distinto de cero y la segunda un cached_tokens distinto de cero, lo que confirma que el prefijo se reutilizó. El modo explícito es una buena opción para bucles agentes con un prefijo grande y estable, donde desea tener control total sobre lo que se almacena en caché.

Almacenamiento en caché implícito

Si no configuras Prompt_cache_options, GPT-5.6 usa el almacenamiento en caché implícito, el modo predeterminado. Amazon Bedrock coloca un punto de interrupción de caché automático en el último mensaje y respeta cualquier punto de interrupción explícito que agregue, por lo que se puede reutilizar un prefijo de aviso estable en todas las solicitudes sin ningún cambio en su estructura de entrada. Ésta es la forma más rápida de beneficiarse del almacenamiento en caché. Mantenga el contenido estático (instrucciones del sistema, definiciones de herramientas, documentos de referencia) al principio del mensaje y contenido variable al final, establezca una clave_cache_problema coherente para las solicitudes relacionadas y el punto final reutiliza el prefijo procesado cuando coincide.

El siguiente ejemplo utiliza el almacenamiento en caché implícito. No establece ninguna opción_cache_prompt ni punto de interrupción, y reutiliza el sistema_prompt del ejemplo anterior (reemplácelo con contenido real de al menos 1,024 tokens) con una clave_cache_prompt consistente:

respuesta = client.responses.create( model="openai.gpt-5.6-terra", Prompt_cache_key="support-agent:kb-v1", input=[ { "type": "message", "role": "developer", # El contenido estático primero para que forme un prefijo estable y almacenable en caché. "content": [{"type": "input_text", "text": system_prompt}], }, { "type": "message", "role": "usuario", "content": [{"type": "input_text", "text": "¿Cómo configuro el inicio de sesión único?"}], }, ], ) print(response.output_text)

La compensación es el control. En modo implícito, no se decide exactamente dónde cae el límite almacenable en caché. El almacenamiento en caché implícito se adapta a las cargas de trabajo de chat y recuperación de generación aumentada (RAG) con un prefijo naturalmente estable, mientras que el almacenamiento en caché explícito se adapta a los bucles agentes en los que desea fijar un prefijo grande y conocido y evitar escrituras de caché innecesarias. La facturación es la misma en ambas modalidades. Las lecturas de caché reciben un descuento del 90 % y las escrituras de caché se facturan a 1,25 veces la tasa de entrada sin caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock. Para desactivar el almacenamiento en caché para una solicitud, configure Prompt_cache_options en modo explícito sin agregar ningún punto de interrupción.

Supervise y evalúe su tasa de aciertos de caché

Cada respuesta informa la actividad de la caché en el objeto de uso. El campo input_tokens_details.cached_tokens es el número de tokens de entrada leídos del caché y cache_write_tokens es el número escrito. Debido a que cached_tokens ya forma parte del total de input_tokens, se obtiene la proporción de caché-entrada dividiendo cached_tokens por input_tokens:

uso = respuesta. detalles de uso = uso. print(f"Tokens escritos: {cache_write}") print(f"Entrada total: {total_input}") print(f"Tasa de aciertos de caché: {tasa de aciertos:.1%}")

Un acierto de caché aparece en el objeto de uso como cached_tokens mayor que cero y cache_write_tokens de cero. Un cero cache_write_tokens por sí solo no confirma un acierto, ya que también lo ve cuando no se almacenó nada en caché. Los aciertos de caché no están garantizados en todas las solicitudes, incluso con un prefijo idéntico, por lo que mida cached_tokens en todas las llamadas en lugar de esperar un acierto en una sola.

Para realizar un seguimiento del rendimiento de la caché en muchas solicitudes, agregue cached_tokens y cache_write_tokens de cada respuesta en el registro de su aplicación. El punto de enlace bedrock-mantle publica métricas de tokens de cuenta, proyecto y modelo en Amazon CloudWatch bajo el espacio de nombres AWS/BedrockMantle, pero no publica una métrica específica de la caché, por lo que el objeto de uso de respuesta es la fuente autorizada para la medición de la caché.

Utilice GPT-5.6 con Codex

Codex es el agente de codificación OpenAI para desarrolladores. Funciona con archivos locales, repositorios, terminales y entornos de desarrollo para escribir funciones, corregir errores, ejecutar pruebas y abrir solicitudes de extracción. Puede ejecutar Codex desde la línea de comandos (Codex CLI), como una extensión IDE para Visual Studio Code y JetBrains, o en la aplicación de escritorio ChatGPT. Cada uno de ellos puede enrutar la inferencia de su modelo a Amazon Bedrock para que se ejecute en su cuenta de AWS con el procesamiento dentro de la región y los controles de acceso descritos anteriormente.

Para apuntar Codex a Amazon Bedrock, configure el modelo y el proveedor en su archivo ~/.codex/config.toml. La nueva consola de Amazon Bedrock también incluye una sección de Clientes que genera estas instrucciones de conexión para usted.

model = "openai.gpt-5.6-sol" model_provider = "amazon-bedrock" [model_providers.amazon-bedrock.aws] region = "us-east-1"

Codex se autentica con una clave API o sus credenciales del SDK de AWS. Si configura AWS_BEARER_TOKEN_BEDROCK, Codex lo usa primero. De lo contrario, recurre a la cadena de credenciales del SDK de AWS. Es posible que la aplicación de escritorio ChatGPT y la extensión IDE no hereden su entorno de shell, así que coloque las variables que necesitan en ~/.codex/.env:

AWS_BEARER_TOKEN_BEDROCK=

Reinicie la aplicación o extensión después de cambiar ~/.codex/config.toml o ~/.codex/.env. Si ejecuta Codex CLI, puede exportar la misma variable en su shell en lugar de usar el archivo .env. Codex enruta la inferencia a través del punto final del manto de roca en las regiones comerciales de AWS admitidas. Para tareas de codificación, un mayor esfuerzo de razonamiento se adapta a la refactorización y depuración complejas, mientras que un nivel más bajo mantiene rápidas las ediciones de rutina.

La siguiente captura de pantalla muestra Codex en la aplicación de escritorio ChatGPT configurado para ejecutar un modelo GPT-5.6 en Amazon Bedrock.

Codex en la aplicación de escritorio ChatGPT configurado para ejecutar un modelo GPT-5.6 en Amazon Bedrock

Codex en la aplicación de escritorio ChatGPT que ejecuta GPT-5.6 en Amazon Bedrock

Puedes cambiar el esfuerzo de razonamiento en la aplicación de escritorio ChatGPT, eligiendo entre Ligero, Medio, Alto y Extra Alto para una tarea. La siguiente captura de pantalla muestra el selector de esfuerzo de razonamiento.

Selector de esfuerzo de razonamiento en la aplicación de escritorio ChatGPT con opciones Ligera, Media, Alta y Extra Alta

Elegir el esfuerzo de razonamiento para una tarea del Codex en la aplicación de escritorio ChatGPT

Cuotas y escalamiento

Cuando invoca modelos GPT-5.6, las solicitudes utilizan inferencia bajo demanda en el nivel de servicio Estándar, donde paga por token sin reservar capacidad.

La inferencia sobre el punto final del manto de roca se rige por dos cuotas por modelo y por región, una para tokens de entrada por minuto y otra para tokens de salida por minuto. No hay cuota de solicitudes por minuto. Los tokens de entrada almacenados en caché leídos a través del almacenamiento en caché de avisos no cuentan para la cuota de tokens de entrada por minuto, lo cual es una razón más por la que el almacenamiento en caché ayuda a escala. Si se excede una cuota de token por minuto, el punto final devuelve una respuesta HTTP 429. Maneje la limitación transitoria con un retroceso exponencial y un recuento de reintentos limitado, que el SDK de OpenAI admite a través de su configuración max_retries. Para obtener más información, consulte Cuotas para el punto final del lecho rocoso-manto.

Una forma recomendada de manejar la limitación transitoria es la reducción exponencial con un recuento de reintentos limitado. El SDK de OpenAI admite esto a través de su configuración max_retries:

de aws_bedrock_token_generator importar provide_token de openai importar BedrockOpenAI región = "us-east-1" cliente = BedrockOpenAI( aws_region=región, bedrock_token_provider=lambda: provide_token(región=región), max_retries=6,)

Para reducir la limitación en un volumen alto sostenido, distribuya grandes cargas de trabajo en varios minutos en lugar de dispararlas en ráfagas ajustadas, y aumente las tasas de solicitudes gradualmente para que el rendimiento pueda seguir la capacidad regional.

Limpiar

La inferencia bajo demanda genera cargos solo cuando se invoca un modelo, por lo que no hay infraestructura que derribar. Para evitar cargos no deseados:

Si generó una clave API a corto plazo, caduca automáticamente dentro de las 12 horas. Para revocar una antes, elimine la clave API en la nueva consola de Amazon Bedrock. Al eliminar una clave, se revoca inmediatamente el acceso a cualquier aplicación que la utilice, así que primero confirme que ninguna aplicación activa dependa de ella. Cada invocación de modelo genera cargos por token. Para conocer las tarifas actuales, consulte los precios de Amazon Bedrock.

Conclusión

En esta publicación, mostramos cómo comenzar con OpenAI GPT-5.6 Sol, Terra y Luna en Amazon Bedrock. Cubrimos cómo elegir una variante, cómo ejecutar inferencias a través de la API de respuestas en el punto final del manto de roca, cómo controlar el esfuerzo de razonamiento y las herramientas de llamada, cómo reducir costos con el almacenamiento en caché de mensajes explícitos y medir su tasa de aciertos de caché, y cómo conectar el agente de codificación OpenAI Codex. También analizamos las cuotas y el escalado para el punto final.

Para empezar:

Abra la nueva consola de Amazon Bedrock, cree un proyecto y evalúe un modelo GPT-5.6 según sus indicaciones. Ejecute el ejemplo de API de respuestas de esta publicación con sus propios datos. Agregue un punto de interrupción de caché explícito a un prefijo de solicitud repetido y mida la tasa de aciertos de caché. Evalúe Sol, Terra y Luna en sus cargas de trabajo para elegir la variante que se ajuste a su perfil de costos y latencia.

Para obtener más información, consulte los siguientes recursos:

Para analizar cómo GPT-5.6 en Amazon Bedrock puede admitir sus cargas de trabajo, comuníquese con un representante de AWS.

Sobre los autores

Zohreh Norouzi

Zohreh Norouzi

Zohreh es arquitecto senior de soluciones de seguridad en Amazon Web Services (AWS). Ayuda a los clientes a tomar buenas decisiones de seguridad y acelerar su viaje a la nube de AWS. Ha participado activamente en iniciativas de seguridad de IA y ha utilizado su experiencia para ayudar a los clientes a crear soluciones de IA seguras a escala.

Koushik Kethamakka

Koushik Kethamakka

Koushik es ingeniero de software principal en AWS y actualmente se centra en la inferencia a escala como parte de Amazon Mantle, la infraestructura fundamental para alojar modelos grandes en AWS. Anteriormente en AWS, Koushik creó Amazon Bedrock Assessments y Amazon Bedrock Guardrails, centrados en las evaluaciones de LLM y la seguridad. Antes de eso, contribuyó a la creación de servicios de IA/ML, incluidos Amazon Lex y Amazon Bedrock, con experiencia que abarca el diseño de productos y sistemas, alojamiento de LLM, evaluaciones y ajustes. Antes de AWS, Koushik creó sistemas de prevención de fraude de aprendizaje automático en tiempo real para Amazon.com. Tiene una maestría de la Universidad de Houston.

Saurabh Trikande

Saurabh Trikande

Saurabh es gerente senior de productos de Amazon Bedrock y Amazon SageMaker Inference. Le apasiona trabajar con clientes y socios, motivado por el objetivo de democratizar la IA. Se centra en la implementación de aplicaciones complejas de IA, la inferencia con modelos multiinquilino y la optimización de costos.

Kamalesh Palanisamy

Kamalesh Palanisamy

Kamalesh es ingeniero de software en AWS y se centra en la inferencia de modelos escalables y la orquestación de seguridad para AWS Mantle. Trabaja en la incorporación de modelos, la optimización de inferencias y la infraestructura de servicio confiable para grandes modelos de IA generativa.

Manish Rathaur

Manish Rathaur

Manish es gerente sénior de Producto de Amazon Bedrock.

Chris Dickens

Chris Dickens

Chris es miembro del personal de producto de OpenAI y se centra en las API de OpenAI. Su trabajo incluye la colaboración con AWS en Amazon Bedrock para hacer que los modelos de frontera de OpenAI sean ampliamente accesibles para los desarrolladores.