Esta publicación está coescrita con Chris Dickens de OpenAI.
Los desarrolladores que crean codificación agente, razonamiento a largo plazo y cargas de trabajo de inferencia de gran volumen quieren modelos de frontera que puedan llamar a través de API familiares, sin operar una infraestructura de modelo separada. OpenAI GPT-5.6 Sol, Terra y Luna ahora están disponibles de forma general en Amazon Bedrock. Los tres modelos cubren cargas de trabajo, desde agentes de codificación autónomos y razonamiento a largo plazo hasta inferencias de gran volumen sensibles a la latencia, y se ejecutan con la seguridad, el procesamiento regional y los controles de costos de AWS.
Puede acceder a los tres modelos a través de la API OpenAI Responses en el punto final de Bedrock-Mantle. Sol es el modelo de razonamiento emblemático, Terra equilibra el rendimiento y el costo para el trabajo de producción diario y Luna está optimizado para una inferencia rápida y de bajo costo, de modo que pueda ajustar la capacidad y el costo adecuados para cada carga de trabajo. Los precios coinciden con las tarifas propias de OpenAI y el uso cuenta para sus compromisos existentes de AWS.
En esta publicación, le mostramos cómo seleccionar un modelo, ejecutar su primera inferencia a través de la API de Responses, reducir el costo con el almacenamiento en caché rápido y medir el uso de tokens almacenados en caché, conectar el agente de codificación OpenAI Codex y planificar cuotas y escalamiento. Sus indicaciones y completaciones no se utilizan para entrenar ningún modelo y no se comparten con el proveedor del modelo.
La familia GPT-5.6 en Amazon Bedrock
GPT-5.6 introduce un sistema de nombres de OpenAI donde el número identifica la generación y los nombres Sol, Terra y Luna identifican niveles de capacidad duraderos que pueden avanzar a su propia cadencia. La siguiente tabla resume las especificaciones clave para cada modelo en Amazon Bedrock.
Modelo ID de modelo Más adecuado para regiones de AWS Sol openai.gpt-5.6-sol Codificación autónoma, investigación de seguridad, análisis científico y razonamiento profundo de varios pasos Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio) Terra openai.gpt-5.6-terra Cargas de trabajo de producción de uso general que equilibran el razonamiento, el rendimiento y los costos Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio), Oeste de EE. UU. (Oregón) Luna openai.gpt-5.6-luna Alto volumen, cargas de trabajo sensibles a la latencia, como clasificación, resumen y enrutamiento Este de EE. UU. (Norte de Virginia), Este de EE. UU. (Ohio), Oeste de EE. UU. (Oregón)
Los tres modelos admiten entrada de texto e imágenes, salida de texto, una ventana de contexto de 272 000 tokens y la API de Respuestas. También admiten esfuerzo de razonamiento nulo, bajo, medio, alto, xalto y máximo, por lo que puede cambiar de modelo sin cambiar su integración API.
Accediendo a GPT-5.6 a través del punto final del lecho rocoso-manto
Puede acceder a los modelos GPT-5.6 a través de la API OpenAI Responses en el punto final de Bedrock-Mantle. La URL base es https://bedrock-mantle.{region}.api.aws y la API de respuestas se ofrece en /openai/v1/responses. Reemplace {región} con una región de AWS compatible, como us-east-1. Esta ruta openai/v1 es específica de los modelos OpenAI. El punto final funciona con los SDK de OpenAI Python y TypeScript. Para ejecutar una aplicación SDK de OpenAI existente en Amazon Bedrock, reemplace la URL base de OpenAI con el punto final de Bedrock-Mantle, utilice el ID de modelo de Amazon Bedrock correspondiente y autentíquese con una clave API de Amazon Bedrock o credenciales de AWS.
Seguridad y manejo de datos
Cada llamada de modelo se ejecuta según sus políticas de AWS Identity and Access Management (IAM), dentro de su nube privada virtual (VPC) y se registra en AWS CloudTrail. La inferencia dentro de la región mantiene las solicitudes dentro de la región de AWS que usted especifica, lo que ayuda a los equipos a cumplir con los requisitos de residencia de datos.
GPT-5.6 Sol, Terra y Luna son modelos de terceros de OpenAI, disponibles en Amazon Bedrock y sujetos a los términos de OpenAI. Para estos modelos de OpenAI, el tráfico marcado por el clasificador se retiene hasta por 30 días para la detección automatizada de abuso fuera de línea. AWS almacena y procesa las entradas y salidas retenidas y no las comparte con el proveedor del modelo a menos que usted opte por participar. Usted controla la configuración de retención a través del modo de retención de datos.
Comience con GPT-5.6 en Amazon Bedrock
Complete los siguientes pasos para comenzar a usar GPT-5.6 en Amazon Bedrock.
Requisitos previos
Para utilizar los modelos GPT-5.6, necesita una cuenta de AWS con permisos para ejecutar inferencias en el punto final del manto de roca. Una forma de otorgarlos es adjuntar la política administrada de AWS AmazonBedrockMantleInferenceAccess a su entidad principal de IAM. Otorga el acceso de lectura y creación de inferencias que necesitan los ejemplos de esta publicación, incluidos bedrock-mantle:CreateInference y bedrock-mantle:CallWithBearerToken.
Instale el SDK de OpenAI Python, versión 2.45.0 o posterior:
Te autenticas con una clave API. Hay dos opciones para autenticar el SDK de OpenAI.
Clave de corto plazo de actualización automática: el cliente BedrockOpenAI nativo del SDK de OpenAI toma un proveedor de tokens que genera una clave de corto plazo a partir de sus credenciales de AWS y la actualiza antes de cada solicitud. Los ejemplos de esta publicación utilizan este cliente.
Clave a corto plazo de una variable de entorno: establezca la clave en AWS_BEARER_TOKEN_BEDROCK y pásela al cliente. Debido a que esta clave no se actualiza, caduca después de 12 horas como máximo. Para producción, utilice la opción de actualización automática o almacene la clave en AWS Secrets Manager.
Ejecute su primera inferencia con la API de Respuestas
Usando el cliente BedrockOpenAI del paso anterior, llame a GPT-5.6 Terra a través de la API de Respuestas. La API de Respuestas utiliza un único campo de entrada y devuelve el texto generado en texto_salida.
Para mover una aplicación OpenAI SDK existente a GPT-5.6 en Amazon Bedrock, actualice la URL base y el ID del modelo.
Controlar el esfuerzo de razonamiento
Los modelos GPT-5.6 pueden gastar tokens de razonamiento adicionales en tareas complejas de varios pasos antes de responder, lo que mejora los resultados pero aumenta la latencia y el costo. Establezca el nivel con el parámetro de razonamiento. Sol, Terra y Luna no admiten ninguno, bajo, medio, alto, xalto y máximo. Haga coincidir el nivel con la tarea.
herramientas de llamada
GPT-5.6 admite llamadas a herramientas, lo que permite que el modelo solicite herramientas que usted defina y use sus resultados para completar una solicitud. El siguiente ejemplo demuestra la llamada a la herramienta del lado del cliente, donde su aplicación ejecuta la herramienta y devuelve el resultado al modelo. Define una herramienta get_weather y completa un viaje de ida y vuelta. El modelo solicita la herramienta, su aplicación la ejecuta y devuelve el resultado, y el modelo produce la respuesta final.
Debido a que los modelos GPT-5.6 razonan antes de responder, pase los elementos de salida del modelo (que pueden incluir el razonamiento) en la siguiente solicitud, como lo hace el ejemplo anterior cuando agrega respuesta.salida a la lista de entrada.
Para implementaciones de producción, utilice Amazon Bedrock Guardrails para implementar salvaguardas personalizadas según sus casos de uso y políticas de IA responsables.
Pruebe GPT-5.6 en la consola
Los modelos GPT-5.6 se ejecutan en el motor de inferencia de próxima generación, que tiene una nueva experiencia de consola Amazon Bedrock optimizada para el punto final Bedrock-Mantle y sus API compatibles con OpenAI y Anthropic.
Esta experiencia se basa en proyectos. Usted crea un proyecto, asigna modelos, configura claves API y evalúa modelos uno al lado del otro antes de escribir el código de la aplicación. Complete los siguientes pasos para probar GPT-5.6 sin salir de la consola:
Abra la nueva consola de Amazon Bedrock en una región donde los modelos estén disponibles, como EE. UU. Este (Norte de Virginia). Si está en la consola existente, elija Pruebe la nueva consola Bedrock. Cree un proyecto o abra uno existente. En el catálogo de modelos, revise los modelos GPT, Claude y de peso abierto disponibles. Puede comparar hasta tres modelos uno al lado del otro en cuanto a capacidades, modalidades, ventana de contexto, precios y disponibilidad regional. Elija un modelo GPT-5.6 para agregarlo a su proyecto. Inicie una evaluación, ingrese un mensaje y revise la respuesta del modelo. Puede seleccionar hasta tres modelos para comparar respuestas al mismo mensaje.
La siguiente captura de pantalla muestra el catálogo de modelos de la nueva consola Amazon Bedrock, donde puede buscar y comparar GPT-5.6 y otros modelos.
Reduzca los costos con el almacenamiento en caché de avisos GPT-5.6
Las cargas de trabajo agentes y de varios pasos repiten gran parte de su contexto entre llamadas. Las instrucciones del sistema, las definiciones de herramientas y los archivos de referencia a menudo permanecen iguales, mientras que solo cambian las últimas entradas. GPT-5.6 admite el almacenamiento en caché rápido en dos modos en Amazon Bedrock. El almacenamiento en caché implícito está activado de forma predeterminada, por lo que las solicitudes elegibles se almacenan en caché automáticamente sin cambios en el código. El almacenamiento en caché explícito le permite marcar puntos de interrupción de la caché para un control preciso sobre qué partes de un mensaje se almacenan en caché. En ambos modos, el almacenamiento en caché rápido reduce el costo de procesar repetidamente el contexto compartido a medida que crece el volumen de solicitudes.
Con un punto de interrupción de caché, se marca el final de un prefijo de mensaje reutilizable. En una solicitud posterior que comparte ese prefijo, Amazon Bedrock reutiliza el contexto procesado y cada llamada paga el precio completo solo por el nuevo trabajo. La entrada almacenada en caché se factura con un descuento del 90 % en comparación con los tokens de entrada sin caché, y los tokens escritos en caché se facturan a 1,25 veces la tasa de entrada sin caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock. El contenido almacenado en caché permanece disponible para su reutilización durante al menos 30 minutos, tiempo suficiente para cubrir la ráfaga de llamadas que genera una sola ejecución de agente. Cada punto de interrupción requiere un prefijo de al menos 1024 tokens y puede configurar hasta cuatro puntos de control de caché por solicitud. Si un prefijo es más corto que el mínimo, la solicitud aún se realiza correctamente, pero no se almacena nada en caché y cached_tokens permanece en cero.
Almacenamiento en caché explícito con puntos de interrupción de caché
Para almacenar en caché un prefijo, agregue un Prompt_cache_breakpoint al bloque de contenido que finaliza la sección reutilizable y configure Prompt_cache_options en modo explícito. Establecer una Prompt_cache_key consistente en todas las solicitudes las enruta al mismo caché y mejora la confiabilidad de las coincidencias. En el siguiente ejemplo, la instrucción del sistema se almacena en caché y la pregunta del usuario aparece después del punto de interrupción para que pueda cambiar sin invalidar el prefijo almacenado en caché. La misma solicitud se envía dos veces para mostrar una escritura en caché seguida de una lectura en caché.
System_prompt aquí es un marcador de posición abreviado. Reemplácelo con contenido real de al menos 1024 tokens. Con un prefijo lo suficientemente grande, la primera llamada informa un cache_write_tokens distinto de cero y la segunda un cached_tokens distinto de cero, lo que confirma que el prefijo se reutilizó. El modo explícito es una buena opción para bucles agentes con un prefijo grande y estable, donde desea tener control total sobre lo que se almacena en caché.
Almacenamiento en caché implícito
Si no configuras Prompt_cache_options, GPT-5.6 usa el almacenamiento en caché implícito, el modo predeterminado. Amazon Bedrock coloca un punto de interrupción de caché automático en el último mensaje y respeta cualquier punto de interrupción explícito que agregue, por lo que se puede reutilizar un prefijo de aviso estable en todas las solicitudes sin ningún cambio en su estructura de entrada. Ésta es la forma más rápida de beneficiarse del almacenamiento en caché. Mantenga el contenido estático (instrucciones del sistema, definiciones de herramientas, documentos de referencia) al principio del mensaje y contenido variable al final, establezca una clave_cache_problema coherente para las solicitudes relacionadas y el punto final reutiliza el prefijo procesado cuando coincide.
El siguiente ejemplo utiliza el almacenamiento en caché implícito. No establece ninguna opción_cache_prompt ni punto de interrupción, y reutiliza el sistema_prompt del ejemplo anterior (reemplácelo con contenido real de al menos 1,024 tokens) con una clave_cache_prompt consistente:
La compensación es el control. En modo implícito, no se decide exactamente dónde cae el límite almacenable en caché. El almacenamiento en caché implícito se adapta a las cargas de trabajo de chat y recuperación de generación aumentada (RAG) con un prefijo naturalmente estable, mientras que el almacenamiento en caché explícito se adapta a los bucles agentes en los que desea fijar un prefijo grande y conocido y evitar escrituras de caché innecesarias. La facturación es la misma en ambas modalidades. Las lecturas de caché reciben un descuento del 90 % y las escrituras de caché se facturan a 1,25 veces la tasa de entrada sin caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock. Para desactivar el almacenamiento en caché para una solicitud, configure Prompt_cache_options en modo explícito sin agregar ningún punto de interrupción.
Supervise y evalúe su tasa de aciertos de caché
Cada respuesta informa la actividad de la caché en el objeto de uso. El campo input_tokens_details.cached_tokens es el número de tokens de entrada leídos del caché y cache_write_tokens es el número escrito. Debido a que cached_tokens ya forma parte del total de input_tokens, se obtiene la proporción de caché-entrada dividiendo cached_tokens por input_tokens:
Un acierto de caché aparece en el objeto de uso como cached_tokens mayor que cero y cache_write_tokens de cero. Un cero cache_write_tokens por sí solo no confirma un acierto, ya que también lo ve cuando no se almacenó nada en caché. Los aciertos de caché no están garantizados en todas las solicitudes, incluso con un prefijo idéntico, por lo que mida cached_tokens en todas las llamadas en lugar de esperar un acierto en una sola.
Para realizar un seguimiento del rendimiento de la caché en muchas solicitudes, agregue cached_tokens y cache_write_tokens de cada respuesta en el registro de su aplicación. El punto de enlace bedrock-mantle publica métricas de tokens de cuenta, proyecto y modelo en Amazon CloudWatch bajo el espacio de nombres AWS/BedrockMantle, pero no publica una métrica específica de la caché, por lo que el objeto de uso de respuesta es la fuente autorizada para la medición de la caché.
Utilice GPT-5.6 con Codex
Codex es el agente de codificación OpenAI para desarrolladores. Funciona con archivos locales, repositorios, terminales y entornos de desarrollo para escribir funciones, corregir errores, ejecutar pruebas y abrir solicitudes de extracción. Puede ejecutar Codex desde la línea de comandos (Codex CLI), como una extensión IDE para Visual Studio Code y JetBrains, o en la aplicación de escritorio ChatGPT. Cada uno de ellos puede enrutar la inferencia de su modelo a Amazon Bedrock para que se ejecute en su cuenta de AWS con el procesamiento dentro de la región y los controles de acceso descritos anteriormente.
Para apuntar Codex a Amazon Bedrock, configure el modelo y el proveedor en su archivo ~/.codex/config.toml. La nueva consola de Amazon Bedrock también incluye una sección de Clientes que genera estas instrucciones de conexión para usted.
Codex se autentica con una clave API o sus credenciales del SDK de AWS. Si configura AWS_BEARER_TOKEN_BEDROCK, Codex lo usa primero. De lo contrario, recurre a la cadena de credenciales del SDK de AWS. Es posible que la aplicación de escritorio ChatGPT y la extensión IDE no hereden su entorno de shell, así que coloque las variables que necesitan en ~/.codex/.env:
Reinicie la aplicación o extensión después de cambiar ~/.codex/config.toml o ~/.codex/.env. Si ejecuta Codex CLI, puede exportar la misma variable en su shell en lugar de usar el archivo .env. Codex enruta la inferencia a través del punto final del manto de roca en las regiones comerciales de AWS admitidas. Para tareas de codificación, un mayor esfuerzo de razonamiento se adapta a la refactorización y depuración complejas, mientras que un nivel más bajo mantiene rápidas las ediciones de rutina.
La siguiente captura de pantalla muestra Codex en la aplicación de escritorio ChatGPT configurado para ejecutar un modelo GPT-5.6 en Amazon Bedrock.
Codex en la aplicación de escritorio ChatGPT que ejecuta GPT-5.6 en Amazon Bedrock
Puedes cambiar el esfuerzo de razonamiento en la aplicación de escritorio ChatGPT, eligiendo entre Ligero, Medio, Alto y Extra Alto para una tarea. La siguiente captura de pantalla muestra el selector de esfuerzo de razonamiento.
Elegir el esfuerzo de razonamiento para una tarea del Codex en la aplicación de escritorio ChatGPT
Cuotas y escalamiento
Cuando invoca modelos GPT-5.6, las solicitudes utilizan inferencia bajo demanda en el nivel de servicio Estándar, donde paga por token sin reservar capacidad.
La inferencia sobre el punto final del manto de roca se rige por dos cuotas por modelo y por región, una para tokens de entrada por minuto y otra para tokens de salida por minuto. No hay cuota de solicitudes por minuto. Los tokens de entrada almacenados en caché leídos a través del almacenamiento en caché de avisos no cuentan para la cuota de tokens de entrada por minuto, lo cual es una razón más por la que el almacenamiento en caché ayuda a escala. Si se excede una cuota de token por minuto, el punto final devuelve una respuesta HTTP 429. Maneje la limitación transitoria con un retroceso exponencial y un recuento de reintentos limitado, que el SDK de OpenAI admite a través de su configuración max_retries. Para obtener más información, consulte Cuotas para el punto final del lecho rocoso-manto.
Una forma recomendada de manejar la limitación transitoria es la reducción exponencial con un recuento de reintentos limitado. El SDK de OpenAI admite esto a través de su configuración max_retries:
Para reducir la limitación en un volumen alto sostenido, distribuya grandes cargas de trabajo en varios minutos en lugar de dispararlas en ráfagas ajustadas, y aumente las tasas de solicitudes gradualmente para que el rendimiento pueda seguir la capacidad regional.
Limpiar
La inferencia bajo demanda genera cargos solo cuando se invoca un modelo, por lo que no hay infraestructura que derribar. Para evitar cargos no deseados:
Si generó una clave API a corto plazo, caduca automáticamente dentro de las 12 horas. Para revocar una antes, elimine la clave API en la nueva consola de Amazon Bedrock. Al eliminar una clave, se revoca inmediatamente el acceso a cualquier aplicación que la utilice, así que primero confirme que ninguna aplicación activa dependa de ella. Cada invocación de modelo genera cargos por token. Para conocer las tarifas actuales, consulte los precios de Amazon Bedrock.
Conclusión
En esta publicación, mostramos cómo comenzar con OpenAI GPT-5.6 Sol, Terra y Luna en Amazon Bedrock. Cubrimos cómo elegir una variante, cómo ejecutar inferencias a través de la API de respuestas en el punto final del manto de roca, cómo controlar el esfuerzo de razonamiento y las herramientas de llamada, cómo reducir costos con el almacenamiento en caché de mensajes explícitos y medir su tasa de aciertos de caché, y cómo conectar el agente de codificación OpenAI Codex. También analizamos las cuotas y el escalado para el punto final.
Para empezar:
Abra la nueva consola de Amazon Bedrock, cree un proyecto y evalúe un modelo GPT-5.6 según sus indicaciones. Ejecute el ejemplo de API de respuestas de esta publicación con sus propios datos. Agregue un punto de interrupción de caché explícito a un prefijo de solicitud repetido y mida la tasa de aciertos de caché. Evalúe Sol, Terra y Luna en sus cargas de trabajo para elegir la variante que se ajuste a su perfil de costos y latencia.
Para obtener más información, consulte los siguientes recursos:
Para analizar cómo GPT-5.6 en Amazon Bedrock puede admitir sus cargas de trabajo, comuníquese con un representante de AWS.