Esta publicación está coescrita con Chris Dickens de OpenAI.
OpenAI GPT-5.6 Sol, Terra y Luna ahora están disponibles de forma general en Amazon Bedrock. Con GPT-5.6 en Amazon Bedrock, obtiene la última generación de modelos de frontera OpenAI con precios de pago por token, controles de gobernanza y seguridad de AWS y un uso que cuenta para sus compromisos existentes de AWS. La familia cubre tres niveles de capacidad: GPT-5.6 Sol para el trabajo de codificación agente y razonamiento más complejo, GPT-5.6 Terra para cargas de trabajo de producción diarias equilibradas y GPT-5.6 Luna para tareas rápidas y de gran volumen, como clasificación y resumen.
Además de los nuevos modelos, GPT-5.6 introduce el almacenamiento en caché de mensajes explícitos en Amazon Bedrock, una nueva capacidad que le brinda control preciso sobre qué partes de su mensaje se almacenan en caché y se reutilizan en todas las solicitudes. La entrada almacenada en caché se factura con un descuento del 90 por ciento (consulte la página de precios de Amazon Bedrock) y permanece disponible para su reutilización durante 30 minutos. Obtiene el máximo valor de esto en los flujos de trabajo agentes, donde las instrucciones del sistema, las definiciones de herramientas y los documentos de referencia se repiten en muchas llamadas.
En esta publicación, presentamos el almacenamiento en caché de mensajes explícitos para GPT-5.6 en Amazon Bedrock, una nueva capacidad que le brinda control sobre qué partes de su mensaje se almacenan en caché y se reutilizan en todas las solicitudes. Mostramos en qué se diferencia del almacenamiento en caché implícito y cuándo usar cada modo, cómo configurarlo y verificar que esté funcionando, y cómo se desempeña en un flujo de trabajo agente. También cubrimos cómo migrar cargas de trabajo de modelos GPT anteriores a GPT-5.6, ya sea que se ejecuten en Amazon Bedrock hoy o en otra plataforma.
Comience con GPT-5.6 en Amazon Bedrock
Los modelos GPT-5.6 se ofrecen a través de la API Responses compatible con OpenAI en el punto final de Amazon Bedrock bedrock-mantle.
Configurar el cliente
La forma recomendada de autenticarse es con tokens de portador a corto plazo generados a partir de sus credenciales de AWS. Instale el generador de tokens junto con el SDK de OpenAI:
Luego crea un cliente. El generador de tokens utiliza la cadena de credenciales estándar de AWS (roles de IAM, variables de entorno o su perfil CLI), por lo que su código permanece libre de secretos de larga duración:
Haz tu primera solicitud
Los modelos GPT-5.6 utilizan la API de respuestas. Una solicitud mínima se ve así:
Los tres ID de modelo son openai.gpt-5.6-sol, openai.gpt-5.6-terra y openai.gpt-5.6-luna. GPT-5.6 Sol está disponible en el Este de EE. UU. (Norte de Virginia) y el Este de EE. UU. (Ohio). Terra y Luna también están disponibles en el oeste de EE. UU. (Oregón). Para conocer la disponibilidad de modelos por región, consulte Modelos admitidos por región de AWS en Amazon Bedrock (https://docs.aws.amazon.com/bedrock/latest/userguide/models-regions.html).
Controlar el esfuerzo de razonamiento
GPT-5.6 admite niveles de esfuerzo de razonamiento ninguno, bajo, medio, alto y xalto, con medio como valor predeterminado. Los niveles más altos asignan más razonamiento a problemas más difíciles y ninguno le brinda la ruta de latencia más baja para tareas sencillas:
Una guía práctica al actualizar desde GPT-5.5 o GPT-5.4: comience con el nivel de esfuerzo que usa hoy y luego pruebe un nivel más bajo. GPT-5.6 es más eficiente con los tokens y muchas cargas de trabajo mantienen la calidad con una configuración de menor esfuerzo. Los parámetros de muestreo (temperatura y top_p) se admiten cuando Reasoning.effort se establece en ninguno. En otros niveles de esfuerzo, el proceso de razonamiento del modelo controla la variación de la producción.
Transmitir respuestas
La transmisión funciona a través de la interfaz estándar del SDK y entrega resultados como eventos escritos:
Llame a herramientas y obtenga resultados estructurados
La llamada a funciones y la salida estricta del esquema JSON funcionan como lo hacen con la API nativa de OpenAI. Las definiciones de herramientas utilizan el formato plano de la API de Respuestas:
Para una salida estructurada, pase un esquema JSON estricto y el modelo devolverá un JSON válido que se ajuste a él:
Utilice el almacenamiento en caché rápido para GPT-5.6 en Amazon Bedrock
Los modelos GPT-5.6 admiten el almacenamiento en caché rápido a través de la API de Responses, con dos modos: implícito, donde Amazon Bedrock coloca puntos de interrupción de caché automáticamente, y explícito, donde usted mismo marca el límite de caché para un control preciso. Esta sección cubre ambos, además de cómo verificar el comportamiento del almacenamiento en caché y elegir el modo correcto para su carga de trabajo.
El almacenamiento en caché de mensajes permite a Amazon Bedrock omitir el recálculo de partes del mensaje que se repiten en todas las solicitudes. En GPT-5.6, las lecturas de caché se facturan con un descuento del 90 por ciento en comparación con los tokens de entrada no almacenados en caché, y las escrituras de caché se facturan a 1,25 veces la tasa de entrada sin caché, por lo que la función está diseñada para patrones de escritura una vez y lectura múltiple. Debido a que una lectura ahorra mucho más de lo que agrega una escritura, una carga de trabajo reduce su costo de entrada neto una vez que las lecturas de caché representan aproximadamente el 20 por ciento de los tokens que fluyen a través de la caché. Implícito lo lleva hacia eso sin ningún trabajo de su parte, porque Amazon Bedrock coloca el punto de interrupción y lo ajusta por usted. En modo explícito, marcar el prefijo estable usted mismo generalmente aumenta aún más la tasa de aciertos, porque las solicitudes posteriores leen el prefijo mientras permanece en caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock.
Comience con el almacenamiento en caché de mensajes implícitos
En GPT-5.6, el almacenamiento en caché de mensajes está activado de forma predeterminada en modo implícito. Cuando envía una solicitud sin ningún parámetro de almacenamiento en caché, Amazon Bedrock coloca automáticamente un punto de interrupción de caché y busca un prefijo reutilizable. Se puede almacenar en caché y reutilizar un prefijo estable de al menos 1024 tokens sin necesidad de realizar cambios en el código.
El almacenamiento en caché implícito significa que su código existente comienza a obtener lecturas de caché desde el primer día, sin necesidad de analizar su estructura de avisos. Debido a que Bedrock elige el punto de interrupción por usted, la primera solicitud escribe el prefijo en la memoria caché y las solicitudes posteriores lo vuelven a leer. Para cargas de trabajo donde el contenido después de su prefijo estable cambia en cada solicitud, como asistentes de chat y bucles de herramientas agentes, obtiene resultados más predecibles marcando el prefijo usted mismo con un punto de interrupción explícito. La siguiente sección describe este enfoque.
Configurar el almacenamiento en caché de mensajes explícitos
El modo explícito le brinda control directo sobre el límite de la caché. Usted marca el final de su prefijo reutilizable y los prefijos almacenados en caché permanecen disponibles para su reutilización durante al menos 30 minutos, tiempo suficiente para cubrir la ráfaga de llamadas que genera una sola ejecución de agente. Tres parámetros de solicitud controlan el almacenamiento en caché en GPT-5.6:
Prompt_cache_breakpoint: colocado en un bloque de contenido, marca el final exacto de un prefijo de mensaje reutilizable. Todo hasta el bloque marcado inclusive se almacena en caché, y todo lo que sigue puede cambiar libremente mientras el prefijo almacenado en caché sigue siendo válido. Cada prefijo almacenado en caché debe contener al menos 1024 tokens y puede configurar hasta 4 puntos de interrupción por solicitud en los bloques input_text, input_image y input_file. Prompt_cache_key: una ID estable que enruta solicitudes al mismo caché. Configúrelo de forma coherente en todas las solicitudes de una sesión o aplicación para que las solicitudes repetidas encuentren el prefijo almacenado en caché. Prompt_cache_options: controla el modo de almacenamiento en caché (implícito o explícito, cubierto en la siguiente sección) y el TTL.
Aquí hay un ejemplo completo: un asistente de soporte con una larga instrucción del sistema que es idéntica en cada llamada, seguida de una pregunta del usuario que cambia cada vez. El punto de interrupción va al final del contenido estático:
Verificar el comportamiento del almacenamiento en caché
Cada respuesta informa exactamente lo que hizo el caché, en el objeto use.input_tokens_details. Este es el lugar para verificar su configuración:
cached_tokens: tokens de entrada leídos desde la memoria caché, facturados con un descuento del 90 por ciento. cache_write_tokens: tokens de entrada escritos en caché, facturados a 1,25 veces la tarifa sin caché.
Nota: Los tokens servidos desde el caché dentro del período de 30 minutos no se incluyen en los cargos de llamadas posteriores. La siguiente explicación cubre esto en detalle.
input_tokens = cached_tokens + cache_write_tokens + resto no almacenado en caché
input_tokens es el recuento total de entradas para la solicitud. cached_tokens y cache_write_tokens informan qué parte de esa entrada proviene del caché, y el resto es el contenido nuevo que envía cada vez, como la pregunta del usuario después de su punto de interrupción. Debido a que los recuentos escritos y en caché son parte de input_tokens en lugar de agregarse encima de él, un token servido desde la caché se cuenta una vez y se factura una vez a la velocidad de lectura de la caché. Nunca se le cobrará dos veces por el mismo token. En el siguiente ejemplo, las solicitudes reutilizan el mismo prefijo del sistema de 3626 tokens en una Prompt_cache_key. La pregunta del usuario cambia cada vez, por lo que el resto de input_tokens no almacenados en caché cambia con ella:
Solicitar input_tokens cached_tokens cache_write_tokens Entrada nueva (no almacenada en caché) Primera (fría) 3682 0 3626 56 Segunda 3671 3626 0 45 Tercera 3662 3626 0 36
La primera solicitud escribe el prefijo de 3626 tokens en la caché. A partir de la segunda solicitud, ese prefijo se vuelve a leer con el descuento de lectura de caché, mientras que solo la entrada del nuevo usuario (aquí 45 y 36 tokens) se procesa a la tarifa estándar. cached_tokens se mantiene alto, cache_write_tokens cae a cero y input_tokens se mueve solo según el tamaño de la pregunta cambiante del usuario.
Estos dos campos llegan con cada respuesta. El flujo de trabajo de verificación más directo es registrarlos desde su aplicación junto con el ID de solicitud y Prompt_cache_key. Luego confirme el patrón de escritura una vez y lectura muchas en sus registros antes de que el tráfico de producción dependa de él. Para el monitoreo agregado, el punto de enlace de Bedrock-Mantle publica inferencias y métricas de tokens en Amazon CloudWatch en el espacio de nombres AWS/BedrockMantle (consulte Monitorear la inferencia de Bedrock-Mantle mediante métricas de CloudWatch). Esto rastrea el volumen general de tokens de entrada y salida por cuenta, proyecto y modelo. El desglose de la caché por solicitud proviene del objeto de uso en cada respuesta, lo que hace que el registro a nivel de aplicación de estos dos campos sea la base de la observabilidad del almacenamiento en caché.
Utilice el almacenamiento en caché en un bucle agente
Las cargas de trabajo agentes son donde brilla el almacenamiento en caché explícito. En un bucle de llamada de herramientas, el mensaje del sistema y las definiciones de las herramientas se repiten en cada turno mientras la conversación crece al final, una opción perfecta para un punto de interrupción después del contenido estático. Este ejemplo crea un asistente de respuesta a incidentes que verifica el estado del servicio y las implementaciones recientes:
El modelo impulsa este ciclo: decide qué herramientas llamar y el ciclo finaliza cuando el modelo devuelve una respuesta final en lugar de otra llamada a la herramienta. Este bucle de herramientas es la forma mínima de un agente, el mismo bucle que los marcos de agentes administran por usted. El primer turno escribe el prefijo del indicador del sistema en la memoria caché. Cada turno posterior de la ejecución lee ese prefijo del caché mientras el modelo procesa las llamadas y los resultados de la herramienta recién agregada, y el TTL de 30 minutos cubre cómodamente sesiones de agente de varios minutos. El registro de los dos campos de uso por turno muestra claramente el patrón: una única escritura de caché en el turno inicial, seguida de lecturas de caché en cada turno posterior.
Elija entre almacenamiento en caché implícito y explícito
GPT-5.6 admite dos modos de almacenamiento en caché, controlados por Prompt_cache_options.mode:
Implícito (el valor predeterminado). Amazon Bedrock coloca automáticamente un punto de interrupción de la caché en el último mensaje e intenta maximizar la tasa de aciertos de la caché. Cualquier punto de interrupción explícito que agregue también se respetará. Este modo ofrece beneficios de almacenamiento en caché automáticamente con su formato de solicitud existente. Explícito. Configurar “prompt_cache_options”: {“mode”: “explicit”} le da a sus puntos de interrupción control total: solo los puntos de interrupción que usted coloca se usan para lecturas y escrituras de caché.
El modo explícito pone el límite de la caché bajo su control, y ese control es más importante cuando sus indicaciones combinan un prefijo estable con contenido que cambia en cada solicitud. En modo implícito, Bedrock coloca el punto de interrupción por usted y la cantidad de escrituras en caché antes de que comiencen las lecturas puede variar de una solicitud a otra. Con un punto de interrupción explícito colocado al final del contenido estático, el comportamiento es determinista: la primera solicitud escribe el prefijo una vez y cada solicitud siguiente lo lee del caché, porque el contenido cambiante se encuentra de forma segura después del punto de interrupción.
Su carga de trabajo Modo recomendado Solicita repetición exacta (análisis de documentos repetidos, puntuación por lotes con una solicitud fija) Implícito (predeterminado) funciona sin cambios de solicitud. Explícito da el mismo resultado con control determinista Prefijo estable más sufijo cambiante (asistentes de chat, RAG, bucles de herramientas agentes) Explícito, con un punto de interrupción después del contenido estático Múltiples secciones que cambian en diferentes frecuencias (herramientas, avisos del sistema, documentos largos, conversación) Explícito, con hasta 4 puntos de interrupción para control granular
Si no desea el almacenamiento en caché de avisos en GPT-5.6+, puede usar el modo de caché explícito sin proporcionar puntos de interrupción explícitos. Esto lo excluye del comportamiento de facturación de caché de avisos (y no incurre en cargos por escritura de caché), pero es posible que partes de los avisos aún se almacenen en caché en los sistemas Bedrock para brindarle una latencia más baja. Cualquiera que sea el modo que elija, siga monitoreando los dos campos de uso en producción. Un patrón de almacenamiento en caché saludable muestra lecturas de caché significativas después de cada escritura. Si ve una gran cantidad de escrituras en caché con pocas lecturas en modo implícito, considere cambiar al modo explícito agregando un punto de interrupción explícito al final de su contenido estático para que el prefijo almacenado en caché sea determinista. En modo explícito, mueva su punto de interrupción antes para que cubra solo el contenido que permanece constante entre llamadas. Confirme que Prompt_cache_key esté configurado de manera consistente en todas las solicitudes que deben compartir un caché.
Migrar a GPT-5.6 desde modelos GPT anteriores
La combinación de GPT-5.6 de mayor rendimiento, mejor eficiencia de token y almacenamiento en caché controlable lo convierte en un objetivo de actualización convincente. El esfuerzo de migración depende de dónde se ejecuta su carga de trabajo hoy. Cubrimos los tres puntos de partida comunes, desde el cambio más pequeño hasta el más grande.
Punto de partida 1: GPT-5.5 o GPT-5.4 en Amazon Bedrock
Si ya ejecuta modelos OpenAI en Amazon Bedrock, la actualización es un cambio de ID de modelo. La forma de solicitud del punto final, la autenticación y la API de respuestas permanecen idénticas:
Dos cosas para incluir en la actualización:
Adopte puntos de interrupción de caché explícitos. En GPT-5.5 y GPT-5.4, el almacenamiento en caché de avisos es automático: el sistema almacena en caché prefijos elegibles de 1024 tokens o más sin parámetros adicionales, y las escrituras en caché son gratuitas. GPT-5.6 pasa al modelo controlable descrito anteriormente, incluida la tasa de escritura de caché de 1,25 veces, que se aplica tanto a las escrituras implícitas como a las explícitas. Planifique los dos cambios juntos: cuando cambie la ID del modelo, coloque un punto de interrupción explícito después de su contenido estático al mismo tiempo. Esa única adición establece el patrón de escritura una vez y lectura muchas para mensajes cuyo final cambia en cada solicitud. También extiende la vida útil de la caché, porque los prefijos almacenados en caché GPT-5.6 permanecen disponibles durante al menos 30 minutos.
Revise su esfuerzo de razonamiento. GPT-5.6 agrega el nivel de esfuerzo xalto y ofrece más capacidad por token en todo el rango. Comience con su nivel de esfuerzo GPT-5.5 actual y pruebe un nivel más bajo. Muchas cargas de trabajo mantienen su nivel de calidad a un costo menor.
Punto de partida 2: API de respuestas en otra plataforma
Si su aplicación ya utiliza la API OpenAI Responses en otra plataforma, la migración a Amazon Bedrock requiere tres cambios: la URL base, la autenticación y el ID del modelo. Su código de manejo de solicitudes y respuestas sigue siendo el mismo:
El cambio de autenticación también es una mejora de seguridad: aws-bedrock-token-generator deriva tokens a corto plazo de sus credenciales de AWS, por lo que su aplicación utiliza roles de IAM de un extremo a otro. Mantiene la misma identidad, política y modelo de auditoría (AWS CloudTrail) que el resto de sus cargas de trabajo de AWS. Para la producción, incluya la generación de tokens en una rutina de actualización, ya que, por diseño, los tokens tienen una vida corta. Debido a que esta migración generalmente también lo eleva una generación de modelo, agregue los dos cambios desde el punto inicial 1: coloque un punto de interrupción de caché explícito después de su contenido estático y pruebe un nivel de esfuerzo de razonamiento por debajo de su configuración actual.
Punto de partida 3: API de finalización de chat en otra plataforma
GPT-5.6 en Amazon Bedrock se ofrece a través de la API de respuestas, por lo que las cargas de trabajo escritas en las finalizaciones de chat trasladan su manejo de solicitudes y respuestas como parte de la migración. El mapeo es mecánico:
Mensajes API de respuestas de finalización de chat=[{role, content}] instrucciones="…" (sistema) más input="…" o lista de mensajes max_completion_tokens max_output_tokens respuesta.choices[0].message.content respuesta.output_text tools=[{"type": "function", "function": {…}}] tools=[{"type": "function", "name": …, …}] opciones (planas)[0].message.tool_calls[i].id salida[i].call_id {"role": "tool", "tool_call_id": …} {"type": "function_call_output", "call_id": …} respuesta.usage.prompt_tokens/completation_tokens respuesta.usage.input_tokens/output_tokens stream=Verdadero con fragmentos delta.content stream=Verdadero con eventos escritos (respuesta.output_text.delta)
Antes y después, uno al lado del otro:
La API de Responses también ofrece capacidades adicionales, incluido el estado de conversación administrado por el servidor, eventos de transmisión escritos y el almacenamiento en caché de mensajes explícitos que se tratan en esta publicación, por lo que el puerto es una inversión que rinde frutos más allá de la migración en sí.
Validar y desplegar
Cualquiera que sea su punto de partida, trate la migración como un proyecto de ingeniería estructurado:
Primero el inventario. Catalogue los modelos, las API (respuestas o finalizaciones de chat), las herramientas, el uso de streaming y la gestión de estado en la que se basa su aplicación. Esto determina qué punto de partida anterior se aplica y abarca el trabajo. Crea un conjunto de mensajes dorados. Recopile indicaciones representativas y comportamientos esperados del tráfico de producción y reprodúzcalos en GPT-5.6 en Amazon Bedrock junto con su configuración actual. Evalúe la tasa de éxito, la calidad de la salida, el consumo de tokens y la latencia en las tareas importantes para su aplicación. Las herramientas de evaluación de Amazon Bedrock o su evaluación existente aprovechan ambos trabajos. Establezca su línea base de almacenamiento en caché. Como parte de la misma repetición, registre cached_tokens y cache_write_tokens y confirme que la ubicación de su punto de interrupción produce el patrón de escritura una vez y lectura muchas antes de que el tráfico de producción dependa de ello. Aumente gradualmente. Enrute un pequeño porcentaje del tráfico al nuevo modelo, compare los KPI con su línea de base y amplíelo a medida que crece la confianza, manteniendo la configuración anterior disponible para una reversión instantánea hasta que se complete la migración.
Conclusión
GPT-5.6 Sol, Terra y Luna traen los modelos de frontera más nuevos de OpenAI a Amazon Bedrock. Con el almacenamiento en caché de avisos explícitos, tiene una herramienta de precisión para las cargas de trabajo que dominan el gasto en modelos de lenguaje grande (LLM) modernos: agentes y cargas de trabajo de IA que reenvían las mismas instrucciones, herramientas y referencias en cada llamada. Necesita un punto de interrupción después de su contenido estático, una clave de caché consistente y dos campos de uso para monitorear. Una vez implementados, puede convertir ese contexto repetido de entrada de precio completo en lecturas de caché con descuento. La misma compatibilidad con OpenAI SDK que hace que el almacenamiento en caché sea sencillo de adoptar también hace que la migración en sí sea un cambio pequeño y bien definido desde donde se ejecute su carga de trabajo hoy.
Para obtener más información, consulte el anuncio de lanzamiento de GPT-5.6 y la documentación de almacenamiento en caché de mensajes de Amazon Bedrock para obtener detalles completos sobre los parámetros y modelos admitidos. Para obtener detalles sobre precios, consulte la página de precios de Amazon Bedrock. Para monitorear sus cargas de trabajo en producción, consulte Monitorear la inferencia del manto de roca mediante métricas de CloudWatch. Pruebe GPT-5.6 con sus propias indicaciones en la consola de Amazon Bedrock y comparta sus comentarios en AWS re:Post para Amazon Bedrock o a través de sus contactos habituales de AWS Support.