Baratería de roca amazónica anuncia la disponibilidad general de filtros de contenido de imagen, lo que le permite moderar el contenido de imagen y texto en sus aplicaciones generativas de IA. Anteriormente limitado al filtrado de solo texto, esta mejora ahora proporciona moderación integral de contenido en ambas modalidades. Esta nueva capacidad elimina el trabajo pesado requerido para construir sus propias salvaguardas de imagen o gastar ciclos en la moderación de contenido manual que puede ser propenso a errores y tediosos.
Tero HottinenVicepresidente, Jefe de Asociaciones Estratégicas en Koneprevé el siguiente caso de uso:
“En su evaluación en curso, Kone reconoce el potencial de las barandillas de roca madre de Amazon como un componente clave para proteger las aplicaciones de IA generativas, particularmente para la relevancia y las verificaciones de base contextuales, así como las salvaguardas multimodales. contenido.”
Amazon Bedrock GuardRails proporciona salvaguardas configurables para ayudar a los clientes a bloquear las entradas y salidas dañinas o no deseadas para sus aplicaciones generativas de IA. Los clientes pueden crear barandillas personalizadas adaptadas a sus casos de uso específicos mediante la implementación de diferentes políticas para detectar y filtrar contenido dañino o no deseado de las indicaciones de entrada y las respuestas del modelo. Además, los clientes pueden usar barandillas para detectar alucinaciones de modelos y ayudar a que las respuestas sean fundadas y precisas. A través de su independiente APIA APPLIA APIGuardRails permite a los clientes aplicar políticas consistentes en cualquier modelo de baseincluidos los alojados en Roca madre de Amazonmodelos autohostados y modelos de terceros. Las barandillas de roca madre admiten una integración perfecta con los agentes de base y las bases de conocimiento de roca madre, lo que permite a los desarrolladores hacer cumplir salvaguardas en varios flujos de trabajo, como sistemas de generación aumentada de recuperación (RAG) y aplicaciones de agente.
Amazon Bedrock -BuardRails ofrece seis políticas distintas, que incluyen: filtros de contenido para detectar y filtrar material dañino en varias categorías, incluidos el odio, los insultos, el contenido sexual, la violencia, la mala conducta y prevenir ataques rápidos; filtros de temas para restringir temas específicos; Filtros de información confidencial para bloquear información de identificación personal (PII); filtros de palabras para bloquear términos específicos; Comprobaciones de base contextuales para detectar alucinaciones y analizar la relevancia de respuesta; y verificaciones de razonamiento automatizadas (actualmente en vista previa cerrada) para identificar, corregir y explicar las reclamaciones fácticas. Con la nueva capacidad de moderación de contenido de imagen, estas salvaguardas ahora se extienden tanto al texto como a las imágenes, lo que ayuda al cliente a bloquear hasta el 88% del contenido multimodal dañino. Puede configurar de forma independiente la moderación para el contenido de imagen o texto (o ambos) con umbrales ajustables de bajo a alto, lo que le ayuda a construir aplicaciones de IA generativas que se alineen con las políticas de IA responsables de su organización.
Esta nueva capacidad generalmente está disponible en East East (N. Virginia), US West (Oregon), Europa (Frankfurt) y Asia Pacific (Tokio) AWS Regions.
En esta publicación, discutimos cómo comenzar con los filtros de contenido de imagen en las barandillas de roca madre de Amazon.
Descripción general de la solución
Para comenzar, cree una barandilla en el Consola de gestión de AWS y configure los filtros de contenido para datos de texto o imagen o ambos. También puedes usar AWS SDKS para integrar esta capacidad en sus aplicaciones.
Crear una barandilla
Para crear una barandilla, complete los siguientes pasos:
- En la consola de roca madre de Amazon, debajo Salvaguardia En el panel de navegación, elija Barandas.
- Elegir Crear barandilla.
- En el Configurar filtros de contenido sección, debajo Categorías dañinas y Ataques rápidospuede usar los filtros de contenido existentes para detectar y bloquear los datos de la imagen además de los datos de texto.
- Una vez que haya seleccionado y configurado los filtros de contenido que desea usar, puede guardar la barandilla y comenzar a usarlo para ayudarlo a bloquear entradas y salidas dañinas o no deseadas para sus aplicaciones AI generativas.
Prueba una barandilla con la generación de texto
Para probar la nueva barandilla en la consola de roca madre de Amazon, seleccione la barandilla y elija Prueba. Tiene dos opciones: pruebe la barandilla eligiendo e invocando un modelo o pruebe la barandilla sin invocar un modelo utilizando las barandillas de roca madre de Amazon independientemente ApplyGuardail API.
Con el ApplyGuardrail API, puede validar el contenido en cualquier momento del flujo de su aplicación antes de procesar o servir resultados al usuario. También puede usar la API para evaluar las entradas y salidas para FMS autogestionados (personalizados) o de terceros, independientemente de la infraestructura subyacente. Por ejemplo, puede usar la API para evaluar un Meta Llama 3.2 modelo alojado en Amazon Sagemaker o Nemo mistral Modelo que se ejecuta en su computadora portátil.
Pruebe una barandilla eligiendo e invocando un modelo
Seleccione un modelo que admita las entradas o salidas de imágenes, por ejemplo, el soneto Claude 3.5 de Anthrope. Verifique que los filtros de respuesta y respuesta estén habilitados para el contenido de la imagen. Luego, proporcione un mensaje, cargue un archivo de imagen y elija Correr.
En este ejemplo, las barandillas de roca madre de Amazon intervinieron. Elegir Vista traza Para más detalles.
La traza de barandilla proporciona un registro de cómo se aplicaron las medidas de seguridad durante una interacción. Muestra si las barandillas de roca madre de Amazon intervinieron o no y qué evaluaciones se hicieron tanto en entrada (Aviso) como en salida (respuesta del modelo). En este ejemplo, los filtros de contenido bloquearon el indicador de entrada porque detectaron violencia en la imagen con confianza media.
Prueba una barandilla sin invocar un modelo
En la consola de rock de Amazon, elija Utilice la API de ApplicGuardAilla API independiente para probar la barandilla sin invocar un modelo. Elija si desea validar un indicador de entrada o un ejemplo de una salida generada por el modelo. Luego, repita los pasos de la sección anterior. Verifique que los filtros de solicitud y respuesta estén habilitados para el contenido de la imagen, proporcionen el contenido para validar y elegir Correr.
Para este ejemplo, reutilizamos la misma imagen y un mensaje de entrada, y las barandillas de roca madre de Amazon intervinieron nuevamente. Elegir Vista traza de nuevo para más detalles.
Prueba una barandilla con la generación de imágenes
Ahora, probemos la detección de toxicidad multimodal de barra de roca madre de Amazon con casos de uso de generación de imágenes. El siguiente es un ejemplo del uso de filtros de contenido de imagen de barra de roca madre de Amazon con un caso de uso de generación de imágenes. Generamos una imagen utilizando el modelo de estabilidad en Amazon Bedrock usando el InvokeModel API y la barandilla:
Puede acceder al ejemplo completo desde el Repositorio de Github.
Conclusión
En esta publicación, exploramos cómo los nuevos filtros de contenido de imagen de las barandillas de rock de Amazon proporcionan capacidades integrales de moderación de contenido multimodal. Al extender más allá del filtrado de solo texto, esta solución ahora ayuda a los clientes a bloquear hasta el 88% de contenido multimodal dañino o no deseado en categorías configurables, que incluyen odio, insultos, contenido sexual, violencia, mala conducta y detección de ataque rápido. GuardRails puede ayudar a las organizaciones a través de la atención médica, la fabricación, los servicios financieros, los medios y la educación a mejorar la seguridad de la marca sin la carga de construir salvaguardas personalizadas o realizar evaluaciones manuales propensas a errores.
Para aprender más, ver Detenga el contenido dañino en modelos que usan barandillas de roca madre de Amazon.
Sobre los autores
Satveer Khurpa es arquitecto de soluciones especialistas en la WW, Bedrock de Amazon Services web de Amazon, especializada en Amazon Bedrock Security. En este rol, utiliza su experiencia en arquitecturas basadas en la nube para desarrollar soluciones de IA generativas innovadoras para clientes en diversas industrias. La comprensión profunda de Satveer de las tecnologías de IA generativas y los principios de seguridad le permite diseñar aplicaciones escalables, seguras y responsables que desbloquean nuevas oportunidades comerciales e impulsan el valor tangible mientras mantienen posturas de seguridad sólidas.
Shyam Srinivasan está en el equipo de productos de barandilla de roca madre de Amazon. Se preocupa por hacer del mundo un lugar mejor a través de la tecnología y le encanta ser parte de este viaje. En su tiempo libre, a Shyam le gusta correr largas distancias, viajar por el mundo y experimentar nuevas culturas con familiares y amigos.
Antonio Rodríguez es un arquitecto principal de soluciones especialistas en IA generativas en AWS. Ayuda a las empresas de todos los tamaños a resolver sus desafíos, adoptar la innovación y crear nuevas oportunidades de negocio con Amazon Bedrock. Además del trabajo, le encanta pasar tiempo con su familia y practicar deportes con sus amigos.
Dr. Andrew Kane es un líder de AWS Director WW Tech (AI Language Services) con sede en Londres. Se enfoca en los servicios de IA de lenguaje y visión de AWS, ayudando a nuestros clientes a arquitectores de múltiples servicios de IA en una solución de uso de un solo uso. Antes de unirse a AWS a principios de 2015, Andrew pasó dos décadas trabajando en los campos del procesamiento de señales, sistemas de pagos financieros, seguimiento de armas y sistemas editoriales y de publicación. Es un entusiasta entusiasta del karate (a solo un cinturón de cinturón negro) y también es un ávido cervecero casero, que usa hardware de elaboración automático y otros sensores de IoT.