Esta publicación está coescrita con Isaac Cameron y Alex Gnibus de Tecton.
Las empresas están bajo presión para mostrar el retorno de la inversión (ROI) de los casos de uso de IA, ya sea aprendizaje automático predictivo (ML) o IA generativa. Solo el 54% de los prototipos de ML llegan a producción y solo el 5% de los casos de uso de IA generativa. llegar a la producción.
El retorno de la inversión no se trata sólo de llegar a la producción: se trata de la precisión y el rendimiento del modelo. Necesita un sistema escalable y confiable con alta precisión y baja latencia para los casos de uso en tiempo real que impactan directamente el resultado final cada milisegundo.
La detección de fraude, por ejemplo, requiere una latencia extremadamente baja porque las decisiones deben tomarse en el tiempo que lleva pasar una tarjeta de crédito. Con fraude en aumentomás organizaciones están presionando para implementar sistemas exitosos de detección de fraude. Las pérdidas por fraude a nivel nacional en EE.UU. superaron los 10.000 millones de dólares en 2023, un 14% de aumento a partir de 2022. Se prevé que el fraude mundial en el comercio electrónico supere los 343.000 millones de dólares en 2027.
Pero crear y gestionar una aplicación de IA precisa y fiable que pueda solucionar ese problema de 343.000 millones de dólares es abrumadoramente complejo.
Los equipos de ML a menudo comienzan uniendo manualmente diferentes componentes de infraestructura. Al principio parece sencillo para los datos por lotes, pero la ingeniería se vuelve aún más complicada cuando es necesario pasar de los datos por lotes a incorporar fuentes de datos en tiempo real y en streaming, y de la inferencia por lotes a la servicio en tiempo real.
Los ingenieros deben crear y organizar los canales de datos, hacer malabarismos con las diferentes necesidades de procesamiento para cada fuente de datos, administrar la infraestructura informática, crear una infraestructura de servicio confiable para la inferencia y más. Sin las capacidades de tectónla arquitectura podría parecerse al siguiente diagrama.
Acelere el desarrollo y la implementación de su IA con Amazon SageMaker y Tecton
Toda esa complejidad manual se simplifica con tectón y Amazon SageMaker. Juntos, Tecton y SageMaker abstraen la ingeniería necesaria para la producción de aplicaciones de IA en tiempo real. Esto permite obtener valor más rápido y los equipos de ingeniería pueden centrarse en crear nuevas funciones y casos de uso en lugar de tener que esforzarse por gestionar la infraestructura existente.
Con SageMaker, puede crear, entrenar e implementar modelos de aprendizaje automático. Mientras tanto, Tecton simplifica la computación, administración y recuperación de funciones para impulsar modelos en SageMaker, tanto para capacitación fuera de línea como para servicio en línea.. Esto agiliza el ciclo de vida de las funciones de un extremo a otro para casos de uso a escala de producción, lo que da como resultado una arquitectura más simple, como se muestra en el siguiente diagrama.
¿Cómo funciona? Con el fácil de usar de Tecton marco declarativousted define las transformaciones de sus funciones en unas pocas líneas de código y Tecton crea las canalizaciones necesarias para calcular, administrar y servir las funciones. Tecton se encarga de la implementación completa en producción y servicio en línea.
No importa si se trata de datos por lotes, streaming o en tiempo real o si se trata de un servicio en línea o sin conexión. Es un marco común para cada necesidad de procesamiento de datos en la producción de funciones de un extremo a otro.
Este marco crea un centro central para la gestión y el gobierno de funciones con la empresa. tienda de funciones capacidades, lo que facilita la observación del linaje de datos para cada canal de características, monitorear la calidad de los datosy reutilizar funciones en múltiples modelos y equipos.
El siguiente diagrama muestra el marco declarativo de Tecton.
La siguiente sección examina una detección de fraude Ejemplo para mostrar cómo Tecton y SageMaker aceleran tanto la capacitación como el servicio en tiempo real para un sistema de IA de producción.
Agilice el desarrollo de funciones y la capacitación de modelos
Primero, es necesario desarrollar las funciones y entrenar el modelo. El marco declarativo de Tecton simplifica la definición de características y genera datos de entrenamiento precisos para los modelos de SageMaker:
- Experimente e itere funciones en los cuadernos de SageMaker – Puede utilizar el kit de desarrollo de software (SDK) de Tecton para interactuar con Tecton directamente a través de instancias de portátiles de SageMaker, lo que permite una experimentación e iteración flexibles sin salir del entorno de SageMaker.
- Orqueste con clústeres EMR administrados por Tecton – Una vez implementadas las funciones, Tecton crea automáticamente la programación, el aprovisionamiento y la orquestación necesarios para las canalizaciones que pueden ejecutarse en EMR de Amazon motores de computación. Puede ver y crear clústeres de EMR directamente a través del cuaderno de SageMaker.
- Genere datos de entrenamiento precisos para los modelos de SageMaker: Para el entrenamiento de modelos, los científicos de datos pueden usar el SDK de Tecton dentro de sus cuadernos SageMaker para recuperar características históricas. El mismo código se utiliza para rellenar la tienda fuera de línea y actualizar continuamente la tienda en línea, lo que reduce el sesgo de capacitación/servicio.
A continuación, las funciones deben ofrecerse en línea para que el modelo final las consuma en producción.
Ofrezca funciones con inferencia en línea sólida y en tiempo real
El marco declarativo de Tecton se extiende al servicio en línea. La infraestructura en tiempo real de Tecton está diseñada para ayudar a satisfacer las demandas de aplicaciones extensas y puede de manera confiable ejecutar 100.000 solicitudes por segundo.
Para las aplicaciones de aprendizaje automático críticas, es difícil cumplir con los exigentes acuerdos de nivel de servicio (SLA) de una manera escalable y rentable. Los casos de uso en tiempo real, como la detección de fraude, suelen tener un presupuesto de latencia p99 de entre 100 y 200 milisegundos. Eso significa que el 99% de las solicitudes deben ser más rápidas que 200 ms para el proceso de un extremo a otro, desde la recuperación de funciones hasta la puntuación del modelo y el posprocesamiento.
La prestación de funciones solo obtiene una fracción de ese presupuesto de latencia de extremo a extremo, lo que significa que necesita que su solución sea especialmente rápida. Tecton se adapta a estos requisitos de latencia integrándose con almacenes de datos basados en disco y en memoria, admitiendo el almacenamiento en caché en memoria y ofreciendo funciones para inferencia a través de una API REST de baja latencia, que se integra con los puntos finales de SageMaker.
Ahora podemos completar nuestro caso de uso de detección de fraude. En un sistema de detección de fraude, cuando alguien realiza una transacción (como comprar algo en línea), su aplicación podría seguir estos pasos:
- Comprueba con otros servicios para obtener más información (por ejemplo, “¿Se sabe que este comerciante es riesgoso?”) de API de terceros.
- Extrae datos históricos importantes sobre el usuario y su comportamiento (por ejemplo, “¿Con qué frecuencia esta persona suele gastar tanto?” o “¿Ha realizado compras en esta ubicación antes?”), solicitando las funciones de ML a Tecton.
- Es probable que utilice funciones de transmisión para comparar la transacción actual con la actividad de gasto reciente durante las últimas horas o minutos.
- Envía toda esta información al modelo alojado en Amazon SageMaker que predice si la transacción parece fraudulenta.
Este proceso se muestra en el siguiente diagrama.
Amplíe los casos de uso de IA generativa con su arquitectura AWS y Tecton existente
Una vez que haya desarrollado funciones de ML utilizando la arquitectura Tecton y AWS, puede ampliar su trabajo de ML a casos de uso de IA generativa.
Por ejemplo, en el ejemplo de detección de fraude, es posible que desee agregar un chat de atención al cliente basado en LLM que ayude al usuario a responder preguntas sobre su cuenta. Para generar una respuesta útil, el chat necesitaría hacer referencia a diferentes fuentes de datos, incluidos los documentos no estructurados en su base de conocimientos (como la documentación de políticas sobre las causas de la suspensión de una cuenta) y datos estructurados como el historial de transacciones y la actividad de la cuenta en tiempo real.
Si estás usando un Recuperación Generación Aumentada (RAG) para proporcionar contexto a su LLM, puede utilizar sus canales de funciones de ML existentes como contexto. Con Tecton, puedes enriquece tus indicaciones con datos contextuales o proporcionar características como herramientas a su LLM, todos utilizando el mismo marco declarativo.
Para elegir y personalizar el modelo que mejor se adapte a su caso de uso, Roca Amazónica proporciona una variedad de modelos básicos (FM) previamente entrenados para la inferencia, o puede usar SageMaker para una creación y capacitación de modelos más exhaustiva.
El siguiente gráfico muestra cómo se incorpora Amazon Bedrock para admitir capacidades de IA generativa en la arquitectura del sistema de detección de fraude.
Cree valiosas aplicaciones de IA más rápido con AWS y Tecton
En esta publicación, analizamos cómo SageMaker y Tecton permiten a los equipos de IA entrenar e implementar una aplicación de IA en tiempo real y de alto rendimiento, sin el complejo trabajo de ingeniería de datos. Tecton combina capacidades de ML de producción con la conveniencia de hacer todo desde SageMaker, ya sea en la etapa de desarrollo para entrenar modelos o realizar inferencias en tiempo real en producción.
Para comenzar, consulte Introducción a la plataforma de funciones de Amazon SageMaker y Tectonuna guía más detallada sobre cómo utilizar Tecton con Amazon SageMaker. Y si no puedes esperar para probarlo tú mismo, echa un vistazo a Tecton. demostración interactiva y observe un caso de uso de detección de fraude en acción.
También puedes encontrar Tecton en AWS re: Inventar. alcanzar para programar una reunión con expertos en el sitio sobre sus necesidades de ingeniería de IA.
Acerca de los autores
isaac cameron Es arquitecto líder de soluciones en Tecton y guía a los clientes en el diseño e implementación de aplicaciones de aprendizaje automático en tiempo real. Habiendo creado previamente una plataforma de aprendizaje automático personalizada desde cero en una importante aerolínea de EE. UU., aporta experiencia de primera mano sobre los desafíos y complejidades involucradas, lo que lo convierte en un firme defensor del aprovechamiento de la infraestructura moderna y administrada de aprendizaje automático e inteligencia artificial.
Alex Gnibus es un evangelista técnico en Tecton, que hace que los conceptos técnicos sean accesibles y prácticos para los equipos de ingeniería. A través de su trabajo formando profesionales, Alex ha desarrollado una profunda experiencia en identificar y abordar los desafíos prácticos que enfrentan los equipos al producir sistemas de IA.
Arnab Sinha es arquitecto senior de soluciones en AWS y se especializa en el diseño de soluciones escalables que impulsan resultados comerciales en inteligencia artificial, aprendizaje automático, big data, transformación digital y modernización de aplicaciones. Con experiencia en industrias como la energía, la atención médica, el comercio minorista y la fabricación, Arnab posee todas las certificaciones de AWS, incluida la especialidad de aprendizaje automático, y ha liderado equipos de tecnología e ingeniería antes de unirse a AWS.