Esta publicación está coescrita con Deepali Rajale de Karini AI.
Karini IAuna plataforma líder de base de IA generativa creada en AWS, permite a los clientes crear rápidamente aplicaciones de IA generativa seguras y de alta calidad. GenAI no es solo una tecnología; es una herramienta de transformación que está cambiando la forma en que las empresas utilizan la tecnología. Según dónde se encuentren en el proceso de adopción, la adopción de IA generativa presenta un desafío significativo para las empresas. Si bien los proyectos piloto que utilizan IA generativa pueden comenzar sin esfuerzo, la mayoría de las empresas necesitan ayuda para avanzar más allá de esta fase. Según Investigación del EverestMás del 50% de los proyectos no avanzan más allá de los pilotos porque enfrentan obstáculos debido a la ausencia de prácticas operativas GenAI estandarizadas o establecidas.
Karini IA ofrece una plataforma de base GenAI sólida y fácil de usar que permite a las empresas crear, administrar e implementar aplicaciones de IA generativa. Permite a los principiantes y a los profesionales expertos desarrollar e implementar aplicaciones Gen AI para varios casos de uso más allá de los chatbots simples, incluidos los flujos de trabajo de lotes, de agentes, de inteligencia empresarial generativa y multiagencial. La plataforma sin código es ideal para la experimentación rápida, la creación de PoC y la transición rápida a la producción con barandillas integradas para la seguridad y la observabilidad para la resolución de problemas. La plataforma incluye un marco de evaluación de calidad en línea y fuera de línea para evaluar la calidad durante la experimentación y monitorear continuamente las aplicaciones después de la implementación. El patio de juegos de indicaciones intuitivo de Karini AI permite la creación de indicaciones, la comparación con diferentes modelos entre proveedores, la gestión de indicaciones y el ajuste de indicaciones. Admite pruebas iterativas de indicaciones más sencillas, de agentes y multiagencial. Para la implementación de producción, las recetas sin código permiten un fácil ensamblaje de la canalización de ingesta de datos para crear una base de conocimiento y la implementación de cadenas RAG o de agentes. Los propietarios de la plataforma pueden monitorear los costos y el rendimiento en tiempo real con una observabilidad detallada e integrarse sin problemas con La roca madre del Amazonas para la inferencia LLM, beneficiándose de amplios conectores empresariales y técnicas de preprocesamiento de datos.
El siguiente diagrama ilustra cómo Karini AI ofrece una solución integral Plataforma fundamental de IA generativa Esta plataforma abarca todo el ciclo de vida de la aplicación y ofrece una solución integral que acelera el tiempo de comercialización y optimiza el uso de los recursos al proporcionar un marco unificado para el desarrollo, la implementación y la gestión.
En esta publicación, compartimos cómo la migración de modelos de incrustación vectorial de Karini AI de Kubernetes a Amazon SageMaker Los puntos finales mejoraron la concurrencia en un 30% y ahorraron más del 23% en costos de infraestructura.
Canal de ingesta de datos de Karini AI para crear incrustaciones vectoriales
Enriquecer los modelos de lenguaje grandes (LLM) con nuevos datos es crucial para crear aplicaciones prácticas de IA generativa. Aquí es donde entra en juego la Generación Aumentada de Recuperación (RAG). RAG mejora las capacidades de los LLM al incorporar datos externos y producir un rendimiento de vanguardia en tareas intensivas en conocimiento. Karini AI ofrece soluciones sin código para crear aplicaciones de IA generativa utilizando RAG. Estas soluciones incluyen dos componentes principales: un canal de ingesta de datos para crear una base de conocimiento y un sistema para la recuperación y el resumen de conocimiento. Juntos, estos canales simplifican el proceso de desarrollo, lo que permite la creación de potentes aplicaciones de IA con facilidad.
Canalización de ingesta de datos
La ingesta de datos de diversas fuentes es esencial para ejecutar la Generación Aumentada de Recuperación (RAG). El flujo de ingesta de datos de Karini AI permite la conexión a múltiples fuentes de datos, incluidas Amazon S3, Amazon Redshift, Servicio de base de datos relacional de Amazon (RDS), Sitios web y Confluence, que manejan datos estructurados y no estructurados. Estos datos de origen se procesan previamente, se dividen en fragmentos y se transforman en incrustaciones vectoriales antes de almacenarse en una base de datos vectorial para su recuperación. La plataforma de Karini AI brinda flexibilidad al ofrecer una variedad de modelos de incrustación desde su centro de modelos, lo que simplifica la creación de incrustaciones vectoriales para aplicaciones de IA avanzadas.
Aquí hay una captura de pantalla del proceso de ingesta de datos sin código de Karini AI.
El centro de modelos de Karini AI agiliza la incorporación de modelos al integrarse con los principales proveedores de modelos básicos, como Amazon Bedrock y plataformas de servicio autogestionadas.
Desafíos de infraestructura
A medida que los clientes exploran casos de uso complejos y los conjuntos de datos crecen en tamaño y complejidad, Karini AI escala el proceso de ingesta de datos de manera eficiente para proporcionar alta concurrencia para crear incrustaciones vectoriales utilizando modelos de incrustación de última generación, como los que se enumeran en Tabla de clasificación de MTEBque evolucionan rápidamente y no están disponibles en plataformas administradas.
Antes de migrar a Amazon SageMakerImplementamos nuestros modelos en Kubernetes (K8s) autogestionados en instancias EC2. Kubernetes ofreció una flexibilidad significativa para implementar modelos desde HuggingFace rápidamente, pero pronto, nuestro equipo de ingeniería tuvo que gestionar muchos aspectos de escalado e implementación. Enfrentamos los siguientes desafíos con nuestra configuración existente que deben abordarse para mejorar la eficiencia y el rendimiento.
- Manteniéndose al día con los modelos SOTA (State-Of-The-Art):Administramos distintos manifiestos de implementación para cada tipo de modelo (como clasificadores, incrustaciones y autocompletado), lo que consumía mucho tiempo y era propenso a errores. También teníamos que mantener la lógica para determinar la asignación de memoria para los distintos tipos de modelos.
- Gestionar la concurrencia dinámica era difícil:Un desafío importante al usar modelos alojados en Kubernetes fue lograr el nivel más alto de concurrencia dinámica. Nuestro objetivo era maximizar el rendimiento de los puntos de conexión para alcanzar el objetivo de transacciones por segundo (TPS) y, al mismo tiempo, cumplir con los estrictos requisitos de latencia.
- Costos más altos:Si bien Kubernetes (K8s) ofrece capacidades sólidas, se ha vuelto más costoso debido a la naturaleza dinámica de los canales de ingesta de datos, lo que genera instancias subutilizadas y costos más altos.
Nuestra búsqueda de una plataforma de inferencia nos llevó a Amazon SageMakeruna solución que administra eficientemente nuestros modelos para lograr una mayor concurrencia, cumple con los acuerdos de nivel de servicio del cliente y reduce la escala de los servicios cuando no son necesarios. La confiabilidad del rendimiento de SageMaker nos dio confianza en sus capacidades.
Elegir Amazon SageMaker fue una decisión estratégica para Karini AI. Equilibró la necesidad de lograr una mayor concurrencia a un menor costo, lo que proporcionó una solución rentable para nuestras necesidades. La capacidad de SageMaker para escalar y maximizar la concurrencia al tiempo que garantiza una latencia de menos de un segundo aborda varios casos de uso de IA generativa, lo que lo convierte en una inversión duradera para nuestra plataforma.
Amazon SageMaker es un servicio completamente administrado que permite a los desarrolladores y científicos de datos crear, entrenar e implementar rápidamente modelos de aprendizaje automático (ML). Con SageMaker, puede implementar sus modelos de ML en puntos de conexión alojados y obtener resultados de inferencia en tiempo real. Puede ver fácilmente las métricas de rendimiento de sus puntos de conexión en Amazon CloudWatch, escalar automáticamente los puntos finales Basado en el tráfico, y actualice sus modelos en producción sin perder disponibilidad.
La arquitectura de canalización de ingesta de datos de Karini AI con punto final del modelo Amazon SageMaker está aquí.
Ventajas de utilizar el hosting SageMaker
Amazon SageMaker ofreció a nuestro proceso de ingestión de Gen AI muchos beneficios directos e indirectos.
- Mitigación de la deuda técnica: Amazon SageMakerAl ser un servicio administrado, nos permitió liberar a nuestros ingenieros de ML de la carga de la inferencia, lo que les permitió enfocarse más en las características principales de nuestra plataforma; este alivio de la deuda técnica es una ventaja significativa de usar SageMaker, y nos asegura su eficiencia.
- Cumplir con los SLA del cliente:La creación de una base de conocimientos es una tarea dinámica que puede requerir una mayor concurrencia durante la generación de la incrustación de vectores y una carga minúscula durante el tiempo de consulta. En función de los acuerdos de nivel de servicio del cliente y el volumen de datos, podemos elegir entre inferencia por lotes, alojamiento en tiempo real con escalado automático o alojamiento sin servidor. Amazon SageMaker También proporciona recomendaciones sobre tipos de instancias adecuados para integrar modelos.
- Reducción de costes de infraestructura:SageMaker es un servicio de pago por uso que le permite crear puntos finales en lote o en tiempo real cuando hay demanda y destruirlos cuando se completa el trabajo. Este enfoque redujo nuestro costo de infraestructura en más del 23 % en comparación con la plataforma Kubernetes (K8s).
- Puesta en marcha de SageMaker: Puesta en marcha de SageMaker Proporciona acceso a modelos SOTA (State-Of-The-Art) y contenedores de inferencia optimizados, lo que lo hace ideal para crear nuevos modelos que sean accesibles para nuestros clientes.
- Compatibilidad con Amazon Bedrock:Karini AI se integra con Amazon Bedrock para la inferencia LLM (modelo de lenguaje grande). Importación de modelos personalizados Esta función nos permite reutilizar los pesos del modelo utilizados en el alojamiento de modelos de SageMaker en Amazon Bedrock para mantener una base de código conjunta y un servicio de intercambio entre Bedrock y SageMaker según la carga de trabajo.
Conclusión
Karini AI mejoró significativamente, logrando un alto rendimiento y reduciendo los costos de alojamiento de modelos al migrar a Amazon SageMaker. Podemos implementar modelos de terceros personalizados en SageMaker y ponerlos rápidamente a disposición del centro de modelos de Karini para las canalizaciones de ingesta de datos. Podemos optimizar la configuración de nuestra infraestructura para el alojamiento de modelos según sea necesario, según el tamaño del modelo y nuestro TPS esperado. Amazon SagaMaker para la inferencia de modelos permitió a Karini AI manejar la creciente complejidad de los datos de manera eficiente y satisfacer las necesidades de concurrencia al mismo tiempo que optimizaba los costos. Además, Amazon SageMaker permite una fácil integración e intercambio de nuevos modelos, lo que garantiza que nuestros clientes puedan aprovechar continuamente los últimos avances en tecnología de IA sin comprometer el rendimiento ni incurrir en costos incrementales innecesarios.
Amazon SageMaker y Karini.ai Ofrece una plataforma potente para crear, entrenar e implementar modelos de aprendizaje automático a gran escala. Al aprovechar estas herramientas, puede:
- Acelerar el desarrollo:Cree y entrene modelos más rápido con algoritmos y marcos prediseñados.
- Mejorar la precisión:Benefíciese de algoritmos y técnicas avanzados para mejorar el rendimiento del modelo.
- Escala sin esfuerzo:Implemente modelos en producción con facilidad y gestione cargas de trabajo crecientes.
- Reducir costes:Optimice la utilización de recursos y minimice los gastos operativos.
No pierda esta oportunidad de obtener una ventaja competitiva.
Acerca de los autores
Deepali Rajale es la fundadora de Karini AI, que tiene la misión de democratizar la IA generativa en las empresas. Le gusta escribir blogs sobre IA generativa y asesorar a los clientes para optimizar su práctica. En su tiempo libre, le gusta viajar, buscar nuevas experiencias y mantenerse al día con las últimas tendencias tecnológicas. Puedes encontrarla en LinkedIn.
Ravindra Gupta es el líder mundial de GTM para SageMaker y le apasiona ayudar a los clientes a adoptar SageMaker para sus cargas de trabajo de aprendizaje automático/GenAI. A Ravi le encanta aprender nuevas tecnologías y disfruta asesorando a empresas emergentes en sus prácticas de aprendizaje automático. Puedes encontrarlo en Linkedin