Hugging Face ha anunciado el lanzamiento de Transformadores versión 4.42que aporta muchas nuevas características y mejoras a la popular biblioteca de aprendizaje automático. Esta versión presenta varios modelos avanzados, admite nuevas herramientas y generación aumentada por recuperación (RAG), ofrece ajuste fino de GGUF e incorpora una caché KV cuantificada, entre otras mejoras.
Con la versión 4.42 de Transformers, este lanzamiento de nuevos modelos, incluidos Gemma 2, RT-DETR, InstructBlip y LLaVa-NeXT-Video, también lo hace más notable. La familia de modelos Gemma 2, desarrollada por el equipo Gemma2 de Google, comprende dos versiones: 2 mil millones y 7 mil millones de parámetros. Estos modelos se entrenan con 6 billones de tokens y han demostrado un rendimiento notable en varios puntos de referencia académicos en comprensión del lenguaje, razonamiento y seguridad. Superaron a modelos abiertos de tamaño similar en 11 de 18 tareas basadas en texto, lo que demuestra sus sólidas capacidades y prácticas de desarrollo responsables.
RT-DETR, o Transformador de detección en tiempo real, es otra incorporación importante. Este modelo, diseñado para la detección de objetos en tiempo real, aprovecha la arquitectura del transformador para identificar y localizar múltiples objetos dentro de imágenes de forma rápida y precisa. Su desarrollo lo posiciona como un competidor formidable en los modelos de detección de objetos.
InstructBlip mejora el ajuste de las instrucciones visuales utilizando la arquitectura BLIP-2. Proporciona indicaciones de texto al Q-Former, lo que permite interacciones más efectivas con el modelo de lenguaje visual. Este modelo promete un mejor rendimiento en tareas que requieren comprensión visual y textual.
LLaVa-NeXT-Video se basa en el modelo LLaVa-NeXT incorporando conjuntos de datos de vídeo e imágenes. Esta mejora permite que el modelo realice tareas de comprensión de video de última generación, lo que lo convierte en una herramienta valiosa para el análisis de contenido de video de toma cero. La técnica AnyRes, que representa imágenes de alta resolución como múltiples imágenes más pequeñas, es crucial en la capacidad de este modelo para generalizar de imágenes a cuadros de video de manera efectiva.
El uso de herramientas y la compatibilidad con RAG también han mejorado significativamente. Hugging Face genera automáticamente descripciones de esquemas JSON para funciones de Python, lo que facilita una integración perfecta con los modelos de herramientas. Una API estandarizada para modelos de herramientas garantiza la compatibilidad entre varias implementaciones, centrándose en las familias de modelos Nous-Hermes, Command-R y Mistral/Mixtral para un soporte inminente.
Otra mejora notable es la compatibilidad con ajustes finos de GGUF. Esta característica permite a los usuarios ajustar los modelos dentro del ecosistema Python/Hugging Face y luego convertirlos nuevamente a bibliotecas GGUF/GGML/llama.cpp. Esta flexibilidad garantiza que los modelos se puedan optimizar e implementar en diversos entornos.
Las mejoras en la cuantificación, incluida la adición de una caché KV cuantificada, reducen aún más los requisitos de memoria para los modelos generativos. Esta actualización, junto con una revisión integral de la documentación de cuantificación, brinda a los usuarios una guía más clara sobre cómo seleccionar los métodos de cuantificación más adecuados para sus necesidades.
Además de estas actualizaciones importantes, Transformers 4.42 incluye varias otras mejoras. Se han agregado nuevos ejemplos de segmentación de instancias, lo que permite a los usuarios aprovechar los pesos de los modelos previamente entrenados de Hugging Face como columna vertebral de los modelos de visión. La versión también incluye correcciones de errores y optimizaciones, así como la eliminación de componentes obsoletos como ConversationalPipeline y el objeto Conversation.
En conclusión, Transformers 4.42 representa un avance significativo para la biblioteca de aprendizaje automático de Hugging Face. Con sus nuevos modelos, compatibilidad mejorada con herramientas y numerosas optimizaciones, esta versión consolida la posición de Hugging Face como líder en PNL y aprendizaje automático.
Fuentes
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.