Google lanza TensorFlow 2.21 y LiteRT: rendimiento de GPU más rápido, nueva aceleración de NPU y actualizaciones perfectas de implementación de PyTorch Edge

Google ha lanzado oficialmente TensorFlow 2.21. La actualización más importante de esta versión es la graduación de LiteRT de su etapa de vista previa a una pila completamente lista para producción. En el futuro, LiteRT sirve como marco de inferencia universal en el dispositivo, reemplazando oficialmente a TensorFlow Lite (TFLite).

Esta actualización agiliza la implementación de modelos de aprendizaje automático en dispositivos móviles y de vanguardia al tiempo que amplía la compatibilidad del hardware y el marco.

LiteRT: rendimiento y aceleración de hardware

Al implementar modelos en dispositivos periféricos (como teléfonos inteligentes o hardware de IoT), la velocidad de inferencia y la eficiencia de la batería son las principales limitaciones. LiteRT soluciona esto con aceleración de hardware actualizada:

Mejoras de GPU: LiteRT ofrece un rendimiento de GPU 1,4 veces más rápido en comparación con el marco TFLite anterior. Integración de NPU: el lanzamiento presenta aceleración de NPU de última generación con un flujo de trabajo unificado y optimizado tanto para GPU como para NPU en plataformas perimetrales.

Esta infraestructura está diseñada específicamente para admitir la implementación de GenAI multiplataforma para modelos abiertos como Gemma.

Operaciones de menor precisión (cuantización)

Para ejecutar modelos complejos en dispositivos con memoria limitada, los desarrolladores utilizan una técnica llamada cuantificación. Esto implica reducir la precisión (el número de bits) utilizada para almacenar los pesos y activaciones de una red neuronal.

TensorFlow 2.21 amplía significativamente la compatibilidad de los operadores tf.lite con tipos de datos de menor precisión para mejorar la eficiencia:

El operador SQRT ahora admite int8 e int16x8. Los operadores de comparación ahora admiten int16x8. tfl.cast ahora admite conversiones que involucran INT2 e INT4. tfl.slice ha agregado soporte para INT4. tfl.fully_connected ahora incluye soporte para INT2.

Soporte de marco ampliado

Históricamente, convertir modelos de diferentes marcos de capacitación a un formato compatible con dispositivos móviles podía resultar difícil. LiteRT simplifica esto al ofrecer soporte de primera clase para PyTorch y JAX a través de una conversión de modelos perfecta.

Los desarrolladores ahora pueden entrenar sus modelos en PyTorch o JAX y convertirlos directamente para su implementación en el dispositivo sin necesidad de reescribir primero la arquitectura en TensorFlow.

Mantenimiento, seguridad y enfoque en el ecosistema

Google está cambiando sus recursos de TensorFlow Core para centrarse en gran medida en la estabilidad a largo plazo. El equipo de desarrollo ahora se centrará exclusivamente en:

Seguridad y corrección de errores: abordar rápidamente las vulnerabilidades de seguridad y los errores críticos mediante el lanzamiento de versiones menores y de parches según sea necesario. Actualizaciones de dependencias: lanzamiento de versiones menores para admitir actualizaciones de dependencias subyacentes, incluidas nuevas versiones de Python. Contribuciones de la comunidad: continuar revisando y aceptando correcciones de errores críticos de la comunidad de código abierto.

Estos compromisos se aplican al ecosistema empresarial más amplio, que incluye: TF.data, TensorFlow Serving, TFX, TensorFlow Data Validation, TensorFlow Transform, TensorFlow Model Analysis, TensorFlow Recommenders, TensorFlow Text, TensorBoard y TensorFlow Quantum.

Conclusiones clave

LiteRT reemplaza oficialmente a TFLite: LiteRT ha pasado de la vista previa a la producción completa, convirtiéndose oficialmente en el principal marco de inferencia en el dispositivo de Google para implementar modelos de aprendizaje automático en entornos móviles y de borde. Importante aceleración de GPU y NPU: el tiempo de ejecución actualizado ofrece un rendimiento de GPU 1,4 veces más rápido en comparación con TFLite e introduce un flujo de trabajo unificado para la aceleración de NPU (Unidad de procesamiento neuronal), lo que facilita la ejecución de cargas de trabajo pesadas de GenAI (como Gemma) en hardware de vanguardia especializado. Cuantización agresiva del modelo (INT4/INT2): para maximizar la eficiencia de la memoria en dispositivos periféricos, los operadores de tf.lite han ampliado el soporte para tipos de datos de precisión extremadamente baja. Esto incluye int8/int16 para SQRT y operaciones de comparación, junto con soporte INT4 e INT2 para operadores de conversión, corte y conexión total. Interoperabilidad perfecta entre PyTorch y JAX: los desarrolladores ya no están obligados a capacitarse con TensorFlow para la implementación perimetral. LiteRT ahora proporciona conversión de modelos nativos de primera clase para PyTorch y JAX, agilizando el proceso desde la investigación hasta la producción.

Consulte los detalles técnicos y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.