Esta publicación es una publicación técnica que resume mi experiencia con el Rayo biblioteca para el procesamiento distribuido de datos y mostrando un ejemplo de usar Ray para escalable inferencia por lotes fuera de línea.
Recientemente, tuve que preparar un conjunto de datos para la formación de Vision LLM. La calidad del conjunto de datos de capacitación es fundamental para el éxito de la capacitación y necesitábamos desarrollar herramientas para procesar grandes cantidades de datos. El objetivo es garantizar que los datos que alimentan el modelo estén controlados y sean de alta calidad.
¿Por qué tanto esfuerzo para crear un conjunto de datos? ¿No es la cantidad el secreto del LLM?
Es no. Primero, permítanme compartirles por qué se debe dedicar esfuerzo de ingeniería a construir y filtrar un buen conjunto de datos.
En la carrera actual por el desarrollo de modelos básicos, cada mes surgen muchos modelos nuevos en la cima de los puntos de referencia SOTA. Algunas empresas o laboratorios comparten los pesos con la comunidad de código abierto. A veces incluso comparten puntos de control y guiones de entrenamiento.
Sin embargo, los pasos de creación y curación de los conjuntos de datos de entrenamiento rara vez se comparten. Para…