Yandex ha hecho recientemente una contribución significativa a la comunidad de sistemas de recomendación al liberar Yambdael conjunto de datos públicos más grande del mundo para la investigación y el desarrollo del sistema de recomendación. Este conjunto de datos está diseñado para cerrar la brecha entre la investigación académica y las aplicaciones a escala de la industria, ofreciendo casi 5 mil millones de eventos de interacción de usuario anonimizados de Yandex Music, uno de los servicios de transmisión insignia de la compañía con más de 28 millones de usuarios mensuales.
Por qué es importante Yambda: abordar una brecha crítica de datos en los sistemas de recomendación
Los sistemas de recomendación respaldan las experiencias personalizadas de muchos servicios digitales en la actualidad, desde el comercio electrónico y las redes sociales hasta las plataformas de transmisión. Estos sistemas dependen en gran medida de volúmenes masivos de datos de comportamiento, como clics, me gusta y escuchan, para inferir las preferencias del usuario y entregar contenido personalizado.
Sin embargo, el campo de los sistemas de recomendación se ha quedado atrás de otros dominios de IA, como el procesamiento del lenguaje natural, en gran parte debido a la escasez de conjuntos de datos grandes y accesibles. A diferencia de los modelos de idiomas grandes (LLM), que aprenden de fuentes de texto disponibles públicamente, los sistemas de recomendación necesitan datos de comportamiento confidenciales, que son comercialmente valiosos y difíciles de anonimizar. Como resultado, las empresas han guardado tradicionalmente estos datos de cerca, lo que limita el acceso de los investigadores a conjuntos de datos a escala del mundo real.
Los conjuntos de datos existentes, como el conjunto de datos de la lista de reproducción de Spotify, los datos del premio de Netflix y los registros de clics de Criteo son demasiado pequeños, carecen de detalles temporales o están mal documentados para desarrollar modelos de recomendación de grado de producción. El lanzamiento de Yandex de Yambda Aborda estos desafíos proporcionando un conjunto de datos extenso de alta calidad con un rico conjunto de características y salvaguardas de anonimización.
Lo que contiene Yambda: escala, riqueza y privacidad
El Yambda El conjunto de datos comprende 4.79 mil millones de interacciones de usuario anonimizadas recopiladas durante un período de 10 meses. Estos eventos provienen de aproximadamente 1 millón de usuarios que interactúan con casi 9.4 millones de pistas en la música Yandex. El conjunto de datos incluye:
- Interacciones de usuario: Tanto la retroalimentación implícita (escucha) y la retroalimentación explícita (me gusta, disgustos y sus mudanzas).
- Incrustos de audio anónimos: Representaciones vectoriales de pistas derivadas de redes neuronales convolucionales, lo que permite que los modelos aprovechen la similitud de contenido de audio.
- Banderas de interacción orgánica: Una bandera “IS_organic” indica si los usuarios descubrieron una pista de forma independiente o mediante recomendaciones, facilitando el análisis de comportamiento.
- Marcas de tiempo precisas: Cada evento está marcado para preservar el pedido temporal, crucial para modelar el comportamiento secuencial del usuario.
Todos los identificadores de usuarios y de seguimiento se anonimizan utilizando ID numéricos para cumplir con los estándares de privacidad, lo que garantiza que no se expone información de identificación personal.
El conjunto de datos se proporciona en formato Apache Parquet, que está optimizado para marcos de procesamiento de big data como Apache Spark y Hadoop, y también es compatible con bibliotecas analíticas como Pandas y Polares. Esto hace que Yambda sea accesible para investigadores y desarrolladores que trabajan en diversos entornos.
Método de evaluación: división temporal global
Una innovación clave en el conjunto de datos de Yandex es la adopción de un División temporal global (GTS) Estrategia de evaluación. En la investigación típica del sistema de recomendación, el método de licencia ampliamente utilizado elimina la última interacción de cada usuario para las pruebas. Sin embargo, este enfoque interrumpe la continuidad temporal de las interacciones del usuario, creando condiciones de entrenamiento poco realistas.
GTS, por otro lado, divide los datos en función de las marcas de tiempo, preservando toda la secuencia de eventos. Este enfoque imita los escenarios de recomendación del mundo real más de cerca porque evita que cualquier datos futuros se filtre en el entrenamiento y permite que los modelos se prueben en interacciones verdaderamente invisibles y cronológicamente posteriores.
Esta evaluación de consumo temporal es esencial para los algoritmos de evaluación comparativa bajo limitaciones realistas y comprender su efectividad práctica.
Modelos de referencia y métricas incluidos
Para admitir la evaluación comparativa y acelerar la innovación, Yandex proporciona modelos de recomendación de referencia implementados en el conjunto de datos, que incluye:
- MostPop: Un modelo basado en la popularidad que recomienda los artículos más populares.
- Decaypop: Un modelo de popularidad de tiempo de tiempo.
- Itemknn: Un método de filtrado colaborativo basado en el vecindario.
- IALS: Factorización de matriz de mínimos cuadrados alternos implícitos.
- BPR: Ranking personalizado bayesiano, un método de clasificación por pares.
- Sansa y Sasrec: Los modelos conscientes de la secuencia aprovechan los mecanismos de autoatensión.
Estas líneas de base se evalúan utilizando métricas de recomendación estándar como:
- Ndcg@k (ganancia acumulativa con descuento normalizada): Medidas Calidad de clasificación que enfatiza la posición de los elementos relevantes.
- Recuerde@K: Evalúa la fracción de elementos relevantes recuperados.
- Cobertura@k: Indica la diversidad de recomendaciones en todo el catálogo.
Proporcionar estos puntos de referencia ayuda a los investigadores a evaluar rápidamente el rendimiento de los nuevos algoritmos en relación con los métodos establecidos.
Aplicabilidad amplia más allá de la transmisión de música
Mientras que el conjunto de datos se origina en un servicio de transmisión de música, su valor se extiende mucho más allá de ese dominio. Los tipos de interacción, la dinámica del comportamiento del usuario y la gran escala hacen que Yambda sea un punto de referencia universal para sistemas de recomendación en sectores como el comercio electrónico, las plataformas de video y las redes sociales. Los algoritmos validados en este conjunto de datos se pueden generalizar o adaptarse a varias tareas de recomendación.
Beneficios para diferentes partes interesadas
- Academia: Permite pruebas rigurosas de teorías y nuevos algoritmos a una escala relevante de la industria.
- Startups y SMB: Ofrece un recurso comparable a lo que poseen los gigantes tecnológicos, nivelando el campo de juego y acelerando el desarrollo de motores de recomendación avanzados.
- Usuarios finales: Se beneficia indirectamente de los algoritmos de recomendación más inteligentes que mejoran el descubrimiento de contenido, reducen el tiempo de búsqueda y aumentan el compromiso.
My Wave: el sistema de recomendación personalizado de Yandex
Yandex Music aprovecha un sistema de recomendación patentado llamado Mi olaque incorpora redes neuronales profundas e IA para personalizar sugerencias musicales. Mi oleada analiza miles de factores que incluyen:
- Secuencias de interacción de usuario e historial de audición.
- Preferencias personalizables como el estado de ánimo y el lenguaje.
- Análisis musical en tiempo real de espectrogramas, ritmo, tono vocal, rangos de frecuencia y géneros.
Este sistema se adapta dinámicamente a los gustos individuales al identificar similitudes de audio y predecir las preferencias, lo que demuestra el tipo de tubería de recomendación compleja que se beneficia de conjuntos de datos a gran escala como Yambda.
Garantizar la privacidad y el uso ético
El lanzamiento de Yambda Subraya la importancia de la privacidad en la investigación del sistema de recomendación. Yandex anonimiza todos los datos con identificaciones numéricas y omite información de identificación personal. El conjunto de datos contiene solo señales de interacción sin revelar identidades exactas del usuario o atributos confidenciales.
Este equilibrio entre la apertura y la privacidad permite una investigación sólida al tiempo que protege los datos individuales del usuario, una consideración crítica para el avance ético de las tecnologías de IA.
Acceso y versiones
Yandex ofrece el conjunto de datos YAMBDA en tres tamaños para acomodar diferentes capacidades de investigación y computación:
- Versión completa: ~ 5 mil millones de eventos.
- Versión media: ~ 500 millones de eventos.
- Versión pequeña: ~ 50 millones de eventos.
Todas las versiones son accesibles a través de Cara abrazadauna plataforma popular para alojar conjuntos de datos y modelos de aprendizaje automático, lo que permite una fácil integración en los flujos de trabajo de investigación.
Conclusión
El lanzamiento de Yandex del Yambda El conjunto de datos marca un momento fundamental en la investigación del sistema de recomendación. Al proporcionar una escala sin precedentes de datos de interacción anonimizados combinados con evaluación de consumo temporal y líneas de base, establece un nuevo estándar para la evaluación comparativa y la aceleración de la innovación. Los investigadores, las nuevas empresas y las empresas ahora pueden explorar y desarrollar sistemas de recomendación que reflejen mejor el uso del mundo real y brindan una personalización mejorada.
A medida que los sistemas de recomendación continúan influyendo en innumerables experiencias en línea, los conjuntos de datos como Yambda juegan un papel fundamental para impulsar los límites de lo que puede lograr la personalización impulsada por IA.
Mira el Yambda Conjunto de datos en la cara abrazada.
Nota: Gracias al equipo de Yandex por el liderazgo/ recursos de pensamiento para este artículo. El equipo de Yandex ha apoyado y patrocinado este contenido/artículo.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.