No todos los problemas de RecSys son iguales

Los valores atípicos de la industria han distorsionado nuestra definición de sistemas de recomendación. TikTok, Spotify y Netflix emplean modelos híbridos de aprendizaje profundo que combinan filtrado colaborativo y basado en contenido para ofrecer recomendaciones personalizadas que ni siquiera sabía que le gustaría. Si está considerando un puesto en RecSys, es posible que desee sumergirse en ellos de inmediato. Pero no todos los problemas de RecSys funcionan (o necesitan funcionar) a este nivel. La mayoría de los profesionales trabajan con modelos tabulares relativamente simples, a menudo árboles potenciados por gradiente. Hasta que asistí a RecSys ’25 en Praga, pensaba que mi experiencia era atípica. Ahora creo que ésta es la norma, oculta detrás de los enormes valores atípicos que impulsan el estado del arte de la industria. Entonces, ¿qué diferencia a estos gigantes de la mayoría de las demás empresas? En este artículo, utilizo el marco mapeado en la imagen de arriba para razonar sobre estas diferencias y ayudar a ubicar su propio trabajo de recomendación en el espectro.

La mayoría de los sistemas de recomendación comienzan con una fase de generación de candidatos, reduciendo millones de elementos posibles a un conjunto manejable que puede clasificarse mediante soluciones de mayor latencia. Pero la generación de candidatos no siempre es la batalla cuesta arriba que parece, ni requiere necesariamente aprendizaje automático. Los contextos con alcances bien definidos y filtros estrictos a menudo no requieren una lógica de consulta compleja o una búsqueda vectorial. Pensemos en Booking.com: cuando un usuario busca “hoteles de 4 estrellas en Barcelona, ​​del 1 al 4 de octubre”, las limitaciones geográficas y de disponibilidad ya han reducido millones de propiedades a unos pocos cientos. El verdadero desafío para los profesionales del aprendizaje automático es clasificar estos hoteles con precisión. Esto es muy diferente de la búsqueda de productos de Amazon o de la página de inicio de YouTube, donde no existen filtros estrictos. En estos entornos, se requiere aprendizaje automático escalable para reducir un catálogo inmenso a un conjunto de candidatos más pequeño, semántico y sensible a la intención, todo antes de que se realice la clasificación.

Más allá de la generación de candidatos, la complejidad de la clasificación se comprende mejor a través de las dos dimensiones representadas en la imagen siguiente. En primer lugar, los resultados observables y la estabilidad del catálogo, que determinan qué tan sólida es la línea de base que se puede tener. En segundo lugar, la subjetividad de las preferencias y su capacidad de aprendizaje, que determinan cuán compleja debe ser su solución de personalización.

Resultados observables y estabilidad del catálogo

En el extremo izquierdo del eje x se encuentran las empresas que observan directamente sus resultados más importantes. Grandes comerciantes como IKEA son un buen ejemplo de ello: cuando un cliente compra un sofá ESKILSTUNA en lugar de un KIVIK, la señal es inequívoca. Si se agregan suficientes de estos, la empresa sabrá exactamente qué producto tiene la tasa de compra más alta. Cuando puedes observar directamente a los usuarios votando con sus billeteras, tienes una base sólida que es difícil de superar.

En el otro extremo se encuentran las plataformas que no pueden observar si sus recomendaciones realmente tuvieron éxito. Es posible que Tinder y Bumble vean que los usuarios coinciden, pero a menudo no sabrán si la pareja se lleva bien (especialmente cuando los usuarios se mudan a otras plataformas). Yelp puede recomendar restaurantes, pero para la gran mayoría, no pueden observar si usted realmente visitó, sólo en qué listados hizo clic. Depender de estas señales del embudo superior significa que domina el sesgo de posición: los elementos en las primeras posiciones acumulan interacciones independientemente de su verdadera calidad, lo que hace casi imposible saber si el compromiso refleja una preferencia genuina o una mera visibilidad. Compare esto con el ejemplo de IKEA: un usuario puede hacer clic en un restaurante en Yelp simplemente porque apareció primero, pero es mucho menos probable que compre un sofá por esa misma razón. En ausencia de una conversión dura, se pierde el ancla de una tabla de clasificación confiable. Esto te obliga a trabajar mucho más duro para extraer la señal del ruido. Las reseñas pueden ofrecer cierta base, pero rara vez son lo suficientemente densas como para funcionar como señal principal. En lugar de ello, debe realizar interminables experimentos sobre sus heurísticas de clasificación, ajustando constantemente la lógica para obtener un proxy de calidad a partir de un flujo de señales débiles.

Catálogo de alta rotación

Sin embargo, incluso con resultados observables, no se garantiza una base de referencia sólida. Si su catálogo cambia constantemente, es posible que no acumule suficientes datos para crear una tabla de clasificación adecuada. Plataformas inmobiliarias como Zillow y sitios de segunda mano como Vinted se enfrentan a la versión más extrema: cada artículo tiene un inventario de uno, desapareciendo en el momento de su compra. Esto le obliga a confiar en clasificaciones simplistas y rígidas como “lo más nuevo primero” o “el precio más bajo por metro cuadrado”. Son mucho más débiles que las tablas de clasificación de conversión basadas en señales de usuario densas y reales. Para hacerlo mejor, debe aprovechar el aprendizaje automático para predecir la probabilidad de conversión de inmediato, combinando atributos intrínsecos con un rendimiento dessesgado a corto plazo para mostrar el mejor inventario antes de que desaparezca.

La ubicuidad de los modelos basados ​​en características

Independientemente de la estabilidad de su catálogo o la intensidad de la señal, el desafío principal sigue siendo el mismo: está tratando de mejorar cualquier punto de referencia disponible. Por lo general, esto se logra entrenando un modelo de aprendizaje automático (ML) para predecir la probabilidad de participación o conversión en un contexto específico. Los árboles impulsados ​​por gradiente (GBDT) son la opción pragmática, mucho más rápidos de entrenar y ajustar que el aprendizaje profundo.

Los GBDT predicen estos resultados basándose en las características de los artículos diseñados: atributos categóricos y numéricos que cuantifican y describen un producto. Incluso antes de que se conozcan las preferencias individuales, los GBDT también pueden adaptar las recomendaciones aprovechando características básicas del usuario como el país y el tipo de dispositivo. Solo con estas características de elementos y usuarios, un modelo de aprendizaje automático ya puede mejorar la línea de base, ya sea que eso signifique desviar una tabla de clasificación de popularidad o clasificar un feed de alta rotación. Por ejemplo, en el comercio electrónico de moda, los modelos suelen utilizar la ubicación y la época del año para mostrar artículos vinculados a la temporada, al mismo tiempo que utilizan el país y el dispositivo para calibrar el precio.

Estas características permiten al modelo combatir el sesgo de posición antes mencionado al separar la verdadera calidad de la mera visibilidad. Al saber qué atributos intrínsecos impulsan la conversión, el modelo puede corregir el sesgo de posición inherente a su base de popularidad. Aprende a identificar elementos que funcionan por mérito, en lugar de simplemente porque ocuparon los primeros puestos. Esto es más difícil de lo que parece: corre el riesgo de degradar a los ganadores comprobados más de lo debido, lo que podría degradar la experiencia.

Contrariamente a la creencia popular, los modelos basados ​​en funciones también pueden impulsar la personalización. Los elementos se pueden codificar en incrustaciones de dos fuentes: contenido semántico (descripciones, fotos y reseñas en plataformas como Booking.com y Yelp) o datos de interacción (métodos como StarSpace que aprenden de qué elementos se hace clic o se ven juntos). Al aprovechar las interacciones recientes de un usuario, podemos calcular puntuaciones de similitud con respecto a los elementos candidatos y enviarlas al modelo potenciado por gradiente como características.

Sin embargo, este enfoque tiene sus límites. Un GBDT podría aprender a promocionar restaurantes similares a las búsquedas italianas recientes de un usuario en Yelp, pero la similitud en sí misma se basa en el contenido semántico o en qué restaurantes se hace clic con frecuencia para combinarlos, no en cuáles los usuarios realmente reservan. Los modelos de aprendizaje profundo aprenden representaciones de elementos de un extremo a otro: las incorporaciones se optimizan para maximizar el rendimiento en la tarea final. La importancia de esta limitación depende de algo más fundamental: en qué medida los usuarios realmente están en desacuerdo.

Subjetividad

No todos los ámbitos son igualmente personales o controvertidos. En algunos, los usuarios coinciden en gran medida en lo que constituye un buen producto una vez que se satisfacen las limitaciones básicas. A estas las llamamos preferencias convergentes y ocupan la mitad inferior del gráfico. Tomemos como ejemplo a Booking.com: los viajeros pueden tener diferentes presupuestos y preferencias de ubicación, pero una vez que se revelan a través de filtros e interacciones con mapas, los criterios de clasificación convergen: los precios más altos son malos, las comodidades son buenas, las buenas críticas son mejores. O considere Staples: una vez que un usuario necesita papel para impresora o baterías AA, la marca y el precio dominan, lo que hace que las preferencias del usuario sean notablemente consistentes.

En el otro extremo (la mitad superior) se encuentran dominios subjetivos definidos por un gusto muy fragmentado. Spotify es un ejemplo de esto: la pista favorita de un usuario es la omisión inmediata de otro. Sin embargo, el gusto rara vez existe en el vacío. En algún lugar de los datos hay un usuario en su longitud de onda exacta, y el aprendizaje automático cierra la brecha, convirtiendo sus descubrimientos de ayer en sus recomendaciones para hoy. En este caso, el valor de la personalización es enorme, al igual que la inversión técnica necesaria.

Los datos correctos

El gusto subjetivo sólo es procesable si tienes suficientes datos para observarlo. Muchos ámbitos implican preferencias distintas pero carecen del circuito de retroalimentación para capturarlas. Una plataforma de contenido de nicho, un nuevo mercado o un producto B2B pueden enfrentar gustos tremendamente divergentes pero carecer de una señal clara para aprenderlos. Las recomendaciones de restaurantes de Yelp ilustran este desafío: las preferencias gastronómicas son subjetivas, pero la plataforma no puede observar las visitas reales a los restaurantes, sólo los clics. Esto significa que no pueden optimizar la personalización para el verdadero objetivo (conversiones). Solo pueden optimizar para métricas de proxy como clics, pero más clics podrían indicar una falla, lo que indica que los usuarios están explorando varios listados sin encontrar lo que buscan.

Pero en ámbitos subjetivos con datos de comportamiento densos, no personalizar deja dinero sobre la mesa. YouTube es un ejemplo de esto: con miles de millones de interacciones diarias, la plataforma aprende las preferencias matizadas de los espectadores y muestra videos que no sabía que quería. Aquí, el aprendizaje profundo se vuelve inevitable. Este es el punto donde verá grandes equipos coordinándose sobre Jira y proyectos de ley en la nube que requieren la aprobación del vicepresidente. Si esa complejidad está justificada depende enteramente de los datos que tenga.

Sepa dónde se encuentra

Comprender dónde se ubica su problema en este espectro es mucho más valioso que buscar ciegamente la última arquitectura. El “estado del arte” de la industria está definido en gran medida por los valores atípicos: los gigantes tecnológicos que manejan inventarios subjetivos masivos y datos densos de los usuarios. Sus soluciones son famosas porque sus problemas son extremos, no porque sean universalmente correctas.

Sin embargo, es probable que enfrente diferentes limitaciones en su propio trabajo. Si su dominio está definido por un catálogo estable y resultados observables, aterrizará en el cuadrante inferior izquierdo junto a empresas como IKEA y Booking.com. Aquí, las bases de popularidad son tan sólidas que el desafío es simplemente construir sobre ellas con modelos de aprendizaje automático que puedan generar victorias mensurables en las pruebas A/B. Si, en cambio, te enfrentas a una gran tasa de abandono (como Vinted) o señales débiles (como Yelp), el aprendizaje automático se convierte en una necesidad sólo para mantenerte al día.

Pero eso no significa que necesitarás un aprendizaje profundo. Esa complejidad adicional sólo realmente vale la pena en territorios donde las preferencias son profundamente subjetivas y hay suficientes datos para modelarlas. A menudo tratamos sistemas como Netflix o Spotify como el estándar de oro, pero son soluciones especializadas para condiciones poco comunes. Para el resto de nosotros, la excelencia no se trata de implementar la arquitectura más compleja disponible; se trata de reconocer las limitaciones del terreno y tener la confianza para elegir la solución que resuelva sus problemas.

Imágenes del autor.