Evaluación de productos de orientación publicitaria mediante inferencia causal: coincidencia de puntuación de propensión.
¿Alguna vez has visto esos animados anuncios de Nike mientras sintonizabas un podcast que recapitulaba el épico enfrentamiento de la NBA de anoche? ¿O qué tal si te topas con el espectáculo de reseñas de zapatillas de deporte de New Balance en YouTube? Esa es la magia de la orientación contextual: ¡el maestro del emparejamiento que conecta contenido y anuncios según la vibra del momento! Dile adiós a la incomodidad de los anuncios y da la bienvenida a las experiencias publicitarias personalizadas que te harán bailar felizmente. Imagínese esto: “¿Preferirías disfrutar de los anuncios de Nike en un podcast de baloncesto o darle vida a las cosas en un podcast de política?”
A medida que los gigantes tecnológicos aumentan su inversión en la protección de la privacidad de los usuarios, el enfoque de comportamiento de la vieja escuela (ya sabes, el que se basa en las direcciones IP y los dispositivos de los usuarios) podría encontrarse en una situación complicada. Con menos cookies y direcciones IP misteriosas acechando, ¡es como el salvaje oeste para la orientación tradicional!
Demos más vida al juego de medición de productos contextuales; por lo general, todo gira en torno a los anunciantes. Estamos hablando de las métricas de éxito típicas: adopción de anunciantes, retención, referencias y esos excelentes ingresos publicitarios. Pero aquí es donde la trama se complica: mi hipótesis es que ofrecer anuncios más relevantes convierte la experiencia publicitaria en un viaje de placer. Imagínese esto: menos cambios de contexto durante los anuncios significan que los usuarios pueden disfrutar de contenido contextual similar sin perder el ritmo.
Sin embargo, no es fácil ejecutar una prueba A/B para ver cómo reaccionan los usuarios a los productos de orientación contextual. ¿Por qué? Cuando los anunciantes compran segmentación contextual en sus anuncios, no se trata solo de segmentación contextual: utilizarán todas las demás segmentaciones en la misma campaña, lo que hace que no podamos asignar aleatoriamente la segmentación contextual como tratamiento. Por lo tanto, no es posible aleatorizar a los usuarios en dos grupos.
Ingresa el superhéroe de las alternativas: ¡Inferencia Causal! Cuando las pruebas A/B no son posibles porque no se pueden barajar a los usuarios como si fueran una baraja de cartas, ¡recurrimos a datos históricos con inferencia causal!
En esta publicación de blog, repasaré cómo evaluar productos de orientación publicitaria mediante inferencia causal. Así que abróchate el cinturón si:
- Navegue por un dominio donde las pruebas A/B aún no están listas, ya sea que sean poco éticas, costosas o completamente imposibles.
- Navega por las emocionantes aguas del dominio publicitario/social, donde la atención se centra en cómo un anuncio se adapta a un usuario específico y su contenido.
¡Es importante diseñar una investigación de inferencia causal estableciendo hipótesis y métricas!
Hipótesis: Creemos que los usuarios se involucran más cuando escuchan un anuncio a través de orientación contextual y planeamos medirlo a través de la tasa de finalización del anuncio (cuanto mayor, mejor) y la omisión fuera de foco (cuanto menor, mejor).
Métrica: Comenzamos con la tasa de finalización de anuncios, una métrica estándar que es común en el espacio publicitario. Sin embargo, esta métrica es ruidosa y finalmente elegimos Off Focus Skip como nuestra métrica.
Nuestra unidad experimental: 90 días de usuarios que fueron (usuarios filtrados que recibieron tanto anuncios de tratamiento como anuncios de control). Vale la pena mencionar que también lo probamos a nivel de impresiones. Hicimos ambas cosas.
Población: Recopilamos 90 ventanas de usuarios/impresiones.
Usaremos Propensity Score Match en esta investigación ya que tenemos dos grupos de muestras que solo necesitamos sintetizar algo de aleatorización. Puedes leer más sobre PSM en aquí, y mi resumen sobre PSM es: digamos a nuestras muestras que encuentren pares entre el control y los tratamientos, y luego medimos el delta promedio entre cada par para atribuir cualquier diferencia que encontremos al tratamiento. ¡Así que comencemos a preparar los ingredientes para nuestro modelo PSM!
Hay muchas cosas que podrían afectar la experiencia publicitaria de los usuarios y estas son las tres categorías:
- Atributo de usuario (es decir, edad/sexo/LHR)
- Atributo del anunciante (es decir, inversión publicitaria anterior de la empresa)
- Atributo del editor (es decir, ingresos publicitarios anteriores de la empresa/metadatos de contenido)
Creemos que controlar lo anterior aísla el efecto del tratamiento entre los anuncios orientados contextualmente frente a los anuncios orientados no contextuales. A continuación se muestra un marco de datos de muestra para ayudar a comprender cómo podrían verse los datos.
Usando la regresión logística, por ejemplo, cuando el estado del tratamiento (exposición) se retrocede según las características observadas (covariables), obtendremos un valor predictivo de qué tan posible es si un usuario está en tratamiento. Este número es cómo relacionamos cada par entre tratamiento y control. ¡Tenga en cuenta que también puede utilizar otros clasificadores de su elección! Al final, lo que debe hacer es usar su clasificador para etiquetar a sus usuarios, de modo que podamos relacionarlos en consecuencia en los siguientes pasos.
Y = Tratamiento [0, 1]
X = Atributos de usuario + Atributos de anunciante + Atributos de editor
Si extraemos las distribuciones de PS Score para dos grupos, veremos dos distribuciones superpuestas como se muestra en el dibujo a continuación. La distribución de la puntuación PS probablemente será diferente en los dos grupos, ¡y eso es de esperarse! Lo que queremos comparar de Apple con Apple es el área “coincidente”.
A medida que asignamos a los usuarios su puntuación de propensión, emparejaremos los pares entre los grupos de tratamiento y control. En el ejemplo aquí, comenzamos a ver cómo se forman pares. El tamaño de nuestra muestra también comenzará a cambiar, ya que es posible que algunas muestras no coincidan. (PD. usa el psmpy paquete si está en un entorno Python.)
Cuando emparejemos los dos grupos, los atributos de usuario de los dos grupos comenzarán a verse similares que antes. Esto se debe a que los usuarios que no pudieron coincidir se eliminan de mis dos grupos.
Ahora que los hemos emparejado según el PS, ¡podemos comenzar nuestro trabajo de medición! El cálculo principal es esencialmente el siguiente:
MEDIA (Grupo de tratamiento Y var) — MEDIA (Grupo de control Y var) = Efecto del tratamiento
Tendremos datos del efecto del tratamiento que podremos probar en cuanto a significación estadística y significación práctica. Al emparejar los patos para calcular el delta promedio de cada pareja, medimos el efecto del tratamiento.
Entonces, si todo está configurado correctamente hasta ahora, habremos medido los efectos del tratamiento en los dos grupos. Pero es fundamental saber que la inferencia causal conlleva más riesgos si faltan variables de confusión o cualquier otra causa potencial de la que no nos dimos cuenta. Entonces, para validar aún más nuestra investigación, ¡realicemos una prueba AA!
Una prueba AA es una prueba en la que, en lugar de utilizar el tratamiento verdadero, asignamos aleatoriamente un tratamiento “falso” a nuestros datos y realizamos la inferencia causal nuevamente. Debido a que es un tratamiento falso, ¡no deberíamos detectar ningún efecto del tratamiento! La ejecución de una prueba AA proporciona una buena revisión del código y también garantiza que nuestro proceso minimice el sesgo (cuando el verdadero efecto del tratamiento es 0, detectamos 0)
Una vez que completemos nuestra prueba AA sin detectar un efecto del tratamiento, ¡estaremos listos para comunicar la información a ingeniería/administración de productos! Para mi proyecto, terminé publicando mi trabajo y lo compartí en un foro de información de toda la empresa sobre el primer trabajo de inferencia causal para medir la orientación de anuncios de podcasts de Spotify.
Esta publicación de blog explica cada paso de la inferencia causal para evaluar un producto de orientación publicitaria que es difícil de experimentar debido a limitaciones en la aleatorización. Desde cómo determinar la relación causal, asignar a los usuarios una puntuación de coincidencia de propensión, hacer coincidir a los usuarios y calcular el efecto del tratamiento, hasta comprobar la cordura del resultado. Espero que este artículo te resulte útil y si tienes alguna pregunta, ¡déjame saber!
PD. Si bien debido a la confidencialidad, no puedo compartir el resultado de la prueba específicamente para el producto de orientación contextual de Spotify, ¡aún puedes usar este blog para desarrollar tu inferencia causal!