Imagínese empresas como Spotify, Apple, Google y más. ¿Qué tienen todos en común, y no me refiero al hecho de que todos son tecnológicos?
Es innovación. Estas empresas invierten constante y fuertemente en novedades. Así se mantienen en el juego. La investigación y el desarrollo están en el corazón de la tecnología. Comienza creando una nueva función y probándola.
En ambas fases de este proceso, los científicos de datos desempeñan un papel fundamental. Realizamos investigaciones que impulsan nuevas funciones. Luego, nos subimos al barco para probar si realmente vale la pena lanzar esta novedad a toda la base de clientes.
¿Cómo? Diseñamos experimentos también conocidos como pruebas A/B para probar nuestras hipótesis. Cuando ve que se lanza una nueva función, es porque ha superado la prueba de la experimentación.
Como Data Scientists, participamos en la creación del experimento, eligiendo las métricas y analizando los resultados.
Nos aseguramos de que los experimentos sean estadísticamente correctos y que los resultados sean interpretables. De esta manera, maximizamos nuestras posibilidades de fundamentar decisiones respaldadas por datos.
Lección n.º 6: Familiarícese con los conceptos básicos de las pruebas A/B
No voy a mentir, nuevamente se trata de estadísticas. Están por todas partes, pero parece que no podemos huir de ellos.
La realización de un experimento tiene que ver con los conceptos estadísticos de la prueba de hipótesis. Así que asegúrese de analizar esto detenidamente.
Nunca hice una prueba A/B antes de unirme a Spotify. Intenté estudiar el tema, pero seamos francos, es difícil hacerlo cuando no lo haces directamente dentro de una empresa. Si no tiene la oportunidad de aprender pruebas A/B en su trabajo actual, aquí tiene una guía sencilla paso a paso de los conceptos que querrá comprender:
1. Prueba de hipótesis
- ¿Qué es? El proceso de determinar si hay suficiente evidencia en nuestros datos para inferir que una determinada condición es cierta para toda la población, y no solo para la muestra en la que probamos la condición.
- ¿Por qué es importante? Es la columna vertebral de las pruebas A/B; estás probando si el cambio (B) es mejor que el status quo (A).
- ¿Cómo aprender esto? Sumérjase en libros de texto de estadística básica o cursos en línea centrados en estadística inferencial.
2. Estadísticas de prueba
- ¿Qué es? Un valor estandarizado que ayuda a decidir si rechazar la hipótesis nula (el status quo) o no. Le ayudan a evaluar si la diferencia que está observando entre el grupo de control (A) y el grupo de tratamiento (B) es estadísticamente significativa o si podría haber ocurrido por casualidad.
- ¿Por qué es importante? Este valor le indicará si el efecto observado en su prueba probablemente se deba al azar o al cambio que realizó.
- ¿Cómo aprender esto? Aborde esto junto con las pruebas de hipótesis. Las plataformas online como Khan Academy o Coursera tienen muy buenos módulos que cubren esto.
Aquí hay un desglose de las principales estadísticas de prueba y cuándo usarlas:
- Prueba Z → Para tamaños de muestra grandes cuando se conoce la varianza poblacional.
- Prueba t de Student → Con tamaños de muestra pequeños cuando se desconoce la varianza poblacional.
- Chi-cuadrado → Para pruebas con resultados categóricos/binarios para verificar las frecuencias observadas frente a las esperadas.
- Estadística F → Al comparar varianzas entre varios grupos en pruebas A/B/C….
El estadístico de prueba se calcula a partir de los datos de la muestra y lo usamos para determinar el valor p.
¿Cuál es el valor p? La probabilidad de observar un estadístico de prueba tan extremo o más extremo que el calculado a partir de la muestra, suponiendo que la hipótesis nula sea verdadera.
3. Cálculo del tamaño de la muestra
- ¿Qué es? Básicamente, cuántas observaciones se necesitan para detectar una diferencia significativa entre el grupo de control y el de tratamiento. No puedes probar tu nueva característica en toda la base de clientes (población), ¿qué pasa si las cosas salen mal? No queremos estropear las cosas en la población, así que utilizamos una muestra.
- ¿Por qué eso importa? Muy pocas observaciones pueden pasar por alto un efecto real; demasiados pueden desperdiciar recursos (o dañar la experiencia).
- ¿Cómo aprender esto? Utilice calculadoras en línea para tener una idea y luego sumérjase en las matemáticas con cursos en línea o libros de texto de estadística.
4. Exposición base frente a exposición personalizada
- ¿Qué es esto? La exposición base es el porcentaje predeterminado de usuarios expuestos a una variante, mientras que la exposición personalizada permite una orientación específica. Quizás solo queramos a los usuarios que reprodujeron una canción en Spotify y no solo abrieron la lista de reproducción.
- ¿Por qué eso importa? Para asegurarse de que está probando a las personas adecuadas y de no sesgar sus resultados.
- ¿Cómo aprender más sobre esto? Lea estudios de casos o mejores prácticas de pruebas A/B de las principales empresas de tecnología para comprender las diferentes estrategias.
5. Efecto mínimo detectable (MDE)
- ¿Qué es? El tamaño del efecto más pequeño que desea que detecte su prueba.
- ¿Por qué es importante? Ayuda en el cálculo del tamaño de la muestra y establece un punto de referencia claro sobre lo que constituye una prueba “exitosa”.
- ¿Cómo aprender más al respecto? Los artículos y estudios de casos sobre pruebas A/B a menudo tratan esto. Algunas herramientas de pruebas A/B tienen calculadoras integradas.
6. Efecto novedad y efecto primacía
- ¿Qué es esto de nuevo? Ud.Los usuarios pueden reaccionar positivamente a algo nuevo (novedad) o recordar mejor lo primero que ven (primacía), lo que puede sesgar los resultados.
- ¿Por qué es importante? Garantiza que no confunda la emoción a corto plazo con una preferencia genuina.
- ¿Cómo aprender más al respecto? Los recursos de psicología conductual pueden proporcionar información, al igual que la literatura sobre pruebas A/B que profundiza en estos sesgos.
También puedes generar datos simulados y ejecutar pruebas A/B para tener una idea del proceso.
En mis próximos artículos, profundizaré más en las pruebas A/B, ya que estoy aprendiendo mucho sobre esto en Spotify en este momento. ¡Estad atentos si queréis saber más al respecto!
Una última palabra: recuerde que estamos navegando en las aguas de las estadísticas. La certeza absoluta es una ilusión. Sin embargo, los buenos científicos de datos se esfuerzan por seguir las mejores prácticas en la experimentación para evitar recomendar historias engañosas a partir de falsos positivos o negativos.