En defensa de la importancia estadística | de Zach Flynn | enero de 2025

Tenemos que trazar la línea en alguna parte

Foto por Fotografía Siora en desempaquetar

Se ha convertido en una especie de meme que la significación estadística es un mal estándar. Varios blogs recientes han circulado, argumentando que la significación estadística es un “culto” o “arbitrario”. Si desea una polémica clásica (¿y quién no?), consulte: https://www.deirdremccloskey.com/docs/jsm.pdf.

Este pequeño ensayo es una defensa del llamado Culto a la Significancia Estadística.

La significación estadística es una idea bastante buena, y todavía tengo que ver algo fundamentalmente mejor o lo suficientemente práctico para usar en la industria.

No voy a argumentar que la significación estadística es la perfecto manera de tomar decisiones, pero es bien.

Un punto común señalado por aquellos que mancillarían el Culto es que la significación estadística no es lo mismo que la importancia comercial. Tienen razón, pero no es argumento para evitar la significación estadística a la hora de tomar decisiones.

La significancia estadística dice, por ejemplo, que si el impacto estimado de algún cambio es del 1% con un error estándar del 0,25%, es estadísticamente significativo (al nivel del 5%), mientras que si el impacto estimado de otro cambio es del 10% con un error estándar del 6%, es estadísticamente insignificante (al nivel del 5%).

El argumento es que el impacto del 10% es más significativo para el negocio, aunque sea menos preciso.

Bueno, veamos esto desde la perspectiva de Toma de decisiones.

Aquí hay dos casos.

Las dos iniciativas son separables.

Si las dos iniciativas son separables, igualmente deberíamos lanzar el 1% con un error estándar del 0,25%, ¿verdad? Es un efecto positivo, por lo que la significación estadística no nos lleva por mal camino. Deberíamos lanzar el resultado estadístico sig positivo.

Bien, pasemos al experimento de tamaño de efecto más grande.

Supongamos que el tamaño del efecto fue +10% con un error estándar del 20%, es decir, el intervalo de confianza del 95% fue aproximadamente [-30%, +50%]. En este caso, realmente no creemos que haya ninguna evidencia de que el efecto sea positivo, ¿verdad? A pesar del mayor tamaño del efecto, el error estándar es demasiado grande para sacar una conclusión significativa.

El problema no es la significancia estadística. El problema es que creemos que un error estándar del 6% es lo suficientemente pequeño en este caso como para lanzar la nueva función basándose en esta evidencia. Este ejemplo no muestra ningún problema con la significación estadística como marco. Muestra que estamos menos preocupados por el error tipo 1 que por el alfa = 5%.

¡Está bien! Aceptamos otros alfas en nuestro Culto, siempre y cuando hayan sido seleccionados antes del experimento. Simplemente use un alfa más grande. Por ejemplo, esto es estadísticamente significativo con alfa = 10%.

El punto es que hay es un nivel de ruido que nos parecería inaceptable. Hay un nivel de ruido en el que incluso si el efecto estimado fuera +20%, diríamos: “Realmente no sabemos qué es”.

Entonces, tenemos que decir cuánto ruido es demasiado.

La inferencia estadística, como el arte y la moralidad, requiere que pongamos un límite en alguna parte.

Las iniciativas son alternativas.

Ahora supongamos que las dos iniciativas son alternativas. Si hacemos uno, no podemos hacer el otro. ¿Cuál deberíamos elegir?

En este caso, el problema con la configuración anterior es que estamos probando la hipótesis incorrecta. No queremos simplemente comparar estas iniciativas con el control. También queremos compararlos entre sí.

Pero esto tampoco es un problema de significación estadística. Es un problema con la hipótesis que estamos probando.

Queremos probar si la diferencia del 9% en los tamaños del efecto es estadísticamente significativa, utilizando un nivel alfa que tenga sentido por la misma razón que en el caso anterior. Hay un nivel de ruido en el que el 9% es simplemente espurio y tenemos que establecer ese nivel.

Una vez más, tenemos que trazar la línea en alguna parte.

Ahora, abordemos algunas otras objeciones comunes y luego les entregaré una hoja de inscripción para unirse al Culto.

Esta objeción a la significación estadística es común, pero no tiene sentido.

Nuestras actitudes hacia el riesgo y la ambigüedad (en el sentido de la teoría de la decisión estadística) son “arbitrarias” porque las elegimos. Pero eso no tiene solución. Las preferencias son un hecho en cualquier problema de toma de decisiones.

La significancia estadística no es más “arbitraria” que otras reglas de toma de decisiones, y tiene la agradable intuición de equilibrar cuánto ruido permitiremos versus el tamaño del efecto. Tiene un parámetro escalar simple que podemos ajustar para preferir más o menos error de tipo 1 en relación con el error de tipo 2. Es encantador.

A veces, la gente argumenta que deberíamos utilizar la inferencia bayesiana para tomar decisiones porque es más fácil de interpretar.

Comenzaré admitiendo que, en su situación ideal, la inferencia bayesiana tiene buenas propiedades. Podemos tomar lo posterior y tratarlo exactamente como “creencias” y tomar decisiones basadas, por ejemplo, en la probabilidad de que el efecto sea positivo, lo que no es posible con la significación estadística frecuentista.

En la práctica, la inferencia bayesiana es otro animal.

La inferencia bayesiana sólo obtiene esas agradables propiedades similares a las “creencias” si lo anterior refleja las creencias previas reales de quien toma las decisiones. Esto es extremadamente difícil de hacer en la práctica.

Si cree que elegir un “alfa” que establezca la línea sobre la cantidad de ruido que aceptará es complicado, imagine tener que elegir un densidad que capture correctamente su opinión (o la de quien toma las decisiones) creencias… ¡Antes de cada experimento! Este es un problema muy difícil.

Así pues, los principios bayesianos seleccionados en la práctica suelen ser elegidos porque son “convenientes”, “poco informativos”, etc. Tienen poco que ver con creencias previas reales.

Cuando no especificamos nuestras creencias previas reales, la distribución posterior es solo una ponderación de la función de probabilidad. Afirmar que podemos observar los cuantiles de esta llamada distribución posterior y decir que el parámetro tiene un 10% de posibilidades de ser menor que 0 es una tontería estadísticamente.

Entonces, en todo caso, es más fácil malinterpretar lo que estamos haciendo en el terreno bayesiano que en el terreno frecuentista. A los estadísticos les resulta difícil traducir sus creencias previas en una distribución. ¿Cuánto más difícil es para quien toma las decisiones en el proyecto?

Por estas razones, la inferencia bayesiana no se escala bien, razón por la cual, creo, las plataformas de experimentación en toda la industria generalmente no la utilizan.

Los argumentos contra el “culto” a la significancia estadística son, por supuesto, una respuesta a un problema real. Allá es un culto peligroso dentro de nuestro Iglesia.

La Iglesia de la Importancia Estadística lo acepta bastante. Permitimos otros alfa además del 5%. Elegimos hipótesis que no se comparan con cero nulos, etc.

Pero a veces, nuestro buen nombre se ve empañado por un elemento radical dentro de la Iglesia que trata cualquier cosa insignificante frente a una hipótesis nula de 0 en el nivel del 5% como “no real”.

Estos herejes creen en una versión del análisis estadístico de culto a la carga, donde el procedimiento de significancia estadística (al nivel del 5%) determina lo que es verdad en lugar de ser simplemente una forma útil de tomar decisiones y sopesar la incertidumbre.

Por supuesto, rechazamos toda asociación con esta peligrosa secta.

Déjame saber si te gustaría unirte a la Iglesia. Te inscribiré en la comida compartida mensual.

¡Gracias por leer!

zach

Conéctese en: https://linkedin.com/in/zlflynn