Dentro del subespacio donde nacen las correlaciones espurias

entre el colesterol y la presión arterial se mide en 10 pacientes. La correlación observada es 0,62.

¿Es esto evidencia suficiente de que existe una relación?

Los estudios que miden 20.000 niveles de expresión genética en 10 ratones aplican de forma rutinaria correcciones de pruebas múltiples y umbrales de correlación estrictos. Los investigadores saben que cuantas más correlaciones examinan, más probabilidades hay de observar valores grandes por pura casualidad, incluso cuando los genes no tienen ninguna relación.

Con estudios pequeños, los investigadores a menudo suponen que están más a salvo de correlaciones espurias. ¿Lo son?

La distribución de una correlación muestral es la misma independientemente del número total de variables medidas. Depende principalmente del número de sujetos. Los conjuntos de datos de alta dimensión no crean correlaciones espurias: simplemente las hacen más fáciles de encontrar.

Este artículo responde a la pregunta: ¿qué valores de correlación deberíamos esperar cuando las variables son independientes y la verdadera correlación poblacional es cero? También explica por qué ocurren tales correlaciones.

Utilizando la geometría del coeficiente de correlación de Pearson, el artículo visualiza los efectos del centrado y la normalización. Luego se analiza el papel de la invariancia rotacional. Juntas, estas ideas crean intuición para la distribución exacta del coeficiente de correlación de Pearson y su aproximación normal asintótica.

Finalmente, el artículo ofrece orientación práctica sobre cómo utilizar esta intuición al leer y realizar investigaciones.

El código para reproducir todas las figuras y experimentos está disponible en el cuaderno adjunto.

El experimento gaussiano

Imagínese medir d variables en n individuos.

Para estudiar las correlaciones que surgen puramente por casualidad, considere un conjunto de datos simulado cuyas columnas son vectores aleatorios gaussianos independientes de dimensión n. La matriz de características resultante, donde las filas corresponden a sujetos y las columnas a variables, es

con columnas satisfactorias

¿Cuál es la correlación muestral entre dos vectores?

Aunque la correlación poblacional entre cualquier par de variables es exactamente cero, las correlaciones muestrales que observamos casi siempre son distintas de cero. Esto plantea una pregunta: cuando las columnas son verdaderamente independientes, ¿qué valores debemos esperar para la correlación muestral?

La correlación muestral (Pearson) entre las columnas k y l es

dónde

es la media muestral de la k-ésima columna. El vector de todas las medias de las columnas es

Debido a que las columnas son vectores aleatorios, la correlación muestral r(X⋅k, X⋅l)r,(X_{cdot k}, X_{cdot l}) es en sí misma una variable aleatoria que toma valores en [−1,1]left[-1, 1right].

La intuición detrás de su derivación se vuelve más clara al comprender cómo el coeficiente de correlación de Pearson transforma los datos.

Paso 1: centrar mueve los vectores a un hiperplano

El numerador está efectivamente centrando los vectores.

El centrado resta la media muestral de cada columna

donde 𝟏nmathbf{1}_n es el vector columna de unos

Después de centrar, las coordenadas de cada columna suman 0

Esto significa que cada columna centrada ahora se encuentra en el subespacio dimensional (n-1).

perpendicular al vector de unos. Los vectores siguen siendo n-dimensionales, pero después de centrarlos quedan restringidos a un hiperplano (n-1)-dimensional. Ya no varían en la dirección del vector de todos unos.

Tamaño de muestra n = 3, el centrado restringe todos los vectores a un plano

Para n = 3, el hiperplano es un plano ordinario en el espacio tridimensional.

Girar el plano para alinearlo con el plano xy lo hace visible: no hay variabilidad en la dirección z y los vectores están restringidos a un subespacio bidimensional.

Tamaño de muestra n = 4: el centrado restringe todos los vectores a un hiperplano tridimensional

Después de elegir un sistema de coordenadas ortogonal al vector de todos unos, los vectores centrados se pueden visualizar en tres dimensiones. Forman una nube centrada en el origen.

Paso 2: la normalización mueve los vectores a la esfera unitaria

Observe que la correlación de Pearson es exactamente el coseno del ángulo entre dos vectores centrados

Por tanto, la distribución de la correlación muestral entre dos vectores aleatorios independientes es la misma que la distribución del coseno del ángulo entre sus versiones centradas.

Cuando las columnas centradas están normalizadas

la matriz de correlación se simplifica a

El centrado movió los vectores a un hiperplano dimensional (n-1), eliminando información sobre la ubicación. La normalización elimina las diferencias de longitud.

eliminando información sobre la escala. Los vectores ahora están restringidos a la esfera unitaria incrustada en el hiperplano de dimensiones (n-1), una variedad de dimensiones (n-2).

n = 3: la normalización mueve los vectores al círculo unitario

Para n = 3, el centrado movió los vectores a un plano. La normalización fija su longitud en uno, restringiéndolos a la esfera unidimensional dentro de ese plano: el círculo unitario.

n = 4: la normalización mueve los vectores a la esfera unitaria

Para n = 4, el centrado movió los vectores hacia una nube centrada en el origen dentro de un subespacio tridimensional. La normalización fija su longitud en uno, colocándolos en la esfera unitaria.

Observe que hasta ahora no se ha utilizado la gaussianidad. Cada vector aleatorio se convierte en un punto en la misma esfera después de centrarlo y normalizarlo.

Paso 3: la gaussianidad permite derivar la distribución exacta

La distribución normal multivariada estándar es rotacionalmente invariante. Esto significa que la densidad de probabilidad de un vector aleatorio depende sólo de su distancia al origen, no de su dirección.

Condicional a un radio, las direcciones se distribuyen uniformemente en una esfera. Por lo tanto, después de la normalización a la unidad de longitud, los vectores quedan distribuidos uniformemente en la esfera unitaria.

Suponiendo que los vectores son independientes y gaussianos, la distribución muestral exacta de la correlación C se puede derivar fijando una dirección y midiendo el área de superficie de todos los puntos de la esfera que producen un valor de correlación determinado. La invariancia rotacional garantiza que un resultado obtenido para una dirección fija se aplique por igual a todas las direcciones. Después de obtener el resultado y normalizarlo a 1, la distribución muestral exacta de la correlación es

donde B es la función Beta. El numerador refleja la geometría de la esfera, mientras que el denominador es la constante de normalización.

Dado que la varianza disminuye como 1n−1frac{1}{n−1}, la magnitud típica de la correlación disminuye como (n)−1(sqrt{n})^{-1}. Entonces, bajo el nulo gaussiano independiente, las correlaciones típicas son del orden

De manera equivalente, la correlación al cuadrado bajo el modelo gaussiano independiente sigue una distribución Beta

lo que hace que los cuantiles exactos y los umbrales de significancia sean fáciles de calcular.

n = 3: la distribución de correlación tiene forma de U

Esta distribución es una versión desplazada y reescalada de la distribución arcoseno clásica.

Histograma: distribución de muestreo empírico a partir de vectores gaussianos simulados

Para un estudio con solo 3 sujetos, el umbral de rechazo bilateral del 5% para la hipótesis nula de correlación poblacional cero es ∣r∣>0,997. Las correlaciones más pequeñas no son lo suficientemente inusuales como para rechazar la hipótesis de que no hay relación.

Observe que con solo 3 sujetos, es más probable observar una correlación grande que una correlación alrededor de 0, aunque las variables no estén relacionadas.

n = 4: la correlación sigue una distribución uniforme

Porque el numerador en la fórmula de distribución muestral exacta se simplifica a 1 cuando n = 4

Histograma: distribución de muestreo empírico a partir de vectores gaussianos simulados

Para un estudio con 4 sujetos, el umbral de rechazo sigue siendo muy alto: ∣r∣>0,95∣r∣>0,95. Las correlaciones más pequeñas proporcionan evidencia insuficiente para rechazar la hipótesis de que no hay relación.

Para este tamaño de muestra, es igualmente probable que se observen todas las correlaciones.

n = 5: la distribución de correlación tiene forma de semicírculo

Es una distribución semicircular de Wigner.

Histograma: distribución de muestreo empírico a partir de vectores gaussianos simulados

Para n = 6 y superiores, la distribución adquiere forma de campana. A medida que aumenta el tamaño de la muestra, se acerca a la distribución normal asintótica.

Paso 4: cuando n llega al infinito

A medida que n crece, la dimensión de la esfera aumenta y casi todos los pares de direcciones aleatorias se vuelven casi ortogonales. Como resultado, la distribución de la correlación se concentra alrededor de cero. Más precisamente,

Por lo tanto, para n suficientemente grande

¿Qué pasa con las distribuciones muestrales no normales?

Sorprendentemente, el resultado asintótico también es válido para datos no normales, siempre que la distribución subyacente tenga una varianza finita.

Lo más sorprendente es que la distribución muestral exacta a menudo sigue siendo una aproximación excelente incluso cuando los datos no son normales y el tamaño de la muestra es pequeño.

Distribución exponencial

La derivación de la distribución muestral exacta se basa en que las direcciones se distribuyan uniformemente en la esfera unitaria y, por lo tanto, requiere invariancia rotacional. La distribución exponencial no posee esta propiedad.

Esta esfera se obtiene centrando y normalizando vectores aleatorios exponenciales independientes. A diferencia del caso gaussiano, los puntos no están distribuidos uniformemente en la esfera y se prefieren algunas direcciones. La distribución de correlación ya no sigue la ley exacta derivada anteriormente.

Histograma: distribución de muestreo empírico a partir de vectores exponenciales simulados

Para n pequeño, la distribución muestral empírica de la correlación es muy diferente de la distribución muestral exacta. Para este ejemplo exponencial simulado, los cuantiles empíricos proporcionarían una referencia más apropiada para la prueba de hipótesis que la distribución gaussiana exacta o la aproximación normal asintótica.

A medida que n aumenta, la distribución muestral empírica de la correlación comienza a parecerse a la distribución normal asintótica.

Histograma: distribución de muestreo empírico a partir de vectores exponenciales simulados

Para n = 10, la distribución muestral empírica todavía no está cerca de la distribución normal asintótica ni de la distribución muestral exacta de la correlación. La forma de campana está visiblemente torcida. Esto tiene consecuencias prácticas: la región de rechazo basada en la distribución exacta ya no es correcta, aunque la tasa de error de Tipo I observada puede parecer aproximadamente correcta o incluso ligeramente conservadora.

Para un tamaño de muestra de 100, la distribución empírica es bastante cercana a la distribución normal asintótica y casi simétrica.

Histograma: distribución de muestreo empírico a partir de vectores exponenciales simulados

Aunque persiste cierta asimetría residual, la aproximación puede considerarse suficientemente buena.

Distribuciones simétricas

Algo muy interesante sucede con las distribuciones simétricas simuladas. Mientras la varianza sea finita, la distribución empírica está muy cerca de la distribución exacta derivada bajo el supuesto de independencia gaussiana.

Esto es cierto para tamaños de muestra tan pequeños como n = 3 para las distribuciones de Laplace y uniformes.

Histograma: distribución de muestreo empírico a partir de vectores de Laplace simulados

Una distribución Beta(0.2,0.2)mathrm{Beta}(0.2, 0.2) transformada en forma de U, simétrica alrededor de 0, se comporta de manera diferente. Su distribución muestral empírica de la correlación de Pearson difiere de la exacta.

Histograma: distribución de muestreo empírico de vectores Beta simulados

No es de extrañar. Los vectores no están distribuidos uniformemente en la esfera unitaria.

Sorprendentemente, todavía converge a la distribución muestral exacta de la correlación.

Histograma: distribución de muestreo empírico de vectores beta simulados

Para n tan pequeño como 8, la distribución empírica parece muy similar a la exacta, aunque esta última se derivó bajo el supuesto de invariancia rotacional.

En estas simulaciones, la asimetría parece ser la fuente dominante de desviación de la distribución muestral exacta derivada bajo el supuesto de normalidad. La distribución de Cauchy, que tiene varianza infinita, no muestra la misma convergencia. Pero las distribuciones simétricas no normales simuladas con varianza finita se mueven hacia la distribución muestral exacta de la correlación.

Observe que la convergencia ocurre mucho antes de que la aproximación normal asintótica sea precisa.

¿Qué significa todo esto para un practicante?

Los estudios pequeños son susceptibles a correlaciones espurias

Un malentendido común es que las correlaciones espurias sólo surgen en conjuntos de datos grandes (de alta dimensión). Pero en un estudio pequeño con el mismo número de sujetos, cada correlación muestral proviene exactamente de la misma distribución muestral.

Es como tirar tres dados justos. La probabilidad de obtener un total superior a 16 es cercana al 2%. Este resultado extremo puede ocurrir en el primer intento. Pero a medida que aumenta el número de tiradas, también aumenta la posibilidad de observar al menos uno de esos resultados. Si tiras los dados 100 veces, la probabilidad de observar al menos una suma mayor que 16 es aproximadamente del 84%.

Esta es la razón por la que los conjuntos de datos de alta dimensión contienen correlaciones extremas con mayor frecuencia, incluso cuando las variables no están relacionadas. Pero un estudio pequeño con el mismo número de sujetos extrae sus correlaciones muestrales exactamente de la misma distribución muestral. Por lo tanto, el mismo tipo de correlación extrema puede ocurrir puramente por casualidad.

Las correlaciones nunca deben interpretarse aisladamente del tamaño de la muestra.

En muchos campos aplicados, las correlaciones de 0,4 o más a menudo se describen como fuertes.

Considere un estudio con sólo 3 sujetos. Incluso cuando las variables no tienen una relación verdadera, es más probable que las correlaciones sean cercanas a ±1 que a 0. La probabilidad de que |r|>0.4|r| > 0,4 ​​se acerca al 74% cuando las variables son independientes.

Las regiones del histograma fuera de las líneas discontinuas corresponden a ∣r∣>0.4|r| > 0,4.

Con 10 observaciones, todavía hay un 25% de posibilidades de obtener un valor |r|>0.4|r| > 0,4.

Las regiones del histograma fuera de las líneas discontinuas corresponden a ∣r∣>0.4|r| > 0,4.

Este valor no puede considerarse evidencia de una relación en estudios de muestras pequeñas.

En un estudio de 10 ratones que midió los niveles de expresión de aproximadamente 20.000 genes frente a un resultado no relacionado, esperamos más de 1.300 pares con |r|>0,6|r| > 0,6 incluso cuando no existe relación biológica. Esta es la razón por la que se utilizan habitualmente correcciones de pruebas múltiples en conjuntos de datos de alta dimensión.

¿Significa esto que no se deben realizar ni publicar estudios con muestras pequeñas? De nada. El experimento se puede replicar y, eventualmente, cuando varios laboratorios lo repitan, un metanálisis puede poner cada resultado en contexto.

Para n = 100 sujetos, el panorama es diferente. La probabilidad de que ∣r∣>0.4∣r∣>0.4 sea solo 0.00359% (aproximadamente 36 por millón).

Las regiones del histograma fuera de las líneas discontinuas corresponden a ∣r∣>0.4|r| > 0,4.

Para este tamaño de muestra, las correlaciones absolutas de 0,2 y mayores se consideran estadísticamente significativas. El valor crítico superior del 2,5 % para varios tamaños de muestra se muestra en la siguiente tabla.

Sin embargo, tenga en cuenta que la significancia estadística no garantiza que una relación sea real. La distribución nula tiene soporte en todo el intervalo [−1,1][-1,1], por lo que todas las posibles correlaciones muestrales pueden surgir incluso cuando la verdadera correlación poblacional es cero. Las correlaciones en la región de rechazo son simplemente improbables bajo la nula, no imposibles. Son la fuente de errores de tipo I en las pruebas de hipótesis y aún pueden conducir a descubrimientos falsos.

La prueba basada en la distribución exacta es sorprendentemente robusta

Muchas implementaciones de software, incluido scipy.stats.pearsonr, utilizan la distribución nula exacta del coeficiente de correlación de Pearson. Debido a que se deriva de variables gaussianas independientes, los investigadores podrían pensar que deberían utilizar otros métodos para datos no normales. Parece que la distribución muestral exacta del coeficiente de correlación de Pearson proporciona una aproximación sorprendentemente buena, mucho antes de que la distribución muestral se acerque a su límite normal de muestra grande, a veces incluso para n = 3 o n = 4.

Esta solidez empírica es notablemente fuerte para distribuciones simétricas simuladas con varianza finita y se mantiene en casos alejados de condiciones asintóticas. Se aceptan explicaciones teóricas o referencias de los lectores.

Cuando se sabe que la distribución subyacente está sesgada, se pueden estimar cuantiles nulos empíricos simulando la distribución de la correlación bajo la hipótesis nula de independencia. Para la distribución exponencial simulada, los cuantiles estimados son:

Éstas son estimaciones de Monte Carlo a partir de simulaciones (una ejecución); Se pueden obtener valores más estables con más ejecuciones de simulación.

Para tamaños de muestra más grandes, el punto medio se mueve hacia 0 y los cuantiles empíricos se acercan tanto a la distribución nula gaussiana exacta como a la aproximación normal asintótica.

La única comida para llevar

Si solo hay una frase que podría recomendarte que recuerdes, es esta: investiga el tamaño de la muestra de cualquier estudio que presuma de un resultado notable.

Podría ser un descubrimiento genuino, pero también podrían ser dos vectores que aterrizaron inusualmente juntos en una esfera por casualidad.

Bienvenidos comentarios

Si desea replicar las simulaciones, visite el repositorio de GitHub. Todas las figuras fueron creadas por mí y las figuras basadas en simulación se pueden reproducir a partir del código que se encuentra allí.

Si te gustó el artículo o tienes alguna sugerencia, no dudes en contactarme en LinkedIn. Todos los comentarios reflexivos son muy apreciados.