Comprender la prueba de chi-cuadrado más allá de la fórmula

que escribió un libro para niños y lo lanzó al mercado en dos versiones al mismo tiempo al mismo precio. Una versión tiene un diseño de portada básico, mientras que la otra tiene un diseño de portada de alta calidad, que por supuesto le costó más.

Luego observa las ventas durante un período determinado y recopila los datos que se muestran a continuación.

Imagen por autor

Ahora viene a nosotros y quiere saber si el diseño de la portada de sus libros ha afectado a sus ventas.

De los datos de ventas podemos observar que existen dos variables categóricas. El primero es el tipo de cobertura, que es de alto o bajo costo, y el segundo es el resultado de ventas, que se vende o no se vende.

Ahora queremos saber si estas dos variables categóricas están relacionadas o no.

Sabemos que cuando necesitamos encontrar una relación entre dos variables categóricas, utilizamos la prueba de independencia de Chi-cuadrado.

En este escenario, generalmente usaremos Python para aplicar la prueba de chi-cuadrado y calcular la estadística de chi-cuadrado y el valor p.

Código:

importar numpy como np desde scipy.stats importar chi2_contingencia # Datos observados observados = np.array([ [320, 180], [350, 150] ]) chi2, p, dof, esperado = chi2_contingencia(observado, corrección=Falso) print("Estadística de chi-cuadrado:", chi2) print("valor p:", p) print("Grados de libertad:", dof) print("Frecuencias esperadas:n", esperada)

Resultado:

Imagen por autor

La estadística de chi-cuadrado es 4,07 con un valor p de 0,043 que está por debajo del umbral de 0,05. Esto sugiere que el tipo de cobertura y las ventas están asociadas estadísticamente.

Ahora hemos obtenido el valor p, pero antes de tratarlo como una decisión, debemos entender cómo obtuvimos este valor y cuáles son los supuestos de esta prueba.

Comprender esto puede ayudarnos a decidir si el resultado que obtuvimos es confiable o no.

Ahora intentemos comprender qué es realmente la prueba de Chi-Cuadrado.

Tenemos estos datos.

Imagen por autor

Al observar los datos, podemos decir que las ventas de libros con portada de alto costo son mayores, por lo que podemos pensar que la portada funcionó.

Sin embargo, en la vida real, los números fluctúan por casualidad, incluso si la portada no tiene ningún efecto o los clientes eligen los libros al azar. Todavía podemos obtener valores desiguales.

La aleatoriedad siempre crea desequilibrios.

Ahora la pregunta es: "¿Es esta diferencia mayor de lo que suele crear la aleatoriedad?"

Veamos cómo la prueba Chi-Cuadrado responde a esa pregunta.

Ya tenemos esta fórmula para calcular el estadístico Chi-Cuadrado.

[
chi^2 = sum_{i=1}^{r} sum_{j=1}^{c}
frac{(O_{ij} – E_{ij})^2}{E_{ij}}
]

dónde:

χ² es el estadístico de prueba de Chi-Cuadrado
i representa el índice de fila
j representa el índice de la columna
Oᵢⱼ es el recuento observado en la fila i y la columna j
Eᵢⱼ es el recuento esperado en la fila i y la columna j

Primero centrémonos en los recuentos esperados.

Antes de comprender qué son los recuentos esperados, planteemos la hipótesis de nuestra prueba.

Hipótesis nula (H₀)

El tipo de cobertura y el resultado de las ventas son independientes. (El tipo de portada no tiene ningún efecto)

Hipótesis alternativa (H₁)

El tipo de cobertura y el resultado de las ventas no son independientes. (El tipo de portada está asociado con si un libro se vende).

Ahora bien, ¿qué queremos decir con recuentos esperados?

Digamos que la hipótesis nula es cierta, lo que significa que el tipo de portada no tiene ningún efecto en las ventas de libros.

Volvamos a las probabilidades.

Como ya sabemos, la fórmula de probabilidad simple es:

[P(A) = frac{text{Número de resultados favorables}}{text{Número total de resultados}}]

Según nuestros datos, la probabilidad general de que se venda un libro es:

[P(text{Vendido}) = frac{text{Número de libros vendidos}}{text{Número total de libros}} = frac{670}{1000} = 0,67]

En probabilidad, cuando escribimos P(A∣B), nos referimos a la probabilidad del evento A dado que el evento B ya ocurrió.

[
text{Bajo independencia, el tipo de cobertura y las ventas no están relacionados.} \
text{Esto significa que la probabilidad de ser vendido no depende del tipo de cobertura.} \
text{que significa} \
P(text{Vendido} mid text{Cobertura de bajo costo}) = P(text{Vendido}) \
P(text{Vendido} mid text{Cobertura de alto costo}) = P(text{Vendido}) \
P(text{Vendido}) = frac{670}{1000} = 0,67 \
text{Por lo tanto, }
P(text{Vendido} mid text{Cobertura de bajo costo}) = 0,67
]

Bajo independencia, tenemos P (Vendido | Portada de bajo costo) = 0,67, lo que significa que se espera que se venda el 67% de los libros con portadas de bajo costo.

Como tenemos 500 libros con cubiertas de bajo costo, convertimos esta probabilidad en una cantidad esperada de libros vendidos.

[0,67 veces 500 = 335]

Esto significa que esperamos vender 335 libros con portadas de bajo costo bajo la independencia.

Según nuestra tabla de datos, podemos representar esto como E11.

De manera similar, el valor esperado para la cubierta de alto costo vendida también es 335, que está representado por E21.

Ahora calculemos E12 – Cobertura de bajo coste, No vendida y E22 – Cobertura de alto coste, No vendida.

La probabilidad global de que un libro no se venda es:

[P(text{No vendido}) = frac{330}{1000} = 0,33]

En condiciones de independencia, esta probabilidad se aplica a cada subgrupo como antes.

[P(text{No vendido} mid text{Cobertura de bajo costo}) = 0,33]

[P(text{No vendido} mid text{Cobertura de alto costo}) = 0,33]

Ahora convertimos esta probabilidad al recuento esperado de libros no vendidos.

[E_{12} = 0,33 veces 500 = 165]

[E_{22} = 0.33 veces 500 = 165]

Usamos probabilidades aquí para comprender la idea de los recuentos esperados, pero ya tenemos fórmulas directas para calcularlos. Echemos un vistazo también a ellos.

Fórmula para calcular los recuentos esperados:

[E_{ij} = frac{R_i times C_j}{N}]

Dónde:

Ri​ = Total de fila Cj​ = Total de columna N = Total general

Cobertura de bajo coste, Vendido:

[E_{11} = frac{500 times 670}{1000} = 335]

Cobertura de bajo coste, No vendida:

[E_{12} = frac{500 times 330}{1000} = 165]

Cobertura de alto costo, Vendido:

[E_{12} = frac{500 times 670}{1000} = 335]

Cobertura de alto costo, no vendida:

[E_{22} = frac{500 times 330}{1000} = 165]

En ambos sentidos obtenemos los mismos valores.

Al calcular los recuentos esperados, lo que encontramos es esto: si asumimos que la hipótesis nula es verdadera, entonces las dos variables categóricas son independientes.

Aquí tenemos 1.000 libros y sabemos que se venden 670. Ahora imaginamos escoger libros al azar y etiquetarlos como vendidos.

Después de seleccionar 670 libros, comprobamos cuántos de ellos pertenecen al grupo de cobertura de bajo coste y cuántos pertenecen al grupo de cobertura de alto coste.

Si repetimos este proceso muchas veces obtendríamos valores en torno a 335. En ocasiones pueden ser 330 o 340.

Luego consideramos el promedio, y 335 se convierte en el punto central de la distribución si todo sucede puramente por aleatoriedad.

Esto no significa que el recuento deba ser igual a 335, sino que 335 representa el centro natural de variación bajo la independencia.

Luego, la prueba de Chi-Cuadrado mide en qué medida el recuento observado se desvía de este valor central en relación con la variación esperada bajo aleatoriedad.

Calculamos los recuentos esperados:

E11 = 335; E21 = 335; E12 = 165; E22 = 165

Imagen por autor

El siguiente paso es calcular la desviación entre los recuentos observados y esperados. Para hacer esto, restamos el recuento esperado del recuento observado.

begin{alineado}
text{Cobertura de bajo costo y vendido:} quad & O – E = 320 – 335 = -15 \[8pt]
text{Cobertura de bajo costo y no vendida:} quad & O – E = 180 – 165 = 15 \[8pt]
text{Cobertura de alto costo y vendido:} quad & O – E = 350 – 335 = 15 \[8pt]
text{Cobertura de alto costo y no vendida:} quad & O – E = 150 – 165 = -15
end{alineado}

En el siguiente paso, elevamos al cuadrado las diferencias porque si sumamos las desviaciones brutas, los valores positivos y negativos se cancelan, lo que da como resultado cero.

Esto sugeriría incorrectamente que no hay desequilibrio. La elevación al cuadrado resuelve el problema de la cancelación al permitirnos medir la magnitud del desequilibrio, independientemente de la dirección.

begin{alineado}
text{Cobertura de bajo costo y vendido:} quad & (O – E)^2 = (-15)^2 = 225 \[6pt]
text{Cobertura de bajo costo y no vendida:} quad & (15)^2 = 225 \[6pt]
text{Cobertura de alto costo y vendido:} quad & (15)^2 = 225 \[6pt]
text{Cobertura de alto costo y no vendida:} quad & (-15)^2 = 225
end{alineado}

Ahora que hemos calculado las desviaciones al cuadrado para cada celda, el siguiente paso es dividirlas por sus respectivos recuentos esperados.

Esto estandariza las desviaciones al escalarlas en relación con lo que se esperaba bajo la hipótesis nula.

begin{alineado}
text{Cobertura de bajo costo y vendido:} quad & frac{(O – E)^2}{E} = frac{225}{335} = 0.6716 \[6pt]
text{Cobertura de bajo costo y no vendido:} quad & frac{225}{165} = 1,3636 \[6pt]
text{Cobertura de alto costo y vendido:} quad & frac{225}{335} = 0,6716 \[6pt]
text{Cobertura de alto costo y no vendido:} quad & frac{225}{165} = 1,3636
end{alineado}

Ahora, para cada celda, hemos calculado:

begin{alineado}
frac{(O – E)^2}{E}
end{alineado}

Cada uno de estos valores representa la contribución cuadrada estandarizada de una celda al desequilibrio total. Sumarlos da la desviación cuadrada estandarizada general de la tabla, conocida como estadística Chi-Cuadrado.

begin{alineado}
chi^2 &= 0,6716 + 1,3636 + 0,6716 + 1,3636 \[6pt]
&= 4.0704 \[6pt]
&aproximadamente 4.07
end{alineado}

Obtuvimos un estadístico Chi-Cuadrado de 4,07.

¿Cómo podemos interpretar este valor?

Después de calcular el estadístico chi-cuadrado, lo comparamos con el valor crítico de la tabla de distribución chi-cuadrado para 1 grado de libertad con un nivel de significancia de 0,05.

Para df = 1 y α = 0,05, el valor crítico es 3,84. Dado que nuestro valor calculado (4,07) es mayor que 3,84, rechazamos la hipótesis nula.

La prueba de chi-cuadrado está completa en este punto, pero aún necesitamos entender qué significa df = 1 y cómo se obtiene el valor crítico de 3,84.

Aquí es donde las cosas empiezan a ponerse interesantes y un poco confusas.

Primero, comprendamos qué significa df = 1.

'df' significa grados de libertad.

A partir de nuestros datos,

Imagen por autor

Podemos llamar a esto una tabla de contingencia y, para ser específicos, es una tabla de contingencia 2*2 porque se define por el número de categorías en la variable 1 como filas y el número de categorías en la variable 2 como columnas. Aquí tenemos 2 filas y 2 columnas.

Podemos observar que los totales de las filas y los totales de las columnas son fijos. Esto significa que si el valor de una celda cambia, las otras tres deben ajustarse en consecuencia para preservar esos totales.

En otras palabras, sólo hay una forma independiente en que la tabla puede variar mientras se mantienen fijos los totales de filas y columnas. Por tanto, la tabla tiene 1 grado de libertad.

También podemos calcular los grados de libertad usando la fórmula estándar para una tabla de contingencia:

[
gl = (r – 1)(c – 1)
]

donde r es el número de filas y c es el número de columnas.

En nuestro ejemplo, tenemos una tabla de 2*2, entonces:

[
gl = (2 – 1)(2 – 1)
]

[
gl = 1
]

Ahora tenemos una idea de lo que significan los grados de libertad a partir de la tabla de datos. Pero ¿por qué necesitamos calcularlos?

Ahora imaginemos un espacio de cuatro dimensiones en el que cada eje corresponde a una celda de la tabla de contingencia:

Eje 1: Bajo costo y vendido

Eje 2: Bajo costo y no vendido

Eje 3: Alto costo y vendido

Eje 4: Alto costo y no vendido

De la tabla de datos, tenemos los recuentos observados (320, 180, 350, 150). También calculamos los recuentos esperados bajo independencia como (335, 165, 335, 165).

Tanto los recuentos observados como los esperados se pueden representar como puntos en un espacio de cuatro dimensiones.

Ahora tenemos dos puntos en un espacio de cuatro dimensiones.

Ya calculamos la diferencia entre los recuentos observados y esperados (-15, 15, 15, -15).

Podemos escribirlo como -15(1, -1, -1, 1)

En los datos observados,

Imagen por autor

Digamos que aumentamos el recuento de Bajo costo y Vendidos de 320 a 321 (un cambio de +1).

Para mantener fijos los totales de filas y columnas, Costo bajo y no vendido debe disminuir en 1, Costo alto y vendido debe disminuir en 1 y Costo alto y no vendido debe aumentar en 1.

Esto produce el patrón (1, −1, −1, 1).

Cualquier cambio válido en una tabla de 2×2 con márgenes fijos sigue este mismo patrón multiplicado por algún escalar.

Con totales fijos de filas y columnas, son posibles muchas tablas diferentes de 2×2. Cuando representamos cada tabla como un punto en un espacio de 4 dimensiones, estas tablas se encuentran en una línea recta unidimensional.

Podemos referirnos a los recuentos esperados, (335, 165, 335, 165), como el centro de esa línea recta y denotaremos ese punto como E.

El punto E se encuentra en el centro de la línea porque, bajo pura aleatoriedad (independencia), estos son los valores que esperamos observar.

Luego medimos cuánto se desvían los recuentos observados de estos recuentos esperados.

Podemos observar que cada punto de la recta es:

mi + x (1, −1, −1, 1)

donde x es cualquier escalar.

De nuestra tabla de datos observados, podemos escribirla como:

O = mi + (-15) (1, −1, −1, 1)

De manera similar, cada punto se puede escribir así.

El (1, −1, −1, 1) define la dirección del espacio de desviación unidimensional. Lo llamamos vector de dirección. El valor escalar simplemente nos dice qué tan lejos debemos movernos en esa dirección.

Toda tabla válida se obtiene comenzando en la tabla esperada y moviéndose cierta distancia en esta dirección.

Por ejemplo, cualquier punto de la recta es (335+x, 165-x, 335-x, 165+x).

Sustituyendo x=−15, los valores se convierten en
(335−15, 165+15, 335+15, 165−15),
que se simplifica a (320, 180, 350, 150).
Esto coincide con nuestra tabla observada.

Podemos imaginar que cuando x cambia, la mesa se mueve solo en una dirección a lo largo de una línea recta.

Esto significa que toda la desviación de la independencia está controlada por un único valor escalar, que mueve la tabla en línea recta.

Dado que todas las mesas se encuentran a lo largo de una línea unidimensional, el sistema tiene sólo una dirección de movimiento independiente. Por eso los grados de libertad son iguales a 1.

En este punto, sabemos cómo calcular el estadístico chi-cuadrado. Como se dedujo anteriormente, estandarizar la desviación del recuento esperado y elevarla al cuadrado da como resultado un valor de chi-cuadrado de 4,07.

Ahora que entendemos qué significan los grados de libertad, exploremos qué es realmente la distribución chi-cuadrado.

Volviendo a nuestros datos observados, tenemos 1000 libros en total. De ellos, 670 se vendieron y 330 no se vendieron.

Bajo el supuesto de independencia (es decir, el tipo de portada no influye en si un libro se vende), podemos imaginar seleccionar aleatoriamente 670 libros de 1000 y etiquetarlos como "vendidos".

Luego contamos cuántos de estos libros seleccionados tienen un tipo de portada de bajo costo. Denotemos este recuento por X.

Si repetimos este experimento muchas veces como se analizó anteriormente, cada repetición produciría un valor diferente de X, como 321, 322, 326, etc.

Ahora bien, si trazamos estos valores en muchas repeticiones, podemos observar que los valores se agrupan alrededor de 335, formando una curva en forma de campana.

Trama:

Imagen por autor

Podemos observar la Distribución Normal.

Según nuestra tabla de datos observados, el número de libros vendidos y de bajo costo es 320. La distribución que se muestra arriba representa cómo se comportan los valores en condiciones de independencia.

Vemos que valores como 334 y 336 son comunes, mientras que 330 y 340 son algo menos comunes. Un valor como 320 parece relativamente raro.

Pero ¿cómo determinamos esto correctamente? Para responder a eso, debemos comparar 320 con el centro de la distribución, que es 335, y considerar qué tan ancha es la curva.

El ancho de la curva refleja cuánta variación natural esperamos bajo independencia. Con base en este diferencial, podemos evaluar con qué frecuencia ocurriría un valor como 320.

Para eso necesitamos realizar la Estandarización.

Valor esperado: ( mu = 335 )

Valor observado: ( X = 320 )

Diferencia: ( 320 – 335 = -15 )

Desviación estándar: ( sigma aprox 7,44 )

[
Z = frac{320 – 335}{7,44} aprox -2,0179
]

Entonces, 320 está aproximadamente dos desviaciones estándar por debajo del promedio.

Ya sabemos que aquí calculamos el puntaje Z.

La puntuación Z de 320 es aproximadamente −2,0179.

De la misma manera, si estandarizamos cada posible de X, entonces la distribución muestral de X anterior se transforma en la distribución normal estándar con media = 0 y desviación estándar = 1.

Imagen por autor

Ahora ya sabemos que 320 está aproximadamente dos desviaciones estándar por debajo del promedio.

Puntuación Z = -2,0179

Ya calculamos una estadística de chi-cuadrado igual a 4,07.

Ahora elevemos al cuadrado el puntaje Z.

Z2 = (−2,0179)2 = 4,0719 y esto es igual a nuestra estadística de chi-cuadrado.

Si una desviación estandarizada sigue una distribución normal estándar, entonces elevar al cuadrado esa variable aleatoria transforma la distribución en una distribución chi-cuadrado con un grado de libertad.

Imagen por autor

Esta es la curva que se obtiene cuando elevamos al cuadrado una variable aleatoria normal estándar Z. Dado que al elevar al cuadrado se elimina el signo, tanto los valores positivos como los negativos de Z se corresponden con valores positivos.

Como resultado, la distribución simétrica en forma de campana se transforma en una distribución sesgada a la derecha que sigue una distribución chi-cuadrado con un grado de libertad.

Cuando los grados de libertad son 1, en realidad no necesitamos pensar en términos de elevación al cuadrado para tomar una decisión.

Sólo hay una desviación independiente de la independencia, por lo que podemos estandarizarla y realizar una prueba Z bilateral.

Elevar al cuadrado simplemente convierte ese valor Z en un valor de chi-cuadrado, cuando df = 1. Sin embargo, cuando los grados de libertad son mayores que 1, existen múltiples desviaciones independientes.

Si simplemente sumamos esas desviaciones, los valores positivos y negativos se cancelan.

La elevación al cuadrado garantiza que todas las desviaciones contribuyan positivamente a la desviación total.

Es por eso que el estadístico chi-cuadrado siempre suma las desviaciones estandarizadas al cuadrado, especialmente cuando gl es mayor que 1.

Ahora tenemos una comprensión más clara de cómo se vincula la distribución normal con la distribución chi-cuadrado.

Ahora usemos esta distribución para realizar pruebas de hipótesis.

Hipótesis nula (H₀)

El tipo de cobertura y el resultado de las ventas son independientes. (El tipo de portada no tiene ningún efecto)

Hipótesis alternativa (H₁)

El tipo de cobertura y el resultado de las ventas no son independientes. (El tipo de portada está asociado con si un libro se vende).

Un nivel de significancia comúnmente utilizado es α = 0,05. Esto significa que rechazamos la hipótesis nula sólo si nuestro resultado se encuentra dentro del 5% más extremo de los resultados bajo la hipótesis nula.

De la distribución Chi-Cuadrado en gl = 1 y α = 0,05: el valor crítico es 3,84.

El valor 3,84 es el valor crítico (de corte). El área a la derecha de 3,84 es igual a 0,05, lo que representa la región de rechazo.

Dado que nuestra estadística de chi-cuadrado calculada excede 3,84, se encuentra dentro de esta región de rechazo.

Imagen por autor

El valor p aquí es 0,043, que es el área a la derecha de 4,07.

Esto significa que si el tipo de cobertura y las ventas fueran verdaderamente independientes, solo habría un 4,3% de posibilidades de observar una diferencia tan grande.

Ahora bien, si estos resultados son confiables o no depende de los supuestos de la prueba de chi-cuadrado.

Veamos los supuestos para esta prueba:

1) Independencia de las observaciones

En este contexto, independencia significa que la venta de un libro no debe influir en otra. El mismo cliente no debe contarse varias veces y las observaciones no deben emparejarse ni repetirse.

2) Los datos deben ser recuentos categóricos.

3) Las frecuencias esperadas no deben ser demasiado pequeñas

Todos los recuentos de células esperados generalmente deben ser al menos 5.

4) Muestreo aleatorio

La muestra debe representar a la población.

Debido a que se cumplen todos los supuestos y el valor p (0,043) es inferior a 0,05, rechazamos la hipótesis nula y concluimos que el tipo de cobertura y las ventas están estadísticamente asociados.

En este punto, es posible que esté confundido acerca de algo.

Pasamos mucho tiempo centrándonos en una célula, por ejemplo, en los libros baratos que se vendían.

Calculamos su desviación, la estandarizamos y la usamos para comprender cómo se forma la estadística de chi cuadrado.

¿Pero qué pasa con las otras células? ¿Qué pasa con los libros caros o los que no se venden?

Lo importante a tener en cuenta es que en una mesa de 2×2, las cuatro celdas están conectadas. Una vez que se fijan los totales de las filas y las columnas, la tabla tiene solo un grado de libertad.

Esto significa que los recuentos no pueden variar de forma independiente. Si una celda aumenta, las demás celdas se ajustan automáticamente para mantener los totales consistentes.

Como comentamos anteriormente, podemos pensar en todas las tablas posibles con los mismos márgenes como puntos en un espacio de cuatro dimensiones.

Sin embargo, debido a las restricciones impuestas por los totales fijos, esos puntos no se extienden en todas direcciones. En cambio, se encuentran a lo largo de una única línea recta, que ya comentamos anteriormente.

Cada desviación de la independencia mueve la mesa sólo en esa dirección, que analizamos anteriormente.

Entonces, cuando una celda se desvía, digamos, +15 de su valor esperado, las otras celdas quedan determinadas automáticamente por la estructura de la tabla.

Toda la mesa se mueve a la vez. La desviación no se trata sólo de un número. Representa el movimiento de todo el sistema.

Cuando calculamos la estadística de chi cuadrado, restamos lo observado de lo esperado para todas las celdas y estandarizamos cada desviación.

Pero en una tabla de 2×2, esas desviaciones están unidas. Se mueven como una estructura coordinada.

Esto significa que basta con examinar una celda para comprender hasta qué punto toda la tabla se ha alejado de la independencia y también la distribución.

El aprendizaje nunca termina y todavía queda mucho más por explorar sobre la prueba de chi-cuadrado.

Espero que este artículo le haya brindado una comprensión clara de lo que realmente hace la prueba de chi-cuadrado.

En otro blog, discutiremos qué sucede cuando no se cumplen los supuestos y por qué la prueba de chi-cuadrado puede fallar en esas situaciones.

Ha habido una pequeña pausa en mi serie de series temporales. Me di cuenta de que algunos temas merecían más claridad y una reflexión más cuidadosa, así que decidí ir más despacio en lugar de seguir adelante. Volveré a él pronto con explicaciones que me parecen más completas e intuitivas.

Si te gustó este artículo, puedes explorar más de mis escritos en Medium y LinkedIn.

¡Gracias por leer!