-Pente a mi artículo anterior: Los peligros de los gráficos de confusión de datos engañosos y titulares engañosos. Mi primer artículo se centró en cómo visualizaciones Se puede utilizar para engañar, sumergirse en una forma de presentación de datos ampliamente utilizada en asuntos públicos.
En este artículo, me profundizo un poco, observando cómo un malentendido de las ideas estadísticas es un caldo de cultivo para ser engañado por los datos. Específicamente, recorreré cómo la correlación, las proporciones de base, las estadísticas resumidas y la mala interpretación de la incertidumbre pueden llevar a las personas por mal camino.
Vamos a entrar en ello.
Correlación ≠ causalidad
Comencemos con un clásico para entrar en el estado de ánimo correcto para algunas ideas más complejas. Desde las primeras clases de estadísticas en la escuela primaria, se nos dice que la correlación no es igual a la causalidad.
Si hace un poco de Google o de lectura, puede encontrar “estadísticas” que muestren una alta correlación entre el consumo de cigarrillos y la esperanza de vida promedio [1]. Interesante. Bueno, ¿eso significa que todos deberíamos comenzar a fumar para vivir más?
Por supuesto que no. Nos falta un factor de confusión: comprar cigarrillos requiere dinero, y los países con mayor riqueza tienen una mayor expectativa de vida. No hay un vínculo causal entre los cigarrillos y la edad. Me gusta este ejemplo porque es muy engañoso y resalta bien el punto. En general, es importante tener cuidado con los datos que solo muestren un enlace correlacional.
Desde un punto de vista científico, se puede identificar una correlación a través de la observación, pero la única forma de reclamar la causalidad es realizar un ensayo aleatorizado que controla posibles factores de confusión, un proceso bastante involucrado.
Elegí comenzar aquí porque al ser introductorio, este concepto también destaca una idea clave que sustenta la comprensión de los datos de manera efectiva: Los datos solo muestran lo que muestra, y nada más.
Tenga eso en cuenta a medida que avanzamos.
Recuerda proporciones de base
En 1978, el Dr. Stephen Casscells y su equipo le preguntaron a un grupo de 60 médicos, residentes y estudiantes de la Facultad de Medicina de Harvard las siguientes preguntas:
“Si una prueba para detectar una enfermedad cuya prevalencia es 1 de cada 1,000 tiene una tasa de falsos positivos del 5%, ¿cuál es la posibilidad de que una persona tenga un resultado positivo en realidad tiene la enfermedad, suponiendo que no sabe nada sobre los síntomas o signos de la persona?”
Aunque se presenta en términos médicos, esta pregunta se trata realmente de estadísticas. En consecuencia, también tiene conexiones con la ciencia de datos. Tómese un segundo para pensar en su propia respuesta a esta pregunta antes de leer más.
La respuesta es (aproximadamente) 2%. Ahora, si mira esto rápidamente (y no está al día con sus estadísticas), es posible que haya adivinado significativamente más.
Este fue ciertamente el caso de la gente de la escuela de medicina. Solo 11/60 personas respondieron correctamente la pregunta, con 27/60 hasta el 95% en su respuesta (presumiblemente solo restando la tasa de falsos positivos de 100).
Es fácil suponer que el valor real debe ser alto debido al resultado positivo de descanso, pero esta suposición contiene un error de razonamiento crucial: no tiene en cuenta la prevalencia extremadamente baja de la enfermedad en la población.
Dicho de otra manera, si solo 1 de cada 1,000 personas tiene la enfermedad, esto debe tenerse en cuenta al calcular la probabilidad de que una persona aleatoria tenga la enfermedad. La probabilidad no depende solo del resultado de la prueba positiva. Tan pronto como la precisión de la prueba cae por debajo del 100%, la influencia de la tasa base entra en juego de manera bastante significativa.
Formalmente, este error de razonamiento se conoce como el Falacia de la tasa base.
Para ver esto más claramente, imagine que solo 1 de cada 1,000,000 de personas tenía la enfermedad, pero la prueba aún tiene una tasa falsa positiva del 5%. ¿Seguiría asumiendo que un resultado de la prueba positivo indica inmediatamente una probabilidad del 95% de tener la enfermedad? ¿Qué pasaría si fuera 1 en mil millones?
Las tasas base son extremadamente importantes. Recuerda eso.
Las medidas estadísticas no son equivalentes a los datos
Echemos un vistazo a los siguientes conjuntos de datos cuantitativos (13 de ellos, para ser precisos), todos los cuales se visualizan como una gráfica de dispersión. Uno incluso está en forma de dinosaurio.
¿Ves algo interesante sobre estos conjuntos de datos?
Te señalaré en la dirección correcta. Aquí hay un conjunto de estadísticas sumarias para los datos:
| X-MEAN | 54.26 |
| Y-mean | 47.83 |
| X-SD (desviación estándar) | 16.76 |
| Y-sd | 26.93 |
| Correlación | -0.06 |
Si se pregunta por qué solo hay un conjunto de estadísticas, es porque son todos iguales. Cada uno de los 13 Gráficos Arriba tiene la misma media, desviación estándar y correlación entre variables.
Este famoso conjunto de 13 conjuntos de datos se conoce como el DataSaurus docena [5]y fue publicado hace algunos años como un claro ejemplo de por qué no siempre se puede confiar en las estadísticas resumidas. También destaca el valor de la visualización como una herramienta para la exploración de datos. En palabras del famoso estadístico John Tukey,
“El mayor valor de una imagen es cuando nos obliga a notar lo que nunca esperamos ver.“
Comprender la incertidumbre
Para concluir, quiero hablar sobre una ligera variación de los datos engañosos, pero que es igualmente importante: desconfiando de datos que en realidad son correctos. En otras palabras, engaño falso.
El siguiente cuadro se toma de un estudio que analiza los sentimientos de los titulares tomados de los medios de comunicación de la izquierda, la derecha y los centristas de noticias [6]:
Están sucediendo bastante en la tabla de arriba, pero hay un aspecto particular al que quiero llamar su atención: las líneas verticales que se extienden desde cada punto trazado. Es posible que haya visto estos antes. Formalmente, estos se llaman barras de errory son una forma en que los científicos a menudo representan la incertidumbre en los datos.
Déjame decir eso de nuevo. En estadísticas y Ciencia de datos“Error” es sinónimo de “incertidumbre”. Crucialmente, No significa que algo esté mal o incorrecto sobre lo que se muestra. Cuando una tabla representa la incertidumbre, representa una medida cuidadosamente calculada del rango de un valor y el nivel de confianza en varios puntos dentro de ese rango. Desafortunadamente, muchas personas simplemente lo consideran para que quien haya hecho el gráfico está esencialmente adivinando.
Este es un error grave en el razonamiento, ya que el daño es doble: no solo los datos en cuestión se malinterpretan, sino que la presencia de esta idea errónea también contribuye a la peligrosa creencia social de que no se debe confiar en la ciencia. Ser sincero sobre las limitaciones del conocimiento debería aumentar nuestra confianza en la confiabilidad de una afirmación, pero confundir esa limitación como admisión de juego sucio conduce al efecto opuesto.
Aprender a interpretar la incertidumbre es desafiante pero increíblemente importante. Como mínimo, un buen lugar para comenzar es darse cuenta de lo que el llamado “error” realmente está tratando de transmitir.
Resumen y pensamientos finales
Aquí hay una hoja de trucos para desconfiar de los datos engañosos:
- Correlación ≠ causalidad. Busque el factor de confusión.
- Recuerda proporciones de base. La probabilidad de un fenómeno es muy Influenciado por su prevalencia en la población, no importa cuán precisa sea su prueba (con la excepción del 100% de precisión, lo cual es raro).
- Cuidado con el resumen Estadística. Los medios y las medianas solo te llevarán tan lejos; Necesita explorar sus datos.
- No malinterpreten incertidumbre. No es un error; Es una descripción cuidadosamente considerada de los niveles de confianza.
Recuerde estos, y estará bien posicionado para abordar el próximo problema de ciencia de datos que se dirige a usted.
Hasta la próxima.
Referencias
[1] Cómo se encuentran los gráficosAlberto El Cairo
[2] https://pmc.ncbi.nlm.nih.gov/articles/pmc4955674
[4] https://visualizing.jp/the-datasaurus-dozen
[6] https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0276367