envió un modelo de predicción de readmisión a principios de 2024. Este es un caso compuesto extraído de patrones documentados por Hernán & Robins en Nature Machine Intelligence, pero cada detalle se corresponde con fallas de implementación reales.
Precisión en el conjunto de prueba retenido: 94%. El equipo de operaciones lo utilizó para decidir qué pacientes priorizar para las llamadas de seguimiento. Esperaban que las tasas de reingreso disminuyeran.
Las tarifas subieron.
El modelo había capturado todas las correlaciones de los datos: pacientes mayores, ciertos códigos postales, diagnósticos de alta específicos. Funcionó exactamente según lo diseñado. Las métricas de la prueba estaban limpias. La matriz de confusión parecía un libro de texto.
Pero cuando el equipo actuó de acuerdo con esas predicciones (llamando a los pacientes marcados como de alto riesgo, reorganizando los protocolos de alta), las relaciones en los datos cambiaron debajo de ellas. Los pacientes que recibieron llamadas de seguimiento adicionales no mejoraron. Los que seguían siendo readmitidos compartían un perfil completamente diferente: no podían pagar sus medicamentos, carecían de transporte confiable para las citas de seguimiento o vivían solos sin apoyo para la atención posterior al alta. Las variables que predijeron el reingreso no fueron las mismas variables que lo provocaron.
El modelo nunca aprendió esa distinción, porque nunca fue diseñado para hacerlo. Vio correlaciones y asumió que eran manijas que se podían manejar. No lo eran. Eran sombras proyectadas por causas más profundas que el modelo no podía ver.
Un modelo que predice la readmisión con un 94% de precisión le dijo al equipo exactamente quién regresaría. No les dijo nada sobre por qué ni qué hacer al respecto.
Si ha creado un modelo que predice bien pero falla cuando se convierte en una decisión, ya ha sentido este problema. Simplemente no tenías un nombre para eso.
El nombre es confuso. La solución es la inferencia causal. Y en 2026, las herramientas para hacerlo correctamente finalmente estarán lo suficientemente maduras para que las utilice cualquier científico de datos.
La pregunta que tu modelo no puede responder
Machine Learning (ML) está diseñado para un trabajo: encontrar patrones en los datos y predecir resultados. Este es el razonamiento asociativo. Funciona de manera brillante para filtros de spam, clasificadores de imágenes y motores de recomendación. Patrón dentro, patrón fuera.
Pero las partes interesadas en las empresas rara vez se preguntan “¿qué pasará después?” Preguntan "¿qué debemos hacer?" ¿Deberíamos subir el precio? ¿Deberíamos cambiar el protocolo de tratamiento? ¿Deberíamos ofrecerle a este cliente un descuento?
Éstas son preguntas causales. Y responderlas con modelos asociativos es como utilizar un termómetro para ajustar el termostato. El termómetro te dice la temperatura. No te dice qué pasaría si cambiaras el dial.
Respondiendo "¿qué debemos hacer?" con una herramienta diseñada para "¿qué pasará?" Es como usar un termómetro para ajustar el termostato.
Judea Pearl, el científico informático que ganó el Premio Turing 2011 por su trabajo sobre razonamiento probabilístico y causal, organizó esta brecha en lo que él llama la Escalera de la Causación. La escalera tiene tres peldaños y la distancia entre ellos explica por qué tantos proyectos de aprendizaje automático fracasan cuando pasan de la predicción a la acción.
Nivel 1: Asociación (“Ver”). "Los pacientes que toman el medicamento X tienen mejores resultados". Esto es pura correlación. Todos los modelos de ML estándar operan aquí. Responde: ¿qué patrones existen en los datos?
Nivel 2: Intervención (“Hacer”). "Si le damos el medicamento X a este paciente, ¿mejorará su resultado?" Esto requiere comprender qué sucede cuando cambias algo. Pearl formaliza esto con el operador do: P(Y | do(X)). Ninguna cantidad de datos observacionales, por sí solos, puede responder a esto.
Nivel 3: Contrafactual (“Imaginando”). "Este paciente tomó el medicamento X y se recuperó. ¿Se habría recuperado sin él?" Esto requiere razonar sobre realidades que nunca sucedieron. Es la forma más elevada de pensamiento causal.
Así es como se ve cada nivel en la práctica. Un modelo de Nivel 1 en una empresa de comercio electrónico dice: "Los usuarios que vieron páginas de productos de zapatillas para correr también compraron barras de proteínas". Útil para recomendaciones. Una pregunta de nivel 2 de la misma empresa: "Si enviamos un descuento del 20% en barras de proteínas a los usuarios que vieron zapatillas para correr, ¿aumentarán las compras?" Eso requiere saber si el descuento provoca compras o si los mismos usuarios habrían comprado de todos modos. Una pregunta de nivel 3: "Este usuario compró barras de proteína después de recibir el descuento. ¿Las habría comprado sin él?" Eso requiere razonar sobre un mundo que no existió.
La mayor parte del ML opera en el Nivel 1. La mayoría de las decisiones comerciales requieren el Nivel 2 o 3. Esa brecha es donde se toman decisiones equivocadas a escala.
Cuando la precisión miente
La brecha entre predicción y causalidad no es teórica. Tiene un recuento de cadáveres.
Considere el estudio sobre cálculos renales de 1986. Los investigadores compararon dos tratamientos para los cálculos renales. El tratamiento A superó al tratamiento B para los cálculos pequeños. El tratamiento A también superó al tratamiento B para cálculos grandes. Pero cuando se combinaron los datos de ambos grupos, el Tratamiento B pareció superior.
Ésta es la paradoja de Simpson. La variable al acecho era la gravedad de los cálculos. Los médicos habían prescrito el Tratamiento A para los casos más difíciles. La combinación de datos borró ese contexto, invirtiendo la aparente conclusión. Un modelo de predicción entrenado con los datos agrupados recomendaría con seguridad el Tratamiento B. Sería un error.
Ese es un ejemplo de libro de texto de estadística. El caso de la terapia hormonal sacó sangre.
Durante décadas, los estudios observacionales sugirieron que la terapia de reemplazo hormonal (TRH) posmenopáusica reducía el riesgo de enfermedad coronaria. Las pruebas parecían sólidas. A millones de mujeres se les prescribió TRH basándose en estos hallazgos. Luego, la Iniciativa de Salud de la Mujer, un ensayo controlado aleatorio a gran escala publicado en 2002, reveló lo contrario: la TRH en realidad aumentaba el riesgo cardiovascular.
Durante décadas, los estudios observacionales sugirieron que la terapia hormonal protegía los corazones. Un juicio adecuado reveló que les dañaba. Millones de recetas, una confusión.
La confusión era la riqueza. Las mujeres más sanas y ricas tenían más probabilidades de elegir la TRH y tener tasas más bajas de enfermedades cardíacas. Los modelos observacionales captaron esta correlación y la confundieron con un efecto del tratamiento. Un artículo de 2019 de Miguel Hernán en CHANCE utilizó este caso exacto para argumentar que la ciencia de datos necesita “una segunda oportunidad para acertar en la inferencia causal”.
¿Qué tan común es este error? Una revisión de alcance de 2021 en el European Journal of Epidemiology examinó estudios observacionales y encontró que el 26% de ellos combinaban la predicción con afirmaciones causales. Uno de cada cuatro artículos publicados, en revistas médicas, donde las personas toman decisiones de vida o muerte en función de los resultados.
La estructura central detrás de ambos casos es la bifurcación de confusión: una causa común oculta (Z) que influye tanto en el tratamiento (X) como en el resultado (Y), creando una asociación espuria entre ellos. La gravedad de los cálculos impulsó tanto la elección del tratamiento como los resultados. La riqueza impulsó tanto la adopción de TRH como la salud del corazón. En cada caso, la correlación entre X e Y era real en los datos. Pero actuar en consecuencia como si X causara Y produjo una intervención equivocada.
La lección es incómoda: un modelo puede tener una gran precisión, pasar todas las comprobaciones de validación y aún así dar recomendaciones que empeoren los resultados. La precisión mide qué tan bien un modelo captura los patrones existentes. No dice nada sobre si esos patrones sobreviven cuando se interviene.
El conjunto de herramientas actualizado
Durante años, la inferencia causal vivió detrás de una pared de libros de texto de econometría, scripts R personalizados y un pequeño círculo de especialistas. Ese muro se ha derrumbado.
Microsoft Research creó DoWhy, una biblioteca de Python que reduce el análisis causal a cuatro pasos explícitos: modelar sus suposiciones, identificar la estimación causal, estimar el efecto y refutar su propio resultado. Ese cuarto paso es lo que separa la inferencia causal de "Hice una regresión y fue significativa". DoWhy te obliga a intentar romper tu conclusión antes de confiar en ella.
Junto a DoWhy se encuentra EconML, otra biblioteca de Microsoft Research que proporciona algoritmos de estimación: aprendizaje automático doble (DML), bosques causales, métodos de variables instrumentales y estimadores doblemente robustos. Juntos, forman el proyecto PyWhy, que rápidamente se está convirtiendo en la pila de análisis causal estándar en Python.
DoWhy reduce el análisis causal a cuatro pasos: modelar, identificar, estimar y refutar. Ese último paso separa la inferencia causal de "Hice una regresión".
Las señales del mercado se alinean. Fortune Business Insights valoró el mercado mundial de inteligencia artificial (IA) causal en 81.400 millones de dólares en 2025, proyectando 116.000 millones de dólares para 2026 (una tasa de crecimiento anual compuesta o CAGR del 42,5%). Un 25% adicional de las organizaciones planea adoptar IA causal para 2026, lo que elevaría la adopción total entre las organizaciones impulsadas por IA a casi el 70%.
Uber creó CausalML para modelar el aumento y estimar el efecto del tratamiento. Netflix ha publicado una investigación sobre bandidos causales de recomendaciones de contenido. El equipo de AWS de Amazon utiliza DoWhy para el análisis de la causa raíz en arquitecturas de microservicios, diagnosticando por qué ocurren los picos de latencia en lugar de simplemente predecir cuándo ocurrirán. Estos no son experimentos académicos. Son sistemas de producción que funcionan a escala.
La barrera práctica solía ser la experiencia. Necesitaba comprender los modelos causales estructurales, el criterio de puerta trasera y cómo derivar estimaciones manualmente. DoWhy automatiza el paso de identificación. Usted dibuja el DAG (codificando su conocimiento de dominio) y la biblioteca determina qué estimación estadística responde a su pregunta causal. Esa es la parte que solía tomar un curso de métodos de nivel de doctorado para hacerla manualmente.
Donde fallan los métodos causales
Una objeción justa: la mayoría de las aplicaciones de ML funcionan bien sin un razonamiento causal. Sistemas de recomendación, clasificación de imágenes, detección de fraude, ranking de búsqueda. Patrón dentro, patrón fuera. Estos problemas realmente no necesitan una estructura causal, y agregarla sería un exceso de ingeniería.
La inferencia causal también conlleva un costo que la predicción no tiene. Requiere suposiciones. Debe especificar un gráfico acíclico dirigido (DAG), un diagrama que codifica qué variables causan qué. Si su DAG es incorrecto (falta un factor de confusión, una flecha invertida), su estimación causal puede ser peor que una correlación ingenua. El problema de la basura que entra y sale no desaparece; se pasa de los datos a los supuestos.
El argumento aquí no es que la inferencia causal deba reemplazar la predicción. Es que la inferencia causal debe complementar la predicción siempre que se pasa del reconocimiento de patrones a la toma de decisiones. El modo de falla no es "ML no funciona". El modo de falla es "El aprendizaje automático funciona para la predicción y luego se aplica mal a una pregunta causal". Saber qué pregunta estás respondiendo es la habilidad que separa a un creador de modelos de un científico que toma decisiones.
¿Su problema necesita una inferencia causal?
El diagnóstico de 5 preguntas
Antes de elegir un método, analice su problema a través de estas cinco preguntas. Si responde "sí" a dos o más, necesita una inferencia causal. Si responde "sí" únicamente a la pregunta 1, necesita una inferencia causal.
¿Estás tomando una decisión o una predicción?
Predecir quién abandonará = ML estándar. Decidir qué intervención previene la deserción = inferencia causal. ¿Actuar según su modelo cambiaría las relaciones subyacentes?
Si su intervención altera los mismos patrones que aprendió el modelo, sus correlaciones cambiarán después de la implementación. Este es un problema causal. ¿Podría una variable de confusión explicar su resultado?
Si dos variables (tratamiento y resultado) comparten una causa común, la asociación observada puede desaparecer, revertirse o amplificarse una vez que se controla el factor de confusión. Piense: el caso de la TRH. ¿Necesita responder “¿y si?” o "¿por qué?"
“¿Qué pasa si duplicamos el precio?” es una pregunta de Nivel 2 (intervención). "¿Por qué se fue este cliente?" es una pregunta de Nivel 3 (contrafactual). Ambos requieren un razonamiento causal. ¿Existe un sesgo de selección en la forma en que se asignaron los tratamientos?
Si los médicos prescriben el medicamento A a los pacientes más enfermos, o si los usuarios seleccionan por sí mismos una característica, comparar los resultados brutos sin realizar ajustes no tiene sentido.
¿Qué método causal se adapta a su problema?
Una vez que sepa que necesita una inferencia causal, la siguiente pregunta es qué método. Esta matriz asigna situaciones comunes a la herramienta adecuada.
Si no está seguro de por dónde empezar: comience con un DAG. Dibuje las relaciones causales que cree que existen entre su tratamiento, el resultado y los posibles factores de confusión. Incluso un DAG aproximado hace explícitas sus suposiciones, que es el paso más importante. Puede refinar el método de estimación después.
Un flujo de trabajo DoWhy en la práctica
Aquí hay un ejemplo concreto: medir si un programa de fidelización de clientes realmente aumenta el gasto anual (a diferencia de los clientes leales que gastarían más de todos modos al seleccionarse ellos mismos en el programa).
# Instalar: pip install dowhy import dowhy from dowhy import CausalModel # Paso 1: MODELE sus supuestos causales como un DAG # Los ingresos afectan tanto el registro de lealtad como el modelo de gasto (confusor) = CausalModel( data=df, tratamiento="loyalty_program", result="annual_spending", common_causes=["ingresos", "prior_purchases", "age"], ) # Paso 2: IDENTIFICAR la estimación causal # DoWhy determina qué cantidad estadística responde a su pregunta identificada = model.identify_effect() # Devuelve: E[annual_spending | do(programa_lealtad=1)] # – E[gasto_anual | do(loyalty_program=0)] # Paso 3: ESTIMAR el efecto causal estimación = model.estimate_effect( identificado, método_nombre="backdoor.propensity_score_matching" ) print(f"Efecto causal: ${estimate.value:.2f}/year") # Paso 4: REFUTAR su propio resultado # Agregue una variable aleatoria que no debería afectar la refutación de la estimación = model.refute_estimate( identificado, estimación, nombre_método="causa_común_aleatoria" ) print(refutación) # Si el efecto se mantiene bajo factores de confusión aleatorios, su resultado es sólido
Cuatro pasos. Modele sus suposiciones, identifique la estimación, estime el efecto y luego intente descomponer su propio resultado. La documentación de DoWhy proporciona tutoriales completos sobre la integración de estimadores de EconML para casos de uso más avanzados (DML, bosques causales, variables instrumentales).
El paso de refutación merece énfasis. En ML estándar, se valida con conjuntos de pruebas reservados. En la inferencia causal, usted valida tratando de destruir su propia estimación: agregando factores de confusión aleatorios, utilizando tratamientos con placebo, ejecutando el análisis en subconjuntos de datos. Si el efecto sobrevive, tienes algo real. Si colapsa, se habrá salvado de una costosa decisión equivocada.
Si las recomendaciones de su modelo cambiarían las relaciones de las que aprendió, ha abandonado el territorio de predicción. Bienvenidos a la causalidad.
¿Qué cambia ahora?
La convergencia ya es visible. Las empresas de tecnología están contratando por razonamiento causal: Microsoft construyó toda la pila PyWhy, Uber lanzó CausalML y Netflix publicó una investigación sobre la inferencia causal en la producción. El conjunto de habilidades ya no se limita a los programas de doctorado en economía y los departamentos de epidemiología. Está ingresando a los equipos de producción de ML.
Las universidades se están adaptando. La clasificación de Hernán de las tareas de ciencia de datos en Descripción, Predicción e Inferencia Causal (publicada a través de la Escuela de Salud Pública de Harvard) se está convirtiendo en un marco pedagógico estándar. La pregunta ya no es "¿deberían los científicos de datos aprender la inferencia causal?" La pregunta es “¿qué tan rápido pueden hacerlo?”
Para el practicante individual, el retorno del aprendizaje de métodos causales es asimétrico. El científico de datos que pueda responder "¿qué pasará?" es valioso. El que puede responder “¿qué debemos hacer?” (y demostrar por qué la respuesta es sólida) exige un tipo diferente de confianza en la sala. Esa confianza se traduce directamente en influencia sobre las decisiones, la asignación de recursos y la estrategia.
La curva de aprendizaje es real pero más corta de lo que parece. Si comprende la probabilidad condicional y ha creado modelos de regresión, ya tiene el 60% de la base. El 40% restante está aprendiendo a pensar en gráficos (DAG), comprendiendo la diferencia entre condicionamiento e intervención, y sabiendo cuándo alcanzar cada estimador. La documentación de PyWhy, el curso gratuito en línea de Brady Neal sobre inferencia causal y el accesible The Book of Why de Pearl cubren ese vacío en semanas, no en años.
¿Recuerda la empresa de tecnología sanitaria de la inauguración? Después del pico de reingresos, reconstruyeron su análisis utilizando DoWhy. Elaboraron un DAG, identificaron que los factores socioeconómicos eran factores de confusión (no causas) de la readmisión y aislaron los factores causales reales: la adherencia a la medicación y el acceso a las citas de seguimiento. Rediseñaron su intervención en torno a esas dos palancas.
Las tasas de reingreso cayeron un 18%.
La precisión del modelo no cambió. Lo que cambió fue la pregunta que respondió.
La próxima vez que una parte interesada pregunte “¿qué deberíamos hacer?”, tiene dos opciones: entregarle una correlación y esperar que sobreviva al contacto con la realidad, o entregarle una estimación causal con un informe de refutación que muestre exactamente cuánto intentó romperla. Las herramientas existen. Las cuentas están resueltas. El código es de cuatro líneas.
La única pregunta que queda es si seguirás prediciendo o empezarás a causar.
Referencias
Pearl, J. y Mackenzie, D. (2018). El libro del por qué: la nueva ciencia de causa y efecto. Libros básicos. Pearl, J. y Bareinboim, E. (2022). "Sobre la jerarquía de Pearl y los fundamentos de la inferencia causal". Informe técnico R-60, Laboratorio de sistemas cognitivos de UCLA. Hernán, MA (2019). "Una segunda oportunidad para acertar en la inferencia causal: una clasificación de las tareas de ciencia de datos". OPORTUNIDAD, 32(1), 42-49. Luijken, K. y col. (2021). "¿Predicción o causalidad? Una revisión del alcance de su combinación dentro de la investigación observacional actual". Revista Europea de Epidemiología, 37, 35-46. Hernán, MA y Robins, JM (2020). "Inferencia causal y predicción contrafactual en el aprendizaje automático para una atención sanitaria procesable". Inteligencia de la máquina de la naturaleza, 2, 369-375. Sharma, A. y Kiciman, E. (2020). DoWhy: una biblioteca de un extremo a otro para la inferencia causal. Investigación de Microsoft/PyWhy. Battocchi, K. y col. (2019). EconML: un paquete de Python para la estimación del efecto de tratamiento heterogéneo basado en ML. Investigación de Microsoft / ALICIA. Perspectivas comerciales de Fortune. (2025). "Tamaño del mercado de IA causal, participación en la industria | Pronóstico, 2026-2034". Charig, CR y cols. (1986). "Comparación del tratamiento de los cálculos renales mediante cirugía abierta, nefrolitotomía percutánea y litotomía extracorpórea por ondas de choque". BMJ, 292(6524), 879-882. Colaboradores de PyWhy. (2024). "Tutorial sobre inferencia causal y sus conexiones con el aprendizaje automático (usando DoWhy+EconML)". Documentación de PyWhy.