Modelado discreto de tiempo hasta el evento: predecir cuándo sucederá algo

Introducción

Los problemas de ciencia de datos predicen qué; por ejemplo, ¿a cuánto se venderá una casa? ¿O qué comprará un cliente? ¿O cuál es la probabilidad de que un paciente tenga una enfermedad?

Sin embargo, muchas decisiones del mundo real dependen igualmente de cuándo sucederá algo. ¿Cuánto tiempo pasa hasta que un cliente abandona? ¿Cuándo entrará en mora un préstamo? ¿Cuánto tiempo queda antes de que falle un componente?

Predecir cuándo sucederá algo es un caso de uso de modelado predictivo que no recibe mucha atención en los materiales introductorios. Predecir el “cuándo” a menudo se denomina modelado de tiempo hasta el evento o análisis de supervivencia.

Si bien el modelado de eventos comparte técnicas e intuiciones con el modelado predictivo más tradicional, también introduce matices que deben tenerse en cuenta para crear predicciones efectivas.

Este es el comienzo de una serie de varias partes que cubrirá los conceptos básicos del modelado de tiempo hasta el evento. Esta primera parte discutirá conceptos básicos, mientras que los artículos futuros cubrirán técnicas de desarrollo de modelos de tiempo hasta el evento.

Estos son los tres temas que cubriré en este artículo:

Poner eventos en tiempo discreto Censurar datos de eventos La tabla de vida

Discretizando el tiempo

Si bien el tiempo es continuo por naturaleza, dependiendo del caso de uso del modelado de tiempo hasta el evento, puede ser apropiado tratar el tiempo como continuo o discreto. En este artículo nos centraremos en el tratamiento discreto, pero quiero dedicar un poco de tiempo a discutir la decisión entre un tratamiento de tiempo discreto versus uno continuo.

Pautas sobre cuándo tratar el tiempo como continuo

A menudo es mejor tratar el tiempo como continuo cuando:

El evento puede ocurrir en cualquier momento y es inherentemente continuo (contrastaremos esto con los eventos menos intuitivos e inherentemente discretos en la siguiente sección). La falla del equipo es un ejemplo común. El momento del evento se puede medir con precisión. Es difícil medir el momento exacto en que una persona desempleada consigue trabajo, pero los sensores de los vehículos modernos pueden capturar el momento exacto de un accidente automovilístico. La granularidad de la medición del tiempo es muy pequeña en relación con el horizonte temporal general. Por ejemplo, medir eventos hasta el segundo cuando la línea de tiempo natural del evento abarca semanas o meses.

Tenga en cuenta que medir el tiempo únicamente en pequeños incrementos no implica automáticamente una configuración de tiempo continuo. Considere el tiempo de respuesta humana al cambio de imágenes. El tiempo de respuesta se puede medir en centisegundos (1/100 de segundo), pero dado que los tiempos de respuesta típicos son del orden de 2 a 3 centisegundos, esta unidad representa una gran parte de la línea de tiempo subyacente. A pesar de la pequeña unidad de medida, este ejemplo probablemente no funcionaría bien como modelo de tiempo continuo.

Directrices sobre cuándo tratar el tiempo como discreto

El evento en sí es inherentemente discreto. Por ejemplo, un cliente sólo puede no realizar un pago en una fecha de vencimiento; no pueden perdérselo en un momento arbitrario. No se puede capturar de manera confiable el momento preciso del evento. No podemos saber exactamente cuándo estalló una tubería o cuándo una persona contrajo una enfermedad. Los datos se agregan a intervalos discretos por razones prácticas. En muchas aplicaciones, tratar el tiempo como continuo añade poco valor. En los seguros de hogar, por ejemplo, rara vez importa en qué momento se produjo una explosión de una tubería o un incendio; la unidad relevante suele ser solo el día del evento o el día en que se presentó el reclamo.

Cuando el contexto de modelado requiere tiempo discreto, se debe tomar una decisión explícita sobre cómo discretizar. Esto requiere una buena comprensión del dominio del problema. En los seguros de vida, el tiempo suele medirse en años; en los informes comerciales, meses o trimestres pueden ser más apropiados.

Una nota sobre los vínculos: una diferencia adicional que quería destacar entre el tiempo discreto y el continuo son los 'vínculos', es decir, un evento que ocurre exactamente al mismo tiempo para múltiples observaciones. Muchas técnicas de modelado continuo del tiempo hasta el evento suponen que los vínculos no son posibles y no existen en el conjunto de datos. Los enfoques discretos de tiempo hasta el evento no tienen este supuesto y, según el caso de uso, los vínculos pueden ser frecuentes (piense en las reclamaciones de seguros en un mes).

Censura

La censura de datos es mucho más común en los datos de tiempo hasta el evento que en las aplicaciones de aprendizaje automático más tradicionales. La censura de datos ocurre cuando el valor de una observación se conoce solo parcialmente: podemos saber que se encuentra por encima (censura por la derecha) o por debajo (censura por la izquierda) de un cierto punto, pero no conocemos el valor real.

Piensa en ti mismo como un ejemplo, ¿cuántos años vas a vivir? Sabes que al menos vivirás hasta tu edad actual (porque ya la tienes), pero no sabes cuánto más podrás llegar. ¡Eres un punto de datos censurado correcto! Tu tatarabuela no está censurada porque ya falleció, puedes saber cuánto vivió. Bien, basta de este ejemplo, no me gusta contemplar mi propia mortalidad.

Si bien la censura derecha e izquierda puede ocurrir en aplicaciones de tiempo hasta el evento, centraré mi discusión en la censura derecha porque es el tipo más común con el que se encontrará. La censura correcta generalmente proviene de dos fenómenos en los datos: (1) el evento no ha sucedido o no ha tenido plena oportunidad de suceder para algunas observaciones y (2) los datos dejaron de recopilarse para algunas observaciones en algún momento. Dedicaremos un poco de tiempo a discutir cada uno de ellos.

El evento no ha ocurrido

Nuestro ejemplo de duración de la vida, un poco demasiado real, cae en la categoría de censura debido a que un evento no sucede. La muerte y los impuestos son inevitables, o eso dicen. Pero no se garantiza que todos los eventos que necesite modelar eventualmente sucedan. Piense en modelar cuando alguien contrae gripe, lo despiden de su trabajo o cuando se presenta un reclamo de seguro por una casa. Son cosas que podrían o no suceder, pero que también están sujetas a censura.

Exploremos un poco más el ejemplo del seguro de hogar. Queremos predecir el momento de las reclamaciones de un conjunto de pólizas de seguro de hogar. Tenemos un conjunto de datos con contratos de 1 año que se remonta a contratos que comenzaron hace 5 años e incluye datos hasta el mes pasado. Detente y piensa dónde entra la censura aquí. Todos los contratos que se originaron hace menos de un año están censurados; no sabemos cuántas reclamaciones tendrán porque todavía están abiertos.

Se dejaron de recopilar datos

A veces nuestros datos son censurados porque no recopilamos datos de eventos por diversos motivos. Imaginemos que estamos haciendo un estudio sobre cuánto tiempo tarda un solicitante de empleo en recibir una oferta. Comenzamos con 500 participantes en nuestro estudio, pero después de un tiempo, 50 de ellos dejan de responder nuestras llamadas y correos electrónicos. Sabemos cuál era el estado de su oferta la última vez que los contactamos, pero no sabemos cuál es ahora o en el futuro (suponiendo que continúen engañándonos).

Para ilustrarlo mejor, volvamos a nuestro ejemplo de seguro de hogar. Probablemente tendremos algunos clientes que cancelarán sus contratos con nosotros durante el período del contrato. Para estos clientes, conocemos la cantidad y el momento de los reclamos (si los hay) hasta la cancelación, pero después de que cancelan, no sabemos si tuvieron un evento reclamable.

Ilustración de la censura en datos de tiempo transcurrido hasta el evento: imagen del autor

¿Qué pasa si no haces nada con respecto a la censura de datos?

Los modelos que se crean sin abordar la censura presentarán sesgos en sus predicciones. Debido a que estamos observando eventos, una mayor censura reduce el número de eventos observados. Cuando nuestro modelo ve menos eventos, los predice con menos frecuencia. Los modelos de tiempo hasta el evento creados sin adaptaciones para la censura generarán predicciones sesgadas por debajo de los eventos reales observados.

Nota adicional: la mayoría de los métodos de tiempo hasta el evento asumen que la censura no es informativa. Lo que significa que la razón por la que se censura una observación no está relacionada con el riesgo de evento subyacente después de tener en cuenta las características observadas. Si la censura está relacionada con el riesgo de un evento, los métodos estándar de tiempo hasta el evento pueden resultar sesgados. En algunas aplicaciones, puede ser más apropiado modelar explícitamente el mecanismo de censura. Por ejemplo, tratándolo como un riesgo competitivo.

La buena noticia es que existe una transformación de datos simple que corrige la censura de derechos basada en el tiempo. La tabla de vida proporciona una forma clara e intuitiva de ver cómo funciona esta corrección.

La mesa de la vida

Las tablas de vida son herramientas muy simples pero ilustrativas para modelar datos de tiempo hasta el evento. Si bien la metodología de predicción real es generalmente inflexible y no es adecuada, comprender la estructura de los datos en las tablas de vida sienta una buena base para enfoques más avanzados de modelización del tiempo hasta el evento.

Antes de entrar en el meollo de la cuestión de las tablas de vida, quiero ofrecer una descripción conceptual de lo que hacen. En resumen, las tablas de vida dividen el tiempo en múltiples porciones discretas para afrontar el desafío de la censura.

Piensa en una póliza de seguro de hogar única. Definitivamente podemos saber el número de reclamaciones simplemente observando el contrato hasta su vencimiento. Pero para hacerlo, tenemos que esperar hasta que finalice el contrato, lo que retrasa nuestra capacidad de aprender de los datos recientes. La tabla de vida nos permite comenzar a aprender de los datos mucho más rápidamente al dividir el tiempo en partes discretas. Podemos aprender de cada período de tiempo discreto tan pronto como finaliza. En lugar de esperar a la fecha de caducidad de una póliza de seguro de hogar, podemos empezar a aprender después del primer mes (si discretizamos tiempo a mes).

Cada fila de una tabla de vida corresponde a una unidad de tiempo discreta. Las columnas de la tabla de vida se dividen en dos categorías: (1) datos de observación y (2) cálculos a partir de los datos de observación. Las columnas de observación incluyen el número de unidades 'en riesgo' (unidades a las que podría sucederles un evento), el número de unidades a las que les ocurrió el evento y el número de unidades que fueron censuradas. Las columnas de cálculo incluyen el número de unidades ajustadas por censura, la probabilidad condicional del evento, la probabilidad incondicional del evento y la probabilidad de supervivencia.

Describir verbalmente la tabla de mortalidad no es fácil. Veamos un ejemplo para desarrollar nuestra intuición.

Ejemplo de tabla de vida – imagen del autor
Tenga en cuenta que agregué la columna adicional (problema 1 condicional) para ilustrar
Tabla con las fórmulas de Excel para ilustrar los cálculos – imagen del autor

Quiero volver a enfatizar la importancia de comprender los cálculos de la tabla de vida. Si bien las tablas de vida rara vez se utilizan para el modelado predictivo, los detalles de los cálculos son un conocimiento absolutamente fundamental cuando se utilizan técnicas más avanzadas.

Si puedes leer las fórmulas y entenderlas, ¡genial! Si no, dejé comentarios adicionales sobre cada cálculo a continuación.

Repasemos las columnas una por una.

Tiempo discreto: unidades de tiempo discretizadas secuenciales. Pueden ser días, semanas, meses, etc.

Unidades en riesgo: esta columna es la cantidad de unidades en riesgo al comienzo de cada período. Es decir, son el número de unidades que no tuvieron el evento antes del periodo de tiempo considerado.

El primer valor de 1283 es ​​una entrada; los otros valores se pueden calcular restando las unidades censuradas y el número de eventos de las unidades en riesgo del período anterior.

Censuradas: esta es la cantidad de unidades que fueron censuradas en el período de tiempo actual. Tenga en cuenta que estos cálculos suponen que fueron censurados al comienzo del período. Lo que significa que las unidades censuradas no estuvieron "en riesgo" durante el período de tiempo. Modificaciones simples a los cálculos pueden cambiar la suposición sobre el momento de la censura. La exposición al riesgo durante todo el período de tiempo y la mitad del período de tiempo son modificaciones comunes.

Probabilidad condicional: en el análisis de supervivencia en tiempo discreto, esto a menudo se denomina peligro. Es la probabilidad de que el evento ocurra en el intervalo actual dada la supervivencia hasta ese intervalo.

1-Probabilidad condicional: cálculo simple para obtener la probabilidad de supervivencia condicional.

Probabilidad de supervivencia: los productos de todas las probabilidades de supervivencia condicionales hasta el momento actual. Puedes pensar en la supervivencia como una serie de lanzamientos de moneda con diferentes probabilidades de obtener cara en cada lanzamiento. La probabilidad de supervivencia captura la probabilidad de que no salga cara n veces seguidas.

Probabilidad incondicional: este cálculo captura la probabilidad de que ocurra un evento en un período de tiempo específico no condicionado a la supervivencia hasta ese momento. Desacondiciona multiplicando la probabilidad del evento en el período de tiempo n por el producto de todas las probabilidades de supervivencia en los períodos de tiempo de 1 a n-1.

Resumiendo

El modelado de tiempo hasta el evento nos brinda las herramientas para predecir cuándo sucederá algo. Esto difiere de los enfoques de aprendizaje automático más comunes que predicen qué o cuánto.

En este artículo, discutimos tres puntos principales. (1) Discretizar el tiempo, (2) comprender la censura en los datos de tiempo transcurrido hasta el evento y (3) utilizar la tabla de vida como demostración de cómo se puede abordar la censura mediante la estructuración de datos.

En el próximo artículo, desarrollaremos estos conceptos y mostraremos cómo se traducen en técnicas prácticas de modelado predictivo.