Robé un truco de Wall Street para resolver un problema de datos de Google Trends

es una bendición para la investigación de mercado. Si desea comprender el interés en un término en particular, puede buscarlo y ver cómo cambia con el tiempo. Este es el tipo de datos con los que podríamos hacer ciencia de datos seria. O mejor dicho, lo sería si los datos fueran realmente utilizables.

En realidad, Google Trends existe únicamente para hacer lo que dice: mostrar tendencias. Los datos están normalizados y regionalizados hasta el punto en que es imposible obtener datos comparables para realizar un modelado significativo. A menos que tengamos algunos trucos bajo la manga.

En mi última publicación sobre este tema, presentamos el concepto de encadenar datos en ventanas superpuestas para sortear las limitaciones de granularidad de los datos de tendencias de Google. Hoy aprenderemos cómo comparar esos datos entre países y regiones para que pueda utilizarlos para obtener información real.

Motivación: comparando la motivación

Google Trends permite descargar y reutilizar datos de Tendencias con citas, así que descargué los datos sobre motivación durante cinco años y los escalé para que tengamos un conjunto de datos de búsquedas de motivación para cada país que nos da una idea aproximada de cómo el interés de cada país en la motivación cambia con el tiempo. Mi objetivo era comparar qué tan motivados están los diferentes países, pero tengo un problema. No sé si una puntuación de Google Trends de 100 búsquedas en los EE. UU. es mayor o menor que una puntuación de 100 en el Reino Unido, y mi primera sugerencia sobre cómo resolverlo fracasó. Déjame explicarte.

Entonces, cuando comencé este proyecto, no era un conocedor de Google Trends e ingenuamente intenté escribir la motivación del Reino Unido, luego agregué una comparación, escribí la motivación nuevamente y cambié la ubicación a los EE. UU. Es cierto que no entendía por qué era el mismo gráfico. Entonces pensé que era simplemente que el Reino Unido y los EE. UU. eran demasiado similares, así que agregué Japón y no fue hasta que llegué a China que me di cuenta de que el gráfico estaba cambiando todas las líneas para ser la motivación de ese país.

Pensé que estaba cambiando de país. Resulta que estaba recargando los mismos datos 3 veces. Captura de pantalla del autor. Fuente de datos: Google Trends ( https://www.google.com/trends)

Entonces, si no puedo colocar los países en el mismo gráfico, entonces no puedo compararlos. A menos que encuentre una manera más creativa…

Mi siguiente idea surgió al mirar los EE. UU., porque si te desplazas hacia abajo en Google Trends verás que hay una sección de subregión que muestra los estados de los EE. UU. en términos relativos. Por lo tanto, el estado con el mayor volumen de búsqueda se establece en 100 y los demás estados se escalan en consecuencia.

Resultados de búsqueda de motivación en Estados Unidos escalados relativamente por estado. Captura de pantalla del autor. Fuente de datos: Google Trends (https://www.google.com/trends)

Entonces pensé que era un genio, simplemente estableceré la región como mundial, veré los diferentes números que salen para mis países de interés y simplemente multiplicaré los resultados de ese país por ese número.

Pero resulta que había vuelto a entender mal algo fundamental. Y lo siento, pero vamos a necesitar hacer algunos cálculos para explicarlo.

Las matemáticas detrás de la normalización de Google Trends

Así que tomé noventa días de datos de EE. UU. y el Reino Unido desde el 24 de abril en dos gráficos de tendencias de Google separados, como puede ver aquí. Ambos están escalados, por lo que el máximo es 100, lo que ocurre en un día diferente para cada país.

Cuando 100 significa algo diferente a cada lado del atlántico. Captura de pantalla del autor. Fuente de datos: Google Trends (https://www.google.com/trends)
Gráfico de EE. UU. y Reino Unido que muestra interés a lo largo del tiempo en la búsqueda de motivación durante 90 días. Captura de pantalla del autor. Fuente de datos: Google Trends (https://www.google.com/trends)

El problema es que debido a que estamos analizando dos países diferentes, las puntuaciones de tendencias de Google están en unidades fundamentalmente diferentes para cada país. Así como las pulgadas y los centímetros son unidades de medida diferentes, también lo son las unidades de Google Trends de EE. UU. y las unidades de Google Trends del Reino Unido. Y a diferencia de pulgadas a centímetros, aquí no conocemos el factor de conversión.

Supongamos que en el gráfico mundial a EE. UU. se le asigna una puntuación de 100 y al Reino Unido una puntuación de 50. La puntuación de 50 del Reino Unido significa que el pico del Reino Unido es el 50% del pico de los EE. UU. A primera vista, esto podría sugerir que el factor de conversión entre estas dos unidades es la mitad, es decir, las unidades del Reino Unido son la mitad de las unidades de los EE. UU. o, equivalentemente, una unidad de los EE. UU. son 2 unidades del Reino Unido. Ahora voy a convencerte de por qué esto no es cierto.

Llevemos esto a un día que no sea un día pico. Miremos el 30 de abril y digamos hipotéticamente que su puntuación fue 70 en EE.UU. y 80 en el Reino Unido. Esto significa que la puntuación en EE.UU. ese día fue el 70% de su máximo y la puntuación en el Reino Unido ese día fue el 80% de su máximo. Veámoslo con algunas matemáticas:

70 % del pico de EE. UU. = 70 % * 100 unidades de EE. UU. = 70 % * 2 * 100 unidades del Reino Unido (basado en el factor de escala de una unidad de EE. UU. = 2 unidades del Reino Unido) = 140 unidades del Reino Unido

Ahora mirándolo desde la perspectiva del Reino Unido:

80 % del pico del Reino Unido = 80 % * 100 unidades del Reino Unido = 80 unidades del Reino Unido

Y la última vez que lo comprobé, 140 no era el doble de 80.

¡El hecho de que el pico de EE. UU. sea el doble del pico del Reino Unido no significa que durante todo el período los datos de EE. UU. sean el doble que los del Reino Unido!

Bueno, no podemos simplemente tomar las proporciones mundiales para comparar los datos de diferentes países. Entonces, ¿qué podemos hacer?

Lo que más me gusta de la ciencia de datos es que la ciencia subyacente y las metodologías que utilizamos pueden trasladarse a múltiples dominios diferentes, por lo que para este problema adoptaré un enfoque similar.

Porque aprendí mis habilidades de científico de datos antes de saber qué era un científico de datos, forjado en el caos que es el piso de operaciones de un banco de inversión. Si alguna vez ha oído hablar del término "Fondo cotizado en bolsa", eso podría darle una idea de lo que le espera, pero si no, no tema.

Inspirándose en el mercado de valores

Entonces, como probablemente sepa, el mercado de valores es un lugar para comprar y vender acciones o acciones de una empresa. Estas acciones son propiedad parcial y generalmente vienen con derechos de voto o la capacidad de recibir dividendos, como una pequeña bonificación por ser propietario de la empresa. Las acciones pueden estar en manos de personas como usted y yo o de grandes inversores como bancos y fondos de cobertura u otras empresas privadas.

El mercado de valores se puede utilizar como medida de la salud económica de un país. Cuando las acciones suben, estamos en un mercado alcista y el país es, en teoría, financieramente próspero. Cuando el mercado empieza a caer, entramos en un mercado bajista y las cosas no van tan bien. Se trata de una enorme simplificación, los mercados se mueven según el comportamiento humano, lo cual es muy difícil de entender, pero para nuestros propósitos esta generalización es válida: podemos comprender la salud económica de un país basándose en su mercado de valores.

Seguimiento del mercado a través de índices

Entonces, ¿cómo hacemos un seguimiento del mercado de valores en su conjunto? Bueno, lo obvio es tomar todas las acciones en bolsa y sumar todos sus precios para obtener una cifra general del valor del mercado de valores. Pero en realidad no es así como funciona. En realidad, utilizamos índices.

Probablemente haya oído hablar del S&P 500, un índice formado por las 500 empresas más grandes de Estados Unidos. Se utiliza para rastrear el mercado estadounidense porque, al ser las empresas más grandes, cubre alrededor del 80% de la capitalización total del mercado, eso es un valor efectivo y también son muy líquidas, lo que significa que se negocian fácilmente y sus precios se mueven mucho.

Debido a que cubren la mayor parte del mercado, es una buena representación de todo el mercado en una colección más pequeña de 500 acciones. ¿Por qué 500? Bueno, para empezar, el S&P 500 se introdujo en 1957 e iba a decir que el poder computacional disponible para calcular la capitalización de mercado de miles de acciones no existía como hoy, pero es incluso más interesante que eso porque el S&P 500 solo se creó con 500 acciones debido a un nuevo método de cálculo electrónico que permitía incluir 500 acciones en el cálculo. Antes de eso, los índices eran aún más pequeños porque se calculaban a mano.

Por qué harías estimaciones en este mundo de big data

Ahora tenemos el poder de cálculo para calcular todo el mercado si queremos, unos pocos miles de acciones son poca cosa en el mundo de big data actual, pero no es realmente necesario. Agregar empresas más pequeñas significa un aumento de los gastos generales al rastrearlas a todas y, además, es posible que algunas de ellas no se negocien con mucha frecuencia, lo que significa que la información sobre ellas se vuelve obsoleta. Las ventajas de agregarlos se ven superadas por las desventajas.

Y esta conversación surge en todas las finanzas. El Reino Unido tiene el FTSE-100, una cesta de 100 acciones. Las canastas de productos básicos se pueden utilizar para rastrear la salud de industrias específicas como el petróleo o la agricultura. Y la inflación, medida por el IPC, se compone de una canasta de bienes que rastrea los cambios de precios a lo largo del tiempo.

FTSE 100, captura de pantalla del autor.

Entonces, si se puede usar una canasta de artículos representativos para medir todo el mercado de valores o la inflación, ¿por qué no usarla para rastrear los volúmenes de búsqueda?

Aplicación de ETF a los datos de Google Trends

Entonces, si quiero usar este concepto, lo que realmente necesito es una idea de los términos más buscados que puedo usar para construir un índice similar al S&P-500 para cada país. Una de las cosas que podemos utilizar es la funcionalidad Año en búsqueda de Google Trend para obtener candidatos de la cesta a partir de términos de búsqueda populares.

Los datos diarios de Google Trends para Facebook, elaborados con mi metodología de encadenamiento. Imagen del autor.

Entonces, digamos por ahora que tengo los volúmenes de búsqueda promedio para al menos un país, digamos EE. UU. La forma de solucionar esto es promediar los factores de escala para un subconjunto de mi cesta (o toda la cesta) y tener esto como un promedio de las unidades de tendencias de Google de EE. UU. para los volúmenes de búsqueda del mundo real. Y luego puedo usar este número para tener una idea de los volúmenes absolutos de búsqueda de motivación.

Hacer que los datos de búsqueda sean realmente comparables entre países

Ahora bien, aquí hay un par de advertencias. No sé qué tan representativa es mi canasta. En realidad, estoy limitado por la cantidad de datos de tendencias de Google que puedo descargar manualmente, por lo que mi cesta era pequeña, solo nueve artículos. Además, algunos países tendrán volúmenes de búsqueda muy grandes para términos particulares que están completamente ausentes en mi cesta. Por ejemplo, tengo Facebook e Instagram en mi carrito, que son muy populares en lugares como el Reino Unido, Estados Unidos, etc. Pero en China, el equivalente sería WeChat, que no se utiliza mucho fuera del país.

No pondría a WeChat en mi cesta porque no es representativo de la gran mayoría de países del mundo. Pero es muy representativo de China.

El otro problema que tengo que resolver es que incluso si puedo comparar un país, ¿cómo puedo escalar a otros países para los cuales no tengo un punto de referencia?

Para abordar este problema, pensé en cosas que podrían influir en los volúmenes de búsqueda de un país. Una obvia es la población del país. Estados Unidos tiene cinco veces más habitantes que el Reino Unido, por lo que no sería sorprendente que Estados Unidos tuviera cinco veces el volumen de búsquedas que el Reino Unido. Pero en realidad creo que podemos hacerlo mejor.

Porque el acceso a Internet no es uniforme en toda la población. Todavía hay muchos lugares en el mundo donde la gente se encuentra sin acceso a Internet. Hay personas mayores que crecieron sin tecnología y no tienen ningún interés en aprender, niños pequeños a los que aún no les han dado una tableta o personas que, por cualquier motivo, deciden optar por no hacerlo. La demografía de estos no usuarios de Internet dependerá en gran medida del país, por lo que una cifra más precisa podría ser el porcentaje de usuarios de Internet en cada país.

De hecho, logré encontrar estos datos y combinándolos con la población podemos obtener una cifra del número absoluto de usuarios de Internet en cada país. Al tomar la proporción de usuarios de Internet en el país y en EE. UU., podemos calcular un factor de ajuste para el factor de escala de EE. UU. para cada país, lo que nos deja con un método para calcular el volumen de búsqueda absoluto de cualquier término para cualquier país.

Cuando las matemáticas se simplifican

Ahora bien, con esto en mente, tengo una advertencia más. Porque para comparar países y modelar las tendencias de motivación, lo que estamos modelando no son volúmenes absolutos de búsqueda de motivación. Si lo estuviéramos, concluiríamos que Estados Unidos está menos motivado que el Reino Unido porque busca más motivación, pero en realidad sabemos que no necesariamente están menos motivados, simplemente hay más.

Entonces, para resolver este problema necesitaría observar los volúmenes de búsqueda de motivación como una proporción del volumen de búsqueda total y ya hemos creado algo para modelar esto: nuestra canasta de términos. Entonces puedo calcular el volumen de búsqueda absoluto para todos estos términos, sumarlos para la canasta y dividir la motivación absoluta por la canasta absoluta.

Es posible que hayas notado algo aquí. Si hago eso, ¿no se cancelarán todos mis factores de escala? Y en realidad la respuesta es sí. Todos estos factores de escala anulan el hecho de que el trabajo que hemos realizado antes sea innecesario, desde cierto punto de vista.

Ajustarse a la realidad: tener en cuenta las diferencias en el acceso a Internet al estimar los volúmenes de búsqueda entre países. Imagen del autor.

Pero en realidad no es innecesario. Porque si hubiera comenzado esta publicación diciendo "sumamos la puntuación de Google Trends de la canasta y dividimos la motivación por ella", probablemente habrías pensado "¿por qué? ¿Es eso algo que realmente podemos hacer?". Hasta que hicimos este análisis, no sabíamos que podíamos hacerlo.

Esto también tiene un beneficio adicional. Era consciente de que cuando encadenamos todos los datos y escalamos todos los números, en realidad habremos acumulado muchas estimaciones y, como resultado, mucho ruido que contaminaría nuestros números. Al cancelar nuestros factores de escala, en realidad estamos eliminando gran parte de ese ruido.

Errores compuestos en acción, imagen del autor.

Entonces sí, hicimos un trabajo que no es necesario para el cálculo final. Pero lo hicimos porque nos permitió comprender el problema y tener confianza en que lo que realmente hemos encontrado es sólido. Y eso hace que valga la pena.

En Evil Works nuestro objetivo es mejorar la vida del científico de datos, mostrando proyectos del mundo real y creando herramientas para hacer mejor la ciencia de datos. Haga clic en los enlaces para obtener más información.