Pronósticos de desempleo en Colombia con Google Trends
Pronósticos de desempleo en Colombia con Google Trends
Documento 468
Dirección de Estudios Económicos
19 de diciembre de 2017
Resumen
jarojasag@[Link].
1
1. Introducción
En la última década Colombia y el resto del mundo ha experimentado un fuerte
proceso de digitalización, entendido como un rápido crecimiento del acceso a Internet y
un aumento de las actividades cotidianas a través de este medio, como las actividades
económicas y transacciones de mercado entre otras cosas. Uno de los actores
importantes en este proceso de digitalización ha sido el motor de búsqueda Google, que
registra aproximadamente el 90% de las búsquedas en Internet (CHANG Y DEL RÍO,
2013). En este sentido las búsquedas que registra Google representan un buen indicador
de la actividad económica en el mundo.
2
Una vez que se estiman los modelos, se analiza el ajuste por fuera de muestra para
determinar si la inclusión de los índices de Google mejora las predicciones de desempleo.
A continuación, se expone una revisión de la aplicación de esta herramienta en otros
países, enseguida se exponen los datos y la metodología y finalmente se presentan
algunos resultados del estudio para Colombia.
2. Revisión de literatura
3
En cuanto a América Latina, también se han hecho aplicaciones de la metodología
GT. En Perú y Chile se utilizó la herramienta para mejorar las predicciones del índice de
empleo y de las dinámicas de la fuerza de trabajo (CHANG y DEL RÍO, 2013; SELAIVE y
SOTO, 2016). Ambos estudios encuentran que los índices de Google permiten
predicciones más precisas. Sin embargo, estas solo funcionan para predecir un periodo
más adelante. En Colombia se realizó la primera aplicación de esta herramienta para
pronosticar la actividad económica desagregada por los distintos sectores (MEJÍA et al.,
2013). El presente estudio representa un análisis novedoso sobre la aplicación de GT en
las predicciones del comportamiento de la economía colombiana.
3. Datos y metodología
A partir los términos de GT que son seleccionados, se estiman tres tipos de modelos:
los modelos de regresión lineal, los modelos autoregresivos integrados de media móvil
(ARIMA) y los modelos autoregresivos integrados de media móvil ampliados con variables
exógenas (ARIMAX). A continuación, se describen los datos que se utilizan para la
estimación de los modelos, el proceso de selección de términos de GT y los modelos de
pronóstico de la tasa de desempleo.
4
3.1 Datos
3.1.1 Gran Encuesta Integrada de Hogares (GEIH):
Esta encuesta realizada por el DANE recoge información mensual a nivel nacional, sobre
el mercado laboral (tamaño y estructura de la fuerza de trabajo), de la población del país,
y de las características sociodemográficas de la población colombiana. La encuesta tiene
cobertura nacional, que permite obtener resultados por zona urbana y rural, cinco grandes
regiones, por 23 departamentos, 13 grandes ciudades con sus áreas metropolitanas y 11
ciudades intermedias. A partir de esta información se construye la tasa de desempleo que
equivale al número total de desocupados-personas que están buscando trabajo (D) sobre
la población económicamente activa (PEA).
i. Se divide el volumen de búsquedas 𝑉𝑖𝑡 de una palabra clave 𝑖 para una región
específica y un periodo 𝑡 sobre el número total de búsquedas ∑𝑖 𝑉𝑖𝑡 .
𝑉𝑖𝑡
𝑣𝑖𝑡 = ∗ 100
∑𝑖 𝑉𝑖𝑡
ii. Se normaliza este índice 𝑣𝑖𝑡 , por el valor más alto para el periodo analizado, por lo
que las distintas series de GT no sean comparables entre ellas.
𝑣𝑖𝑡
𝑗𝑖𝑡 = ∗ 100
𝑣𝑖 𝑚𝑎𝑥
5
Siguiendo a CHOI y VARIAN (2009b), se analizan los índices de GT para los términos
presentados en el Cuadro 1, explorando así su relación con la evolución del desempleo
en Colombia. Por facilidad, se separaron las búsquedas en tres grupos: (i) las consultas
que pueden asociarse al proceso de búsqueda de empleo, (ii) a las empresas que
contratan gran cantidad de personal y (iii) a las herramientas asociadas a un trabajo o a
las zonas de alta actividad comercial. Inicialmente, los términos fueron incluidos según el
criterio de los investigadores y posteriormente ampliados con las sugerencias de
GtrendsR.
Cuadro 1. Términos consultados en Google Trends
i. Posiblemente relacionadas con la búsqueda de empleo
6
La información correspondiente a cada uno de estos términos fue descargada para el
periodo comprendido entre enero de 2014 y septiembre de 2017, restringiendo el dominio
de búsqueda al territorio nacional. Posteriormente, se adelantó una inspección visual de
su relación con la tasa de desempleo y se calculó su correlación simple (Ver Anexo 1).
A partir de los términos estudiados, se decidió continuar el análisis con los que
exhibieron una correlación mayor a 0,7 con la tasa de desempleo (Cuadro 2) y
adicionalmente con sus consultas asociadas, incluyendo así términos como: “Trabajo
medio tiempo”, “trabajo”, “sena empleo”, “ofertas de trabajo” y “empleo”. Para terminar de
construir la base de datos, se estandarizaron los índices de GT (para que su media fuera
cero y su desviación típica fuera 1, y se tomó su promedio para construir un indicador
general del comportamiento de las búsquedas.
Término/palabra Correlación
ahorro 0.72
bolsa de empleo 0.72
busco trabajo 0.70
clasificados 0.78
[Link] 0.72
empleo en colombia 0.77
Una vez consolidada la base de datos, se hicieron las pruebas de raíz unitaria
presentadas en el Cuadro 3. Allí se sigue el procedimiento delineado por DICKEY y
FULLER, en donde se prueban diferentes tipos de estacionariedad. En primer lugar, se
prueba estacionariedad en tendencia (Tau 3), seguido de la significancia conjunta de la
tendencia y la deriva (Phi 2) y la significancia de la tendencia (Phi 3). De rechazarse la
existencia de una raíz unitaria con Tau 3, se concluye que la serie es estacionaria, de lo
contrario se procede a validar las hipótesis de significancia en Phi 2 y Phi 3. En caso de
que la tendencia no sea significativa, se procede a evaluar la estacionariedad con deriva
(Tau 2) y la significancia de la deriva (Phi 1). Al igual que en el caso anterior, si se
rechaza la existencia de una raíz con Tau 2, se concluye que la serie es estacionaria, de
lo contrario se evalúa Phi 1 y en caso de no rechazar esta hipótesis, se revisa el resultado
de Tau 1, que prueba si la serie de interés es un paseo aleatorio. De rechazar esta última
hipótesis, se concluye que la serie es estacionaria. Si esto no es posible, es necesario
repetir este análisis con las primeras diferencias de las series originales.
7
Aplicando esta estrategia, se concluye que las variables de interés contienen una raíz
unitaria, pues las primeras diferencias presentadas en el Cuadro 4 cumplen las
condiciones de estacionariedad que no se observan en las series originales.
A partir de estos resultados se decide trabajar con las series en diferencias simples,
tal y como son presentadas en las Figuras 1 y 2. Aquí se observa que tanto la tasa de
desempleo como sus diferencias exhiben oscilaciones estacionales, hecho que será útil
en la etapa de modelación de la siguiente sección.
8
Figura 1. Tasa de Desempleo – Nivel y primeras diferencias
Así mismo, se destaca que los índices de GT (En gris) en la Figura 2 se comportan de
manera muy similar a la tasa de desempleo (En rojo), replicando tanto los movimientos de
corto plazo como patrones estacionales propios de la serie. Por lo tanto, es posible
concebir la existencia de una función que relacione los cambios en estos índices con los
cambios en la tasa de desempleo.
9
10
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.
Como se puede observar, los indicadores que guardan la relación más cercana con
los cambios en el desempleo son los correspondientes a “Ahorro”, “Empleo en Colombia”,
“Trabajo”, “Sena Empleo”, “Busco Trabajo” y el promedio, todos con una coherencia
superior a 0,4. Estos a su vez parecen anticipar el comportamiento de la tasa de
desempleo con dos meses de anterioridad, con excepción de “Ahorro”, que oscila con dos
meses de rezago.
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de desempleo mensual.
11
(incluyendo el promedio). Para esto, la siguiente sección explora estrategias de
modelación que permiten explotar las relaciones entre las variables.
3.2 Modelos
𝑦𝑡 = 𝛽0 + ∑12
𝑖=1 𝛽𝑖 𝐺𝑇𝑖𝑡 + 𝜙1 𝑦𝑡−1 + 𝜙12 𝑦𝑡−12 + 𝑒𝑡 (1)
𝑃 𝑃
𝑑 𝑑
∆ 𝑦𝑡 = ∅0 + ∑ ∅𝑖 ∆ 𝑦𝑡 + ∑ 𝜃𝑖 𝜀𝑡−𝑖 (2)
𝑖=1 𝑖=0
12
El orden de este modelo se obtiene usando el criterio de información de AKAIKE
(AIC), que considera la verosimilitud (𝐿) de las diferentes especificaciones posibles y las
pondera según el número de parámetros que involucran (𝑘), bajo la ecuación (3)
𝑃 𝑃 12
𝑑 𝑑
∆ 𝑦𝑡 = ∅0 + ∑ ∅𝑖 ∆ 𝑦𝑡 + ∑ 𝜃𝑖 𝜀𝑡−𝑖 + ∑ 𝛽 𝐺𝑇𝑖𝑡 (4)
𝑖=1 𝑖=0 𝑖=1 𝑖
Al igual que en el ARIMA de referencia, el orden del modelo y los términos a incluir se
definen usando criterios de información.
4. Pronósticos
Para adelantar los pronósticos, se estiman los modelos arriba descritos usando la
información comprendida entre enero de 2004 y diciembre de 2015, de manera que las
realizaciones registradas entre enero de 2016 y septiembre de 2017 son utilizadas para
evaluar el desempeño de cada modelo por fuera de muestra.
13
Cuadro 5. Ajuste de los modelos individuales según AIC
Regresión
ARIMAX
L_12 L_1 + L_12
14
El Cuadro 6 presenta los Errores Absolutos Medios y el Cuadro 7 la Media de la Raíz
de los Errores al Cuadrado. En ambos se concluye que los pronósticos basados en
regresiones son más precisos que los basados en ARIMAs, ya sea incluyendo o no los
términos de GT.
Al interior de cada columna es posible ver que las búsquedas que más contribuyen a
pronosticar no son las mismas que mejoran el ajuste. Por ejemplo, en el caso de la
primera columna, es claro que los términos que mejor se desempeñan fuera de muestra
son “Trabajo medio tiempo”, “Trabajo” y “Busco trabajo”. Por su parte, los términos que
mejoran el ajuste empeoran la precisión de las predicciones.
15
Cuadro 7. Error de pronóstico – Media de la Raíz de los Errores al Cuadrado.
Regresión
ARIMAX
L_12 L_1 + L_12
En el caso del ARIMAX, los pronósticos auxiliados por el término “Ofertas de trabajo”
mejoran tanto el ajuste como el pronóstico. No obstante, los errores de estos son
significativamente mayores a los obtenidos a través de las regresiones.
Finalmente, se estudia que tan diferentes son los pronósticos de todos los modelos
con respecto al que tiene los menores errores, es decir, el que predice los cambios en el
desempleo basado en el cambio un año atrás y en las búsquedas del término “Trabajo
medio tiempo” en Google. Para esto, se usa la prueba de DIABOLD y MARIANO, cuyos
resultados son presentados en el Cuadro 8. En este caso, se realizó una prueba
unilateral, que cuando se rechaza, indica que la capacidad predictiva del modelo en la
tabla es menor a la del modelo de referencia.
16
Cuadro 8. Pruebas de Diabold y Mariano (p-valor)
Regresión
ARIMAX
L_12 L_1 + L_12
Examinando estos resultados, se tiene que muy pocos modelos tienen pronósticos
similares a los del mejor modelo. Dentro de los que sí, se destaca el modelo que
pronostica el cambio en el desempleo en función del cambio que tuvo un año atrás y los
que además de incluir este rezago, incluyen los términos “Busco Trabajo” o “Trabajo”.
5. Conclusiones
17
comportamiento de la tasa de desempleo, reflejando no solo las variaciones de corto
plazo si no sus patrones estacionales.
18
Bibliografía
ASKITAS, N., & ZIMMERMANN, K. F. (2009). Google econometrics and unemployment
forecasting. Applied Economics Quarterly, 55(2), 107-120.
BAKER, S., & FRADKIN, A. (2011). What drives job search? Evidence from Google
search data. Discussion Papers, 10-020.
BERSIER, F. (2010). Towards Better Policy and Practice Using Real-Time Data, Oxford
Internet Institute, Inlaterra.
CHAMBERLIN, G. (2010). Googling the present. The Labour gazette, 4(12), 59-95.
CHANG, J., & DEL RÍO, A. (2013). Google Trends: Predicción del nivel de empleo
agregado en Perú usando datos en tiempo real, 2005-2011 (No. 2013-015).
CHEN, T., PIK KI SO, L. & KIT MING YAN, I. (2014). The 2007-2008 U.S. recession: What
did the real-time google trends data tell the United States? Contemporary Economic
Policy, 33(2), 395-403.
CHOI, H., & VARIAN, H. (2009). Predicting initial claims for unemployment
benefits. Google Inc, 1-5.
D’AMURI, F., & MARCUCCI, J. (2010). 'Google it!'Forecasting the US unemployment rate
with a Google job search index.
DELLA PENNA, N. y H. HUANG (2009). Constructing Consumer Sentiment Index for U.S.
Using Google Searches, Working Papers, 2009-26, Universidad de Alberta, Canadá.
DIEBOLD, F.X. and MARIANO, R.S. (1995) Comparing predictive accuracy. Journal of
Busines and Economic Statistics, 13, 253-263.
HAMILTON, J. D. (1994). Time series analysis (Vol. 2). Princeton: Princeton university
press.
19
MASSICOTTE P. y EDDELBUETTEL D. (2017). gtrendsR: Perform and Display Google
Trends Queries. R package version 1.4.1. [Link]
MEJÍA, L.F., MONSALVE, D., PARRA, y., PULIDO, S., & REYES, A.M. (2013).
Indicadores ISAAC: Siguiendo la actividad sectorial a partir de Google Trends. Notas
Fiscales, No.22.
SONG, H, P. BING y D. Y-L Ng (2010).Forecasting demand for hotel rooms with search
engine query volume data, School of Hotel and Tourism Management, Hong Kong y
College of Charleston, U.S.
SUHOY, T. (2009). Query Indices and a 2008 Downturn: Israeli Data,Discussion Paper ,
2009-06, Banco de Israel.
VARIAN, H. R. (2014). Big data: New tricks for econometrics. The Journal of Economic
Perspectives, 28(2), 3-27.
20
ANEXO 1.
Matriz de correlación
Niveles
almacenes empleo Almacenes
Periodo jornalero peon todero jardinero meseros exito grupo éxito
exito éxito éxito
2004-2016 - 0,11 - 0,36 - 0,40 0,23 - 0,16 - 0,70 - 0,62 0,45 - 0,15 - 0,64
2005-2016 TD - 0,06 - 0,19 - 0,33 0,24 0,07 - 0,67 - 0,66 0,37 - 0,11 - 0,62
2011-2016 - 0,12 - 0,17 - 0,12 - 0,28 0,16 - 0,42 - 0,51 0,11 0,24 - 0,29
éxito
Periodo jumbo yumbo la 14 metro alkosto colsubsidio easy olimpica carrefour
(categoria
2004-2016 - 0,42 - 0,62 - 0,64 - 0,61 - 0,43 - 0,69 - 0,45 0,13 - 0,27 0,36
2005-2016 TD - 0,42 - 0,64 - 0,65 - 0,66 - 0,21 - 0,67 - 0,26 0,04 - 0,07 0,51
2011-2016 - 0,04 - 0,56 - 0,50 - 0,57 - 0,13 - 0,57 - 0,18 - 0,20 0,13 0,59
Matriz de correlación
Niveles
servicio de servicios salon de sector compro san san
Periodo motos bicicletas cicla
vigilancia generales belleza inmobiliario moto victorino victorino
2004-2016 0,39 - 0,32 - 0,37 - 0,00 0,01 0,06 - 0,23 - 0,63 - 0,36 - 0,51
2005-2016 TD 0,40 - 0,25 - 0,27 0,07 0,25 0,21 - 0,41 - 0,59 - 0,43 - 0,55
2011-2016 0,05 - 0,21 0,05 - 0,17 0,68 0,59 - 0,40 - 0,42 - 0,47 - 0,44
21
éxito
Periodo jumbo yumbo la 14 metro alkosto colsubsidio easy olimpica carrefour
(categoria
2004-2016 - 0,42 - 0,62 - 0,64 - 0,61 - 0,43 - 0,69 - 0,45 0,13 - 0,27 0,36
2005-2016 TD - 0,42 - 0,64 - 0,65 - 0,66 - 0,21 - 0,67 - 0,26 0,04 - 0,07 0,51
2011-2016 - 0,04 - 0,56 - 0,50 - 0,57 - 0,13 - 0,57 - 0,18 - 0,20 0,13 0,59
Matriz de correlación
Niveles
temporales alianza obras
Periodo temporales coltempora subsidio Indeed convocatorias vacantes convocatoria
uno a temporales publicas
2004-2016 0,49 - 0,28 - 0,43 - 0,33 0,13 0,55 - 0,66 0,37 0,06 0,24
2005-2016 TD 0,56 - 0,13 - 0,28 - 0,24 0,13 0,42 - 0,66 0,35 0,09 0,33
2011-2016 0,59 0,56 0,08 - 0,24 0,27 0,28 - 0,39 0,51 0,51 0,28
Familias en
Periodo ecopetrol cenit equion recolecta cosecha gota a gota prestamo
acción
2004-2016 0.23 0.23 - 0.63 0.10 0.09 - 0.18 - 0.59 - 0.64
2005-2016 TD 0.28 - 0.27 - 0.61 0.29 - 0.14 - 0.44 - 0.63 - 0.61
2011-2016 0.49 - 0.51 0.12 - 0.08 - 0.26 - 0.53 - 0.60 - 0.51
22