0% encontró este documento útil (0 votos)
5 vistas23 páginas

Pronósticos de desempleo en Colombia con Google Trends

El documento propone utilizar Google Trends para mejorar las predicciones de la tasa de desempleo en Colombia, seleccionando términos de búsqueda que muestran una fuerte correlación con dicha tasa. Se emplean modelos de regresión lineal y ARIMA para estimar el impacto de estas búsquedas en las predicciones, encontrando que términos como 'Trabajo' y 'Ofertas de trabajo' mejoran significativamente los pronósticos. Este enfoque se basa en la creciente digitalización y el acceso a Internet en Colombia, permitiendo obtener información en tiempo real sobre el mercado laboral.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
5 vistas23 páginas

Pronósticos de desempleo en Colombia con Google Trends

El documento propone utilizar Google Trends para mejorar las predicciones de la tasa de desempleo en Colombia, seleccionando términos de búsqueda que muestran una fuerte correlación con dicha tasa. Se emplean modelos de regresión lineal y ARIMA para estimar el impacto de estas búsquedas en las predicciones, encontrando que términos como 'Trabajo' y 'Ofertas de trabajo' mejoran significativamente los pronósticos. Este enfoque se basa en la creciente digitalización y el acceso a Internet en Colombia, permitiendo obtener información en tiempo real sobre el mercado laboral.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

ARCHIVOS DE ECONOMÍA

Pronósticos para la tasa de desempleo en Colombia


a partir de Google Trends

Luisa Fernanda CARDONA ROJAS


Javier Andrés ROJAS AGUILERA

Documento 468
Dirección de Estudios Económicos
19 de diciembre de 2017

La serie ARCHIVOS DE ECONOMÍA es un medio de divulgación de la Dirección de Estudios Económicos, no es un órgano


oficial del Departamento Nacional de Planeación. Sus documentos son de carácter provisional, de responsabilidad exclusiva
de sus autores y sus contenidos no comprometen a la institución.

Consultar otros Archivos de economía en:


[Link]
[Link]
Pronósticos para la tasa de desempleo en Colombia a
partir de Google Trends
Luisa Fernanda CARDONA ROJAS1
Javier Andrés ROJAS AGUILERA2

Resumen

Este trabajo propone utilizar la información de la plataforma Google Trends para


mejorar las predicciones de corto plazo para la tasa de desempleo en Colombia. Para
esto, se seleccionan los términos de búsqueda de Google Trends que más se relacionan
con la tasa de desempleo, siguiendo un criterio de correlación simple y de coherencia
media entre estas series. Una vez seleccionados los términos, se estiman modelos de
regresión lineal simple, modelos autoregresivos integrados de media móvil (ARIMA) y su
versión ampliada por variables exógenas (ARIMAX). Se encuentra que el volumen de
consultas mejora el ajuste de los modelos y en particular que las búsquedas de los
términos “Trabajo”, “Ofertas de trabajo” y “Busco trabajo” mejoran los pronósticos del
comportamiento del mercado laboral.

Palabras clave: Desempleo, Google Trends, regresiones dinámicas, ARIMA.


Clasificación JEL: E24, C22, C32, C51.

1 Departamento Nacional de Planeación - Dirección de Estudios Económicos. Correo electrónico:


luicardona24@[Link].
2 Departamento Nacional de Planeación - Dirección de Estudios Económicos. Correo electrónico:

jarojasag@[Link].

1
1. Introducción
En la última década Colombia y el resto del mundo ha experimentado un fuerte
proceso de digitalización, entendido como un rápido crecimiento del acceso a Internet y
un aumento de las actividades cotidianas a través de este medio, como las actividades
económicas y transacciones de mercado entre otras cosas. Uno de los actores
importantes en este proceso de digitalización ha sido el motor de búsqueda Google, que
registra aproximadamente el 90% de las búsquedas en Internet (CHANG Y DEL RÍO,
2013). En este sentido las búsquedas que registra Google representan un buen indicador
de la actividad económica en el mundo.

El objetivo de esta investigación es mejorar las predicciones de la tasa de desempleo


en Colombia con la información de las búsquedas de Google. Para lo anterior se utilizan
los índices de búsqueda de la herramienta Google Trends (GT), que es una plataforma
que compila y organiza la información del número de búsquedas de cualquier término en
determinado lugar y periodo de tiempo.

Resulta importante utilizar los datos de GT en los pronósticos de desempleo


principalmente por dos razones: En primer lugar, los índices de Google representan
información en tiempo real, a diferencia de los datos oficiales de mercado laboral (Gran
Encuesta Integrada de Hogares-GEIH) que se observan con un mes de rezago. En
segundo lugar, esta herramienta es apropiada para estimar el comportamiento de la tasa
de desempleo en Colombia, dado que la penetración del Internet en el país ha aumentado
durante la última década, alcanzando una tasa de 55,9% en 2015 (Banco Mundial, 2015).

A partir de los índices de GT y la serie de la tasa de desempleo que reporta la GEIH


se construyen distintos modelos que permiten predecir la tasa de desempleo en
Colombia, los cuales constan de dos pasos. Primero, se determinan los índices de Google
que se van a incluir en el modelo. Es decir, se seleccionan las palabras que más se
relacionan con la búsqueda de empleo por Internet. Se utilizan dos criterios de selección:
por un lado, se eligen aquellos términos de Google que exhiben una fuerte correlación con
la tasa de desempleo, siguiendo la metodología de CHOI & VARIAN (2009) y CHANG &
DEL RÍO (2013). Por otro lado, se seleccionan términos que muestran una coherencia alta
con la tasa de desempleo, es decir aquellos que exhiben un patrón de oscilación similar
con la serie de desempleo.

En segundo lugar, se construyen los modelos de predicción de la tasa de desempleo


utilizando los términos preseleccionados de Google. En particular se emplearon tres tipos
de modelos. Por un lado, se estiman modelos de regresión lineal, por otro lado, los
modelos autoregresivos integrados de media móvil (ARIMA) y finalmente los modelos
autoregresivos integrados de media móvil ampliados con variables exógenas (ARIMAX).

2
Una vez que se estiman los modelos, se analiza el ajuste por fuera de muestra para
determinar si la inclusión de los índices de Google mejora las predicciones de desempleo.
A continuación, se expone una revisión de la aplicación de esta herramienta en otros
países, enseguida se exponen los datos y la metodología y finalmente se presentan
algunos resultados del estudio para Colombia.

2. Revisión de literatura

Las primeras aplicaciones de la herramienta GT en el análisis económico fueron


propuestas por CHOI Y VARIAN (2009a). Los autores exponen que las consultas en
Google pueden estar correlacionadas con el nivel actual de actividad económica en
ciertas industrias. Con un modelo autoregresivo los autores realizan predicciones del
mercado automotriz, el mercado inmobiliario y la realización de viajes (turismo) en
Estados Unidos. Los autores concluyen que a partir del modelo AR y controlando por
efectos fijos de tiempo, la predicción de las tendencias de la economía mejora con la
inclusión de los índices de Google. Adicionalmente proponen que esta información puede
ser útil al momento de buscar puntos de giro en la actividad económica.

A partir de este estudio surgieron nuevas investigaciones y aplicaciones de esta


metodología en otros países. CARRIÉRE-SWALLOW y LABBÉ (2013) encuentran que, al
incluir los índices de Google las predicciones sobre los comportamientos de los
consumidores en el sector automotriz son más precisas. SONG et al. (2010),
CHAMBERLIN (2010), DELLA PENNA y HUANG (2009) y SCHMIDT y VOSEN (2009)
también emplean los datos de Google para predecir el comportamiento de los
consumidores en Estados Unidos. Estos encuentran que la inclusión de esta información
mejora la bondad de ajuste de los modelos.

Con respecto a la predicción de puntos de giro en la economía, también se ha


empleado la información de GT. CHEN et al. (2014) utilizan dicha información para
identificar en tiempo real puntos de giro del ciclo económico en Estados Unidos. Los
autores utilizan las consultas para capturar el malestar público en la economía, el
mercado crediticio y en el mercado laboral. Por su parte, ASKITAS y ZIMMERMANN
(2009) estiman puntos de giro en el comportamiento de variables económicas usando las
búsquedas de Google en Alemania.

Ahora bien, en cuanto al mercado laboral también se ha empleado la información de


los índices de búsqueda de Google. SUHOY (2009), CHOI y VARIAN (2009b), ASKITAS y
ZIMMERMANN (2009), D’AMURI y MARCUCCI (2009) y BERSIER (2010) encuentran
mejoras en las predicciones de la demanda de trabajo, de desempleo y de seguros de
desempleo en Israel, Estados Unidos y Alemania. Estos modelos reflejan el
comportamiento de los agentes que demandan y ofrecen empleo por Internet. Cabe
resaltar que un trabajo similar para Ucrania encontró que la información proporcionada
por Google no mejoraba la predicción de desempleo (OLEKSANDR, 2010).

3
En cuanto a América Latina, también se han hecho aplicaciones de la metodología
GT. En Perú y Chile se utilizó la herramienta para mejorar las predicciones del índice de
empleo y de las dinámicas de la fuerza de trabajo (CHANG y DEL RÍO, 2013; SELAIVE y
SOTO, 2016). Ambos estudios encuentran que los índices de Google permiten
predicciones más precisas. Sin embargo, estas solo funcionan para predecir un periodo
más adelante. En Colombia se realizó la primera aplicación de esta herramienta para
pronosticar la actividad económica desagregada por los distintos sectores (MEJÍA et al.,
2013). El presente estudio representa un análisis novedoso sobre la aplicación de GT en
las predicciones del comportamiento de la economía colombiana.

Finalmente, se han realizado estudios que proponen distintos métodos para


aproximarse al Big Data (datos a gran escala), como los datos de GT. Por ejemplo,
VARIAN (2014) propone una serie de herramientas para manipular y analizar el Big Data,
relacionadas con la minería de datos.

3. Datos y metodología

Con el objetivo de construir modelos para predecir la tasa de desempleo en Colombia


a partir de la información de GT se realiza un procedimiento que consta de dos
momentos. En un primer momento se seleccionan los índices de GT que más se
relacionan con la búsqueda de empleo en Colombia y en un segundo momento se utiliza
esta información junto con la serie de la tasa de desempleo para construir los modelos de
pronóstico.

Para seleccionar los términos de GT que mejor predigan la tasa de desempleo, se


utilizan dos criterios. El primero, consiste en escoger aquellos que tengan una correlación
simple mayor a 0,7 con la tasa de desempleo entre 2004 y 2015. El segundo, consiste en
seleccionar aquellos términos que tengan una coherencia media3 mayor a 0,4 con la tasa
de desempleo, entendiendo como coherencia el grado en que dos series son
influenciadas por ciclos de una determinada frecuencia (HAMILTON, 1994). Se utilizan
estos dos criterios teniendo en cuenta que los términos de GT pueden reflejar la tendencia
y el ciclo de la tasa de desempleo.

A partir los términos de GT que son seleccionados, se estiman tres tipos de modelos:
los modelos de regresión lineal, los modelos autoregresivos integrados de media móvil
(ARIMA) y los modelos autoregresivos integrados de media móvil ampliados con variables
exógenas (ARIMAX). A continuación, se describen los datos que se utilizan para la
estimación de los modelos, el proceso de selección de términos de GT y los modelos de
pronóstico de la tasa de desempleo.

3 Tomando el promedio sobre las frecuencias superiores a la mensual.

4
3.1 Datos
3.1.1 Gran Encuesta Integrada de Hogares (GEIH):

Esta encuesta realizada por el DANE recoge información mensual a nivel nacional, sobre
el mercado laboral (tamaño y estructura de la fuerza de trabajo), de la población del país,
y de las características sociodemográficas de la población colombiana. La encuesta tiene
cobertura nacional, que permite obtener resultados por zona urbana y rural, cinco grandes
regiones, por 23 departamentos, 13 grandes ciudades con sus áreas metropolitanas y 11
ciudades intermedias. A partir de esta información se construye la tasa de desempleo que
equivale al número total de desocupados-personas que están buscando trabajo (D) sobre
la población económicamente activa (PEA).

Para el estudio se utiliza la tasa de desempleo mensual durante el periodo (2004-2016), la


cual se observa con un mes de rezago.

3.1.2 Google Trends (GT):

GT es la plataforma de Google que reporta los índices de búsqueda de cualquier palabra


en el explorador. Esta información se encuentra disponible en tiempo real para diferentes
frecuencias, aunque en este documento se utiliza su versión mensual. Los datos están
disponibles a nivel nacional, departamental y para grandes ciudades gratuitamente4. Para
este ejercicio se utilizó el paquete GtrendsR escrito por MASSICOTTE y EDDELBUETTEL
(2017) para R, que permite consultar de manera simultánea varios términos en GT, al
tiempo que sugiere búsquedas relacionadas.

Los índices se construyen en dos pasos:

i. Se divide el volumen de búsquedas 𝑉𝑖𝑡 de una palabra clave 𝑖 para una región
específica y un periodo 𝑡 sobre el número total de búsquedas ∑𝑖 𝑉𝑖𝑡 .

𝑉𝑖𝑡
𝑣𝑖𝑡 = ∗ 100
∑𝑖 𝑉𝑖𝑡

Lo anterior para aislar el efecto del crecimiento de usuarios en Internet.

ii. Se normaliza este índice 𝑣𝑖𝑡 , por el valor más alto para el periodo analizado, por lo
que las distintas series de GT no sean comparables entre ellas.
𝑣𝑖𝑡
𝑗𝑖𝑡 = ∗ 100
𝑣𝑖 𝑚𝑎𝑥

4 Los datos se pueden descargar en el siguiente enlace: [Link]

5
Siguiendo a CHOI y VARIAN (2009b), se analizan los índices de GT para los términos
presentados en el Cuadro 1, explorando así su relación con la evolución del desempleo
en Colombia. Por facilidad, se separaron las búsquedas en tres grupos: (i) las consultas
que pueden asociarse al proceso de búsqueda de empleo, (ii) a las empresas que
contratan gran cantidad de personal y (iii) a las herramientas asociadas a un trabajo o a
las zonas de alta actividad comercial. Inicialmente, los términos fueron incluidos según el
criterio de los investigadores y posteriormente ampliados con las sugerencias de
GtrendsR.
Cuadro 1. Términos consultados en Google Trends
i. Posiblemente relacionadas con la búsqueda de empleo

alianza temporales ofertas trabajo


bolsa de empleo oportunidades laborales
bolsa trabajo prestamo
Busco trabajo Sena empleo
clasificados servicio de empleo
coltempora subsidio
computrabajo temporales
convocatoria temporales uno a
convocatorias trabajando
[Link] trabajando Colombia
empleo Trabajo
empleos públicos trabajo
Familias en acción trabajo medio tiempo
hoja de vida Trabajo medio tiempo
Indeed vacantes
Ofertas de trabajo

ii. Sectores y empresas que contribuyen en gran medida a la


contratación de personal en Colombia
4G falabella
alkosto gota a gota
ALO jumbo
aseador la 14
Carrefour metro
cenit metro bogota
colsubsidio obras publicas
construcción olímpica
cosecha recolecta
easy servicio de aseo
ecopetrol servicio de vigilancia
equion transmilenio
éxito yumbo

iii. Herramientas de trabajo y con lugares geográficos de gran


actividad comercial
bicicletas compro moto
bogota motos
cicla san victorino
Fuente: cálculos propios a partir de los índices de Google Trends.

6
La información correspondiente a cada uno de estos términos fue descargada para el
periodo comprendido entre enero de 2014 y septiembre de 2017, restringiendo el dominio
de búsqueda al territorio nacional. Posteriormente, se adelantó una inspección visual de
su relación con la tasa de desempleo y se calculó su correlación simple (Ver Anexo 1).

A partir de los términos estudiados, se decidió continuar el análisis con los que
exhibieron una correlación mayor a 0,7 con la tasa de desempleo (Cuadro 2) y
adicionalmente con sus consultas asociadas, incluyendo así términos como: “Trabajo
medio tiempo”, “trabajo”, “sena empleo”, “ofertas de trabajo” y “empleo”. Para terminar de
construir la base de datos, se estandarizaron los índices de GT (para que su media fuera
cero y su desviación típica fuera 1, y se tomó su promedio para construir un indicador
general del comportamiento de las búsquedas.

Cuadro 2. Mayores coeficientes de correlación entre los índices GT y la tasa de desempleo

Término/palabra Correlación
ahorro 0.72
bolsa de empleo 0.72
busco trabajo 0.70
clasificados 0.78
[Link] 0.72
empleo en colombia 0.77

Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de


desempleo mensual.

Una vez consolidada la base de datos, se hicieron las pruebas de raíz unitaria
presentadas en el Cuadro 3. Allí se sigue el procedimiento delineado por DICKEY y
FULLER, en donde se prueban diferentes tipos de estacionariedad. En primer lugar, se
prueba estacionariedad en tendencia (Tau 3), seguido de la significancia conjunta de la
tendencia y la deriva (Phi 2) y la significancia de la tendencia (Phi 3). De rechazarse la
existencia de una raíz unitaria con Tau 3, se concluye que la serie es estacionaria, de lo
contrario se procede a validar las hipótesis de significancia en Phi 2 y Phi 3. En caso de
que la tendencia no sea significativa, se procede a evaluar la estacionariedad con deriva
(Tau 2) y la significancia de la deriva (Phi 1). Al igual que en el caso anterior, si se
rechaza la existencia de una raíz con Tau 2, se concluye que la serie es estacionaria, de
lo contrario se evalúa Phi 1 y en caso de no rechazar esta hipótesis, se revisa el resultado
de Tau 1, que prueba si la serie de interés es un paseo aleatorio. De rechazar esta última
hipótesis, se concluye que la serie es estacionaria. Si esto no es posible, es necesario
repetir este análisis con las primeras diferencias de las series originales.

7
Aplicando esta estrategia, se concluye que las variables de interés contienen una raíz
unitaria, pues las primeras diferencias presentadas en el Cuadro 4 cumplen las
condiciones de estacionariedad que no se observan en las series originales.

Cuadro 3. Pruebas de Dickey-Fuller – Series en Niveles

tau3 phi2 phi3 tau2 phi1 tau1


Ahorro -2.12 2.03 3.00 -1.64 1.39 -1.60
Bolsa de empleo -1.64 1.27 1.48 -0.48 0.53 -0.51
Busco trabajo -1.95 1.45 1.99 -1.87 1.94 -1.90
Clasificados -2.54 3.26 4.15 -0.17 0.72 -0.43
Desempleo -2.15 2.13 2.48 -1.41 1.70 -1.34
[Link] -2.15 1.63 2.35 -1.72 1.56 -1.76
Empleo -1.37 0.88 1.10 -1.33 1.09 -1.38
Empleo en colombia -3.23 4.88 6.07 -2.70 4.86 -1.96
Ofertas de trabajo -0.87 1.09 1.35 -1.54 1.47 -1.48
Sena empleo -2.38 2.62 3.85 -2.52 3.24 -2.43
Trabajo -1.43 2.36 3.54 -1.54 1.18 -1.50
Trabajo medio tiempo -3.44 15.58 13.55 1.70 6.29 0.88
Promedio -2.19 1.77 2.65 -1.39 0.97 -1.40

Valor crítico 5% -3.43 4.75 6.49 -2.88 4.63 -1.95


Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

Cuadro 4. Pruebas de Dickey-Fuller – Series en Diferencias

tau3 phi2 phi3 tau2 phi1 tau1


Ahorro -2.79 2.67 3.99 -2.70 3.66 -2.70
Bolsa de empleo -3.80 4.80 7.20 -3.76 7.07 -3.72
Busco trabajo -7.02 16.44 24.64 -7.00 24.49 -7.00
Clasificados -3.38 4.00 5.88 -3.16 5.12 -2.95
Desempleo -2.90 2.88 4.24 -2.89 4.27 -2.82
[Link] -2.87 2.75 4.12 -2.84 4.02 -2.83
Empleo -4.03 5.49 8.22 -3.99 7.97 -3.96
Empleo en colombia -3.66 4.53 6.74 -3.50 6.17 -2.82
Ofertas de trabajo -11.66 45.39 68.08 -11.52 66.33 -5.57
Sena empleo -3.74 4.67 7.01 -3.12 4.87 -3.11
Trabajo -5.18 8.94 13.40 -4.65 10.81 -4.67
Trabajo medio tiempo -4.18 5.84 8.75 -3.66 6.71 -3.09
Promedio -4.31 6.21 9.31 -3.55 6.30 -3.56

Valor crítico 5% -3.43 4.75 6.49 -2.88 4.63 -1.95


Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

A partir de estos resultados se decide trabajar con las series en diferencias simples,
tal y como son presentadas en las Figuras 1 y 2. Aquí se observa que tanto la tasa de
desempleo como sus diferencias exhiben oscilaciones estacionales, hecho que será útil
en la etapa de modelación de la siguiente sección.

8
Figura 1. Tasa de Desempleo – Nivel y primeras diferencias

Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de


desempleo mensual.

Así mismo, se destaca que los índices de GT (En gris) en la Figura 2 se comportan de
manera muy similar a la tasa de desempleo (En rojo), replicando tanto los movimientos de
corto plazo como patrones estacionales propios de la serie. Por lo tanto, es posible
concebir la existencia de una función que relacione los cambios en estos índices con los
cambios en la tasa de desempleo.

Figura 2. Índices de Google Trends en diferencias vs tasa de desempleo en diferencias

9
10
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

Para verificar las conclusiones de esta inspección visual, se evaluó la coherencia


media existente entre los indicadores de GT y la tasa de desempleo (Ver Figura 3). A
grandes rasgos, una coherencia alta implica que estos términos y la serie de desempleo
exhiben patrones similares de oscilación, por lo que podrían usarse para explicar la tasa
de desempleo. Así mismo, se estudia el adelanto o rezago con el que estos índices
reflejan el comportamiento del mercado laboral, usando su desplazamiento medio en fase.

Como se puede observar, los indicadores que guardan la relación más cercana con
los cambios en el desempleo son los correspondientes a “Ahorro”, “Empleo en Colombia”,
“Trabajo”, “Sena Empleo”, “Busco Trabajo” y el promedio, todos con una coherencia
superior a 0,4. Estos a su vez parecen anticipar el comportamiento de la tasa de
desempleo con dos meses de anterioridad, con excepción de “Ahorro”, que oscila con dos
meses de rezago.

Figura 3. Coherencia y Fase entre GT y la tasa de desempleo

Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de desempleo mensual.

Teniendo en cuenta estos resultados, es de interés construir una relación paramétrica


entre la tasa de desempleo y los 12 términos de GT que fueron presentados arriba

11
(incluyendo el promedio). Para esto, la siguiente sección explora estrategias de
modelación que permiten explotar las relaciones entre las variables.

3.2 Modelos

A partir los 12 términos de GT que se escogieron, se presentan tres tipos de modelos:


los modelos de regresión lineal, los modelos Autoregresivos Integrados de Media Móvil
(ARIMA por sus siglas en inglés) y los modelos Autoregresivos Integrados de Media Móvil
con variables exógenas (ARIMAX). A continuación, se describe brevemente la estructura
de estos modelos.

3.2.1 Modelos de regresión lineal

Los modelos que se estiman toman la siguiente forma funcional:

𝑦𝑡 = 𝛽0 + ∑12
𝑖=1 𝛽𝑖 𝐺𝑇𝑖𝑡 + 𝜙1 𝑦𝑡−1 + 𝜙12 𝑦𝑡−12 + 𝑒𝑡 (1)

donde 𝑦𝑡 es la tasa de desempleo mensual en el periodo t, que se asume estacionaria,


𝐺𝑇𝑖𝑡 es el 𝑖-esimo índice de GT en el periodo 𝑡 y 𝑒𝑡 es el error en el periodo t. La
estimación de estas ecuaciones se hace a través de una regresión lineal, en donde los GT
a incluir, se seleccionan con el algoritmo de búsqueda desarrollado por SESTELO et al.
(2016). A grandes rasgos, este algoritmo toma la base de datos e intercambia covariables
(una a la vez, mientras mantiene las otras fijas) de manera repetida, hasta que ninguna
variable se puede intercambiar sin desmejorar el ajuste del modelo. Al tiempo, este
algoritmo determina (por medio de pruebas estadísticas) el número ideal de variables a
incluir para explicar de la mejor manera posible la variable dependiente.

Una vez seleccionado un modelo, se adelanta su estimación y sus correspondientes


pruebas de bondad de ajuste.

3.2.2 Modelos autoregresivos integrados de media móvil (ARIMA)

Se parte de un ARIMA en donde la tasa de desempleo es modelada en función de sus


rezagos y un proceso de ruido blanco {𝜀𝑡 }𝑇𝑡=1 , bajo la estructura presentada en (2)

𝑃 𝑃
𝑑 𝑑
∆ 𝑦𝑡 = ∅0 + ∑ ∅𝑖 ∆ 𝑦𝑡 + ∑ 𝜃𝑖 𝜀𝑡−𝑖 (2)
𝑖=1 𝑖=0

donde 𝑑 corresponde al orden de integración de la tasa de desempleo, ∅1 , . . . . , ∅𝑝 a los


ponderadores del polinomio sobre los rezagos de 𝑦𝑡 y 𝜃1 , . . . . , 𝜃𝑝 a los coeficientes
correspondientes al polinomio sobre las innovaciones del proceso, es decir {𝜀𝑡 }𝑇𝑡=1 .

12
El orden de este modelo se obtiene usando el criterio de información de AKAIKE
(AIC), que considera la verosimilitud (𝐿) de las diferentes especificaciones posibles y las
pondera según el número de parámetros que involucran (𝑘), bajo la ecuación (3)

𝐴𝐼𝐶 = 2𝑘 − 2 ln(𝐿) (3)

El mejor modelo relativamente es el que tenga un menor AIC.

3.2.3 Modelos autoregresivos integrados de media móvil


aumentados con variables exógenas (ARIMAX)

Una vez establecido un modelo ARIMA de referencia, se procede a aumentar el


modelo con términos exógenos como los de GT. La estructura viene dada por (4)

𝑃 𝑃 12
𝑑 𝑑
∆ 𝑦𝑡 = ∅0 + ∑ ∅𝑖 ∆ 𝑦𝑡 + ∑ 𝜃𝑖 𝜀𝑡−𝑖 + ∑ 𝛽 𝐺𝑇𝑖𝑡 (4)
𝑖=1 𝑖=0 𝑖=1 𝑖

y puede ser interpretada desde la literatura de las regresiones dinámicas.

Al igual que en el ARIMA de referencia, el orden del modelo y los términos a incluir se
definen usando criterios de información.

4. Pronósticos

Para adelantar los pronósticos, se estiman los modelos arriba descritos usando la
información comprendida entre enero de 2004 y diciembre de 2015, de manera que las
realizaciones registradas entre enero de 2016 y septiembre de 2017 son utilizadas para
evaluar el desempeño de cada modelo por fuera de muestra.

Las predicciones se adelantan en un contexto real, es decir, el modelo estimado es


iterado con la información que tendría disponible en ese momento, por lo que todos los
pronósticos son a un periodo. La evaluación de estos se hace a través de su Error
Absoluto Medio y la Media de la Raíz de los Errores al Cuadrado. Finalmente, su precisión
es comparada utilizando la prueba de DIABOLD y MARIANO (1995).

13
Cuadro 5. Ajuste de los modelos individuales según AIC

Regresión
ARIMAX
L_12 L_1 + L_12

281.99 282.64 371.00

Ahorro 270.64 264.66 277.98


Bolsa de empleo 260.54 262.35 275.67
Busco trabajo 283.79 284.49 295.38
Clasificados 267.09 269.07 278.34
[Link] 275.15 276.68 295.58
Empleo 261.88 263.61 275.17
Empleo en colombia 279.97 281.15 295.59
Ofertas de trabajo 273.95 275.67 269.08
Sena empleo 274.01 275.11 295.27
Trabajo 283.78 284.64 293.52
Trabajo medio tiempo 282.53 282.64 294.06
Promedio 267.79 268.48 275.97
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

En este orden de ideas, el Cuadro 5 presenta el ajuste de los modelos individuales


según su AIC. Es importante notar que las columnas contienen la estructura base y las
filas los términos que las complementan. Observando estas cifras, es fácil ver que los
modelos con el mejor ajuste vienen dados por una regresión que modela el cambio en la
tasa de desempleo en función de su realización un año atrás. En segundo lugar, se
encuentran las regresiones que modelan el cambio en la tasa de desempleo en función de
su valor el mes anterior y un año atrás. En ambos casos, es notoria la mejoría en el ajuste
tras la inclusión de los términos “Bolsa de Empleo” y “Empleo”, siendo estas las casillas
con los valores más pequeños para el indicador de calidad de ajuste.

Al emplear el algoritmo de SESTELO et al. (2016) para encontrar la mejor


combinación de términos, se llega a que la mejor especificación viene dada por la
regresión que explica los cambios en el desempleo en función de los cambios un año
atrás y que incluye a la vez las consultas de la palabra “Empleo” en Google.

Por su parte, la tercera columna presenta los ajustes correspondientes al ARIMA


(primera fila) y los ARIMAX. Estos no tienen un ajuste tan bueno como los anteriores y en
contraste con las regresiones, el término con el mejor aporte es “Ofertas de Trabajo”.
Estas diferencias vienen dadas por un mayor número de parámetros en la estructura
(Siendo la especificación base más común un SARIMA(0,1,1)x(2,0,0)[12]) y al aporte
dinámico de los GT. Al intentar incluir un segundo término, se llega que el mejor ARIMAX
incluye la pareja de términos “Ofertas de Trabajo” y “Empleo”, con un AIC de 276.51, valor
que no disminuye al cambiar los términos o incorporar términos adicionales, por lo que se
descartan otras combinaciones.

14
El Cuadro 6 presenta los Errores Absolutos Medios y el Cuadro 7 la Media de la Raíz
de los Errores al Cuadrado. En ambos se concluye que los pronósticos basados en
regresiones son más precisos que los basados en ARIMAs, ya sea incluyendo o no los
términos de GT.

Al interior de cada columna es posible ver que las búsquedas que más contribuyen a
pronosticar no son las mismas que mejoran el ajuste. Por ejemplo, en el caso de la
primera columna, es claro que los términos que mejor se desempeñan fuera de muestra
son “Trabajo medio tiempo”, “Trabajo” y “Busco trabajo”. Por su parte, los términos que
mejoran el ajuste empeoran la precisión de las predicciones.

Cuadro 6. Error de pronóstico – Error Absoluto Medio


Regresión
ARIMAX
L_12 L_1 + L_12

0.22 0.29 0.39

Ahorro 0.36 0.55 0.43


Bolsa de empleo 0.31 0.33 0.57
Busco trabajo 0.22 0.29 0.51
Clasificados 0.32 0.33 0.44
[Link] 0.34 0.37 0.61
Empleo 0.28 0.30 0.56
Empleo en colombia 0.27 0.32 0.61
Ofertas de trabajo 0.27 0.30 0.45
Sena empleo 0.26 0.32 0.61
Trabajo 0.22 0.29 0.60
Trabajo medio tiempo 0.21 0.28 0.64
Promedio 0.31 0.37 0.59
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

15
Cuadro 7. Error de pronóstico – Media de la Raíz de los Errores al Cuadrado.

Regresión
ARIMAX
L_12 L_1 + L_12

0.29 0.38 0.34

Ahorro 0.47 0.72 0.54


Bolsa de empleo 0.36 0.38 0.68
Busco trabajo 0.29 0.38 0.65
Clasificados 0.40 0.41 0.55
[Link] 0.44 0.49 0.77
Empleo 0.36 0.38 0.69
Empleo en colombia 0.34 0.41 0.77
Ofertas de trabajo 0.32 0.35 0.54
Sena empleo 0.30 0.36 0.77
Trabajo 0.29 0.39 0.75
Trabajo medio tiempo 0.24 0.34 0.84
Promedio 0.38 0.44 0.70
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

En el caso del ARIMAX, los pronósticos auxiliados por el término “Ofertas de trabajo”
mejoran tanto el ajuste como el pronóstico. No obstante, los errores de estos son
significativamente mayores a los obtenidos a través de las regresiones.

Finalmente, se estudia que tan diferentes son los pronósticos de todos los modelos
con respecto al que tiene los menores errores, es decir, el que predice los cambios en el
desempleo basado en el cambio un año atrás y en las búsquedas del término “Trabajo
medio tiempo” en Google. Para esto, se usa la prueba de DIABOLD y MARIANO, cuyos
resultados son presentados en el Cuadro 8. En este caso, se realizó una prueba
unilateral, que cuando se rechaza, indica que la capacidad predictiva del modelo en la
tabla es menor a la del modelo de referencia.

16
Cuadro 8. Pruebas de Diabold y Mariano (p-valor)

Regresión
ARIMAX
L_12 L_1 + L_12

16.16% 4.51% 0.00%

Ahorro 0.94% 0.56% 2.23%


Bolsa de empleo 0.07% 0.11% 0.24%
Busco trabajo 15.34% 3.84% 1.00%
Clasificados 0.74% 0.72% 1.34%
Computrabajo 0.02% 0.02% 0.09%
[Link] 2.43% 2.01% 0.33%
Empleo 2.81% 1.33% 0.11%
Empleo en colombia 4.12% 2.25% 0.32%
Ofertas de trabajo 0.30% 0.24% 0.86%
Sena empleo 1.09% 0.08% 0.32%
Trabajo 19.87% 4.25% 0.40%
Trabajo medio tiempo - 0.09% 1.25%
Promedio 0.20% 0.04% 0.08%
Fuente: cálculos propios a partir de los índices de Google Trends y la tasa de
desempleo mensual.

Examinando estos resultados, se tiene que muy pocos modelos tienen pronósticos
similares a los del mejor modelo. Dentro de los que sí, se destaca el modelo que
pronostica el cambio en el desempleo en función del cambio que tuvo un año atrás y los
que además de incluir este rezago, incluyen los términos “Busco Trabajo” o “Trabajo”.

En este orden de ideas, a niveles de significancia estándar, los pronósticos


destacados son estadísticamente iguales, por lo que sus contribuciones sobre los hechos
con base en el rezago estacional no parecen sobresalir. No obstante, es claro con base
en los resultados descriptivos de la tercera sección que existen fuertes coincidencias
entre estas series, por lo que su comportamiento puede ser útil para la explicación de las
dinámicas en el corto plazo. Teniendo esto en cuenta, los cálculos de estos modelos
podrían ser útiles para la construcción de pronósticos combinados, capaces de predecir
más fácilmente variaciones de corto plazo en los cambios de la tasa de desempleo.

5. Conclusiones

El presente documento estudia las relaciones existentes entre la tasa de desempleo y


la serie de consultas en Google para un conjunto de términos, esto con el propósito de
encontrar formas funcionales que permitan hacer pronósticos sobre el comportamiento del
mercado laboral. Para hacer esto, se estudian las propiedades de las series de tiempo
conformadas por estas consultas y su relación con los cambios en la tasa de desempleo.
Con base en esto, se encuentra que los índices de Google Trends siguen muy de cerca el

17
comportamiento de la tasa de desempleo, reflejando no solo las variaciones de corto
plazo si no sus patrones estacionales.

Para modelar esta relación se hizo uso de un conjunto de regresiones dinámicas y


modelos ARIMAX, en donde se concluyó que varios de los términos considerados
mejoran el ajuste de los modelos. Así mismo, se adelantaron pronósticos para la tasa de
desempleo, que, aunque a niveles estándar de significancia no mejoran los pronósticos
basados en una regresión estacional, pueden ser capaces de aportar información sobre la
dinámica de corto plazo de la tasa de desempleo.

18
Bibliografía
ASKITAS, N., & ZIMMERMANN, K. F. (2009). Google econometrics and unemployment
forecasting. Applied Economics Quarterly, 55(2), 107-120.

BAKER, S., & FRADKIN, A. (2011). What drives job search? Evidence from Google
search data. Discussion Papers, 10-020.

BERSIER, F. (2010). Towards Better Policy and Practice Using Real-Time Data, Oxford
Internet Institute, Inlaterra.

CARRIÈRE‐SWALLOW, Y., & LABBÉ, F. (2013). Nowcasting with Google Trends in an


emerging market. Journal of Forecasting, 32(4), 289-298.

CHAMBERLIN, G. (2010). Googling the present. The Labour gazette, 4(12), 59-95.

CHANG, J., & DEL RÍO, A. (2013). Google Trends: Predicción del nivel de empleo
agregado en Perú usando datos en tiempo real, 2005-2011 (No. 2013-015).

CHEN, T., PIK KI SO, L. & KIT MING YAN, I. (2014). The 2007-2008 U.S. recession: What
did the real-time google trends data tell the United States? Contemporary Economic
Policy, 33(2), 395-403.

CHOI, H., & VARIAN, H. (2009). Predicting initial claims for unemployment
benefits. Google Inc, 1-5.

D’AMURI, F., & MARCUCCI, J. (2010). 'Google it!'Forecasting the US unemployment rate
with a Google job search index.

DELLA PENNA, N. y H. HUANG (2009). Constructing Consumer Sentiment Index for U.S.
Using Google Searches, Working Papers, 2009-26, Universidad de Alberta, Canadá.

DIEBOLD, F.X. and MARIANO, R.S. (1995) Comparing predictive accuracy. Journal of
Busines and Economic Statistics, 13, 253-263.

HAMILTON, J. D. (1994). Time series analysis (Vol. 2). Princeton: Princeton university
press.

19
MASSICOTTE P. y EDDELBUETTEL D. (2017). gtrendsR: Perform and Display Google
Trends Queries. R package version 1.4.1. [Link]

MEJÍA, L.F., MONSALVE, D., PARRA, y., PULIDO, S., & REYES, A.M. (2013).
Indicadores ISAAC: Siguiendo la actividad sectorial a partir de Google Trends. Notas
Fiscales, No.22.

KOOP, G., & ONORANTE, L. (2013). Macroeconomic nowcasting using Google


probabilities. University of Strathclyde.

OLEKSANDR, B.(2010). Can Google’s search engine be used to forecast unemployment


in Ukraine?, Kyiv School of Economics, Ucrania.

SCHMIDT, T. y S. VOSEN (2009). Forecasting Private Consumption: Survey-based


Indicators vs. Google Trends, Ruhr Economic Papers, 2009-155, Alemania.

SELAIVE, J. & SOTO, F. (2016). Agregados laborales, esfuerzoa de búsqueda de empleo


y Google Trends. BBVA Research. Observatorio Económico de Chile.

SESTELO, M., VILLANUEVA, N., MEIRA-MACHADO, L., & ROCA-PARDIÑAS J. (2016).


FWDselect: An R Package for Variable Selection in Regression Models. The R Journal,
Vol. 8/1, Aug. 2016.

SONG, H, P. BING y D. Y-L Ng (2010).Forecasting demand for hotel rooms with search
engine query volume data, School of Hotel and Tourism Management, Hong Kong y
College of Charleston, U.S.

SUHOY, T. (2009). Query Indices and a 2008 Downturn: Israeli Data,Discussion Paper ,
2009-06, Banco de Israel.

VARIAN, H. R. (2014). Big data: New tricks for econometrics. The Journal of Economic
Perspectives, 28(2), 3-27.

20
ANEXO 1.

Cuadro 1. Matrices de correlación entre los términos de GT y la tasa de desempleo


Matriz de correlación
Niveles
Servicio de Trabajando Empleos Bolsa de Ofertas Trabajos en Colombia
Periodo Empleo Trabajo [Link]
empleo colombia publicos empleo trabajo colombia trabajo
2004-2016 0,56 0,33 0,56 - 0,30 0,53 0,32 0,72 0,42 0,57 0,56
2005-2016 TD 0,61 0,16 0,72 - 0,15 0,49 0,32 0,73 0,46 0,46 0,32
2011-2016 0,38 - 0,24 0,73 - 0,06 0,66 0,35 0,73 0,32 0,41 0,46

Empleo en Bolsa Busco Seguro Servicio de Agencia


Periodo elempleo Sena Ahorro
colombia trabajo trabajo desempleo empleo publica de Reclutamie
2004-2016 0,77 0,26 0,61 0,42 - 0,12 0,15 - 0,42 0,31 0,47 0,51
2005-2016 TD 0,68 0,51 0,51 0,52 - 0,29 0,31 - 0,43 0,56 0,44 0,72
2011-2016 0,77 0,50 0,57 0,70 - 0,36 0,27 - 0,25 0,53 - 0,26 0,80

Listado de Categoría bolsa


Periodo Zapatos Vestuario comercio clasificados trabajando vacantes computrabajo
empleo Empleo trabajo
2004-2016 - 0,70 0,20 - 0,51 - 0,53 0,62 0,70 0,54 0,09 - 0,23 0,54
2005-2016 TD - 0,72 0,07 - 0,40 - 0,44 0,52 0,78 0,64 0,12 - 0,00 0,44
2011-2016 - 0,62 - 0,49 0,56 0,43 0,31 0,73 0,73 0,47 0,79 0,58

Matriz de correlación
Niveles
almacenes empleo Almacenes
Periodo jornalero peon todero jardinero meseros exito grupo éxito
exito éxito éxito
2004-2016 - 0,11 - 0,36 - 0,40 0,23 - 0,16 - 0,70 - 0,62 0,45 - 0,15 - 0,64
2005-2016 TD - 0,06 - 0,19 - 0,33 0,24 0,07 - 0,67 - 0,66 0,37 - 0,11 - 0,62
2011-2016 - 0,12 - 0,17 - 0,12 - 0,28 0,16 - 0,42 - 0,51 0,11 0,24 - 0,29

éxito
Periodo jumbo yumbo la 14 metro alkosto colsubsidio easy olimpica carrefour
(categoria
2004-2016 - 0,42 - 0,62 - 0,64 - 0,61 - 0,43 - 0,69 - 0,45 0,13 - 0,27 0,36
2005-2016 TD - 0,42 - 0,64 - 0,65 - 0,66 - 0,21 - 0,67 - 0,26 0,04 - 0,07 0,51
2011-2016 - 0,04 - 0,56 - 0,50 - 0,57 - 0,13 - 0,57 - 0,18 - 0,20 0,13 0,59

agente empresas servicios casalimpia centro servicio de


Periodo domicilios casa limpia
construccio inmobiliario Domicilios.c de aseo (economia) empleo aseo aseo
2004-2016 0,56 0,39 - 0,69 - 0,71 0,48 0,44 - 0,44 - 0,31 - 0,11 0,55
2005-2016 TD 0,42 0,31 - 0,68 - 0,70 0,20 0,30 - 0,30 - 0,26 - 0,31 0,40
2011-2016 0,02 - 0,13 - 0,56 - 0,58 0,13 - 0,40 0,10 - 0,03 - 0,25 0,19

Matriz de correlación
Niveles
servicio de servicios salon de sector compro san san
Periodo motos bicicletas cicla
vigilancia generales belleza inmobiliario moto victorino victorino
2004-2016 0,39 - 0,32 - 0,37 - 0,00 0,01 0,06 - 0,23 - 0,63 - 0,36 - 0,51
2005-2016 TD 0,40 - 0,25 - 0,27 0,07 0,25 0,21 - 0,41 - 0,59 - 0,43 - 0,55
2011-2016 0,05 - 0,21 0,05 - 0,17 0,68 0,59 - 0,40 - 0,42 - 0,47 - 0,44

21
éxito
Periodo jumbo yumbo la 14 metro alkosto colsubsidio easy olimpica carrefour
(categoria
2004-2016 - 0,42 - 0,62 - 0,64 - 0,61 - 0,43 - 0,69 - 0,45 0,13 - 0,27 0,36
2005-2016 TD - 0,42 - 0,64 - 0,65 - 0,66 - 0,21 - 0,67 - 0,26 0,04 - 0,07 0,51
2011-2016 - 0,04 - 0,56 - 0,50 - 0,57 - 0,13 - 0,57 - 0,18 - 0,20 0,13 0,59

agente empresas servicios casalimpia centro servicio de


Periodo domicilios casa limpia
construccio inmobiliario Domicilios.c de aseo (economia) empleo aseo aseo
2004-2016 0,56 0,39 - 0,69 - 0,71 0,48 0,44 - 0,44 - 0,31 - 0,11 0,55
2005-2016 TD 0,42 0,31 - 0,68 - 0,70 0,20 0,30 - 0,30 - 0,26 - 0,31 0,40
2011-2016 0,02 - 0,13 - 0,56 - 0,58 0,13 - 0,40 0,10 - 0,03 - 0,25 0,19

Matriz de correlación
Niveles
temporales alianza obras
Periodo temporales coltempora subsidio Indeed convocatorias vacantes convocatoria
uno a temporales publicas
2004-2016 0,49 - 0,28 - 0,43 - 0,33 0,13 0,55 - 0,66 0,37 0,06 0,24
2005-2016 TD 0,56 - 0,13 - 0,28 - 0,24 0,13 0,42 - 0,66 0,35 0,09 0,33
2011-2016 0,59 0,56 0,08 - 0,24 0,27 0,28 - 0,39 0,51 0,51 0,28

san victorino bogota metro


Periodo bogota ALO transmilenio 4G
bogota (localidad) bogota
2004-2016 - 0,16 - 0,34 0,04 0,53 - 0,59 - 0,23 - 0,67
2005-2016 TD Bogotá - 0,09 - 0,28 - 0,04 0,59 - 0,50 - 0,33 - 0,68
2011-2016 - 0,30 0,33 0,20 0,36 0,06 - 0,24 - 0,33

Familias en
Periodo ecopetrol cenit equion recolecta cosecha gota a gota prestamo
acción
2004-2016 0.23 0.23 - 0.63 0.10 0.09 - 0.18 - 0.59 - 0.64
2005-2016 TD 0.28 - 0.27 - 0.61 0.29 - 0.14 - 0.44 - 0.63 - 0.61
2011-2016 0.49 - 0.51 0.12 - 0.08 - 0.26 - 0.53 - 0.60 - 0.51

Fuente: GEIH, DANE y Google Trends. Cálculos: DNP-DEE

22

También podría gustarte