Métodos de Clasificación en Transporte Estudiantil
Métodos de Clasificación en Transporte Estudiantil
RESUMEN ABSTRACT
Este trabajo presenta los resultados de un proceso This work presents the results of an exploratory process
exploratorio donde se aplicaron diferentes métodos de where different classification methods were applied to
clasificación para determinar el modo de transporte determine the mode of transportation for students
de los estudiantes para acceder a la sede Rodrigo Facio de to access the Rodrigo Facio campus of the University
la Universidad de Costa Rica. Dentro de los modelos of Costa Rica. Among the analyzed models are binomial
analizados se encuentran la regresión logística binomial, logistic regression, linear discriminant analysis, decision
análisis discriminante lineal, árboles de decisión, K-vecinos trees, K-closest neighbors, vector support machines
más cercanos, máquinas de soporte vectorial y redes and neural networks. A validation was carried out with
neuronales. Se realizó una validación con el método de the K-folds method and a precision higher than 83%
K-pliegues y se obtuvo una precisión superior al 83% para was obtained for all the models analyzed. Similarly, the
todos los modelos analizados. De manera similar, se aplicó stacking assembly model was applied for the decision tree
el modelo de ensamble apilamiento para las técnicas de techniques, K-nearest neighbors, vector support machines,
árboles de decisión, K-vecinos más cercanos, máquinas random forests, Bootstrap aggregation, binomial logistic
de soporte vectorial, bosques aleatorios, agregación de regression, and the potentiation method, obtaining
Bootstrap, regresión logística binomial y método precision values higher than 86% in all cases. The random
de potenciación obteniendo valores de precisión forest method gives the highest precision.
superiores al 86% en todos los casos, siendo el modelo de
bosques aleatorios el que presentó una mayor precisión. Keywords: mode of transport, multivariate analysis,
ensemble methods, classification methods.
Palabras clave: modo de transporte, análisis multivariado,
métodos de ensamble, métodos de clasificación.
2
Sin embargo, después del año 2007 se ha visto
un incremento significativo en las publicaciones Metodología
científicas relacionadas con la aplicación de técnicas El objetivo general de esta investigación es comparar
de clasificación de aprendizaje de máquinas (Hillel, la precisión de técnicas de clasificación para la
Bierlaire, Elshafie y Jin, 2020). Por ejemplo, Zenina determinación del modo de transporte que utilizan
y Borisov (2011) utilizaron análisis discriminantes los estudiantes activos de la Universidad de Costa
escalonados y progresivos para la elección del Rica en el 2018 con base en su frecuencia de visita, las
modo del modelo y compararon los resultados con características del hogar y la ubicación de su residencia.
el modelo Multinomial Logit (MNL, por sus siglas en
inglés) y los modelos de árbol de decisión (DT, por sus Interesa explorar el rendimiento de modelos
siglas en inglés). paramétricos de clasificación posteriores al modelo
Logit multinomial, basadas en la conformación de
Adicionalmente, Sekhar (2014) indica que modelos grupos de personas de un entorno común con base
como el logit, redes neuronales artificiales, sets de en coincidencia de características y relaciones de
teoría difusa y neuro-difusos tienen alta precisión. independencia entre sí: tanto técnicas basadas en
Por otro lado, Souza Pitombo, Schindler Gomes Da cálculos estadísticos, como los modelos previamente
Costa y Salgueiro (2015) aplicaron la metodología mencionados y el análisis de discriminante lineal,
de árboles de decisión donde la mayoría de los así como otras basadas en inteligencia artificial
encuestados usaban el modo motorizado privado como árboles de decisión y clasificación, K-vecinos
(60,6%), seguido del modo no motorizado (21,2%) más cercanos, máquinas de soporte vectorial y
y el transporte público (18,2%). La variable más redes neuronales.
importante (que explica mejor la variabilidad de los
datos teniendo en cuenta la elección del modo) fue El registro utilizado para esta investigación es la
“Licencia de conducir”, que divide los datos en dos Encuesta de Transporte UCR llevada a cabo por el
ramas principales. LanammeUCR (Hernández-Vega y Umaña-Marín,
2018), la cual tuvo el objetivo de caracterizar a los
Vassilev (2018) combinó tres herramientas de minería viajes de las personas usuarias de las instalaciones
de datos: análisis de componentes principales, de la Universidad de Costa Rica (UCR), identificando
distancia de Mahalanobis y análisis discriminante zonas de generación de viajes, perfil personal y
lineal para explorar el modo de transporte utilizado, a de viajes, medios de transporte utilizados, rutas
partir de datos recolectados con teléfonos celulares. empleadas, entre otros. El cuestionario se aplicó
Similarmente, Hillel, Elshafie y Jin (2018) aplicaron la en formato electrónico mediante la plataforma
metodología de árboles de decisión con aumento de LimeSurvey, tomando en cuenta aspectos prácticos,
gradiente estocástico y realizaron una validación especialmente considerando su bajo costo. Se
de K-pliegues. Adicionalmente, Sekhar y Madhu enviaron correos electrónicos al estudiantado y al
(2016) aplicaron el modelo de bosque aleatorio para personal docente y administrativo de la universidad.
modelar la selección de modo en Delhi, India. Las respuestas recibidas al cuestionario fueron
Existen estudios donde se determina el modo de totalmente voluntarias, por lo que es de esperar de
transporte a partir de datos recolectados de manera que exista un sesgo de participación.
automática. Por ejemplo, Dabiri y Heaslip (2018) El estudiantado y el personal docente y
aplicaron redes neuronales convolucionales para administrativo tuvieron acceso a la encuesta durante
predecir el modo de transporte a partir de datos el mes de junio del 2018, a través del enlace http://
obtenidos de Sistemas de Posicionamiento Global. [Link]. La duración promedio del
Similarmente, Jahangiri y Rakha (2014) aplicaron llenado de las preguntas fue de 13 minutos para
máquinas de soporte vectorial utilizando datos el caso de los estudiantes y de 12 minutos para el
de diferentes sensores para predecir el modo de caso de las personas funcionarias de la universidad
transporte utilizados por los diferentes usuarios. (Hernández-Vega y Umaña-Marín, 2018).
3
La base de datos disponible cuenta con 1733 registros. • Cantidad de automóviles en el hogar. Variable
En cuanto a tipo de usuario cabía la posibilidad de categórica que ofrece tres opciones: 0, 1 o más
seleccionar múltiples roles por respuesta, se resalta de 2.
que el 82,23% declaró ser estudiante regular de la
Universidad (diplomado, bachillerato o licenciatura), Las siguientes variables que se refieren a la
paralelamente 7,16% se identificó como estudiante provincia, consideran la dinámica de movilidad
de posgrado, 6,41% como docente y 6,06% como de los estudiantes que viven fuera de la Gran Área
funcionario administrativo, las personas que también Metropolitana, principalmente, y su movilización a
se denominaron deportistas, visitantes, estudiantes residencias alquiladas o temporales en el campus
de curso libre, egresados, proveedores no alcanzan el durante el periodo lectivo, y su retorno a su lugar de
1% en cada categoría. origen en los periodos de receso de lecciones: fines
de semana y meses de vacaciones.
Así, el presente trabajo buscó enfocarse en personas
usuarias que son estudiantes regulares, cuyo nivel • Provincia de residencia (entre semana, de
más alto de educación declarado es universitaria marzo a junio y de julio a diciembre).
incompleta y son estudiantes activos. Además, el
análisis se limitó a estudiantes que visitan el campus • Provincia de residencia durante los fines
universitario Rodrigo Facio, en San Pedro Montes de de semana.
Oca, y excluyendo a quienes visitan exclusivamente • Provincia de residencia durante los meses de
alguna otra sede. Finalmente, interesó considerar enero y febrero.
datos de ingreso monetario, por lo cual se excluyeron
los registros que no contaban con respuestas • Fincas de la sede Rodrigo Facio que visita.
asociadas. La selección final se compone de 626 Cantidad de fincas del campus que suelen visitar:
registros válidos. campus central, Ciudad de la Investigación
e Instalaciones Deportivas, por lo cual las
Seguidamente, se detalla la totalidad variables de respuestas se categorizaron, respectivamente,
la encuesta consideradas para el presente trabajo, en 1, 2 o 3.
además de su descripción y tratamiento preliminar.
En la mayoría se agruparon ciertas categorías • Días de la semana que visita la Universidad.
originales para generar rangos representativos y Cantidad de días que visita la Universidad en
evitar rangos con poca representación de respuestas: una semana, los valores parten desde 1 días
hasta la categoría 5 o más.
• Edad. Variable discreta, edad de los estudiantes,
cuyo rango va desde los 17 a los 47 años, con • Tiempo promedio de llegada a la Universidad.
una media de 21,8 años. El 75% de las personas Tiempo en rangos que parten desde los 15
tenía 23 años o menos. minutos hasta más de 1 hora.
• Sexo. La muestra está compuesta exactamente • Tiempo promedio de retorno de la
por 50% estudiantes mujeres y 50% hombres. Universidad. Tiempo en rangos que parten
desde los 15 minutos hasta más de 1 hora.
• Ingreso bruto mensual del hogar. Esta variable
es categórica, tiene rangos que van desde menos Entre todas las posibilidades que ofrece la información
de 250 mil colones (443 dólares de los Estados de la encuesta, la variable categórica que se planteó
Unidos de América) mensuales hasta 1 millón de como respuesta de los modelos por construir es
colones (1773 dólares de los Estados Unidos el modo de transporte que cada persona utiliza
de América), los rangos superiores a este valor más frecuentemente (es decir, que se está ante una
se agruparon en la categoría “Más de 1 millón”. encuesta de preferencias reveladas). Considerando
• Cantidad de personas en el hogar. Variable el objetivo de la investigación y la versatilidad que
categórica, número de personas que una variable dependiente dicotómica ofrece para la
conforman el hogar de la persona encuestada simplificación y aplicación de diversos métodos, los
en rangos: uno o dos miembros, tres, cuatro, modos de transporte encuestados se categorizaron
más de cinco miembros. previamente en dos grupos:
4
• Movilidad activa - Servicio público colectivo calculando los indicadores de precisión y, finalmente,
(MASP): camina, bicicleta, servicio de autobús promediando los resultados de todas las iteraciones.
externo de la universidad (conocido como ruta
bus UCR) para el transporte de estudiantes, bus En una segunda etapa, se exploraron los resultados de
regular, tren, otro (87,06% de la selección final). la combinación de modelos predictivos, a través de los
modelos de ensambles que incluyen la generación de
• Vehículo particular o servicio público pliegues de construcción e iteraciones: Agregación
individual (motorizado) (VP): Carro (conductor de Bootstrap, Bosques Aleatorios, Método de
o pasajero), Moto (conductor o pasajero), Uber, potenciación y Apilamiento.
Taxi (12,94%).
5
Cuadro 2. Coeficientes significativos del modelo de Regresión Logística Binomial
de predicciones de modo de transporte estudiantil
Similarmente, el método de árbol de decisión (ver vive fuera de la Gran Área Metropolitana (GAM)
Figura 1) utiliza la tenencia de vehículo en el hogar durante los fines de semana, seguido del tiempo de
como primer criterio de selección, seguido del tiempo retorno (en este caso entre 45 y 60 minutos).
de retorno, del ingreso en el hogar, si el estudiante
Figura 1. Árbol de decisión y clasificación del modo de transporte de estudiantes de la Universidad de Costa Rica
6
Específicamente, para el modelo de K-vecinos, y con Respecto a la precisión de predicciones de modo
base en un 20% de los datos originales reservados de transporte, se aplicó el modelo de ensamble de
para validación, se obtuvo una precisión superior al apilamiento y para las diferentes técnicas analizadas
85%, una sensibilidad del 98% y una especificidad del se obtuvieron precisiones con medias superiores
11%, como se detalla en el Cuadro 3. al 86% (ver Cuadro 4), resultados muy similares se
obtuvieron con los modelos individuales.
7
Las medidas promedio de evaluación de predicciones Se recomienda explorar, en estudios posteriores, otros
para el modelo de ensamble Apilamiento con base métodos de clasificación de aprendizaje bayesiano
en 20% de los datos originales reservados para como el explorador bayesiano ingenuo aplicado por
validación tienen una precisión del 89% siendo este Hagenauer y Helbich (2017), o realizar pruebas de
modelo el que presenta mejores resultados, según lo hipótesis, como la Kruskal-Wallis sobre las diferencias
observado en el Cuadro 5. de rendimiento entre los clasificadores que también
fue aplicada por Hagenauer y Helbich (2017).
Los resultados obtenidos se encuentran dentro
de los rangos obtenidos por Hagenauer y Helbich Sería interesante utilizar en futuros proyectos similares
(2017) y superiores a los reportados por Omrani otros modelos para la clasificación, como el enfoque
(2015). Al comparar los resultados obtenidos en el de aprendizaje automático supervisado utilizado
presente análisis con otros estudios de tenencia de por Bjerre-Nielsen, Minor, Sapieżyński, Lehmann y
vehículo, por ejemplo, se puede decir presentan Lassen (2020) para determinar el modo de transporte
valores de precisión ligeramente inferiores y utilizado a partir de datos de Wi-fi y Bluetooth.
similares a los encontrados por Muhsin Zambang,
Jiang, y Wahab (2021) en un estudio realizado en Finalmente, sería recomendable aplicar estos
Ghana, pero superiores a los determinados por métodos con datos más recientes con el fin de
Kaewwichian, Tanwanichkul y Pitaksringkarn (2019) valorar posibles variaciones recientes en los patrones
en otro estudio similar en Tailandia. En estos estudios de movilidad.
se aplicaron algunas de las técnicas incluidas en el
presente análisis.
Agradecimientos
Conclusiones y Se agradece a Deiby Solano, profesor del posgrado
en Estadística en la Universidad de Costa Rica, los
recomendaciones comentarios y sugerencias para mejorar el presente
estudio. Además, se agradece al Laboratorio
En el presente estudio se logró comparar la precisión Nacional de Materiales y Modelos Estructurales de la
de técnicas de clasificación para la determinación Universidad de Costa Rica por proveer la información
del modo de transporte que utilizan los estudiantes requerida para el presente estudio.
activos de la Universidad de Costa Rica en el 2018 con
base en su frecuencia de visita, las características del
hogar y la ubicación de su residencia. Los métodos Referencias
estudiados brindan en términos generales buenos
resultados, por lo que su aplicación podría tener un Alpízar, F., Piaggio, M., y Pacay, E. (2017). Valoración
potencial similar a los métodos logit tradicionales. económica de los beneficios en la salud
asociados a la reducción de la contaminación
Respecto a los modelos de clasificación base del aire. Santiago, Chile: CEPAL.
construidos y aplicación de validación cruzada
K-pliegues, la técnica de K-vecinos más cercanos Bekhor, S., y Shiftan, Y. (2009). Specification and
presentó la precisión más alta. Cuando se aplicó Estimation of Mode Choice Model Capturing
el modelo de ensamble de apilamiento y para Similarity between Mixed Auto and Transit
las diferentes técnicas analizadas se obtuvieron Alternatives. Journal of Choice Modelling, 3(2),
precisiones con medias superiores al 86%, siendo 29-49. DOI: 10.1016/S1755-5345(13)70034-4
la técnica de bosques aleatorios la que presentó Bjerre-Nielsen, A., Minor, K., Sapieżyński, P.,
resultados ligeramente superiores a las otras técnicas. Lehmann, S., y Lassen, D. D. (2020). Inferring
Los resultados fueron muy similares a los que se transportation mode from smartphone
obtuvieron con los modelos individuales. sensors: Evaluating the potential of Wi-Fi and
Bluetooth. PLOS ONE, 15(7), e0234003. DOI:
10.1371/[Link].0234003
8
Castro-Rodríguez, L, Picado-Aguilar, G., y Rodríguez- Jiménez-Serpa, J. C., Rojas-Sánchez, A. E., y Salas-
Shum, S. (2018). Evolución histórica de la Rondón, M. H. (2015). Tariff integration for
modelación de demanda de transporte public transportation in the metropolitan area
urbano en Costa Rica. Infraestructura Vial, 20, of Bucaramanga. INGE CUC, 11(1), 25-33. DOI:
4-47. DOI: 10.15517/iv.v20i1.33541 10.17981/ingecuc.11.1.2015.02
Dabiri, S., y Heaslip, K. (2018). Inferring transportation Jiménez-Serpa, J. C., y Salas-Rondón, M. H. (2016).
modes from GPS trajectories using a Un caso de estudio sobre los factores que
convolutional neural network. Transportation influyen para viajar en taxi compartido desde
Research Part C: Emerging Technologies, 86, y hacia el aeropuerto. Ingeniería de Transporte,
360-371. DOI: 10.1016/[Link].2017.11.021 20(01), 33-46.
Jahangiri, A., y Rakha, H. (2014). Developing a Ortúzar, J.D. (2012). Modelos de demanda de
support vector machine (SVM) classifier for transporte. Santiago, Chile: Ediciones UC.
transportation mode identification by using
mobile phone sensor data. En Transportation París-Bravo, D. (2019). Factores determinantes para
Research Board 93rd Annual Meeting. la selección de modo auxiliar para acceder a
Conferencia de Transportation Research Transmilenio (Tesis de grado). Universidad de
Board, Washington D.C., Estados Unidos. los Andes, Colombia.
9
Programa Estado de la Nación (2019). Informe Estado
de la Nación 2019. Recuperado de: [Link]
[Link]/wpcontent/uploads/2019/11/
informe_estado_nacion_2019.pdf
10