0% encontró este documento útil (0 votos)
3 vistas27 páginas

Proyecto STR

El documento presenta un proyecto para desarrollar un modelo predictivo de abandono escolar en instituciones educativas peruanas utilizando técnicas de Machine Learning. Este modelo busca identificar tempranamente a los estudiantes en riesgo de deserción, permitiendo intervenciones personalizadas y mejorando la gestión educativa. Se fundamenta en la metodología CRISP-DM y propone un sistema automatizado de alertas y un dashboard interactivo para facilitar la toma de decisiones informadas.

Cargado por

kchira
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas27 páginas

Proyecto STR

El documento presenta un proyecto para desarrollar un modelo predictivo de abandono escolar en instituciones educativas peruanas utilizando técnicas de Machine Learning. Este modelo busca identificar tempranamente a los estudiantes en riesgo de deserción, permitiendo intervenciones personalizadas y mejorando la gestión educativa. Se fundamenta en la metodología CRISP-DM y propone un sistema automatizado de alertas y un dashboard interactivo para facilitar la toma de decisiones informadas.

Cargado por

kchira
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Universidad Nacional Pedro Ruiz Gallo

Facultad de Ciencias Físicas y Matemáticas

Escuela Profesional de Computación e Informática

Modelo predictivo de abandono escolar mediante técnicas de


Machine Learning en instituciones educativas peruanas

ALUMNO:

Chira Cruz Kevin Bryan

DOCENTE:

Ing. Denny Jhon Fuentes Adrianzen

CURSO:
SISTEMAS EN TIEMPO REAL

CICLO
: 2025 -
II
Lambayeque, noviembre del 2025.
INTRODUCCIÓN
El abandono escolar, conocido en inglés como dropout, constituye
uno de los problemas más persistentes y complejos dentro de los
sistemas educativos contemporáneos. Su impacto no solo se
refleja en las trayectorias individuales de los estudiantes, sino
también en la estructura social y económica de los países. En el
contexto latinoamericano y, particularmente, en el Perú, el
abandono escolar representa una amenaza directa al desarrollo
humano, ya que limita las oportunidades de inserción laboral,
aumenta la desigualdad y perpetúa ciclos de pobreza
intergeneracional. Diversos estudios del Ministerio de Educación
(MINEDU) y organismos internacionales como la UNESCO
evidencian que las causas de este fenómeno son multifactoriales,
involucrando variables académicas, socioeconómicas, familiares y
tecnológicas.

En este escenario, la integración de la Inteligencia Artificial (IA) y,


específicamente, del Machine Learning (ML) en la gestión
educativa se presenta como una herramienta poderosa para
abordar el problema desde una perspectiva predictiva y preventiva.
Este proyecto propone el desarrollo de un modelo de Machine
Learning capaz de estimar el riesgo de abandono escolar de los
estudiantes en niveles secundarios y universitarios (según la
disponibilidad de datos), con el objetivo de identificar de manera
temprana aquellos casos con mayor probabilidad de desertar y
generar alertas oportunas que permitan implementar
intervenciones personalizadas. A diferencia de los enfoques
tradicionales que suelen reaccionar una vez ocurrido el abandono,
este modelo busca anticipar el riesgo y actuar antes de que se
concrete la deserción.

La propuesta se fundamenta en la metodología CRISP-DM (Cross-


Industry Standard Process for Data Mining), reconocida
internacionalmente como un marco de referencia estructurado y
flexible para el desarrollo de proyectos de ciencia de datos. Esta
metodología contempla seis fases fundamentales: comprensión
del negocio, comprensión de los datos, preparación de los datos,
modelado, evaluación y despliegue. En el marco de este proyecto,
se llevará a cabo una caracterización exhaustiva de las variables
que influyen en la deserción escolar, seguida de la construcción de
un pipeline de preprocesamiento de datos que garantice su calidad
y consistencia. Posteriormente, se evaluarán diversos algoritmos
de clasificación supervisada, tales como Random Forest, XGBoost
y redes neuronales artificiales (ANN), con el propósito de
determinar cuál ofrece el mejor equilibrio entre precisión,
interpretabilidad y capacidad de generalización.

Finalmente, se propone el diseño de un dashboard interactivo y un


sistema automatizado de alertas, orientados a los directivos,
tutores y psicólogos educativos, que facilite la visualización de los
resultados y la toma de decisiones informadas. Este enfoque no
solo pretende ofrecer una solución tecnológica avanzada, sino
también fortalecer la gestión institucional mediante una cultura de
análisis de datos educativos, promoviendo una educación más
equitativa, inclusiva y basada en la evidencia. En síntesis, este
proyecto busca convertir los datos en conocimiento y el
conocimiento en acción, contribuyendo así a reducir
significativamente los índices de abandono escolar y a mejorar la
calidad del sistema educativo peruano.
I. INFORMACIÓN GENERAL

 Título: Modelo predictivo de abandono escolar mediante técnicas de Machine


Learning en instituciones educativas peruanas.

 Autor(es):

Chira Cruz, Kevin Bryan.

 Asesor de especialidad: Ing. Denny Jhon Fuentes Adrianzen

 Línea de Investigación: Sistemas Inteligentes y Tiempo Real

 Lugar: Lambayeque, Perú.

 Duración estimada del proyecto: 5 meses.

 Fecha de inicio: noviembre 2025.

 Fecha de término: marzo 2026.

II. PLANTEAMIENTO DE LA INVESTIGACIÓN

1.1 Descripción del Problema

A nivel global, la deserción escolar o dropout se ha consolidado


como una de las problemáticas más críticas para los sistemas
educativos contemporáneos. Organismos internacionales como la
UNESCO (2023) y el Banco Mundial han alertado que la crisis de
aprendizaje post-pandemia ha exacerbado las tasas de
abandono, especialmente en países en vías de desarrollo. Si bien
la digitalización ha permitido la implementación de plataformas de
gestión del aprendizaje (LMS) como Moodle, Canvas o
Blackboard en gran parte del mundo, existe una brecha
tecnológica significativa en la forma en que se procesan estos
datos.

En el panorama internacional, la mayoría de instituciones


educativas operan bajo un paradigma reactivo y asíncrono. Los
sistemas actuales funcionan como grandes repositorios pasivos
de información: almacenan notas, registros de asistencia y
reportes de conducta, pero carecen de mecanismos de
procesamiento en tiempo real. Estudios recientes en Educational
Data Mining evidencian que, en entornos tradicionales, el tiempo
transcurrido entre el "evento de riesgo" (ej. una tercera
inasistencia consecutiva o una caída abrupta en calificaciones) y
la "acción correctiva" (intervención del tutor) puede oscilar entre
semanas e incluso meses. En el contexto de los Sistemas en
Tiempo Real, esta latencia es inaceptable, pues la ventana de
oportunidad para retener al estudiante se cierra mucho antes de
que se generen los reportes trimestrales o semestrales.

Aterrizando en la realidad peruana, el escenario se torna más


complejo debido a factores estructurales y socioeconómicos.
Según cifras del Ministerio de Educación (MINEDU) y el sistema
Escale, la tasa de deserción en educación secundaria y superior
técnica muestra una correlación directa no solo con la pobreza,
sino con la falta de seguimiento personalizado. El sistema
educativo nacional se apoya en plataformas como el SIAGIE, las
cuales, si bien centralizan la información académica oficial,
funcionan estrictamente como herramientas de registro
administrativo post-factum.

El problema en el Perú no es la falta de datos; las instituciones


poseen registros históricos y transaccionales ricos en información.
El problema radica en la arquitectura de procesamiento de estos
datos. Actualmente, un docente en una institución peruana
promedio sube las notas o toma lista manualmente, y esta
información queda "dormida" en la base de datos hasta que se
procesan las actas finales. No existe una infraestructura de
streaming de datos o triggers inteligentes que analicen esta
información en el momento de su ingesta. Esta carencia
tecnológica convierte a las instituciones en observadores pasivos
del abandono escolar, actuando únicamente cuando el alumno ya
ha formalizado su retiro, lo cual anula cualquier estrategia de
prevención efectiva.
En el ámbito local, específicamente en la institución objeto de
estudio, esta problemática se manifiesta en la desconexión
operativa entre los departamentos académicos y las áreas de
bienestar estudiantil o psicopedagogía. El flujo de trabajo actual
es manual y fragmentado: los docentes registran incidencias
(inasistencias, bajo rendimiento) en hojas de cálculo o sistemas
legados aislados, y los departamentos de psicología carecen de
un dashboard unificado que consolide estas variables.

La situación problemática local se define, por tanto, por una alta


latencia en la detección del riesgo. Cuando un estudiante
comienza a mostrar patrones de abandono (inasistencias
intermitentes, entrega tardía de trabajos), el sistema no emite
ninguna alerta. La identificación del estudiante en riesgo depende
enteramente de la observación humana subjetiva y de la revisión
manual de registros, procesos que son lentos y propensos al
error. Desde la perspectiva de la Ingeniería de Sistemas y
Computación, la institución carece de un sistema experto capaz
de ingerir datos heterogéneos (académicos y socioeconómicos) y
procesarlos mediante inferencia inmediata. La ausencia de un
modelo predictivo integrado en tiempo real impide priorizar los
recursos de apoyo limitados hacia quienes más lo necesitan,
resultando en una pérdida continua de matrícula que podría ser
evitable con una arquitectura de detección temprana basada en
Machine Learning.

1.2 Formulación del Problema

¿De qué manera un modelo predictivo de abandono escolar


mediante técnicas de Machine Learning permitirá optimizar la
detección temprana de riesgo de deserción en instituciones
educativas peruanas?
1.3 Formulación de la hipótesis

La implementación de un modelo predictivo basado en técnicas


de Machine Learning optimizará significativamente la detección
temprana de riesgo de deserción escolar en instituciones
educativas peruanas, al permitir el procesamiento automático y la
correlación de variables académicas y socioeconómicas en
tiempo real.
1.4.- OBJETIVO GENERAL DEL PROYECTO

Desarrollar un modelo de Machine Learning que identifique


estudiantes en riesgo de abandono escolar para permitir
intervenciones tempranas.

1.5.- OBJETIVOS ESPECIFICOS DEL PROYECTO

 Recolectar y consolidar datos relevantes (académicos,


asistencia, socioeconómicos, conducta) de la institución.
 Realizar análisis exploratorio para identificar variables
predictoras y patrones.
 Construir pipelines reproducibles de preprocesamiento y
modelado.
 Entrenar y comparar modelos (Random Forest, XGBoost,
LGBM, MLP) y seleccionar el mejor según métricas
relevantes.
 Implementar un prototipo de dashboard para visualización
de riesgo y recomendaciones de intervención.
 Realizar la evaluación económica de la propuesta de la
implementación del modelo predictivo de abandono
escolar.
III. SÍNTESIS DEL DISEÑO TEÓRICO

2.1.- ANTECEDENTES

2.1.1 INTERNACIONALES

El artículo titulado El machine learning para abordar el abandono


escolar: Una revisión de los modelos más innovadores (Flores
Satalaya, 2024) presenta una revisión sistemática de estudios
que aplican técnicas de aprendizaje automático al problema del
abandono escolar en contextos internacionales y
latinoamericanos. Según el resumen, los autores examinaron más
de 700 documentos, seleccionando 20 trabajos para análisis con
metodología PRISMA, y concluyeron que modalidades como
redes neuronales artificiales, KNN, regresión logística y árboles
de decisión han demostrado eficacia en la clasificación y
detección de riesgo de abandono. Además, se enfatiza que datos
relativos al rendimiento académico previo, situación financiera
familiar y apoyo social constituyen predictores centrales. Este
trabajo es clave para tu proyecto ya que aporta una base
académica sólida sobre qué modelos funcionan, qué variables
suelen ser relevantes y qué vacíos metodológicos aún existen
(por ejemplo, poca estandarización de métricas o escasa
replicación en contextos latinoamericanos).

El artículo Predicción temprana de deserción mediante


aprendizaje automático en cursos profesionales en línea
(Urteaga, Siri & Garófalo, 2023) analiza la aplicación de
aprendizaje automático en cursos en modalidad virtual (seis a
dieciséis semanas) en el mundo hispano. Se emplearon registros
de interacción de la plataforma (Moodle) durante las dos primeras
semanas del curso para construir un modelo que identificase
alumnos con alto riesgo de abandonar. Este antecedente es
valioso para tu proyecto porque muestra cómo variables de
comportamiento (trato con plataforma, participación temprana)
pueden integrarse al análisis, además del clásico foco en
asistencia y notas. Si tu institución tiene o prevé modalidad
híbrida o virtual, este estudio aporta un complemento
metodológico interesante.

El artículo Etiología y metodología de intervención en los


procesos de fracaso y abandono escolar. Una revisión sistemática
y metaanálisis (Rodríguez-Manteca & Rodríguez-Bravo, 2024)
aborda desde una perspectiva más pedagógica-educativa el
fenómeno del abandono y el fracaso escolar en España. Mediante
revisión sistemática y meta-análisis, identifica múltiples variables
de riesgo (socioeconómicas, familiares, organizativas, de clima
escolar) y analiza cómo los programas de intervención han sido
diseñados para contrarrestar estos procesos. Aunque no está
centrado exclusivamente en modelos de ML, este estudio te da un
marco académico importante sobre las variables contextuales que
debes considerar en tu modelo y por qué es importante
integrarlas (no basta solo rendimiento académico).

El artículo Revisión sistemática sobre las causas del abandono y


el fracaso escolar en España. Propuestas y alternativas (Plaza
Rodríguez, Cachón Zagalaz, González González de Mesa &
Zagalaz Sánchez, 2023) analiza causas del abandono temprano
en el sistema educativo español a partir de trabajos publicados
entre 2013-2024. Su conclusión es que el abandono se vincula
estrechamente con factores estructurales (desigualdad,
repetición, desmotivación, falta de apoyo), y que se necesitan
intervenciones integradas y multidimensionales. Este antecedente
es útil para tu proyecto como respaldo al planteamiento de
problema demuestra que el abandono no es solo cuestión
individual sino estructural, lo cual refuerza la necesidad de usar
múltiples tipos de variables en tu modelo.
El estudio (autoría mexicana, 2025) se enfoca en la educación
superior y revisa los modelos de ML utilizados para predecir
abandono universitario, analizando factores como balanceo de
clases, métricas utilizadas, modelos más frecuentes. Aunque su
foco es universitario, su aporte es relevante para tu proyecto pues
proporciona insights en técnica de modelado (cómo lidiar con
desbalanceo, qué métricas priorizar) que puedes trasladar al nivel
de secundaria o pregrado, adaptando variables.

2.1.2.- NACIONALES

El estudio “Modelo de aprendizaje automático para la predicción


del abandono escolar mediante encuestas de hogares”
desarrollado por Jacha Rojas, Yataco Cañari y Ospina Galíndez
(2024) propone un enfoque de machine learning para identificar
estudiantes peruanos con alto riesgo de abandono, utilizando
como fuente principal los datos de la Encuesta Nacional de
Hogares (ENAHO). Los autores aplican algoritmos de
clasificación supervisada, entre ellos Random Forest y Support
Vector Machine, con el propósito de analizar la influencia de
factores socioeconómicos, demográficos y familiares en la
deserción escolar. Los resultados evidencian que el nivel
educativo de los padres, el acceso a servicios básicos y el ingreso
económico familiar son los predictores más relevantes. Este
antecedente tiene una relación directa con el presente proyecto,
ya que demuestra la aplicabilidad de la inteligencia artificial en
contextos nacionales, y refuerza la importancia de integrar
variables socioeconómicas y contextuales junto con el
rendimiento académico para obtener modelos predictivos más
precisos.

El informe “Interrupción escolar y vulnerabilidad educativa en el


Perú” elaborado por Rojas Arangoitia et al. (2024) y publicado por
el Grupo de Análisis para el Desarrollo (GRADE) examina las
causas estructurales y coyunturales del abandono escolar en la
educación básica peruana. A través del análisis de bases de
datos nacionales como ENAHO, ENDES y SIRE, los autores
identifican que los principales factores de riesgo son el bajo nivel
socioeconómico, la ruralidad, la migración interna y la falta de
acceso a tecnología. El estudio propone políticas de seguimiento
individualizado y fortalecimiento de tutorías, pero también sugiere
el uso de herramientas predictivas basadas en datos como vía
futura para mejorar la gestión educativa. Este antecedente apoya
la justificación del proyecto al mostrar la magnitud del problema y
la necesidad de soluciones tecnológicas sostenibles en el sistema
educativo peruano.

La investigación “Impacto de los factores socioeconómicos en la


deserción escolar en el Perú” realizada por Chala Lloclla (2013)
analiza mediante modelos econométricos la relación entre las
condiciones del hogar y el abandono escolar. El estudio, basado
en información de la ENAHO 2012, concluye que el ingreso
familiar, la disponibilidad de servicios básicos y la situación
laboral de los padres influyen significativamente en la probabilidad
de que un estudiante abandone la escuela. Aunque el enfoque
metodológico es tradicional (regresión lineal), los hallazgos son
altamente útiles para el presente trabajo, pues proporcionan
evidencia empírica sobre las variables que deberían incorporarse
en los modelos de machine learning para capturar de manera
más realista las causas del abandono.

El estudio “Efectos del programa social AVANCEMOS sobre el


abandono educativo en hogares peruanos” desarrollado por
Muñoz-Alvarado (2016) evalúa el impacto de los programas de
transferencia condicionada en la permanencia escolar. A partir de
un diseño cuasi-experimental, se determinó que los estudiantes
beneficiarios del programa presentan menores tasas de
abandono respecto a los no beneficiarios, aunque persisten
diferencias por edad y zona geográfica. La relevancia de este
antecedente radica en que demuestra la influencia de
intervenciones sociales y variables de política pública en la
reducción del abandono, lo cual puede ser incorporado en
modelos predictivos como una variable categórica o binaria que
explique patrones de riesgo o permanencia.

Finalmente, el reporte periodístico-analítico “Deserción escolar en


el Perú: más de 360 000 niños y adolescentes no reciben
educación” publicado por Infobae (2023) recoge cifras oficiales
del Ministerio de Educación del Perú (MINEDU) y de UNICEF,
que evidencian la gravedad del problema educativo nacional.
Según el informe, el 3,8 % de estudiantes en edad escolar
abandonó el sistema entre 2022 y 2023, siendo las principales
causas la pobreza, el trabajo infantil y la desmotivación escolar.
Este antecedente no solo ilustra la magnitud del fenómeno, sino
que también aporta datos actualizados que permiten
contextualizar el modelo predictivo dentro de una realidad crítica,
reforzando la urgencia de implementar soluciones basadas en
inteligencia artificial para prevenir la deserción temprana.

2.1.3 LOCALES

El informe regional “Deserción escolar y el problema de la


educación en Cajamarca” elaborado por el Gobierno Regional de
Cajamarca (2019) analiza la situación educativa en dicha región,
identificando que cinco de cada cien alumnos abandonan la
escuela principalmente por factores económicos, embarazo
adolescente y migración. Además, se reporta una alta tasa de
rezago escolar (34,3 %) y deficiencias en infraestructura
educativa. Este estudio local es relevante para el proyecto, ya que
evidencia cómo factores contextuales y culturales inciden
directamente en la permanencia estudiantil, mostrando la
importancia de adaptar los modelos predictivos a realidades
regionales específicas.
El artículo periodístico “Junín ostenta las peores cifras de
deserción escolar” publicado por Diario Correo (2022) reporta
que, en dicha región, más de 6 200 escolares abandonaron sus
estudios durante 2021, a raíz de la pandemia y de las dificultades
económicas de las familias. Las autoridades regionales señalaron
que la falta de conectividad y el cierre prolongado de escuelas
rurales incrementaron el riesgo de abandono. Este antecedente
ofrece evidencia contextual actualizada sobre cómo los cambios
socioeconómicos y tecnológicos (como la brecha digital) se
convierten en determinantes clave de la deserción, lo cual
respalda la necesidad de considerar variables tecnológicas y de
conectividad dentro del modelo predictivo.

El reporte “Inasistencia escolar alcanza el 18 % en las regiones


del norte del país” publicado por Perucámaras (2015) advierte
que la inasistencia en educación secundaria llegó al 18 % en
regiones del norte, siendo las principales causas la falta de
interés (35,8 %) y los problemas económicos (32,9 %). Si bien la
investigación se centra en la inasistencia, este fenómeno es
considerado un indicador temprano del abandono escolar. Este
antecedente aporta valor al proyecto porque permite identificar
variables intermedias (como ausentismo o desmotivación) que
pueden servir como señales predictivas en el entrenamiento de
los modelos de machine learning.

El informe oficial “La deserción escolar en Lima Metropolitana se


redujo a la mitad en 2020” publicado por la Dirección Regional de
Educación de Lima Metropolitana (DRELM, 2021) señala que,
gracias a estrategias de recuperación y programas de
acompañamiento estudiantil, cerca de 39 000 estudiantes
retornaron al sistema educativo tras la pandemia. Este
antecedente evidencia que las políticas de seguimiento y la
intervención temprana pueden revertir el abandono, lo que
refuerza la utilidad de contar con modelos predictivos que
permitan focalizar de forma oportuna a los alumnos en riesgo y
optimizar los recursos institucionales.

Finalmente, el comunicado de la Defensoría del Pueblo (2020)


titulado “Más de 18 000 estudiantes en Lambayeque no tienen
acceso al programa ‘Aprendo en Casa’” alerta sobre la brecha
digital existente durante la educación remota en la pandemia. El
documento revela que miles de estudiantes quedaron excluidos
del programa educativo virtual por falta de dispositivos o
conectividad, lo que los colocó en riesgo de abandono. Este
antecedente es de gran importancia para el presente proyecto,
pues demuestra cómo el acceso a la tecnología y la
infraestructura digital se han convertido en variables críticas para
la permanencia educativa, las cuales deben incorporarse dentro
del modelo predictivo propuesto.

2.2. Bases Teóricas


Variable Independiente
Modelo predictivo de abandono escolar mediante técnicas de
Machine Learning
Lenguaje de Programación - Python
(Lutz, 2013), afirma que: Python se ha consolidado como el
estándar de facto para la ciencia de datos y el aprendizaje
automático debido a su extensa colección de bibliotecas
especializadas y su capacidad de integración. Su sintaxis clara
permite una prototipación rápida de modelos complejos,
facilitando la transición desde la fase experimental hasta el
despliegue en entornos de producción (págs. 7-9).
Algoritmo XGBoost (Extreme Gradient Boosting)
(Chen & Guestrin, 2016) afirman que: XGBoost es un sistema de
"tree boosting" escalable diseñado para ofrecer velocidad y
rendimiento de vanguardia. A diferencia de las implementaciones
tradicionales de Gradient Boosting, XGBoost optimiza el uso de
recursos computacionales mediante el manejo de datos dispersos
y el aprendizaje paralelo, lo cual es crítico para sistemas que
requieren tiempos de respuesta rápidos (págs. 785-787).

Variable Dependiente
Optimización de la detección temprana de riesgo de deserción
Sensibilidad (Recall) del Modelo (%)
Debe entenderse que: (Powers, 2011) afirma que, en problemas
de clasificación desbalanceada, como la detección de
enfermedades o fraudes (análogo a la deserción), la exactitud
global (accuracy) es engañosa. La métrica crítica es la
Sensibilidad o Recall, que mide la capacidad del sistema para
identificar correctamente todos los casos positivos reales
(estudiantes que van a abandonar), minimizando los falsos
negativos que tendrían un alto costo social (pág. 38).
Latencia de Inferencia (ms)
Debe entenderse que: (Buttazzo, 2011) afirma que: Un sistema en
tiempo real estricto debe garantizar que el resultado del cómputo
(la predicción de riesgo) se produzca dentro de un intervalo de
tiempo predecible tras el evento desencadenante. Si el sistema
tarda demasiado en procesar la alerta tras una inasistencia crítica,
la utilidad de la información decae, impidiendo la intervención
oportuna (pág. 21).
Factores de Riesgo (Feature Importance)
(Tinto, 1987) afirma que: El abandono estudiantil es un proceso
longitudinal de desvinculación, no un evento aislado. Los modelos
eficaces deben ser capaces de ponderar dinámicamente factores
académicos (rendimiento) y de integración social para anticipar la
salida del estudiante antes de que esta se formalice
administrativamente (págs. 89-91).
IV. DISEÑO METODOLÓGICO

En este capítulo se detalla la ruta metodológica seguida para


alcanzar los objetivos de la investigación y contrastar la hipótesis
planteada. Se define el tipo, nivel y diseño de la investigación, así
como la población y muestra, las técnicas e instrumentos para la
recolección de datos y el plan de análisis que se ejecutará.

Tipo y nivel de investigación


El presente estudio es de tipo Aplicada, ya que su propósito es
emplear los conocimientos existentes sobre Inteligencia Artificial,
Minería de Datos y Aprendizaje Automático (Machine Learning)
para desarrollar una solución tecnológica (modelo predictivo de
deserción escolar) que resuelva un problema práctico y
específico: la alta latencia e ineficacia en la detección temprana
de estudiantes en riesgo de abandono en instituciones educativas
peruanas.
El nivel de la investigación es Explicativo, debido a que no solo
busca describir las variables académicas y socioeconómicas, sino
que pretende establecer y explicar la relación de causalidad entre
la variable independiente (implementación del modelo predictivo
basado en Machine Learning) y la variable dependiente
(optimización de la detección temprana mediante la reducción del
tiempo de respuesta y el aumento de la precisión en el
diagnóstico de riesgo).

Diseño de la investigación
El diseño adoptado para esta investigación es Pre-Experimental
(o Cuasi-experimental de un solo grupo), dado que se trabajará
con los registros históricos y transaccionales de una institución
educativa específica, sobre la cual el investigador intervendrá
implementando el nuevo sistema de alertas, comparando su
desempeño contra la metodología tradicional.
El esquema específico que se empleará será el de pre-test y post-
test con un solo grupo, mediante el cual se evaluará la capacidad
de detección de riesgo antes (método manual/reactivo) y después
(método automatizado/predictivo) de la implementación del
modelo.
Este diseño se representa de la siguiente manera:
G . E=O1 X O 2
Donde:
 G.E (Grupo Experimental): Corresponde al conjunto de
datos y procesos de seguimiento estudiantil de la
institución educativa donde se desplegará el modelo.
 O1(Pre-test): Representa la primera observación, que
consiste en medir los indicadores actuales de detección de
abandono (tasa de deserción histórica, tiempo promedio de
detección de casos de riesgo) utilizando el método
tradicional manual.
 X (Estímulo): Simboliza la intervención, es decir, el
entrenamiento, validación y puesta en producción del
modelo predictivo de abandono escolar basado en
algoritmos de ensamble (XGBoost/Random Forest).
 O2 (Post-test): Representa la segunda observación, donde
se evaluará el impacto del sistema midiendo las métricas
de desempeño del modelo (Sensibilidad, Precisión,
Latencia de inferencia) y comparándolas con la línea base
histórica para determinar la mejora en la anticipación del
riesgo.

Población y muestra

Población
La población de estudio está constituida por la totalidad de los
registros académicos y socioeconómicos históricos de los
estudiantes matriculados en la institución educativa seleccionada
durante los últimos 5 años. Esta población incluye tanto a los
alumnos que culminaron sus estudios como a aquellos que
desertaron, proporcionando la base de conocimiento necesaria
para que el algoritmo aprenda los patrones de abandono.
Muestra
Dado que se dispone de la base de datos completa de la
institución, se utilizará un muestreo No Probabilístico por
Conveniencia, seleccionando específicamente aquellos registros
que cuenten con la integridad de datos necesaria (notas
completas, asistencia registrada, ficha socioeconómica llena) para
garantizar la calidad del entrenamiento. Se proyecta trabajar con
un dataset depurado que represente significativamente los
patrones de comportamiento estudiantil, dividiendo esta muestra
en subconjuntos de entrenamiento (70%) y prueba (30%) para
validar la capacidad de generalización del modelo.
OPERACIONALIZACION DE VARIABLES

Variable Definición Conceptual Dimensión Indicador(es) Instrumento

• Sensibilidad (Recall): % de
desertores detectados
correctamente.
Reporte de clasificación
Precisión del Modelo
(Matriz de Confusión).
• Precisión: % de alertas reales
sobre el total.
Capacidad técnica del
V.I: • Latencia de Inferencia:
algoritmo de Machine
Implementación Tiempo (ms) entre el ingreso de
Learning para procesar
del Modelo la nota y la alerta.
datos académicos y Desempeño en Tiempo Logs del sistema /
Predictivo de
generar alertas precisas Real Librería time.
Abandono Escolar
en tiempo real.
• Tasa de procesamiento:
Registros por segundo.

• Estabilidad: Tiempo de
Fiabilidad Técnica Reportes del servidor.
actividad sin fallos (Uptime).
Variable Definición Conceptual Dimensión Indicador(es) Instrumento

• Tiempo de Detección:
Velocidad de Reducción del tiempo Registro de incidencias
Respuesta promedio (Semanas vs. (Pre-test / Post-test).
Segundos).

• Tasa de Anticipación:
Mejora en la velocidad y Alumnos detectados antes de
V.D: Optimización de la anticipación con la que la finalizar el ciclo.
Detección Temprana de institución identifica a Eficacia de la Comparativo Histórico vs.
Riesgo estudiantes vulnerables Detección Dashboard.
frente al método manual. • Reducción de omisiones:
Disminución de falsos
negativos.

• Centralización:
Gestión de la Lista de verificación
Disponibilidad unificada de
Información funcional.
datos en el dashboard.
Técnicas e instrumentos de recolección de datos

Procedimiento de recolección de datos


Para la recolección de los datos, se emplearán las siguientes
técnicas e instrumentos:

Técnica de Evaluación de Desempeño


 Instrumento: Ficha de Registro de Indicadores de
Deserción (Pre-test y Post-test).
Consiste en un formato estructurado que permitirá evaluar la tasa
de detección, el tiempo promedio de identificación de casos de
riesgo y la cantidad de intervenciones oportunas realizadas por el
departamento de psicología antes y después de la
implementación del modelo predictivo.
Será aplicada como:
o Pre-test Situación inicial de la detección de riesgo
(método manual y reactivo actual).
o Post-test Situación después de la implementación
del sistema de alertas tempranas basado en
Machine Learning.

Técnica de Observación Automatizada (Monitoreo de


Sistema)
 Instrumento: Registros Automáticos del Sistema (Logs de
Inferencia).
El sistema automatizado de predicción almacenará de forma
automática en el servidor:
o Latencia de inferencia (tiempo en ms desde la
ingesta de la nota hasta la alerta).
o Puntajes de probabilidad de abandono (Confidence
Score).
o Matriz de confusión en tiempo real (Verdaderos
Positivos / Falsos Negativos).
o Registros de fallos o excepciones del modelo.
o Historial de alertas enviadas a los tutores.
Estos registros garantizan objetividad y precisión milimétrica en la
medición de la variable independiente (funcionamiento del
software).

Técnica de Encuesta
 Instrumento: Cuestionario de Percepción y Usabilidad
(TAM).
Un cuestionario con escala tipo Likert (1–5) aplicado a los tutores
y psicólogos educativos para medir:
Percepción de utilidad de las alertas, facilidad de interpretación
del dashboard, confianza en la predicción de la IA y
predisposición al uso de la tecnología.
Este instrumento evalúa la variable interviniente (factores
humanos y operativos del personal).

Plan de análisis de datos


Los datos recolectados (tanto los registros históricos del CSV
como los logs del sistema) serán procesados utilizando Python
(librerías Pandas y Scikit-learn) y exportados a Excel para la
presentación de tablas resumen. Se realizará un análisis
descriptivo (promedios de latencia, porcentajes de precisión,
frecuencias de alertas) para evaluar el comportamiento inicial y
final de los indicadores relacionados con la retención estudiantil.
Asimismo, se efectuará un análisis inferencial con el propósito de
contrastar la hipótesis de investigación. Para ello, se utilizará la
prueba t de Student para muestras relacionadas, debido a que el
estudio contempla dos mediciones sobre el mismo grupo (la
institución educativa), comparando la eficiencia de detección
antes (manual) y después (automatizada) de la implementación
del modelo.
El nivel de significancia estadística establecido será de p < 0.05,
lo que permitirá determinar si la reducción en el tiempo de
detección y el aumento en la precisión del diagnóstico de riesgo
son estadísticamente significativos y no producto del azar.

Aspectos éticos
Se garantizará la estricta confidencialidad y anonimización de los
datos académicos y socioeconómicos de los estudiantes,
cumpliendo con la Ley de Protección de Datos Personales. Para
el entrenamiento del modelo, se utilizarán identificadores
encriptados (IDs) en lugar de nombres reales, asegurando que la
información sea usada únicamente con fines de investigación
académica y mejora institucional. La participación de los tutores
en las encuestas será voluntaria y el proyecto busca, como fin
último, reducir la deserción escolar para mejorar la calidad de vida
de los estudiantes, respetando su privacidad en todo momento.

DISEÑO DE CONTRASTACIÓN DE HIPÓTESIS


Para la contrastación de la hipótesis de investigación se utilizará
una prueba estadística inferencial que permita comparar los
resultados obtenidos en el pre-test (método manual) y el post-test
(modelo predictivo), evaluando el impacto del modelo de Machine
Learning sobre la optimización de la detección temprana del
riesgo de abandono escolar.

Hipótesis Nula ( H 0)
La implementación del modelo predictivo de abandono escolar
basado en Machine Learning no optimiza significativamente la
detección temprana de riesgo de deserción en la institución
educativa.
Simbólicamente: μ1 ≥ μ2
(La eficacia de detección del post-test es menor o igual a la del
pre-test).
Hipótesis Alterna ( H 1)
La implementación del modelo predictivo de abandono escolar
basado en Machine Learning optimiza significativamente la
detección temprana de riesgo de deserción en la institución
educativa.
Simbólicamente: μ1 ≤ μ2
(La eficacia de detección del post-test es significativamente mayor
que la del pre-test).
Prueba Estadística
Se empleará la prueba t de Student para muestras
relacionadas, ya que se evaluará a la misma población (la
institución educativa y sus registros) en dos momentos diferentes:
antes y después de la implementación del sistema de alertas.
Esta prueba es la adecuada para determinar si la diferencia media
entre la capacidad de respuesta del sistema manual y el sistema
automatizado es estadísticamente significativa.
Nivel de Significancia
Se establece un nivel de significancia (α) de 0.05, considerado el
estándar en investigaciones de carácter tecnológico y social para
aceptar o rechazar la hipótesis nula, garantizando un 95% de
confianza en los resultados.
Regla de Decisión
 Si el valor p (p-value) de la prueba t de Student es menor
que 0.05 (p < 0.05), se rechazará la hipótesis nula ( H 0) y
se aceptará la hipótesis alterna ¿).
 Si el valor p es mayor o igual a 0.05 ( p ≥ 0 ,05 ), se aceptará
la hipótesis nula ( H 0), concluyendo que no existe mejora
significativa.
El procesamiento y análisis de datos se realizarán con el software
Excel complementado con la librería científica SciPy de Python
para la validación de los cálculos.
REFERENCIAS
Banco Mundial. (2022). Colapso y recuperación: Cómo el
COVID-19 erosionó el capital humano y qué hacer al respecto.
Washington, DC: Banco Mundial. (Contexto internacional de la
crisis educativa).
Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5-
32.
Buttazzo, G. C. (2011). Hard Real-Time Computing Systems:
Predictable Scheduling Algorithms and Applications (3rd ed.).
Springer US.
Chawla, N. V., Bowyer, K. W., Hall, L. O., & Kegelmeyer, W. P.
(2002). SMOTE: Synthetic Minority Over-sampling Technique.
Journal of Artificial Intelligence Research, 16, 321-357.
Chen, T., & Guestrin, C. (2016). XGBoost: A Scalable Tree
Boosting System. En Proceedings of the 22nd ACM SIGKDD
International Conference on Knowledge Discovery and Data
Mining (pp. 785–794). ACM.
Fawcett, T. (2006). An introduction to ROC analysis. Pattern
Recognition Letters, 27(8), 861-874.
Géron, A. (2019). Hands-On Machine Learning with Scikit-Learn,
Keras, and TensorFlow (2nd ed.). O'Reilly Media.
Hernández Sampieri, R., Fernández Collado, C., & Baptista
Lucio, P. (2018). Metodología de la investigación (6ta ed.).
México: McGraw-Hill Interamericana.
INEI. (2024). Perú: Indicadores de Resultados de los Programas
Presupuestales, 2018-2023. Instituto Nacional de Estadística e
Informática.
Liu, J. W. (2000). Real-Time Systems. Prentice Hall.
Lutz, M. (2013). Learning Python (5th ed.). O'Reilly Media.
McKinney, W. (2017). Python for Data Analysis: Data Wrangling
with Pandas, NumPy, and IPython (2nd ed.). O'Reilly Media.
Ministerio de Educación (MINEDU). (2023). Sistema de
Información de Apoyo a la Gestión de la Institución Educativa
(SIAGIE).
Ministerio de Educación (MINEDU). (2024). Escale: Estadística
de la Calidad Educativa. Unidad de Estadística Educativa.
Pedregosa, F., et al. (2011). Scikit-learn: Machine Learning in
Python. Journal of Machine Learning Research, 12, 2825-2830.
Powers, D. M. (2011). Evaluation: from precision, recall and F-
measure to ROC, informedness, markedness and correlation.
Journal of Machine Learning Technologies, 2(1), 37-63.
Provost, F., & Fawcett, T. (2013). Data Science for Business:
What You Need to Know about Data Mining and Data-Analytic
Thinking. O'Reilly Media.
Raschka, S., & Mirjalili, V. (2019). Python Machine Learning:
Machine Learning and Deep Learning with Python, scikit-learn,
and TensorFlow 2 (3rd ed.). Packt Publishing.
Romero, C., & Ventura, S. (2010). Educational Data Mining: A
Review of the State of the Art. IEEE Transactions on Systems,
Man, and Cybernetics, Part C (Applications and Reviews), 40(6),
601-618.
Tinto, V. (1987). Leaving college: Rethinking the causes and
cures of student attrition. University of Chicago Press.
UNESCO. (2023). Informe de seguimiento de la educación en el
mundo 2023: Tecnología en la educación. París: UNESCO.
Van Rossum, G., & Drake, F. L. (2009). Python 3 Reference
Manual. CreateSpace.
Wirth, R., & Hipp, J. (2000). CRISP-DM: Towards a standard
process model for data mining. En Proceedings of the 4th
International Conference on the Practical Applications of
Knowledge Discovery and Data Mining.
Wolpert, D. H. (1992). Stacked generalization. Neural Networks,
5(2), 241-259.
Zhu, X., & Wu, X. (2004). Class Noise vs. Attribute Noise: A
Binary Classification Case Study. IEEE International Conference
on Data Mining.

También podría gustarte