MODELADO DE
DATOS
Etapa: Modeling
CRISP-DM: Fase de “Modelado” (Modeling)
En esta fase se seleccionan y aplican diferentes técnicas
(algoritmos) de modelado, calibrando sus parámetros
para conseguir sus valores óptimos. Para un mismo
problema de minería de datos tenemos diferentes
técnicas susceptibles de ser usadas y, dado que cada una
de ellas puede tener requisitos diferentes en la forma en
que deben presentarse los datos de entrada, es probable
que sea necesario realizar ciclos adicionales de
“preparación de los datos”.
Las principales tareas que abarca esta fase son las
siguientes:
1. Selección de la técnica de modelado. Aunque ya desde el
principio del proyecto, en la fase de comprensión del negocio, se
realiza una selección preliminar del tipo de técnica a emplear, en
este caso la tarea se centra en poner “nombre y apellidos” a la
técnica, de entre las diferentes opciones de configuración,
versionado, etc. ([Link]. distribuciones uniformes, ausencia de
missing values, atributos simbólicos para la clase, etc.), por lo
que las asunciones realizadas para seleccionar una u otra técnica
deben quedar documentadas.
Las principales tareas que abarca esta fase son las
siguientes:
2. Diseño de los test. Antes de ponernos a generar un
modelo, debemos diseñar el procedimiento según el
cual va a medir la calidad y validez del modelo. Esto
abarca la métrica concreta de error que se va a
emplear, o la descripción del plan para entrenar y
evaluar los modelos, incluyendo el diseño de la
separación entre datos de entrenamiento, de testeo y
de validación.
Las principales tareas que abarca esta fase son las
siguientes:
3. Construcción del modelo. Consiste en la ejecución
del algoritmo de modelado seleccionado sobre el
dataset preparado siguiendo el procedimiento
diseñado. Es importante documentar la
parametrización utilizada y la justificación de la
elección, así como una descripción del modelo
resultante, lo interpretable que resulta y las
dificultades para dicha interpretación.
Las principales tareas que abarca esta fase son las
siguientes:
4. Evaluación del modelo. Partiendo de la calidad del modelo o
modelos obtenidos según las métricas definidas en el
procedimiento diseñado, se realiza también una interpretación y
contraste preliminares de los modelos según el conocimiento del
dominio y los objetivos de éxito planteados en términos de
negocio. La conclusión de esta tarea puede implicar una revisión
de la tarea de construcción del modelo para cambiar la
configuración de los parámetros de la técnica, y así afinar en la
calidad del resultado.
Consideraciones para modelado
Cuando decida el modelo(s) que va a utilizar, tenga en cuenta los siguientes aspectos
que pueden afectar a sus opciones:
● ¿Requiere el modelo que los datos se dividan en conjuntos de entrenamiento y
prueba?
● ¿Dispone de datos suficientes para producir resultados fiables para un modelo
concreto?
● ¿Requiere el modelo un cierto nivel de calidad de datos? ¿Puede alcanzar este
nivel con los datos que dispone?
● ¿Son sus datos el tipo correcto para un modelo concreto? En caso contrario,
¿puede realizar las conversiones necesarias utilizando nodos de manipulación de
datos?
Resumen de la Metodología CRISP-DM - Modelado - Caso de
éxito “Aplicación de la metodología CRISP-DM a un proyecto
de Minería de datos en el Entorno Universitario”
Objetivo general; Aplicar CRISP-DM para observar que mejoras se pueden
realizar en la oferta académica en la universidad Carlos III de Madrid.
● Seleccionar Técnica de modelado
○ Técnica de modelado (Algoritmos en general/Herramienta Oracle
Data Mining).
○ Supuestos modelos (Modelo de regresión).
● Generar el Plan de Pruebas
○ Plan de pruebas (Calidad y validez del modelo)
■ Error cuadrático medio (RMSE, Root mean squared error).
■ Error absoluto medio (MAE, Mean absolute error).
■ Confianza predictiva (Predictive confidence).
Resumen de la Metodología CRISP-DM - Modelado - Caso de
éxito “Aplicación de la metodología CRISP-DM a un proyecto
de Minería de datos en el Entorno Universitario”
● Construir el Modelo - Se describen los ajustes de parámetros del modelo
escogido.
○ Ajuste de parámetros, se ajustan los hiperparámetros en relación con los
objetivos definidos.
○ Modelo, se ejecutan sobre conjuntos de datos de entrenamiento, en este
caso 60%, 40%.
○ Descripción del modelo, se describen los resultados de la ejecución de cada
modelo para cada objetivo.
■ Confianza predictiva para el algoritmo SVM = 68.05%.
● Evaluar el modelo
○ Evaluar el modelo, evalúa los modelos generados desde un punto de vista de
los objetivos de negocio, una vez evaluado decide si los objetivos han sido
cumplidos.
○ Revisión del proceso, en términos del plan de prueba.
BIBLIOGRAFÍA:
[Link]
lecting-techniques.
[Link]
Galan_Cortina.pdf
[Link]
[Link]