Dpto.
de Sistemas
[Link] Sistemas / Lic. en Sistemas
Inteligencia de Negocios
Ing. Alejandro Dingianna
Clase #11
Unidad 5: Data mining
Data mining
La minería de datos o data mining es un proceso
técnico, automático o semiautomático, que
analiza grandes cantidades de información
dispersa para darle sentido y convertirla en
conocimiento.
Busca anomalías, patrones o correlaciones entre millones de registros
para predecir resultados, como indica el SAS Institute, uno de los
referentes mundiales en analítica de negocios.
CRISP - DM
Cross-Industry Standard Process for Data Mining
• Objetivos
Establecer una herramienta independiente de la
industria, la herramienta o la aplicación para
desarrollar proyectos de Descubrimiento del
Conocimiento
• Define pasos, tareas y salidas esperadas de las
mismas
• Fundado por DaimlerChrysler, SPSS y NCR
• Tiene 2 documentos básicos:
• Manual de referencia
• Guía del usuario
CRISP - DM
Pasos 1 y 2 de 6
Entendimiento del Negocio
Esta fase inicial tiene puesto el foco en entender los requerimientos
y objetivos del proyecto desde el punto de vista del negocio para
luego convertir este conocimiento en la definición de un problema
de data mining y en un plan preliminar para conseguir estos
objetivos.
Entendimiento de los Datos
Esta fase comienza con una primera «recolección» de datos y continua con actividades para
familiarizarse con los datos, identificar problemas de calidad y encontrar los primeros
«descubrimientos» dentro de los datos o detectar subconjuntos interesantes para formular
hipótesis sobre la información que esta oculta.
CRISP - DM
Pasos 3 y 4 de 6
Data Preparation
Esta fase involucra todas las actividades para armar el dataset
final ( los datos que van a ser incorporados a las herramientas de
modelado) a partir de los datos iniciales. Esta fase seguramente
será llevada a cabo varias veces y no necesariamente en un
orden establecido. Las tareas incluyen selección de tablas,
atributos y registros así como también la transformación y limpieza
de los datos. .
Modeling
En esta fase pueden aplicarse diversas técnicas de modelado y también se ajustan los
parámetros de las mismas para conseguir una solución optima.
CRISP - DM
Pasos 5 y 6 de 6
Evaluation
En esta etapa hay que construir uno ( o varios ) modelos que
parezca que tienen alta calidad desde el punto de vista del
análisis de datos. Antes de proceder a la puesta en producción es
importante efectuar una evaluación mas detallada del modelo y
revisar los pasos que se utilizaron para construir el modelo para
estar seguro que cumple con los objetivos del negocio. Como
conclusión de esta fase se debe tener una decisión referida al uso
de los resultados que se obtuvieron.
Deployment
Crear el modelo no es el final del proyecto. Aun en proyectos donde el propósito es
incrementar el conocimiento sobre los datos es necesario representar la información de una
forma que los usuarios puedan utilizarla. Dependiendo de los requerimientos esta fase puede
ser tan sencilla como generar un reporte o tan compleja como implementar un proceso de
data mining repetible.
KDD
KDD (Knowledge Discovery in
Databases) : es un proceso
metodológico para encontrar un
“modelo” válido, útil y entendible
que describa patrones de
acuerdo a la información, y como
modelo entendemos que es la
representación que intenta
explicar ese patrón en los datos.
SEMMA
Fue creada por SAS
Su sigla SEMMA se refiere al proceso central de hacer data mining:
❑ Sample
❑ Explore
❑ Modify
❑ Model
❑ Assesment
“SEMMA no es una metodología de minería de datos, sino una organización lógica del
conjunto de herramientas funcionales de SAS Enterprise Miner para llevar a cabo las
tareas centrales de la minería de datos.”
Fuente: [Link]
Comparativa entre metodologías
Objetivos de data mining
Métodos Descriptivos: Hallar patrones interpretables que describan
los datos.
“Que paso?” “Como paso?”
Métodos Predictivos: Usar algunas variables para predecir valores
desconocidos o futuros de otras variables.
“Que va a pasar?”
Métodos Prescriptivos: Identificar estrategias y acciones que mejoren
los resultados previstos. Es decir a partir de los datos automatizar
procesos.
“Como mejoro los procesos con los datos”
Técnicas de data mining
Algoritmos
Machine Learning Algoritmos Deep
Learning
Supervisados No Supervisados Redes
neuronales
Reducción
Clasificación Regresión de dimensión
Clustering
(PCA)
Predictiva Predictiva Descriptiva Descriptiva
Ejemplo: Clasificador
Métricas para evaluar modelos
▪ Métricas para Evaluación de Performance
Cómo evaluar la performance de un modelo?
▪ Métodos para Evaluación de Performance
Cómo obtener estimaciones confiables?
▪ Métodos para Comparación de Modelos
Cómo comparar la performance relativa entre modelos competitivos ?
Matriz de confusión
TP FN
FP TN
Accuracy - Precision – Recall – F1
Métrica más ampliamente usada
TP
Accuracy TP + TN Recall
(Exactitud) TP + FN
TP + TN + FP + FN
(verdaderos positivos /
(aciertos totales / total) positivos que deberían
haber sido detectados)
Precision TP
(Precisión) Precision x Recall
TP + FP F1 Score 2x
Precision + Recall
(verdaderos positivos /
positivos detectados)
Accuracy - Precision – Recall – F1
Medidas en clustering
Como sabemos que tan “bueno” es el
modelo generando los clusters?
Medidas en clustering
Alejandro armó un modelo “A”
Beatriz armó un modelo “B”
Cual es el mejor modelo?
Medidas en clustering
La validación externa y la validación interna son las dos categorías más
importantes para la validación de clustering. La principal diferencia es si
se usa o no información externa para la validación, es decir, información
que no es producto de la técnica de agrupación utilizada.
A diferencia de técnicas de validación externas, las de validación interna
miden el clustering únicamente basadas en información de los datos.
Evalúan que tan buena es la estructura del clustering sin necesidad de
información ajena al propio algoritmo y su resultado.
La idea de la validación externa es , una vez finalizado el algoritmo
de agrupación, se compara el clúster en el que fue asignado cada
elemento, con la etiqueta de clase que traía de antemano
(información externa).
Medidas en clustering: Validación interna
Cohesión: El miembro de cada clúster debe Separación: Los clúster deben estar ampliamente separados
ser lo más cercano posible a los otros entre ellos. Existen varios enfoques para medir esta distancia
miembros del mismo clúster. entre clúster: distancia entre el miembro más cercano,
distancia entre los miembros más distantes o la distancia
entre los centroides.
Medidas en clustering: Validación externa
Se puede generar una tabla de verdad o
matriz de confusión y utilizar las medidas
vistas anteriormente (accuracy, recall, F1,
etc)
Medidas en clustering: Validación externa
Entropía
Cantidad de clases diferentes que contiene un cluster
Para cada clúster se asume la entropía como:
Dónde 𝑃𝑟𝑖(𝑐𝑗) es la proporción de puntos de la clase 𝑐𝑗 ubicados en el clúster i o 𝐷𝑖 . La entropía
total de todo el agrupamiento (que considera todos los clústers) es:
Medidas en clustering: Validación externa
Pureza
Mide el hecho de que un clúster contenga solo una clase entre sus datos.
La pureza de cada clúster se calcula con::
La pureza total de todo el agrupamiento (considerando todos los
clusters) es :