0% encontró este documento útil (0 votos)
2 vistas24 páginas

Unidad 5 - Datamining

La minería de datos es un proceso que analiza grandes volúmenes de información para identificar patrones y predecir resultados. Se basa en metodologías como CRISP-DM y KDD, que establecen pasos para entender el negocio, preparar datos, modelar y evaluar resultados. Además, se utilizan técnicas de machine learning y métricas de evaluación para medir la efectividad de los modelos generados.

Cargado por

Maculay Maculay
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas24 páginas

Unidad 5 - Datamining

La minería de datos es un proceso que analiza grandes volúmenes de información para identificar patrones y predecir resultados. Se basa en metodologías como CRISP-DM y KDD, que establecen pasos para entender el negocio, preparar datos, modelar y evaluar resultados. Además, se utilizan técnicas de machine learning y métricas de evaluación para medir la efectividad de los modelos generados.

Cargado por

Maculay Maculay
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Dpto.

de Sistemas

[Link] Sistemas / Lic. en Sistemas

Inteligencia de Negocios
Ing. Alejandro Dingianna

Clase #11
Unidad 5: Data mining
Data mining

La minería de datos o data mining es un proceso


técnico, automático o semiautomático, que
analiza grandes cantidades de información
dispersa para darle sentido y convertirla en
conocimiento.

Busca anomalías, patrones o correlaciones entre millones de registros


para predecir resultados, como indica el SAS Institute, uno de los
referentes mundiales en analítica de negocios.
CRISP - DM

Cross-Industry Standard Process for Data Mining


• Objetivos
Establecer una herramienta independiente de la
industria, la herramienta o la aplicación para
desarrollar proyectos de Descubrimiento del
Conocimiento
• Define pasos, tareas y salidas esperadas de las
mismas
• Fundado por DaimlerChrysler, SPSS y NCR
• Tiene 2 documentos básicos:
• Manual de referencia
• Guía del usuario
CRISP - DM
Pasos 1 y 2 de 6

Entendimiento del Negocio


Esta fase inicial tiene puesto el foco en entender los requerimientos
y objetivos del proyecto desde el punto de vista del negocio para
luego convertir este conocimiento en la definición de un problema
de data mining y en un plan preliminar para conseguir estos
objetivos.

Entendimiento de los Datos


Esta fase comienza con una primera «recolección» de datos y continua con actividades para
familiarizarse con los datos, identificar problemas de calidad y encontrar los primeros
«descubrimientos» dentro de los datos o detectar subconjuntos interesantes para formular
hipótesis sobre la información que esta oculta.
CRISP - DM
Pasos 3 y 4 de 6

Data Preparation
Esta fase involucra todas las actividades para armar el dataset
final ( los datos que van a ser incorporados a las herramientas de
modelado) a partir de los datos iniciales. Esta fase seguramente
será llevada a cabo varias veces y no necesariamente en un
orden establecido. Las tareas incluyen selección de tablas,
atributos y registros así como también la transformación y limpieza
de los datos. .

Modeling
En esta fase pueden aplicarse diversas técnicas de modelado y también se ajustan los
parámetros de las mismas para conseguir una solución optima.
CRISP - DM
Pasos 5 y 6 de 6

Evaluation
En esta etapa hay que construir uno ( o varios ) modelos que
parezca que tienen alta calidad desde el punto de vista del
análisis de datos. Antes de proceder a la puesta en producción es
importante efectuar una evaluación mas detallada del modelo y
revisar los pasos que se utilizaron para construir el modelo para
estar seguro que cumple con los objetivos del negocio. Como
conclusión de esta fase se debe tener una decisión referida al uso
de los resultados que se obtuvieron.
Deployment
Crear el modelo no es el final del proyecto. Aun en proyectos donde el propósito es
incrementar el conocimiento sobre los datos es necesario representar la información de una
forma que los usuarios puedan utilizarla. Dependiendo de los requerimientos esta fase puede
ser tan sencilla como generar un reporte o tan compleja como implementar un proceso de
data mining repetible.
KDD

KDD (Knowledge Discovery in


Databases) : es un proceso
metodológico para encontrar un
“modelo” válido, útil y entendible
que describa patrones de
acuerdo a la información, y como
modelo entendemos que es la
representación que intenta
explicar ese patrón en los datos.
SEMMA
Fue creada por SAS
Su sigla SEMMA se refiere al proceso central de hacer data mining:

❑ Sample
❑ Explore
❑ Modify
❑ Model
❑ Assesment

“SEMMA no es una metodología de minería de datos, sino una organización lógica del
conjunto de herramientas funcionales de SAS Enterprise Miner para llevar a cabo las
tareas centrales de la minería de datos.”

Fuente: [Link]
Comparativa entre metodologías
Objetivos de data mining

Métodos Descriptivos: Hallar patrones interpretables que describan


los datos.
“Que paso?” “Como paso?”

Métodos Predictivos: Usar algunas variables para predecir valores


desconocidos o futuros de otras variables.
“Que va a pasar?”

Métodos Prescriptivos: Identificar estrategias y acciones que mejoren


los resultados previstos. Es decir a partir de los datos automatizar
procesos.
“Como mejoro los procesos con los datos”
Técnicas de data mining
Algoritmos
Machine Learning Algoritmos Deep
Learning

Supervisados No Supervisados Redes


neuronales

Reducción
Clasificación Regresión de dimensión
Clustering
(PCA)

Predictiva Predictiva Descriptiva Descriptiva


Ejemplo: Clasificador
Métricas para evaluar modelos

▪ Métricas para Evaluación de Performance

Cómo evaluar la performance de un modelo?

▪ Métodos para Evaluación de Performance

Cómo obtener estimaciones confiables?

▪ Métodos para Comparación de Modelos

Cómo comparar la performance relativa entre modelos competitivos ?


Matriz de confusión

TP FN

FP TN
Accuracy - Precision – Recall – F1
Métrica más ampliamente usada

TP
Accuracy TP + TN Recall
(Exactitud) TP + FN
TP + TN + FP + FN
(verdaderos positivos /
(aciertos totales / total) positivos que deberían
haber sido detectados)

Precision TP
(Precisión) Precision x Recall
TP + FP F1 Score 2x
Precision + Recall
(verdaderos positivos /
positivos detectados)
Accuracy - Precision – Recall – F1
Medidas en clustering

Como sabemos que tan “bueno” es el


modelo generando los clusters?
Medidas en clustering

Alejandro armó un modelo “A”

Beatriz armó un modelo “B”

Cual es el mejor modelo?


Medidas en clustering
La validación externa y la validación interna son las dos categorías más
importantes para la validación de clustering. La principal diferencia es si
se usa o no información externa para la validación, es decir, información
que no es producto de la técnica de agrupación utilizada.

A diferencia de técnicas de validación externas, las de validación interna


miden el clustering únicamente basadas en información de los datos.
Evalúan que tan buena es la estructura del clustering sin necesidad de
información ajena al propio algoritmo y su resultado.

La idea de la validación externa es , una vez finalizado el algoritmo


de agrupación, se compara el clúster en el que fue asignado cada
elemento, con la etiqueta de clase que traía de antemano
(información externa).
Medidas en clustering: Validación interna

Cohesión: El miembro de cada clúster debe Separación: Los clúster deben estar ampliamente separados
ser lo más cercano posible a los otros entre ellos. Existen varios enfoques para medir esta distancia
miembros del mismo clúster. entre clúster: distancia entre el miembro más cercano,
distancia entre los miembros más distantes o la distancia
entre los centroides.
Medidas en clustering: Validación externa
Se puede generar una tabla de verdad o
matriz de confusión y utilizar las medidas
vistas anteriormente (accuracy, recall, F1,
etc)
Medidas en clustering: Validación externa
Entropía
Cantidad de clases diferentes que contiene un cluster

Para cada clúster se asume la entropía como:

Dónde 𝑃𝑟𝑖(𝑐𝑗) es la proporción de puntos de la clase 𝑐𝑗 ubicados en el clúster i o 𝐷𝑖 . La entropía


total de todo el agrupamiento (que considera todos los clústers) es:
Medidas en clustering: Validación externa
Pureza
Mide el hecho de que un clúster contenga solo una clase entre sus datos.

La pureza de cada clúster se calcula con::

La pureza total de todo el agrupamiento (considerando todos los


clusters) es :

También podría gustarte