0% encontró este documento útil (0 votos)
2 vistas20 páginas

Intro Datamining

La minería de datos es el análisis de grandes volúmenes de datos utilizando algoritmos avanzados y metodologías como SEMMA y CRISP-DM para extraer conocimiento y patrones útiles. Su objetivo es aprender de la experiencia mediante la validación y mejora continua de modelos a partir de datos recolectados. Incluye procesos como la selección, procesamiento y análisis de datos, así como la preparación y evaluación de los resultados obtenidos.

Cargado por

bnicolas370
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas20 páginas

Intro Datamining

La minería de datos es el análisis de grandes volúmenes de datos utilizando algoritmos avanzados y metodologías como SEMMA y CRISP-DM para extraer conocimiento y patrones útiles. Su objetivo es aprender de la experiencia mediante la validación y mejora continua de modelos a partir de datos recolectados. Incluye procesos como la selección, procesamiento y análisis de datos, así como la preparación y evaluación de los resultados obtenidos.

Cargado por

bnicolas370
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Minería de Datos

Business Analytics
[Link]@[Link]
Contenido
1. ¿Qué es?
2. Objetivos
3. Proceso
4. Metodologías
5. Datos
1.¿Qué es?

Básicamente es análisis de datos


¿Por qué?
• Volumen de datos
• Nuevos Algoritmos (fuzzy logic, redes neuronales, sistemas expertos…)
• Software amigable automático (para no expertos en estadística)
• Potencia de cálculo y cómputo de las máquinas
Qué disciplinas incluye
Estadística – Inteligencia Artificial – Machine Learning
1. ¿qué es?
• Aprender a partir de la observación y análisis de la realidad
• Diferencia con lo que hemos visto hasta ahora
DATA DRIVEN frente a Theory Driven

• Técnicas estadísticas • Aprendizaje automático


– asumen una determinada estructura/ distribución – dirigidas por los datos. Realizan un mínimo de supuestos
– tienen que determinar los parámetros (técnicas – pueden capturar cambios estructurales en los datos
paramétricas) – determinan los parámetros y además la estructura del
– pueden funcionar con pocos datos. Verificación de modelo
hipótesis – admiten formulación genérica como búsqueda.
– basadas fundamentalmente en la estadística – basadas fundamentalmente en la computación (algoritmos)
- Aspiran a generalizar - No generalizables
2. Objetivo
• Extraer conocimiento a base de ejemplos

¿Qué significa?
El modelo se genera a partir de una matriz de casos
Con nuevos casos se valida el modelo
Los nuevos casos se añaden a la matriz de conocimientos para
perfeccionar el modelo

EL MODELO VA “APRENDIENDO” CON LA EXPERIENCIA


2. Objetivos
• Descripción
valores, recuentos
• Asociación
categorías
• Predicción
valor – grupo de pertenencia
• Interpretación
texto - símbolos
• Clasificación
construcción de grupos – asignación a grupos
3. Proceso

Realidad Realidad
Representación de la realidad

Problema [Link]ón Info + contexto + Uso de la info:


Información [Link]ón [Link]álisis
de de experiencia+…= Decisión
necesaria de los datos de datos
decisión información conocimiento justificada

Cualquier análisis de calidad considera la parte previa para plantear datos necesarios y objetivos de información.
Además debe utilizar los resultados para su aplicación en la realidad
3. Proceso
Más columnas == más variables
Más filas == más muestra
• Ciclo del data mining
1. Selección de datos: v. dependientes/objetivo
Fuentes de datos
v. independientes/factores Etl
Datawarehouse
2. Procesamiento de datos
3. Determinación del modelo (estadística, gráficos,…)
4. Análisis de resultados (coherencia, comparación, interpretación)
5. Validación
6. Uso
datamining
3. Proceso
1. Formular el problema
2. Determinar la representación (variables, categorías, ocasiones/individuos)
– directamente – hablando con expertos– a partir de otras técnicas
3. Identificar y recolectar datos de entrenamiento (bases de datos, ficheros, …)
4. Preparar datos para análisis
5. Selección de modelo, construcción y entrenamiento
6. Evaluar lo aprendido (validación cruzada, expertos…)
7. Integrar la base de conocimiento a la espera de nuevos datos tras acciones
8. Uso del conocimiento
Datos. Qué tener en cuenta?
Objetivo/problema:
Qué se quiere aprender
clasificar, asociar, predecir, agrupar
Variables/atributos
Cómo mido el concepto estudiado
Categorías/clases
Posibles valores de las variables
Individuos/ocasiones/ejemplos
Cada vez que mido/observo/registro las variables
Datos: Preparación
• Integración de varias fuentes → DW
Datos: Preparación
Limpieza de outliers, faltantes, incoherentes
Datos: Preparación
• Transformaciones de las variables

𝑥−𝜇
normalización Z = 𝜎

pasar de continuas a discretas


intervalos: edad → joven-adulto-mayor
Datos: Preparación
Reducción
reducir la dimensión → Análisis de Componentes principales
m variables → k<m vectores que resumen las m variables
Análisis: Elección del método
Criterios:

1. Objetivos de información
Descripción, Clasificación, predicción, asociación, asignación,…
2. Tipo de datos
Cualitativos, textos, imágenes, cuantitativos, fechas,
coordenadas geográficas, presencia/ausencia,…
Análisis: Elección del método

Bala Deshpande, V.K. (2014) Predictive Analytics and Data Mining Concepts and Practice with RapidMiner. Boston: Morgan Kauffmann
Análisis: Técnicas (algunas)
• Árbol de decisión • A. Discriminante
• Árbol de regresión • Regresiones
• Clasificación bayesiana
• Red neuronal
• Análisis de Sentimientos
• Cluster • Text mining
• Reglas de asociación • Reconocimiento de
• Máquina de Vector soporte imágenes
• …………
Metodologías: SEMMA
La metodología SEMMA se utiliza para descubrir patrones de negocio desconocidos.
El nombre refiere a las cinco fases básicas del proceso (del inglés Sample, Explore,
Modify, Model, Assess) (Matignon, 2009), (SAS Institute, 2009). Las etapas consisten
en lo siguiente:
• Sample: Obtener un subconjunto de los datos suficientemente representativo para
poder obtener información útil de ellos y procesarlos fácilmente.
• Explore: buscar patrones en los datos.
• Modify: Crear y transformar variables o incluso eliminar las que son innecesarias.
• Model: Seleccionar y aplicar el modelo que mejor se ajuste a los datos.
• Assess: determinar si los resultados son útiles y confiables. Testear los resultados
contra datos conocidos.
Metodologías:CRISP
CRISP-dM (Cross-Industry Standard Process for data Mining: [Link] por IBM (SPSS)
• Comprensión del negocio: abarca la comprensión de los objetivos de proyecto y las exigencias
desde la perspectiva de negocio.
• Comprensión de los datos: implica la recolección de datos inicial y sigue con las actividades
que le permiten descubrir subconjuntos relevantes para formar hipótesis relacionadas a la
información oculta.
• Preparación de los datos: cubre todas las actividades necesarias para construir el conjunto de
datos final a partir de los datos en bruto iniciales.
• Modelado: implica la selección de varias técnicas de modelado y sus parámetros son calibrados a
valores óptimos.
• Evaluación: consiste en evaluar a fondo el modelo y la revisión de los pasos ejecutados para
crearlo, para comparar el modelo correctamente obtenido con los objetivos establecidos.
• Despliegue: abarca desde la generación de un informe hasta la realización repetida de un proceso
de minería de datos a través de la organización.
Metodología: KDD
Knowledge Discovered in Databases Fayyard (1996)
• Selección de datos
• Preprocesamiento de datos
• Transformación
• Minería de datos
• Evaluación de resultados
• Implantación del conocimiento

También podría gustarte