Lab 02 – Preprocesamiento de datos
• Curso: Data Mining para ingenieros
industriales
• Software: Orange-DM
• Instructor: Elmer González Herrera, Doctor en
Ingeniería Industrial
Preprocesamiento de datos
Objetivos
• - Comprender el preprocesamiento de datos
• - Manejar valores faltantes (missing values)
• - Normalizar datos
• - Detectar valores atípicos (outliers)
¿Por qué es necesario el
preprocesamiento de datos?
• - Los datos del mundo real son desordenados
• - Valores faltantes y ruidosos
• - Afecta la precisión del modelo
• - Esencial antes de modelar
Datasets
• - Heart Disease (recomendado)
• - Automobile dataset
• - Opcional: Machine sensor data
link: UPAO Data Analysis in Engineering
Repository:
[Link]
LW8t799Hbi-WH32mmOxS?usp=sharing
Workflow en Orange-DM
• File → Select Columns → Impute →
Normalize → Data Table → Box Plot
Paso 1: Seleccionar Columnas
• - Aplicar widget Select Columns
• - Identificar atributos (features) y objetivo
(target)
• - Remover variables irrelevantes
Paso 2: Manejo de valores faltantes
• - Use el widget Impute
• - Métodos: Mean, Median, Most Frequent
• - Impute sustituye valores faltantes por
valores ya sea calculados a partir de los datos
o fijados por el usuario.
Paso 3: Normalizar datos
• - Para normalizar una variable, sustraemos la
media desde cada valor y luego lo dividimos
por la desviación estándar. Esta operación es
llamada estandarización
• - En efecto, estamos expresando cada valor
como el “número de desviaciones estándar
lejos de la media,” también llamado un z-score
Normalizar datos
• - La normalización es una manera de traer
todas las variables a una misma escala. Otro
enfoque popular es re-escalando cada variable
a una escala [0,1]. Esto es hecho al restar el
valor mínimo y luego dividirlo por el rango.
Restar el mínimo desplaza el origen de la
variable a cero.
• - Estandarizar los rangos de los atributos o
features
Normalizar datos
• - Preprocess es crucial para lograr resultados
de análisis de mejor calidad. Este widget
ofrece varios métodos de preprocesamiento
que se pueden combinar en una única
canalización de preprocesamiento
Paso 4: Inspeccionar datos
• - Usar el widget Data Table
• - Verificar que el dataset esté limpio
Paso 5: Detectar Outliers
• - Usar el widget Box Plot
• - Identificar valores extremos
• - El widget Box Plot muestra las distribuciones
de los valores de los atributos. Se recomienda
comprobar cualquier dato nuevo con este
widget para detectar rápidamente anomalías,
como valores duplicados (e.g., gris y gris),
outliers, y similares.
Detectar Outliers
media mediana
desviación
standard
Q1 Q3
mínimo máximo
IQR: Q3 – Q1 = 61 -48 = 13
Valor más pequeño NO outlier permitido =
Q1 – 1.5 (IQR) = 48 – 1.5(13) = 28.5
Valor más grande NO outlier permitido =
Q1 + 1.5 (IQR) = 48 + 1.5(13) = 80.5
Tareas prácticas
• 1. Cargar dataset
• 2. Limpiar valores faltantes
• 3. Normalizar datos
• 4. Detectar outliers
Entregables (Deliverables)
• - Captura de pantallas
• - Mini informe
• - Explicación de los métodos usados
Reflexión
• - ¿Qué método funcionó mejor?
• - ¿Por qué es importante el
preprocesamiento?
• - ¿Aplicaciones industriales?