SEMESTER EX AM PREPARATION
Data Preprocessing
Comprehensive Study Material & Guide — Data Mining & Warehousing
Why Preprocess Data? Real-world data is inherently "dirty"—frequently incomplete, noisy, inconsistent, or
redundant. High-quality data is an essential prerequisite for accurate decision-making and optimal machine learning
performance.
1. Overview of Data Preprocessing
Data Preprocessing involves cleaning, transforming, and organizing raw data into an understandable, structured,
and high-quality format suitable for analysis and model training.
Key Preprocessing Tasks:
• Data Cleaning: Handles missing values, smooths noisy data, and identifies or removes outliers.
• Data Integration: Merges data from multiple heterogeneous sources into a unified data store.
• Data Reduction: Reduces data volume while preserving analytical integrity.
• Data Transformation & Discretization: Scales, normalizes, and converts continuous values into discrete
intervals.
2. Data Cleaning
Data cleaning routines aim to fill in missing values, smooth out noise, detect outliers, and correct data
inconsistencies.
Handling Missing Data
• Ignore the Tuple: Typically used in classification when the class label is missing.
• Manual Imputation: Feasible only for small datasets; highly time-consuming.
• Global Constant: Replace missing values with a designated placeholder like "Unknown" or ∞.
• Central Tendency Measures:
◦ Use the mean for symmetric data distributions.
◦ Use the median for skewed data distributions.
• Most Probable Value: Predict missing values using algorithms like Decision Trees, Naïve Bayes, or Regression
models.
Handling Noisy Data
Noise refers to random errors or variances in measured variables.
• Binning: Sort data and partition into bins (equal-frequency or equal-width), then smooth by bin means,
medians, or boundaries.
• Regression: Fit data to a regression equation (e.g., y = mx + c) to eliminate variance and smooth values.
Data Preprocessing — Semester Exam Study Guide Page 1 of 3
• Clustering / Outlier Analysis: Group similar values into clusters; data points falling far outside clusters are
flagged as noise/outliers.
3. Data Integration
Data Integration merges data from multiple heterogeneous databases, files, or data cubes into a coherent data
repository.
CHALLENGE EXPLANATION SOLUTION / TECHNIQUE
Schema Entity identification problem (e.g., mapping Metadata matching & standardization.
Integration cust_id to customer_number).
Redundancy Duplicate or derived attributes (e.g., storing both Correlation analysis (χ² test for categorical,
birth_date and age). Pearson for numerical).
Data Value Differing units, scales, or representations (e.g., Data normalization & attribute value
Conflicts metric vs. imperial units). mapping.
4. Data Reduction
Data reduction techniques produce a reduced representation of the dataset that is significantly smaller in volume
while retaining original analytical results.
Data Reduction Strategies:
• Dimensionality Reduction: Removes redundant or irrelevant features.
◦ Methods: Principal Component Analysis (PCA), Feature Selection (forward selection, backward elimination),
Wavelet Transforms.
• Numerosity Reduction: Replaces original data with smaller alternative representations.
◦ Parametric: Fitting data to parametric models (e.g., Linear Regression, Log-linear models).
◦ Non-Parametric: Histograms, Clustering, Sampling.
• Data Compression: Transforms data into compressed representations (Lossless or Lossy).
5. Data Transformation
Data Transformation converts or consolidates data into suitable forms for mining and algorithm training.
Common Transformation Methods:
• Smoothing: Removes noise (e.g., Binning, Regression).
• Aggregation: Summarizes data (e.g., aggregating daily transactions into monthly totals).
• Generalization: Replaces low-level raw values with higher-level concepts (e.g., replacing exact age 22 with
"Young").
• Normalization: Scales numerical values into a specific structured range:
Min-Max Normalization: Maps value v to v' in range [new_minA, new_maxA]:
v' = [(v − minA) / (maxA − minA)] × (new_maxA − new_minA) + new_minA
Data Preprocessing — Semester Exam Study Guide Page 2 of 3
Z-Score Normalization (Zero-Mean): Uses mean (μ) and standard deviation (σ):
v' = (v − μA) / σA
Decimal Scaling: Normalizes by moving the decimal point of attribute A:
v' = v / 10j (where j is the smallest integer such that max(|v'|) < 1)
6. Data Discretization
Data Discretization reduces continuous attribute values by dividing them into intervals, replacing raw continuous
data with nominal or categorical interval labels.
Discretization Methods:
• Binning: Unsupervised discretization based on bin intervals (equal-width or equal-frequency).
• Histogram Analysis: Unsupervised partitioning of attribute values into buckets/ranges.
• Cluster Analysis: Groups values into clusters; cluster boundaries serve as discretization split points.
• Decision Tree Analysis: Supervised top-down method where split values at tree nodes act as interval
boundaries.
• Concept Hierarchies: Recursively reduces low-level concepts to high-level abstractions (e.g., City → State →
Country).
Quick Exam Summary Reference
PREPROCESSING STEP PRIMARY OBJECTIVE KEY TECHNIQUES / ALGORITHMS
Data Cleaning Fill missing values & smooth noise Mean/Median Imputation, Binning, Regression
Data Integration Combine heterogeneous sources Schema Matching, Correlation Analysis (χ²)
Data Reduction Compress data size / dimensions PCA, Feature Selection, Sampling, Histograms
Data Transformation Normalize & scale attribute values Min-Max, Z-score Normalization, Aggregation
Data Discretization Convert continuous to categorical Binning, Clustering, Concept Hierarchies
Data Preprocessing — Semester Exam Study Guide Page 3 of 3