Module 5 Lecture Notes
Module 5 Lecture Notes
Definition
Applications
Healthcare diagnostics
Fraud detection
Scientific research
Cybersecurity
Data Warehouse
Purpose
Data Mining
Data mining extracts hidden knowledge and patterns from the data stored
in databases or data warehouses.
Relationship
Generates actionable
Provides organized data
insights
Key Point
Data mining works more efficiently when data has already been:
Collected
Cleaned
Integrated
KDD Process
Raw Data
│
▼
Data Selection
│
▼
Data Cleansing
│
▼
Data Enrichment
│
▼
Data Transformation
│
▼
Data Mining
│
▼
Knowledge Presentation
Example
A retailer selects:
Activities
Example
Name
Phone Number
Enriched Data:
Age
Income
Credit Rating
Occupation
Examples
Original Transformed
Data Data
Product
Item Codes
Categories
Geographic
ZIP Codes
Regions
Income
Income Ranges
Values
Examples:
Association Rules
Classification
Clustering
Sequential Patterns
Methods
Reports
Graphs
Dashboards
Tables
Visualizations
Customer Name
ZIP Code
Phone Number
Purchase Date
Product Code
Price
Quantity
Total Amount
Association Rule
Sequential Pattern
Buy Camera
↓
Buy Accessories
↓
Buy Maintenance Products
Classification
Frequent Shoppers
Discount Seekers
Premium Buyers
Seasonal Buyers
5. Goals of Data Mining
5.1 Prediction
Examples
Sales forecasting
Weather prediction
Earthquake prediction
Retail Example
Predict:
5.2 Identification
Examples
Fraud detection
Intrusion detection
Face recognition
Gene identification
Cybersecurity Example
Login patterns
CPU usage
Example
1. Discount Seekers
2. Loyal Customers
3. Brand-Conscious Buyers
4. Occasional Shoppers
5. Impulse Buyers
Benefits
Targeted marketing
Customer segmentation
Risk analysis
5.4 Optimization
Objectives
Maximize profit
Minimize cost
Optimize inventory
Examples
Workforce scheduling
1. Association Rules
Example
Handbag → Shoes
Meaning:
Customers buying handbags often buy shoes.
Applications
Recommendation Systems
Cross-Selling
2. Classification Hierarchies
Example
Excellent
│
Good
│
Average
│
Poor
│
Very Poor
Applications
Loan approval
Medical diagnosis
Customer segmentation
3. Sequential Patterns
Camera Purchase
↓
Photographic Supplies
↓
Accessories
Applications
4. Time-Series Patterns
Example
Applications
Weather forecasting
5. Clustering
Example
Customer Segments:
Applications
Customer segmentation
Disease categorization
Image processing
Example: Mathematical
Example: Data mining
proofs
Hidden knowledge
Predictable conclusions
discovery
Rules
IF Bread is purchased
THEN Butter is likely purchased
Decision Trees
Income?
│
├── High → Premium Customer
└── Low → Budget Customer
Neural Networks
Used for:
Pattern recognition
Prediction
Classification
Semantic Networks
Class Hierarchies
9. Summary
Key Concepts
1. Data Selection
2. Data Cleansing
3. Data Enrichment
4. Data Transformation
5. Data Mining
6. Knowledge Presentation
Major goals:
o Prediction
o Identification
o Classification
o Optimization
o Association Rules
o Classification Hierarchies
o Sequential Patterns
o Time-Series Patterns
o Clustering
Lecture Notes: 28.2 Association Rules
Introduction
Definition
An Association Rule identifies patterns showing how the occurrence of
one set of items influences the occurrence of another set of items.
General Form
X→Y
Where:
Meaning:
Example
Milk → Juice
Market-Basket Analysis
Sample Transactions
Transaction
Items Purchased
ID
Itemset
Examples
{Milk}
{Milk, Juice}
{Bread, Cookies}
Support
Definition
Formula
Transactions containing X ∪ Y
Support( X →Y )=
Total Transactions
Example
Itemset:
{Milk, Juice}
Appears in:
Transaction 101
Transaction 792
Total transactions = 4
2
Support= =0.5=50 %
4
Interpretation
Confidence
Definition
Formula
Support ( X ∪ Y )
Confidence( X → Y )=
Support (X )
Example
Rule:
Milk → Juice
Milk appears in:
101
792
1130
Total = 3 transactions
101
792
Total = 2 transactions
2
Confidence= =66.7 %
3
Interpretation
Support Confidence
Example
Frequent Itemsets:
{Milk}
{Bread}
{Juice}
{Cookies}
{Milk, Juice}
{Bread, Cookies}
Example:
If
is frequent,
then
{Milk, Bread}
{Milk, Juice}
{Bread, Juice}
2. Antimonotonicity Property
Example:
If
{Eggs}
is infrequent,
then
{Milk, Eggs}
{Bread, Eggs}
{Milk, Bread, Eggs}
Purpose
To discover all frequent itemsets efficiently.
Key Idea
Use:
Downward Closure
Antimonotonicity
Apriori Steps
Step 1
C1
Example:
{Milk}
{Bread}
{Juice}
{Cookies}
{Eggs}
{Coffee}
Step 2
Compute Supports
Suppo
Item
rt
Milk 0.75
Bread 0.50
Juice 0.50
Cookie
0.50
s
Eggs 0.25
Coffee 0.25
Step 3
L1 =
{Milk}
{Bread}
{Juice}
{Cookies}
Step 4
{Milk,Bread}
{Milk,Juice}
{Bread,Juice}
{Milk,Cookies}
{Bread,Cookies}
{Juice,Cookies}
Step 5
Compute Supports
Suppo
Itemset
rt
Milk,Bread 0.25
Milk,Juice 0.50
Bread,Juice 0.25
Milk,Cookies 0.25
Bread,Cooki
0.50
es
Juice,Cookie
0.25
s
Step 6
Step 7
Advantages
Simple
Easy implementation
Disadvantages
Purpose
Working
Database
↓
Take Sample
↓
Find Frequent Itemsets
↓
Check Negative Border
↓
Validate in Full Database
Negative Border
Importance
Example
Items:
{A,B,C,D,E}
Frequent Sets:
{A}
{B}
{C}
{D}
{AB}
{AC}
{BC}
{AD}
{CD}
{ABC}
Negative Border:
{E}
{BD}
{ACD}
Advantages
Faster
Disadvantages
Example
(1000
2 )
=499,500
candidate 2-itemsets.
Features
No candidate generation
Compact storage
Faster mining
FP-Tree Construction
Step 1
Scan database
Example:
Milk = 3
Bread = 2
Cookies = 2
Juice = 2
Step 2
Step 3
Insert transactions into tree.
Example
Transaction:
Stored as:
Root
└─Milk
└─Bread
└─Cookies
└─Juice
FP-Growth Algorithm
Steps
1. Build FP-tree.
4. Mine recursively.
Output
Frequent Patterns:
{Milk}
{Bread}
{Cookies}
{Juice}
{Milk,Juice}
{Bread,Cookies}
Advantages
No candidate generation
High performance
Idea
Working
Database
↓
Partition 1
Partition 2
Partition 3
↓
Find Local Frequent Itemsets
↓
Merge Results
↓
Find Global Frequent Itemsets
Two Passes
Pass 1
Pass 2
Benefits
Suitable for very large databases
Example
Beverages
├─ Bottled Water
└─ Juices
Desserts
├─ Ice Cream
└─ Frozen Yogurt
Rule Example
Single-Dimensional Rule
Items_Bought(Milk)
→
Items_Bought(Juice)
Multidimensional Rule
Time(6:30–8:00)
→
Items_Bought(Milk)
Attribute Types
Type Example
Categorica Product
l Type
Quantitati Salary,
ve Time
Quantitative Data Handling
Example:
Salary Category
30000– Middle
74999 Income
Example
Potato Chips
→
NOT Bottled Water
Challenges
Example
Positive Rule:
Days Chips
→
Topsy Soft Drink
Days Chips
→
NOT Joke Soft Drink
28.2.7 Additional Considerations for Association Rules
10,000+ products
Examples:
Summer purchases
Winter purchases
Regional preferences
Categories
Subcategories
Brands
Common problems:
Missing data
Incorrect entries
Conflicting information
Redundant records
Candidate
Yes Yes No Yes
Generation
Moderat
Speed Fast Very Fast Fast
e
Association Rule: X → Y
Measures:
Support = Frequency
Confidence = Strength
Major Algorithms:
Apriori
Sampling
FP-Growth
Partition
Special Rules:
Hierarchical Rules
Multidimensional Rules
Negative Rules
Key Properties:
Downward Closure
Antimonotonicity
Applications:
Recommendation Systems
Retail Analytics
Fraud Detection
Business Intelligence
28.3 Classification
Introduction
Definition
Good Risk
Fair Risk
Poor Risk
Salary
Marital Status
Account Balance
Age
Classification Process
Input attributes
Example:
C1 50K 30 Yes
C2 20K 22 No
Objectives of Classification
1. High Accuracy
3. Scalability
Definition
Components
Componen
Description
t
Married?
/ \
Yes No
| |
Salary Acct_Balance
/ | \ / \
<20K 20-50K ≥50K <5K ≥5K
| | | | |
Poor Fair Good Poor Age
|
<25 ≥25
| |
Fair Good
Rule 1
IF Married = Yes
AND Salary ≥ 50K
THEN Good Risk
Rule 2
IF Married = No
AND Account Balance < 5K
THEN Poor Risk
Rule 3
IF Married = No
AND Account Balance ≥ 5K
AND Age ≥ 25
THEN Good Risk
Decision Tree Induction Algorithm
Entropy
Definition
Formula
n
I (S 1 , S2 , … , S n)=−∑ pi log 2 p i
i=1
Where:
Interpretation
Entro
Meaning
py
0 Pure dataset
Maximum
1
uncertainty
For an attribute A:
m
∣Sj∣
E( A)=∑ × I (S 1 j , S 2 j ,... , S nj )
j=1 ∣S ∣
Where:
Where:
I (S )= Original Entropy
Rule
≥2
1 No ≥50K <5K Yes
5
≥2
2 Yes ≥50K ≥5K Yes
5
20K– <2
3 Yes <5K No
50K 5
<2
4 No <20K ≥5K No
5
≥2
5 No <20K <5K No
5
20K– ≥2
6 Yes ≥5K Yes
50K 5
There are:
Yes = 3
No = 3
Thus:
3 3
p(Yes)= =0.5 p(No)= =0.5
6 6
Entropy:
Attribute: Married
Yes = 2
No = 1
Entropy:
I (2 ,1)=0.92
Yes = 1
No = 2
Entropy:
I (1 ,2)=0.92
Expected Entropy:
3 3
E(Married )= (0.92)+ (0.92) E(Married )=0.92
6 6
Gain:
Gain(Married )=1−0.92=0.08
Attribute: Salary
E(Salary)=0.33Gain(Salary)=1−0.33Gain(Salary)=0.67
E( AccountBalance)=0.92Gain( AccountBalance)=0.08
Attribute: Age
E( Age)=0.54Gain( Age)=0.46
Attribute Selection
Gai
Attribute
n
Married 0.08
Salary 0.67
Account
0.08
Balance
Age 0.46
Highest Gain
Salary = 0.67
Therefore:
Records:
RID 4
RID 5
Loanworthy = No
Class = No
Salary ≥ 50K
Records:
RID 1
RID 2
Loanworthy = Yes
Class = Yes
Salary = 20K–50K
Records:
RID 3
RID 6
Remaining Attributes:
Married
Age
Account Balance
Gai
Attribute
n
Married 0
Age 1
Account
1
Balance
Choose:
Age
Rule 1
Rule 2
IF Salary ≥ 50K
THEN Loanworthy = Yes
Rule 3
IF Salary = 20K–50K
AND Age < 25
THEN Loanworthy = No
Rule 4
IF Salary = 20K–50K
AND Age ≥ 25
THEN Loanworthy = Yes
Applications of Classification
Banking
Healthcare
Disease diagnosis
Marketing
Customer segmentation
Cybersecurity
Spam filtering
Intrusion detection
Insurance
Claim approval
Risk assessment
28.4 Clustering
Introduction
Clustering is a data mining technique used to group similar data objects
together without prior knowledge of class labels.
Unsupervised Learning
Definition of Clustering
Goal
Examples of Clustering
Business Applications
Customer segmentation
Market analysis
Product recommendation
Healthcare Applications
Social Media
Community detection
Education
Student performance grouping
Classification vs Clustering
Training Data
Yes No
Required
Customer
Example Loan approval
segmentation
Euclidean Distance
Formula
Distance:
Distance(r j , r k )=√ ¿ ¿ ¿
Interpretation
Smaller Distance
More Similar
Larger Distance
Less Similar
Introduction
Idea
K-Means Flowchart
Start
↓
Select K Centroids
↓
Assign Records to Nearest Cluster
↓
Compute New Centroids
↓
Any Changes?
↓
Yes → Repeat
No
↓
Stop
Sample Dataset
Two-Dimensional Records
RI Ag Years of
D e Service
1 30 5
2 52 20
3 51 15
4 5 52
5 10 3
6 52 55
Assume:
K=2
Cluster C1
RID 3
( 51 ,15 )
Cluster C2
RID 6
( 52 ,55 )
First Iteration
Assignment Results
Recor Assigned
d Cluster
RID 1 C1
RID 2 C2
RID 3 C1
RID 4 C1
RID 5 C1
RID 6 C2
Recalculate Centroids
Cluster C1
Records:
RID 1
RID 3
RID 4
RID 5
New Mean:
( 33.75 , 8.75 )
Cluster C2
Records:
RID 2
RID 6
New Mean:
( 52.5 , 25 )
Second Iteration
RID 1
RID 4
RID 5
Cluster C2
RID 2
RID 3
RID 6
Updated Centroids
Cluster C1
( 28.3 , 6.7 )
Cluster C2
( 51.7 , 21.7 )
Third Iteration
No changes occur.
Therefore:
Algorithm Terminates
Final Clusters
Cluster C1
-----------
RID 1
RID 4
RID 5
Cluster C2
-----------
RID 2
RID 3
RID 6
Where:
m = number of dimensions
n = number of records
Formula
k
Error=∑ ∑ Distance ¿ ¿ ¿
i=1 r j ∈C i
Where:
C i= Cluster i
Objective Function
Advantages of K-Means
1. Simple
2. Fast
3. Scalable
Works well with large databases.
4. Converges Quickly
Limitations of K-Means
1. Need to Specify K
3. Local Optimum
Full Form
Why BIRCH?
Hybrid Technique
Combines:
1. Hierarchical Clustering
2. Partition-Based Clustering
Input Parameters
1. Available Memory
2. Radius Threshold
Large Radius
Few Clusters
Many Records per Cluster
Small Radius
Many Clusters
Few Records per Cluster
Working of BIRCH
Step 1
Step 2
Step 3
Step 4
Update:
Cluster center
Radius
Step 5
Step 6
Step 7
BIRCH Architecture
Input Records
↓
CF Tree Construction
↓
Leaf Clusters
↓
Cluster Refinement
↓
Final Clusters
Advantages of BIRCH
Memory Efficient
Incremental
Scalable
Fast
Linear complexity.
Computational Complexity
BIRCH complexity:
O(n)
where
n=Number of Records
K-Means vs BIRCH
K-
Feature BIRCH
Means
Memory
High Low
Requirement
Moderat Very
Scalability
e High
Very
Dataset Size Medium
Large
Centroid
Structure Used CF Tree
s
Applications of Clustering
Banking
Customer segmentation
Fraud detection
Healthcare
Patient grouping
Disease classification
Marketing
Target advertising
Customer profiling
E-Commerce
Product recommendation
Social Networks
Community detection
Telecommunications
Clustering
Similarity Measure
Euclidean Distance
K-Means Steps
1. Select K centroids
2. Assign records
3. Recompute centroids
Objective
Minimize Squared Error
BIRCH
Uses CF Tree.
Key Difference
Classification → Known Classes
Clustering → Unknown Classes
Introduction
3. Regression Analysis
4. Neural Networks
5. Genetic Algorithms
Definition
Sequence of Itemsets
Customer purchases:
Sequence:
Subsequence
Examples:
and
Support of a Sequence
Formula
Number of sequences containing S
Support( S)= ×100
Total number of sequences
Applications
Retail
Laptop
↓
Mouse
↓
Printer
Healthcare
Banking
Sequence Database
↓
Find Frequent Subsequences
↓
Apply Minimum Support
↓
Generate Sequential Patterns
Advantages
Limitations
Computationally expensive.
Large sequence databases require significant processing.
Definition
Examples
Stock Prices
Monday → 500
Tuesday → 510
Wednesday → 520
Daily Sales
Weather Data
Temperature
Rainfall
Humidity
Trend Detection
Pattern Discovery
Forecasting
Similarity Analysis
Compare multiple time series.
Typical Patterns
Increasing Trend
10 → 20 → 30 → 40
Decreasing Trend
40 → 30 → 20 → 10
Seasonal Pattern
Stable Pattern
Applications
Weather Forecasting
Sales Forecasting
Healthcare
Advantages
Enables forecasting.
Limitations
Sensitive to noise.
28.5.3 Regression
Definition
Example
Predicting:
House prices
Stock prices
Sales revenue
Consider:
LAB_TESTS
(Patient ID,
Test1,
Test2,
...
Testn)
Target variable:
P = Probability of Survival
Regression rule:
(Test1 Range)
AND
(Test2 Range)
AND ...
(Testn Range)
→P=x
or
x<P≤y
Regression Function
General form:
Y =f ( X 1 , X 2 , X 3 , … , X n )
Where:
Y = Target variable
Linear Regression
or
Y =a+b 1 X 1 +b 2 X 2+⋯+ bn X n
Working of Regression
Historical Data
↓
Build Regression Function
↓
Estimate Target Variable
↓
Prediction
Applications
Medical Diagnosis
Marketing
Education
Advantages
Easy interpretation.
Limitations
Sensitive to outliers.
Definition
Basic Idea
Input Data
↓
Learning Process
↓
Hidden Representation
↓
Output Prediction
Characteristics
Learning Capability
Self-Adaptive
Generalization
Example:
Example:
Input Layer
↓
Hidden Layer(s)
↓
Output Layer
Applications
Image Recognition
Face detection.
Speech Recognition
Voice assistants.
Medical Diagnosis
Disease prediction.
Fraud Detection
Banking applications.
Data Mining
Advantages
Limitations
Definition
Developed by:
John Holland
Basic Concept
Natural Selection
Mutation
Crossover
Biological Inspiration
A
C
T
G
1. Population
2. Chromosome
Representation of a solution.
3. Fitness Function
4. Selection
5. Crossover
Combine parent solutions.
6. Mutation
Random modification.
Initial Population
↓
Evaluate Fitness
↓
Selection
↓
Crossover
↓
Mutation
↓
New Generation
↓
Repeat Until Optimum Found
Population-Based Search
Parallel Search
Randomized Search
Adaptive Learning
Applications
Data Mining
Pattern discovery.
Clustering
Scheduling
Engineering Design
Optimization tasks.
Image Analysis
Pattern recognition.
Advantages
Flexible
Parallel Processing
Limitations
Computationally Expensive
Random Nature
Comparison of Approaches
Learn complex
Neural Networks Predictive model
patterns
Near-optimal
Genetic Algorithms Optimization & search
solutions
Business
Market forecasting
Healthcare
Disease prediction
Survival analysis
Finance
Stock prediction
Fraud detection
Telecommunications
Usage analysis
Manufacturing
Process optimization
Regression
Y =f ( X 1 , X 2 , … , X n )
Neural Networks
Genetic Algorithms
Key Learning
Definition
Data Mining is the process of extracting useful patterns, trends,
correlations, and knowledge from large volumes of data to support
decision-making and strategic planning.
Importance
Business growth
Improved decision-making
Risk management
Resource optimization
Customer satisfaction
A. Marketing Applications
Objective
Key Applications
Example:
Customers buying smartphones often purchase:
Earphones
Phone cases
Screen protectors
Benefits
Increased sales
2. Targeted Marketing and Advertising
Example:
An online retailer recommends products based on previous purchases.
Benefits
3. Customer Segmentation
Age
Income
Purchase behavior
Location
Interests
Segment Characteristics
Occasional Seasonal
Customers purchases
Benefits
Customized services
Personalized marketing campaigns
Example
Placing:
Benefits
B. Finance Applications
Objective
Income
Employment history
Credit history
Classification Example
Customer
Risk Level
Type
Additional
Fair Risk
Verification
Benefits
Organizations analyze:
Outstanding payments
Benefits
Stocks
Bonds
Mutual funds
Investment portfolios
Applications
Trend analysis
Risk prediction
Portfolio optimization
Benefits
Better investment decisions
Increased returns
4. Fraud Detection
Banking Fraud
Fake loans
Identity theft
Unauthorized transactions
Insurance Fraud
False claims
Classification
Clustering
Anomaly Detection
Benefits
Improved security
C. Manufacturing Applications
Objective
1. Resource Optimization
Resources include:
Machines
Workers
Raw materials
Energy
Applications
Production planning
Workforce allocation
Inventory control
Benefits
Higher productivity
Process bottlenecks
Production inefficiencies
Benefits
Reduced waste
Faster production
Analyzes:
Workflow patterns
Material movement
Benefits
4. Product Design
Customer feedback
Sales records
Service reports
Used to improve:
Safety
Fuel efficiency
Comfort
Features
Benefits
D. Healthcare Applications
Objective
X-rays
CT scans
MRI images
Ultrasound images
Applications
Tumor detection
Disease diagnosis
Pattern recognition
Benefits
Early disease detection
Gene clustering
Disease prediction
Drug development
Benefits
Personalized medicine
Analyzes:
Patient records
Treatment outcomes
Medication responses
Benefits
Safer medications
Applications include:
Patient scheduling
Bed allocation
Resource utilization
Emergency response management
Benefits
Treatment quality
Doctor qualifications
Applications
Benefits
6. Cost savings.
7. Enhanced productivity.
8. Competitive advantage.
Learning Objectives
Machine Learning
Statistics
Optimization
Database Technology
Example
Bread ⇒ Butter
Applications:
2. Clustering
Example
Purchasing behavior
Income level
Geographic location
Applications:
Customer segmentation
Medical diagnosis
3. Neural Networks
Applications:
Pattern recognition
Fraud detection
Stock prediction
Medical diagnosis
Example
Customer purchases:
Applications:
5. Statistical Analysis
Correlation analysis
Regression analysis
Hypothesis testing
Applications:
Business forecasting
Risk analysis
6. Decision Trees
Applications:
Credit approval
Disease diagnosis
Customer classification
7. Advanced Techniques
Genetic Algorithms
Optimization problems
Feature selection
Case-Based Reasoning
Bayesian Networks
Probabilistic reasoning
Risk prediction
Nonlinear Regression
Pattern Matching
Image recognition
Text mining
Fuzzy Logic
Definition
Microsoft Access
Oracle
SQL Server
Informix
dBASE
Advantages of ODBC
Database independence
Easy connectivity
Improved interoperability
Architecture
3. Operating Environment
Windows Environment
UNIX Environment
Used in enterprise-level applications
Better scalability
Client-Server Architecture
Client
|
Server Database
|
Data Mining Engine
Advantages:
Centralized processing
Better performance
Scalability
Features
Drag-and-drop operations
Visualization tools
Interactive analysis
Graphical reports
Visualization Support
Trends
Clusters
Rules
Patterns
Examples
Charts
Graphs
Heat maps
Decision trees
Benefits
Easy interpretation
Improved decision-making
User-friendly operation
Text-Based Interfaces
Example
Advantages:
Script automation
Disadvantages:
Definition
C Libraries
Proprietary Languages
Benefits
Software customization
Application integration
Statistical Analysis,
CrossZ Data Distilleries
Optimization
DBMiner
DBMiner Comprehensive Data Mining
Technology
Classification, Association
IBM Intelligent Miner
Rules
Management Discovery
NCR Association Rules
Tool (MDT)
IBM Intelligent
Enterprise analytics
Miner
MineSet Visualization
Comprehensive mining
DBMiner
features
Continuous Evolution
Artificial Intelligence
Machine Learning
Statistics
Optimization Techniques
Distributed databases
Parallel databases
Data warehouses
Cloud platforms
Emerging Trends
Web mining
Applications:
E-commerce analytics
Hybrid Approaches
Data Mining
|
---------------------------
| | | |
AI ML Statistics OLAP
---------------------------
Benefits:
Improved accuracy
Better scalability
Faster processing
Parallel Computing
Distributed Computing
Advantages:
Faster computation
Improved scalability
Big Data and Data Mining
Volume
Velocity
Variety
Hadoop-Based Mining
Hadoop
Mahout
Applications:
Recommendation systems
Classification
Clustering
Benefits
Scalability
On-demand resources
Images
Medical imaging
Satellite imagery
Videos
Surveillance systems
Video analytics
Audio
Speech recognition
Voice analytics
Text Documents
Text mining
Sentiment analysis
3. Real-time analytics.
7. Cloud-based scalability.
User-friendly interfaces.
Advanced visualization.
Summary
Purpose
Structure
Functioning
Performance
Data organization
Data
Single System Multiple Systems
Sources
Data
Moderate Very Large
Volume
Example
Depositing money
Withdrawing cash
According to W. H. Inmon:
A. Subject-Oriented
Data is organized around major business subjects rather than applications.
Examples:
Customer
Sales
Product
Supplier
Finance
B. Integrated
Relational databases
Legacy systems
Flat files
ERP systems
Web applications
Example
CRM System
Sales Database
Online Store
C. Nonvolatile
Data Loading
Data Retrieval
Data Analysis
Benefits
Consistency
Historical preservation
Reliable analysis
D. Time-Variant
Example
5 years
10 years
20 years
Example query:
Decision Making
Managers can:
Forecast trends
Develop strategies
Business Intelligence
Knowledge Discovery
Hidden patterns and relationships can be discovered.
Ad Hoc Queries
Example
Canned Queries
Example
Advantages:
Faster execution
Standardized reporting
Analyze trends
Compare performance
Features
Drill Down
Roll Up
Pivoting
Example
Analyzing:
Functions
Trend analysis
Performance monitoring
Strategic planning
Forecasting
Example
Objectives
Pattern discovery
Trend analysis
Prediction
Classification
Clustering
Example
A supermarket discovers:
Product placement
Marketing campaigns
Sales promotions
8. OLTP vs OLAP
Characteristics
Frequent updates
Small transactions
High concurrency
Real-time processing
Examples
ATM transactions
Railway reservations
E-commerce purchases
Characteristics
Complex queries
Historical information
Read-intensive operations
Examples
Sales forecasting
Small transactions
Fast updates
Complex joins
Historical analysis
Multidimensional reporting
Internal Sources
ERP Systems
CRM Systems
Operational Databases
Accounting Systems
External Sources
Government Data
Partner Data
Web Data
File-Based Sources
CSV files
Excel spreadsheets
Text files
Operational Databases
│
▼
Data Extraction
│
▼
Data Transformation
│
▼
Data Cleaning
│
▼
Data Warehouse
│
┌──────┼──────┐
▼ ▼ ▼
OLAP DSS Data Mining
Key Terms
Term Meaning
Summary
1. Introduction
Strategic decision-making
Trend analysis
Forecasting
Data mining
Business intelligence
Data
Relational Multidimensional
Model
Characteristics
Example
Fact:
Sales Amount
Dimensions:
Time
Product
Location
Customer
Time
│
│
Product ───── Sales ───── Location
│
│
Customer
This multidimensional structure is ideal for OLAP operations.
Integrated data
Consistent data
Cleansed data
Consolidated data
Data Sources
Relational Databases
Legacy Systems
ERP Systems
CRM Systems
Flat Files
Web Data
Benefits
✔ Improved consistency
✔ Better decision-making
Supports
Trend Analysis
Predictive Analysis
Forecasting
Example
An organization may analyze:
Yea
Sales
r
202 ₹50
2 Crore
202 ₹62
3 Crore
202 ₹75
4 Crore
202 ₹89
5 Crore
Meaning
Read
Append
Purge
Frequent Updates
Frequent Deletions
Transaction Processing
Data Warehouse
Read Data
↓
Append New Data
↓
Purge Old Data (Optional)
Advantages
Stable environment
Consistent reporting
Full Refresh
Incremental Refresh
Faster
E – Extract
T – Transform
L – Load
Store transformed data into the warehouse.
ETL Architecture
Source Systems
(DBs, Files, ERP, CRM)
│
▼
Extract
│
▼
Transform
(Clean, Filter, Integrate)
│
▼
Load
│
▼
Data Warehouse
9. Decision-Support Technologies
A. OLAP
Functions:
Slice
Dice
Drill Down
Roll Up
Pivot
Example:
Year
State
Product
B. DSS
Used by:
Executives
Managers
Analysts
Applications:
Strategic planning
Resource allocation
Forecasting
C. Data Mining
Applications:
Classification
Clustering
Association Rules
Prediction
Example:
Rules
Patterns
Metadata
Predictions
Data Warehouse
│
▼
OLAP / DSS / Data Mining
│
▼
Knowledge / Rules
│
▼
Stored Back into Warehouse
Example:
Example:
Example:
Example:
5. Client-Server Architecture
Client Applications
│
▼
OLAP Server
│
▼
Data Warehouse
6. Multiuser Support
Benefits:
Collaboration
Concurrent analysis
7. Accessibility
Benefits:
Improved reporting
Better visibility
8. Transparency
Storage details
Slice
Dice
Drill-down
Roll-up
Inductive Analysis
Example:
Deductive Analysis
Example:
Example:
Organization-wide warehouse.
Characteristics
Centralized
Large scale
High investment
Advantages
Enterprise-wide view
Better consistency
Benefits
Reduced storage
Faster implementation
Uses:
Data Federation
Virtualization
Distributed Access
Benefits
Flexible access
D. Data Mart
Small departmental warehouse.
Examples
HR Data Mart
Benefits
Lower cost
Faster deployment
Functions
Temporary storage
Data integration
Data cleaning
Characteristics
Near real-time
Operational reporting
ODS Flow
Operational Systems
│
▼
ODS
│
Cleansing
│
▼
Data Warehouse
Created Through
Data Cleansing
Aggregation
Transformation
Applications
OLAP
Reporting
Forecasting
Data Mining
ODS vs ADS
Operational Analytical
Purpose
Reporting Reporting
Analysts &
Users Operational Staff
Managers
Complexit
Low High
y
Summary
Data Mining
Objective
Data Cubes
Dimensions
Examples:
Time
Product
Region
Customer
Salesperson
Measures
Examples:
Sales Revenue
Profit
Quantity Sold
Cost
Example Dimensions
Sales Revenue
3. Data Cube
Two-Dimensional Example
Time
▲
│
│
Region ◄───────────┼──────────► Product
Example:
Example:
Sales
├── Product
├── Region
├── Time
├── Customer
├── Promotion
└── Channel
Faster Queries
Multiple Perspectives
Users can analyze data from different dimensions.
Simplified Reporting
Better Decision-Making
6. Pivoting (Rotation)
Definition
Pivoting is the process of rotating a data cube to view data from different
perspectives.
Example 1
Original View
Produ Regio
Sales
ct n
₹50,00
Laptop South
0
Pivoted View
Regio Quart
Sales
n er
₹50,00
South Q1
0
Benefits
Flexible analysis
Interactive reporting
Easy visualization
7. Slice Operation
Definition
Example
3-D Cube:
Selecting:
Time = Q1
produces:
Mobile 80 95 110
Definition
Example
Selecting:
The phrase "Slice and Dice" refers to breaking large datasets into
smaller views for detailed analysis.
9. Roll-Up Operation
Definition
Day
↓
Week
↓
Month
↓
Quarter
↓
Year
Sales Example
Mont Sale
h s
Jan 50
Feb 60
Mar 70
Roll-Up:
Quart Sale
er s
Q1 180
Benefits
Summary reporting
Executive dashboards
Trend analysis
Definition
Country
↓
Region
↓
State
↓
City
Example Analysis
India
↓
Karnataka
↓
Bengaluru
↓
Whitefield
Roll-Up vs Drill-Down
Roll-Up Drill-Down
Detailed → Summary →
Summary Detailed
Higher Lower
Aggregation Aggregation
Roll-Up Drill-Down
1. Fact Tables
2. Dimension Tables
Definition
Examples:
Sales
Revenue
Profit
Quantity
Characteristics
Large table
1000
P1 R1 T1
0
1500
P2 R2 T1
0
13. Dimension Table
Definition
Examples
Product Dimension
Product_I Product_Na
Category
D me
Electronic
P1 Laptop
s
Region Dimension
Region_I Region_Na
D me
R1 South
Time Dimension
202
T1 Q1
5
14. Relationship Between Fact and Dimension Tables
Product
│
│
Region ─── Fact Table ─── Time
│
│
Customer
Definition
Structure
Product
│
│
Customer ─ Fact ─ Time
│
│
Region
Advantages
Simple design
Faster queries
Easy implementation
Example
Fact Table:
Sales_Fact
Dimensions:
Product_Dim
Time_Dim
Region_Dim
Customer_Dim
Definition
Example
Product
│
Category
│
Department
Structure
Category
│
Product ─────────┤
│
Fact
│
Time
│
Region
Advantages
Reduced redundancy
Disadvantages
More joins
Slower queries
Denormaliz
Structure Normalized
ed
Query
Faster Slower
Speed
Maintenanc
Easy Difficult
e
Definition
Example
Product
│
┌───────────┼───────────┐
│ │
Sales Fact Forecast Fact
Shared Dimension:
Product
Advantages
Supports complex warehouses
Definition
Low-cardinality attributes
Example
Attribute:
Car Size
Values:
Economy
Compact
Mid-size
Full-size
Bitmap representation:
Ca Econom
r y
C1 1
C2 0
C3 1
Benefits
Faster searching
Reduced I/O
Definition
Primary Keys
Foreign Keys
Example
Fact Table:
Sales
Dimension:
City
Benefits
Faster joins
Examples
Quart Revenu
er e
Q1 ₹10 Cr
Q2 ₹15 Cr
Advantages
Faster reporting
Definition
Customer
Product
Supplier
Region
Objectives of MDM
Data Consistency
Data Quality
Governance
Integration
Before loading:
Remove duplicates
Standardize names
Resolve conflicts
Harmonize formats
Example:
Bangalore
Bengaluru
B'luru
Bengaluru
Summary
1. Introduction
Anticipated Usage
Who will use the warehouse?
Example
Consumer Products
Product, Sales, Customer Analysis
Company
Data Sources
│
▼
Extraction
│
▼
Transformation
│
▼
Data Cleaning
│
▼
Data Modeling
│
▼
Loading
│
▼
Data Warehouse
4. Step 1: Data Extraction
Definition
Sources of Data
Relational Databases
Legacy Systems
ERP Systems
CRM Systems
Spreadsheets
Web Services
Challenges
Different formats
Different platforms
Definition
Problems Encountered
Cust_ID
Customer_ID
CID
Example:
Quarter
Company
End
Subsidiary
March
A
Subsidiary
April
B
Definition
Data Cleaning improves data quality before loading into the warehouse.
Missing Values
Example:
Duplicate Records
Ashwin Kumar
A. Kumar
Ashwin K.
Example:
Age = -5
Inconsistent Data
Example:
Error detection
Error correction
Duplicate elimination
Domain validation
Standardization
7. Backflushing
Definition
Source System
│
▼
Data Cleaning
│
▼
Data Warehouse
│
▼
Backflushing
│
▼
Source System Updated
Benefits
Enhances consistency
Definition
Data from source systems must be transformed into the warehouse data
model.
Source Models
Relational
Object-Oriented
Network
Hierarchical
Legacy Databases
Target Model
Usually:
Multidimensional Model
Implemented through:
Fact Tables
Dimension Tables
Star Schema
Snowflake Schema
Definition
Challenges
Large Data Volumes
Terabytes
Petabytes
of data.
Requirements
Monitoring Tools
Recovery Mechanisms
Error Handling
Full Refresh
Advantages
Consistency
Disadvantages
Time-consuming
Resource intensive
Incremental Refresh
Advantages
Faster
Lower cost
Less downtime
Data Freshness
Downtime
Data Dependencies
Storage Availability
Distribution Requirements
Need for:
Replication
Partitioning
Loading Time
Includes:
Extraction
Cleaning
Transformation
Transmission
Index rebuilding
Example
Customer Master
│
▼
Sales Transactions
│
▼
Billing Data
Incorrect Order
Integrity Constraints
Business Rules
A. Data Storage
Star Schema
Snowflake Schema
Fact Constellation
B. Data Structures
Maintain:
Fact Tables
Dimension Tables
Summary Tables
C. Access Paths
Create:
Indexes
Join Indexes
Bitmap Indexes
D. Time-Variant Data
Example:
E. Data Refresh
F. Data Purging
Example:
Definition
Benefits
Saves storage
Improves performance
Simplifies maintenance
Example
1. Usage Projections
Determine:
User groups
Query patterns
Reporting requirements
Star Schema
Snowflake Schema
Fact Constellation
3. Source Characteristics
Understand:
Data quality
Data volume
Data formats
4. Metadata Design
5. Modular Design
Benefits:
Easier maintenance
Scalability
Future expansion
6. Manageability
Monitoring
Maintenance
Evolution
Support:
Multiple locations
Large-scale processing
High-performance analytics
Definition
Types of Metadata
A. Technical Metadata
Contains:
Data sources
ETL rules
Storage structures
Access paths
Maintenance information
B. Business Metadata
Contains:
Business definitions
Business rules
Organizational policies
Reporting standards
Metadata Architecture
Metadata Repository
/ \
/ \
Technical Metadata Business Metadata
Characteristics
Replication
Partitioning
Load Balancing
High Availability
Architecture
Site A
│
│
Metadata Repository
│
│
Site B
│
│
Site C
Advantages
✔ Scalability
✔ Better performance
✔ Fault tolerance
✔ Improved availability
Definition
Architecture
Warehouse A
│
│
Warehouse B
│
│
Warehouse C
Local autonomy
Easier management
Reduced complexity
Examples:
New Challenges
Real-Time Analytics
Unstructured Data
IoT Data
Emerging Technologies
Examples include:
Apache Hadoop
Spark Ecosystem
Analytic Appliances
IBM
SAP
Data Virtualization
Benefits:
Reduced duplication
Faster deployment
Data Sources
(DBs, ERP, CRM, Files)
│
▼
Extraction
│
▼
Transformation
│
▼
Data Cleaning
│
▼
Data Modeling
│
▼
Loading
│
▼
Data Warehouse
│
┌────────┼────────┐
│ │ │
OLAP DSS Data Mining
│
▼
Metadata & Reports
│
▼
Refresh / Purge
Summary
1. Introduction
Complex Queries
Data Analysis
Business Intelligence
Data Mining
✔ Ad hoc querying
✔ Strategic decision-making
The Access Component acts as the interface between users and the
data warehouse.
Functions
Query Processing
OLAP Analysis
Reporting
Spreadsheet Integration
Data Mining
Materialized View Access
Users
│
▼
Access Component
│
┌───────────┼───────────┐
│ │ │
OLAP Queries Data Mining
│
▼
Data Warehouse
Microsoft Excel
Definition
Example
Day
↓
Week
↓
Month
↓
Quarter
↓
Year
Sales Example
Mont Sale
h s
Jan 100
Feb 120
Mar 130
Roll-Up:
Quart Sale
er s
Q1 350
Applications
Executive Reporting
Trend Analysis
Strategic Planning
5. Drill-Down Operation
Definition
Example
Country
↓
State
↓
District
↓
City
Roll-Up vs Drill-Down
Roll-Up Drill-Down
Detailed → Summary →
Summary Detailed
Aggregation Disaggregation
6. Pivot (Rotation)
Definition
Also called:
Rotation
Cross-Tabulation
Example
Original View
Pivoted View
Regio Produ Sale
n ct s
Advantages
Multiple viewpoints
Flexible reporting
Better visualization
Slice
Definition
Example
Cube:
Selecting:
Time = Q1
Dice
Definition
Example
creates a sub-cube.
Benefits
Detailed analysis
Customized reporting
Interactive exploration
8. Sorting
Definition
Example
Produ Sale
ct s
Mobile 100
Laptop 300
Tablet 200
Sorted Descending:
Produ Sale
ct s
Laptop 300
Tablet 200
Mobile 100
Benefits
Ranking
Performance comparison
Top-N analysis
9. Selection (Filtering)
Definition
Example
SELECT *
FROM Sales
WHERE Region='South'
Result
Applications
Regional Analysis
Product Analysis
Customer Segmentation
Definition
Examples
Profit
Growth Rate
Growth Rate =
(Current Sales - Previous Sales)
/ Previous Sales × 100
Average Revenue
Average Revenue =
Total Revenue / Number of Customers
Benefits
Additional insights
Better forecasting
Performance evaluation
Why Faster?
Because warehouses:
Are read-oriented
A. Query Transformation
Definition
Example
Complex query:
SELECT *
FROM Sales
WHERE Year=2025
Faster execution
Definition
Example
Indexes:
Region Index
Year Index
Query:
Region = South
Year = 2025
Definition
Example
Region = South
OR
Region = North
Hash Join
Merge Join
Star Join
Bitmap Join
Benefits
Definition
Example
Query 1
Query 2
Query 3
Benefits
Reduced I/O
Faster execution
Uses:
Tables
SQL Queries
Relational Schema
Architecture
Users
│
▼
ROLAP Engine
│
▼
Relational Database
Advantages
Scalable
Disadvantages
Definition
Architecture
Users
│
▼
MOLAP Engine
│
▼
Data Cube
Advantages
Disadvantages
Definition
Architecture
HOLAP
/ \
/ \
MOLAP ROLAP
(Summary Data) (Detail Data)
Working
Summary Data
Detailed Data
Drill Through
Advantages
✔ Fast performance
✔ Large-scale storage
✔ Flexible analysis
Characteristics
Multiple CPUs
Shared memory
CPU1
CPU2
CPU3
│
Shared Memory
B. Cluster Architecture
Characteristics
Multiple servers
Connected network
Server 1
│
Server 2
│
Server 3
Characteristics
Independent processing
Processor 1
Processor 2
Processor 3
Processor N
Faster queries
Better scalability
Improved availability
Parametric Queries
Example:
Ad Hoc Queries
User-created queries.
Example:
Benefits
Flexible analysis
User independence
Faster decision-making
Definition
Classification
Example:
Loan Approval
Customer Segmentation
Clustering
Example:
Association Rules
Example:
Prediction
Example:
Future Sales
Customer Churn
A. Lag Analysis
Example:
Sales(Current Month)
vs
Sales(Previous Month)
B. Moving Average
Smooths fluctuations.
Formula:
Moving Average =
Sum of Previous N Values / N
C. Regression Analysis
Example:
Advertising Cost
vs
Sales Revenue
Neural Networks
Applications:
Classification
Prediction
Pattern Recognition
Genetic Algorithms
Applications:
Optimization
Rule Discovery
Benefits
Data Warehouse
│
┌───────────────────┼───────────────────┐
│ │ │
OLAP Queries Data Mining
│ │ │
▼ ▼ ▼
Roll-Up Structured Statistical
Drill-Down Ad Hoc Analysis
Pivot Parametric AI Techniques
Slice & Dice Filtering Neural Networks
Sorting Selection Genetic Algorithms
Summary
1. Introduction
2. What is a View?
Definition
A View is a virtual table derived from one or more base tables using a
query.
Example
Base Table:
Student_ Departme
Name
ID nt
Ashwi
101 CSE
n
View:
Result:
Student_
Name
ID
Ashwi
101
n
Definition
Example
Definition
Characteristics
Persistent storage
Historical data
Multidimensional structure
A. Read-Only Access
Example
Users can:
View reports
Generate summaries
Perform analysis
B. Subject-Oriented Access
Examples:
Sales
Customers
Products
Employees
Example:
SELECT *
FROM Sales
WHERE Region='South';
Difference 1: Persistence
View
Base Tables
│
▼
View
(On-Demand Creation)
Data Warehouse
Source Systems
│
▼
Data Warehouse
(Persistent Storage)
Key Point
Data
View
Warehouse
Virtua
Persistent
l
View
Typically based on relational tables.
Example:
Data Warehouse
Examples:
Data Cubes
Star Schema
Snowflake Schema
Key Point
Data
View
Warehouse
Relation Multidimension
al al
View
Limited aggregation.
Data Warehouse
Example:
Day
↓
Month
↓
Quarter
↓
Year
Roll-Up
Drill-Down
Slice
Dice
Key Point
Difference 4: Indexing
View
Data Warehouse
Bitmap Index
Join Index
Benefits
Faster querying
Key Point
View Data Warehouse
View
Data Warehouse
Examples:
Roll-Up
Drill-Down
Pivot
Data Mining
OLAP
Key Point
Data
View
Warehouse
Data Advanced
Retrieval Analytics
View
Limited scope.
Data Warehouse
May store:
Terabytes
Petabytes
of information.
Key Point
Data
View
Warehouse
Small Massive
Subset Repository
View
Database
│
▼
View
Data Warehouse
ERP
CRM
Files
Databases
External Sources
│
▼
Data Warehouse
Key Point
Data
View
Warehouse
Single Multiple
Source Sources
View
No complex preprocessing.
Data Warehouse
Extract
↓
Transform
↓
Clean
↓
Load
Activities Included
Data Cleaning
Data Integration
Summarization
Standardization
Transformation
Key Point
Data
View
Warehouse
Query-
ETL-Based
Based
View
Data Warehouse
Example:
Yea Reven
r ue
202
50 Cr
1
202
60 Cr
2
202
72 Cr
3
202
85 Cr
4
Key Point
Data
View
Warehouse
Current
Historical Data
Data
View
Supports operational reporting.
Data Warehouse
Supports:
Business Intelligence
OLAP
Data Mining
Strategic Planning
Key Point
Data
Feature View
Warehouse
No Independent Specialized
Indexing
Indexes Indexing
Decision
Limited Extensive
Support
Automatic from
Refresh Periodic Refresh
Source
Architecture Comparison
View-Based Architecture
Base Tables
│
▼
View
│
▼
Users
Better Performance
Multidimensional Analysis
Integrated Information
Summary
1. Introduction
Data Mining
1. Construction
2. Administration
4. Change Management
5. Performance Optimization
6. Team Management
Data Warehouse
│
┌─────────────┼─────────────┐
│ │ │
Construction Administration Quality Control
│ │ │
└─────────────┼─────────────┘
│
Change Management
│
Performance Tuning
Definition
Construction involves:
Planning
Designing
Developing
Deploying
the warehouse infrastructure.
ERP systems
CRM systems
Legacy databases
Cloud platforms
Enterprise-Wide Warehouses
Often involve:
Multiple departments
Multiple locations
Time Requirements
Months → Years
Resource Requirements
Require:
Large budgets
Skilled personnel
Specialized software
Hardware infrastructure
4. Project Management Challenges
Activities Involved
Planning
Define:
Scope
Objectives
Budget
Timeline
Design
Determine:
Data Models
Schemas
ETL Processes
Implementation
Build:
Warehouse Infrastructure
ETL Pipelines
Reporting Systems
Testing
Validate:
Accuracy
Performance
Security
Risks
Cost overruns
Schedule delays
Scope creep
Technical failures
Data Mart
Examples:
HR Data Mart
Advantages
✔ Faster implementation
✔ Lower cost
Comparison
Enterprise
Data Mart
Warehouse
Department-
Organization-wide
specific
Expensive Affordable
Enterprise
Data Mart
Warehouse
Long development
Quick deployment
time
Definition
Administrative Responsibilities
Data Refresh
Monitoring
Tracking:
Performance
Storage
Query execution
Security Management
Managing:
User access
Authentication
Authorization
Performance Tuning
Examples:
Impact on Warehouse
Schema modifications
ETL updates
Metadata updates
Example
Source System:
Customer Table
Definition
Data quality control ensures that warehouse data is:
Accurate
Complete
Consistent
Reliable
Importance
Incorrect reports
Faulty analysis
A. Inconsistent Data
Example:
Source Source
A B
Bengalur Bangalor
u e
B. Naming Differences
Example:
Cust_ID
Customer_ID
Client_ID
C. Domain Differences
Example:
Gender = M/F
Gender = Male/Female
Requires standardization.
D. Duplicate Data
Example:
Ashwin Kumar
A. Kumar
Ashwin K.
ERP
CRM
Legacy Systems
External Sources
Challenges
Different Formats
DD/MM/YYYY
MM/DD/YYYY
YYYY-MM-DD
Different Codes
State Code = KA
State Name = Karnataka
Different Identifiers
Customers
Products
Regions
Employees
Problems
Example:
Sales Department:
Finance Department:
Source Change
│
▼
ETL Update
│
▼
Schema Update
│
▼
Metadata Update
Result
Definition
Number of users
Query volume
Storage requirements
Future growth
Importance
Underestimation
Poor performance
Resource shortages
Overestimation
Wasted resources
Increased costs
Optimization Activities
Index Tuning
Examples:
Bitmap Indexes
Join Indexes
Storage Optimization
Compression
Partitioning
Examples:
Cloud Platforms
IoT Systems
Social Media Data
Mobile Applications
Requirement
One of the most difficult tasks is fitting source data into the warehouse
model.
Why Difficult?
Different structures
Different meanings
Different granularity levels
Example
Sales System:
Daily Sales
Finance System:
Quarterly Revenue
Examples:
Hadoop Ecosystems
Data Lakes
AI Analytics
Real-Time Streaming
Impact
Challenges
Software upgrades
Hardware upgrades
Migration activities
Definition
Modular design divides the warehouse into manageable components.
Benefits
Easier Maintenance
Better Scalability
Reduced Risk
Modular Architecture
ETL Module
│
Metadata Module
│
Storage Module
│
Reporting Module
Required Expertise
Technical Skills
Database Management
ETL Tools
Data Modeling
OLAP Technologies
Performance Tuning
Business Skills
Understanding:
Business Processes
Policies
Regulations
Organizational Rules
Communication Skills
Coordinate with:
Managers
Analysts
Developers
Executives
Required Team
Project Manager
│
Data Architect
│
ETL Developer
│
Database Administrator
│
Business Analyst
│
Security Specialist
Benefits
✔ Shared expertise
✔ Better decision-making
✔ Improved maintenance
Planning
Coordination
Governance
Defining:
Standards
Policies
Procedures
Risk Management
Handling:
Data loss
Security threats
System failures
IBM
SAP
Oracle Corporation
Monitoring
Scheduling
Metadata Management
Performance Optimization
Technology Changes
│
▼
Warehouse Changes
│
▼
Skill Requirements Change
Therefore
New technologies
Data Warehouse
│
┌──────────────────────┼──────────────────────┐
│ │ │
Construction Administration Quality Control
│ │ │
Project Mgmt Maintenance Data Consistency
ETL Design Monitoring Data Cleaning
Schema Design Security Data Integration
│ │ │
└──────────────────────┼──────────────────────┘
│
Technology Evolution
│
▼
Continuous Change
│
▼
Skilled Team Required
Summary
1. Introduction
The rapid growth of digital technologies, social media, IoT devices, cloud
computing, mobile applications, and enterprise systems has resulted in
the generation of enormous volumes of data. Traditional Relational
Database Management Systems (RDBMS) often struggle to handle such
large-scale, diverse, and rapidly changing datasets.
2. Learning Objectives
Definition
Big Data refers to extremely large and complex datasets that cannot be
effectively processed using traditional database management systems.
Examples
Online transactions
Sensor data
Healthcare records
1. Volume
Examples:
Terabytes (TB)
Petabytes (PB)
Exabytes (EB)
2. Velocity
Examples:
3. Variety
Structured Data
Relational tables
Semi-Structured Data
XML
JSON
Unstructured Data
Images
Videos
Audio
Text
4. Veracity
Challenges:
Missing values
Duplicate records
Inconsistent information
5. Value
Examples:
Fraud detection
Sales forecasting
5. Big Data Analytics
Definition
A. Descriptive Analytics
Answers:
"What happened?"
Example:
B. Diagnostic Analytics
Answers:
Example:
C. Predictive Analytics
Answers:
Example:
Demand forecasting
D. Prescriptive Analytics
Answers:
Example:
Recommending inventory levels
Data Sources
(Social Media, IoT, ERP, CRM)
│
▼
Data Ingestion
│
▼
Data Storage
│
▼
Data Processing
│
▼
Analytics Engine
│
▼
Visualization & Reports
Internal Sources
ERP systems
CRM systems
Transaction databases
External Sources
Social media
Sensors
Web logs
Public datasets
Apache Spark
Apache Flink
Apache Storm
Components
MapReduce
YARN
Hive
SQL-like querying.
Pig
Definition
Fixed schema
Limited scalability
Vertical scaling
Horizontal scaling
Flexible schema
High availability
Distributed architecture
Schema flexibility
Horizontal scalability
High performance
Distributed storage
Fault tolerance
Cloud compatibility
Examples:
Redis
Riak
2. Document Databases
Examples:
MongoDB
CouchDB
3. Column-Family Databases
Examples:
Apache Cassandra
Apache HBase
4. Graph Databases
Examples:
Neo4j
JanusGraph
NoSQL Databases
│
┌────┼────┬────┐
│ │ │ │
Key Doc Column Graph
Value Family
16. Integration of Big Data with NoSQL Systems
Big Data platforms frequently use NoSQL databases for scalable storage
and retrieval.
Scalability
Flexibility
High Availability
Real-Time Processing
Data Sources
│
▼
Data Ingestion Layer
│
▼
NoSQL Database Layer
│
▼
Big Data Processing Layer
(Hadoop/Spark)
│
▼
Analytics Engine
│
▼
Visualization Dashboard
Hadoop NoSQL
Component Database
HDFS Cassandra
Hive HBase
Spark MongoDB
MapReduce Cassandra
Benefits:
Real-time analytics
Example:
MongoDB
│
▼
Apache Spark
│
▼
Predictive Analytics
Data Collection
│
▼
Data Storage (NoSQL)
│
▼
Data Processing
│
▼
Machine Learning
│
▼
Visualization
│
▼
Decision Making
Banking
Fraud detection
Risk assessment
Credit scoring
Healthcare
Disease prediction
Patient monitoring
E-Commerce
Product recommendations
Customer segmentation
Demand forecasting
Social Media
Sentiment analysis
Trend detection
Smart Cities
Traffic management
Energy optimization
Environmental monitoring
Examples:
Classification
Clustering
Regression
Recommendation systems
CAP Properties
Consistency (C)
Availability (A)
CAP Triangle
Consistency
▲
/\
/ \
/ \
/ \
Availability-----Partition Tolerance
Data Security
Protecting sensitive information.
Data Quality
Data Governance
Integration Complexity
Performance Optimization
Authentication
Authorization
Encryption
Auditing
Real-Time Analytics
Streaming analytics for immediate insights.
Edge Computing
Generative AI Analytics
Feature Benefit
Handles massive
Scalability
datasets
Real-Time
Faster decisions
Analytics
28. Limitations
Limitation Description
Data Consistency
CAP trade-offs
Issues
Limitation Description
Integration
Multiple technologies involved
Complexity
Summary