Client website External
Client Social Media Dataset
Pixel data Sources Uploads
Data Extraction and Data Type Selection
Analytics Frameworks
transformation from
source
Google Analytics Storage
(Script or ETL
Facebook Analytics
Service)
Classification
Time Document Images and
and
Series and Text Videos
Regression
Dynamo DB Cassandra MySQL Redis MongoDB
Fast, Scalable Highly Scalable Secure Fast & Highly Secure Very Fast
High Uptime Fault Tolerant Moderately Supports Graph Highly Scalable Histogram
Data Visualisation
Low Maintenance High Speed Fast Higher Complexity Better for front end using
MatPlotLib and Seaborn
Scatter Plot
Data Preparation
Data
Transformation Data Cleaning
Normalization
using Min-Max or Missing Noise Outlier
Z-score Values Cleaning Detection
Dxi Calculation Replace
Ignore the
the Binning
tuple DBSCAN Normalization
value method Techiniques
Feature Selection
with
with majority
Unsupervised Supervised with zero
mean/median repeated
values
AntiLog Left Right Log
Wrapper Data Skew?
Intrinsic Filter method Operations Operation
Method
No
Recursive Convert to normal
Check for
Trees Feature Stats Feature Importance distribution with
Outlier
Elimination mean 0 and sigma 'n'
Imbalance Data
Upsampling Downsampling SMOT
Data Reduction
(Not Compulsory)
(only for unsupervised)
PCA Wavelet Transform
Common Features Selected
ML/DL Algorithms
Ensemble Learning
Probability Prediction Clustering
Classification Time Series
KNN (Classification
Bagging
& Regression) Naive Bayes K-Means
Boosting ElmanCart Arima Forecast
RFM Random Forest Heirarchical clustering
Stacking SimpleCart LSTM
Bayesian Learning K-mediot
Random Forest
Conversion to Real Values
Front-End
PreProcessing
Manual and
Automated Testing
Finish