CS-425: Introduction to Data Mining – Algorithm & Methods
Reference
1. Data Visualization Locality-Sensitive Hashing
(LSH)
Visual types:
MinHash
o Scatterplot
Jaccard Similarity
o Histogram
5. Data Clustering
o Boxplot
K-Means
o Heatmap
K-Medoids
o Parallel Coordinates
Hierarchical Clustering
2. Similarity / Dissimilarity
(Agglomerative)
Euclidean Distance
DBSCAN
Manhattan Distance
6. Mining Data Streams
Cosine Similarity
Sliding Window Model
Jaccard Similarity
Landmark Model
Pearson Correlation
Damped Window Model
3. Data Processing
Count-Min Sketch
Min-Max Normalization
Stream Clustering (e.g.,
Z-Score Normalization CluStream)
Binning 7. Frequent Itemsets
Discretization A-priori
Sampling FP-Growth
4. Finding Similar Items
8. PageRank
Power Iteration (Matrix-Vector
Multiplication)
Teleportation / Random
Surfer Model
Sparse Matrix Formulation
Block-Based Update
Algorithm
Block-Stripe Update
Algorithm
Topic-Specific PageRank /
Personalized PageRank
Random Walk with Restarts
9. Web Spams
Term Spam detection
(statistical / text analysis)
PageRank (used to combat
spam)
Link Spam detection / Link
Farms
TrustRank (topic-specific
PageRank with trusted
teleport set)
Trust Propagation