Python
Python Core Fundamentals
Python syntax, indentation, code style (PEP8)
Variables, data types, type casting
Input/output, comments, docstrings
Control flow: if / else, loops (for, while)
Functions, arguments, return values
Lambda functions
List / dict / set comprehensions
Built-in Data Structures (Must-Master)
Lists
Tuples
Sets
Dictionaries
Strings (immutability, slicing, formatting)
Pythonic Thinking
Iterators and generators
zip, enumerate, map, filter, reduce
Shallow vs deep copy
Mutability vs immutability
*args and **kwargs
Object-Oriented Programming (OOP)
Classes and objects
Constructors (__init__)
Instance vs class variables
Methods and dunder methods
Inheritance and method overriding
Polymorphism
Encapsulation & abstraction
Dataclasses (@dataclass)
Error Handling & Debugging
Exceptions (try / except / finally)
Custom exceptions
Common runtime errors
Modules, Packages & Environments
Import system (import, from, as)
Creating modules and packages
Virtual environments (venv, conda)
Dependency management (pip, [Link], poetry)
Understanding __main__
File Handling & Serialization
Reading/writing text files
CSV, JSON handling
Pickle (pros & cons)
Working with directories (os, pathlib)
Logging to files
Numerical Computing (AI Foundation)
NumPy
Arrays, shapes, dtypes
Broadcasting
Vectorized operations
Linear algebra basics
Random sampling
Data Analysis & Manipulation
Pandas
Series and DataFrames
Indexing & filtering
GroupBy & aggregation
Missing values handling
Merging & joining
Time-series basics
Data Visualization (Essential)
Matplotlib
Seaborn
Plot types for EDA
Standard Library (High-ROI Parts)
os, sys
pathlib
datetime, time
math, random
logging
Asynchronous & Parallel Python (Modern AI Apps)
Multithreading vs multiprocessing
async / await
Async I/O basics
When to use each
Other Python Libraries
FastAPI
Pydantic
Production-Ready Python Mindset
Writing clean, readable code
Modular design
Logging & monitoring mindset
Reading other people’s code
[Link]
SQL
SQL Fundamentals
What SQL is & why databases exist
Relational database concepts
Tables, rows, columns
Primary key vs foreign key
Basic SQL syntax & formatting
Data Manipulation (DML)
INSERT
UPDATE
DELETE
UPSERT (ON CONFLICT)
Transactions (BEGIN, COMMIT, ROLLBACK)
Table Design & Schema Basics
Creating tables (CREATE TABLE)
Constraints:
PRIMARY KEY
FOREIGN KEY
UNIQUE
NOT NULL
CHECK
Indexes (conceptual + practical)
Normalization basics (1NF, 2NF, 3NF)
Denormalization (when & why)
Core Querying (Absolute Must)
SELECT
FROM
WHERE
DISTINCT
ORDER BY
LIMIT / OFFSET
Aliases (AS)
Filtering & Conditions
Comparison operators (=, !=, <, >, BETWEEN)
Logical operators (AND, OR, NOT)
IN, NOT IN
LIKE, ILIKE
IS NULL, IS NOT NULL
Case expressions (CASE WHEN)
Aggregations & Grouping
Aggregate functions:
COUNT
SUM
AVG
MIN, MAX
GROUP BY
HAVING
Difference between WHERE and HAVING
Joins (Critical for Real Data)
INNER JOIN
LEFT JOIN
RIGHT JOIN
FULL OUTER JOIN
CROSS JOIN
Join conditions & join keys
Self joins
Common join pitfalls (duplicate rows)
Subqueries & CTEs
Subqueries in SELECT, FROM, WHERE
Correlated subqueries
WITH (Common Table Expressions)
Recursive CTEs (conceptual)
When to use CTEs vs subqueries
Window Functions (AI / Analytics Superpower)
OVER() clause
PARTITION BY
ORDER BY in windows
Ranking functions:
ROW_NUMBER
RANK
DENSE_RANK
Aggregate window functions
Lag/lead (LAG, LEAD)
Running totals & moving averages
Data Cleaning & Transformation
String functions (LOWER, UPPER, TRIM, SUBSTRING)
Date/time functions
Type casting (CAST, ::)
Handling missing values
Conditional transformations
Normalizing raw data using SQL
Performance & Optimization (High ROI)
Indexes and how they work
Query execution plans (EXPLAIN)
Common slow query patterns
Filtering early vs late
Avoiding unnecessary joins
When SQL beats Pandas
Analytical Thinking with SQL
Funnel analysis
Cohort analysis
Time-based analysis
User behavior analysis
Feature extraction using SQL
Creating ML-ready datasets
SQL Dialects Awareness
PostgreSQL
MySQL
SQLite
BigQuery / Snowflake (conceptual)
ANSI SQL vs dialect differences
SQL + Python Integration
Running SQL from Python
sqlite3, psycopg2, sqlalchemy
Pandas + SQL workflows
Writing parameterized queries
Avoiding SQL injection
Databases Every AI Engineer Should Touch
PostgreSQL
SQLite
MySQL
Cloud warehouses (BigQuery / Redshift / Snowflake – awareness)
Real-World SQL Skills
Writing readable SQL
Breaking complex queries into steps
Commenting queries
Versioning SQL
Debugging wrong results
[Link]
Mathematics
Linear Algebra (The Backbone of ML)
Scalars, vectors, matrices, tensors
Vector and matrix operations
Dot product & geometric interpretation
Matrix multiplication
Identity, transpose, inverse
Rank of a matrix
Systems of linear equations
Linear transformations
Column space & null space (intuition level)
Eigenvalues & eigenvectors (intuition + usage)
Orthogonality
Norms & distances (L1, L2)
Calculus (Learning Happens Here)
Differential Calculus
Functions and graphs
Limits (intuition only)
Derivatives and gradients
Partial derivatives
Chain rule (very important)
Gradient as direction of steepest descent
Local vs global minima
Convex vs non-convex functions
Optimization Concepts
Gradient Descent
Learning rate intuition
Cost / loss functions
Saddle points
Vanishing & exploding gradients (intuition)
Probability Theory (Uncertainty Handling)
Random variables
Discrete vs continuous variables
Probability distributions
PMF, PDF, CDF
Expectation & variance
Common distributions:
Bernoulli
Binomial
Normal
Uniform
Poisson
Independence & conditional probability
Bayes’ theorem
Likelihood vs probability
Statistics (From Data to Decisions)
Population vs sample
Measures of central tendency
Measures of dispersion
Covariance
Correlation
Bias & variance
Sampling techniques
Central Limit Theorem (intuition)
Law of Large Numbers
Outliers & robustness
Information Theory (Modern ML Intuition)
Entropy
Cross-entropy
KL divergence
Information gain
Why cross-entropy is used in classification
Geometry & Distance Measures
Euclidean distance
Manhattan distance
Cosine similarity
Angle between vectors
High-dimensional intuition (curse of dimensionality)
Probability + Linear Algebra in ML
Multivariate distributions
Gaussian distribution in higher dimensions
Covariance matrix interpretation
Mahalanobis distance
Matrix Factorization & Decomposition (High ROI)
Eigen decomposition
Singular Value Decomposition (SVD)
PCA math intuition
Dimensionality reduction rationale
Software Essentials
Version Control
Git fundamentals
Branching and merging
Pull requests
Code reviews
Merge conflict resolution
GitHub workflows
Development Environment
Virtual environments
Dependency management
Environment variables
Project structure
Reproducible setups
Working with APIs & Services
REST APIs
HTTP methods & status codes
JSON handling
Authentication mechanisms
Error handling
Rate limiting
Free Resources
videoGit & Github by CampusX
videoVirtual Environments
videoUV in Python
videoWhat is API
Cloud Fundamentals
Cloud Fundamentals
Cloud Basics
What cloud computing is
Cloud service models (IaaS, PaaS, SaaS)
Public, private, hybrid cloud
Regions, availability zones
Shared responsibility model
Core Cloud Services
Compute services
Storage services
Networking services
Managed databases
Managed AI/ML services
Compute Fundamentals
Virtual machines
Containers (conceptual)
Auto-scaling
Load balancing
Serverless computing
Storage Fundamentals
Object storage
Block storage
File storage
Networking Basics
Virtual networks (VPC/VNet)
Subnets
IP addressing
Firewalls and security groups
DNS
Load balancers
Databases in the Cloud
Relational databases
NoSQL databases
Managed database services
Backups and replication
Identity & Security
Identity and access management (IAM)
Roles and policies
Authentication vs authorization
Secrets management
Network security basics
Containers & Orchestration (Awareness)
Docker fundamentals
Container images
Container registries
Cloud for AI Workloads
GPU and accelerator instances
Batch vs real-time inference
Model deployment patterns
Data storage for ML pipelines
Cost & Resource Management
Pay-as-you-go pricing
Cost estimation
Resource tagging
Budgeting and cost monitoring
DevOps & Automation Basics
Infrastructure as code (conceptual)
CI/CD pipelines (conceptual)
Environment separation (dev, staging, prod)
Cloud Providers Awareness
AWS
Google Cloud Platform (GCP)
Microsoft Azure
AI Coding
AI-Assisted Development Basics
What AI coding assistants are
Code generation vs code completion
Prompting for code
Understanding AI-generated code
Prompting for Code
Writing clear coding prompts
Providing context and constraints
Iterative prompting
Asking for explanations and refactors
Reading & Validating AI Code
Understanding unfamiliar code
Identifying logical errors
Identifying security issues
Validating outputs
Testing AI-generated code
Refactoring with AI
Code simplification
Improving readability
Performance optimization
Modularization
Converting scripts into packages
Debugging with AI
Explaining errors and stack traces
Hypothesis-driven debugging
Step-by-step reasoning
Fixing edge cases
AI for Learning Codebases
Summarizing large codebases
Explaining functions and modules
Generating architecture overviews
Navigating unfamiliar repositories
AI for Data & ML Code
Writing data preprocessing code
Feature engineering code
Model training pipelines
Evaluation code
Experiment scripts
AI for Automation
Script generation
Workflow automation
Data pipeline scripts
DevOps-related scripts
AI Coding Tools Awareness
IDE-based AI assistants
Chat-based coding assistants
CLI-based AI tools
Code review assistants
Limitations of AI Coding
Hallucinated APIs
Outdated patterns
Overconfidence in incorrect code
Dependency mismatches
Machine Learning Fundamentals
What Machine Learning Really Is
What is Machine Learning (vs traditional programming)
Why ML works: pattern discovery from data
ML vs Statistics vs Rules-based systems
When not to use ML
Types of Machine Learning
Supervised learning
Unsupervised learning
Semi-supervised learning
Self-supervised learning (conceptual intro)
Reinforcement learning (high-level only)
Batch learning vs online learning
ML Problem Formulation
Regression vs classification
Binary vs multi-class vs multi-label
Clustering vs density estimation
Anomaly / outlier detection
Ranking & recommendation problems
Train / Validation / Test Split
Why splitting data matters
Train vs validation vs test sets
Data leakage (very important)
Hold-out validation
Cross-validation (conceptual, not math-heavy)
When test data should be touched (almost never)
Model Concept (Very Important)
What is a model?
Parameters vs hyperparameters
Hypothesis space intuition
Decision boundaries (visual intuition)
Linear vs non-linear models (conceptual)
Loss Functions (Optimization Target)
What is a loss function?
Loss vs error vs metric
Regression losses (MAE, MSE – intuition)
Classification losses (log loss – intuition)
Why models minimize loss, not accuracy
Average loss over dataset
Evaluation Metrics (Conceptual)
Regression metrics: MAE, MSE, RMSE, R² (intuition)
Classification metrics:
Accuracy
Precision, recall
F1-score
Confusion matrix intuition
Why accuracy is often a bad metric
Choosing the right metric for the problem
Bias–Variance Tradeoff
Bias vs variance intuition
Underfitting vs overfitting
Model complexity vs data size
How bias–variance shows up in practice
Why this tradeoff never disappears
End-to-End ML Workflow
Problem definition
Data collection
Data understanding
Train–validate loop
Model selection
Final evaluation
Deployment awareness (high-level)
Common ML Pitfalls (Must-Know)
Data leakage
Improper evaluation
Ignoring baseline models
Blindly trusting metrics
Free Resources
video100 Days of ML [Video 1-22]
Feature Engineering
What Feature Engineering Really Is
What is a feature?
Raw data vs features
Feature engineering vs feature selection
Why models don’t “understand” raw data
Feature engineering as signal extraction
When feature engineering matters more than algorithms
Understanding Data Before Engineering
Feature types:
Numerical
Categorical
Ordinal
Text (high-level)
Date & time
Continuous vs discrete variables
Cardinality (low vs high)
Feature distributions
Target leakage awareness
Missing Values Handling
Why missing values occur
Missing completely at random vs not random (intuition)
Deletion strategies (row/column)
Simple imputation:
Mean / median / mode
Constant value imputation
Flagging missingness as a feature
When not to impute
Encoding Categorical Variables
Why models can’t handle categories directly
Label encoding (when it works, when it breaks)
One-hot encoding
Dummy variable trap
Ordinal encoding
High-cardinality categorical features (conceptual intro)
Encoding leakage risks
Feature Scaling & Normalization
Why scale features?
Feature magnitude vs importance
Standardization (z-score)
Min–max scaling
Robust scaling (intuition)
When scaling is unnecessary
Scaling before vs after train-test split (very important)
Handling Outliers
What is an outlier?
Outliers vs rare but valid values
Visual detection (boxplots, scatter plots)
Statistical detection (intuition only)
Capping / flooring
Removal vs transformation
When outliers help the model
Feature Transformation
Why transform features?
Log transformation
Power transformations (intuition)
Handling skewed distributions
Non-linear transformations
Stabilizing variance
Interpretability tradeoffs
Feature Creation (High-Impact Section)
Domain-driven feature creation
Ratios and differences
Aggregated features (mean, count, sum)
Interaction features (feature × feature)
Binning / discretization
Polynomial features (intuition)
Temporal feature creation (high-level)
Date & Time Feature Engineering
Extracting year, month, day, weekday
Cyclical features (sin/cos intuition)
Time since / time until features
Lag features (conceptual)
Rolling window features (intuition)
Avoiding time-based leakage
Text Feature Engineering (Intro Level)
Why text needs special handling
Text cleaning basics
Tokenization (conceptual)
Bag of Words intuition
TF-IDF intuition
When feature engineering gives way to embeddings
What is deferred to NLP section
Feature Selection (Not Algorithms)
Why fewer features can be better
Redundant vs informative features
Correlation-based filtering
Variance thresholding (intuition)
Domain-driven selection
Selection vs dimensionality reduction (conceptual)
Feature Engineering Pipelines
Why pipelines matter
Train-test consistency
Fit vs transform distinction
Order of operations
Reproducibility
Avoiding leakage via pipelines
Feature Engineering Pitfalls (Must-Know)
Data leakage through features
Encoding using full dataset
Scaling using test data
Over-engineering features
Feature explosion
Ignoring domain knowledge
Free Resources
video100 Days of ML [Videos 23-45]
pending
ML Algorithms
Linear Models
Linear Regression
Multiple Linear Regression
Polynomial Regression
Ridge Regression
Lasso Regression
Elastic Net
Classification Algorithms
Logistic Regression
k-Nearest Neighbors (kNN)
Naive Bayes
Gaussian Naive Bayes
Multinomial Naive Bayes
Bernoulli Naive Bayes
Tree-Based Models
Decision Tree (Classification)
Decision Tree (Regression)
Ensemble Algorithms
Random Forest
Extra Trees (Extremely Randomized Trees)
Boosting Algorithms
AdaBoost
Gradient Boosting
XGBoost
LightGBM
CatBoost
Support Vector Machines
Support Vector Classifier (SVC)
Support Vector Regressor (SVR)
Unsupervised Learning Algorithms
K-Means
Hierarchical Clustering
DBSCAN
Dimensionality Reduction
Principal Component Analysis (PCA)
Kernel PCA
Linear Discriminant Analysis (LDA)
T-sne
Anomaly Detection
Isolation Forest
One-Class SVM
Local Outlier Factor (LOF)
Probabilistic Models
Gaussian Mixture Models (GMM)
Recommendation & Ranking
Matrix Factorization
Singular Value Decomposition (SVD)
Free Resources
video100 Days of ML [Videos 45-130]
pending
ML Advanced Concepts
Hyperparameter Optimization
Grid search
Random search
Bayesian optimization
Model Evaluation & Validation
Cross-validation strategies
Stratified sampling
Time-series validation
Nested cross-validation
Imbalanced Data Handling
Class imbalance problem
Oversampling
Undersampling
SMOTE
Class weighting
Threshold moving
Ensemble Theory (Beyond Algorithms)
Bagging vs boosting
Stacking
Blending
Voting classifiers
Interpretability & Explainability
Model interpretability vs explainability
Global vs local explanations
Feature importance
Partial dependence plots
SHAP
LIME
Model Selection & Comparison
Bias vs variance driven selection
Metric-driven model choice
Statistical significance testing
Scaling Machine Learning
Training on large datasets
Incremental / online learning
Distributed training (conceptual)
Memory vs compute tradeoffs
Free Resources
video100 Days of ML [Last 3-4 videos]
pending
End to End Projects
Recommendation Systems
Movie Recommendation System (Netflix-style)
E-commerce Product Recommendation (Amazon-style)
Online Course Recommendation
News / Content Feed Ranking
Music Playlist Recommendation
Prediction & Forecasting
House Price Prediction
Stock Price Movement Prediction
Sales Forecasting System
Demand Forecasting for Inventory
Energy Consumption Forecasting
Classification Systems
Spam Email Detection
Credit Card Fraud Detection
Loan Default Prediction
Customer Churn Prediction
Fake News Detection
Computer Vision (Classical ML / Intro DL)
Handwritten Digit Recognition
Product Image Classification
Traffic Sign Recognition
NLP-Based Systems
Sentiment Analysis System
Resume Screening System
News Article Categorization
Text Similarity / Duplicate Detection
Anomaly & Risk Detection
Fraud Detection System
Network Intrusion Detection
Insurance Claim Anomaly Detection
Manufacturing Fault Detection
Customer & Business Intelligence
Customer Segmentation System
Market Basket Analysis
Customer Lifetime Value Prediction
User Behavior Analytics
Healthcare & Social Impact
Disease Risk Prediction
Medical Cost Prediction
Famous “Interview Classic” Projects
House Price Prediction
Titanic Survival Prediction
Customer Churn Prediction
Credit Risk Modeling
Recommendation System
Free Resources
videoML Projects