0% found this document useful (0 votes)
7 views39 pages

Python

The document outlines a comprehensive curriculum for mastering Python, SQL, mathematics, and cloud fundamentals, essential for AI and machine learning applications. It covers core programming concepts, data structures, object-oriented programming, error handling, and advanced topics like asynchronous programming and data visualization. Additionally, it includes machine learning fundamentals, feature engineering, and practical skills for cloud computing and version control, emphasizing the integration of these skills in real-world applications.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as DOCX, PDF, TXT or read online on Scribd
0% found this document useful (0 votes)
7 views39 pages

Python

The document outlines a comprehensive curriculum for mastering Python, SQL, mathematics, and cloud fundamentals, essential for AI and machine learning applications. It covers core programming concepts, data structures, object-oriented programming, error handling, and advanced topics like asynchronous programming and data visualization. Additionally, it includes machine learning fundamentals, feature engineering, and practical skills for cloud computing and version control, emphasizing the integration of these skills in real-world applications.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as DOCX, PDF, TXT or read online on Scribd

Python

Python Core Fundamentals


 Python syntax, indentation, code style (PEP8)
 Variables, data types, type casting
 Input/output, comments, docstrings
 Control flow: if / else, loops (for, while)
 Functions, arguments, return values
 Lambda functions
 List / dict / set comprehensions

Built-in Data Structures (Must-Master)


 Lists
 Tuples
 Sets
 Dictionaries
 Strings (immutability, slicing, formatting)

Pythonic Thinking
 Iterators and generators
 zip, enumerate, map, filter, reduce
 Shallow vs deep copy
 Mutability vs immutability
 *args and **kwargs

Object-Oriented Programming (OOP)


 Classes and objects
 Constructors (__init__)
 Instance vs class variables
 Methods and dunder methods
 Inheritance and method overriding
 Polymorphism
 Encapsulation & abstraction
 Dataclasses (@dataclass)

Error Handling & Debugging


 Exceptions (try / except / finally)
 Custom exceptions
 Common runtime errors

Modules, Packages & Environments


 Import system (import, from, as)
 Creating modules and packages
 Virtual environments (venv, conda)
 Dependency management (pip, [Link], poetry)
 Understanding __main__

File Handling & Serialization


 Reading/writing text files
 CSV, JSON handling
 Pickle (pros & cons)
 Working with directories (os, pathlib)
 Logging to files

Numerical Computing (AI Foundation)


 NumPy
 Arrays, shapes, dtypes
 Broadcasting
 Vectorized operations
 Linear algebra basics
 Random sampling
Data Analysis & Manipulation
 Pandas
 Series and DataFrames
 Indexing & filtering
 GroupBy & aggregation
 Missing values handling
 Merging & joining
 Time-series basics

Data Visualization (Essential)


 Matplotlib
 Seaborn
 Plot types for EDA

Standard Library (High-ROI Parts)


 os, sys
 pathlib
 datetime, time
 math, random
 logging
Asynchronous & Parallel Python (Modern AI Apps)
 Multithreading vs multiprocessing
 async / await
 Async I/O basics
 When to use each

Other Python Libraries


 FastAPI
 Pydantic

Production-Ready Python Mindset


 Writing clean, readable code
 Modular design
 Logging & monitoring mindset
 Reading other people’s code
[Link]

SQL
SQL Fundamentals
 What SQL is & why databases exist
 Relational database concepts
 Tables, rows, columns
 Primary key vs foreign key
 Basic SQL syntax & formatting
 Data Manipulation (DML)
 INSERT
 UPDATE
 DELETE
 UPSERT (ON CONFLICT)
 Transactions (BEGIN, COMMIT, ROLLBACK)

Table Design & Schema Basics


 Creating tables (CREATE TABLE)
 Constraints:
 PRIMARY KEY
 FOREIGN KEY
 UNIQUE
 NOT NULL
 CHECK
 Indexes (conceptual + practical)
 Normalization basics (1NF, 2NF, 3NF)
 Denormalization (when & why)

Core Querying (Absolute Must)


 SELECT
 FROM
 WHERE
 DISTINCT
 ORDER BY
 LIMIT / OFFSET
 Aliases (AS)

Filtering & Conditions


 Comparison operators (=, !=, <, >, BETWEEN)
 Logical operators (AND, OR, NOT)
 IN, NOT IN
 LIKE, ILIKE
 IS NULL, IS NOT NULL
 Case expressions (CASE WHEN)

Aggregations & Grouping


 Aggregate functions:
 COUNT
 SUM
 AVG
 MIN, MAX
 GROUP BY
 HAVING
 Difference between WHERE and HAVING
Joins (Critical for Real Data)
 INNER JOIN
 LEFT JOIN
 RIGHT JOIN
 FULL OUTER JOIN
 CROSS JOIN
 Join conditions & join keys
 Self joins
 Common join pitfalls (duplicate rows)

Subqueries & CTEs


 Subqueries in SELECT, FROM, WHERE
 Correlated subqueries
 WITH (Common Table Expressions)
 Recursive CTEs (conceptual)
 When to use CTEs vs subqueries

Window Functions (AI / Analytics Superpower)


 OVER() clause
 PARTITION BY
 ORDER BY in windows
 Ranking functions:
 ROW_NUMBER
 RANK
 DENSE_RANK
 Aggregate window functions
 Lag/lead (LAG, LEAD)
 Running totals & moving averages
Data Cleaning & Transformation
 String functions (LOWER, UPPER, TRIM, SUBSTRING)
 Date/time functions
 Type casting (CAST, ::)
 Handling missing values
 Conditional transformations
 Normalizing raw data using SQL

Performance & Optimization (High ROI)


 Indexes and how they work
 Query execution plans (EXPLAIN)
 Common slow query patterns
 Filtering early vs late
 Avoiding unnecessary joins
 When SQL beats Pandas

Analytical Thinking with SQL


 Funnel analysis
 Cohort analysis
 Time-based analysis
 User behavior analysis
 Feature extraction using SQL
 Creating ML-ready datasets

SQL Dialects Awareness


 PostgreSQL
 MySQL
 SQLite
 BigQuery / Snowflake (conceptual)
 ANSI SQL vs dialect differences

SQL + Python Integration


 Running SQL from Python
 sqlite3, psycopg2, sqlalchemy
 Pandas + SQL workflows
 Writing parameterized queries
 Avoiding SQL injection

Databases Every AI Engineer Should Touch


 PostgreSQL
 SQLite
 MySQL
 Cloud warehouses (BigQuery / Redshift / Snowflake – awareness)

Real-World SQL Skills


 Writing readable SQL
 Breaking complex queries into steps
 Commenting queries
 Versioning SQL
 Debugging wrong results
[Link]

Mathematics
Linear Algebra (The Backbone of ML)
 Scalars, vectors, matrices, tensors
 Vector and matrix operations
 Dot product & geometric interpretation
 Matrix multiplication
 Identity, transpose, inverse
 Rank of a matrix
 Systems of linear equations
 Linear transformations
 Column space & null space (intuition level)
 Eigenvalues & eigenvectors (intuition + usage)
 Orthogonality
 Norms & distances (L1, L2)
Calculus (Learning Happens Here)
Differential Calculus
 Functions and graphs
 Limits (intuition only)
 Derivatives and gradients
 Partial derivatives
 Chain rule (very important)
 Gradient as direction of steepest descent
 Local vs global minima
 Convex vs non-convex functions

Optimization Concepts
 Gradient Descent
 Learning rate intuition
 Cost / loss functions
 Saddle points
 Vanishing & exploding gradients (intuition)

Probability Theory (Uncertainty Handling)


 Random variables
 Discrete vs continuous variables
 Probability distributions
 PMF, PDF, CDF
 Expectation & variance
 Common distributions:
 Bernoulli
 Binomial
 Normal
 Uniform
 Poisson
 Independence & conditional probability
 Bayes’ theorem
 Likelihood vs probability

Statistics (From Data to Decisions)


 Population vs sample
 Measures of central tendency
 Measures of dispersion
 Covariance
 Correlation
 Bias & variance
 Sampling techniques
 Central Limit Theorem (intuition)
 Law of Large Numbers
 Outliers & robustness

Information Theory (Modern ML Intuition)


 Entropy
 Cross-entropy
 KL divergence
 Information gain
 Why cross-entropy is used in classification

Geometry & Distance Measures


 Euclidean distance
 Manhattan distance
 Cosine similarity
 Angle between vectors
 High-dimensional intuition (curse of dimensionality)

Probability + Linear Algebra in ML


 Multivariate distributions
 Gaussian distribution in higher dimensions
 Covariance matrix interpretation
 Mahalanobis distance

Matrix Factorization & Decomposition (High ROI)


 Eigen decomposition
 Singular Value Decomposition (SVD)
 PCA math intuition
 Dimensionality reduction rationale

Software Essentials
Version Control
 Git fundamentals
 Branching and merging
 Pull requests
 Code reviews
 Merge conflict resolution
 GitHub workflows

Development Environment
 Virtual environments
 Dependency management
 Environment variables
 Project structure
 Reproducible setups

Working with APIs & Services


 REST APIs
 HTTP methods & status codes
 JSON handling
 Authentication mechanisms
 Error handling
 Rate limiting
Free Resources
 videoGit & Github by CampusX
 videoVirtual Environments
 videoUV in Python
 videoWhat is API

Cloud Fundamentals
Cloud Fundamentals

Cloud Basics
 What cloud computing is
 Cloud service models (IaaS, PaaS, SaaS)
 Public, private, hybrid cloud
 Regions, availability zones
 Shared responsibility model

Core Cloud Services


 Compute services
 Storage services
 Networking services
 Managed databases
 Managed AI/ML services

Compute Fundamentals
 Virtual machines
 Containers (conceptual)
 Auto-scaling
 Load balancing
 Serverless computing

Storage Fundamentals
 Object storage
 Block storage
 File storage

Networking Basics
 Virtual networks (VPC/VNet)
 Subnets
 IP addressing
 Firewalls and security groups
 DNS
 Load balancers

Databases in the Cloud


 Relational databases
 NoSQL databases
 Managed database services
 Backups and replication

Identity & Security


 Identity and access management (IAM)
 Roles and policies
 Authentication vs authorization
 Secrets management
 Network security basics

Containers & Orchestration (Awareness)


 Docker fundamentals
 Container images
 Container registries

Cloud for AI Workloads


 GPU and accelerator instances
 Batch vs real-time inference
 Model deployment patterns
 Data storage for ML pipelines

Cost & Resource Management


 Pay-as-you-go pricing
 Cost estimation
 Resource tagging
 Budgeting and cost monitoring

DevOps & Automation Basics


 Infrastructure as code (conceptual)
 CI/CD pipelines (conceptual)
 Environment separation (dev, staging, prod)

Cloud Providers Awareness


 AWS
 Google Cloud Platform (GCP)
 Microsoft Azure
AI Coding
AI-Assisted Development Basics
 What AI coding assistants are
 Code generation vs code completion
 Prompting for code
 Understanding AI-generated code

Prompting for Code


 Writing clear coding prompts
 Providing context and constraints
 Iterative prompting
 Asking for explanations and refactors

Reading & Validating AI Code


 Understanding unfamiliar code
 Identifying logical errors
 Identifying security issues
 Validating outputs
 Testing AI-generated code
Refactoring with AI
 Code simplification
 Improving readability
 Performance optimization
 Modularization
 Converting scripts into packages

Debugging with AI
 Explaining errors and stack traces
 Hypothesis-driven debugging
 Step-by-step reasoning
 Fixing edge cases

AI for Learning Codebases


 Summarizing large codebases
 Explaining functions and modules
 Generating architecture overviews
 Navigating unfamiliar repositories
AI for Data & ML Code
 Writing data preprocessing code
 Feature engineering code
 Model training pipelines
 Evaluation code
 Experiment scripts

AI for Automation
 Script generation
 Workflow automation
 Data pipeline scripts
 DevOps-related scripts

AI Coding Tools Awareness


 IDE-based AI assistants
 Chat-based coding assistants
 CLI-based AI tools
 Code review assistants
Limitations of AI Coding
 Hallucinated APIs
 Outdated patterns
 Overconfidence in incorrect code
 Dependency mismatches

Machine Learning Fundamentals


What Machine Learning Really Is
 What is Machine Learning (vs traditional programming)
 Why ML works: pattern discovery from data
 ML vs Statistics vs Rules-based systems
 When not to use ML

Types of Machine Learning


 Supervised learning
 Unsupervised learning
 Semi-supervised learning
 Self-supervised learning (conceptual intro)
 Reinforcement learning (high-level only)
 Batch learning vs online learning
ML Problem Formulation
 Regression vs classification
 Binary vs multi-class vs multi-label
 Clustering vs density estimation
 Anomaly / outlier detection
 Ranking & recommendation problems

Train / Validation / Test Split


 Why splitting data matters
 Train vs validation vs test sets
 Data leakage (very important)
 Hold-out validation
 Cross-validation (conceptual, not math-heavy)
 When test data should be touched (almost never)

Model Concept (Very Important)


 What is a model?
 Parameters vs hyperparameters
 Hypothesis space intuition
 Decision boundaries (visual intuition)
 Linear vs non-linear models (conceptual)
Loss Functions (Optimization Target)
 What is a loss function?
 Loss vs error vs metric
 Regression losses (MAE, MSE – intuition)
 Classification losses (log loss – intuition)
 Why models minimize loss, not accuracy
 Average loss over dataset

Evaluation Metrics (Conceptual)


 Regression metrics: MAE, MSE, RMSE, R² (intuition)
 Classification metrics:
 Accuracy
 Precision, recall
 F1-score
 Confusion matrix intuition
 Why accuracy is often a bad metric
 Choosing the right metric for the problem

 Bias–Variance Tradeoff
 Bias vs variance intuition
 Underfitting vs overfitting
 Model complexity vs data size
 How bias–variance shows up in practice
 Why this tradeoff never disappears
End-to-End ML Workflow
 Problem definition
 Data collection
 Data understanding
 Train–validate loop
 Model selection
 Final evaluation
 Deployment awareness (high-level)

Common ML Pitfalls (Must-Know)


 Data leakage
 Improper evaluation
 Ignoring baseline models
 Blindly trusting metrics

Free Resources
 video100 Days of ML [Video 1-22]

Feature Engineering
What Feature Engineering Really Is
 What is a feature?
 Raw data vs features
 Feature engineering vs feature selection
 Why models don’t “understand” raw data
 Feature engineering as signal extraction
 When feature engineering matters more than algorithms

Understanding Data Before Engineering


 Feature types:
 Numerical
 Categorical
 Ordinal
 Text (high-level)
 Date & time
 Continuous vs discrete variables
 Cardinality (low vs high)
 Feature distributions
 Target leakage awareness

Missing Values Handling


 Why missing values occur
 Missing completely at random vs not random (intuition)
 Deletion strategies (row/column)
 Simple imputation:
 Mean / median / mode
 Constant value imputation
 Flagging missingness as a feature
 When not to impute
Encoding Categorical Variables
 Why models can’t handle categories directly
 Label encoding (when it works, when it breaks)
 One-hot encoding
 Dummy variable trap
 Ordinal encoding
 High-cardinality categorical features (conceptual intro)
 Encoding leakage risks

Feature Scaling & Normalization


 Why scale features?
 Feature magnitude vs importance
 Standardization (z-score)
 Min–max scaling
 Robust scaling (intuition)
 When scaling is unnecessary
 Scaling before vs after train-test split (very important)

Handling Outliers
 What is an outlier?
 Outliers vs rare but valid values
 Visual detection (boxplots, scatter plots)
 Statistical detection (intuition only)
 Capping / flooring
 Removal vs transformation
 When outliers help the model

Feature Transformation
 Why transform features?
 Log transformation
 Power transformations (intuition)
 Handling skewed distributions
 Non-linear transformations
 Stabilizing variance
 Interpretability tradeoffs

Feature Creation (High-Impact Section)


 Domain-driven feature creation
 Ratios and differences
 Aggregated features (mean, count, sum)
 Interaction features (feature × feature)
 Binning / discretization
 Polynomial features (intuition)
 Temporal feature creation (high-level)
Date & Time Feature Engineering
 Extracting year, month, day, weekday
 Cyclical features (sin/cos intuition)
 Time since / time until features
 Lag features (conceptual)
 Rolling window features (intuition)
 Avoiding time-based leakage

Text Feature Engineering (Intro Level)


 Why text needs special handling
 Text cleaning basics
 Tokenization (conceptual)
 Bag of Words intuition
 TF-IDF intuition
 When feature engineering gives way to embeddings
 What is deferred to NLP section

Feature Selection (Not Algorithms)


 Why fewer features can be better
 Redundant vs informative features
 Correlation-based filtering
 Variance thresholding (intuition)
 Domain-driven selection
 Selection vs dimensionality reduction (conceptual)
Feature Engineering Pipelines
 Why pipelines matter
 Train-test consistency
 Fit vs transform distinction
 Order of operations
 Reproducibility
 Avoiding leakage via pipelines

Feature Engineering Pitfalls (Must-Know)


 Data leakage through features
 Encoding using full dataset
 Scaling using test data
 Over-engineering features
 Feature explosion
 Ignoring domain knowledge
Free Resources
 video100 Days of ML [Videos 23-45]

pending

ML Algorithms
Linear Models
 Linear Regression
 Multiple Linear Regression
 Polynomial Regression
 Ridge Regression
 Lasso Regression
 Elastic Net

Classification Algorithms
 Logistic Regression
 k-Nearest Neighbors (kNN)
 Naive Bayes
 Gaussian Naive Bayes
 Multinomial Naive Bayes
 Bernoulli Naive Bayes

Tree-Based Models
 Decision Tree (Classification)
 Decision Tree (Regression)

Ensemble Algorithms
 Random Forest
 Extra Trees (Extremely Randomized Trees)
Boosting Algorithms
 AdaBoost
 Gradient Boosting
 XGBoost
 LightGBM
 CatBoost

Support Vector Machines


 Support Vector Classifier (SVC)
 Support Vector Regressor (SVR)

Unsupervised Learning Algorithms


 K-Means
 Hierarchical Clustering
 DBSCAN

Dimensionality Reduction
 Principal Component Analysis (PCA)
 Kernel PCA
 Linear Discriminant Analysis (LDA)
 T-sne
Anomaly Detection
 Isolation Forest
 One-Class SVM
 Local Outlier Factor (LOF)

Probabilistic Models
 Gaussian Mixture Models (GMM)

Recommendation & Ranking


 Matrix Factorization
 Singular Value Decomposition (SVD)
Free Resources
 video100 Days of ML [Videos 45-130]

pending

ML Advanced Concepts
Hyperparameter Optimization
 Grid search
 Random search
 Bayesian optimization
Model Evaluation & Validation
 Cross-validation strategies
 Stratified sampling
 Time-series validation
 Nested cross-validation

Imbalanced Data Handling


 Class imbalance problem
 Oversampling
 Undersampling
 SMOTE
 Class weighting
 Threshold moving

Ensemble Theory (Beyond Algorithms)


 Bagging vs boosting
 Stacking
 Blending
 Voting classifiers
Interpretability & Explainability
 Model interpretability vs explainability
 Global vs local explanations
 Feature importance
 Partial dependence plots
 SHAP
 LIME

Model Selection & Comparison


 Bias vs variance driven selection
 Metric-driven model choice
 Statistical significance testing

Scaling Machine Learning


 Training on large datasets
 Incremental / online learning
 Distributed training (conceptual)
 Memory vs compute tradeoffs
Free Resources
 video100 Days of ML [Last 3-4 videos]

pending

End to End Projects


Recommendation Systems
 Movie Recommendation System (Netflix-style)
 E-commerce Product Recommendation (Amazon-style)
 Online Course Recommendation
 News / Content Feed Ranking
 Music Playlist Recommendation

Prediction & Forecasting


 House Price Prediction
 Stock Price Movement Prediction
 Sales Forecasting System
 Demand Forecasting for Inventory
 Energy Consumption Forecasting

Classification Systems
 Spam Email Detection
 Credit Card Fraud Detection
 Loan Default Prediction
 Customer Churn Prediction
 Fake News Detection

Computer Vision (Classical ML / Intro DL)


 Handwritten Digit Recognition
 Product Image Classification
 Traffic Sign Recognition

NLP-Based Systems
 Sentiment Analysis System
 Resume Screening System
 News Article Categorization
 Text Similarity / Duplicate Detection

Anomaly & Risk Detection


 Fraud Detection System
 Network Intrusion Detection
 Insurance Claim Anomaly Detection
 Manufacturing Fault Detection

Customer & Business Intelligence


 Customer Segmentation System
 Market Basket Analysis
 Customer Lifetime Value Prediction
 User Behavior Analytics
Healthcare & Social Impact
 Disease Risk Prediction
 Medical Cost Prediction

Famous “Interview Classic” Projects


 House Price Prediction
 Titanic Survival Prediction
 Customer Churn Prediction
 Credit Risk Modeling
 Recommendation System
Free Resources
 videoML Projects

You might also like