DATA SCIENCE USING PYTHON
SYLLABUS
Unit 1: Data Preprocessing and Cleaning
Importing data from various sources (CSV, Excel, SQL)
Exploring and understanding the dataset
Handling missing data: imputation techniques
Dealing with outliers and anomalies
Data transformation: normalization, standardization
Data integration and manipulation using pandas
Unit 2: Exploratory Data Analysis (EDA)
Descriptive statistics: mean, median, mode, variance, etc.
Histograms, box plots, scatter plots
Correlation analysis and heatmaps
Univariate and bivariate analysis
Data visualization using Matplotlib and Seaborn
Unit 3: Data Visualization
Advanced data visualization techniques: bar plots, line plots,
pie charts, etc.
Interactive visualizations using Plotly
Geospatial visualization
Effective data storytelling and communication
Unit 4: Statistical Analysis
Sampling techniques and the Central Limit Theorem
Hypothesis testing: t-tests, chi-square tests, ANOVA
Confidence intervals and p-values
Interpreting statistical results
Introduction to machine learning
Feature engineering and selection
Linear regression: simple and multiple regression
Logistic regression for classification
Decision trees and random forests
Model evaluation metrics: R-squared, MAE, RMSE, accuracy,
precision, recall, F1-score
Model assumptions and diagnostics
Unit 5: Real-World Projects and Case Studies
Applying data analysis concepts to real datasets
Solving data analysis challenges and problems
Creating a portfolio of data analysis projects