0% found this document useful (0 votes)
4 views9 pages

Data Engineering Detailed Study Guide

This study guide for the Data Engineering (BCSG0034) exam outlines key topics such as the Data Engineering Lifecycle, ETL processes, data modeling, and the differences between OLTP and OLAP systems. It emphasizes the importance of data engineering in supporting business decisions and analytics, as well as the significance of data quality and security. The guide also includes exam preparation tips and important questions to focus on for effective studying.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as PDF, TXT or read online on Scribd
0% found this document useful (0 votes)
4 views9 pages

Data Engineering Detailed Study Guide

This study guide for the Data Engineering (BCSG0034) exam outlines key topics such as the Data Engineering Lifecycle, ETL processes, data modeling, and the differences between OLTP and OLAP systems. It emphasizes the importance of data engineering in supporting business decisions and analytics, as well as the significance of data quality and security. The guide also includes exam preparation tips and important questions to focus on for effective studying.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as PDF, TXT or read online on Scribd

DATA ENGINEERING (BCSG0034) - DETAILED

EXAM STUDY GUIDE


Prepared from the GLA [Link] CSE (AIML) Syllabus
How to Use This Guide
This guide is designed for a 15-day preparation window. Focus first on: 1. Data Engineering
Lifecycle 2. ETL 3. Data Modeling & Normalization 4. OLTP vs OLAP 5. Data Warehouse vs Data
Lake 6. Data Pipelines & Airflow 7. Data Security & Privacy These topics frequently appear as
5-mark and 10-mark questions.
Introduction to Data Engineering

Data Engineering is the discipline of designing, building and maintaining systems that collect,
store, process and deliver data. It acts as the backbone of analytics, business intelligence,
data science and AI systems.

Importance:
• Makes data available in usable form.
• Supports business decisions.
• Enables machine learning and analytics.
• Handles large-scale data efficiently.

Applications:
E-commerce, healthcare, banking, logistics, social media, IoT, fraud detection and recommendation
systems.

Data Engineering Lifecycle

1. Data Generation – data produced by applications, websites, sensors and users.


2. Data Collection – gathering data using APIs, databases, scraping and logs.
3. Data Storage – storing data in databases, lakes or warehouses.
4. Data Processing – cleaning, transforming and enriching data.
5. Data Analysis – extracting insights through reports and dashboards.

Role of a Data Engineer:


• Build data pipelines.
• Maintain data quality.
• Design storage systems.
• Ensure scalability and security.

Data Collection

Sources of Data:
Internal Sources: ERP, CRM, transactions, inventory systems.
External Sources: APIs, social media, public datasets, partners.

Web Scraping:
Technique used to extract information from web pages.
Popular tools: BeautifulSoup, Selenium, Scrapy.

APIs:
Application Programming Interfaces allow software systems to exchange data.
Advantages: Structured data, reliable access, automation.

Batch Processing vs Stream Processing

Batch Processing:
Data processed at intervals.
Example: Monthly salary generation.

Advantages:
• Cost efficient
• Simpler implementation

Stream Processing:
Data processed continuously.
Example: UPI notifications, stock market feeds.

Advantages:
• Real-time insights
• Immediate action

Exam Table:
Batch = delayed results, grouped processing.
Stream = instant results, continuous processing.

Data Modeling and ER Diagrams

Data Modeling organizes information for storage and retrieval.

Entity: Real-world object (Student).


Attribute: Property (Roll Number).
Relationship: Association (Student enrolls in Course).

Benefits:
• Better database design
• Reduced redundancy
• Improved consistency

Normalization

Normalization reduces duplicate data.

1NF:
• Atomic values only.
• No repeating groups.

2NF:
• Must be in 1NF.
• Remove partial dependency.

3NF:
• Must be in 2NF.
• Remove transitive dependency.

Advantages:
• Better consistency
• Reduced redundancy

Denormalization:
Intentional duplication to improve query speed.

OLTP and OLAP

OLTP (Online Transaction Processing):


• Supports daily operations.
• Fast inserts and updates.
• Example: ATM, Railway booking.

OLAP (Online Analytical Processing):


• Supports reporting and analytics.
• Complex queries.
• Historical data.

Common Exam Difference:


OLTP = operational systems.
OLAP = decision support systems.

Relational Databases and NoSQL

Relational Databases:
MySQL, PostgreSQL, Oracle.
Characteristics:
• Tables and rows
• Structured schema
• ACID compliance

NoSQL Databases:
MongoDB (Document)
Redis (Key-Value)
Cassandra (Column)
Neo4j (Graph)

Advantages:
• Scalability
• Flexible schema
• High availability

Data Warehouse and Data Lake

Data Warehouse:
Stores processed and structured data.
Optimized for analytics.

Benefits:
• Faster reporting
• Historical analysis

Data Lake:
Stores raw data in original format.
Supports structured, semi-structured and unstructured data.

Warehouse = Processed.
Lake = Raw.

ETL Process

ETL = Extract, Transform, Load.

Extract:
Gather data from databases, APIs and files.

Transform:
Clean, standardize and enrich data.

Load:
Store transformed data into warehouse.

Benefits:
• Data consistency
• Better analytics
• Centralized storage

Most important long-answer topic.

Data Cleaning and Integration

Data Cleaning Techniques:


• Remove duplicates
• Handle missing values
• Correct formatting issues
• Validate records

Data Integration:
Combining data from multiple sources into a unified view.

Challenges:
• Different formats
• Duplicate records
• Inconsistent naming

Data Quality

Key Dimensions:
Accuracy – correct values.
Completeness – no missing values.
Consistency – same meaning everywhere.
Validity – follows rules.
Timeliness – up-to-date.
High quality data improves decision making.

Data Pipelines and Airflow

Data Pipeline:
Automated flow of data from source to destination.

Stages:
Ingestion → Processing → Storage → Analysis

Apache Airflow:
Workflow orchestration platform.
Uses DAGs (Directed Acyclic Graphs).

Functions:
• Scheduling
• Monitoring
• Dependency management

Pipeline Design Principles:


Scalability, Reliability, Monitoring, Security.

Monitoring and Maintenance

Metrics:
• Throughput
• Latency
• Error Rate
• Availability

Benefits:
• Detect failures early
• Maintain reliability
• Improve performance

Data Security and Privacy

Goals:
Confidentiality, Integrity and Availability (CIA Triad).

Security Measures:
• Authentication
• Authorization
• Encryption
• Access Control

Symmetric Encryption:
Same key for encryption and decryption.
Example: AES
Asymmetric Encryption:
Public and private keys.
Example: RSA

Data Privacy Regulations

Privacy protects personal information such as emails, phone numbers and IDs.

GDPR:
European privacy regulation.

DPDP Act:
India's Digital Personal Data Protection framework.

Importance:
• Protect users
• Reduce misuse
• Ensure legal compliance

Important Exam Questions

5 Marks:
• ETL
• Data Lake vs Warehouse
• OLTP vs OLAP
• Batch vs Stream Processing
• NoSQL Databases
• Airflow and DAG

10 Marks:
• Data Engineering Lifecycle
• ETL Architecture
• Normalization
• Data Pipelines
• Security and Privacy
• Relational vs NoSQL Databases
One-Day Before Exam Revision Sheet
Remember: • Lifecycle = Generation → Collection → Storage → Processing → Analysis • ETL =
Extract → Transform → Load • 1NF → 2NF → 3NF • OLTP = Transactions • OLAP = Analytics •
Warehouse = Processed Data • Lake = Raw Data • Airflow uses DAGs • AES = Symmetric
Encryption • RSA = Asymmetric Encryption • Data Quality = Accuracy, Completeness, Consistency,
Validity, Timeliness

You might also like