0% found this document useful (0 votes)
2 views12 pages

Example Problems Unit-4

Information Retrieval (IR) is crucial for efficiently managing large volumes of data, saving time, and supporting decision-making by providing ranked and relevant results. It is widely used in various domains such as web search engines, digital libraries, e-commerce, and healthcare systems. The document also discusses different models and techniques used in IR, including Boolean models, vector space models, and statistical language models.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as PDF, TXT or read online on Scribd
0% found this document useful (0 votes)
2 views12 pages

Example Problems Unit-4

Information Retrieval (IR) is crucial for efficiently managing large volumes of data, saving time, and supporting decision-making by providing ranked and relevant results. It is widely used in various domains such as web search engines, digital libraries, e-commerce, and healthcare systems. The document also discusses different models and techniques used in IR, including Boolean models, vector space models, and statistical language models.
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as PDF, TXT or read online on Scribd

Why Information Retrieval (IR) is Important

1. Handles Large Volumes of Data


Today, massive amounts of digital data are generated daily in the form of web pages,
emails, research papers, social media posts, and reports. Information Retrieval helps in
efficiently searching and extracting relevant information from these large data
collections.
2. Saves Time and Effort
Instead of manually searching through documents, IR systems quickly retrieve relevant
results based on user queries. This significantly reduces time and improves productivity.
3. Supports Decision Making
IR systems help professionals access accurate and relevant information needed for
decision-making. For example, researchers retrieve related research papers before
publishing their work.
4. Provides Ranked Results
Modern IR systems rank results based on relevance, ensuring users see the most useful
information first.
5. Improves User Experience
Features like auto-complete, spelling correction, and personalized recommendations are
powered by IR techniques, making systems more user-friendly.
6. Enables Knowledge Discovery
IR helps identify patterns, trends, and insights from large document collections,
supporting research and analytics.
Where Information Retrieval is Used
1. Web Search Engines
Search engines use IR to retrieve and rank billions of web pages based on user queries.
2. Digital Libraries and Academic Databases
Used to search research papers, journals, theses, and books in universities and research
institutions.
3. E-Commerce Platforms
Online shopping websites use IR to search and recommend products based on keywords
and user behavior.
4. Healthcare Systems
Medical databases use IR to retrieve patient records, medical literature, and treatment
guidelines.
5. Legal Information Systems
Law firms and courts use IR to search case laws, judgments, and legal documents.
6. Social Media Platforms
IR retrieves posts, videos, and trending topics based on hashtags and keywords.
7. Enterprise Document Management Systems
Organizations use IR to search internal documents, emails, policies, and reports.
8. Question Answering and Chatbots
Intelligent systems retrieve relevant information from knowledge bases to answer user
queries.
9. Multimedia Retrieval Systems
Used to search images, videos, and audio files based on metadata and content.
10. Plagiarism Detection Systems
Used in educational institutions to detect duplicate or copied content.
Example Problems

Boolean Model
Document Collection
D1: “data mining techniques”
D2: “data analysis methods”
D3: “machine learning and data mining”
Query
data AND mining
Step 1: Term Occurrence Table
Document data mining

D1 1 1

D2 1 0

D3 1 1

Step 2: Apply Boolean Operator (AND)


Condition: Document must contain both data and mining
 D1 → Yes
 D2 → No (mining absent)
 D3 → Yes
Final Result
Retrieved Documents: D1 and D3
Construction of Term Occurrence Table
A Term Occurrence Table (also called a binary term-document matrix) shows whether a term
appears in a document or not.
 If the term appears → 1
 If the term does not appear → 0
It is mainly used in the Boolean Retrieval Model.
Steps to Construct a Term Occurrence Table
Step 1: Collect Documents
Example:
D1: “data mining techniques”
D2: “data analysis methods”
D3: “machine learning and data mining”
Step 2: Preprocess Text
 Convert to lowercase
 Remove stopwords (optional)
 Tokenize
After preprocessing:
D1 → data, mining, techniques
D2 → data, analysis, methods
D3 → machine, learning, data, mining
Step 3: Create Vocabulary (Unique Terms)
Vocabulary = {data, mining, techniques, analysis, methods, machine, learning}
Step 4: Create Table (Binary Representation)

Term D1 D2 D3

data 1 1 1

mining 1 0 1

techniques 1 0 0

analysis 0 1 0

methods 0 1 0

machine 0 0 1

learning 0 0 1
 Each row represents a term.
 Each column represents a document.
 Value 1 indicates presence.
 Value 0 indicates absence.
Vector Space Model (VSM)
Document Collection
D1: “data mining”
D2: “data analysis”
D3: “mining techniques”
Query
data mining
Step 1: Vocabulary
Terms = {data, mining, analysis, techniques}
Step 2: Term Frequency Table

Term D1 D2 D3 Query

data 1 1 0 1

mining 1 0 1 1

analysis 0 1 0 0

techniques 0 0 1 0

Step 3: Vector Representation


D1 = (1,1,0,0)
D2 = (1,0,1,0)
D3 = (0,1,0,1)
Q = (1,1,0,0)
Step 4: Cosine Similarity
Similarity (D1, Q)

Similarity (D2, Q)
Similarity (D3, Q)

Final Ranking
1. D1 → 1.0 (Most relevant)
2. D2 → 0.5
3. D3 → 0.5
Construction of Term Frequency Table
A Term Frequency Table shows how many times a term appears in each document. Unlike the
occurrence table, it uses actual frequency counts instead of 0 and 1.
It is mainly used in the Vector Space Model.
Steps to Construct Term Frequency Table
Using the same documents:
D1: “data mining data techniques”
D2: “data analysis methods data”
D3: “machine learning data mining”
Step 1: Preprocess Text
D1 → data, mining, data, techniques
D2 → data, analysis, methods, data
D3 → machine, learning, data, mining
Step 2: Create Vocabulary
Vocabulary = {data, mining, techniques, analysis, methods, machine, learning}
Step 3: Count Frequency of Each Term
Term D1 D2 D3

data 2 2 1

mining 1 0 1

techniques 1 0 0

analysis 0 1 0
Term D1 D2 D3

methods 0 1 0

machine 0 0 1

learning 0 0 1
 Each cell contains the number of occurrences of a term in a document.
 This table is used to calculate:
 TF (Term Frequency)
 TF-IDF
 Cosine Similarity

Vector Space Model using TF–IDF


Step 1: Given Document Collection
D1: “data mining data”
D2: “data analysis”
D3: “mining techniques”
Query
data mining
Step 2: Preprocessing
Vocabulary (unique terms): {data, mining, analysis, techniques}
Total documents (N) = 3
Step 3: Term Frequency (TF) Table

Term D1 D2 D3 Query

data 2 1 0 1

mining 1 0 1 1

analysis 0 1 0 0

techniques 0 0 1 0

Step 4: Compute Document Frequency (DF)


DF = Number of documents containing the term
Term DF

data 2

mining 2

analysis 1

techniques 1

Step 5: Compute IDF

Step 6: Compute TF–IDF Weights

For D1
data = 2 × 0.176 = 0.352
mining = 1 × 0.176 = 0.176
D1 = (0.352, 0.176, 0, 0)
For D2
data = 1 × 0.176 = 0.176
analysis = 1 × 0.477 = 0.477
D2 = (0.176, 0, 0.477, 0)
For D3
mining = 1 × 0.176 = 0.176
techniques = 1 × 0.477 = 0.477
D3 = (0, 0.176, 0, 0.477)
For Query
data = 1 × 0.176 = 0.176
mining = 1 × 0.176 = 0.176
Q = (0.176, 0.176, 0, 0)
Step 7: Cosine Similarity Calculation

Similarity(D1, Q)
Dot Product:

Magnitude:
Final Ranking

Document Similarity Rank

D1 Highest (~0.95) 1

D2 Lower 2

D3 Lower 2

Document D1 is most relevant to the query “data mining” because it has the highest TF–IDF
weight for both query terms.

Statistical Language Model


Document Collection
D1: “data mining data”
D2: “machine learning”
Query
data mining
Step 1: Calculate Probabilities
Document D1
Total words = 3
P(data|D1) = 2/3
P(mining|D1) = 1/3

Document D2
Total words = 2
P(data|D2) = 0/2 = 0
P(mining|D2) = 0/2 = 0
Without smoothing → Probability = 0
Final Result
D1 has higher probability → More relevant
Example 2
Step 1: Given Document Collection
D1: “information retrieval retrieval system”
D2: “database management system”
Query
retrieval system
Step 2: Token Count
Document D1
Words: information, retrieval, retrieval, system
Total words = 4
Frequency:
 information = 1
 retrieval = 2
 system = 1
Document D2
Words: database, management, system
Total words = 3
Frequency:
 database = 1
 management = 1
 system = 1
Step 3: Compute Term Probabilities
Using:
\

Step 4: Compute Query Likelihood

Step 5: Final Ranking

Document Probability Rank

D1 0.125 1

D2 0 2

Document D1 is more relevant to the query “retrieval system” because it has the higher
probability of generating the query.

You might also like