PyPDF2 Tutorial Overview
PyPDF2 Tutorial Overview
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
okenization (is (the (process (of (splitting (text (into (individual (words (or
(Tokenizationةدرفنم تاملك ىلإ ةلمجلا عيطقت 🔹sentences
: ةيلخلا
NLTK wordnet
.ةقباسpunkt ةيلخلا ةيلخلا
: ةيلخلا
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
ةيلخلا ةيلخلا
ةقباس. ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
tokens (= (tokenizer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationtokenize).text (print)." ( okens (without (punctuation:"
tokens (```
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
Stop (words (are (common (words (that (are (usually (removed (in (text (processing
(Tokenizationةدرفنم تاملك ىلإ ةلمجلا عيطقت 🔹tasks
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
NLTK wordnet
.ةقباسpunkt ةيلخلا ةيلخلا
: ةيلخلا
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
ةيلخلا ةيلخلا
ةقباس. ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
Stemming (reduces (words (to (their (base (or (root (form🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenization
stemmer (= (PorterStemmer).
stemmed_words (= ([stemmer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationstem).token (for (token (in (tokens]
table (= (Pretty able). (table🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationfield_names (= (['word', ('stemmed (word']
for (word, (stw (in (zip).tokens, (stemmedwords : (table🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationaddrow).[word, (stw]
print).table (```
: ةيلخلا
POS (tagging (assigns (grammatical (tags (to (each (token, (such (as (noun, (verb,
etc🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenization
: ةيلخلا
NLTK wordnet
punktةقباس. ةيلخلا ةيلخلا
: ةيلخلا
for (word, (pos (in (zip).tokens, (taggedwords : (table🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationaddrow).[word, (pos[1]]
print).table (```
: ةيلخلا
WordNet NLTK
ةيلخلاlemmatizerةقباس.
Lemmatization (reduces (words (to (their (base (or (root (form (using (WordNet
Lemmatizer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenization
: ةيلخلا
🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenization).lemmatization ( فيرعت ةادأ يز فيرعت ةادأةفص ( يوغللا اهلصأ ىلإ ةملكلا عاجرإلWordNet
NLTK wordnet
punktةقباس. ةيلخلا ةيلخلا
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
print).table (```
: ةيلخلا
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
Prepare table
table (= (Pretty able).field_names=['word', ('POS (tag', ('stemmed (word', ('lemma
word (without (tagging', ('lemma (word (using (tagging']
for (word, (pos (in (taggedwords: (wnpos (= (getwordnetpos).pos (stemmed (=
stemmer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationstem).word (lemmatizedwithout (= (lemmatizer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationlemmatize).word
lemmatized (= (lemmatizer🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationlemmatize).word, (pos=wnpos (table🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationaddrow).[word,
pos, (stemmed, (lemmatizedwithout (,lemmatized] (print).table (```
: ةيلخلا
```
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
ةيلخلا ةيلخلا
ةقباس. ةقباس
text = ""
for page in [Link]:
text += page.extract_text()
metadata = [Link]
title = [Link]("/Title", [Link](pdf_path).replace(
author = [Link]("/Author", "Unknown")
return {
"title": title,
"content": text,
"author": author,
}
```
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
ةيلخلا ةيلخلا
ةقباس. ةقباس
writer.add_document(
title=title,
content=content,
author = author,
path=pdf_file
)
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
Convert to DataFrame
df (= (pd🔹 ( ةدرفنم تاملك ىلإ ةلمجلا عيطقتTokenizationDataFrame).index_data (df (```
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
ةقباس. ةقباس
```
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس
```
: ةيلخلا
ةيلخلا ةيلخلا
.ةقباس ةقباس