FICHE DE LECTURE
1. Identification
1.1. Auteurs Steven Bird, Ewan Klein, Edward Loper
1.2. Titre Natural Language Processing with Python
1.3. Mots clés NLP, Python, Text Processing, NLTK, Linguistic Data,
Corpora, Computational Linguistics, Text Mining
1.4. Nombre de 504 (en PDF)
pages
1.5. Nombre de Plus de 100
références
1.6. Source O'Reilly Media, Inc.
1.7. Date de l'article 2009
2. Identification de la fiche
2.1. Steven Bird, Ewan Klein, Edward Loper
Auteur
2.2. 2009
Date
3. Plan de l'article
1. Introduction à la NLP et à Python
2. Accès aux corpus textuels et ressources lexicales
3. Traitement des textes bruts
4. Écriture de programmes structurés
5. Catégorisation et étiquetage des mots
6. Classification supervisée de textes
7. Extraction d'information à partir de textes
8. Analyse de la structure des phrases
9. Conception de grammaires basées sur des fonctionnalités
10. Analyse sémantique des phrases
11. Gestion des données linguistiques
12. Conclusion et perspectives
4. Résumé
Ce manuel vise à introduire les concepts et outils pour la programmation en Python dans le
but de faire des traitements automatiques des langues (NLP). Ceci utilise principalement la
bibliothèque Natural Language Toolkit.
Dans cet ouvrage, on y trouve les techniques de catégorisation des mots, l’étiquetage
automatique et analyse grammaticale des phrases, en exploitant la classification supervisée, les
arbres de décision ainsi que les méthodes de classifications bayésiennes naïves.
A part cela, on y trouve aussi la gestion des données linguistiques aussi sur les défis actuels
et futurs concernant le domaine du traitement automatiques des langues. Tout cela expliquer et
appliquer avec des exemples concrètes.
5. Problématiques
Le thème abordé s’oriente plutôt sur la manipulation des données textuelles, que ce soit
avec les algorithmes, les techniques utilisé pour les NLP.
Les problématiques peuvent se résumer par les questions :
Comment automatiser efficacement l'analyse et le traitement des grandes quantités de
données textuelles avec Python ?
Quels sont les principaux algorithmes et techniques utilisés dans le traitement automatique
des langues ?
Comment classifier et extraire automatiquement des informations pertinentes à partir de
textes non structurés ?
6. Proposition
6.1. Message global de l’article Ce document met en avant la puissance du Python,
surtout la biblio NLTK pour la gestion, la manipulation et
l’analyse des données linguistiques cela en renforçant le fait de
rendre possible l’automatisation de nombreuses tâches liées à
la NLP, tout en permettant une exploration approfondie des
structures textuelles.
6.2. Résultats En lisant ce document, on peut acquérir une bonne base
de compréhension approfondie des processus de NLP, partant
de la manipulation du corpus en passant par la gestion des
données historiques jusqu’à la création de modèles de
classification textuelle avancées.
7. Perspectives
L'ouvrage ouvre des pistes pour l'application du NLP dans des domaines variés tels que la
recherche d'information, le traitement automatique des données vocales et la traduction
automatique. Il propose également des directions pour les futurs développements de la NLP.
8. Principales références
NLTK Documentation
• Source : NLTK Library Documentation
• Lien : [Link]
Documentation Python
• Source : Python Official Documentation
• Lien (non accessible) : [Link]
Speech and Language Processing
• Auteurs : Daniel Jurafsky et James Martin
• Date : 2008
Remarques :
Dans le cadre de ma thèse sur la GENERATION AUTOMATIQUE DE QUESTIONS ET LA
PREDICTION DES RESULTATS D’ENQUETES, l'approche présentée dans ce document s'avère
particulièrement pertinente dans le cadre de l’exploration et la manipulation des données textuelles
dans le cadre de la génération automatiques des questions et l’analyse des réponses et résultats des
requête concernant les enquêtes. Surtout dans l’usage de Python pour le NLP.