0% ont trouvé ce document utile (0 vote)
4 vues7 pages

NLP

Transféré par

b00792507
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues7 pages

NLP

Transféré par

b00792507
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

1.

Project en data science, la preparation des données, la traitement d’images , GPU, outil
dataiku
2. Sur la banque et la position l’insepection générale (pourquoi)
3. Me presentation
a. Bonjour, je m’appelle Sihan. Actuellement, je suis en dernière année de Master
spécialisé en DSBA à CentraleSupélec et à l'ESSEC, classé troisième au niveau
mondial après le MIT (Sloan) et l'UCLA Anderson. Pendant le programme, J'ai
réalisé des projets dans les domaines de l'optimisation, du machine learning et
du deep learning. J’ai approfondi mes compétences dans le domaine des
données. De plus, le programme m’a donné les chances de pratiquer en utilisant
les données de la réalité. Par exemple, j’ai assisté au hackathon organisé par BCG
pour élaborer les time séries modèles de prédiction du trafic routier. J'ai obtenu
un premier diplôme de l'Université de Wisconsin-Madison avec une moyenne de
3.98 sur 4 (GPA), avec une triple specialités en mathématiques, statistiques et
économie. J'ai également reçu une mention honorifique dans le cadre du
programme. Ce parcours m’a permis de consolider ma connaissance de l’analyse
de données. Grâce à mes deux stages chez Deloitte en tant que IT data
consultante et chez Mext en tant que data analyste, j’ai compris les techniques
sur la modélisation et l’analyses des donné[Link]ès l'achèvement de mes études,
mon objectif est de travailler en tant que data analyst ou data engineer. Depuis
mes années universitaires, je suis passionné par l'exploration et l'analyse des
données pour obtenir des reculs et des solutions exploitables. Je comprends
l'importance des données dans le processus de la prise de décision stratégique
des entreprises. Voici, c’était ma présentation
4. Project sur la préparation des données
a. Cet vacance d’ete, jai fait un stage à Paris. Il y a deux missions principles: la
première partie est que je dois nettoyer les deux base de données et combiner
ensemble pour preparer l’algorithmes d’IA la deuxieme partie est que je dois
creer un algorithme pour gerer les categories selon les mots de clé des clients. La
premiere partie que je dois equilibrier comment reserver les deux informations
de deux bases des donnée mais le meme temps jetter les informations pour bien
connecter les deux bases des données. La deuxieme partie est que je dois
reserver les dictionaries pour chaque industries, et apres selon les mots clés, juge
quel industrie ce client se trouve si il y les nouvelles informations entrent.
5. Project sur le natural language processing en utilisant le modele de deep learning
a. J’ai attendu un kaggle competition sur identifier les commentaires toxiques.
6. Project sur le traitement d’image
a. Préparer des données en convertisant les données de numpy au format
TensorDatasets et puis construsant un DataLoader:
i. Convertir les données de numpy au format TensorDataset et puis
construire un DataLoader.
1. Dataloader :
a. il spécifie quel lot de données utilisé pour la prédiction
b. il permet de mélanger l'ordre des données.
b. Constructre un modèle de deep learning en ajoutant les couches differents :
i. Créer un modèle séquentiel
ii. ajouter un ou plus de la combination de couches de convolution et de
couches de pooling
iii. aplatir les caractéristiques bidimensionnelle en un vecteur
unidimensionnel
iv. ajouter des couches entièrement connectées
v. ajouter une couche de sortie.
c. Entraîne un modèle en Utilisant la fonction compile dans la python library keras
d. Évalue de la performance du modèle en utilisant la fonction evaluate() pour
évaluer.
e. Utilise le modele pour les prédictions en Utilisant la fonction predict pour
effectuer des prédictions avec le modèle.
7. Deep learning
a. Extraire des significations des données en utilisant une hiérarchie de plusieurs
couches (layer) d’unités, également appeléese neurones
b. Chaque unité calcule une somme pondérée de sses entrées, et cette somme
pondérée est ensuite passé à travers une fonction non linéaire.
2. CNN, le nom entier ou Convolutional Neural Network
a. Une architecture spécifique de réseaux de neurones (neuron network)
b. Pour des signaux stationnaires tels que l’audio, les images et la vidéo
c. Avantages
i. réduire efficacement la taille de grandes données en de petites données.
(Réduire les pixels d'une image n'affecte pas la capacité à distinguer les
objets.)
ii. Peut conserver efficacement les caractéristiques de l'image
d. Traiter des données structurées en grille surtout des images
e. Caractéristqiues
i. Convolutional Layers:
1. appliquent des filtres (noyau de convolution) pour
a. extraire des caractéristiques locales dans l’image
b. en obtenant les valeurs propres de ces petites zones
ii. Pooling Layers :
1. Après chaque couche de convolution
2. Réduire significativement la magnitude des paramètres pour
a. Diminue considérablement la quantité de calcul
b. Éviter efficacement le surajustement
iii. Activation Function :
1. Introduire de non-linéarité dans le modèle:
a. ce qui lui permet d'apprendre des motifs complexes et des
relations dans les données
b. backpropagation plus efficace
2. Des fonctions d'activation non linéaires, comme ReLU (Rectified
Linear Unit)- unité lineaire rectifiee
iv. Fully Connected Layers (couches entièrement connectées)
1. Mappe la représentation entre l’entrée et la sortie
3. RNN (recurrent neural network)
a. Pour l’information séquentielle et pour des données de séquences de longueurs
variables, par exemple dans le langage naturel
b. Utilise les même paramètres U (parametre pour l’état actuel), W(parametre pour
le dernier état, V: la parametre pour transformer l’état en sortie) à travers toutes
les étaps
i. Réduire le
calcul
ii. Eviter le
surajustement
c. SGD (stochastic
gradient desent) et BPTT(backpropagation though time) pour les parametres
d. Applications: prédiciton de séquence à séquence (traduction automatique,
reconnaissance vocale)…
4. Tanh(tangente hyperbolique)
a. Produit des valeurs dans l’intervalle entre -1 et 1
b. Dans les couches cachées
c. Introuire une non-linéairité et rend les sorties centrées autour de zéro
5. Sigmoid ou fonction logisitique
a.
a.
a.
a.
a.
a.
a.
a.
a.
a.
a.
a.
a.
Produit des valeur dans l’intervalle entre 0 et 1
b. Souvent dans les couches de sortie
6. les deux fonctions peut-etre amener à la situation de disparition du gradient parce que
les dérivés converge vers zero dans les deux côté, embechent les RNN standards
d'apprendre des dépendances à long terme.
7. ReLU (recitified linear unit)
a. Ca marche pour Replacer toutes les valeurs négatives par zéro et laisse les
valeurs positive inchangées
b. Dans les couches cachées
c. Reduire les effect de disparition du gradient
d. Accélére l’apprentissage

8.
8.
8.
8.
8.
8.
8.
8.
8.
8.
8.
LSTM (long short term memory) networks
a. Utilise un mécanisme de gating pour prévenir la disparition du gradient
b. trois portes : l'entrée (input), l'oubli (forget), et la sortie (output). + introduire un
memoire cellude c
c. la fonction sigmoïde: définir quelle proportion de l’entreé se retrouve à
d. La porte d'entrée(input gate) définit quelle proportion de l'état nouvellement
calculé vous souhaitez laisser passer.
e. La porte d'oubli(forget gate) détermine quelle proportion de l'état précédent
vous souhaitez laisser passer.
f. La porte de sortie(output gate) détermine quelle proportion de l'état interne
vous souhaitez exposer au réseau externe.
9. GRUs (gated recurrent units)
a. prévenir la disparition du gradient
b. Deux portes: une porte de réinitialization(reset gate) et une porte de mise à jour
(update gate)
c. La porte de réinitialization détermine définit quelle proportion de la mémoire
précédente conserver
d. La porte de mise à jour définit quel conserve et quel reinitialize dans l’etat cache
e. Different avec LSTM
i. Un GRU a deux portes, mais un LSTM a trois portes
ii. Le GRU n'a pas de mémoire interne.
iii. La porte de mise à jour est la porte d'entrée et les portes d'oubli dans un
LSTM
iv. Il n’y a pas de deuxième non-linéarité.
v. Entraînement plus rapide, moins de données à généraliser.
10. Attention mechanism
a. prévenir la disparition du gradient
b. look at the entire source sequence when generating each target word
11. GPU (Graphics Processing Unit)
a. Une importante puissance de calcul
b. nécessaire pour l’entraînement de réseaux de neurones performants
c. GPU a de milliers de cœur dédiés simultanément à une tâche unique vs un CPU
complète les tâches de manière séquntielle, et il peut être divisé en quelques
cœurs (typiquement 8 ou 16 cœurs), et chaque cœur peut effectuer une tâche
différente.

12. Les plus grandes différences entre l'apprentissage machine (ML) et l'apprentissage
profond (DL)
a. la complexité des modèles
i. ML prefere l’algorithme plus simple mais DL prefere l’algorithme de
réseaux de neurones avec des millions de paramètres et des hierarchie
complexe
b. la représentation des données
i. ML: les ingenieurs peuvent extraire et sélectionner manuellement des
caractéristiques pertinentes des données
ii. DL: les réseaux de neurones profonds peuvent apprendre
automatiquement des caractéristiques des données et les ingenierie ne
peuvent pas deciderer
c. la nécessité de grandes quantités de données.
i. ML: avec des ensembles de données plus petits
ii. DL grandes quantites de donnees pour generaliser efficacement et eviter
le surajustement
d. Puissance de calcul
i. DL utilise GPU et TPU
e. Interprétabilité
i. ML: plus interprétables
ii. Dl: boîtes noires
13. Architecture encodeur-décodeur
a. L'encodeur traite l'entrée séquentielle et crée une représentation.
b. Le décodeur utilise cette représentation pour générer une sortie.
14. Mécanisme d'attention
a. examine une séquence d'entrée et attribue un poids et une valeur à chaque mot
en fonction de sa pertinence pour distinguer l'importance de mots spécifiques.
15. Auto-attention
a. un mécanisme d'attention qui compare les différents éléments d'une séquence
d'entrée, recherchant des relations et des dépendances entre les éléments pour
aider à calculer leurs positions dans la sortie.
16. Attention multi-têtes
a. Plutôt que de s'appuyer sur un mécanisme d'attention isolé, les transformers
incluent plusieurs couches d'attention parallèles dans différentes parties du
modèle. Chaque tête traite différentes parties de la séquence d'entrée et se
concentre sur des représentations ayant des significations sémantiques ou
syntaxiques différentes.
17. Masquage
a. transformers peuvent masquer les positions futures dans la séquence d'entrée
afin de ne prêter attention qu'aux mots qui l'ont précédée dans la séquence. Le
décodeur ne peut se concentrer que sur ce qu'il a vu jusqu'à présent, pas sur ce
qui est à venir.
18. Traitement du langage naturel
a. Segmentation de sous-mots (tokenization/subtokenization) - BPE (encodage de
paires de caractères)
i. Divise les mots complexes en morceaux plus petits (sous-tokens) tout en
laissant les mots fréquents non divisés
ii. Résout le problème avec <inconnu>
iii. Atténue le problème avec les mots rares
iv. Fonctionne bien même sans prétraitement, surtout sur de grands corpus
b. Prétraitement
i. Éliminer les mots vides (stop words) ou la ponctuation
ii. Convertir tous les mots en minuscules
c. Couche d'incorporation : Transformer les mots en vecteurs
i. Sac de mots : extrait des caractéristiques du texte
1. Grand nombre de vecteurs d'entrée
2. Aucune relation de signification ou considération pour l'ordre des
mots
3. Intensif en calcul
ii. TF-IDF : recherche d'information, extraction de mots-clés
iii. Word2Vec : tâches d'analyse sémantique
iv. BERT (représentations d'encodeurs bidirectionnels à partir de
transformateurs) : traduction de langues, systèmes de questions-réponses
d. Couches récurrentes ou transformateurs
e. Prediction
f.
1. Reduce the costs: softmax, adding projection layers, GPU
2. 1. NLP leture notes + juptybook
3. DL 作业
4. 公司介绍

Vous aimerez peut-être aussi