0% ont trouvé ce document utile (0 vote)
15 vues57 pages

Techniques pour éviter le surajustement

Le document traite des techniques d'apprentissage d'ensemble en intelligence artificielle, notamment le bagging, le boosting et le stacking. Il explique comment ces méthodes combinent plusieurs modèles pour améliorer la précision des prédictions tout en réduisant le surajustement. Des concepts comme le Random Forest et l'Adaptive Boosting (Adaboost) sont également abordés, illustrant l'importance de l'échantillonnage et de l'agrégation des résultats.

Transféré par

Hasnae Moulim
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PPTX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
15 vues57 pages

Techniques pour éviter le surajustement

Le document traite des techniques d'apprentissage d'ensemble en intelligence artificielle, notamment le bagging, le boosting et le stacking. Il explique comment ces méthodes combinent plusieurs modèles pour améliorer la précision des prédictions tout en réduisant le surajustement. Des concepts comme le Random Forest et l'Adaptive Boosting (Adaboost) sont également abordés, illustrant l'importance de l'échantillonnage et de l'agrégation des résultats.

Transféré par

Hasnae Moulim
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PPTX, PDF, TXT ou lisez en ligne sur Scribd

Intelligence Artificielle

IRISI – S4. FSTG MARRAKECH.


[Link] BENHADDI.
CONTENT

Bias – variance tradeoff


Linear regression
Logistic regression
Regularization
Decision trees
Naïve Bayes
Support vector machine
Clustering
Principal component analysis (PCA)
Ensemble learning
Random forest and boosted trees
Ensemble learning

L'idée principale de l'apprentissage d'ensemble est de combiner les


résultats de plusieurs "apprenants faibles" pour obtenir des résultats plus
précis.
Bootstrap

Bootstrap est une stratégie d'échantillonnage populaire utilisée dans l'apprentissage d'ensemble.

Il applique un échantillonnage aléatoire avec remplacement : Row sampling.

Echantillon 1 Echantillon 2
#1 #1
#2 #4 Double
#3 #3
#4 #1
#5 #5
#6 #3
Bagging

Le Bagging est aussi appelé bootstrap aggregating.

Chaque model est entrainé avec un dataset bootstrappé, et le résultat est calculé par la
moyenne (regression) ou le vôte (classification).
Bootstrapped dataset 1 Model 1 Prediction 1 1

Bootstrapped dataset 2 Model 2 Prediction 2 1


Final
dataset 1
0 prediction
Bootstrapped dataset 3 Model 3 Prediction 3

Bootstrapped dataset 4 Model 4 Prediction 4 1

Cette technique réduit le over-fitting du modèle.


Boosting
Boosting est une variante du bagging où chaque modèle est construit sequentiellement (Adaboustng,
Gradient boosting, XgBoosting).
L’itération suivante met l’accent sur la partie des données qui étaient faussement prédites dans
l’itération précédente.

Samples falsely
Bootstrap dataset 1 Model 1 Test model 1
predicted

dataset Samples falsely


Bootstrap dataset 2 Model 2 Test model 2
predicted

Samples falsely
Bootstrap dataset 3 Model 3 Test model 3
predicted

Repeat
Adaptative boosting (Adaboost)

Le modèle ensemble est une somme pondérée de L faibles apprenants ( weak learners).

Bootstrap dataset 1 Model 1

Samples falsely predicted prediction


dataset

Bootstrap dataset 2 Model 2

Donc, on construit sequentiellement notre L faibles apprenants et on les aggrège en un seul apprenant fort.
Gradient boosting

The ensemble model as a weighted sum of L weak learners

dataset Model 1 Prediction 1 Pseudo-residuals 1

dataset Prediction of
Model 2 Pseudo-residuals 2
pseudo-residuals 1

Prediction of
dataset Model 3
pseudo-residuals 2
Stacking

Stacking has similar concepts as bagging, however, the models can be heterogeneous weak learners

Prediction
Bootstrapped dataset 11 Model 1 Prediction 1 1
Prediction
Bootstrapped dataset 22 Model 2 Prediction 2 1
Meta- Final
dataset Prediction 1
Prediction model prediction
Bootstrapped dataset 33 Model 3 Prediction 3 0
Prediction
Bootstrapped dataset 44 Model 4 Prediction 4 1
CONTENT

Bias – variance tradeoff


Linear regression
Logistic regression
Regularization
Decision trees
Naïve Bayes
Support vector machine
Clustering
Principal component analysis (PCA)
Ensemble learning
Random forest and boosted trees
Random forest
Random forest combine la simplicité des arbres de décision mais permet une grande amélioration de la
précision.
Random forest avec le bagging :

Bootstrap dataset 1 Decision tree 1

dataset Final
Bootstrap dataset 2 Decision tree 2
prediction

Bootstrap dataset 3 Decision tree 3

Bootstrap s'applique à la fois aux échantillons et aux fonctionnalités (features) (ne conservez qu'un
pourcentage de fonctionnalités pour chaque jeu de données bootstrap) :
Row sampling (bootstrapped dataset) + Features sampling
Random forest
▪ Le nombre de variables à utiliser est choisis en déroulant l’algorithme pour plusieurs valeurs et
en choisissant la valeur qui donne la meilleur précision.
Random Forest et Adaboost
Stump : un apprenant faible
Exemple
0.68 is the sum of
the normalized
weights
Random Forest : TP
Decision Trees & Random Forest for Beginners
[Link]
notebook

Vous aimerez peut-être aussi