Intelligence Artificielle
IRISI – S4. FSTG MARRAKECH.
[Link] BENHADDI.
CONTENT
Bias – variance tradeoff
Linear regression
Logistic regression
Regularization
Decision trees
Naïve Bayes
Support vector machine
Clustering
Principal component analysis (PCA)
Ensemble learning
Random forest and boosted trees
Ensemble learning
L'idée principale de l'apprentissage d'ensemble est de combiner les
résultats de plusieurs "apprenants faibles" pour obtenir des résultats plus
précis.
Bootstrap
Bootstrap est une stratégie d'échantillonnage populaire utilisée dans l'apprentissage d'ensemble.
Il applique un échantillonnage aléatoire avec remplacement : Row sampling.
Echantillon 1 Echantillon 2
#1 #1
#2 #4 Double
#3 #3
#4 #1
#5 #5
#6 #3
Bagging
Le Bagging est aussi appelé bootstrap aggregating.
Chaque model est entrainé avec un dataset bootstrappé, et le résultat est calculé par la
moyenne (regression) ou le vôte (classification).
Bootstrapped dataset 1 Model 1 Prediction 1 1
Bootstrapped dataset 2 Model 2 Prediction 2 1
Final
dataset 1
0 prediction
Bootstrapped dataset 3 Model 3 Prediction 3
Bootstrapped dataset 4 Model 4 Prediction 4 1
Cette technique réduit le over-fitting du modèle.
Boosting
Boosting est une variante du bagging où chaque modèle est construit sequentiellement (Adaboustng,
Gradient boosting, XgBoosting).
L’itération suivante met l’accent sur la partie des données qui étaient faussement prédites dans
l’itération précédente.
Samples falsely
Bootstrap dataset 1 Model 1 Test model 1
predicted
dataset Samples falsely
Bootstrap dataset 2 Model 2 Test model 2
predicted
Samples falsely
Bootstrap dataset 3 Model 3 Test model 3
predicted
Repeat
Adaptative boosting (Adaboost)
Le modèle ensemble est une somme pondérée de L faibles apprenants ( weak learners).
Bootstrap dataset 1 Model 1
Samples falsely predicted prediction
dataset
Bootstrap dataset 2 Model 2
Donc, on construit sequentiellement notre L faibles apprenants et on les aggrège en un seul apprenant fort.
Gradient boosting
The ensemble model as a weighted sum of L weak learners
dataset Model 1 Prediction 1 Pseudo-residuals 1
dataset Prediction of
Model 2 Pseudo-residuals 2
pseudo-residuals 1
Prediction of
dataset Model 3
pseudo-residuals 2
Stacking
Stacking has similar concepts as bagging, however, the models can be heterogeneous weak learners
Prediction
Bootstrapped dataset 11 Model 1 Prediction 1 1
Prediction
Bootstrapped dataset 22 Model 2 Prediction 2 1
Meta- Final
dataset Prediction 1
Prediction model prediction
Bootstrapped dataset 33 Model 3 Prediction 3 0
Prediction
Bootstrapped dataset 44 Model 4 Prediction 4 1
CONTENT
Bias – variance tradeoff
Linear regression
Logistic regression
Regularization
Decision trees
Naïve Bayes
Support vector machine
Clustering
Principal component analysis (PCA)
Ensemble learning
Random forest and boosted trees
Random forest
Random forest combine la simplicité des arbres de décision mais permet une grande amélioration de la
précision.
Random forest avec le bagging :
Bootstrap dataset 1 Decision tree 1
dataset Final
Bootstrap dataset 2 Decision tree 2
prediction
Bootstrap dataset 3 Decision tree 3
Bootstrap s'applique à la fois aux échantillons et aux fonctionnalités (features) (ne conservez qu'un
pourcentage de fonctionnalités pour chaque jeu de données bootstrap) :
Row sampling (bootstrapped dataset) + Features sampling
Random forest
▪ Le nombre de variables à utiliser est choisis en déroulant l’algorithme pour plusieurs valeurs et
en choisissant la valeur qui donne la meilleur précision.
Random Forest et Adaboost
Stump : un apprenant faible
Exemple
0.68 is the sum of
the normalized
weights
Random Forest : TP
Decision Trees & Random Forest for Beginners
[Link]
notebook