Exposé : Introduction au Machine Learning et aux Techniques Avancées
Introduction
Bonjour à tous, aujourd'hui je vais vous parler de quelques concepts essentiels en machine
learning,
notamment les forêts aléatoires, une technique très populaire pour résoudre des problèmes
de classification et de régression.
Nous allons aborder les bases du machine learning, pourquoi la variance est un problème
dans les algorithmes comme les arbres de décision,
et comment des techniques comme le Bagging peuvent améliorer les performances.
Estimateurs de Variance Élevée
Les arbres de décision sont très utiles, car ils sont simples à comprendre et à visualiser.
Mais ils présentent un inconvénient majeur : une grande instabilité. Cela signifie que des
changements minimes dans les données
peuvent produire des arbres très différents. Cette instabilité se traduit par une variance
élevée dans les prédictions,
ce qui peut poser problème lorsque l’on travaille avec des données bruitées ou imprécises.
Pour résoudre ce problème, des techniques comme le Bagging et les forêts aléatoires ont été
développées.
Elles visent à réduire la variance en combinant plusieurs modèles pour produire une
moyenne plus stable.
Bagging (Bootstrap Aggregating)
Le Bagging est une technique puissante qui utilise le principe de la moyenne pour réduire la
variance des modèles.
Voici comment cela fonctionne :
1. On crée plusieurs échantillons aléatoires (avec remise) à partir de la base
d’apprentissage.
2. Sur chaque échantillon, on entraîne un modèle séparé (par exemple, un arbre de
décision).
3. Pour faire une prédiction, on combine les résultats des différents modèles,
soit par une moyenne (pour la régression), soit par un vote majoritaire (pour la
classification).
L’avantage du Bagging est qu’il améliore la stabilité et la précision des prédictions sans
modifier le modèle de base.
Cependant, cela demande plus de ressources en calcul, car on entraîne plusieurs modèles au
lieu d’un seul.
Prenons un exemple simple : imaginez que vous essayez de deviner la température
extérieure.
Si vous posez la question à une seule personne, vous pouvez obtenir une estimation
erronée.
Mais si vous demandez à 10 personnes et faites la moyenne de leurs réponses, votre
estimation sera probablement plus précise.
C’est exactement ce que fait le Bagging en machine learning.