Ensemble de méthodes :
Overfiting : pour éviter que le modèle soit trop spécialisé : avec un hyperparamètre : limiter la
profondeur de l’art.
Random forest : pleins d’arbres et chacun va donner une prédiction, et on va compter la majorité qui
donne la même décision.
Limiter le surapprentissage : Algoritm summariazation
- Hyperparamètre :
1- Nombre d’arbres
2- Nombre de features
3- Profondeur des arbres
Pourquoi limiter le nombre d’hyperparamètre : trop long
Pour la programmation faut toujours choisir le Modèle (random classifier … ) et
hyperparamètre pertinent ( n estimator … )
Boosting : avoir de l’information à partir du résultat d’une donnée
Grandient boosting : choisir un point et descendre jusqu’à l’arrivée au minimum et une fois arriver le
gradient va être égale à 0, elle garantit de trouver le minimum local et le seul moyen d’avoir un
minimum local qui est global est d’avoir qu’un seul minimum (fonction convexe )
Learning rate : le saut qu’on doit optimiser tout en ne pas dépassant la limite
Gradient ( rapidité )
Random forest ( precision )
SVM :
La distance entre mes hyperplans et points est inversement proportionnelle ??!
C : si on maximise C on minimise les erreurs