01/03/2024
Intelligence Artificielle
IRISI – S4. FSTG Marrakech.
[Link] BENHADDI.
CONTENT
• Bias – variance tradeoff
• Linear regression
• Logistic regression
• Regularization
• Decision trees
• Naïve Bayes
• Support vector machine
• Clustering
• Principal component analysis (PCA)
• Ensemble learning
• Random forest and boosted trees
• Model evaluation metrics
01/03/2024
Arbres de décision
Tâche : prédire le risque de maladies cardiovasculaires. Root
Caractéristiques (features):
1. Blood pressure (BP) measurement Node
2. Smoking status (non-smoker, smoker)
3. Treated with antihypertensive drugs (yes/no) leaf
Smoking status
yes no
BP>140 mm Hg Low risk
yes no
Treated with Low risk
antihypertensive drug
yes no
Low risk High risk
Arbres de décision
Questions : Smoking
1. Quelle feature doit être à la racine de l'arbre ? yes no
Features:
1. Blood pressure (BP) measurement Heart failure Heart failure
2. Smoking status (non-smoker, smoker) Yes. No Yes. No
-------------------- --------------------
3. Treated with antihypertensive drugs (yes/no) 140 60 10 90
Smoking Treated BP Heart failure Treated
hypertension hypertension
Yes Yes 130 No yes no
No Yes 125 No Heart failure Heart failure
Yes. No Yes. No
Yes No 140 Yes -------------------- --------------------
30 70 50 150
Yes No 120 Yes
01/03/2024
Arbres de décision
Treated
Smoking hypertension
yes no yes no
Heart failure Heart failure Heart failure Heart failure
Yes. No Yes. No Yes. No Yes. No
-------------------- -------------------- -------------------- --------------------
140 60 10 90 30 70 50 150
Il n'y a pas de feuille qui soit à 100% “oui” ou 100% “non”, elles sont donc considérées comme impures.
Donc, on devra calculer leurs impurité.
“Gini” ou‘Entropy’
Arbres de décision
Questions :
1. Quelle feature doit être à la racine de l'arbre ?
Choisissez le feature qui a la meilleure séparation (la plus basse impureté Gini)
2. Continuer pour le reste des fonctionnalités après la séparation
3. Si une séparation ne diminue pas l'impureté, arrêtez la
séparation et conservez-la comme une feuille
01/03/2024
Arbres de décision
=1 − Smoking
= ( ) + ( ) yes no
Heart failure Heart failure
0.42 Yes. No Yes. No 0.18
-------------------- --------------------
140 60 10 90
Treated
hypertension
Smoking : 0.34 (lowest impurity) yes no
Treated hypertension : 0.39 Heart failure Heart failure
0.42 Yes. No Yes. No 0.38
-------------------- --------------------
30 70 50 150
!" #$: 140 60
0,42 = 1 − − ( )
140 + 60 140 + 60
10 90
Arbres de décision 0,18 = 1 −
10 + 90
− (
10 + 90
)
T+ 77' *' 7+ 8 !7+# 8 :
!" #$ = % − Smoking
300 = 140+60+10+90
= ( ) + ( ) yes no
&' ()#'* +,'"+(' !" #$:
Heart failure Heart failure
034 = (0,42 ∗ ((140+60)/300)) +
0.42 Yes. No Yes. No 0.18
-------------------- -------------------- (018 * ((10+90)/300))
140 60 10 90
&' ()#'* +,'"+(' !" #$ Treated
hypertension
Smoking : 0.34 (lowest impurity) yes no
Treated hypertension : 0.39 Heart failure Heart failure
0.42 Yes. No Yes. No 0.38
-------------------- --------------------
30 70 50 150
01/03/2024
Arbres de décision
Comment faire avec les valeurs n mériques ?
BP Heart failure 1. Trier la valeur de haut en bas
2. Définissez le nombre de groupes que vous souhaitez tester pour la séparation
130 No 3. Calculer l'impureté Gini pour chacune des séparations et sélectionner celle avec la
plus faible impureté
125 No
> 127 ?
140 Yes
140, 130, 125, 120
120 Yes
> 135 ? > 123 ?
Arbres de décision
Que faire en cas de valeurs manquantes ?
Smoking Treated BP Heart failure On peut calculer la moyenne, la
hypertension médiane, ou même la valeur la plus
fréquante pour remplacer la valeur
Yes Yes 130 No
manquante
No Yes ??? No
??? No 140 Yes
Yes No 120 Yes
01/03/2024
Arbres de décision
Comment éviter le overfitting ?
1. Si l'impureté ne diminue pas, nous ne diviserons pas en utilisant ce feature
2. Nous ne divisons en utilisant un feature que si la quantité d'impuretés diminue atteint un seuil
3. Il y aura un nombre minimum d'échantillons dans un nœud feuille
Pour un problème de régression, l’impurité peut être calculée avec least square ou least absolute deviation
Arbres de décision : TP
• Decision-Tree Classifier Tutorial :
• [Link]