Apprentissage
automatique
supervisé
Regression linéaire
et classification
Par Fereshteh Mafakheri
Régression linéaire
La régression linéaire est le modèle d'apprentissage automatique supervisé dans lequel
une relation linéaire est déterminée entre une variable dépendante et une ou plusieurs
variables explicatives.
La régression linéaire a deux types :
• Régression simple
• Régression multiple
3
Régression linéaire simple
La régression linéaire simple est une méthode qui vous permet de déterminer la relation
entre une variable dépendante (y) et une variable indépendante (x) : 𝑦 = 𝑏0 + 𝑏1 x
La régression linéaire multiple : 𝑦 = 𝑏0 + 𝑏1 𝑥1 +𝑏2 𝑥2 +…+𝑏𝑛 𝑥𝑛
x: variable indépendante
y: variable dépendante
𝑏1 : la pente (slope)
𝑏0 : l'ordonnée à l'origine (intercept)
Régression linéaire
Source: Statistical tools for high-throughput data analysis
5
Formule
𝒃𝟏
𝒃𝟎
n est le nombre de points de données
∑ indique la somme. Par exemple pour obtenir ∑x vous ajoutez la valeur de x pour tous
les points de données.
Exemple
salaire hrs/semaine salaire hrs/semaine
6500 38 8000 35
6400 50 6000 37.5
2500 15 5400 37
3000 30 6000 35
6000 50 3300 30
5000 38 6500 45
8000 50 1000 15
3200 20 8000 37.5
8000 45 2100 25
7500 50 8000 46
3700 20 4000 30
5000 35 1000 200
3500 30 2000 200
7000 43 4100 30
Exemple
9000
8000
7000
6000
5000
Salaire
4000
3000
2000
1000
0
0 10 20 30 40 50 60
hrs/semaine
8
Exemple
9000
8000
y = 167.13x - 598.36
R² = 0.7148
7000
6000
5000
y 4000
3000
2000
1000
0
0 10 20 30 40 50 60
x
Mesures d’évaluation pour analyse
de régression
Coefficient de Détermination
𝒏 𝒙𝒚 − 𝒙 𝒚
𝒓=
𝒏 𝒙𝟐− 𝒙 𝟐 × 𝒏 𝒚𝟐 − 𝒚 𝟐
10
Classification
La classification est une technique d'apprentissage supervisé par laquelle les données
sont classées dans des catégories pertinentes, préalablement apprises. Elle se
compose de deux étapes :
1. Le système reçoit des données d'apprentissage déjà classées ou étiquetées,
afin qu'il puisse développer une compréhension des différentes catégories.
2. Le système reçoit des données inconnues mais similaires à classer et,
sur la base de la compréhension qu'il a développée à partir des données
de formation, l'algorithme classera les données non étiquetées.
Exemple
Algorithmes de classification
Régression logistique (Logistic Regression)
Naive Bayes
k plus proches voisins(K-Nearest Neighbors)
Arbre de decision (Decision Tree)
Machines à vecteurs de support (Support Vector Machines)
Régression logistique
L'équation linéaire serait donnée mathématiquement par l'équation suivante :
𝑍 = 𝛽0 + 𝛽1 𝑋1
x1 est une variable explicative et Z est une variable de réponse, les coefficients β0 et β1
sont les paramètres du modèle.
En cas de variables explicatives multiples, l'équation ci-dessus peut être étendue à :
𝑍 = 𝛽0 + 𝛽1 𝑋1 +𝛽2 𝑋2 +…+𝛽𝑛 𝑋𝑛
Fonction sigmoïde (Sigmoid Function)
15
Limite de décision (Decision boundary)
Mathématiquement, elle peut être
exprimée comme suit :
p ≥ 0.5 => class = 1
p < 0.5 => class = 0
16
Hypothèses de la régression logistique
Le modèle de régression logistique exige que la variable dépendante soit de nature
binaire, multinomiale ou ordinale.
Il exige que les observations soient indépendantes les unes des autres.
Ainsi, les observations ne doivent pas provenir de mesures répétées.
L'algorithme de régression logistique requiert peu ou pas de multicollinéarité entre
les variables indépendantes. Cela signifie que les variables indépendantes ne
doivent pas être trop fortement corrélées entre elles.
Le modèle de régression logistique suppose la linéarité des variables indépendantes
et des probabilités logarithmiques.
Le succès du modèle de régression logistique dépend de la taille de l'échantillon.
En général, il faut un échantillon de grande taille pour obtenir une grande précision.
17
Types de régression logistique
Régression logistique binaire (Binary Logistic Regression)
Régression logistique multinomiale (Multinomial Logistic Regression)
Régression logistique ordinale (Ordinal Logistic Regression)
18
Applications
Prédire si un courriel est du spam ou non
Détection des fraudes
Prévision des maladies
Prédiction de la désaffection
(Churn prediction)
19
Exemple
Probability of getting
promotion
Exemple
Employee rating
Probability of getting
promotion
Matrice de confusion
(Confusion matrix)
Actuel
Positif Négatif
Positif Vrai positif (VP) Faux positif (FP)
Prédit
Négatif Faux négatif (FN) Vrai négatif (VN)
Exemple
Risque élevé Risque faible
Risque élevé 85 12
Risque faible 10 70
23
Précision
𝑁𝑜𝑚𝑏𝑟𝑒 𝑑𝑒 𝑝𝑟é𝑑𝑖𝑐𝑡𝑖𝑜𝑛𝑠 𝑐𝑜𝑟𝑟𝑒𝑐𝑡𝑒𝑠 𝑉𝑃 + 𝑉𝑁
𝑃𝑟é𝑐𝑖𝑠𝑖𝑜𝑛 𝐴𝑐𝑐𝑢𝑟𝑎𝑐𝑦 = =
Nombre total de prédictions 𝑉𝑃 + 𝑉𝑁 + 𝐹𝑃 + 𝐹𝑁
Précision (Accuracy) = (85 +70) / (85 + 70 + 12 + 10) = 0.8757 = 87.57%
24
Références
Aminot, I., & Damon, M. N. (2002). Régression logistique: intérêt dans l’analyse de
données relatives aux pratiques médicales. Revue Médicale de l’Assurance Maladie,
33(2), 137-143.
Sarmento Batista, A. (2014) Logistic Regression: An introduction to statistical model with
an example on Revolving Credit, CreateSpace Independent Publishing Platform,
chapitre 3.
Merci !