0% ont trouvé ce document utile (0 vote)
5 vues25 pages

Régression Linéaire et Classification en ML

Transféré par

gloiredivinemala2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues25 pages

Régression Linéaire et Classification en ML

Transféré par

gloiredivinemala2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Apprentissage

automatique
supervisé
Regression linéaire
et classification
Par Fereshteh Mafakheri
Régression linéaire
 La régression linéaire est le modèle d'apprentissage automatique supervisé dans lequel
une relation linéaire est déterminée entre une variable dépendante et une ou plusieurs
variables explicatives.

 La régression linéaire a deux types :


• Régression simple
• Régression multiple
3
Régression linéaire simple
 La régression linéaire simple est une méthode qui vous permet de déterminer la relation
entre une variable dépendante (y) et une variable indépendante (x) : 𝑦 = 𝑏0 + 𝑏1 x

 La régression linéaire multiple : 𝑦 = 𝑏0 + 𝑏1 𝑥1 +𝑏2 𝑥2 +…+𝑏𝑛 𝑥𝑛

x: variable indépendante
y: variable dépendante
𝑏1 : la pente (slope)
𝑏0 : l'ordonnée à l'origine (intercept)
Régression linéaire

Source: Statistical tools for high-throughput data analysis


5
Formule

𝒃𝟏
𝒃𝟎

n est le nombre de points de données


∑ indique la somme. Par exemple pour obtenir ∑x vous ajoutez la valeur de x pour tous
les points de données.
Exemple
salaire hrs/semaine salaire hrs/semaine
6500 38 8000 35
6400 50 6000 37.5
2500 15 5400 37
3000 30 6000 35
6000 50 3300 30
5000 38 6500 45
8000 50 1000 15
3200 20 8000 37.5
8000 45 2100 25
7500 50 8000 46
3700 20 4000 30
5000 35 1000 200
3500 30 2000 200
7000 43 4100 30
Exemple
9000

8000

7000

6000

5000
Salaire

4000

3000

2000

1000

0
0 10 20 30 40 50 60

hrs/semaine
8
Exemple
9000

8000
y = 167.13x - 598.36
R² = 0.7148
7000

6000

5000
y 4000

3000

2000

1000

0
0 10 20 30 40 50 60

x
Mesures d’évaluation pour analyse
de régression
Coefficient de Détermination

𝒏 𝒙𝒚 − 𝒙 𝒚
𝒓=
𝒏 𝒙𝟐− 𝒙 𝟐 × 𝒏 𝒚𝟐 − 𝒚 𝟐
10
Classification

La classification est une technique d'apprentissage supervisé par laquelle les données
sont classées dans des catégories pertinentes, préalablement apprises. Elle se
compose de deux étapes :

1. Le système reçoit des données d'apprentissage déjà classées ou étiquetées,


afin qu'il puisse développer une compréhension des différentes catégories.

2. Le système reçoit des données inconnues mais similaires à classer et,


sur la base de la compréhension qu'il a développée à partir des données
de formation, l'algorithme classera les données non étiquetées.
Exemple
Algorithmes de classification
 Régression logistique (Logistic Regression)
 Naive Bayes
 k plus proches voisins(K-Nearest Neighbors)
 Arbre de decision (Decision Tree)
 Machines à vecteurs de support (Support Vector Machines)
Régression logistique
L'équation linéaire serait donnée mathématiquement par l'équation suivante :
𝑍 = 𝛽0 + 𝛽1 𝑋1

x1 est une variable explicative et Z est une variable de réponse, les coefficients β0 et β1
sont les paramètres du modèle.

En cas de variables explicatives multiples, l'équation ci-dessus peut être étendue à :

𝑍 = 𝛽0 + 𝛽1 𝑋1 +𝛽2 𝑋2 +…+𝛽𝑛 𝑋𝑛
Fonction sigmoïde (Sigmoid Function)
15
Limite de décision (Decision boundary)
Mathématiquement, elle peut être
exprimée comme suit :

 p ≥ 0.5 => class = 1


 p < 0.5 => class = 0
16
Hypothèses de la régression logistique
 Le modèle de régression logistique exige que la variable dépendante soit de nature
binaire, multinomiale ou ordinale.
 Il exige que les observations soient indépendantes les unes des autres.
Ainsi, les observations ne doivent pas provenir de mesures répétées.
 L'algorithme de régression logistique requiert peu ou pas de multicollinéarité entre
les variables indépendantes. Cela signifie que les variables indépendantes ne
doivent pas être trop fortement corrélées entre elles.
 Le modèle de régression logistique suppose la linéarité des variables indépendantes
et des probabilités logarithmiques.
 Le succès du modèle de régression logistique dépend de la taille de l'échantillon.
En général, il faut un échantillon de grande taille pour obtenir une grande précision.
17
Types de régression logistique
 Régression logistique binaire (Binary Logistic Regression)

 Régression logistique multinomiale (Multinomial Logistic Regression)

 Régression logistique ordinale (Ordinal Logistic Regression)


18
Applications
 Prédire si un courriel est du spam ou non
 Détection des fraudes
 Prévision des maladies
 Prédiction de la désaffection
(Churn prediction)
19
Exemple
Probability of getting
promotion
Exemple

Employee rating

Probability of getting
promotion
Matrice de confusion
(Confusion matrix)
Actuel

Positif Négatif

Positif Vrai positif (VP) Faux positif (FP)


Prédit

Négatif Faux négatif (FN) Vrai négatif (VN)


Exemple

Risque élevé Risque faible

Risque élevé 85 12

Risque faible 10 70
23
Précision

𝑁𝑜𝑚𝑏𝑟𝑒 𝑑𝑒 𝑝𝑟é𝑑𝑖𝑐𝑡𝑖𝑜𝑛𝑠 𝑐𝑜𝑟𝑟𝑒𝑐𝑡𝑒𝑠 𝑉𝑃 + 𝑉𝑁


𝑃𝑟é𝑐𝑖𝑠𝑖𝑜𝑛 𝐴𝑐𝑐𝑢𝑟𝑎𝑐𝑦 = =
Nombre total de prédictions 𝑉𝑃 + 𝑉𝑁 + 𝐹𝑃 + 𝐹𝑁

Précision (Accuracy) = (85 +70) / (85 + 70 + 12 + 10) = 0.8757 = 87.57%


24
Références
 Aminot, I., & Damon, M. N. (2002). Régression logistique: intérêt dans l’analyse de
données relatives aux pratiques médicales. Revue Médicale de l’Assurance Maladie,
33(2), 137-143.
 Sarmento Batista, A. (2014) Logistic Regression: An introduction to statistical model with
an example on Revolving Credit, CreateSpace Independent Publishing Platform,
chapitre 3.
Merci !

Vous aimerez peut-être aussi