0% ont trouvé ce document utile (0 vote)
4 vues68 pages

Regression

Le document présente les algorithmes de régression linéaire simple et multiple dans le cadre de l'apprentissage automatique. Il décrit les principes de fonctionnement, les applications pratiques, ainsi que les méthodes d'optimisation telles que la descente de gradient pour minimiser les erreurs de prédiction. Les concepts de base incluent la définition des variables indépendantes et dépendantes, ainsi que la formulation mathématique des modèles de régression.

Transféré par

marwanamara713
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues68 pages

Regression

Le document présente les algorithmes de régression linéaire simple et multiple dans le cadre de l'apprentissage automatique. Il décrit les principes de fonctionnement, les applications pratiques, ainsi que les méthodes d'optimisation telles que la descente de gradient pour minimiser les erreurs de prédiction. Les concepts de base incluent la définition des variables indépendantes et dépendantes, ainsi que la formulation mathématique des modèles de régression.

Transféré par

marwanamara713
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Les algorithmes de l'apprentissage automatique

La régression linéaire simple et multiple

M. Bakhouya

23/10/2025

1 / 28
Plan

1 Présentation

2 Applications de la régression linéaire

3 Présentation du principe de fonctionnement

4 Exercice d'application

5 La régression linéaire multiple

2 / 28
Petit rappel

Les algorithmes de l'apprentissage automatique :


Supervisé (Supervised)

3 / 28
Petit rappel

Les algorithmes de l'apprentissage automatique :


Supervisé (Supervised)
Non supervisé (Unsupervised)

3 / 28
Petit rappel

Les algorithmes de l'apprentissage automatique :


Supervisé (Supervised)
Non supervisé (Unsupervised)
Par renforcement (Reinforcement)

3 / 28
Petit rappel

Les algorithmes de l'apprentissage automatique :


Supervisé (Supervised)
Non supervisé (Unsupervised)
Par renforcement (Reinforcement)

Apprentissage Supervisé :
Régression
Classication

3 / 28
Types de Régression
Régression :
Régression linéaire simple (Simple Linear Regression)

4 / 28
Types de Régression
Régression :
Régression linéaire simple (Simple Linear Regression)
Régression linéaire multiple (Multiple Linear Regression)

4 / 28
Types de Régression
Régression :
Régression linéaire simple (Simple Linear Regression)
Régression linéaire multiple (Multiple Linear Regression)
Régression polynomiale (Polynomial Regression)

4 / 28
Types de Régression
Régression :
Régression linéaire simple (Simple Linear Regression)
Régression linéaire multiple (Multiple Linear Regression)
Régression polynomiale (Polynomial Regression)
y y y

x x1 x
x2
Simple Multiple Polynomiale
4 / 28
Dénitions

Régression linéaire simple


Est une méthode où l'on dispose de nombreuses données et on essaie de tracer une droite à
travers ces données pour modéliser la relation entre une variable indépendante x et une variable
dépendante y .

5 / 28
Dénitions

Régression linéaire simple


Est une méthode où l'on dispose de nombreuses données et on essaie de tracer une droite à
travers ces données pour modéliser la relation entre une variable indépendante x et une variable
dépendante y .

Régression linéaire multiple


Est une extension où l'on a plusieurs variables indépendantes (x1 , x2 , . . . , xn ) et où l'on peut
ajouter d'autres variables pour enrichir le modèle et améliorer les prédictions.

5 / 28
Dénitions

Régression linéaire simple


Est une méthode où l'on dispose de nombreuses données et on essaie de tracer une droite à
travers ces données pour modéliser la relation entre une variable indépendante x et une variable
dépendante y .

Régression linéaire multiple


Est une extension où l'on a plusieurs variables indépendantes (x1 , x2 , . . . , xn ) et où l'on peut
ajouter d'autres variables pour enrichir le modèle et améliorer les prédictions.

Régression polynomiale
Au lieu de tracer une droite, on trace une courbe polynomiale à travers les données pour
capturer des relations non-linéaires.

5 / 28
Applications de la régression linéaire

Estimation des prix des produits : Prédire le prix d'un produit dans le futur en fonction
de diverses variables (demande, coût de production, etc.)

6 / 28
Applications de la régression linéaire

Estimation des prix des produits : Prédire le prix d'un produit dans le futur en fonction
de diverses variables (demande, coût de production, etc.)
Estimation des prix de vente des maisons : Estimer le nombre de maisons qu'un
constructeur vendrait et à quel prix dans les mois à venir (surface, localisation, nombre de
chambres, etc.)

6 / 28
Applications de la régression linéaire

Estimation des prix des produits : Prédire le prix d'un produit dans le futur en fonction
de diverses variables (demande, coût de production, etc.)
Estimation des prix de vente des maisons : Estimer le nombre de maisons qu'un
constructeur vendrait et à quel prix dans les mois à venir (surface, localisation, nombre de
chambres, etc.)
Prédiction des scores des matchs de sport : Prédire le nombre de buts qu'un joueur
peut marquer dans les matchs à venir en se basant sur ses performances antérieures

6 / 28
Applications de la régression linéaire

Estimation des prix des produits : Prédire le prix d'un produit dans le futur en fonction
de diverses variables (demande, coût de production, etc.)
Estimation des prix de vente des maisons : Estimer le nombre de maisons qu'un
constructeur vendrait et à quel prix dans les mois à venir (surface, localisation, nombre de
chambres, etc.)
Prédiction des scores des matchs de sport : Prédire le nombre de buts qu'un joueur
peut marquer dans les matchs à venir en se basant sur ses performances antérieures
Estimation de l'évolution économique : Prédire la croissance économique, l'ination, le
chômage, etc.

6 / 28
Applications de la régression linéaire

Estimation des prix des produits : Prédire le prix d'un produit dans le futur en fonction
de diverses variables (demande, coût de production, etc.)
Estimation des prix de vente des maisons : Estimer le nombre de maisons qu'un
constructeur vendrait et à quel prix dans les mois à venir (surface, localisation, nombre de
chambres, etc.)
Prédiction des scores des matchs de sport : Prédire le nombre de buts qu'un joueur
peut marquer dans les matchs à venir en se basant sur ses performances antérieures
Estimation de l'évolution économique : Prédire la croissance économique, l'ination, le
chômage, etc.
Analyse nancière : Prévision des cours boursiers, analyse de risque

6 / 28
Principe de base

Dénition
La régression linéaire est un modèle statistique utilisé pour prédire la relation entre des variables
indépendantes (x1 , x2 , . . . , xn ) et une variable dépendante (y ).

7 / 28
Principe de base

Dénition
La régression linéaire est un modèle statistique utilisé pour prédire la relation entre des variables
indépendantes (x1 , x2 , . . . , xn ) et une variable dépendante (y ).

Objectif qualitatif
La régression linéaire consiste à trouver où placer la droite qui se trouve la plus proche de tous
les points du jeu de données.

7 / 28
Question visuelle
Quelle est 'visuellement' la droite qui répond le mieux au critère ?

8 / 28
Question visuelle
Quelle est 'visuellement' la droite qui répond le mieux au critère ?

Réponse
La meilleure droite est celle qui minimise les distances aux points !
8 / 28
Formulation mathématique
Forme générale
La forme la plus simple de la régression linéaire avec une variable dépendante et une variable
indépendante est représentée par :
y = ax + b
où :
a est la pente (coecient directeur)
b est l'ordonnée à l'origine (intercept)
x est la variable indépendante (feature)
y est la variable dépendante (target)

9 / 28
Formulation mathématique
Forme générale
La forme la plus simple de la régression linéaire avec une variable dépendante et une variable
indépendante est représentée par :
y = ax + b
où :
a est la pente (coecient directeur)
b est l'ordonnée à l'origine (intercept)
x est la variable indépendante (feature)
y est la variable dépendante (target)

Objectif
L'algorithme consiste à trouver les valeurs de a et b (les poids du modèle) de telle manière
que la distance entre tous les points du dataset et la droite f (x) = ax + b soit minimale.
9 / 28
Visualisation des erreurs

Erreur pour chaque point : erreur(i) = (f (x (i) ) − y (i) )2

Question
Comment obtenir les valeurs de a et b qui vont minimiser toutes les erreurs pour chaque point ?
10 / 28
Dénir la Fonction Coût
Erreur pour un exemple
Pour la régression linéaire, on utilise la norme euclidienne (distance) pour mesurer les erreurs
entre f (x) et y :
erreur(i) = (f (x (i) ) − y (i) )2
où f (x (i) ) représente la prédiction faite par le modèle pour l'exemple i .

11 / 28
Dénir la Fonction Coût
Erreur pour un exemple
Pour la régression linéaire, on utilise la norme euclidienne (distance) pour mesurer les erreurs
entre f (x) et y :
erreur(i) = (f (x (i) ) − y (i) )2
où f (x (i) ) représente la prédiction faite par le modèle pour l'exemple i .
Fonction Coût (Cost Function)
La Fonction Coût J(a, b) est la moyenne de toutes les erreurs :
m m m
1 X 1 X 1 X (i)
J(a, b) = erreur(i) = (f (x (i) ) − y (i) )2 = (ax + b − y (i) )2
2m 2m 2m
i=1 i=1 i=1

Cette fonction est appelée Erreur Quadratique Moyenne (Mean Squared Error - MSE). Le
facteur 21 simplie les calculs de dérivées.
11 / 28
Méthode 1 : Équations normales (Statistique)
Ensemble de données
A = {(x1 , y1 ), (x2 , y2 ), . . . , (xm , ym )} l'ensemble des données.

Formules analytiques
Pm
1 (xi − x̄)(yi − ȳ )
a = i=P m 2
, b = ȳ − a × x̄
i=1 (xi − x̄)
où x̄ et ȳ sont les moyennes de x et y respectivement.

12 / 28
Méthode 1 : Équations normales (Statistique)
Ensemble de données
A = {(x1 , y1 ), (x2 , y2 ), . . . , (xm , ym )} l'ensemble des données.

Formules analytiques
Pm
1 (xi − x̄)(yi − ȳ )
a = i=P m 2
, b = ȳ − a × x̄
i=1 (xi − x̄)
où x̄ et ȳ sont les moyennes de x et y respectivement.
Formulation matricielle
θ = (X T X )−1 X T Y
1 x1
 
 
y1
  1 x2   y2 
b
où θ = , X =  .. .. , Y =  .. 
   
a . .   . 
1 xm ym
12 / 28
Méthode 2 : Machine Learning - Collecte de données

Dataset
Soit A = {(x1 , y1 ), (x2 , y2 ), . . . , (xm , ym )} l'ensemble de données, où chaque paire (xi , yi )
représente un exemple de données.

x (i) est la caractéristique (feature)


y (i) est la valeur cible correspondante (target)
m est le nombre d'exemples d'apprentissage

13 / 28
Méthode 2 : Machine Learning - Collecte de données

Dataset
Soit A = {(x1 , y1 ), (x2 , y2 ), . . . , (xm , ym )} l'ensemble de données, où chaque paire (xi , yi )
représente un exemple de données.

x (i) est la caractéristique (feature)


y (i) est la valeur cible correspondante (target)
m est le nombre d'exemples d'apprentissage

Exemple concret
Pour prédire le prix d'une maison :
x (i) = surface de la maison en m²
y (i) = prix de la maison en euros
m = nombre de maisons dans notre dataset
13 / 28
Descente de Gradient - Principe
Algorithme d'optimisation
Pour trouver le minimum de J(a, b), on utilise la Descente de Gradient (Gradient Descent).

14 / 28
Descente de Gradient - Principe
Algorithme d'optimisation
Pour trouver le minimum de J(a, b), on utilise la Descente de Gradient (Gradient Descent).

1 Initialiser a et b avec des valeurs aléatoires (ou nulles)

14 / 28
Descente de Gradient - Principe
Algorithme d'optimisation
Pour trouver le minimum de J(a, b), on utilise la Descente de Gradient (Gradient Descent).

1 Initialiser a et b avec des valeurs aléatoires (ou nulles)


2 Calculer la pente de la Fonction Coût, c'est-à-dire les dérivées partielles :
∂J(a, b) ∂J(a, b)
et
∂a ∂b

14 / 28
Descente de Gradient - Principe
Algorithme d'optimisation
Pour trouver le minimum de J(a, b), on utilise la Descente de Gradient (Gradient Descent).

1 Initialiser a et b avec des valeurs aléatoires (ou nulles)


2 Calculer la pente de la Fonction Coût, c'est-à-dire les dérivées partielles :
∂J(a, b) ∂J(a, b)
et
∂a ∂b
3 Évoluer d'une distance α (learning rate) dans la direction opposée au gradient :
∂J(a, b)
a=a−α
∂a
∂J(a, b)
b =b−α
∂b

14 / 28
Descente de Gradient - Principe
Algorithme d'optimisation
Pour trouver le minimum de J(a, b), on utilise la Descente de Gradient (Gradient Descent).

1 Initialiser a et b avec des valeurs aléatoires (ou nulles)


2 Calculer la pente de la Fonction Coût, c'est-à-dire les dérivées partielles :
∂J(a, b) ∂J(a, b)
et
∂a ∂b
3 Évoluer d'une distance α (learning rate) dans la direction opposée au gradient :
∂J(a, b)
a=a−α
∂a
∂J(a, b)
b =b−α
∂b
4 Répéter les étapes 2 et 3 jusqu'à convergence (atteindre le minimum de J(a, b))
14 / 28
Visualisation de la Descente de Gradient
10

6
J(θ)
4 Départ

2
Minimum
0
−2 −1 0 1 2 3 4
θ (paramètre)

Principe
À chaque itération, on se déplace dans la direction qui diminue la fonction coût !
15 / 28
Impact du Learning Rate

α trop petit α optimal α trop grand

4 4 4

2 2 2

0 0 0
−1 0 1 2 3 −1 0 1 2 3 −1 0 1 2 3
Convergence lente Convergence rapide Divergence / Oscillation
Remarque importante
Si α est trop petit, le modèle peut mettre longtemps à converger. Si α est trop grand,
l'algorithme peut diverger ou osciller. Il faut donc trouver un juste milieu ! 16 / 28
Qualité de la régression
1. RMSE - Root Mean Squared Error
L'erreur quadratique moyenne doit être la plus petite possible :
v
m
u1 X
u
RMSE = t (f (x (i) ) − y (i) )2
m
i=1

Plus la valeur est proche de 0, meilleure est la régression


Même unité que la variable cible y

17 / 28
Qualité de la régression
1. RMSE - Root Mean Squared Error
L'erreur quadratique moyenne doit être la plus petite possible :
v
m
u1 X
u
RMSE = t (f (x (i) ) − y (i) )2
m
i=1

Plus la valeur est proche de 0, meilleure est la régression


Même unité que la variable cible y
2. Coecient de détermination R 2
(f (x (i) )−y (i) )2
Pm
Doit être proche de 1 (R 2 ∈ [0, 1]) : R 2 = 1 − i=P1m (i) 2
i=1 (ȳ −y )
où ȳ est la valeur moyenne des sorties observées.
R 2 = 1 : prédiction parfaite
R 2 = 0 : le modèle n'est pas meilleur que la moyenne
R 2 < 0 : le modèle est pire que la moyenne 17 / 28
Exercice pratique

Énoncé
On dispose des données suivantes sur le prix de maisons en fonction de leur surface :
Surface (m²) Prix (k¿)
50 150
70 200
90 250
110 300
130 350
Questions :
1 Calculer les paramètres a et b du modèle y = ax + b par la méthode des équations
normales
2 Prédire le prix d'une maison de 100 m²
3 Calculer le coecient R 2
18 / 28
Solution - Partie 1
Données
50+70+90+110+130 150+200+250+300+350
m = 5, x̄ = 5 = 90, ȳ = 5 = 250

19 / 28
Solution - Partie 1
Données
50+70+90+110+130 150+200+250+300+350
m = 5, x̄ = 5 = 90, ȳ = 5 = 250

Calcul de a
Pm
i= 1 (xi − x̄)(yi − ȳ )
a= P m 2
i=1 (xi − x̄)
(50 − 90)(150 − 250) + (70 − 90)(200 − 250) + · · ·
= = 2.5
(50 − 90)2 + (70 − 90)2 + · · ·

19 / 28
Solution - Partie 1
Données
50+70+90+110+130 150+200+250+300+350
m = 5, x̄ = 5 = 90, ȳ = 5 = 250

Calcul de a
Pm
i= 1 (xi − x̄)(yi − ȳ )
a= P m 2
i=1 (xi − x̄)
(50 − 90)(150 − 250) + (70 − 90)(200 − 250) + · · ·
= = 2.5
(50 − 90)2 + (70 − 90)2 + · · ·

Calcul de b
b = ȳ − a × x̄ = 250 − 2.5 × 90 = 250 − 225 = 25

19 / 28
Solution - Partie 1
Données
50+70+90+110+130 150+200+250+300+350
m = 5, x̄ = 5 = 90, ȳ = 5 = 250

Calcul de a
Pm
i= 1 (xi − x̄)(yi − ȳ )
a= P m 2
i=1 (xi − x̄)
(50 − 90)(150 − 250) + (70 − 90)(200 − 250) + · · ·
= = 2.5
(50 − 90)2 + (70 − 90)2 + · · ·

Calcul de b
b = ȳ − a × x̄ = 250 − 2.5 × 90 = 250 − 225 = 25
Modèle
y = 2.5x + 25
19 / 28
Solution - Partie 2 et 3
Prédiction pour 100 m²
y = 2.5 × 100 + 25 = 250 + 25 = 275 k¿

20 / 28
Solution - Partie 2 et 3
Prédiction pour 100 m²
y = 2.5 × 100 + 25 = 250 + 25 = 275 k¿

Calcul du R 2
Prédictions : ŷ1 = 150, ŷ2 = 200, ŷ3 = 250, ŷ4 = 300, ŷ5 = 350
(yi − ŷi )2 = (150 − 150)2 + · · · + (350 − 350)2 = 0
P

(yi − ȳ )2 = (150 − 250)2 + (200 − 250)2 + · · · = 10000 + 2500 + 0 + 2500 + 10000 = 25000
P

0
R2 = 1 − = 1.0
25000

20 / 28
Solution - Partie 2 et 3
Prédiction pour 100 m²
y = 2.5 × 100 + 25 = 250 + 25 = 275 k¿

Calcul du R 2
Prédictions : ŷ1 = 150, ŷ2 = 200, ŷ3 = 250, ŷ4 = 300, ŷ5 = 350
(yi − ŷi )2 = (150 − 150)2 + · · · + (350 − 350)2 = 0
P

(yi − ȳ )2 = (150 − 250)2 + (200 − 250)2 + · · · = 10000 + 2500 + 0 + 2500 + 10000 = 25000
P

0
R2 = 1 − = 1.0
25000

Conclusion
Le modèle est parfait (R 2 = 1) car les données sont parfaitement linéaires ! En pratique, on
obtient rarement R 2 = 1.
20 / 28
Visualisation de la solution
400
Données d'entraînement
y = 2.5x + 25
Prédiction (100 m²)
300
Prix (k¿)

200

100
40 50 60 70 80 90 100 110 120 130 140
Surface (m²)
21 / 28
Régression linéaire multiple - Introduction
Dénition
La régression linéaire multiple est une extension de la régression linéaire simple où l'on utilise
plusieurs variables indépendantes pour prédire une variable dépendante.

22 / 28
Régression linéaire multiple - Introduction
Dénition
La régression linéaire multiple est une extension de la régression linéaire simple où l'on utilise
plusieurs variables indépendantes pour prédire une variable dépendante.
Modèle mathématique
Au lieu d'avoir y = ax + b, on a : y = θ0 + θ1 x1 + θ2 x2 + ·· · +θn xn
1
 x1 
 
ou en notation vectorielle : y = θT X = θ0 θ1 · · · θn  . 
 .. 
xn

22 / 28
Régression linéaire multiple - Introduction
Dénition
La régression linéaire multiple est une extension de la régression linéaire simple où l'on utilise
plusieurs variables indépendantes pour prédire une variable dépendante.
Modèle mathématique
Au lieu d'avoir y = ax + b, on a : y = θ0 + θ1 x1 + θ2 x2 + ·· · +θn xn
1
 x1 
 
ou en notation vectorielle : y = θT X = θ0 θ1 · · · θn  . 
 .. 
xn
Exemple : Prix des maisons
x1 : surface (m²)
x2 : nombre de chambres
x3 : âge de la maison ⊙ y : prix de la maison (¿)
x4 : distance au centre-ville (km) 22 / 28
Formulation matricielle
Représentation matricielle
Pour m exemples et n features :
Y = Xθ
où :
Y ∈ Rm×1 : vecteur des cibles
X ∈ Rm×(n+1) : matrice des features (avec colonne de 1 pour l'intercept)
θ ∈ R(n+1)×1 : vecteur des paramètres

23 / 28
Formulation matricielle
Représentation matricielle
Pour m exemples et n features :
Y = Xθ
où :
Y ∈ Rm×1 : vecteur des cibles
X ∈ Rm×(n+1) : matrice des features (avec colonne de 1 pour l'intercept)
θ ∈ R(n+1)×1 : vecteur des paramètres
Matrices explicites
1 x1(1) x2(1) · · · (1)
   
y (1)

xn θ0
 y (2)  1 x (2) x (2) · · ·
 (2)   
xn  θ1 
1 2
 ..  =  .. .. .. .. ..  . 
 
 .   . . . . .   .. 
y (m) 1 x1(m) (m)
x2 ···
(m)
xn θn
23 / 28
Fonction Coût pour la régression multiple
Fonction Coût généralisée
m
1 X
J(θ) = (hθ (x (i) ) − y (i) )2
2m
i=1

où hθ (x) = θT x = θ0 + θ1 x1 + · · · + θn xn

24 / 28
Fonction Coût pour la régression multiple
Fonction Coût généralisée
m
1 X
J(θ) = (hθ (x (i) ) − y (i) )2
2m
i=1

où hθ (x) = θT x = θ0 + θ1 x1 + · · · + θn xn

Forme vectorielle
1
J(θ) = (X θ − Y )T (X θ − Y )
2m

24 / 28
Fonction Coût pour la régression multiple
Fonction Coût généralisée
m
1 X
J(θ) = (hθ (x (i) ) − y (i) )2
2m
i=1

où hθ (x) = θT x = θ0 + θ1 x1 + · · · + θn xn

Forme vectorielle
1
J(θ) = (X θ − Y )T (X θ − Y )
2m

Gradient
Le gradient de J(θ) par rapport à θ est :
1
∇θ J(θ) = X T (X θ − Y )
m
24 / 28
Algorithme de Gradient Descent multiple
Mise à jour simultanée
Répéter jusqu'à convergence :
∂J(θ)
θj = θj − α pour j = 0, 1, . . . , n
∂θj

25 / 28
Algorithme de Gradient Descent multiple
Mise à jour simultanée
Répéter jusqu'à convergence :
∂J(θ)
θj = θj − α pour j = 0, 1, . . . , n
∂θj
Forme explicite
m
1 X (i)
θj = θj − α (hθ (x (i) ) − y (i) ) · xj
m
i=1

25 / 28
Algorithme de Gradient Descent multiple
Mise à jour simultanée
Répéter jusqu'à convergence :
∂J(θ)
θj = θj − α pour j = 0, 1, . . . , n
∂θj
Forme explicite
m
1 X (i)
θj = θj − α (hθ (x (i) ) − y (i) ) · xj
m
i=1

Forme vectorielle (plus ecace)


1
θ =θ−α X T (X θ − Y )
m

25 / 28
Algorithme de Gradient Descent multiple
Mise à jour simultanée
Répéter jusqu'à convergence :
∂J(θ)
θj = θj − α pour j = 0, 1, . . . , n
∂θj
Forme explicite
m
1 X (i)
θj = θj − α (hθ (x (i) ) − y (i) ) · xj
m
i=1

Forme vectorielle (plus ecace)


1
θ =θ−α X T (X θ − Y )
m
Important
Toutes les composantes de θ doivent être mises à jour simultanément ! 25 / 28
Équation normale pour la régression multiple
Solution analytique
Au lieu d'utiliser le gradient descent, on peut résoudre directement :

θ = (X T X )−1 X T Y

26 / 28
Équation normale pour la régression multiple
Solution analytique
Au lieu d'utiliser le gradient descent, on peut résoudre directement :

θ = (X T X )−1 X T Y

Avantages
Pas besoin de choisir le learning rate α
Pas besoin d'itérations
Pas besoin de normaliser les features

26 / 28
Équation normale pour la régression multiple
Solution analytique
Au lieu d'utiliser le gradient descent, on peut résoudre directement :

θ = (X T X )−1 X T Y

Avantages
Pas besoin de choisir le learning rate α
Pas besoin d'itérations
Pas besoin de normaliser les features

Inconvénients
Lent si n (nombre de features) est très grand (> 10000)
Nécessite le calcul de (X T X )−1 qui est coûteux : O(n3 )
Peut être numériquement instable si X T X est singulière
26 / 28
Polynomial Features
Idée
On peut utiliser la régression multiple pour modéliser des relations non-linéaires en créant des
features polynomiales.

27 / 28
Polynomial Features
Idée
On peut utiliser la régression multiple pour modéliser des relations non-linéaires en créant des
features polynomiales.
Exemple
Au lieu de h(x) = θ0 + θ1 x , on peut utiliser :

h(x) = θ0 + θ1 x + θ2 x 2 + θ3 x 3

En posant : x1 = x , x2 = x 2 , x3 = x 3 , on retrouve une régression multiple !

27 / 28
Polynomial Features
Idée
On peut utiliser la régression multiple pour modéliser des relations non-linéaires en créant des
features polynomiales.
Exemple
Au lieu de h(x) = θ0 + θ1 x , on peut utiliser :

h(x) = θ0 + θ1 x + θ2 x 2 + θ3 x 3

En posant : x1 = x , x2 = x 2 , x3 = x 3 , on retrouve une régression multiple !


40
Données
30 h(x) = 1 + 0.5x + 0.5x 2

20
y

10

0
0 1 2 3 4 5 6 7 27 / 28
Exercice à faire - Régression Multiple
Énoncé
On veut prédire le prix d'une maison en fonction de plusieurs variables :
Surface (m²) Chambres Âge (ans) Prix (k¿)
80 2 5 200
100 3 10 250
120 3 3 320
150 4 15 350
90 2 8 220

À faire :
1 Normaliser les features
2 Implémenter le gradient descent
3 Trouver les paramètres θ0 , θ1 , θ2 , θ3
4 Prédire le prix d'une maison de 110 m², 3 chambres, 7 ans
5 Calculer RMSE et R 2 28 / 28

Vous aimerez peut-être aussi