0% ont trouvé ce document utile (0 vote)
0 vues124 pages

4

Le document traite de l'apprentissage supervisé, en se concentrant sur les modèles de régression, y compris la régression linéaire simple et multiple. Il explique la formalisation mathématique, les paramètres et hyperparamètres, ainsi que l'importance de la fonction de perte pour évaluer les performances du modèle. Enfin, il aborde les hypothèses sous-jacentes à la régression linéaire et fournit des exemples concrets d'application.

Transféré par

Ouafaa Lakrakar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
0 vues124 pages

4

Le document traite de l'apprentissage supervisé, en se concentrant sur les modèles de régression, y compris la régression linéaire simple et multiple. Il explique la formalisation mathématique, les paramètres et hyperparamètres, ainsi que l'importance de la fonction de perte pour évaluer les performances du modèle. Enfin, il aborde les hypothèses sous-jacentes à la régression linéaire et fournit des exemples concrets d'application.

Transféré par

Ouafaa Lakrakar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Apprentissage supervisé :

Régression
 Régression linéaire
 Régression polynomiale
 Régression régularisée

K. Nassiri
Apprentssage supervisé : Régression vs Classification
 Concept :
• Nous travaillons avec des données sous la forme d'entrées et de sorties :

• Ici, représente l'entrée et représente la sortie.

 Objectifs
 Expliquer : Comprendre comment les entrées sont reliées aux sorties.
 Prédire : Faire des prévisions sur la sortie à partir de nouvelles entrées .

 Deux types de problèmes


 Régression : Utilisée lorsque la sortie est une variable quantitative ( ).
 Classification : Utilisée lorsque la sortie est une variable qualitative.
Formalisation mathématique
Tout commence par les données, qui sont fondamentales pour tout modèle d'apprentissage
automatique. Voici un aperçu détaillé des composants clés impliqués dans ce cadre :

A. Espaces des Entrées et des Sorties


 Espace des Entrées ( ) : représente les caractéristiques (ou "features") utilisées pour
effectuer des prédictions.
o Par exemple, si l'on souhaite prédire le prix d'une maison, les entrées peuvent
inclure des attributs tels que la surface habitable, le quartier, le nombre de chambres,
etc.
 Espace des Sorties ( ) : représente les valeurs que nous cherchons à prédire, souvent
appelées "labels".
o Dans notre exemple, l'espace des sorties pourrait contenir les différents prix des
maisons.
 Dataset ( : la collection de données que nous utilisons pour entraîner notre modèle.
Mathématiquement, où et . Cela représente
tous les exemples que nous avons à notre disposition pour apprendre.
Formalisation mathématique
B. L'Objectif fondamental

L'objectif principal de l'apprentissage automatique est de trouver une fonction , appelée


fonction de prédiction, qui puisse mapper n'importe quel point dans l'espace des
entrées vers la sortie correspondante .

Trouver une fonction de prédiction

telle que :

 L’objectif est de trouver les paramètres qui minimisent une fonction de coût mesurant
l’écart entre prédictions 𝑖 et valeurs réelles .
Paramètres vs Hyperparamètres
A. Les paramètres ( )
 Les paramètres sont des valeurs qui sont ajustées automatiquement par le modèle
pendant le processus d'apprentissage. Ils déterminent le comportement du modèle.
 Les paramètres sont les réglages internes que le modèle ajuste automatiquement
pendant l'apprentissage en fonction des données qu'il "lit".

Exemple :
Dans une fonction de prédiction telle que , les paramètres incluent
 Poids ( ) : Cela représente la pente de la ligne, combien elle monte ou descend.
 Biais ( ) : Cela détermine où la ligne coupe l'axe vertical (l'ordonnée à
l'origine).

Rôle :
Ces paramètres définissent les connaissances acquises par le modèle lors de
l’entraînement. Plus ils sont ajustés correctement, meilleure sera la performance du
modèle.
Paramètres vs Hyperparamètres
A. Les paramètres ( ) : Exemple d’un enfant qui apprend à écrire des lettres.
 Le problème (tâche) : apprendre à tracer la lettre “A” correctement.
 Le « modèle » de l’enfant = sa façon d’écrire (mouvements, pression du crayon,
séquence des traits).

 Paramètres (ce que l’enfant apprend)


Ce sont les détails internes que l’enfant ajuste en pratiquant.
Exemples concrets :
o L’angle exact du crayon pour tracer la barre oblique gauche.
o La longueur relative des traits.
o La force de la pression sur le papier.

 Comment ils sont obtenus : l’enfant pratique, observe, corrige — ces éléments
changent progressivement en réponse au feedback.
 paramètres = coefficients d’un modèle (coefficients d’une régression) qui sont ajustés automatiquement pendant
l’entraînement pour réduire l’erreur.
Paramètres vs Hyperparamètres
B. Les Hyperparamètres
 Les hyperparamètres, en revanche, sont des paramètres que vous devez définir vous-
même avant que le processus d'apprentissage ne commence. Ils ne sont pas ajustés par
le modèle pendant l'apprentissage.

Exemple :
Reprenons l'exemple de la ligne droite. Supposons que vous deviez décider de la façon
dont vous allez apprendre à dessiner cette ligne (en d’autres termes, comment vous
entraînez le modèle). Voici quelques hyperparamètres possibles :
• Taux d’apprentissage ( ) : Cela détermine la taille des étapes que vous faites lorsque
vous ajustez et . Un taux d'apprentissage élevé peut vous faire sauter des zones
importantes, tandis qu'un taux trop bas peut rendre le processus très lent.
• Nombre d’époques : Cela signifie combien de fois vous allez examiner tous vos points
de données pour mettre à jour et . Par exemple, si vous entraînez votre modèle sur
un ensemble de données pendant 100 époques, cela signifie que vous allez passer 100
fois par tous vos exemples.
Paramètres vs Hyperparamètres
B. Les Hyperparamètres (ce que l’adulte définit) : Exemple d’un enfant
 Ce sont les règles, l’organisation ou les conditions que l’adulte (enseignant/parent) fixe
avant l’apprentissage.
 Exemples concrets :
o Durée et fréquence des séances d’entraînement (5 minutes par jour vs 1 heure par
semaine).
o Le type de crayon utilisé (crayon à mine dure vs crayon gras).
o Le niveau de détail des instructions (dessiner point par point ou montrer le modèle
fini).
o S’il faut corriger l’enfant à chaque erreur ou seulement après chaque session.

 Ces choix influencent fortement ce que l’enfant apprend et la vitesse d’apprentissage,


mais l’adulte ne modifie pas directement les angles et longueurs que l’enfant adoptera —
l’enfant les découvre en pratiquant.
Hyperparamètres = learning rate (vitesse d’apprentissage), nombre d’itérations/époques, architecture du modèle (nombre de
couches, de neurones), coefficient de régularisation, taille du batch, etc. On les fixe avant l’entraînement (ou on les ajuste via
validation).
Paramètres vs Hyperparamètres
Pourquoi est-ce Important ?

Paramètres :
 Ajustés par le modèle pendant l'apprentissage (ex : poids et biais d'une ligne)
 Les paramètres sont cruciaux, car ce sont eux qui déterminent comment le modèle
"apprend" des données. Si les paramètres sont bien ajustés, le modèle peut faire
de bonnes prédictions.

Hyperparamètres :
 Choisis par vous avant l'apprentissage (ex : taux d'apprentissage, nombre
d'époques).
 Les hyperparamètres affectent la manière dont le modèle apprend. Choisir les
bons hyperparamètres peut améliorer la performance du modèle, tandis que de
mauvais choix peuvent le rendre inefficace ou même le faire échouer.
La fonction de perte ( )
La fonction de perte est essentielle pour évaluer si notre fonction de prédiction (notre
modèle) est performante. Elle nous permet de quantifier l'écart entre les prédictions du modèle
et les valeurs réelles .

A. Règles de la fonction de perte (Loss Function)


 si : Cela signifie que si la prédiction est parfaite, la perte est nulle.
 si : Dès qu'il y a une erreur dans la prédiction, un coût est associé, et
la perte prend des valeurs positives.

B. Le risque empirique : La fonction de coût (Cost Function)


 Pour s'assurer que notre modèle est performant sur le dataset et pas seulement sur un
point isolé, nous cherchons à minimiser la moyenne des pertes. Ce concept est connu
sous le nom de Risque Empirique ( ) et est formulé comme suit :
Qu’est-ce qu’un modèle de régression ?
 Un modèle de régression est une fonction mathématique qui cherche à établir une
relation entre :
 : variables explicatives (features)
 : variable cible continue (target) 𝒚: variable cible
(target)
 Elle prédit les valeurs continues en ajustant une
droite qui représente au mieux les données.

 Elle suppose qu'il existe une relation linéaire 𝑿: variable explicative


entre l'entrée et la sortie (feature)

 Utilise une droite de régression pour


effectuer des prédictions
Par exemple :
 Couramment utilisé en prévision, en analyse o Quel est le prix d’une maison ?
des tendances et en modélisation prédictive o Quelle sera la consommation
d’énergie demain ? »
Qu’est-ce qu’un modèle de régression ?
Formalisation mathématique générale

Soit un ensemble d’apprentissage de observations :

où ) vecteur de caractéristiques) et .

Le modèle de régression cherche une fonction (paramétrée par ) telle que :


𝑖 =

 L’objectif est de trouver les paramètres qui minimisent une fonction de


coût mesurant l’écart entre prédictions 𝑖 et valeurs réelles .
Qu’est-ce qu’un modèle de régression ?
Quelques-uns des modèles de régression les plus courants :

 Régression linéaire simple


 Régression linéaire Multiple
 Régression polynomiale
 Régression régularisée
 Régression à vecteurs de support (SVR)
 Régression par arbre de décision
 Régression par forêt aléatoire
 …
Qu’est-ce qu’un modèle de régression ?
1. Régression linéaire simple (une seule variable)
C’est le cas le plus simple :


 est l’ordonnée à l’origine (intercept) (biais)
 la pente (coefficient) , qui indique la variation de Y pour une variation unitaire de
X (la pondération de la caractéristique )
 L'erreur aléatoire (le bruit que le modèle ne peut pas expliquer).
Qu’est-ce qu’un modèle de régression ?
1. Régression linéaire simple (une seule variable)

 La droite d'ajustement optimale sera celle qui optimise les valeurs de (pente) et
(ordonnée à l'origine) afin que les valeurs y prédites soient aussi proches que possible des
points de données réels.
Qu’est-ce qu’un modèle de régression ?
Exemple concret : Régression linéaire simple (une seule variable)
 Prédiction du prix d’un diamant

Prix Carat

 Si le carat augmente → le prix augmente


 Relation approximée par une droite

 Ce que fait le modèle


Trouver la meilleure droite qui approxime les données

 Objectif de l’apprentissage
Minimiser l’erreur entre :
et
Qu’est-ce qu’un modèle de régression ?
Exemple concret : Régression linéaire simple (une seule variable)
Tout commence par un constat d'échec.

 Le modèle prédit une valeur :


 Mais la vraie valeur est : , un point situé au-dessus ou en dessous.

Il y a donc un écart (Le résidu) étant la distance brute de prédiction.

Le problème :
 Si on fait la moyenne des résidus , les erreurs positives et négatives
s'annulent. Un modèle qui se trompe de +100 et de -100 aurait une erreur
moyenne de 0... ce qui est absurde !
Qu’est-ce qu’un modèle de régression ?
2. Régression linéaire Multiple (plusieurs variables)
 La régression linéaire multiple permet de prédire
une variable continue (variable dépendante) à
partir de plusieurs variables explicatives
)appelées caractéristiques ou
covariables).
 Le terme linéaire signifie que le modèle est
linéaire par rapport aux paramètres
(coefficients), et non nécessairement par rapport
aux variables elles-mêmes.
 Modèle

 Forme vectorielle
avec
o Le terme permet d’intégrer le biais .
Qu’est-ce qu’un modèle de régression ?
2. Régression linéaire Multiple (plusieurs variables)
 Modèle

 Forme vectorielle
avec
o Le terme permet d’intégrer le biais .
 Forme matricielle (pour observations)

où :
o :vecteur des observations
o × :matrice de design (variables indépendantes)
o :vecteur des coefficients (poids) correspondant à chaque prédicteur.
o : vecteur des erreurs (bruit)
Qu’est-ce qu’un modèle de régression ?
2. Régression linéaire Multiple (plusieurs variables)
Exemple : prédiction du prix d’une maison
On souhaite prédire le prix d’une maison en fonction de plusieurs variables
explicatives :
o 1 :superficie (m²)
o 2 :nombre de chambres
o 3 :âge de la maison

 Modèle de régression linéaire multiple :

Superficie (m²) Chambres Âge (ans) Prix (kMAD)


 Exemple de données 100 3 10 200
120 4 5 250
80 2 20 150
150 5 8 300
Qu’est-ce qu’un modèle de régression ?
2. Régression linéaire Multiple (plusieurs variables)
Exemple : prédiction du prix d’une maison Superfici Chambre Prix
Âge (ans)
Interprétation des coefficients e (m²) s (kMAD)
Supposons que le modèle apprend : 100 3 10 200
1 2 3 120 4 5 250
Interprétation :
80 2 20 150
0 : prix de base
: chaque m² ajoute 1.5 kMAD 150 5 8 300
1
2 : chaque chambre ajoute 10 kMAD
3 : chaque année réduit le prix de 2 kMAD

Exemple de prédiction
Pour une maison avec :130 m², 4 chambres, 10 ans

Prix estimé : 265 kMAD


Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?
1. Linéarité :
 La relation entre les entrées (X) et la sortie (Y) est linéaire.

Comment Vérifier :
a. Scatter Plot : Tracer un nuage de points de Y contre X pour visualiser si les points semblent suivre
une tendance linéaire.
b. Corrélation : Calculer le coefficient de corrélation (r) pour quantifier la force de la relation
linéaire. Un r proche de 1 ou -1 indique une forte relation linéaire.
Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?
2. Indépendance des résidus (erreurs) :
 Les résidus doivent être indépendants les uns des autres. Cela est particulièrement
important pour les données de séries temporelles où les observations peuvent être
corrélées dans le temps.
 la valeur du résidu pour une observation ne donne aucune information sur la valeur du
résidu d'une autre observation.
 Les erreurs ne doivent pas être corrélées entre elles (absence d'autocorrélation).
Pourquoi est-ce important ?
 Si les résidus ne sont pas indépendants, cela signifie que le modèle n'a pas capturé
toute la structure informationnelle des données.
o Biais : Les coefficients du modèle deviennent biaisés, et le modèle ne prédit pas correctement
le phénomène.
o Inférence invalide : Les intervalles de confiance et les tests de significativité (p-values) sont
erronés.
Comment Vérifier :
a. Residual Plot : Tracer les résidus contre l'index temporel ou les valeurs prédites. Si les résidus
montrent un motif (par exemple, une tendance ou un cycle), cela indique une dépendance.
b. Test de Durbin-Watson : Utiliser ce test pour quantifier l'autocorrélation des résidus.
Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?
3. Normalité des erreurs :
 Les erreurs doivent suivre une distribution normale (en forme de cloche). Cela est important
pour les tests d'hypothèses et la construction d'intervalles de confiance pour les coefficients du
modèle.
 La non-normalité révèle souvent un problème de spécification :
o Forme fonctionnelle incorrecte : Relation non-linéaire non modélisée
o Variables omises : Effets confondus non capturés
o Hétéroscédasticité : Variance des erreurs non constante
o Distribution des données : Y suit une loi non-normale (ex: asymétrie, queues épaisses)
Comment Vérifier :
a. Q-Q Plot (Graphique de probabilité normale) : Tracer un quantile-quantile plot des résidus
contre une distribution normale. Si les points suivent approximativement une ligne droite, les
résidus sont normalement distribués.
b. Test de Shapiro-Wilk : Utiliser ce test pour vérifier formellement la normalité des résidus.
Identifier la cause : Analyse des résidus (histogramme, test d'autocorrélation)
Corriger la spécification :
o Transformations (Box-Cox pour Y, log pour X)
o Ajout de termes polynomiaux/interactions
o Modèles robustes (Quantile Regression) ou GLS
o Variables instrumentales si exogénéité violée
Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?
4. Variance constante (homoscédasticité) :
 les erreurs doivent être uniformément réparties sur toutes les valeurs d’entrée. Si cette
répartition change (par exemple, si elle s’élargit ou se rétrécit), on parle
d’hétéroscédasticité, ce qui pose problème pour le modèle.
Comment Vérifier :
a. Residual vs Fitted Plot : Tracer les résidus contre les valeurs prédites. Si la dispersion des résidus
augmente ou diminue avec les valeurs prédites, cela indique une hétéroscédasticité.
b. Test de Breusch-Pagan : Utiliser ce test pour détecter formellement l'hétéroscédasticité.

 Les points sont répartis  Le nuage de points forme


aléatoirement sans un entonnoir (funnel
forme particulière. shape) ou une forme
 La largeur du nuage conique.
reste constante sur  La dispersion des
toute l'échelle. résidus augmente ou
diminue avec les valeurs
prédites (ŷ) ou X.
Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?
5. Absence de multicolinéarité (pour la régression multiple) :
 Dans la régression linéaire multiple, les variables indépendantes ne doivent pas être
trop corrélées entre elles. La multicollinéarité peut rendre les estimations des
coefficients instables et difficiles à interpréter.
Comment Vérifier :
a. Matrice de Corrélation : Examiner la matrice de corrélation entre les variables indépendantes
pour identifier les corrélations élevées.
b. Variance Inflation Factor (VIF) : Calculer le VIF pour chaque variable indépendante. Un VIF
supérieur à 10 indique généralement un problème de multicollinéarité.

6. Absence de valeurs aberrantes ou influentes


 Les valeurs aberrantes ou influentes peuvent avoir un impact disproportionné sur les
estimations des coefficients du modèle, conduisant à des résultats biaisés.
Comment Vérifier :
a. Box Plot : Utiliser un box plot pour identifier les valeurs aberrantes dans les variables.
b. Leverage, Cook's Distance : Calculer ces mesures pour identifier les observations influentes.
Hypothèses de la régression linéaire Qu’est-ce qu’un modèle de régression ?

7. Exogénéité des variables indépendantes


 Les variables indépendantes doivent être exogènes, c'est-à-dire qu'elles ne doivent
pas être corrélées avec l'erreur du modèle. Si cette hypothèse est violée, les
estimations des coefficients peuvent être biaisées.
 les variables indépendantes sont déterminées en dehors du système modélisé et
n'influencent pas le terme d'erreur.
 Si les variables indépendantes sont corrélées avec le terme d'erreur (endogénéité), les
coefficients estimés deviennent biaisés et peu fiables.

Comment Vérifier :
a. Connaissance Théorique : Utiliser la connaissance théorique du domaine pour
argumenter l'exogénéité des variables.
b. Instruments Variables : Si l'exogénéité est suspectée, utiliser des variables
instrumentales pour estimer le modèle.
Qu’est-ce qu’un modèle de régression ?
3. Régression polynomiale
 La régression polynomiale est une
extension de la régression linéaire.

 Modéliser des relations plus complexes


entre les variables lorsque les données ne
suivent pas une ligne droite, mais une
courbe.

Appliquer un modèle linéaire sur des transformations polynomiales des variables


d’entrée.
Autrement dit, on transforme les variables originales en nouvelles caractéristiques :

puis on applique une régression linéaire classique.


Le modèle reste linéaire en coefficients
Mais il permet de capturer des relations non linéaires
Qu’est-ce qu’un modèle de régression ?
3. Régression polynomiale
 Formalisation Mathématique

Le modèle de régression polynomiale de degré s’exprime comme suit :

 :représente l’ordonnée à l’origine (le biais du modèle)


 :sont les coefficients (poids) appris à partir des données
 :correspond à la variable d’entrée élevée à la puissance
 : représente le bruit ou l’erreur aléatoire

 Note cruciale :
 Même si la relation entre et est non linéaire (courbe) : le modèle reste linéaire
par rapport aux paramètres
Qu’est-ce qu’un modèle de régression ?
3. Régression polynomiale
 Exemple simple : rendement d’une réaction chimique
 Imaginons que l’on étudie le rendement d’une réaction chimique en fonction de
la température .

 Comportement réel :

o À basse température → la réaction est lente → rendement faible


o À une température optimale → rendement maximal
o À très haute température → dégradation des composants → le rendement
diminue

La relation entre et est donc non linéaire (forme en cloche)


Qu’est-ce qu’un modèle de régression ?
3. Régression polynomiale
 Exemple simple : rendement d’une réaction chimique
Limite de la régression linéaire
 Si l’on applique une régression linéaire :
on obtient une droite qui traverse les données
Problème :
 elle ne capture pas le maximum
 elle ne permet pas d’identifier la température optimale

Solution : régression polynomiale (degré 2)


Avec une régression polynomiale de degré 2 :

Le modèle apprend une parabole


Avantage :
 Cette courbe pourra monter, atteindre un sommet, puis redescendre
 Elle reproduit fidèlement le comportement physique réel
Qu’est-ce qu’un modèle de régression ?
3. Régression polynomiale
 Exemple simple : rendement d’une réaction chimique
 Les risques : le choix du degré
Le choix du degré est une étape cruciale et délicate, car il influence directement
la capacité du modèle à bien apprendre.
 Degré 1 : Le modèle est une droite. Risque de Sous-apprentissage
(Underfitting)
o le modèle est trop simple
o il ne capture pas les relations non linéaires des données
 Degré 2 ou 3 : Permet de capturer les courbures naturelles
o Offre généralement un bon compromis entre simplicité et performance
 Degré élevé (ex : 15) : Le modèle devient très complexe. Risque de sur-
apprentissage (overfitting)
o la courbe s’ajuste parfaitement à tous les points d’apprentissage
o elle présente des oscillations excessives (comportement instable)
o le modèle perd sa capacité à généraliser sur de nouvelles données
La fonction de perte Qu’est-ce qu’un modèle de régression ?

 La fonction de perte mesure l’erreur pour un seul exemple (C’est une mesure
individuelle : 𝒊 𝒊
 C’est la pénalité locale

 Solutions possibles : rendre les erreurs positives


Idée clé : Éviter l’annulation des erreurs

Erreur absolue : C'est la valeur absolue de la différence entre la valeur prédite et la


valeur réelle.

Erreur quadratique: : C'est la différence au carré entre la valeur prédite et la valeur


réelle.
La fonction de coût Qu’est-ce qu’un modèle de régression ?

 Le coût est une mesure globale. C'est la moyenne (ou la somme) de toutes les fonctions
de perte sur l'ensemble du dataset d'entraînement.C’est la pénalité globale

Où est le nombre total d'exemples.

 Elle représente l'erreur totale du modèle. C'est cette valeur que l'algorithme
d'optimisation (comme la Descente de Gradient) cherche à minimiser.
La fonction de coût Qu’est-ce qu’un modèle de régression ?

1. Erreur Absolue Moyenne MAE (Mean Absolute Error)

 Pourquoi ? Elle est plus "robuste". Si vous avez des données aberrantes
(outliers), la MAE ne s'affole pas autant que la MSE.

2. Erreur Quadratique Moyenne MSE (Mean Squared Error)


2

 Pourquoi ? Pour rendre l'erreur positive et surtout pour punir sévèrement les
grosses erreurs. Une erreur de 10 devient une pénalité de 100, alors qu'une
erreur de 2 ne vaut que 4.
La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss
 C'est un hybride. Elle se comporte comme une MSE quand l'erreur est petite, et
comme une MAE quand l'erreur est grande.

 Pourquoi ? Pour avoir la stabilité de la MSE au centre et la robustesse de la


MAE sur les bords.

 Elle a été conçue pour résoudre un dilemme classique (MSE vs MAE) :


o comment rester précis sur les données normales tout en ignorant les données
aberrantes (outliers) ?
La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss

 Le Dilemme : MSE vs MAE


Avant de définir la Huber Loss, rappelons pourquoi elle existe :

 La MSE est excellente quand l'erreur est petite, car elle est très lisse près
de zéro (facile à optimiser). Mais elle est obsédée par les grandes erreurs :
si un point est très loin, le carré rend l'erreur gigantesque et "tire" tout le
modèle vers lui.

 La MAE est robuste. Elle ignore la violence des outliers. Cependant, elle
n'est pas dérivable en zéro (forme de "V"), ce qui peut rendre
l'optimisation instable quand on approche du minimum.
La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss : Définition Mathématique

 La Huber Loss utilise un hyperparamètre critique, seuil de transition , qui


définit le seuil de basculement entre un comportement quadratique et un
comportement linéaire.

 La fonction de perte pour une erreur :

2 si

si
La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss
Pourquoi ces formules ?
 Zone centrale ( ) : on adopte une fonction quadratique identique à la MSE :
2

1
o Le facteur est introduit pour simplifier les calculs, notamment la dérivée, qui
2
devient simplement , ce qui facilite l’optimisation.

 Zone extérieure ( ) : Lorsque l’erreur devient importante, la fonction passe à


un comportement linéaire, similaire à la MAE.
1
o Le terme joue un rôle essentiel : il garantit une transition parfaitement lisse
2
entre les deux zones au point .
o Ainsi, la fonction reste continue et dérivable, ce qui est crucial pour les
algorithmes d’optimisation comme la descente de gradient.
La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss : Exemple concret


Supposons que l’on fixe le seuil de transition à :

 Cas A : Petite erreur (donnée normale)

 Valeur réelle :
 Prédiction :
 Erreur :

 Comme , on se trouve dans la zone quadratique :


2

o La pénalité est faible, car l’erreur est petite.


La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss : Exemple concret

 Cas B : Grande erreur (valeur aberrante)

 Valeur réelle :
 Prédiction :
 Erreur :

 Comme , on passe à la zone linéaire :

o La pénalité augmente, mais de manière contrôlée.


La fonction de coût Qu’est-ce qu’un modèle de régression ?

3. Huber Loss : Exemple concret

 Remarque importante
 Si l’on avait utilisé la MSE :
2

o La pénalité aurait été beaucoup plus élevée.

 Conclusion
La Huber Loss limite fortement l’impact des grandes erreurs :
 elle reste précise pour les petites erreurs
 elle évite que les outliers dominent l’apprentissage
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

 Les modèles ML apprennent en minimisant une fonction de cout qui mesure la


différence entre les valeurs prédites et les valeurs réelles.
 Des algorithmes d'optimisation sont utilisés pour mettre à jour les paramètres du
modèle.
 réduire cette perte et d'améliorer l'apprentissage à partir des données.

 Leurs principaux rôles dans l'entraînement sont les suivants :


o Réduire l'erreur de prédiction : ajuster les paramètres du modèle pour minimiser la
fonction de perte.
o Favoriser l'apprentissage : Aider les modèles à améliorer leurs prédictions grâce à
des mises à jour répétées.
o Entraînement guidé : Faire évoluer le modèle vers une solution optimale pendant
l’entraînement.
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Objectif du Machine Learning (régression)

En régression, on cherche à construire un modèle :

où :
: variables d’entrée
:prédiction
: paramètres (coefficients) du modèle

Objectif
Trouver les paramètres optimaux :

Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
Modèle linéaire 1 𝜃
𝑥 𝜃
𝑋= et 𝜃 =
⋮ ⋮
𝑥 𝜃
o est le nombre de variables d’entrée (features)

Fonction de coût

Passage à l’optimisation
 Le problème devient :

Condition d’optimalité
 On cherche :
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Rappel : qu'est-ce qu'une dérivée ?


La dérivée d’une fonction en un point indique la direction et la vitesse de variation de
cette fonction en ce point.
Autrement dit, elle représente la pente de la courbe.

 Si la dérivée est positive : la fonction est croissante. elle monte


o Cela signifie que pour diminuer la valeur de la fonction, il faut se déplacer vers la
gauche.

 Si la dérivée est négative : la fonction est décroissante. elle descend


o Pour continuer à descendre, il faut aller vers la droite.

 Si la dérivée est nulle : la pente est horizontale


o On se trouve à un point critique :
• soit un minimum (fond de vallée)
• soit un maximum (sommet d’une colline)
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Objectif
Trouver qui minimise l’erreur entre :
et

Fonction de coût (MSE)


2

En forme matricielle

En forme développée :

Développons :
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Le gradient (la dérivée vectorielle) de par rapport à est :

𝒥
En annulant ce gradient, on obtient les équations normales :

Si est inversible (ce qui signifie que les colonnes de X sont linéairement
indépendantes) :
∗ 1

1ière solution (analytique) : Équation normale


L’équation normale permet de :


 transformer un problème d’optimisation
 en une solution analytique fermée
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Exemple concret

Prenons un jeu de données simple avec observations et variable


explicative (plus l’intercept).

La matrice (avec colonne de 1) est :


Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

Exemple concret
Résolvons :
Calculons et :  De la première ligne : →
.
 De la seconde : →
.
 En multipliant la première équation par 3 :
.
 On soustrait de la seconde :
→ .
 Puis .
Les équations normales :

 Le modèle ajusté est donc .On vérifie que les résidus sont nuls (car
points alignés).
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?

2ieme solution (Itérative) : Descente de gradient (gradient descent )


 C’est une méthode d'optimisation utilisée pour minimiser une fonction de coût,
notamment dans le cadre de la régression linéaire.
 Elle permet d'ajuster les paramètres d'un modèle (les coefficients) de manière
itérative pour trouver les valeurs qui minimisent l'erreur entre les prédictions du
modèle et les données réelles.
Contexte
Fonction de coût (MSE) (On utilise l’erreur quadratique moyenne, souvent multipliée
par 2 pour simplifier les dérivées )
1

2
o 𝑛 est le nombre d’observations

En forme matricielle :
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Gradient de la fonction de coût
𝒥
On calcule le gradient par rapport à , . Pour un modèle linéaire avec la MSE, le
gradient est :

Descente de gradient
L'objectif est de minimiser (θ) en ajustant iterativement les paramètres θ. À
chaque itération, les paramètres sont mis à jour dans la direction du gradient négatif
de (θ):

pour où:
o est le taux d'apprentissage (learning rate),
𝒥
o est le gradient de (θ) par rapport à .
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Calcul des gradients

On considère :

0
Fonction de coût
2

1
Objectif
Calculer :
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Calcul des gradients
Dérivation étape par étape
Étape 1 : dériver une somme

Étape 2 : dérivée d’un carré


On utilise :
2

Donc :

1
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Calcul des gradients
Dérivation étape par étape
Étape 3 : simplification

Étape 4 : dériver le modèle

0
Donc :
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Calcul des gradients
Dérivation étape par étape

Étape 5 : résultat final

 Le gradient est une moyenne des erreurs, pondérée par la variable


Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Calcul des gradients : Recap.
Les dérivées partielles de la fonction de coût par rapport à chaque paramètre sont
données par :

pour
1
 Chaque gradient mesure l’influence du paramètre sur l’erreur globale du modèle.

Pour le paramètre 0 (le biais) : 0


o Cela permet d’intégrer l’ordonnée à l’origine directement dans le modèle.

 Chaque dérivée nous indique comment ajuster un paramètre donné pour réduire
l’erreur.
o On corrige ensuite chaque en fonction de cette contribution.
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Cas particulier : le biais 0
Comme :
0
Alors :

0
1

Lien avec la descente de gradient


Mise à jour :

 Cette formule montre que :


 le modèle apprend à partir des erreurs
 chaque paramètre est ajusté proportionnellement à son influence
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
 Algorithme de la descente de gradient
La descente de gradient fonctionne en répétant les étapes suivantes :
Initialiser les paramètres 0 1 ) généralement à zéro ou à de petites valeurs
aléatoires).

Répéter jusqu’à convergence (c’est-à-dire jusqu’à ce que les paramètres ne changent


plus significativement) :
1. Calculer la prédiction 𝜽 pour chaque exemple .
2. Calculer le gradient de la fonction de coût par rapport à chaque paramètre .
3. Mettre à jour chaque paramètre simultanément :

où est le taux d’apprentissage (learning rate).


Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )

Initialisation des paramètres


 Initialisation à zéro : simple et souvent efficace pour les modèles convexes
comme la régression linéaire.
 Initialisation aléatoire : utilisée pour briser la symétrie dans les réseaux de
neurones, mais pas indispensable ici.

Choix du taux d’apprentissage


 Trop petit : convergence très lente.
 Trop grand : la perte peut diverger.

 Une stratégie : essayer des valeurs et tracer l’évolution du


coût.
 La descente de gradient est garantie de converger pour la MSE (fonction
convexe) si est suffisamment petit.
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )

Point important : Importance de la normalisation des caractéristiques

Lorsque les variables ont des échelles très différentes (ex. âge entre 0 et 100, salaire
entre 1000 et 100000), la descente de gradient converge plus lentement et peut
osciller. Il est conseillé de standardiser les caractéristiques :

où est la moyenne et l’écart-type de la caractéristique .


Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple numérique simple
Supposons : x y
1 2
2 3

Modèle :
Gradient
Initialisation :

Calcul des prédictions Mise à jour


1 2
Erreurs  augmente → amélioration du modèle
1 2
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire simple
Reprenons l’exemple simple de trois points : .
Modèle : .
Initialisons , .
Itération 1
Prédictions :
Erreurs :

0
1

Mise à jour :
0
1
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire simple
Itération 2
Prédictions :
Erreurs :

Mise à jour :
0
1

Les paramètres se rapprochent des valeurs optimales .


Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Données et initialisation x1 2
1 2 5
2 3 8
3 4 11
Modèle :
Initialisation :
Taux d’apprentissage :

Itération 1 (déjà partiellement calculée)


Prédictions
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Erreurs
1 1 1
2 2 2
3 3 3
Calcul des gradients
Pour la MSE, les gradients sont :

0
1

1
1
1

2
2
1
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Avec :

Mise à jour des paramètres


0 0
1 1
2 2
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Itération 2 (complète)
Nouveaux paramètres : 0 1 2

Prédictions
1
2
3

Erreurs
1
2
3
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Itération 2 (complète)

Gradients

Mise à jour
0
1
2
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Itération 3 (résumée)
Avec 0 1 2 :
Prédictions :
1
2
3
Erreurs :
Gradients :
0
1
2
Mise à jour :
0
1
2
Optimisation : Minimisation du coût Qu’est-ce qu’un modèle de régression ?
2ieme solution (Itérative) : Descente de gradient (gradient descent )
Exemple détaillé : Régression linéaire multiple
Itération 3 (résumée)
Avec 0 1 2 :
Prédictions :
1
2
3
Erreurs :
Gradients : Mise à jour :
𝜃 ≈ 0.148 + 0.05746 = 0.2055
𝜃 ≈ 0.333 + 0.12887 = 0.4619
𝜃 ≈ 0.480 + 0.18579 = 0.6658

 Après plusieurs itérations, les paramètres tendent vers une combinaison qui minimise
la MSE. Avec nos itérations, nous observons que et augmentent, et aussi. En
pratique, avec un nombre suffisant d’itérations, on atteint une solution stable.
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?

 Une fois qu’un modèle de régression est entraîné, une question essentielle se pose :

Est-ce que mon modèle est bon ?

 Pour répondre à cela, on utilise des métriques d’évaluation.

 Les métriques d'évaluation sont utilisées pour mesurer la performance d'un modèle de
régression.

 Elles permettent de quantifier l'erreur entre les valeurs prédites par le modèle et les
valeurs réelles.
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?
 Les principales métriques de régression
1. MAE – Mean Absolute Error (Erreur absolue moyenne)

MAE

 C’est la moyenne des écarts absolus. Elle s’exprime dans la même unité que la
variable cible.

 Points forts :
o Très interprétable : « en moyenne, le modèle se trompe de X unités ».
o Robuste aux valeurs aberrantes (outliers) car l’erreur est linéaire.
o Simple à comprendre pour des non-spécialistes.
 Points faibles :
o Non différentiable en zéro (mais ce n’est pas gênant pour l’évaluation).
o Ne pénalise pas plus les grandes erreurs que les petites.
Exemple : Prédiction de prix de maisons. MAE = 10 000 € signifie qu’en moyenne,
l’erreur absolue est de 10 000 €.
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?
 Les principales métriques de régression
2. MSE – Mean Squared Error (Erreur quadratique moyenne)
2
MSE
1
 Moyenne des carrés des erreurs. L’unité est le carré de l’unité de la cible.

 Points forts :
o Différentiable, utilisée comme fonction de coût.
o Pénalise fortement les grandes erreurs (à cause du carré), ce qui est souhaitable
quand les grosses erreurs sont inacceptables.
 Points faibles :
o Peu interprétable directement (unité au carré).
o Très sensible aux outliers : une seule valeur très aberrante peut faire exploser la
MSE.
Exemple : Si la cible est en euros, la MSE est en euros², ce qui n’est pas intuitif.
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?
 Les principales métriques de régression
3. RMSE – Root Mean Squared Error (Racine de l’erreur quadratique moyenne)

2
RMSE MSE
1

 C’est la racine carrée de la MSE. Elle s’exprime dans la même unité que la cible, ce qui la rend très
interprétable.

 Points forts :
o Combine l’avantage de la MSE (pénalisation des grandes erreurs) avec une unité naturelle.
o Très populaire en pratique.
 Points faibles :
o Toujours sensible aux outliers (comme la MSE).
o Peut être dominée par une seule observation aberrante.
Comparaison MAE vs RMSE :
o Si les erreurs sont petites et symétriques, MAE ≈ RMSE.
o Si le RMSE est nettement plus grand que la MAE, cela indique la présence de quelques erreurs
très grandes.
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?
 Les principales métriques de régression
4. R² – Coefficient de détermination

2
2 1
2
1

Où est la moyenne des valeurs réelles.

 Proportion de la variance de expliquée par le modèle.

2
 : prédictions parfaites.
2
 : le modèle ne fait pas mieux que la moyenne.
2
 : le modèle est pire que la moyenne (mauvais signe).
Métriques d’évaluation Qu’est-ce qu’un modèle de régression ?
 Les principales métriques de régression
4. R² – Coefficient de détermination

 Points forts :
o Indépendant de l’échelle : permet de comparer des modèles sur des cibles
différentes.
o Souvent utilisé pour communiquer la qualité d’ajustement (en pourcentage).
 Points faibles :
o Ne donne pas l’ampleur de l’erreur (un R² de 0,9 peut cacher des erreurs
importantes si la variance de est faible).
o Augmente artificiellement avec l’ajout de variables inutiles (non pénalisé).
→ Utiliser le R² ajusté quand le nombre de variables est grand

Formule du ajusté
o : nombre d’observations
o : nombre de variables explicatives
o :coefficient classique
Mise en pratique Rappel Qu’est-ce qu’un modèle de régression ?

Les deux rôles principaux du modèle Un modèle de Machine Learning a deux phases
bien distinctes :

1. Phase d’entraînement (Training)


a. Le modèle reçoit un dataset d’entraînement (exemples + réponses).
b. Il ajuste ses paramètres internes pour minimiser les erreurs.
c. C’est là que l’« apprentissage » se produit (comme l’enfant qui regarde les photos).
d. Durée : de quelques secondes à plusieurs jours selon la complexité.

1. Phase de prédiction (Inference ou Testing)


a. Une fois entraîné, on donne au modèle des nouvelles données qu’il n’a jamais
vues.
b. Il applique ce qu’il a appris pour faire une prédiction.
c. Exemple : vous prenez une photo de maison → le modèle donne le prix estimé en
0,01 seconde.
Mise en pratique Qu’est-ce qu’un modèle de régression ?

1. Importer les bibliothèques


from sklearn.linear_model import LinearRegression

2. Préparer les données


= # variable explicative (doit être 2D)
= # variable cible

Scikit-learn exige que soit une matrice (même avec une seule variable)
3. Créer le modèle de régression linéaire
model = LinearRegression()
Ici, on instancie un modèle de régression linéaire, mais il n’a encore rien appris.
Mise en pratique Qu’est-ce qu’un modèle de régression ?
4. Entraîner le modèle
[Link](X, y)
La méthode fit() permet d’apprendre les coefficients du modèle à partir des données
5. Voir les paramètres appris
print("Intercept ( 0) :", model.intercept_)
print("Coefficient ( 1) :", model.coef_[0])
Le modèle appris est de la forme :
0 1
6. Faire une prédiction
prediction = [Link](nouvelle_valeur)
Le modèle utilise les paramètres appris pour estimer une nouvelle valeur.
Mise en pratique Qu’est-ce qu’un modèle de régression ?

5. Calcul des métriques

from [Link] import mean_squared_error, r2_score, mean_absolute_error

mse = mean_squared_error(y_true, y_pred)


#la moyenne des erreurs quadratiques.

rmse = [Link](mse)
#l'écart-type des erreurs de prédiction en même unités que la variable cible

mae = mean_absolute_error(y_true, y_pred)


#Moins sensible aux valeurs aberrantes que le MSE

r2 = r2_score(y_true, y_pred)
#Le pourcentage de la variance de Y est expliquée par le modèle.
Mise en pratique Qu’est-ce qu’un modèle de régression ?
6. Régression polynomiale
A. Création des caractéristiques polynomiales
from [Link] import PolynomialFeatures
from sklearn.linear_model import LinearRegression
X = Variable explicative
y = Variable cible

# 1. Instancier le transformateur polynomial


poly = PolynomialFeatures(degree=2, include_bias=False)
#crée un objet qui génère les puissances 1 et 2 de chaque caractéristique.
#include_bias=False : évite d’ajouter une colonne de 1 (l’intercept sera ajouté
par LinearRegression)
# 2. Transformer X en [x, x^2]
X_poly = poly.fit_transform(X)
#calcule les combinaisons polynomiales sur les données X et retourne un nouveau
tableau X_poly.
Mise en pratique Qu’est-ce qu’un modèle de régression ?

6. Régression polynomiale
B. Instanciation et entraînement du modèle linéaire

# 3. Créer le modèle de régression linéaire


model = LinearRegression()
#On utilise LinearRegression() exactement comme pour une régression linéaire
classique.

# 4. Entraîner sur les caractéristiques polynomiales


[Link](X_poly, y)
#La seule différence est qu’on l’entraîne sur X_poly (qui contient les colonnes x et x²)
au lieu du X original.

# 5. Afficher les coefficients


print("Coefficients :", model.coef_) # [θ1, θ2]
print("Intercept :", model.intercept_) # θ0
Mise en pratique Qu’est-ce qu’un modèle de régression ?

6. Régression polynomiale
C. Prédiction sur de nouvelles données

# Nouvelles données (par exemple, un seul point x=2.5)


X_new = [Link]([[2.5]])

# Transformer ces nouvelles données avec le même transformateur polynomial (le


transformateur a déjà été ajusté sur les données d’entraînement.)
X_new_poly = [Link](X_new) # attention : transform, pas fit_transform

# Prédiction
y_pred = [Link](X_new_poly)
Régularisation en régression : Qu’est-ce qu’un modèle de régression ?
lutte contre le sur-apprentissage
Pourquoi la régularisation ?
Problème du sur-apprentissage :
o un phénomène qui se produit lorsqu'un modèle apprend trop bien les données
d'entraînement, y compris le bruit et les valeurs aberrantes, et qu'il est peu
performant sur de nouvelles données.
o Exemple : Prenons une régression polynomiale. Un modèle trop complexe (degré
élevé) passe par tous les points d’entraînement, mais donne des prédictions
catastrophiques sur de nouvelles données.

Objectif : trouver un compromis entre :


 Biais faible : le modèle s’adapte bien aux données d’entraînement.
 Variance faible : le modèle ne change pas trop quand les données varient
légèrement.
 La régularisation réduit la variance en pénalisant les coefficients élevés, ce qui aplatit la
courbe de régression.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?

Pourquoi la régularisation ?
 La régularisation est une technique d'apprentissage automatique qui permet d'éviter
le surapprentissage

 La régularisation contribue à créer des modèles qui généralisent mieux aux


nouvelles données en pénalisant la fonction de perte (la fonction que le modèle
cherche à minimiser pendant l'entraînement
ce qui permet de réduire le nombre de paramètres du modèle et de simplifier son
algorithme.
Perte_regularisée = Perte_initiale + λ × Terme_de_régularisation

o Perte initiale : Mesure la différence entre les prédictions du modèle et les


valeurs réelles.
o Terme de régularisation : Ajoute une pénalité pour les poids plus élevés.
o λ (lambda) : Hyperparamètre contrôlant l’intensité de la pénalité. Plus λ est
grand, plus la régularisation est importante.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?

 Forme générale de la régression régularisée


Pour un modèle linéaire :

La fonction de coût sans régularisation (MSE) (Perte_initiale ) :

On ajoute un terme de pénalité (Terme_de_régularisation) :

reg

 : hyperparamètre qui contrôle la force de la régularisation.


o → pas de régularisation.
o très grand → les coefficients tendent vers 0 (modèle très simple).
 On ne pénalise généralement pas l’intercept .
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1)

1
La fonction de coût devient :
2
lasso
1 1
 Cette pénalité peut annuler certains coefficients, ce qui permet de ne retenir que les
variables importantes et d'ignorer les moins pertinentes.
o 𝑛: Nombre d'exemples ou de points de données
Propriétés :
o 𝑝 : Nombre de caractéristiques, (variables prédictives)
o Peut annuler certains coefficients → sélection de
o 𝑦 :Valeur cible réelle pour le iieme exemple
variables (parcimonie).
o 𝑦 :Valeur cible prévue pour le iieme exemple
o 𝜃 : Coefficients des caractéristiques o Utile quand beaucoup de variables sont inutiles.
o 𝜆 : Paramètre de régularisation qui contrôle l'intensité o Pas de solution analytique (optimisation par
de la régularisation descente de sous-gradient ou coordinate descent).
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Descente de gradient
La fonction de coût :

lasso

La valeur absolue n’est pas dérivable en 0. On utilise le sous-gradient : pour ,


la dérivée est signe ; pour ,n’importe quelle valeur entre et .
En pratique, on met à jour avec :

signe

où signe est choisi arbitrairement (souvent 0).


Effet : Le terme signe pousse systématiquement vers zéro, ce qui peut
annuler certains coefficients exactement après plusieurs itérations (si devient nul, il
reste nul car le sous-gradient permet de rester à zéro).
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Code Python (Scikit-learn)
from sklearn.linear_model import Ridge

model = Lasso(alpha=lam)
[Link](X_train, y_train)
#le sous-gradient (ou l’opérateur proximal) ajoute un terme constant
signe ,ce qui peut annuler certains coefficients.

pred = [Link](X_test)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
 Le principal hyperparamètre à régler est alpha (noté aussi λ), qui contrôle la force de la
pénalité L1.
 Un alpha trop petit conduit à un modèle trop complexe (peu de coefficients nuls, risque
de sur-apprentissage).
 Un alpha trop grand annule trop de coefficients (sous-apprentissage).
Principes généraux
o Normalisation obligatoire : Les pénalités L1 et L2 sont sensibles à l’échelle des
variables. Avant toute régularisation, centre et réduis chaque caractéristique
(moyenne = 0, écart-type = 1). Utilise StandardScaler.
o Validation croisée (CV) : La méthode la plus fiable. On découpe les données en k
plis (ex. 5 ou 10). Pour chaque valeur du paramètre, on entraîne sur k-1 plis et on
évalue sur le pli restant. On retient la valeur qui minimise l’erreur moyenne.
o Plage de recherche : Pour α (lambda), utilise une échelle logarithmique
(ex. [Link](-4, 2, 50)).
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de LassoCV (validation croisée intégrée)
 LassoCV explore automatiquement une grille d’alpha et sélectionne celui qui
minimise l’erreur en validation croisée.

import numpy as np
from sklearn.model_selection import train_test_split

# Exemple de données (vous pouvez les remplacer par les vôtres)


X = Variable(s) explicative(s)
y = variable cible
# Séparation entraînement / test
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de LassoCV (validation croisée intégrée)
import numpy as np
from sklearn.linear_model import LassoCV
from [Link] import StandardScaler
# Normalisation
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = [Link](X_test)

# LassoCV : recherche du meilleur alpha par validation croisée (5 plis par défaut)
lasso_cv = LassoCV(cv=5, random_state=42, max_iter=10000)
#LassoCV teste automatiquement une série d’alpha (par défaut 100 valeurs).
lasso_cv.fit(X_train_scaled, y_train)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de LassoCV (validation croisée intégrée)
from [Link] import mean_squared_error

print(f"Meilleur alpha : {lasso_cv.alpha_:.6f}") #L’attribut alpha_ donne le meilleur alpha.


print(f"Nombre de coefficients non nuls : {[Link](lasso_cv.coef_ != 0)}")
#Les attributs coef_ et intercept_ sont ceux du modèle entraîné avec cet alpha sur
l’ensemble de l’entraînement.

# Évaluation sur le test


y_pred = lasso_cv.predict(X_test_scaled)
mse = mean_squared_error(y_test, y_pred)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV

 GridSearchCV est une méthode d'optimisation des hyperparamètres offerte


par scikit-learn.

 Elle permet de tester automatiquement différentes combinaisons


d'hyperparamètres sur un modèle, en utilisant la validation croisée (Cross-
Validation) pour évaluer chaque combinaison.

trouver la meilleure configuration qui minimise l'erreur (ou maximise la


performance) sur des données non vues.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV

Pourquoi utiliser GridSearchCV ?


 Hyperparamètres : Les paramètres qui contrôlent l'apprentissage (ex: alpha en
Lasso Regression, C en SVM, max_depth en arbres de décision).
 Problème : Tester manuellement toutes les combinaisons est fastidieux et peu
fiable.
 Solution : GridSearchCV automatise la recherche en :
o Définissant une grille de valeurs pour chaque hyperparamètre.
o Entraînant et évaluant le modèle pour chaque combinaison via validation
croisée.
o Sélectionnant la meilleure combinaison selon une métrique (ex: RMSE,
R², accuracy)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV

Étapes de GridSearchCV
• Ex: {'alpha': [0.01, 0.1, 1, 10, 100]} pour une Lasso Regression.
1. Configurer la validation croisée :
• Par défaut, cv=5 (5-Fold CV).
2. Tester chaque combinaison :
• Pour chaque hyperparamètre, le modèle est entraîné K fois (une par fold).
• La performance est moyennée sur les K tests.
3. Sélectionner le meilleur modèle :
• La combinaison avec la meilleure moyenne de performance est retenue.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python
Comment ça marche ?
 Importation des bibliothèques
import numpy as np
from sklearn.linear_model import Lasso
from sklearn.model_selection import GridSearchCV, train_test_split
from [Link] import mean_squared_error
from [Link] import make_regression
from [Link] import StandardScaler
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python

# Séparation train/test (80%/20%)


X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=42)

# PRÉTRAITEMENT : STANDARDISATION DES DONNÉES


# Lasso est sensible à la taille des features
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = [Link](X_test)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python
1- Définir la grille d'hyperparamètres :
param_grid = {
'alpha': [0.001, 0.01, 0.1, 1, 10, 100], # Principal paramètre de Lasso
'max_iter': [1000], # Nombre d'itérations (fixe pour cet exemple)
'tol': [0.0001] # Tolérance (fixe pour cet exemple)
}
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python
2- Configuration de GridSearchCV :
grid_search = GridSearchCV(
estimator=Lasso(), # Modèle à optimiser
param_grid=param_grid, # Grille de paramètres
cv=5, # 5-Fold Cross Validation
scoring='neg_mean_squared_error', # Métrique : -MSE (plus grand = meilleur)
return_train_score=True, # Afficher scores d'entraînement
n_jobs=-1 # Utiliser tous les cores du CPU
)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python

3- Lancement de la recherche
grid_search.fit(X_train_scaled, y_train)

4- Meilleur hyperparamètre
print(f"Meilleur alpha : {grid_search.best_params_['alpha']}")

5- Meilleur score (validation croisée)


best_rmse = [Link](-grid_search.best_score_)
print(f"Meilleur RMSE (validation croisée) : {best_rmse:.3f}\n")
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
1. Régression Lasso (pénalité L1) ) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV – Code Python
6- Modèle final entraîné avec le meilleur alpha
best_model = grid_search.best_estimator_
y_pred = best_model.predict(X_test_scaled)
test_rmse = [Link](mean_squared_error(y_test, y_pred))

7- Interprétation des coefficients


# Récupération des coefficients
coefficients = best_model.coef_
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2)
2 (on ne pénalise pas 𝜃 )
1
La fonction de coût devient :
2 2
ridge
1 1
 gère la multicolinéarité en réduisant les coefficients des variables corrélées au lieu de les
éliminer.
o 𝑛: Nombre d'exemples ou de points de données
o 𝑝 : Nombre de caractéristiques, (variables prédictives) Propriétés :
o 𝑦 :Valeur cible réelle pour le iieme exemple o Les coefficients sont réduits mais jamais annulés.
o 𝑦 :Valeur cible prévue pour le iieme exemple o Bien adapté quand toutes les variables sont utiles
o 𝜃 : Coefficients des caractéristiques mais qu’on veut limiter leurs amplitudes.
o 𝜆 : Paramètre de régularisation qui contrôle l'intensité de o Solution analytique : .
la régularisation
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Descente de gradient
La fonction de coût devient :

ridge

Gradient supplémentaire pour :


D’où le gradient total :
ridge

Mise à jour Ridge (pour ):

On voit un facteur de décroissance qui réduit progressivement à chaque


itération, en plus de la correction par le gradient. C’est ce qu’on appelle le weight decay.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Code Python (Scikit-learn)
from sklearn.linear_model import Ridge

model = Ridge(alpha=lam)
[Link](X_train, y_train)
#le gradient contient un terme linéaire , ce qui réduit exponentiellement les
coefficients.

pred = [Link](X_test)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de RidgeCV (validation croisée intégrée)
 RidgeCV explore automatiquement une grille d’alpha et sélectionne celui qui
minimise l’erreur en validation croisée.
from sklearn.model_selection import train_test_split
from sklearn.linear_model import RidgeCV
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# Normalisation
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = [Link](X_test)
1. On définit les valeurs d'alpha que l'on veut tester
alphas_a_tester = [0.001, 0.01, 0.1, 1.0, 10.0, 100.0]
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de RidgeCV (validation croisée intégrée).
2. Création du modèle RidgeCV
ridge_cv = RidgeCV(alphas=alphas_a_tester, cv=5)
# cv=5 = validation croisée en 5 parties
3. Entraînement sur les données d'entraînement
ridge_cv.fit(X_train_scaled, y_train _scaled)]
4. Meilleur alpha trouvé
Best_alpha = ridge_cv.alpha_

5. Prédictions avec le meilleur modèle


pred_ridge_cv = ridge_cv.predict(X_test_scaled)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV
# Import
from sklearn.model_selection import GridSearchCV
from sklearn.linear_model import Ridge

1. On définit la grille des valeurs d'alpha à tester


param_grid = {'alpha': [0.001, 0.01, 0.1, 1.0, 10.0, 100.0]}

2. Création du modèle Ridge de base


ridge = Ridge()
3. Création du GridSearchCV
grid_search = GridSearchCV(ridge, param_grid, cv=5, scoring='r2')
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Choisir le paramètre de régularisation α (alpha)
Méthode 2 : Validation croisée manuelle avec GridSearchCV
4. Entraînement (GridSearchCV teste toutes les valeurs)
grid_search.fit(X_train _scaled, y_train _scaled)

5. Affichage des résultats


best_alpha = grid_search.best_params_['alpha’])
Best_score = grid_search.best_score_
#Meilleur score R² en validation croisée
6. Prédictions avec le meilleur modèle
pred_grid = grid_search.predict(X_test _scaled)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
2. Régression Ridge (pénalité L2) : Choisir le paramètre de régularisation α (alpha)
Méthode 1 : Utilisation de RidgeCV (validation croisée intégrée).
3. Entraînement sur les données d'entraînement
ridge_cv.fit(X_train, y_train)

4. Meilleur alpha trouvé


Best_alpha = ridge_cv.alpha_

5. Prédictions avec le meilleur modèle


pred_ridge_cv = ridge_cv.predict(X_test)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2)
2
elastic 1 2
1 1
Souvent paramétrée avec et un ratio :

elastic

Combine les avantages : sélection de variables (Lasso) et stabilité en groupe (Ridge).

o : Nombre de caractéristiques (variables prédictives)


o Coefficients des caractéristiques
o : Paramètre de régularisation qui contrôle l'intensité de la régularisation
o : Paramètre de mélange où et = 1 correspond à Lasso ( (régularisation, = 0
correspond à Ridge ( La régularisation et les valeurs comprises entre 0 et 1 permettent
d'équilibrer les régularisations L1 et L2.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2)

 Elle est particulièrement utile lorsque le nombre de variables est grand (n_features >
n_samples) ou que les variables sont corrélées entre elles.

 ElasticNet se comporte comme :


o un Lasso (annule des coefficients) quand l1_ratio est proche de 1,
o un Ridge (réduit tous les coefficients) quand l1_ratio est proche de 0.

 Pour les valeurs intermédiaires, il effectue à la fois une sélection de variables (L1) et
une régularisation de groupe (L2)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Descente de gradient
1 2
Pénalité : avec .
2
Gradient (pour ):

elastic signe
Mise à jour :

signe

Elle combine l’effet de réduction proportionnelle (Ridge) et de seuillage (Lasso).


Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Code Python (Scikit-learn)

from sklearn.linear_model import ElasticNet

# Exemple de base
model = ElasticNet(alpha=lam, l1_ratio=r, random_state=42)
#alpha (par défaut 1.0) : pénalité globale. Plus il est grand, plus les coefficients sont
réduits ou annulés.
#l1_ratio (par défaut 0.5) : proportion de L1 dans la mixité.

[Link](X_train, y_train)

pred = [Link](X_test)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
ElasticNet a deux paramètres à choisir :

 alpha : force globale de la régularisation (comme dans Ridge et Lasso).


• alpha = 0 → pas de régularisation
• alpha grand → forte régularisation (coefficients très petits)

 l1_ratio : mélange entre L1 (Lasso) et L2 (Ridge)


• l1_ratio = 0 → c’est du Ridge pur
• l1_ratio = 1 → c’est du Lasso pur
• l1_ratio = 0.5 → mélange équilibré

Le but est de trouver la meilleure combinaison (alpha + l1_ratio) qui donne le


meilleur score sur les données.
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 1 : Utilisation de ElasticNetCV (validation croisée intégrée)
ElasticNetCV teste automatiquement plusieurs valeurs d’alpha et l1_ratio.
# Import
from sklearn.linear_model import ElasticNetCV
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# Normalisation
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = [Link](X_test)

1. On définit les valeurs à tester


alphas_a_tester = [0.001, 0.01, 0.1, 1.0, 10.0]
l1_ratios_a_tester = [0.1, 0.3, 0.5, 0.7, 0.9]
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 1 : Utilisation de ElasticNetCV (validation croisée intégrée)
2. Création du modèle ElasticNetCV
elastic_cv = ElasticNetCV(
alphas=alphas_a_tester,
l1_ratio=l1_ratios_a_tester,
cv=5, # validation croisée 5-fold
max_iter=10000
)

3. Entraînement
elastic_cv.fit(X_train _scaled, y_train _scaled )
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 1 : Utilisation de ElasticNetCV (validation croisée intégrée)
4. Meilleurs paramètres trouvés
Best_alpha = elastic_cv.alpha_
Rest_ratio = elastic_cv.l1_ratio_

5. Prédictions avec le meilleur modèle


pred_elastic_best = elastic_cv.predict(X_test _scaled )
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 2 : Utiliser GridSearchCV
Cette méthode permet de tester une grille complète de combinaisons.
# Import
from sklearn.model_selection import GridSearchCV
from sklearn.linear_model import ElasticNet

1. On définit la grille des paramètres à tester


param_grid = {
'alpha': [0.001, 0.01, 0.1, 1.0, 10.0],
'l1_ratio': [0.1, 0.3, 0.5, 0.7, 0.9]
}

# 2. Création du modèle ElasticNet de base


elastic = ElasticNet(max_iter=10000)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 2 : Utiliser GridSearchCV
3. Création du GridSearchCV
grid_search_elastic = GridSearchCV(
elastic,
param_grid,
cv=5,
scoring='r2'
)

4. Entraînement

grid_search_elastic.fit(X_train_scaled, y_train_scaled)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
Types de régularisation
3. Elastic Net (combinaison L1 + L2) : Choisir les paramètre de régularisation
Méthode 2 : Utiliser GridSearchCV
5. Affichage des meilleurs paramètres
Best_alpha = grid_search_elastic.best_params_['alpha’]
Best_ratio = grid_search_elastic.best_params_['l1_ratio’]
Best_score = grid_search_elastic.best_score_
# Meilleur score R² en validation croisée

6. Prédictions avec le meilleur modèle


pred_grid_elastic = grid_search_elastic.predict(X_test_scaled)
Régularisation en régression Qu’est-ce qu’un modèle de régression ?
 Impact sur la convergence et le choix du taux d’apprentissage

1. Ridge : le terme impose une borne supérieure sur pour la stabilité


: (en plus des conditions habituelles). En pratique, on peut utiliser le
même que sans régularisation, mais la convergence peut être plus lente.

2. Lasso : avec le sous-gradient simple, le pas doit être plus petit pour éviter les
oscillations autour de zéro. L’approche proximale est préférable.

3. Elastic Net : combine les deux contraintes.


Régularisation en régression Qu’est-ce qu’un modèle de régression ?
 Rappel : implémentations optimisées
from sklearn.linear_model import Ridge, Lasso, ElasticNet

ridge = Ridge(alpha=lam)
[Link](X_b, y)
#le gradient contient un terme linéaire , ce qui réduit exponentiellement les coefficients.

lasso = Lasso(alpha=lam)
[Link](X_b, y)
#le sous-gradient (ou l’opérateur proximal) ajoute un terme constant signe ,ce qui peut
annuler certains coefficients.

enet = ElasticNet(alpha=lam, l1_ratio=l1_ratio)


[Link](X_b, y)
#combine les deux effets.

Vous aimerez peut-être aussi