Régressions linéaires
généralisées (GLM)
Cours Pratique
La SG-SERVICE
2025-11-08
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 1 / 17
Introduction
Dans ce cours, nous abordons les modèles linéaires généralisés, souvent
désignés par l’acronyme GLM (generalized linear models en anglais).
Ces modèles constituent une extension directe des modèles de régression
linéaire multiple (LM), reposant sur la méthode des moindres carrés ordi-
naires. À la fin de ce cours, vous serez en mesure de :
Connaître les limites d’un LM classique ;
Connaître les avantages et les inconvénients d’un GLM ;
Connaître les conditions d’applications d’un GLM ;
Connaître les composantes de deux exemples de GLM ;
Connaître les formes de résidus avec un GLM ;
Comment vérifier l’ajustement d’un modèle GLM ;
Lancer un GLM dans R .
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 2 / 17
Connaître les limites d’un LM classique
La régression linéaire multiple (LM) présente plusieurs limites impor-
tantes. Tout d’abord, elle ne peut être appliquée que si la variable dépen-
dante analysée est continue et normalement distribuée, une fois les variables
indépendantes contrôlées. Cela signifie qu’elle ne convient pas pour mod-
éliser et prédire des variables binaires, multinomiales, de comptage, ordinales
ou des données anormalement distribuées. De plus, la régression LM sup-
pose que l’influence des variables indépendantes sur la variable dépendante
est uniquement linéaire. Ainsi, l’augmentation d’une unité de X entraîne
une augmentation (ou diminution) de 𝛼(coefficient de régression) unités
de Y , ce qui n’est pas toujours représentatif des phénomènes étudiés. Pour
dépasser ces contraintes, Nelder et Wedderburn (1972) ont proposé une
extension des modèles LM : les modèles linéaires généralisés (GLM).
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 3 / 17
Connaître les avantages et les inconvénients d’un GLM
Les avantages d’un GLM
Le modèle linéaire généralisé (GLM) permet de résoudre ces problèmes
ci-dessous en apportant des modifications significatives aux équations et
hypothèses du modèle linéaire classique (LM) :
Dans un GLM, la réponse ne doit pas être nécessairement une variable
continue ;
Dans un GLM, on ne suppose pas une relation linéaire ”directe” entre
Y et X. Au lieu de quoi, on suppose une hypothèse plus générale ;
L’homogénéité de la variance n’a pas besoin d’être satisfaite ;
Y n’a pas besoin d’être distribuée normalement, mais on suppose une
distribution qui fait partie d’une famille beaucoup plus générale connue
sous le nom de la famille exponentielle .
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 4 / 17
Connaître les avantages et les inconvénients d’un GLM
Les inconvénients d’un GLM
Ces avantages d’un GLM entrainent quelques “inconvénients” :
L’estimation d’un GLM ne peut pas se faire via la méthode des moin-
dres carrés ordinaire utilisée dans le cadre de la régression linéaire clas-
sique ;
Les coefficients deviennent, en général, plus difficiles à calculer et in-
terpréter ;
L’inférence se base sur des approximations valides uniquement pour de
grandes tailles d’échantillon (théorie asymptotique) et ne peut donc
être appliquée que dans un contexte où l’on juge que l’on dispose de
suffisamment d’observations ;
La visualisation, le diagnostic, l’analyse des résidus et l’analyse de la
qualité d’ajustement d’un modèle GLM ne sont pas toujours des sujets
faciles à traiter. On ne peut pas appliquer directement les outils clas-
siques .
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 5 / 17
Connaître les conditions d’applications d’un GLM
La famille des GLM englobe de (très) nombreux modèles du fait de la diver-
sité de distributions existantes et des fonctions de liens utilisables. Cepen-
dant, certaines combinaisons sont plus souvent utilisées que d’autres. Les
conditions d’application varient d’un modèle à l’autre, il existe cependant
quelques conditions d’application communes à tous ces modèles :
L’indépendance des observations (et donc des erreurs) ;
L’absence de valeurs aberrantes / fortement influentes ;
L’absence de multicolinéarité excessive entre les variables
indépendantes .
Ces trois conditions sont également valables pour les modèles LM également.
La distance de Cook peut ainsi être utilisée pour détecter les potentielles
valeurs aberrantes et le facteur d’inflation de la variance (VIF) pour détecter
la multicolinéarité.
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 6 / 17
Connaître les composantes de deux exemples de GLM
Modèle logistique binaire
La régression binaire modélise la probabilité de ”succès” pour une variable
de réponse binaire en fonction d’autres variables.
𝜋𝑖
𝑙𝑜𝑔(𝜋𝑖 ) = 𝑙𝑜𝑔( ) = 𝛼0 + 𝛼 ⋅ 𝑋𝑖
1 − 𝜋𝑖
Composante aléatoire : La distribution de la variable de réponse est
supposée suivre une loi binomiale avec un seul essai et une probabilité
de succès unique 𝐸(𝑌 ) = 𝜋 ;
Composante systématique : X vecteur de variables explicatives (peut
être continue, discrète, ordinale ou nominale) et est linéaire dans les
paramètres ;
Fonction de liaison : la log-odds ou la liaison logit 𝑔(𝜋) =
𝜋𝑖
𝑙𝑜𝑔( 1−𝜋 ), est utilisé .
𝑖
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 7 / 17
Connaître les composantes de deux exemples de GLM
Modèle de Poisson
Elle modélise la moyenne d’une variable de réponse discrète (de comptage)
en fonction d’un ensemble de variables explicatives.
𝑙𝑜𝑔(𝜆𝑖 ) = 𝛼0 + 𝛼 ⋅ 𝑋𝑖
Composante aléatoire : la répartition des 𝑌𝑖 est Poisson avec la
moyenne 𝜆𝑖 ;
Composante systématique : X vecteur des variables explicatives
(peut être continue, discrète , ordinale ou nominale) et est linéaire
dans les paramètres. Cela peut être étendu à de multiples variables de
transformations non linéaires ;
Fonction liaison : le lien logarithme est utilisé.
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 8 / 17
Connaître les formes de résidus avec un GLM
Pour un modèle de type GLM, les résidus traditionnels (également appelés
résidus naturels) sont peu informatifs lorsque la variable à modéliser est
binaire, multinomiale ou de comptage. Dans le contexte des GLM, nous
privilégions l’utilisation de trois autres types de résidus : les résidus de
Pearson, les résidus de déviance et les résidus simulés.
Les résidus de Pearson constituent une forme ajustée des résidus clas-
siques, obtenue en divisant les résidus naturels par la racine carrée de la
variance modélisée. Leur formule varie d’un modèle à l’autre, car l’expression
de la variance dépend de la distribution spécifique du modèle.
𝑦𝑖 −𝜇𝑖
Pour un modèle GLM gaussien, elle s’écrit : 𝑟𝑖 = 𝜎 ;
𝑦𝑖 −𝑝𝑖
Pour un modèle GLM de Bernoulli, elle s’écrit : 𝑟𝑖 = √𝑝𝑖 (1−𝑝𝑖 )
.
Avec 𝜇𝑖 et 𝑝𝑖 les préditions du modèle pour l’observation i.
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 9 / 17
Connaître les formes de résidus avec un GLM
Les résidus de déviance sont basés sur le concept de likelihood. La
vraisemblance (ou likelihood) d’un modèle correspond à la probabilité con-
jointe d’observer les données Y selon le modèle étudié. Plus cette valeur est
élevée, moins le modèle se trompe. Cette interprétation est inverse à celle
des résidus classiques, c’est pourquoi le log-likelihood est généralement
multiplié par −2 pour retrouver une interprétation intuitive. Ainsi, pour
chaque observation i, nous pouvons calculer : w
𝑑𝑖 = −2 ∗ 𝑙𝑜𝑔(𝑃 (𝑦𝑖 /𝑀𝑒 ))
avec 𝑑𝑖 le résidu de déviance et 𝑃 (𝑦𝑖 /𝑀𝑒 ) la probabilité d’avoir observé la
valeur 𝑦𝑖 selon le modèle étudié 𝑀𝑒 .
La somme de tous ces résidus est appelée la déviance totale du modèle.
𝑛
𝐷(𝑀𝑒 ) = ∑(−2 ∗ 𝑙𝑜𝑔(𝑃 (𝑦𝑖 /𝑀𝑒 )))
𝑖=1
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 10 / 17
Connaître les formes de résidus avec un GLM
La déviance est une mesure indiquant dans quelle mesure le modèle diffère
des données observées. Il est important de noter que la déviance n’a pas
d’interprétation directe par elle-même ; cependant, elle est utilisée pour
calculer des mesures d’ajustement des modèles GLM.
Les résidus simulés représentent une avancée récente dans le domaine des
GLM, offrant une définition et une interprétation harmonisée des résidus
pour tous les modèles GLM. Contrairement aux LM (modèles linéaires),
cette technique est plus complexe à mettre en œuvre pour les GLM, car la
forme attendue des résidus varie en fonction de la distribution choisie pour
modéliser Y. Une méthode efficace consiste à interpréter les graphiques des
résidus simulés, qui ont la particularité d’être identiquement distribués
quelle que soit la distribution du modèle GLM construit. Ces résidus simulés
sont compris entre 0 et 1.
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 11 / 17
Comment vérifier l’ajustement d’un modèle GLM
Il existe trois méthodes pour évaluer l’ajustement d’un modèle GLM :
Utiliser des mesures d’ajustement telles que l’AIC, le pseudo-R², la
déviance expliquée, etc ;
Comparer les distributions de la variable originale et des prédictions ;
Comparer les prédictions du modèle avec les valeurs originales.
Il est important de noter que vérifier la qualité d’ajustement d’un modèle
(c’est-à-dire son ajustement aux données originales) ne revient pas à vérifier
sa validité (respect des conditions d’application). Cependant, ces deux élé-
ments sont généralement liés, car un modèle mal ajusté a peu de chances
d’être valide, et inversement.
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 12 / 17
Lancer un GLM dans R
Dans R, les modèles linéaires généralisés (GLM) sont ajustés aux données
en utilisant la fonction glm() :
glm(formula, family = [Link](link = ”[Link]”), data, ...)
formula : sert à introduire la partie linéaire du modèle sous forme
d’une formule R ;
family : sert à indiquer la distribution et la fonction de lien. Par
exemple pour choisir une distribution binomiale avec un lien logit, il
faut écrire family = binomial(link = ”logit”) ;
data : sert à introduire le noms du [Link] contenant le jeux de
données à analyser.
Remarque : Pour qu’une opération arithmétique soit traduite de manière
conventionnelle, elle doit être mise dans la fonction I() . Par exemple y ∼
𝐼(𝑥 + 𝑧) est équivalente à y ∼ w où 𝑤 = 𝑥 + 𝑧 .
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 13 / 17
Lancer un GLM dans R
Nous allons vous présenter ici quelques exemples de script de modèles de
régression GLM :
Exemple Modèle Binomiale
La variable de réponse doit être binaire (ici, Vaccin 1=Oui et 0=Non).
glm(Vaccin ∼ Poids + Palu + Age + Hb, family = binomial(link =
”logit”), data = DATA)
Exemple Modèle Gamma
Pour ce modèle, la variable de réponse suit une distribution gamma :
glm(Age ∼ Poids + Palu + Hb , family = Gamma(link = ”log”), data =
DATA)
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 14 / 17
Lancer un GLM dans R
Exemple Modèle Gaussien
Pour ce modèle, la variable de réponse suit une distribution normale, souvent
utilisé pour les données continues :
glm( Age ∼ Poids + Palu + Taille + Hb, family = gaussian(link =
”identity”), data =DATA)
Exemple Modèle Poisson
La régression de Poisson est effectivement utilisée pour les données de comp-
tage, en supposant que la variance est égale à la moyenne.
glm(Age ∼ Poids + Palu + Taille + Hb , family = poisson(link = ”log”),
data =DATA)
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 15 / 17
Lancer un GLM dans R
Exemple Modèle Quasi-Poisson
Ce modèle est approprié pour les données de comptage avec sur-dispersion
(où la variance est supérieure à la moyenne) :
glm(Age ∼ Poids + Palu + Taille + Hb ,family = quasipoisson(link =
”log”), data = DATA)
Exemple Modèle Binomiale Négative
Ce modèle est aussi approprié pour les données de comptage avec sur-
dispersion (où la variance est supérieure à la moyenne) :
[Link](Age ∼ Poids + Palu + Taille + Hb, data = DATA)
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 16 / 17
𝑀 𝐸𝑅𝐶𝐼 𝑃 𝑂𝑈 𝑅 𝑉 𝑂𝑇 𝑅𝐸 𝐴𝑇 𝑇 𝐸𝑁 𝑇 𝐼𝑂𝑁 !!!
Cours Pratique (La SG-SERVICE) Régressions linéaires généralisées (GLM) 2025-11-08 17 / 17