0% ont trouvé ce document utile (0 vote)
25 vues20 pages

Prédiction du diabète par Machine Learning

Ce document présente une étude sur la prédiction du risque de diabète de type 2 en utilisant des modèles de Machine Learning appliqués au Pima Indians Diabetes Dataset. L'étude reproduit et étend une recherche antérieure, mettant en avant le modèle XGBoost comme le plus performant avec une accuracy de 85% et une AUC-ROC de 91%. En plus de la reproduction des résultats, le projet se concentre sur l'optimisation des modèles et l'évaluation de leur robustesse sur un dataset complémentaire.

Transféré par

emna guefrech
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
25 vues20 pages

Prédiction du diabète par Machine Learning

Ce document présente une étude sur la prédiction du risque de diabète de type 2 en utilisant des modèles de Machine Learning appliqués au Pima Indians Diabetes Dataset. L'étude reproduit et étend une recherche antérieure, mettant en avant le modèle XGBoost comme le plus performant avec une accuracy de 85% et une AUC-ROC de 91%. En plus de la reproduction des résultats, le projet se concentre sur l'optimisation des modèles et l'évaluation de leur robustesse sur un dataset complémentaire.

Transféré par

emna guefrech
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

École Supérieure Privée d’Ingénierie et de Technologies

4ème année DATA


Machine Learning et Optimisation

A.U : 2025/2026
Encadrant : Bilel CHARFI

Prédiction du risque de diabète de type 2 par


Machine Learning et Optimisation :
Reproduction et extension d’une étude scientifique
sur le Pima Indians Diabetes Dataset

Auteurs :
Mohamed Seifeddine Ouarag (Groupe6)
Jihed Alfi (Groupe 6)
Eya Garrab (Groupe 6)
Emna Guefrech (Groupe 6)
Aziz Abrougui (Groupe 6)

20 décembre 2025
Résumé

Le diabète de type 2 constitue un problème majeur de santé publique à l’échelle mondiale,


avec une prévalence en constante augmentation et des conséquences importantes sur les systèmes
de soins. Dans ce contexte, la prédiction précoce du risque de diabète représente un enjeu crucial
pour la prévention et l’intervention médicale. Ce travail s’inscrit dans le cadre de la reproduction
et de l’extension de l’étude proposée par Zhang (2025), qui compare les performances de plusieurs
modèles de Machine Learning appliqués au Pima Indians Diabetes Dataset.
L’étude originale évalue quatre modèles — régression logistique, Random Forest, Support Vec-
tor Machine (SVM) et XGBoost — à l’aide de métriques adaptées au domaine médical, telles que
l’accuracy, la sensibilité, la spécificité, le F1-score et l’AUC-ROC. Les résultats montrent que le
modèle XGBoost surpasse les autres approches, avec une accuracy de 85% et une AUC-ROC de
91%, tout en identifiant le glucose, l’indice de masse corporelle (BMI) et l’âge comme les variables
les plus influentes.
Dans ce rapport, nous reproduisons cette étude sur le dataset PIDD, puis approfondissons la
dimension optimisation des modèles, avant d’étendre l’analyse à un dataset complémentaire afin
d’évaluer la robustesse des approches proposées.
Table des matières
Résumé 1

1 Introduction et contexte général 4


1.1 Contexte médical et scientifique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
1.2 Contexte du projet . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
1.3 Objectifs du travail . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5

2 Présentation de l’article de référence et des données 5


2.1 Présentation de l’article de Zhang (2025) . . . . . . . . . . . . . . . . . . . . . . . . 5
2.2 Pipeline global décrit dans l’article . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
2.3 Jeux de données . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
2.3.1 Dataset principal : Pima Indians Diabetes Dataset (PIDD) . . . . . . . . . . 6

3 Reproduction de l’étude sur le PIDD 6


3.1 Prétraitement des données . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
3.2 Séparation apprentissage / test . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.3 Modèles entraînés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.3.1 Régression Logistique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.3.2 Random Forest . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.3.3 SVM . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.3.4 XGBoost . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.4 Protocole expérimental . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
3.5 Résultats et comparaison avec l’article . . . . . . . . . . . . . . . . . . . . . . . . . 8

4 Étude d’optimisation approfondie 9


4.1 Machine Learning et optimisation . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
4.2 Modèle principal choisi pour l’étude détaillée . . . . . . . . . . . . . . . . . . . . . . 9
4.2.1 Formulation du problème . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
4.3 Algorithmes d’optimisation étudiés . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
4.3.1 Descente de gradient batch (Gradient Descent) . . . . . . . . . . . . . . . . . 9
4.3.2 Descente de gradient stochastique et mini-batch SGD . . . . . . . . . . . . . 10
4.3.3 Adam (Adaptive Moment Estimation) . . . . . . . . . . . . . . . . . . . . . 10
4.4 Implémentation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
4.5 Courbes de convergence . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
4.6 Impact des hyperparamètres . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12

2
5 Extension au dataset complémentaire 13
5.1 Prétraitement et difficultés spécifiques . . . . . . . . . . . . . . . . . . . . . . . . . 13
5.2 Pipeline Machine Learning appliqué . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
5.3 Résultats sur le dataset complémentaire . . . . . . . . . . . . . . . . . . . . . . . . 14
5.4 Comparaison PIDD vs dataset complémentaire . . . . . . . . . . . . . . . . . . . . . 15

6 Synthèse critique 16
6.1 Limites des approches utilisées . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
6.2 Points forts et faibles des modèles . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
6.3 Points forts et faibles des algorithmes d’optimisation . . . . . . . . . . . . . . . . . 17
6.4 Pistes d’amélioration . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

7 Conclusion 18
1 Introduction et contexte général
1.1 Contexte médical et scientifique
Le diabète de type 2 (DT2) est une maladie métabolique chronique caractérisée par une résis-
tance à l’insuline et une hyperglycémie persistante. Lorsqu’il n’est pas détecté et pris en charge
précocement, il peut entraîner des complications graves, notamment des maladies cardiovascu-
laires, une insuffisance rénale, des atteintes neurologiques (neuropathies) et des troubles de la
vision. Sa prévalence est en augmentation à l’échelle mondiale, ce qui en fait un enjeu majeur de
santé publique en raison de son impact humain et économique sur les systèmes de soins.
Dans ce contexte, la prédiction du risque de diabète à partir de données cliniques ou d’indi-
cateurs de santé constitue un outil important pour favoriser la prévention et la prise de décision
médicale. En effet, identifier tôt les individus à risque permet de proposer des interventions ciblées
(suivi médical, modification du mode de vie, prévention des complications). Les méthodes statis-
tiques classiques, telles que la régression logistique, sont historiquement utilisées pour ce type de
prédiction, mais elles peuvent être limitées lorsqu’il s’agit de capturer des relations non linéaires
complexes. Les techniques de Machine Learning offrent des alternatives capables de modéliser des
interactions plus riches entre variables et d’améliorer la performance prédictive, notamment lorsque
les données sont hétérogènes ou déséquilibrées.

1.2 Contexte du projet


Ce projet s’inscrit dans le module Machine Learning et Optimisation et vise à reproduire et
analyser une étude scientifique récente portant sur la prédiction du diabète de type 2. L’article
de référence, Zhang (2025), compare quatre modèles de Machine Learning appliqués au Pima
Indians Diabetes Dataset (PIDD) : la régression logistique, le Random Forest, le Support Vector
Machine (SVM) et XGBoost. L’étude évalue ces modèles à l’aide de métriques adaptées au contexte
médical (accuracy, sensibilité, spécificité, F1-score, AUC-ROC) et met en évidence la supériorité
de XGBoost ainsi que l’importance de variables telles que le glucose, le BMI et l’âge.
Notre travail consiste d’abord à mettre en place un pipeline expérimental reproductible sur le
PIDD (prétraitement, séparation apprentissage/test, entraînement, validation et évaluation) afin
de comparer nos résultats à ceux de l’article. Ensuite, le projet met un accent particulier sur la
dimension optimisation, à travers l’étude de la convergence, de la stabilité et de la sensibilité aux
hyperparamètres, en analysant notamment l’impact des choix de prétraitement sur l’apprentissage.
Enfin, l’étude est étendue à un dataset complémentaire (CDC BRFSS) afin d’évaluer la robustesse
des approches et de comprendre comment le changement de contexte (population, type de variables,
déséquilibre des classes, taille de l’échantillon) influence les performances et le comportement des
modèles.

4
1.3 Objectifs du travail
Les objectifs principaux de ce projet sont les suivants :
— Comprendre et synthétiser l’article de Zhang (2025) : problématique, méthodologie, modèles
utilisés et résultats.
— Reproduire un pipeline complet de Machine Learning sur le PIDD : prétraitement, sépa-
ration apprentissage/test, entraînement, validation et comparaison des performances des
modèles.
— Étudier et comparer des algorithmes d’optimisation et leurs effets sur l’apprentissage :
convergence de la fonction coût, stabilité, sensibilité aux hyperparamètres et influence du
prétraitement.
— Étendre l’étude à un dataset complémentaire (CDC BRFSS) afin de comparer les perfor-
mances entre deux contextes de données et analyser les difficultés rencontrées (déséquilibre
des classes, nature des variables, distribution des données).

2 Présentation de l’article de référence et des données


2.1 Présentation de l’article de Zhang (2025)
L’article de Zhang (2025) s’inscrit dans le contexte de la prédiction du risque de diabète de type
2 (T2D), une pathologie chronique dont la prévalence ne cesse d’augmenter à l’échelle mondiale.
L’auteur souligne que le diabète de type 2 constitue un enjeu majeur de santé publique, en raison
de ses complications sévères telles que les maladies cardiovasculaires, l’insuffisance rénale et les
neuropathies, ainsi que de son impact économique sur les systèmes de santé.
L’objectif principal de l’étude est de comparer les performances de quatre modèles de Machine
Learning largement utilisés ; la régression logistique, le Random Forest, le Support Vector Machine
(SVM) et XGBoost pour la prédiction du risque de diabète à partir du Pima Indians Diabetes
Dataset. Contrairement aux approches statistiques traditionnelles, l’étude met en avant la capacité
des modèles d’apprentissage automatique à capturer des relations non linéaires complexes entre
les variables cliniques et le diagnostic du diabète.
L’auteur accorde une attention particulière à l’évaluation rigoureuse des modèles à l’aide de
plusieurs métriques adaptées aux problématiques médicales, notamment l’accuracy, la sensibilité
(recall), la spécificité, la précision, le F1-score et l’AUC-ROC. L’étude vise également à analyser
l’importance des variables afin d’identifier les facteurs cliniques les plus influents dans la prédiction
du diabète, et à discuter les implications potentielles pour la prise de décision clinique.

2.2 Pipeline global décrit dans l’article


Z hang (2025) adopte un pipeline de Machine Learning structuré et reproductible, comprenant
plusieurs étapes successives. Dans un premier temps, les données sont prétraitées afin de corriger

5
les incohérences biologiques et de garantir une qualité suffisante pour l’apprentissage des modèles.
Ensuite, le dataset est séparé en ensembles d’apprentissage et de test afin d’évaluer la capacité de
généralisation des modèles.
Les différents modèles de Machine Learning sont ensuite entraînés à l’aide d’une procédure de
validation croisée combinée à une recherche par grille des hyperparamètres. Cette approche permet
d’optimiser les performances des modèles tout en limitant le surapprentissage. Enfin, les perfor-
mances sont évaluées à l’aide de plusieurs métriques quantitatives, puis comparées afin d’identifier
le modèle le plus performant pour la prédiction du diabète de type 2

2.3 Jeux de données


2.3.1 Dataset principal : Pima Indians Diabetes Dataset (PIDD)

Le Pima Indians Diabetes Dataset est un jeu de données tabulaire largement utilisé comme
benchmark pour les tâches de prédiction du diabète. Il contient 768 observations, chacune corres-
pondant à une patiente de sexe féminin âgée d’au moins 21 ans. Chaque observation est décrite
par huit variables explicatives et une variable cible binaire indiquant la présence ou l’absence d’un
diabète de type 2.
Les variables explicatives incluent des informations cliniques et démographiques telles que le
nombre de grossesses, le taux de glucose plasmatique, la pression artérielle diastolique, l’épaisseur
du pli cutané, le niveau d’insuline, l’indice de masse corporelle (BMI), la fonction de pedigree
diabétique et l’âge. La variable cible prend la valeur 1 pour les patients diabétiques et 0 pour les
patients non diabétiques.
Le dataset présente un déséquilibre modéré des classes, avec environ 34,9% de patients diabé-
tiques et 65,1% de patients non diabétiques. Cette caractéristique reflète une situation réaliste en
pratique clinique et constitue un défi pour l’entraînement des modèles, notamment en termes de
sensibilité

3 Reproduction de l’étude sur le PIDD


3.1 Prétraitement des données
Dans le notebook, une phase de prétraitement est appliquée au Pima Indians Diabetes Data-
set afin de garantir la qualité des données avant l’apprentissage des modèles. Certaines variables
cliniques telles que le glucose, l’insuline, l’indice de masse corporelle (BMI) et la pression artérielle
contiennent des valeurs nulles biologiquement incohérentes. Conformément à la méthodologie dé-
crite par Zhang (2025), ces valeurs nulles sont traitées comme des valeurs manquantes.
Les valeurs manquantes sont ensuite imputées à l’aide de la médiane de chaque variable, un
choix robuste face aux distributions asymétriques observées dans les données. L’ensemble des
variables numériques est ensuite normalisé afin de les ramener dans un intervalle comparable, ce

6
qui est particulièrement important pour les modèles sensibles à l’échelle des données, comme la
régression logistique et le SVM.

3.2 Séparation apprentissage / test


Le dataset est divisé en un ensemble d’apprentissage et un ensemble de test selon une proportion
de 70% pour l’entraînement et 30% pour l’évaluation. Une stratification est appliquée lors de cette
séparation afin de préserver la distribution des classes dans les deux sous-ensembles, compte tenu
du déséquilibre modéré entre patients diabétiques et non diabétiques.
Ce choix est cohérent avec celui de l’étude de référence et permet une comparaison pertinente
des résultats obtenus.

3.3 Modèles entraînés


3.3.1 Régression Logistique

La régression logistique est utilisée comme modèle de référence en raison de sa simplicité et de


son interprétabilité. Elle repose sur une fonction sigmoïde appliquée à une combinaison linéaire
des variables explicatives et est optimisée à l’aide d’une fonction de perte logistique.

3.3.2 Random Forest

Le modèle Random Forest est implémenté afin de capturer des relations non linéaires entre
les variables. Il repose sur un ensemble d’arbres de décision entraînés sur des sous-échantillons
aléatoires des données et des variables, ce qui permet de réduire le surapprentissage et d’améliorer
la robustesse des prédictions.

3.3.3 SVM

Le Support Vector Machine est utilisé pour construire une frontière de décision maximisant la
marge entre les classes. Dans le notebook, une attention particulière est portée à l’optimisation
des hyperparamètres du SVM, notamment le paramètre de régularisation et le choix du noyau.

3.3.4 XGBoost

Le modèle XGBoost, basé sur le gradient boosting, est implémenté pour exploiter sa capacité
à modéliser des interactions complexes entre variables et à gérer efficacement le déséquilibre des
classes. Ce modèle est reconnu dans l’étude de Zhang comme le plus performant sur le PIDD.

3.4 Protocole expérimental


Le notebook met en œuvre une recherche d’hyperparamètres combinée à une validation croisée
afin d’optimiser les performances des modèles. Les performances sont évaluées à l’aide de métriques

7
adaptées au contexte médical, notamment l’accuracy et l’AUC-ROC, qui permettent de mesurer
respectivement la performance globale et la capacité de discrimination des modèles.

3.5 Résultats et comparaison avec l’article


Les résultats obtenus dans le notebook sont comparés à ceux rapportés par Zhang (2025). De
manière générale, les performances observées suivent les mêmes tendances que dans l’étude de
référence : le modèle XGBoost obtient les meilleurs scores en termes d’accuracy et d’AUC-ROC,
tandis que la régression logistique présente des performances plus modestes mais stables.
Les légères différences observées entre les résultats peuvent s’expliquer par des variations dans
le prétraitement, les choix d’hyperparamètres ou l’aléa introduit lors de la séparation des données.
Cette comparaison valide néanmoins la reproductibilité globale de l’étude de Zhang sur le dataset
PIDD

Table 1 – Performances des modèles sur le PIDD – Pipeline A (MinMax)


Modèle Accuracy Precision Recall F1-score
Logistic Regression 0.7489 0.6292 0.6914 0.6588
Random Forest 0.7489 0.7255 0.4568 0.5606
SVM 0.7186 0.6429 0.4444 0.5255
XGBoost 0.7403 0.6667 0.5185 0.5833

Table 2 – Performances des modèles sur le PIDD – Pipeline B (StandardScaler)


Modèle Accuracy Precision Recall F1-score
Logistic Regression 0.7532 0.6364 0.6914 0.6627
Random Forest 0.7489 0.7255 0.4568 0.5606
SVM 0.7273 0.6552 0.4691 0.5468
XGBoost 0.7403 0.6667 0.5185 0.5833

Table 3 – Performances des modèles sur le PIDD – Pipeline C (Yeo-Johnson)


Modèle Accuracy Precision Recall F1-score
Logistic Regression 0.7273 0.6406 0.5062 0.5655
Random Forest 0.7489 0.7255 0.4568 0.5606
SVM 0.7273 0.6364 0.5185 0.5714
XGBoost 0.7403 0.6667 0.5185 0.5833

8
4 Étude d’optimisation approfondie
4.1 Machine Learning et optimisation
Le notebook consacre une partie spécifique à l’étude du lien entre Machine Learning et opti-
misation. L’apprentissage des modèles repose sur la minimisation d’une fonction de coût, dont la
forme dépend du modèle utilisé. Le choix de l’algorithme d’optimisation influence directement la
vitesse de convergence, la stabilité de l’apprentissage et la qualité de la solution finale.

4.2 Modèle principal choisi pour l’étude détaillée


Dans le notebook, l’étude d’optimisation est principalement menée sur le Support Vector Ma-
chine (SVM), qui constitue un modèle pertinent pour analyser l’impact des algorithmes d’optimi-
sation et des hyperparamètres sur les performances.

4.2.1 Formulation du problème

Le problème d’optimisation du SVM consiste à trouver l’hyperplan maximisant la marge entre


les classes, tout en pénalisant les erreurs de classification à l’aide d’un terme de régularisation. Ce
compromis est contrôlé par des hyperparamètres qui influencent fortement les performances du
modèle.

4.3 Algorithmes d’optimisation étudiés


Dans le cadre de cette étude, plusieurs algorithmes d’optimisation ont été analysés afin de
comprendre leur impact sur l’apprentissage des modèles de Machine Learning, en particulier sur
la vitesse de convergence, la stabilité de l’optimisation et la qualité de la solution obtenue. Ces
algorithmes visent à minimiser une fonction de coût associée au modèle, en ajustant itérativement
les paramètres afin de réduire l’erreur de prédiction.
Trois familles d’algorithmes d’optimisation ont été étudiées : la descente de gradient classique
(batch), la descente de gradient stochastique et ses variantes, ainsi qu’un algorithme adaptatif de
type Adam.

4.3.1 Descente de gradient batch (Gradient Descent)

La descente de gradient batch est une méthode d’optimisation déterministe qui met à jour les
paramètres du modèle en utilisant le gradient calculé sur l’ensemble des données d’apprentissage.
À chaque itération, les paramètres sont ajustés dans la direction opposée au gradient de la fonction
coût, selon la règle suivante :

θ(t+1) = θ(t) − η∇J(θ(t) )

9

η>0 représente le taux d’apprentissage (learning rate) et ∇J(θ) le gradient de la fonction
coût. Cette méthode présente une convergence stable pour des fonctions coût convexes, mais peut
s’avérer coûteuse en temps de calcul et lente lorsque le nombre d’observations est élevé.

4.3.2 Descente de gradient stochastique et mini-batch SGD

La descente de gradient stochastique (SGD) constitue une alternative visant à accélérer l’opti-
misation. Contrairement à la méthode batch, le gradient est ici estimé à partir d’un seul échantillon
ou d’un sous-ensemble de données (mini-batch). La mise à jour des paramètres s’écrit alors :

θ(t+1) = θ(t) − η∇JBt (θ(t) )

où Bt désigne le mini-batch utilisé à l’itération t. Cette approche introduit du bruit dans l’es-
timation du gradient, ce qui peut ralentir la convergence vers le minimum exact, mais permet
souvent d’atteindre plus rapidement une solution satisfaisante et d’échapper à certains plateaux
de la fonction coût.

4.3.3 Adam (Adaptive Moment Estimation)

Adam est un algorithme d’optimisation adaptatif combinant les avantages des méthodes de type
momentum et RMSProp. Il repose sur l’estimation du premier et du second moment du gradient
afin d’adapter automatiquement le taux d’apprentissage pour chaque paramètre. Les moments sont
définis par :

mt = β1 mt−1 + (1 − β1 )∇J(θt )

vt = β2 vt−1 + (1 − β2 )(∇J(θt ))2

Afin de corriger le biais introduit par l’initialisation, des estimations corrigées sont utilisées :

mt vt
m̂t = , v̂t =
1 − β1t 1 − β2t
La mise à jour finale des paramètres s’effectue alors selon :

η
θt+1 = θt − √ m̂t
v̂t + ϵ
où B1 et B2 sont des coefficients de décroissance exponentielle et ϵ un terme de stabilité nu-
mérique. Adam est particulièrement apprécié pour sa convergence rapide et sa faible sensibilité au
choix du taux d’apprentissage.

10
4.4 Implémentation
L’implémentation des modèles et des algorithmes d’optimisation étudiés dans ce projet repose
sur l’utilisation de bibliothèques standards de Machine Learning en Python, reconnues pour leur
fiabilité, leurs performances et leur large adoption dans la communauté scientifique. En particulier,
les bibliothèques NumPy, pandas et scikit-learn ont été utilisées pour le prétraitement des données,
l’entraînement des modèles et l’évaluation des performances.
Les algorithmes d’optimisation sont principalement intégrés via les implémentations natives
fournies par scikit-learn, qui offrent différents solveurs optimisés et adaptés aux modèles étudiés.
Pour la régression logistique, plusieurs solveurs ont été explorés afin d’analyser l’impact du choix
de l’algorithme d’optimisation sur la convergence et les performances. Le solveur LBFGS, basé
sur une approximation quasi-Newtonienne, a été privilégié pour sa rapidité de convergence et sa
stabilité sur des jeux de données de taille modérée comme le Pima Indians Diabetes Dataset. En
complément, des solveurs de type SGD ont été utilisés pour étudier le comportement de la descente
de gradient stochastique et analyser l’influence du taux d’apprentissage et du nombre d’itérations.
Pour les modèles plus complexes, tels que le Support Vector Machine et XGBoost, l’optimisation
repose sur des algorithmes internes spécifiques à chaque méthode. Dans le cas du SVM, les solveurs
intégrés permettent de résoudre efficacement le problème d’optimisation quadratique associé à la
maximisation de la marge, tout en gérant le compromis entre complexité du modèle et erreurs de
classification à l’aide du paramètre de régularisation. Pour XGBoost, l’optimisation est réalisée de
manière itérative par gradient boosting, avec un contrôle précis des hyperparamètres tels que le
taux d’apprentissage, la profondeur des arbres et le nombre d’estimateurs.
Le choix de ces implémentations permet de se concentrer sur l’analyse comparative des al-
gorithmes d’optimisation et de leurs hyperparamètres, plutôt que sur les détails bas niveau de
l’implémentation. Cette approche garantit à la fois la reproductibilité des expériences et la cohé-
rence des résultats obtenus, tout en s’inscrivant dans les bonnes pratiques actuelles du Machine
Learning expérimental.

4.5 Courbes de convergence


Les courbes de convergence permettent d’analyser le comportement des algorithmes d’optimi-
sation au cours de l’apprentissage, en étudiant l’évolution de la fonction de coût ainsi que des
performances en fonction du nombre d’époques. Dans cette étude, la convergence est analysée
pour un modèle entraîné par descente de gradient stochastique (SGD) sur le Pima Indians Dia-
betes Dataset, en comparant trois stratégies de prétraitement des données : normalisation Min-Max
(Pipeline A), standardisation (Pipeline B) et transformation de Yeo-Johnson (Pipeline C).
La première ligne de la figure présente l’évolution de la log-loss pour les ensembles d’entraîne-
ment et de test. Pour les trois pipelines, une diminution rapide de la fonction de coût est observée
lors des premières époques, indiquant une convergence efficace du modèle. Le pipeline utilisant la
transformation Yeo-Johnson converge le plus rapidement vers une valeur de loss minimale, avec

11
une stabilisation dès les premières itérations. Le pipeline basé sur la standardisation présente éga-
lement une convergence rapide et stable, tandis que le pipeline Min-Max montre une convergence
plus progressive, nécessitant davantage d’époques pour atteindre un plateau.
La seconde ligne de la figure illustre l’évolution de l’accuracy au cours de l’apprentissage. Pour
les trois pipelines, l’accuracy d’entraînement augmente rapidement avant de se stabiliser, traduisant
une phase d’apprentissage efficace suivie d’un régime stationnaire. Les performances sur l’ensemble
de test suivent une tendance similaire, bien que légèrement inférieures à celles de l’entraînement,
ce qui est cohérent avec un comportement de généralisation raisonnable.
L’écart limité entre les courbes d’entraînement et de test suggère une absence de surappren-
tissage marqué. Ces résultats mettent en évidence l’influence du prétraitement des données sur la
vitesse de convergence et la stabilité de l’optimisation, tout en confirmant la capacité du modèle
optimisé par SGD à converger vers une solution stable.

4.6 Impact des hyperparamètres


L’analyse conjointe des courbes de convergence de la loss et de l’accuracy met en évidence un
lien direct entre les choix de prétraitement, l’optimisation et les performances finales du modèle.
Les pipelines B (standardisation) et C (Yeo-Johnson) présentent une convergence plus rapide et
plus stable que le pipeline A (Min-Max), ce qui s’explique par une meilleure mise à l’échelle des
variables et une distribution plus favorable à l’optimisation par descente de gradient.
Le pipeline C, basé sur la transformation de Yeo-Johnson, obtient les valeurs de loss les plus
faibles et une accuracy stable sur l’ensemble de test, indiquant une meilleure capacité de généra-
lisation. À l’inverse, le pipeline Min-Max, bien qu’efficace, montre une convergence plus lente et
une variabilité légèrement plus importante au cours des premières époques.
Ces observations soulignent l’importance des étapes de prétraitement dans les processus d’op-
timisation en Machine Learning. Un prétraitement adapté facilite la convergence des algorithmes
de descente de gradient, réduit la sensibilité aux hyperparamètres tels que le taux d’apprentissage
et améliore la stabilité globale de l’apprentissage. Ainsi, l’optimisation ne dépend pas uniquement
de l’algorithme choisi, mais également de la qualité de la représentation des données en entrée.

12
Figure 1 – Courbes de convergence des algorithmes d’optimisation .

5 Extension au dataset complémentaire


5.1 Prétraitement et difficultés spécifiques
L’extension de l’étude à un dataset complémentaire permet d’évaluer la robustesse des ap-
proches développées sur le Pima Indians Diabetes Dataset (PIDD) dans un contexte de données
différent. Contrairement au PIDD, le dataset complémentaire présente des caractéristiques spéci-
fiques qui nécessitent des adaptations au niveau du prétraitement.
Certaines variables peuvent être de nature catégorielle ou présenter des distributions fortement
asymétriques, ce qui impose des étapes d’encodage et de transformation appropriées avant l’en-
traînement des modèles. Lorsque des variables catégorielles sont présentes, un encodage adapté est
appliqué afin de les rendre exploitables par les algorithmes de Machine Learning. Par ailleurs, la
présence de bruit et de valeurs manquantes peut affecter la qualité de l’apprentissage et requiert
des stratégies de nettoyage similaires à celles mises en œuvre sur le PIDD.
Une difficulté majeure concerne le déséquilibre potentiel des classes, parfois plus prononcé que
dans le PIDD. Ce déséquilibre peut conduire à des modèles biaisés en faveur de la classe majoritaire
et impacter négativement des métriques telles que la sensibilité. Enfin, la taille du dataset et la
nature des variables influencent la stabilité de l’optimisation et la vitesse de convergence, rendant
le prétraitement particulièrement déterminant dans ce contexte.

13
5.2 Pipeline Machine Learning appliqué
Le pipeline de Machine Learning appliqué au dataset complémentaire reprend les grandes étapes
définies pour le PIDD afin de garantir une comparaison cohérente. Il comprend successivement le
prétraitement des données, la séparation en ensembles d’apprentissage et de test avec stratification,
l’entraînement du modèle principal et l’évaluation des performances.
Dans un souci de continuité avec la partie optimisation, le modèle principal étudié précédem-
ment est réutilisé sur le dataset complémentaire. Ce choix permet d’analyser l’impact du chan-
gement de données indépendamment du choix du modèle. Les algorithmes d’optimisation et les
stratégies de prétraitement validés sur le PIDD sont appliqués autant que possible, tout en ajustant
certains hyperparamètres afin de tenir compte des spécificités du nouveau dataset.
Cette approche garantit une méthodologie expérimentale homogène et facilite l’interprétation
des différences de performances observées entre les deux jeux de données.

5.3 Résultats sur le dataset complémentaire


Les performances obtenues sur le dataset complémentaire sont évaluées à l’aide de métriques
adaptées à la prédiction du diabète, notamment l’accuracy, la précision, le rappel, le F1-score et
l’AUC-ROC. Les résultats sont synthétisés dans des tableaux et complétés par des figures illustrant
le comportement des modèles.
De manière générale, les scores obtenus sur le dataset complémentaire sont légèrement inférieurs
à ceux observés sur le PIDD. Cette diminution s’explique par la complexité accrue des données, la
possible présence de bruit et un déséquilibre des classes plus marqué. Néanmoins, le modèle conserve
des performances stables et cohérentes, indiquant une capacité de généralisation satisfaisante.
Ces résultats confirment que les modèles entraînés ne sont pas excessivement spécialisés au
dataset initial, tout en soulignant l’influence déterminante du contexte des données sur les perfor-
mances finales.

14
Figure 2 – Courbes de convergence CDC BRFSS .

5.4 Comparaison PIDD vs dataset complémentaire

Table 4 – Comparaison PIDD vs CDC BRFSS et différence de performance


Métrique PIDD CDC BRFSS Différence
Accuracy 0.7403 0.8467 +0.1064
F1-score 0.5775 0.2014 -0.3761
AUC-ROC 0.8478 0.8065 -0.0413

On observe une accuracy plus élevée sur le dataset CDC BRFSS, mais un F1-score nettement
plus faible. Ce comportement est typique des contextes à fort déséquilibre de classes : un modèle
peut obtenir une bonne accuracy en favorisant la classe majoritaire, tout en identifiant mal la
classe minoritaire (ce qui dégrade fortement le F1-score). L’AUC-ROC reste relativement élevée
dans les deux cas, indiquant une capacité de discrimination correcte, mais légèrement inférieure
sur CDC BRFSS.

15
Figure 3 – COMPARAISON DE LA CONVERGENCE : PIMA vs CDC BRFSS .

6 Synthèse critique
6.1 Limites des approches utilisées
Plusieurs limites doivent être considérées dans l’interprétation des résultats. Tout d’abord, la
qualité et la nature des données influencent fortement les performances des modèles. Le dataset
PIDD est de taille relativement réduite (768 observations) et concerne une population spécifique
(femmes Pima âgées de 21 ans ou plus), ce qui limite la généralisation des conclusions à d’autres
populations. De plus, certaines variables contiennent des valeurs biologiquement incohérentes (zé-
ros) qui doivent être traitées comme des valeurs manquantes ; le choix de l’imputation (médiane)
reste une approximation pouvant introduire un biais.
Concernant le dataset complémentaire (CDC BRFSS), la taille est beaucoup plus grande mais
la nature des variables est différente (indicateurs comportementaux et de santé auto-déclarés). Cela
peut introduire du bruit de mesure, des biais de déclaration et des variables moins directement
liées à la physiopathologie du diabète par rapport aux mesures biologiques du PIDD. Par ailleurs,
la comparaison directe des performances entre PIDD et CDC BRFSS doit être interprétée avec
prudence, car les deux jeux de données ne décrivent pas le diabète de la même manière (features,
population, contexte de collecte).
Une autre limite concerne la validation expérimentale : même si une validation croisée et une

16
recherche d’hyperparamètres ont été réalisées, les performances peuvent varier selon la partition
des données, la stratégie de prétraitement et certains choix d’implémentation. Enfin, la robustesse
des modèles face à un déséquilibre de classes plus marqué (notamment sur CDC BRFSS) reste un
point sensible, comme le suggère la baisse du F1-score malgré une accuracy élevée.

6.2 Points forts et faibles des modèles


Les modèles étudiés présentent des compromis différents. La régression logistique est un modèle
simple, rapide à entraîner et facilement interprétable, ce qui constitue un avantage important en
contexte médical. Elle fournit des résultats souvent stables, mais sa capacité de modélisation est
limitée lorsque la relation entre variables et cible est non linéaire.
Le Random Forest permet de capturer des relations non linéaires et offre généralement une
bonne robustesse au bruit, avec une résistance relative au surapprentissage grâce à l’agrégation
d’arbres. Cependant, son interprétabilité est plus faible et son coût computationnel peut augmenter
avec le nombre d’arbres et la profondeur maximale.
Le SVM est performant dans des contextes où les classes sont séparables avec une marge élevée,
notamment avec des noyaux non linéaires. Il est toutefois sensible au choix des hyperparamètres
(déséquilibre, C, γ, type de noyau) et peut devenir coûteux sur des datasets très volumineux.
Enfin, XGBoost est particulièrement efficace pour capturer des interactions complexes et offre
souvent les meilleures performances prédictives. Néanmoins, il nécessite un réglage fin des hyper-
paramètres et sa complexité réduit l’interprétabilité directe, ce qui peut constituer une limite pour
l’explication des décisions en milieu clinique.

6.3 Points forts et faibles des algorithmes d’optimisation


L’étude de l’optimisation met en évidence que la convergence et la stabilité dépendent à la fois
de l’algorithme utilisé et du prétraitement appliqué aux données. La descente de gradient batch
offre une convergence stable mais peut être lente et coûteuse lorsque le nombre d’échantillons aug-
mente. À l’inverse, le mini-batch SGD accélère l’apprentissage mais introduit un bruit stochastique
pouvant entraîner des oscillations de la fonction coût et une sensibilité plus forte au choix du taux
d’apprentissage η.
Les méthodes adaptatives telles qu’Adam améliorent généralement la vitesse de convergence et
réduisent la sensibilité au choix du taux d’apprentissage, grâce à l’adaptation automatique du pas
pour chaque paramètre. Toutefois, elles peuvent parfois converger vers des solutions légèrement
différentes de celles obtenues par des méthodes plus classiques, et leur comportement théorique
peut être plus difficile à analyser.
Enfin, les résultats montrent que la convergence n’est pas uniquement une question d’algo-
rithme : le prétraitement joue un rôle déterminant. Les transformations (standardisation, Yeo-
Johnson) peuvent rendre l’optimisation plus efficace en améliorant l’échelle et la distribution des
variables, ce qui réduit les difficultés numériques et stabilise l’apprentissage.

17
6.4 Pistes d’amélioration
Plusieurs améliorations peuvent être envisagées pour renforcer la qualité et la robustesse de
l’approche. Sur le plan du prétraitement, l’utilisation de méthodes plus avancées d’imputation
(KNN imputation, itérative) pourrait être testée, ainsi que des stratégies de détection et traite-
ment des outliers. De plus, la sélection de variables (feature selection) ou l’ingénierie de variables
(création de nouvelles features pertinentes) pourraient améliorer les performances, en particulier
sur le dataset CDC BRFSS où les variables sont plus indirectes.
La gestion du déséquilibre des classes constitue également une piste importante, notamment
pour expliquer une accuracy élevée mais un F1-score faible sur CDC BRFSS. Des techniques telles
que le class weighting, le sur-échantillonnage (SMOTE) ou le sous-échantillonnage pourraient être
intégrées, et l’évaluation pourrait être davantage centrée sur des métriques adaptées (F1-score,
recall, PR-AUC).
Sur le plan des modèles, il serait pertinent de tester des approches complémentaires (réseaux de
neurones simples, modèles linéaires régularisés, méthodes d’ensemble supplémentaires) et d’explo-
rer des techniques d’interprétabilité (importance des variables, SHAP) afin d’améliorer la compré-
hension et la confiance dans les prédictions. Enfin, une calibration des probabilités (Platt scaling,
isotonic regression) pourrait être utile pour rendre les scores de risque plus exploitables en pratique
clinique.
Ces perspectives s’inscrivent dans une démarche de renforcement de la généralisation, de la
robustesse et de l’utilité pratique des modèles de prédiction du diabète.

7 Conclusion
Ce projet avait pour objectif de reproduire et d’analyser l’étude de Zhang (2025) sur la pré-
diction du diabète de type 2 à partir du Pima Indians Diabetes Dataset (PIDD), tout en appro-
fondissant la dimension optimisation et en étendant l’analyse à un dataset complémentaire (CDC
BRFSS). Un pipeline complet de Machine Learning a été mis en place, incluant le prétraitement,
la séparation apprentissage/test, l’entraînement de plusieurs modèles (régression logistique, Ran-
dom Forest, SVM et XGBoost) ainsi que l’évaluation à l’aide de métriques adaptées au contexte
médical.
Sur le PIDD, les résultats obtenus montrent des performances globalement comparables à celles
rapportées dans la littérature, avec une influence notable du prétraitement sur les performances
et sur la stabilité de l’apprentissage. L’analyse des courbes de convergence met en évidence que
certaines transformations (notamment la standardisation et la transformation de Yeo-Johnson)
favorisent une convergence plus rapide et plus stable par rapport à une normalisation simple.
Cette partie confirme l’importance du lien entre la représentation des données et l’efficacité de
l’optimisation.
L’extension au dataset CDC BRFSS a permis d’évaluer la robustesse des approches dans un

18
contexte très différent, caractérisé par un nombre d’observations bien plus élevé et des variables
davantage comportementales que biologiques. Les résultats illustrent que la comparaison directe
des performances entre datasets doit être interprétée avec prudence : une accuracy plus élevée sur
CDC BRFSS peut coexister avec un F1-score plus faible, ce qui souligne l’impact du déséquilibre
de classes et la nécessité d’utiliser des métriques adaptées. Cette étape a mis en évidence que la
performance d’un modèle dépend fortement du contexte des données, de la qualité des variables
et des choix d’optimisation.
En synthèse, ce travail met en évidence trois apports principaux : (i) la reproductibilité d’un
pipeline ML pour la prédiction du diabète sur un dataset de référence, (ii) l’importance de l’optimi-
sation et du prétraitement dans la convergence et la généralisation, et (iii) l’intérêt d’une validation
inter-datasets pour mieux comprendre les limites de généralisation. Comme perspectives, il serait
pertinent d’intégrer des méthodes de gestion du déséquilibre (pondération des classes, SMOTE),
d’explorer des modèles plus avancés ou hybrides, et d’ajouter des outils d’interprétabilité (par
exemple SHAP) ainsi qu’une calibration des probabilités afin de rendre les prédictions plus exploi-
tables dans un cadre clinique réel.

Références
[1] Z. Zhang (2025). Comparison of Machine Learning Models for Predicting Type 2 Diabetes Risk
Using the Pima Indians Diabetes Dataset. Journal of Innovations in Medical Research, 4(1),
65–71.
[2] Pima Indians Diabetes Dataset (UCI/Kaggle). Pima Indians Diabetes Database.
[3] Dataset complémentaire (UCI/Kaggle/CDC). Diabetes Health Indicators Dataset.

19

Vous aimerez peut-être aussi