0% ont trouvé ce document utile (0 vote)
9 vues3 pages

Analyse de données p ≫ n : Méthodes et résultats

Ce TP consiste à travailler sur un jeu de données simulé de grande dimension, où le nombre de variables dépasse celui des observations, en appliquant des techniques de réduction de dimension, de sélection de variables et de classification. Les objectifs incluent l'application de méthodes comme ACP, Lasso, PCR et PLS, ainsi que la comparaison d'algorithmes de classification tels que la régression logistique et SVM, tout en évaluant les performances par validation croisée. Le livrable attendu est un rapport structuré contenant les résultats, interprétations et comparaisons, accompagné d'un code complet.

Transféré par

Jordy Djadou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
9 vues3 pages

Analyse de données p ≫ n : Méthodes et résultats

Ce TP consiste à travailler sur un jeu de données simulé de grande dimension, où le nombre de variables dépasse celui des observations, en appliquant des techniques de réduction de dimension, de sélection de variables et de classification. Les objectifs incluent l'application de méthodes comme ACP, Lasso, PCR et PLS, ainsi que la comparaison d'algorithmes de classification tels que la régression logistique et SVM, tout en évaluant les performances par validation croisée. Le livrable attendu est un rapport structuré contenant les résultats, interprétations et comparaisons, accompagné d'un code complet.

Transféré par

Jordy Djadou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

TP A RENDRE

Armel YODE

2025-07-09

Contexte
Dans ce TP, vous travaillez sur un jeu de données simulé de très grande dimension : le nombre de variables (p)
dépasse largement le nombre d’observations (n). Cette situation est fréquente en génomique, en neurosciences
ou en finance.
Vous devrez appliquer plusieurs techniques de réduction de dimension, de sélection de variables, et de
classification, puis analyser leur pertinence dans ce contexte.

Objectifs pédagogiques
Appliquer des méthodes adaptées aux données de grande dimension : ACP, Lasso, PCR, PLS Comparer des
algorithmes de classification : régression logistique, SVM, forêts aléatoires, etc. Évaluer les performances par
validation croisée Interpréter et justifier les résultats obtenus

Jeu de donnée
# Exemple : jeu de données simulé
[Link](123)
n <- 72
p <- 1000
X <- matrix(rnorm(n * p), n, p)
colnames(X) <- paste0("V", 1:p)
y <- factor(sample(c("ALL", "AML"), n, replace = TRUE))
#
# Vérifier les dimensions
dim(X)

## [1] 72 1000
table(y)

## y
## ALL AML
## 34 38

Contexte
Vous travaillez sur un jeu de données simulé où le nombre de variables (p) dépasse largement le nombre
d’observations (n), une situation fréquente en bioinformatique, neurosciences ou finance.
Votre mission est d’appliquer plusieurs techniques statistiques pour réduire la dimension, sélectionner les
variables pertinentes, et classer les observations, tout en analysant les résultats.

1
Objectifs
• Appliquer des méthodes adaptées aux situations p ≫ n : ACP, Lasso, PCR, PLS
• Mettre en œuvre des algorithmes de classification : régression logistique, SVM, forêts aléatoires, etc.
• Évaluer les performances par validation croisée
• Interpréter et justifier les résultats obtenus avec esprit critique

1. Chargement et exploration du jeu de données


Chaque groupe doit générer un jeu de données unique à partir d’un [Link]() fourni séparément.

À faire :
• Résumer les dimensions du jeu de données
• Identifier la répartition des classes
• Vérifier la normalité et l’échelle des variables

2. Analyse en Composantes Principales (ACP)


À faire :
• Réaliser une ACP sur les données centrées et réduites
• Représenter les deux premières composantes
• Identifier si les classes sont séparables visuellement
Attention : l’interprétation du graphique est obligatoire. Ne vous contentez pas de dire “les classes
sont bien séparées”.

3. Régression logistique Lasso


À faire :
• Effectuer une régression logistique pénalisée (Lasso)
• Identifier les variables sélectionnées
• Interpréter l’effet de la régularisation dans ce contexte
Piège pédagogique : la sélection dépend du choix de pénalisation. Justifiez vos choix et vos
observations.

4. Régression sur composantes principales (PCR)


À faire :
• Réaliser une régression sur les composantes principales
• Comparer les résultats à ceux du Lasso
• Discuter la différence d’approche
Question guidée : que perd-on en passant des variables initiales aux composantes principales ?

5. Régression PLS
À faire :
• Appliquer une régression PLS discriminante
• Comparer ses performances avec PCR et Lasso
• Interpréter les résultats

2
6. Comparaison de méthodes de classification
À faire :
Tester au moins trois des méthodes suivantes :
• Régression logistique
• SVM (linéaire ou RBF)
• Forêt aléatoire
• Naive Bayes
• Gradient boosting
Pour chaque méthode :
• Décrire brièvement son principe
• Appliquer la méthode avec validation croisée
• Évaluer les performances (accuracy, sensibilité, etc.)
Les résultats attendus doivent être numériques et justifiés à partir de votre propre jeu de
données.

7. Synthèse comparative
À faire :
• Présenter un tableau comparatif des résultats
• Discuter la pertinence de chaque méthode dans le contexte p ≫ n
• Identifier les limites rencontrées et proposer des pistes d’amélioration

Livrable attendu
**Un rapport structuré (.pdf ou .html) contenant :
• Vos résultats chiffrés
• Vos interprétations personnelles
• Vos comparaisons justifiées
• Une annexe avec le code complet et comment
à deposer à mon secretariat; la version electronique (.Rmd avec .pdf ou .htlm) est à envoyer à
yafevrard@[Link]

Dispositifs anti-plagiat et anti-IA


• Données personnalisées par groupe
• Interprétations spécifiques exigées
• Analyse obligatoire des résultats propres
• Code brut non commenté = pénalité

Vous aimerez peut-être aussi