Questions et réponses sur RStudio et l’analyse de données
1. Création et manipulation de tableaux de données
Question : Comment créer un tableau de données en R ?
Réponse : Utilisez la fonction [Link](). Par exemple :
data <- [Link](ID = 1:3, Name = c("Alice", "Bob",
"Charlie"), Age = c(24, 30, 28))
print(data)
Question : Comment ajouter une nouvelle ligne à un tableau existant ?
Réponse : Utilisez la fonction rbind(). Exemple :
new_row <- [Link](ID = 4, Name = "Diana", Age = 27)
data <- rbind(data, new_row)
Question : Comment ajouter une nouvelle colonne à un tableau ?
Réponse : Utilisez l’opérateur $ ou les indices. Exemple :
data$Occupation <- c("Engineer", "Doctor", "Artist", "Lawyer")
Question : Quelle est la différence entre les types de données character et
factor ?
Réponse :
o character : Représente du texte brut.
o factor : Utilisé pour des variables catégoriques avec des niveaux prédéfinis.
Question : Comment convertir une colonne en facteur dans un tableau ?
Réponse :
data$Gender <- [Link](c("Female", "Male", "Male", "Female"))
Question : Comment fusionner deux tableaux de données ?
Réponse : Utilisez la fonction merge(). Exemple :
data1 <- [Link](ID = 1:3, Score = c(85, 90, 88))
merged_data <- merge(data, data1, by = "ID")
Question : Comment trier un tableau selon une colonne ?
Réponse : Utilisez la fonction order(). Exemple :
data <- data[order(data$Age), ]
Question : Comment renommer les colonnes d’un tableau ?
Réponse :
colnames(data) <- c("ID", "Nom", "Âge", "Genre", "Métier")
2. Exploration de données
Question : Comment afficher la structure d’un tableau de données ?
Réponse :
str(data)
Question : Comment calculer les statistiques descriptives pour des variables
quantitatives ?
Réponse : Utilisez les fonctions suivantes :
o Moyenne : mean(data$Age)
o Médiane : median(data$Age)
o Écart-type : sd(data$Age)
Question : Comment créer un tableau de fréquences pour des variables
catégoriques ?
Réponse :
table(data$Gender)
Question : Comment résumer plusieurs variables quantitatives avec dplyr ?
Réponse :
library(dplyr)
data %>% summarise(across(c(Age), list(mean = mean, sd = sd)))
Question : Comment identifier et gérer les valeurs manquantes dans un tableau ?
Réponse :
o Identifier les valeurs manquantes :
[Link](data)
o
o Supprimer les lignes contenant des valeurs manquantes :
data <- [Link](data)
o
o Remplacer les valeurs manquantes par la moyenne :
data$Age[[Link](data$Age)] <- mean(data$Age, [Link] = TRUE)
Question : Comment détecter les doublons dans un tableau ?
Réponse :
duplicated(data)
3. Visualisation des données
Univariée
Question : Comment tracer un histogramme pour une variable quantitative ?
Réponse :
o Sans package :
hist(data$Age, main = "Histogramme de l'âge", xlab =
"Âge", col = "blue")
o
o Avec ggplot2 :
library(ggplot2)
ggplot(data, aes(x = Age)) + geom_histogram(binwidth = 5,
fill = "skyblue", color = "black")
Question : Comment tracer un diagramme en barres pour des variables
catégoriques ?
Réponse :
o Sans package :
barplot(table(data$Gender), main = "Répartition par
genre", col = "green")
o
o Avec ggplot2 :
ggplot(data, aes(x = Gender)) + geom_bar(fill =
"lightgreen")
o
Bivariée
Question : Comment tracer un nuage de points pour analyser deux variables
quantitatives ?
Réponse :
plot(data$Age, data$Income, main = "Age vs Income", xlab =
"Age", ylab = "Income")
Question : Comment créer un boxplot qui compare une variable quantitative par
catégories ?
Réponse :
boxplot(data$Income ~ data$Gender, main = "Income by Gender",
xlab = "Gender", ylab = "Income")
Question : Comment ajouter une courbe de densité sur un histogramme ?
Réponse :
hist(data$Age, probability = TRUE, main = "Histogramme avec
densité")
lines(density(data$Age), col = "red")
Question : Comment sauvegarder un graphique en fichier image ?
Réponse :
png("[Link]")
plot(data$Age, data$Income)
[Link]()
4. Analyse multivariée
Question : Qu'est-ce qu'une PCA et comment l’effectuer ?
Réponse :
o Sans package :
pca_data <- scale(data[, c("Age", "Income")])
pca_result <- prcomp(pca_data)
summary(pca_result)
o
o Avec FactoMineR :
library(FactoMineR)
pca_result <- PCA(data[, c("Age", "Income")], graph =
FALSE)
Question : Quelles sont les étapes pour effectuer un clustering hiérarchique ?
Réponse :
o Standardiser les données :
data_scaled <- scale(data[, c("Age", "Income")])
o
o Calculer une matrice de distances :
dist_matrix <- dist(data_scaled)
o
o Appliquer le clustering :
hc_result <- hclust(dist_matrix)
plot(hc_result)
Question : Comment interpréter un dendrogramme ?
Réponse : Un dendrogramme montre comment les points de données sont regroupés à
différents niveaux. Chaque division représente une séparation de cluster. Vous pouvez
choisir un niveau de découpage pour obtenir des groupes distincts.
5. Régression linéaire
Question : Comment effectuer une régression linéaire simple ?
Réponse :
model <- lm(Income ~ Age, data = data)
summary(model)
Question : Comment interpréter les coefficients d'une régression multiple ?
Réponse : Les coefficients représentent l’effet d’une variable indépendante sur la
variable dépendante, toutes choses égales par ailleurs.
Question : Comment visualiser une régression linéaire ?
Réponse :
ggplot(data, aes(x = Age, y = Income)) +
geom_point() +
geom_smooth(method = "lm", col = "blue")
6. Comparaison avec ou sans packages
Question : Quels sont les avantages d’utiliser ggplot2 par rapport aux
graphiques de base ?
Réponse :
o Personnalisation avancée.
o Meilleure intégration avec dplyr pour la manipulation de données.
o Gestion intuitive des couches graphiques.
Question : Pourquoi standardiser les données avant une analyse multivariée ?
Réponse : Pour s'assurer que toutes les variables ont le même poids dans l'analyse,
indépendamment de leurs unités ou échelles.
Question : Comment sauvegarder un graphique ggplot2 dans un fichier ?
Réponse :
ggsave("mon_graphique.png", plot = last_plot(), width = 8,
height = 6)
Question : Comment installer et charger plusieurs packages en une seule
commande ?
Réponse :
[Link](c("ggplot2", "dplyr", "tidyr"))
lapply(c("ggplot2", "dplyr", "tidyr"), library, [Link]
= TRUE)
Ce document couvre une large variété de questions sur l'utilisation de R pour la
manipulation de données, leur exploration et leur analyse.