0% ont trouvé ce document utile (0 vote)
2 vues3 pages

Analyse des pourboires et tendances de livres

Le document présente des exercices pratiques utilisant le logiciel R pour analyser des données statistiques. Les exercices incluent le calcul de pourcentages de pourboires, l'analyse des ventes de livres, et l'exploration des tendances de recherche sur Google. Chaque exercice contient des questions spécifiques à répondre à l'aide de visualisations et de manipulations de données.

Transféré par

24602
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues3 pages

Analyse des pourboires et tendances de livres

Le document présente des exercices pratiques utilisant le logiciel R pour analyser des données statistiques. Les exercices incluent le calcul de pourcentages de pourboires, l'analyse des ventes de livres, et l'exploration des tendances de recherche sur Google. Chaque exercice contient des questions spécifiques à répondre à l'aide de visualisations et de manipulations de données.

Transféré par

24602
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

TP Logiciels statistique (R)

22/11/2024

Exercice 1
Pendant plusieurs mois, un serveur a enregistré un total de 244 pourboires. Ces données
ont été rapportées dans une collection d’études de cas pour les entreprises (Bryant &
Smith, 1995).

Charger les données avec data(tips, package = "reshape2") et utiliser tidyverse et


ggplot2 pour répondre aux questions suivantes.

Questions
1. Créer une nouvelle colonne tip_percentage pour calculer le pourcentage du pour-
boire par rapport au total de la facture.
2. Réorganiser la colonne day pour que les jours apparaissent dans l’ordre chronolo-
gique en utilisant comme levels = c("Thur", "Fri", "Sat", "Sun")
3. Ajouter une colonne party_size_label pour catégoriser les tailles des groupes
comme suit : Small si la taille est inférieure ou égale à 2, Medium si la taille est
comprise entre 3 et 4 inclus, et Large sinon.
4. Regrouper les données par day et smoker, puis calculer le pourboire moyen, le
total des pourboires et le pourcentage moyen des pourboires.
5. Agréger les pourboires totaux, les factures totales et le pourcentage moyen des
pourboires pour chaque jour.
6. Catégoriser la colonne total_bill en trois groupes en utilisant les seuils suivants :
$ si le montant est inférieur à 10, $$ si le montant est compris entre 10 et 20 inclus,
et $$$ sinon.
7. Créer un histogramme pour visualiser la distribution de tip_percentage par ca-
tégorie de facture (bill_category).
8. Créer une boîte à moustaches pour visualiser la distribution des pourboires par
jour. Identifier le jour avec la plus grande variabilité.

1
Exercice 2
Le jeu de données du fichier [Link] contient des informations sur des livres : les
ventes, les genres et d’autres détails. Cela vous aidera à explorer comment ces facteurs
influencent le succès et la popularité des ouvrages.

Questions
1. Quel est le livre le plus vendu ?
2. Identifier le livre avec le plus faible nombre de critiques.
3. Calculer la note moyenne pour les livres de chaque genre.
4. Visualiser la répartition des notes moyennes des livres à l’aide d’un histogramme.
5. Quel éditeur génère le plus de revenus ?
6. Explorer la relation entre le prix de vente et le nombre d’unités vendues avec un
graphique de dispersion.
7. Comment les livres très bien notés (>4,5) ont-ils été publiés au fil du temps ?
Visualiser la tendance des livres très bien notés publiés chaque année.
8. Représenter la proportion des ventes totales par langue à l’aide d’un diagramme
en camembert.
9. Comment sont distribués les prix de vente ?

2
Exercice 3
Le fichier [Link] provient de Google Trends et contient les données sur les recherches
du mot « Bac » en Mauritanie de 2004 jusqu’à présent. Les données sont normalisées,
où 100 représente le maximum de popularité des recherches et 0 indique un volume de
recherche insuffisant.

Questions
1. Charger les données et extraire l’année et le mois de la colonne Date.
2. Sélectionner uniquement les colonnes pertinentes (Year, Month, et Bac) et renom-
mer cette dernière en Search_Interest.
3. Écrire le code pour créer une heatmap basique en utilisant ggplot2.
4. Améliorer la heatmap avec des personnalisations :
— Ajouter un dégradé de couleurs en utilisant rev([Link](9, "Spectral"))
de la librairie RColorBrewer.
— Ajouter des étiquettes pour les mois sur l’axe des abscisses ( Janv, Févr, etc.).
5. Combiner tout le code dans une seule fonction qui prend en entrée le chemin du
fichier [Link] et génère la heatmap présentée ci-dessous.

Vous aimerez peut-être aussi