Guide des fonctions R et gestion des données
Guide des fonctions R et gestion des données
Faire attention aux majuscules et minuscules dans les fonctions (fonction setwd n’est pas la même chose que Setwd
(qui n’existe pas d’ailleurs))
Couleurs = noms des variables, catégories, nombres,… -> CHOSES QUE L’ON PEUT MODIFIER, CHANGER
library(car)
library(carData)
library(ggplot2)
library(MASS)
library(rstudioapi)
library(gdata)
library(lme4)
library(Matrix)
library(plyr)
library(knitr)
library(DescTools)
Atlantis juilland
variables qualitatives
continue)
Imprimer, print(Nom docu dans R$Variable) Fait apparaitre les print(data_satisfaction$Age)
montrer print(nom tableau) données, elles deviennent print(table1)
print(Nom probabilité) visibles (dans partie en
… bas à gauche)
Histogram hist(Nom docu dans R$Variable, breaks= Créé un histogramme hist(data_satisfaction$Age, breaks=15)
me nombre) (dans partie en bas à
droite), breaks : on choisit
le nombre de
bâtons/colonnes que l’on
veut sur le graphique
(nombre)
Tableau pour varibales
quantitatives
Moyenne mean(Nom docu dans R$Variable) Moyenne de tout les mean(data_satisfaction$Age)
éléments de la variable
(toutes les lignes de 1
colonne)
Médianne median(Nom docu dans R$Variable) Médiane = nombre au median(data_satisfaction$Grandeur)
milieu de toutes les
données
Ex : 1 2 3 4 5 ->
médiane= 3
Ex : 1 5 6 7 8 10 14->
médiane= 7
Mode Mode(Nom docu dans R$Variable) Nombre le + choisi dans Mode(data_satisfaction$Sexe)
la variable
Ex : 1 1 1 2 2 2 2 -> ATTENTION : Activer package « DescTools »
Mode=2 (présent 4 fois) avant !
Ex : 1 1 2 4 4 4 4 4 5 6 7
-> Mode= 4 (présent 5
fois)
Ordonner Nom données rangées<-sort(Nom docu dans Classer les données par Data_ordonné_Taille<-sort(data_satisfaction$Taille)
Atlantis juilland
perpendiculaires à l'axe
(verticales).
3 : étiquettes verticales,
mais dans le sens inverse
de l'orientation par
défaut.
[Link] :contrôle la taille
des étiquettes des axes.
1=valeur par défaut,
0,8=un peu plus petit,…
col : change la couleur
des bâtons du
diagramme. Si plusieurs
couleurs, mettre
col=c(« couleur1 »,
« couleur2 »)
NB : il faut écrire les
couleurs en anglais
Limites sur xlim =(x minimum, x maximum) Donne les valeurs limites barplot(data$Frequence,xlim=(80,120))
le ylim =(y minimum, y maximum) que l’on veut représenter
graphique Ex : si on a des données
de QI de 60 à 140 mais
que l’on veut voir sur le
graph que de 80 à 120 :
xlim=c(80,120)
Même chose pour l’axe
y : ylim
Densité dnorm(valeur qui nous intéresse Densité d’une valeur sur dnorm(100,120,10)
,mean=moyenne variable,sd=écart-type la distribution normale
variable) avec une certaine
ou moyenne(mean) et un
dnorm(valeur qui nous intéresse, moyenne certain écart-type(sd)
variable,écart-type variable)
Atlantis juilland
Probabilité pnorm(valeur qui nous intéresse Proba qu’une valeur soit pnorm(100,100,15)
dans un ,mean=moyenne variable,sd=écart-type entre -l’infini et la valeur
intervalle variable) choisie (dans cet
au moins ou intervalle) probabilité
aussi pnorm(valeur qui nous intéresse, moyenne d'avoir une valeur au
basse variable,écart-type variable) moins aussi basse sur
cette distribution
Probabilité 1 – pnorm(valeur qui nous intéresse, Proba que’une valeur soit 1-pnorm(140,100,15)
dans un moyenne variable,écart-type variable) entre une valeur choisie
intervalle et +l’infini (dans cet
Au moins intervalle)
aussi
haute
Probabilité pnorm(valeur la plus GRANDE, moyenne Proba qu’une valeur soit pnorm(140,100,15)-pnorm(120,100,15)
dans un variable,écart-type variable)-pnorm(valeur la entre 2 valeurs choisies
intervalle plus PETITE, moyenne variable,écart-type (pas de -infini ou de
Entre les variable) +infini)
deux
Simulation rnorm(nombre de valeurs, moyenne Nous donne un certain rnorm(100,50,20)
de variable,écart-type variable) nombre de données au
données hasard mais qui vont plus
ou moins suivre une
distribution normale
Score Z scale(Nom docu dans R$Variable) Les scores Z permettent scale(data_satisfaction$Sport)
+ de standardiser les
moyenne données d’une variable,
et écart- pour que ce soit plus
type de la facile de la comparer
distribution avec d’autres variables
normale (parce que 2 variables ont
Atlantis juilland
moyenne 2) Echantillon_population_reference)
(ici } }
fonction
générale,
séparée et
détaillée
plus bas)
Partie 1 Nom Variable 1<-rep(NA,nombre) rep =répéter une action Moyennes_des_echantillons <- rep(NA, 10000)
un certain nombre de fois
(l’action en question sera
décrite après dans la
fonction for et les {} )
NA= une valeur non
définie que l’on souhaite
répéter (qui sera définie
après)
Nombre = le nombre de
fois que l’on veut répéter
cette action
Partie 2 for(lettre in 1ère itération:dernière itération){ for = pour : on dit pour for(i in 1:10000){
quel bloc de code on va
répéter l’action
lettre : souvent on utilise
la lettre « i » mais on
peut utiliser n’importe
quelle lettre ou même un
mot si on préfère
i in 1 :10000 : i c’est le
nom pour une action (ce
qui est mis entre {}) que
l’on va faire 10000 fois
(de 1 à 10000)
Atlantis juilland
Ex : l’action « i » c’est
diviser par 2 et ajouter 3,
donc on va prendre
10000 chiffres au hasard
et pour chacun on divise
par 2 et on ajoute 3
Partie 3 Nom variable 2<-rnorm(nombre de valeurs, Nom variable 2 : on rnorm(20,100,15)
moyenne variable,écart-type variable) crée un échantillon avec Moyennes_des_echantillons[i] <- mean(
Nom Variable 1[lettre]<-mean(Nom variable la fonction rnorm Echantillon_population_reference)
2) rnorm : voir plus haut }
} Nom variable 1 : nom
pour stocker la moyenne
de cet échantillon qu’on
vient de créer
mean : moyenne de
l’échantillon généré au
hasard
Distributio nsim<-chiffre (nombre simulé) !! c’est la même fonction nsim<-1000
n n<-chiffre (nombre) que la précédente sauf n<-20
d’échantill mu<-chiffre (moyenne) que avant d’écrire la mu<-100
onnage de sigma<-chiffre (écart type) fonction on définit les 4 sigma<-15
la Nom Variable 1<-rep(NA,nsim) chiffres dont on a besoin,
moyenne et donc si on doit les samp_distern_means<-rep(NA,nsim)
(2) for(lettre in 1:nsim){ changer c’est plus facile for(lettre in 1:nsim){
Nom variable 2<- (cette forme est plus x<-rnorm(n,mean=mu,sd=sigma)
rnorm(n,mean=mu,sd=sigma) flexible) samp_distern_means [lettre]<-mean(x)
Nom Variable 1[lettre]<-mean(Nom N.B : nsim,n,mu et }
variable 2) sigma sont les mots
} conventionnels (=utilisés
habituellement), mais de
nouveau, ils peuvent être
remplacés par n’importe
quelle lettre/mot
Atlantis juilland
indépendants avec
(si test_t non apparié) variances égales)
df=n_variable_1+n_variable_2−2
Score_t ou (si d’échantillonage) T score : diffèrence entre (si échantillionage)
valeur t t_score <- (moyenne_echantillon - ton échantillon en
moyenne_populationH0) / Hypothèse nulle et la t_score <- (moyenne_echantillon -
(ecart_type_echantillon / sqrt(n)) moyenne général moyenne_populationH0) /
(ecart_type_echantillon / sqrt(n))
(si non apparié) Expliquation : (moyenne
t_score <- (moyenne_Variable1 - general- moyenne H0) / (si non apparié)
moyenne_variable2) / (sqrt(((et_variable1)^2 (ecart type général /
/ (n_variable1)) +((et_variable2)^2) / racine du nombre de t_score <- (moyenne_VC - moyenne_OJ) /
(n_variable2)) ) personne de l’échantillon (sqrt(((et_VC)^2 / (n_VC)) +((et_OJ)^2) /
(n_OJ)) )
(si apparié,un test t à un échantillon, qui
compare la difference, moyenneH0 à 0) (si apparié)
t_score<-(moyenne_diff_entre_variables - t_score <- (moyenne_diff -
moyenne_H0)/(et_des_différences_entre_vari moyenne_populationH0) / (et_echantillon /
ables / sqrt(n)) sqrt(n))
égale ou au dessous
P valeur Si mu<muh0 : Uni : l’hypothèse dit
unilatéral pt(t_score,df) clairement si on s’attend
à une moyenne plus
si mu>muh0 élevée ou plus basse que
1−pt(t_score,df) celle de H0
égale ou au dessous
[Link](data$valeur,mu=valeur de la -> [Link](data$PDI_Score,mu=100,
moyenne, alternative="greater") (uni) On rejette toujours H0 si alternative="greater")
la probabilité est égale ou
inférieure à 5% mais on
doit maintenant
considérer les deux côtés
de la distribution. Il faut
donc que les deux
probabilités soient égales
ou inférieures à 0.05 ->
La somme des deux
probabilités doit être
inférieure à 5% pour que
le test soit significatif.
unilatéral)
Utilisé lorsque les
mesures sont faites sur le
même groupe.
Le n<- nombre théorème permettant et_distr_ech_moy <- et/sqrt(n)
théoreme d’obtenir, par calcul, la
central Écart type de la distribution moyenne et l’écart type
limite d’échantillionnage de la moyenne <- de n’importe quelle
Ecart_type_de_la_variable/sqrt(n) distribution mean_distr_ech_moy <- mu
(part 1) d’échantillonnage de la
Moyenne de la distribution moyenne (à partir de la
d’échantillionnage de la_moyenne = moyenne de la population
moyenne de la variable et son écart-type)
(en gros les moyennes sont les mêmes)
Le nsim<-nombre de fois simulé Faire la partie 1 puis nsim<-10000
théorème nom de la variable simulée<-rep(NA,nsim) verifier à l’aide d’une vecteur_pour_mettre_moyenne_a_chaque_itera
central simulation si les résultats tion<-rep(NA,nsim)
limite for(i in 1:nsim){ sont les même
(partie 2) nom de variable 2 pour la simulée<- for(i in 1:nsim){
(si rnorm(n,mu,et) x<-rnorm(n_TCL,mu,et)
demandé) nom de la variable simulée[i]<-mean(nom
de variable 2 pour la simulée) vecteur_pour_mettre_moyenne_a_chaque_itera
} tion[i]<-mean(x)
}
Le mean(nom de la variable simulée) Puis on peux calculer mean(vecteur_pour_mettre_moyenne_a_chaqu
théorème l’écart-type et la e_iteration)
central sd(nom de la variable simulée) moyenne de la simulation
(partie 3) et comparer sd(vecteur_pour_mettre_moyenne_a_chaque_it
(si eration)
demandé) Si même cool c’est juste
obtenir un data$variable sélectionner une partie Anorexia$Post
subset des données d’un jeu de
(sous =donne la colonne données (subset an
Atlantis juilland
t dans un
jeu de
données
Test_t non [Link](data[data$variable1=="se qui se comparer les moyennes [Link](ToothGrowth[ToothGrowth$supp
apparié trouve dans cette variable qui nous intéresse de deux échantillons =="VC",]$len,ToothGrowth[ToothGrowth$supp
(ou test 1",]$variable2,data[data$variable1 ==" se issus de deux groupes =="OJ",]$len,alternative ="[Link]")
pour qui se trouve dans cette variable qui nous non appariés
échantillon intéresse 2",]$variable2,alternative
s ="[Link]")
indépenda
nts) (Par défaut, la fonction utilise
l’approximation de Welch-Satterthwaite
Si nous faisons l’hypothèse que les variances (Par défaut, la fonction utilise l’approximation de
sont égales, nous pouvons changer ce Welch-Satterthwaite
paramètre) Si nous faisons l’hypothèse que les variances sont
égales, nous pouvons changer ce paramètre)
[Link](data[data$variable1=="se qui se
trouve dans cette variable qui nous intéresse [Link](ToothGrowth[ToothGrowth$supp
1",]$variable2,data[data$variable1 ==" se =="VC",]$len,ToothGrowth[ToothGrowth$supp
qui se trouve dans cette variable qui nous =="OJ",]$len,alternative ="[Link]",
intéresse 2",]$variable2,alternative [Link] = TRUE)
="[Link]", [Link] = TRUE)
(Si mu<muh0)
pt(t_score,df)
(si mu>muh0)
1−pt(t_score,df)
Étape 3 : cf expliquation
Distributio et_populationH0/sqrt(n) et_population/sqrt(n)
n normal ?
(largeur
d’un
distribution
= écart-
type)
Taille la taille d’effet = différence entre les
d’effet moyennes ou entre la moyenne de
l’échantillon et la moyenne de référence.
D de cohen (Pour le test apparié ou à un échantillon) Afin de comparer des
tailles d’effets entre elles,
d<- (moyenne_echantillion- on utilise une mesure
moyenne_h0)/ecart_type_echantillion) standardisée de la taille
d’effet. Pour les
comparaisons de
moyennes il s’agit du d
de Cohen.
Atlantis juilland
Verifier l’inverse :
À toujours interpreter
selon la moyenne
Quand on demande au
centre, sépare le
pourcentage en deux
Pour augmenter la
puissance on peux :
1) Aug alpha
3) Réduire la variance
Atlantis juilland
4) Augmenter la taille
de l’échantillon
alpha
si le test est
bilatéral ou
unilatéral
(Attention, ici l’argument
“alterntive” prend soit
“two-sided” ou “one-
sided”)
( A noter: comme la
convention veut qu’on
effectue des tests
bilatéraux, on calcule en
général (et sauf indication
contraire) la puissance
avec des tests bilatéraux)
la taille d’effet
Atlantis juilland
(paramètre
“delta”)
la taille de
l’échantillon
(paramètre “n”)
l’écart-type
(paramètre “sd”)
intercept :b0
pente (l’autre) :b1 Une relation linéaire peut
être approximée par une
permet de déterminer les valeurs de y en droite
fonction des valeurs de x :
Effectuer une régression
y=a+bx linéaire va consister à
ou trouver la droite qui
y= b0 + b1x (régression lin. Statistique : résume le mieux la
permettra plus de deux variables) relation dans nos
données
a(b0) et b(b1) sont des constantes.
A(b0): valeur de “y” pour x = 0 (intercept) La droite va représenter
B(b1) : pente une tendance, mais les
x : variable 2 (peut prendre différentes individus ne vont pas tous
valeurs) avoir des valeurs sur la
y : variable 1 droite.
L’intercept de
l’échantillon = estimation
de l’intercept dans la
population.
Atlantis juilland
Les résidus de
l’échantillon = estimation
de l’erreur résiduelle dans
la population
3 : erreur standard
ES_b1 <- s / sqrt(sum((x - moyX)^2))
Obtenir summary(lm(y~x)) La fonction summary()
ces nous donne accès à la
informatio valeur de t, à l’erreur
ns dans R standard et à la p valeur
(remplace et l’erreur résiduelle
test
d’hypothès
Atlantis juilland
e)
Hypothèse Hypothèse
directionne directionnelle:
lle et non spécifie si
directionell l’influence de x sur
e y est positive ou
Et p valeur négative
Hypothèse non
directionnelle: ne
spécifie pas la
direction de cette
influence,
uniquement que la
pente est
différente de 0
Par convention, on
effectue en général un
test bilatéral. La p-valeur
fournie par R résulte d’un
test bilatéral.
Besoin de la covariances
entre les variables :
nombre qui reflète le
degré auquel deux
variables varient
ensemble
La corrélation de Pearson
peut prendre les valeurs
comprises entre -1 à 1
(inclues).
La corrélation rend
compte du degré auquel
les points se groupent
autour de la droite (qui se
calcule comme la droite
de régression).
Prédire Qqnorm(x)
résulats y
dans
distribution
nnormal
moyenne
zero
Atlantis juilland