Le rôle des méthodes quantitatives c’est d’interpréter des données.
Les méthodes quantitatives sont utiles pour tout le monde, gouvernement, politiciens, etc.
L’analyse inférentiel est d’utiliser les données d’un petit groupe pour mieux savoir sur la
population complète.
Ta population est la totalité du groupe étudié, en revanche, l’échantillon est une portion du
groupe étudié choisi aléatoirement.
Un paramètre est une mesure descriptive de la population, et les paramètres sont toujours
écris avec une lettre Grecque. Quand c’est une lettre latine, c’est une statistique.
Le but ultime des méthodes quantitatives est de tester et validité des hypothèses.
On va déterminer les marges d’erreurs
Échelles de mesures :
1- Échelle Nominale
Échelle qui met les sujets dans des groupes qui sont mutuellement exclusifs, alors tu ne
peux pas être dans deux groupes différents. Tu ne peux pas classer les groupes et mettre
un comme étant meilleur que l’autre. Tu peux seulement calculer le nombre de personnes
dans un groupe.
2- Échelle Ordinaire
Échelle qui met les sujets dans des groupes qui sont mutuellement exclusifs. Tu peux
classer les groupes en ordre, mais tu ne peux pas mettre un chiffre entre la distance des
groupes. Par exemple, les questions “Très satisfait, satisfait, non satisfait”, tu peux les
mettre en ordre, mais tu ne peux pas quantifier la distance de satisfaction entre “satisfait
et très satisfait”. Ici aussi tu peux faire des fréquences et compter combien dans chaque
groupe.
3- Échelle Intervalle
Échelle qui permet de mettre les sujets dans des groupes qui sont mutuellement exclusifs,
tu peux les classer en ordre. Tu peux aussi avoir une valeur exacte entre les catégories. Il
n’y pas de vrai 0, 0 ne veut pas dire que ça n’existe pas, une température de 0 ça existe. Tu
ne peux pas multiplier ou diviser entre les données.
4- Échelle De rapport
Une échelle de rapport a toutes les caractéristiques des autres échelles, et il y a un vrai
zéro. On peut aussi multiplier et diviser entre les données.
L’idée de validité est que la manière dont tu mesures une donnée soit capable de mesurer
adéquatement ce que t’essaye d’étudier
L’idée de fidélité est que ton instrument de mesure soit capable de répliquer les données
que tu as trouvé
Nombre Population = N
Échantillon = n
On doit toujours garder la même probabilité de choisir quelqu’un quand on fait des
échantillons aléatoires.
Une fréquence absolue est le nombre de.
La fréquence relative est le pourcentage.
La fréquence cumulée est le total des fréquences relative avant.
Les Mesures de tendances centrales:
1- Le mode (Mo)
La plus grande fréquence. C’est la valeur qui revient le plus souvent.
C’est le plus utile pour des échelles nominales, comme les nationalités ou quel est l’objet
qui est le plus vendu par une compagnie.
2- La médiane (Md)
C’est la valeur du milieu. On ne peut pas utiliser la médiane pour des variables nominales,
parce qu’on ne peut pas les mettre en ordre. La médiane peut être plus ou moins utile que
la moyenne. Un avantage de la médiane est qu’elle ne se fait pas influencer par les valeurs
extrêmes.
Formule : Md= (N+1)/2 ou (N-1)/2.
N est la population. La formule te donne la position de la médiane
Exemple : 1, 3, 7, 10, 11
Md= (5+1)/2 = 3.
Alors la médiane est la 3e valeur ou 7
1, 3, 7, 10, 11, 525
Md= (6+1)/2 = 3.5
Dans cette situation, on fait : (7+10)/2= 8.5 La médiane ici est 8.5.
Un des meilleurs exemples ou la médiane est plus utile que la moyenne est pour les
revenues. Parce que la moyenne peut être affecté par quelques personnes qui font
énormément plus que le reste.
3- La moyenne
La moyenne est seulement des variables quantitatives.
C’est la somme des données divisé par le nombre de données.
Formules : 𝜇 =(𝜖 nxi)/N ou X/= (xi)/n
Première formule est pour la population, et la deuxième est pour l’échantillon.
Un problème avec la moyenne est qu’elle est influencé par les extrêmes
Moyenne pondérée :
C’est trouvé une moyenne quand les données ont des valeurs relatives différentes.
Comme par exemple, on l’utilise pour l’IPC. Un pain et une voiture ne sont pas calculées
avec la même valeur, parce que l’IPC est utilisé pour voir le pouvoir d’achat des gens.
L’IPC vont mettre une plus grande valeur pour le pain que pour une voiture, parce qu’on
achète du pain a chaque semaine, mais on achète une voiture une fois par 10 ans environ.
Donc, une augmentation du prix du pain va se faire plus sentir qu’une voiture.
Formule: 𝜇 = 𝜖 ( fi/N) xi
Fi = poids relative
Exemple: Test
Note
#1 20%---82%
#2 30%---85%
#3 50%---61%
0.2(82) + 0.3(85) + 0.5(61) = 72.4%
Distribution :
Distribution symétrique (Normale)
C’est une distribution qui a une forme de cloche sur un graphique
F=fréquence
Le milieu d’une distribution normale est la médiane, la moyenne et le mode.
Distribution Asymétrique
C’est une courbe qui n’est pas égale
Asymétrique négative; la queue va vers la gauche
Un exemple d’une distribution asymétrique négative serait l'Age au Canada, car il y a plus
de vieux que de jeunes
Une distribution asymétrique positive aurait une queue qui s’étire vers la droite, un
exemple serait la distribution du revenu, car il y a moins de personnes riches que de
pauvres.
Les mesures de tendances centrales nous donnent une idée du centre des données. Mais
ça ne donne pas les extrêmes des données. Et ça ne donne pas l’étendus des données.
Une moyenne de 80% dans une classe ne nous laisse pas savoir si les notes sont entre
75% et 85% ou si c’est entre 50% et 95%.
Mesures de dispersion:
Les mesures de dispersions nous donne en général on est comment loin de la moyenne.
1- L’étendue
Ça nous donne la différence entre la plus haute et la plus basse donnée. Ça peut
être extrêmement influencer par les extrêmes
E = Vmax – Vmin
2- La variance (𝜇 ou x)
Ça nous donne en général, comment loin les valeurs varient autour de la moyenne
Exemple : 2,4,6,8
Formule :
Variance: 𝜎 ^2=( Σ(xi-𝜇 )^2)/N Population
s^2= (Σ(xi-x/)^2)/(n-1) Échantillon
La racine carrée de la variance est l’écart type. Ça nous donne la variance moyenne
de chaque observation de la moyenne.
Écart Type
𝜎 =√ ( 𝜎 ^2)
s=√ (s^2)
Coefficient de variation (CV)
Compare différents types de variation et donne un pourcentage de la valeur de
l’écart par rapport à la moyenne.
𝜎
Formule : CV= ( * 100) ou (s/x) x100
𝜇
𝜇 = 125 lbs
σ=8
(8/125) x 100= 6.4%
Quand Cv est plus petit que 15%, la population est généralement homogène, tandis
que quand CV est plus grand que 15%, il y a beaucoup de variation dans la
population. Plus le pourcentage est haut, plus la variation est grande.
Mesures de Position
Ça nous permet de positionner une observation par rapport au reste. Ça permet de
diviser la distribution en différentes parties égales. La médiane est une mesure de
postition.
Ceci sont des Quantiles
Quartiles – 4 parties égales
Quintiles – 5 parties égales
Déciles -- 10 parties égales
Centiles – 100 parties égales
Le rang centile te donne le nombre en pourcentage sous l’observation. Si ton rang
centile est de 72, ça veut dire que tu es meilleur que 72% des observations.
Lire P.211-212
Théorème de Cheybyshev
Au moins (1- 1/(k^2)) des observations d’une distributions doivent (sera) être contenus
entre + ou - k Écart type de la moyenne si (k est plus grand que 1)
K=2
(1-1/2^2) =0.75 = 75%
Cela veut dire que 75% des observations d’une distribution doivent etre entre +2 ou –2 de
l’écart type de la moyenne
Si M = 72 % et o = 3, alors 75% de tous les étudiants auraient entre 66% et 78%.
Distribution normale (symétrique)
Plus le n ou le N de la distribution est grand, plus la distribution va s’approcher de la
symétrie.
En général, on veut un n plus grand ou égal ç 30 pour qu’elle soit normale
La différence entre les deux distributions est l’écart type.
Avec une distribution normale, le théorème de Cheybyshev, n’est plus “au moins” =, mais
on peut dire avec certitude.
68.26% des données sont entre –1 et 1 écart type.
1𝜎 = 1Z
Cote Z
On veut convertir des données en Z pour voir comment rare une donnée est.
Formule:
Z= (Xi - 𝜇 )/ 𝜎 Population
Z – (Xi – X)/s Population
Exemple
Jean guy – note cours – 75%
Moyenne ( 𝜇 )= 65%
Écart type ( 𝜎 )= 10%
Ginette – Note cours = 62%
Moyenne ( 𝜇 )= 52%
Écart type (σ) = 4%
1- Qui a mieux performé que sa classe en générale
Ginette a mieux performé que J.G, car elle a fait mieux que 99.38% de sa classe, tandis que
J.G a seulement fait mieux que 84.13% de sa classe.
2- Ginette a mieux performé que quel pourcentage de sa classe
Ginette a mieux performé que 99.38% de sa classe.
3- Quel pourcentage de sa classe a mieux performé que Jean Guy
J.G a fait moins bien que 15.87% de sa classe.
Les Z les plus utiles:
Z -- +- 1,96 – 95%
Z -- +- 2,575 – 99%
Si on veut trouver la valeur de l’observation a l’aide du Z
Xi = Zσ + 𝜇
QI
𝜇 = 100
𝜎 = 15
Dawson veut admettre seulement les 10% des plus hauts en terme de QI
Le QI accepté serait tout ceux avec un QI supérieur à 119.2
N((x,y)
X: X moyenne
Y: Écart type
N(259,112,5)
Sur Excel, le pourcentage va toujours être à gauche de xi
A: le pourcentage à gauche du z
4 fonctions excel:
Norm. Dist.:
Donne: La valeur de A en décimal alors 0.72 au lieu de 72%
Demande:
xi
X moyenne
S écart type
Dernière question il faut toujours mettre True
Norm. S. Dist:
Donne : La valeur de A
Demande:
Le Z
Norm. INV:
Donne: xi
Demande:
Le A en décimal
La moyenne
L’écart type
Norm. S. INV:
Donne:
Le Z
Demande:
Le A
Il faut commencer par écrire = et après clicker sur les d cases que tu veux additioner ou
soustraire, etc., ensemble
Cote R:
3 éléments pris en considérations:
- La cote Z
- Un indicateur de dispersion du groupe
Ils regardent les écart types des personnes groupe dans leur cours de secondaire
obligatoire.
- Un indicateur de force
Ça regarde la moyenne des cours au secondaire obligatoire des personnes du groupe.
R= ((Z college x IND disp.) + IND force +5)x5
La cote R est faite pour avoir une moyenne de 25, et un écart type de 5.
Inférence
1- Estimation – Estimé Moyenne en utilisant X/
2- Test – Tester hypothèse à propos d’une population à partir d’une donnée d’un
échantillon
3- Régression -- Prédire une valeur d’une population en utilisant des données d’une
échantillon
4 concepts pour aider à faire de bonnes inférences
1- Échantillon aléatoire
- Chaque individues à une chance égale d’être choisie
- Chaque échantillon à une chance égale d’être choisies
2- Erreur d’échantillonnage
- La différence entre la valeur obtenue de l’échantillon et la valeur qu’on aurait eu
avec la population.
- Example : Revenue moyen à Westmount Moyenne= 180 000$
Échantillon : n=300 X/1 =170 000$
Il y a une erreur d’échantillonnage de 10 000$
3- Distribution d’échantillonnage des moyennes
Ex: Échantillon des revenues à Westmount
X/1=170 000$
x/2 = 180 000$
x/3 = 350 000$
x/4 = 192 000$
...
X/n = 210 000$
𝜇 = 180 000$
Avec toutes ces échantillons, on pourrait faire une distribution de la valeur de
toutes les moyennes des échantillons possibles. C’est la distribution de TOUTES
les échantillons possibles
Ceci est un concept théorique, car ce n’est pas réaliste de prendre un ci grand
nombre d’échantillons
La distribution de la population sera asymétrique, car le revenu n’est pas une
distribution qui est normale.
4- Théorème central limite
- Donne les caractéristique de la distribution d’échantillons des X/
Toujours vrai si n est plus grand que 30
- A force que n grandit, la distribution d’échantillon moyenne devient normale.
(Toujours si n est plus grand que 30)
- Même si la distribution de la population ne l’est pas.
Si population a une distribution normale – Distribution d’échantillonnage X/ sera
normale peut importe n.
- La moyenne de la distribution d’échantillons X/ nommé 𝜇 x/
- Écart type de la distribution d’échantillonnage X/: 𝜎 x/ = Erreur type
La valeur de : 𝜇 x/= 𝜇
La valeur de 𝜎 x/= 𝜎 /(n^(½))
Dans ce théorème, le z est :
Z = (X/ - 𝜇 x /)/(𝜎 x/)
Ex: Note cours
𝜇 = 70%
𝜎 = 7%
C’est quoi la probabilité de choisir au hasard 1 élève avec une note etre 65% et 75 %?
65%: Z = -0.71 75%: Z = 0.71
La chance de trouver cet étudiant est de 52,24%
C’est quoi la probabilité de choisir un échantillon de 5 élèves avec une moyenne entre 65%
et 75%.
𝜎 X/= 7/5^(½)= 3.13
Z= (75-70)/3.13)=1.6
Z = -1.6
Z: 1.6= 0.4452
0.4452+0.4452= 0.8904
Tu as une chance de 89.04% de choisir un échantillon comme ça.
L’estimation et les intervalles de confiance
On veut prendre notre X/ et avoir un intervalle autour du X\ qui devrait avoir le 𝜇 ou tu as
un pourcentage de chance que ton intervalles est correct.
X/=170 000$
+- 5000
Ici tu es 90% sûr que ton 𝜇 est entre 165 000$ et 175 000$.
Il y a 2 scénarios possibles quand tu fais des intervalles.
1- 𝜎 est connu
2- 𝜎 Est inconnue
2 est beaucoup plus commun.
Si 𝜎 est connu, Intervalle de confiance (I.C) ?
Niveau de confiance:
- 90% C=0.9
- 95% C=0.95
- 99% C=0.99
Cela nous amène a trouver le Zc
Zc= 0.95 =+-1.96
Zc= 0.99 =+-2.575
Ex: Savoir QI moyen des Étudiants de Dawson.
𝜎 =15me
n= 400
X/ = 121
On veut construire un intervalle autour de ce chiffre avec un degré de confiance de 95% ou
c=0.95
I.C. = X/ +- Zc*𝜎 x/
I.C.= 121 +- 1.96*0.75
I.C. = 121 +- 1.47
Je suis sûre à 95 % que le QI moyen à Dawson est entre 119.53 et 122.47
Si on augmente l’intervalle, la certitude agrandi, mais la a précision est plus basse.
En augmentant le n, notre 𝜎 x va diminuer, ce qui va diminuer l’intervalle.
Zc𝜎 x= marge d’erreur (E)
On peut écrire l’équation comme
I.C.= X/ +- E
On peut aussi écrire
E = Zcσ/√ n
Avec ça on peut décider exactement c’est quoi notre marge d’erreur.
Si l’on veut que E soit 1
E*√ n = Zc𝜎
n = ((Zc𝜎 )/E)^2
864,36 = ((1,96*15)/1)^2
n = 865
Excel
Confidence Norm.
Donne: E
Demande:
Alpha (a): le seuil de signification. C’est le reste de ton c
Alors c’est égal à 1-c.
Quand on “sort” il faut s’assurer d’avoir les bonnes données ensembles.
Le X est la valeur de T et non la valeur.
[Link]. est toujours a gauche.
[Link] est pour la droite
[Link].2T est pour les 2 tails.
Le Deg. Freedom est le n-1.
I.C quand σ n’est pas connu.
- Estimer σ aves s.
Σ avec sx/.
On ne sait pas dans ce cas si la distribution est normale.
Alors on ne peut plus utiliser Z.
Sx/ --Distribution t.
- Symétrique
- +- T
- 𝜇 X / milieu
Comment lire tableau:
One tail area – seuil de signification. Regarde seulement 1 extrémité
Two-tail area – seuil de signification. Regarde les 2 extrémités de la distribution. Si c’est
0.020, donce chaque coté est le 1% chacun qui ne rentre pas dans le seuil.
d.f.\c -- degré de confiance
d.f. = Degrees of freedom
d.l. degré de liberté
C'est une façon de compenser pour l’idée qu’on fait des estimations.
d.l. = n-1
On ne peut pas juste regarder le c, si on veut 95% et on regarde juste 1 coté, alors on
prendrait le c 0.9 avec one-tail area de 0.05.
Example:
N= 10
C = 95%
2-tailed t= 2.262
La derniere rangée avec le signe infini sont pour les chiffres plus haut de milles.
Passé milles les valeurs de t sont égales à Z.
Erreurs communs est d’oublier que les degrées de libertés sont n-1.
I.C = X/ +- t*sx\
Sx/=s/√ n
Exercise:
N = 50
C = 95%
Two-tailed t= 2.014
Pour 1 cote, on va juste faire +. ou -.
I.C. Pour Des Pourcentage
(Sondage)
La réponse n’est plus une moyenne, c’est le pourcentage des personnes sondées qui ont
répondu quelque chose a une question. Par exemple: 45% des personnes ont répondu oui
dans le sondage.
P: Pourcentage
I.C. = P+-E
I.C. = P+- Z ou t *Sp
Sp: erreur type
P= % obtenue au sondage
n= Grandeur de l’échantillon
Quand utiliser Z ou t?
Ça dépend de n.
Dépendemment de la source le n necessaire pour utiliser z au lieu de t est different.
Ici il faudrait utiliser Z seulement si n est plus grand que 1000.
La réponse doit etre écrite comme çca: Dans les médias ils écriveraient: D’apres un
sondage, 54% des québécois aiment la poutine. Avec une marge d’erreur de +- 9,9%. Vrai
19 fois sur 20.
Test d’hypothèses
La relation qu’on s’attend a avoir entre nos variables
On pourra jamais etre 100% sure de notre réponse, mais on pourra dire avec un certain
dégrée/% de confiance
On aura une probabilité d’erreur
On ne saura jamais si notre hypothèse est valide ou non, mais on sait le pourcentage de
chances qu’elle soit fausse.
Si le σ est connu:
Hypothèse, manger de la poutine augmente le QI
On teste l’effet de manger de la poutine sur le QI
Échantillon de personnes qui mangent de la poutine
n= 144
X/ = 103
Population
μ= 100
σ= 15
µp= 100 si la poutine a aucun effet sur le QI
Alors, est ce qu’un X/ de 103 est assez différent de la population pour faire une conclusion
sur l’effet de la poutine?
Alors est ce que le 103 est du a la chance et que l’échantillon a seulement pris des
personnes avec un plus haut QI, ou si la poutine a réellement un effet? C’est cela qu’on
veut savoir.
On a toujours 2 Hypothèses:
1- Hypothèse nulle (H0): Nulle = 0
Dans le sens que la variable n’a pas d’effet
2- Hypothèse alternative (H1):
Variable a un effet
On doit toujours faire les 2 hypothèses en meme temps
Les deux doivent toujours etre mutuellement exclusives,
Et mutuellement exhaustives, voulant dire que c’est impossible que les deux soit fausses,
la réponse doit soit affirmer une ou l’autre.
Exemple:
H0 : Manger de la poutine n’a pas d’effet sur le QI
Ou : Les gens qui mangent de la poutine n’ont pas un QI différent des autres.
H0 : µp (Mu de gens qui mangent la poutine) = µpop
Ou : µp = 100
H1 : Manger de la poutine a un effet sur le QI
Ou : Les gens qui mangent de la poutine ont un QI différents des autres
H1 : µ n’est pas égal à µpop
Ou : µp n’est pas égal à 100
Il faut faire attention quand on formule notre hypothèse pour demander si ça l’a un effet
positif, un effet négatif ou simplement un effet.
On part toujours en assumant que H0 est vrai
Si H0 est vrai: µp = 100
X/ = µx/ = 100
σ = σ/√n
Cela est seulement vrai si H0 est vrai
Avec ces données on peut faire un I.C., maintenant appelé valeur critiques.
Valeur critique: Limite de la(les) zones de rejet de HO
VC = µATT +- Zσx/
µATT = µ qu’on s’attend à voir si H0 est vrai
σx/= 15/√144 = 1.25
VC = 100 +- 1,96(1.25)
VC = 100+- 2.45
VC = 97.55 à 102.45
Je rejette H0, j’accepte H1 avec un dégrée de confiance de 95%. Oui la poutine a un effet.
Si l’on change le dégrée confiance à 99%, z va changer à 1.575, le E va changer à 3.22 et le
X/ ne va plus etre à l’extérieur, des VC et maintenant on ne refuse pas H0
Si on n’est pas a l’extérieur des VC, je ne peux pas accepter H0, je peux seulement ne pas
rejeter H0. Je rejette H1, car je ne rejette pas H0. Je ne peux aussi pas donner un degré de
confiance au rejet de H1 les résultats sont simplement inconcluants.
Si on ne connait pas σ
Estimer σx/ avec sx/
Et on utilise t si n est petit
VC = µATT +- tsx/
Exemple : On veut savoir si venir à Dawson a un effet une fois que les étudiants sont à
l’université JMSB
n = 51 gradués de Dawson
X/ = 73% note moyenne
s=8
μJMSB = 71%
C= 95%
1- Hyp:
H0 : Les gradués de Dawson ne sont pas différents des autres étudiants de JMSB
H1 : Les gradués de Dawson ont des notes différentes des autres étudiants de JMSB
H0 : µD = µJMSB ou µD=71%
H1: µD =/ µJMSB ou µD =/71%
Sx/ = 8/√51 = 1.12
t = C = 95%, d.l = 50
t = 2.009
VC = µATT =- tsx/
VC = 71 +- 2.009(1.12)
VC = 71 +- 2.25
VC = 68.75 à 72.25
On n’a pas besoin de mettre t dans ce graphique. Mettre VC à la place le ZR (Zone de rejet)
On ne rejette pas HO, donc on rejette H1.
Si H0 est vrai, le X/ doit etre dans la distribution.
Ho et H1
Soit on rejette Ho (accepter H1) avec % degée de confiance (C)
Soit on ne rejette pas Ho (rejette H1) avec aucun degrée de confiance. Résultat non-
concluant.
Les 2 types d'erreurs qu’on peut faire sont :
- Rejeter H0 quand en réalité Ho est vrai
- Ne pas rejeter H0 quand en réalité H0 est faux
2 types d’erreurs possibles :
1- Erreur type 1: Rejeter H0 quand H0 est vrai en réalité
- Probabilité de faire une erreur type 1 : alpha (1-c)
2- Erreur type 2: Ne pas rejeter H0 quand H0 est faux en réalité
- Probabilité de faire une erreur type 2: B (Beta)
On ne connait pas la valeur de B
On peut accepter H1, car on sait c’est quoi la probabilité d’erreur, mais on ne connait pas
beta, donc on ne peut pas accepter H0
Erreur type 1:
Le chercheur a une influence sur si il fait une erreur de type 1. S’il veut diminuer ses
chances de faire une erreur de type 1il a qu’a diminuer l’alpha et d’augmenter le C pour
diminuer la zone de rejet.
Erreur type 2:
Exemple Dawson:
μjmsb = 71%
X/D = 73%
VC = 68,75 à 73,25
Réalité:
Dans l’échantillon on dit que les valeurs par-dessus 73,25 prouvent que H0 est fausses,
mais en réalité le vrai µ est 75, donc on a fait une erreur de type 2. L’intervalle oû on rejette
H1 serait dans la vrai courbe, Beta. Cependant, si on ne connait pas le vrai µ, on ne peut
pas connaitre les chances qu’on a commis une erreur.
Pour diminuer tes chances de faire une erreur de type 2, il faut augmentes alpha pour
diminuer beta. Ce qui est contraire à ce qu’il faut faire pour diminuer les chances de faire
une erreur de type 1.
Si je veux minimiser la probabilité de faire une erreur de type 1 = On prend un petit alpha
(alpha = 1%)
Si on veut minimiser la probabilité de faire une erreur de type 2 = On prend un grand alpha
pour que B plus petit (alpha = 5%)
Exemple:
Recherche: Employeur veut envoyer ses employés à un atelier pour réduire le stress, mais
l’atelier coute cher.
Niveau stress initial = 6
Étape 1:
H0: l’atelier ne réduit pas le stress
μaprès est plus grand ou égal à 6
H1: L’atelier réduit le stress
µaprès est plus petit que 6
Étape 2: qu’est ce que ça implique de faire une erreur
Erreur type 1: rejeter H0 quand H0 est vrai
Tu dirais que l’atelier est efficace, quand en réalité il ne l’est pas
Erreur type 2: ne pas rejeter H0 quand H0 est faux
Tu dirais que l’atelier n’est pas efficace quand en réalité il est efficace.
Étape 3: la conséquence si l’on fait une erreur.
Si on fait une erreur de type 1, l’employeur va envoyer ses employés à l’atelier et va
gaspiller son argent pour rien.
Si on fait une erreur de type 2, l’employeur ne les envoie pas à l’atelier, mais il aurait dû. Il
perd rien, il perd simplement l’opportunité d’améliorer.
Donc, l’erreur de type 1 est pire.
On va minimiser l’alpha et augmenter la confiance.
À faire à la maison:
Santé Canada veut évaluer une nouvelle version d’un médicament pour voir si il y a moins
d’effets secondaires négatives que la version originale. La version originale a 3 effets
secondaires négatifs.
H0: La nouvelle version du médicament n’a pas moins d’effets secondaires que la version
originale
µnouveau plus grand ou égal à 6
H1: La nouvelle version du médicament a moins d’effets secondaires que la version
originale
µnouveau plus petit que 6
Qu'est que ça implique de faire une erreur:
Type 1:
Tu dis que le médicament a moins d’effets secondaires quant en réalité c’est faux.
Type 2:
Tu dis que le médicament n’a pas moins d’effets secondaire quand en réalité il en a moins.
Si on fait une erreur de type 1, on approuverait un médicament qui a le meme montant
d’effets secondaires ou plus et on le vendrait comme ayant moins. On risque des
problemes légaux
Si on fait une erreur de type 2, on n’approuve pas le médicament et on perd l’opportunité
de donner un médicament qui a moins d’effets secondaires.
Juste inverse tout et c’est correct
Test unilatéral:
Vs
Test Bilatéral
Bilatéral:
H1: µ après n’est pas égal
Unilatéral à gauche :
H1: µ après est plus petit
Unilatéral à droite:
H1: µ après est plus grand
Tableau t:
Pour une trouver le t unilatéral, on prend le alpha qui est sur la colonne one-tail area.
Exemple, pour un c=99%, on prend le one-tail area 0.010
Pour trouver le t bilatéral, on prend celui sur la colonne du two-tail area.
Valeur P
C’est la valeur de la probabilité de trouver un X/ spécifique étant donné notre H0.
Si notre X/ est dans la zone de rejet, on va le transformer en t pour connaitre la valeur au
delà du t.
P= Aire sous la courbe de notre X/ et au delà. Soit à gauche, à droite ou des deux bords.
On rejette H0 si P est plus petit que alpha.
On ne rejette pas H0 si P est plus grand que alpha
Trouver P = Convertir X/ en t
t =(x/i - µATT) /sx/
Test bilatéral
d.l = 20
Alpha = 5%
Troue que t = 2.2
Il n’y a pas exactement un t de 2.2 avec un d.l de 19, donc on le met entre:
2.086 < t < 2.528
2.086 = 0.05 2.528 = 0.02
On doit changer de côté les alphas quand on fait P
0.02 < P < 0.05
Exemple: Ford veut sortir sa nouvelle version d’une Ford focus et Ford veulent promouvoir
le fait que cette nouvelle version consomme moins d’essence que les versions
précédentes.
Vieux modèle: 28 km/L
Échantillon de 55 nouveau modèles et trouvent que
X/=30 km/L
S=6
H0: Le nouveau modèle consomme ne consomme pas moins d’essence
µN Plus petit ou égal à 28km/L
H1: Le nouveau modèle consomme moins d’essence
µN plus grand que 28 km/L
Erreur de type 1:
C’est de dire que le nouveau modèle est plus performant quand en réalité il ne l’est pas
Erreur de type 2:
Dire que le nouveau modèle n’est pas plus performant quand en réalité il l’est
Conséquence:
Type 1: Ford va perdre de l’argent en faisant de la fausse publicité et les gens vont perdre
confiance
Type 2: Ford va manquer l’occasion de promouvoir la meilleure consommation d’essence
de leur nouveau modèle
VC = µATT + tsx/
Sx/ = 6/√55 = 0.809
T = alpha 1% d.l. = 50
T= 2.403
VC = µATT + tsx/
VC = 28+ 2.403*0.809
VC = 29.94
Valeur P:
T= (30-28)/0.809 = 2.47
2.403 < 2.47(t) < 2.678
0.005< P < 0.01
Alpha = 0.01
P < alpha on rejette H0
Fonction Excel
[Link] - unilatéral à gauche
[Link] - Unilatéral à droite
[Link].2T - Bilatéral
Demande:
- X = Valeur de t calculé
Quand tu calcules ton t: = (D32:X//-µATT)/(E33:s/sqrt(D25:n)
- Dégrée de liberté (d.f) = (n-1)
- Cumulative – on écrit TRUE
Donne:
- La valeur P
Avec ton P, tu peux voir si c’est plus grand ou plus petit que alpha et voir quel H tu
rejettes.
Si le t est négatif pour un two tail test, on met le t en positif quand on calcule.
On laisse seulement le négatif quand on fait un test unilatéral à gauche.
Tester différence entre 2 échantillons (Pour voir si 2 populations sont différentes)
2 types de “paire” d’échantillons
1- Echantillons appariés (liés)
- Si la sélection d’un échantillon a un impact sur la sélection de l’autre. Une fois
que t’as choisi un tu n’as pas de choix de choisir l’autre.
Ex: pré-test vs post-test
Si tu regardes 10 intersections avant et après la loi sur les virages à droite. Les
10 intersections que t’as choisies avant vont etre les mêmes que les 10 après
2- Échantillons indépendants
Ils sont pas liées.
Ex: Si tu choisis un échantillon de personnes au Canada et un autre de
personnes au Québec, les 2 échantillons n’ont pas d’effets sur l’un et l’autre.
Méthodes quand on a /échantillons lies
Disons qu’on veut comparer les notes moyennes des élèves avant et après l’interdiction
des téléphones, puis on veut voir si la nouvelle loi a causé un changement au sujet des
notes.
n = 25
X/av = 68%
X/ap = 72%
C= 95%
H0: la note moyenne des élèves n’est pas différentes après l’interdiction des téléphones
H1: les notes moyennes sont différentes après l’interdiction des téléphones.
H0: µAV = µAP ou µD/ = 0
H1: µAV /= µAP ou µD /= 0
D/obs = 4
Sd=7
VC = µD/ ±tsD/
SD/ = sd/√n = 7/√25 = 1.4
C = 95%
d.l. = 24
Bilattéral
t= 2.064
VC = 0±2.064(1.4)
VC = ±2.89
Dobv > VC
On rejette H0, on accepte H1, donc les notes sont diff/rentes avec une confiance de
95%
Valeur P:
t = (D/obs - µD/ATT)/sD/
= (4-0)/1.4 =t calcule =2.86
2.797 > t > 3.745
0.001 > p > 0.01
C = 95% , alpha = 5%
P< alpha, donc on rejette H0 et one accepte H1.
Écart type des différences
Sd = √((Σ(d-D)^2)/n-1)
D = différence observé
d = différence de chaque individu avant et après
Il ne demandera jamais de calculer un sd.
Sd = 7
Le sd est l’écart type.
VC = µD/ATT ± tsD/
Erreur type:
sD/ = sd/√n
Méthodes échantillons indépendants
On veut comparer les étudiants de méthodes quantitatives de dawson et de vanier.
H0: Les étudiants de méthodes quantitatives de Dawson ne sont pas différents de ceux
de Vanier.
µD = µV
H1: Les étudiants de méthodes quantitatives de Dawson sont différents de ceux de
Vanier
µD /= µV
C = 95%
Dawson:
n = 19
X/ = 73%
S =2.12
Vanier:
n = 23
X/ = 71%
S = 2.23
Erreur type:
VC = D/ATT ± tsx/1-x/2
t --
C
Bil ou uni
d.l. = (n1+n2) -2
= √(((19-1)2.12² + (23-1)2.23²)/((19+23)-2)) x (1/19+1/23))
= 0.676
C=95%
Billatéral
d.l = (19+23)-2 = 40
t=2.021
VC = 0 ± 2.021*0.676
= 1.37
D/obs = 2
Donc on rejette H0
Valeur P Échantillon indépendant
Tcalculé = ((x/1-x/2)-(µ1-µ2)) / √(s1²/n1 + s2²/n2)
Ou D/obs - D/ATT
Tcal = (2-0)/(2.12²/19 + 2.23²/23)
= 2.949
d.l. = (plus petit n )- 1
d.l. = 19 – 1 = 18
2.878 < t < 3.922
0.001 < p < 0.01
P < alpha, donc on rejette H0 et on accepte H1
Excel
2 échantillon liés = [Link], etc.
2 échantillons indépendants = [Link]
Donne P
EX. On veut voir si la vitesse moyenne des autos américaines est plus petites que la
vitesse moyennes des autos allemandes
X/ÉU = 168 km/h
SÉU = 3.8
nÉU =27
X/ALL = 170.5 KM/H
SAL = 2.7
nALL = 25
C=95%
Excel
1 echantillons vs valeur connu
[Link] (RT, 2T)
2 échantillons
[Link]
Méthode #3 pour tester H0 vs H1 pour échantillons independants
I.C. = D/OBS - E < D/ATT < D/OBS + E
E = t√(s1²/n1+s2²/n2)
• T --> tableau
• d.l. = plus petit n-1
Quand I.C. contient tous des chiffres positifs ou tous des chiffres négatifs, on rejette h0,
on accepte H1 avec % confiance
Si IC à des chiffres positifs et négatifs, on ne rejette pas H0.
Ici on rejette H0, car le DATT n’est pas dans l’intervalle
Ici on ne rejette pas H0.
Exemple avec les voitures allemandes et americaines:
C = 99%
D/ATT = 0
D/ OBS = -2.5
S1 = 3.8
N1 = 27
S2 =2.8
N2=25
E = t√(s1²/n1+s2²/n2)
T = c=99&
d.l. = 25-1 = 24
Unilatéral
T = 2.492
E = 2.492√(3.8²/27+2.8²/25)
E = 2.295
I.C. --> -2.5 - 2.295 < 0 < -2.5 + 2.295
I.C. = -4.795 < 0 < -0.205
Tous négatifs, donc on rejette H0 et on accepte H1, car l’intervalle ne fait pas de sens
Quand nos données sont nominale ou ordinale
On ne peut pas trouver X/
On va former des hypothèses autour des fréquences.
H0 et H1 vont regarder la distribution des fréquences.
On va utiliser un test d’indépendance
Test Khi-Carré
X ² = (Σ(fo-ft) ²)/ft
Fo = Fréquence observée
Ft = Fréquence théorique
Quand X ² calculé > X ² Tableau --> Rejette H0 et on accepte H1 avec degré de
confiance
X ² Tableau
1ere ligne = alpha
1ere colonne = d.l.
d.l. = k-1
K = Nombre de catégories
Excel: CHISQ. TEST
Donne P
Exemple: Voir comment les opinions des élèves de méthodes quantitatives sont
distribué par rapport l’utilité du cours de MQ. On veut voir si les opinions sont
distribuées également.
H0 est toujours la fréquence suit notre fréquence théorique
H0: Les opinions des élèves de méthodes quantitatives sont divisées de façon égale à
propos de l’utilité du cours de MQ.
H1: Les opinions des élèves de méthodes quantitatives ne sont pas divisées de façon
égale.
Question posé: Que pensez-vous de l’utilité des méthodes quantitatives
Catégories:
D’accord
Peu d’accord
Pas d’accord
Fréquence Observé:
D’accord (35)
Peu d’accord (10)
Pas d’accord (15)
Total (60) = n
Quand H0 est vrai que la fréquence est divisé également
Ft = n/k
Ft = 20
X² = (Σ(fo-ft)²)/ft
X² = ((35-20) ² + (10-20) ² + (15-20) ² )/20
X² = 17.5
X²cal = 17.5
alpha = 5%
d.l. = k-1 = 2
X² tab = 5.99
X²cal > X²tab = rejette H0 et on accepte H1 avec une confiance de 95%
X²tab c’est notre valeur critique
Exemple pour la maison: Le gouvernement veut savoir si la distribution des sujets que
la population trouve le plus important sont pareil qu’aux dernières élections.
On veut un C=99%
Dernière élection:
Catégories %qui pensent que c’est le plus important
Santé 35%
Environnement 10%
Emploi 33%
Éducation 22%
On prend un échantillon de 300 personnes et on a les résultats suivant
Catégories Fréquence observé
Santé 114
Environnement 42
Emploi 93
Éducation 51
Ft =
Santé: 35% de 300 = 105
Environnement: 10% de 300 = 30
Emploi: 33% de 300= 99
Éducation: 22% de 300 = 66
X² = (Σ(fo-ft)²)/ft
X² = ((114-105)²/105+(42-30)²/30+(93-99)²/99+(51-66)²)/66
X² cal = 9.34
X² tableau = 11.35
X² cal est plus petit que X² tableau, donc on refuse H1 et on n’accepte pas H0
Corrélation:
Une corrélation ne veut pas nécessairement dire une causalité. Une corrélation veut
seulement dire qu’il y a une relation entre deux choses.
On peut avoir des corrélations positives, des corrélation négatives ou nulles.
Corrélation positive: Si ta variable indépendante monte, ta variable dépendante monte
Corrélation négative: Si ta variable dépendante monte ta variable dépendante descend
Corrélation nulle: il n’y a pas de corrélation
On a aussi des corrélations fortes ou faibles.
Sur un graphique, notre x est notre variable indépendante et notre y est notre variable
dépendante.
On a un nuage de points avec toutes nos données sur le graphique
Une corrélation parfaite, c’est quand tout tes points sont alignés parfaitement.
Le coefficient linéaire de corrélation (r)
r = 0 nulle
r = 0.25 faible
r = 0.5 moyen
r = 0.75 fort
r = 1 parfait
Mème chose quand c’est négatif
Le r nous donne un sens de l’intensité de la corrélation entre les deux variables.
Formules:
Formule 1:
Formule 2:
Une astuce pour aider avec les formules est de faire les calculs séparément et replugger
les chiffres dans la formule.
On peut calculer le pourcentage de la variation de y (variable dépendante) qui est
attribuable à la variation de x (variable indépendante).
On appelle ça le coefficient de détermination
Formule: (r^2)
Dans le cas ou r^2 est = a 0.72, cela veut dire que 72% de la variation de y peut etre
expliqué par la variation de x. Ça veut aussi dire que 28% de la variation de x est causé par
des variables externes.
Tester la “validité” de r
Est-ce que r est statistiquement significatif?
H0: r = 0
H1: r /= 0
Tableau r:
Alpha de 5% ou de 1%
d.l. = n-2
Ça donne ta valeur critique. Ça te dit que ton r doit etre au moins de “Ça” pour qu’il soit
significatif.
Dans l’exemple, notre n est de 4 et notre r = 0.849
Le tableau nous dit qu’avec un d.l. de 2, on a besoin d’avoir une corrélation d’au moins
0.95, donc notre r n’est pas significatif. Dans ce cas tu ne rejettes pas H0.
Excel:
Il y a la fonction de Corrèl ou Pearson. Même formule.