0% ont trouvé ce document utile (0 vote)
0 vues82 pages

Examen Math

Le document présente les techniques d'échantillonnage et d'inférence statistique, en détaillant les méthodes aléatoires et non aléatoires pour sélectionner un échantillon représentatif d'une population. Il explique les principes de l'échantillonnage, les implications en inférence statistique, et fournit des exemples pratiques pour chaque méthode. Enfin, il souligne l'importance de l'échantillonnage aléatoire pour garantir la validité scientifique des résultats obtenus.

Transféré par

mamankhadydiop221
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
0 vues82 pages

Examen Math

Le document présente les techniques d'échantillonnage et d'inférence statistique, en détaillant les méthodes aléatoires et non aléatoires pour sélectionner un échantillon représentatif d'une population. Il explique les principes de l'échantillonnage, les implications en inférence statistique, et fournit des exemples pratiques pour chaque méthode. Enfin, il souligne l'importance de l'échantillonnage aléatoire pour garantir la validité scientifique des résultats obtenus.

Transféré par

mamankhadydiop221
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

MIASS 121.

1
MATHÉMATIQUES 2
(APPLIQUÉES AUX SCIENCES SOCIALES)

© El Hadj Touré, PhD. Sociologie


Département de sociologie, UGB de St-Louis

Cours 5
Techniques d’échantillonnage &
inférence statistique

21:55 1
Au programme

■ Appliquer les techniques d’échantillonnage dans un


sondage et en connaître les implications en inférence
– Principes de l’échantillonnage
– Échantillonnage aléatoire ou probabiliste
❖ Simple, systématique, stratifié, en grappes, aréolaire
– Échantillonnage non aléatoire ou empirique
❖ Quotas, volontaires, accidentel, typique, boule de neige
– Lien entre échantillonnage et inférence statistique
❖ Des conditions de l’inférence

■ Résolution de problèmes pratiques en lien avec les


techniques d’échantillonnage
21:55 2
Échantillonnage
Illustration
Population
+ + + + +
+ + + Unité
+ + +
d’analyse
+ + + +
+ + Échantillon
+ + + +
+ + + + + Cas

+ + + + +
21:55 + 3
Échantillonnage
Sélection d’un échantillon
■ Trois concepts clés
– Population N: ensemble étudié (individus)
– Échantillon n: sous-ensemble enquêté (cas)
– Échantillonnage: Fait de sélectionner n pour représenter N

■ Pourquoi échantillonner?
– Réduction des coûts
– Gain de temps
– Faisabilité

👉 On cherche à minimiser l’erreur d’échantillonnage


(erreur due au fait de sélectionner n pour représenter N)
21:55 4
Échantillonnage
Deux méthodes dominantes
1. Échantillonnage aléatoire ou probabiliste
– Les individus de l’échantillon n sont choisis au hasard, par
tirage au sort (principe du chapeau, du hasard)
– Nécessite plus souvent qu’autrement une base de sondage
(liste numérotée et exhaustive des individus de N)

2. Échantillonnage non aléatoire ou empirique


– Les individus de l’échantillon n sont choisis selon des
critères de façon à reproduire N (principe de la maquette,
du modèle réduit)
– Ne nécessite pas de disposer d’une base de sondage
21:55 5
Échantillonnage aléatoire
Aperçu
■ Méthode d’échantillonnage aléatoire…
– Appropriée lorsqu’on dispose habituellement d’une base de
sondage et qu’on veut sélectionner des individus au hasard
pour obtenir un échantillon représentatif de N

■ Survol de 5 techniques ou modes d’échantillonnage


aléatoire ou probabiliste
1. Échantillonnage aléatoire simple
2. Échantillonnage aléatoire systématique
3. Échantillonnage stratifié
4. Échantillonnage en grappes
5. Échantillonnage aréolaire
21:55 6
Échantillonnage aléatoire
1. Échantillon aléatoire simple
■ Quand? Si on dispose d’une base de sondage fiable, et
que la population est plutôt homogène (N)
■ Comment? Par tirage aléatoire à partir d’une loterie ou
d’un générateur de nombres aléatoires (table, logiciels)
■ Exemple: tirer au sort un n de 100 étudiants à partir d’un
fichier (N = 1000) pour étudier leurs conditions de vie
– Choisi un point de départ sur la table, et le chemin
– On aura 031, 925, 868, etc. jusqu’à obtenir les 100 cas.
03160 92576 86855 74058 64846 06404 76596 94471 94135 95246
10051 93685 27803 43040 08325 98438 94271 64021 05710 47952
74641 49405 32586 02128 21572 05469 55807 75215 13976 72708
52592 96113 98276 22136 51569 71384 25879 24631 41623 33804
72945 02020 44435 54701 18757 13608 07809 27487 92480 45265
21:55 Table de nombres aléatoires générés avec Excel 7
Échantillonnage aléatoire
2. Échantillon systématique
■ Quand? Si on dispose d’une base de sondage fiable, et
qu’on veut sélectionner les individus selon un intervalle
■ Comment? Par tirage aléatoire à partir d’une règle
systématique (en se donnant une raison de sondage)
■ Études? Contrôle de qualité, sondages ‘sortie des urnes’
– Exemple : Un prof veut contrôler la qualité des corrections
de 60 copies (N) réalisées par son assistant. Il veut
sélectionner 6 copies (n) aux fins du contrôle.
❖ Se donner une raison de sondage: N/n = 60/6 = 10
❖ Choisir l’origine, càd un individu (copie) au hasard, soit 5
❖ En partant de ce chiffre, l’échantillon de 6 copies est ainsi
constitué: 5, 15, 25, 35, 45, 55.
21:55 8
Échantillonnage aléatoire
3. Échantillon stratifié
■ Quand? Si on dispose d’une base de sondage et que la
population est caractérisée par des strates (groupes)
■ Comment? Par tirage aléatoire dans chacune des strates
(échantillon proportionnel ou non proportionnel)
■ Études? Problèmes sociaux: inégalités, chômage…
– Exemple : Un chercheur veut étudier les inégalités
salariales selon le sexe: N=1000; n=100
Femmes Hommes
N 550 450
n1 55 45 n1: Échantillon proportionnel
n2 50 50 n2: Échantillon non proportionnel
21:55 9
Échantillonnage aléatoire
4. Échantillon en grappes
■ Quand? Si on ne dispose pas d’une base de sondage et
que la population est découpée en grappes (quartiers,
immeubles, rue, bureaux de vote, moments de visite…)
■ Comment? Par tirage aléatoire des grappes, et soit en
enquêtant tous les individus des grappes retenues ou en
sélectionnant aléatoirement des individus
■ Études? D’ordre spatiotemporel: élections, immigration…
– Exemple 1 : Un chercheur veut étudier le vote. Il choisit au
hasard 2 bureaux (N=10), et interroge tous les électeurs
– Exemple 2: Un chercheur veut étudier l’immigration dans
un quartier d’accueil. Il choisit au hasard 1 quartier (parmi
trois), 10 immeubles, puis 30 immigrants
21:55 10
Échantillonnage aléatoire
5. Échantillon aréolaire
■ Quand? Si on ne dispose pas d’une base de sondage et
que la population cible est dispersée sur un territoire
découpé en sous-zones géographiques ou « aréoles »
(régions, villes, quartiers, pâtés de maisons, parcelles)
■ Comment? Découpage du territoire en aréoles et
sélection aléatoire des aréoles puis des individus
■ Études? Caractère territorial : enquêtes sur les ménages
– Exemple 1 : D’abord, on divise le site en plusieurs quartiers
(aréoles). Ensuite, on sélectionne un ou quelques-uns de
ces quartiers. Enfin, on choisit au hasard un point de
départ et on sélectionne par exemple chaque patté de 10
maisons pour y enquêter un membre du ménage
21:55 11
Échantillonnage non aléatoire
Aperçu
■ Méthode d’échantillonnage non aléatoire…
– Appropriée lorsqu’on ne dispose pas d’une base de
sondage et qu’on veut sélectionner des individus pour
obtenir un échantillon caractéristique de N

■ Survol de 5 techniques ou modes d’échantillonnage non


aléatoire ou empirique
1. Échantillonnage par quotas
2. Échantillonnage de volontaires
3. Échantillonnage accidentel (ou « à l’aveuglette »)
4. Échantillonnage typique (ou par choix raisonné)
5. Échantillonnage en boule de neige
21:55 12
Échantillonnage non aléatoire
1. Échantillon par quotas
■ Quand? Si on souhaite que l’échantillon n ait une
structure sociale identique à celle de la population N
■ Comment? Reproduction des caractéristiques de N dans
l’échantillon selon les mêmes proportions ou quotas
– Quotas de sexe, groupe d’âge, profession, etc.
■ Études? Problèmes sociaux : à profils diversifiés
– Exemple : Un chercheur veut étudier les inégalités
salariales selon le sexe: N=1000; n=100
👉 Il suffit de définir les quotas
Femmes Hommes
(55% de femmes et 45%
N 550 450 d’hommes) et d’interroger les
n2 55 45 individus qui y répondent
21:55 13
Échantillonnage non aléatoire
2. Échantillon de volontaires
■ Quand? Si on souhaite sélectionner de façon spontanée
des personnes volontaires suite à un appel à participation
■ Comment? Lancement d’un questionnaire publicisé
(Internet, presse) et invitation des gens à participer
■ Études? Tabous ou déviance : infidélité, prostitution,
sexualité, infraction au code de la route, homosexualité…
■ Exemple: perception et tolérance de l’homosexualité
– On lance un questionnaire en ligne et on invite les gens
motivés par le sujet ou ayant un intérêt personnel à se
porter volontaires pour le compléter. Il est possible de
rémunérer, mais attention aux chasseurs de prime
21:55 14
Échantillonnage non aléatoire
3. Échantillon accidentel
■ Quand? Si on veut rencontrer les enquêtés au gré des
circonstances, avec une sélection rapide et peu coûteuse
■ Comment? On interroge les individus qui se présentent
en un lieu et un moment donnés (méthode des itinéraires
ou de sélection systématique)
■ Études? À caractère public: usage de services publics,
fréquentation des lieux publics, etc.
■ Exemple: usage du transport intra-urbain public DDD
– On suit un itinéraire (bus 121) et on interroge les usagers
rencontrés le long du trajet. Ou bien on sélectionne de
façon systématique un usager à chaque arrêt.
21:55 15
Échantillonnage non aléatoire
4. Échantillon typique
■ Quand? Si on veut recruter par choix raisonné des
individus typiques, représentatifs du phénomène étudié
■ Comment? Sélection délibérée d’individus considérés
comme typiques selon des critères prédéterminés
■ Études? De nature exploratoire: itinérance, tabagisme,
alcoolisme, addiction aux jeux, etc.
■ Exemple: itinérance des enfants de la rue
– Étudier les élèves d’un seul Dahra de Saint-Louis (informel,
traditionnel) parce qu’on estime que leur comportement est
typique du phénomène de l’itinérance, en recrutant ainsi
les cas les plus pertinents au regard de l’étude
21:55 16
Échantillonnage non aléatoire
5. Échantillon en boule de neige
■ Quand ? Si on s’intéresse à des personnes partageant
un réseau ou à des populations difficiles à joindre
■ Comment? On part d'un noyau d'individus qui nous
mettent en relation avec leurs contacts, et ainsi de suite
■ Études? À caractère relationnel: médias sociaux, cercles
d’amis, relations professionnelles, élites politiques…
■ Exemple: usage des réseaux sociaux chez les étudiants
– Il s’agit d’identifier et d’interroger d’abord un étudiant
influent avant de recruter les étudiants partageant son
réseau ou lui demander de recruter des participants qu’il
connaît, de façon à faire boule de neige
21:55 17
Échantillonnage aléatoire Vs non aléatoire
Éléments comparés Échantillonnage Échantillonnage non
aléatoire, probabiliste aléatoire, empirique
Principe Tirage aléatoire Choix selon des critères
(principe du chapeau) (principe de la maquette)

Probabilité de Connue pour chaque Inconnue (trop


sélection individu (n/N) d’impondérables)

Représentativité Forte (si bien réalisé) Faible ou incertaine


Biais Faible Pus élevé
Validité scientifique Élevée (généralisation Limitée (précautions à
possible) prendre)
Temps et coût Plus long et coûteux Rapide et économique

Objectif de recherche Études explicatives / Études descriptives /


confirmatoires exploratoires

18
9:55
Inférence statistique
Définition

« Dans tous les cas où une recherche vise à étudier les


caractéristiques d’une population, l’analyse quantitative doit
être poursuivie en vue d’établir dans quelle mesure les
résultats de l’échantillon, mis à jour par l’analyse
descriptive, sont valables pour la population cible. Cette
analyse inférentielle des résultats consiste donc à évaluer
les caractéristiques de la population [paramètres] à partir
des résultats d’un échantillon [statistiques]»
Lamoureux (2000: 217

19
21:55
Inférence statistique
Deux conditions d’application
1. L’échantillon doit être constitué de 30 cas au minimum
– Les caractéristiques de n se rapprochent d’autant plus de
celles de N que n est grand (loi des grands nombres)
– À vous de faire un compromis entre ce qui est souhaitable
statistiquement (un grand n), et ce qui est réaliste en pratique
(selon vos moyens)

2. L’échantillon doit être aléatoire et non empirique


– Les individus de l’échantillon n sont choisis au hasard, par
tirage au sort (principe du chapeau, du hasard)

👉 Exemple d’une enquête dans un lieu public pour montrer


les limites de l’échantillonnage non aléatoire (Auchan)!
Inférence statistique
Pourquoi opter pour l’échantillonnage aléatoire?
■ Sémantiquement, un échantillon n est vraiment aléatoire si
chacun des individus de la pop. N a une chance égale non
nulle (équiprobabilité) et indépendante d’être sélectionné
■ À la longue, l’échantillon aléatoire produit un échantillon
"représentatif" de la population, permettant ainsi de pouvoir
se servir en toute confiance de la statistique de n pour
connaître, estimer le paramètre de N (estimation fiable)
■ Techniquement, avec un n aléatoire, on peut calculer la
probabilité qu’un ind. de N fasse partie de n (p=n/N),
permettant de calculer l’erreur d’échantillonnage, d’établir
une probabilité connue de la précision de l’estimation
21
Au programme

■ Appliquer les techniques d’échantillonnage dans un


sondage et en connaître les implications en inférence
– Principes de l’échantillonnage
– Échantillonnage aléatoire ou probabiliste
❖ Simple, systématique, stratifié, en grappes, aréolaire
– Échantillonnage non aléatoire ou empirique
❖ Quotas, typique, accidentel, volontaires, boule de neige
– Lien entre échantillonnage et inférence statistique
❖ Des conditions de l’inférence

■ Résolution de problèmes pratiques en lien avec les


techniques d’échantillonnage
21:55 22
Résolution de problèmes
Problème 1 (méthodes d’échantillonnage)
■ Pour chacune des situations ci-dessous, quelle méthode
d’échantillonnage choisir? Aléatoire ou non aléatoire!
Proposer une technique d’échantillonnage. Justifiez!
1. Tu veux étudier la perception de la corruption au
Sénégal, l’objectif étant de généraliser à toute la
population
2. Tu veux étudier les travailleurs informels difficiles à
identifier
3. Tu veux étudier l’usage de l’IA chez les étudiants de ta
classe
21:55 23
Résolution de problèmes
Problème 2 (quiz)
■ Une université compte 10 000 étudiants répartis ainsi : 6
000 en Sciences, 3 000 en Arts et 1 000 en Droit. Un
chercheur souhaite constituer un échantillon stratifié
proportionnel de 500 étudiants. Combien d'étudiants de
chaque faculté doit-il sélectionner ?
A. 250 en sciences, 150 en Arts et 100 en Droit
B. 200 en Sciences, 200 en Arts et 100 en Droit
C. 300 en Sciences, 150 en Arts et 50 en Droit
D. 166 en Sciences, 166 en Arts et 166 en Droit
21:55 24
Résolution de problèmes
Problème 3 (quiz)
■ Un institut de sondage réalise une étude flash sur un
échantillon de 1 000 personnes représentatif de la
population nationale selon le sexe (52 % de femmes, 48 %
d'hommes). N'ayant pas de liste de contacts, les
enquêteurs interrogent les passants dans la rue jusqu'à
remplir les catégories requises. Quelle est cette technique
et quel est le nombre exact d'hommes à interroger ?
A. Échantillonnage par choix typique; 520 hommes
B. Échantillonnage accidentel; 480 hommes
C. Échantillonnage par quotas; 480 hommes
D. Échantillonnage stratifié; 480 hommes
21:55 25
Résolution de problèmes
Problème 4
■ Un sociologue étudie les inégalités de revenu selon le
programme d’études chez les étudiants. Il souhaite
constituer un échantillon selon les 30 programmes de
université. Pour ce faire, il compare trois modes d’
échantillonnage : stratifié, par grappes et par quotas.
1. Comment doit-il s’y prendre pour constituer…
1. … un échantillon stratifié?
2. … un échantillon par grappes?
3. … un échantillon par quotas?
2. Quel est le mode d’échantillonnage le moins approprié s’il
désire procéder à l’inférence statistique? Justifiez!
21:55 26
Résolution de problèmes
Problème 5
■ Un sondage aléatoire porte sur 1000 individus tirés
aléatoirement dans une population de 100 000 individus.

1. Quelle est la probabilité générale qu’un individu fasse partie


de l’échantillon ?

2. Pourrait-on déterminer la probabilité qu’un individu fasse


partie de l’échantillon si le sondage était non aléatoire?

21:55 27
Résolution de problèmes
Problème 6
■ Pour chacun des deux sondages ci-dessous, peut-on inférer
de façon fiable les résultats à toute la population ? Justifiez
votre réponse.
1. Le premier sondage aléatoire porte sur 25 étudiants
rencontrés dans une université. Parmi ces répondants,
30% déclarent posséder un iPhone. Les adolescents y
utilisent Internet en moyenne 8 heures par semaine.
2. Un sondage indique que 61% des Sénégalais ayant rempli
un questionnaire sont intéressés par la politique. La
collecte de données en ligne s'est déroulée par le biais d'un
panel web auquel les répondants ont volontairement
participé.
21:55 28
Tout prochainement

■ À faire cette semaine


– Résoudre le restant des problèmes (exercices-maisons)

■ Prochain cours
– Estimation par intervalle de confiance d’un paramètre

21:55 29
MIASS 121.1
MATHÉMATIQUES 2
(APPLIQUÉES AUX SCIENCES SOCIALES)

© El Hadj Touré, PhD. Sociologie


Département de sociologie, UGB de St-Louis

Cours 6
Estimation par intervalle de confiance
d’un paramètre

13:16 1
Au programme

■ Comment inférer à toute la population des résultats


obtenus à partir d’un échantillon aléatoire?
– Comprendre la logique de l’inférence statistique:
❖ Statistique vs paramètre; distribution d’échantillonnage;
❖ Estimation ponctuelle vs par intervalle de confiance
– Estimer par intervalle de confiance une moyenne d’une
population à partir de la moyenne d’un échantillon
– Estimer par intervalle de confiance une proportion d’une
population à partir de la proportion d’un échantillon

■ Résolution de problèmes pratiques en lien avec


l’estimation par intervalle de confiance
13:16 2
Inférence statistique
Statistique & paramètre
■ Elle consiste à connaître les caractéristiques d’une
popula-tion (paramètres) à partir de celles d’un échantillon
(statistiques) en déterminant l’erreur d’échantillonnage
■ Une statistique
– Valeur décrivant une caractéristique d’un échantillon n : X ou p
– Une statistique peut être vue comme l’estimé d’un paramètre
– Elle est un nombre aléatoire, c’est-à-dire soumis au hasard
■ Un paramètre
– Valeur décrivant une caractéristique d’une population N :μ ou π
– La plupart du temps, cette valeur est inconnue et il faut l’estimer
– Un paramètre est un nombre déterministe, non soumis au hasard
3
13:16
Estimation d’un paramètre
Statistique & paramètre: mise en situation
Tabagisme chez les sénégalais âgés de 15 ans et plus (GATS 2015)
(naléatoire=4347) • % fumeurs p= 5,4% (235/4347)
Statistiques
• Nbre
(échantillon n) cig. fumées/j X = 9,4

Dans quelle mesure la


proportion ou la moyenne
X μ de l’échantillon
p π reflète-t-elle la valeur
réelle, c’est-à-dire la
proportion ou la moyenne
qui serait obtenue si l’
étude portait sur
Paramètres l’ensemble de la
(population N)
population sénégalaise?
Estimation d’un paramètre
Estimation ponctuelle & par intervalle de confiance
L’estimation consiste, à partir d’une statistique de n (X ou
p), à estimer le paramètre de N (μ ou π)
■ Estimation ponctuelle
– Elle consiste à estimer un paramètre d’une population par une
valeur unique: une statistique de l’échantillon
– Ex: Un sondage aléatoire mené en 2015 auprès de 4347
sénégalais montre que 5,4% (235) fument du tabac. La proportion
5,4% s’applique à toute la population sénégalaise étudiée
■ Estimation par intervalle de confiance
– Elle consiste à estimer les deux valeurs qui encadrent un paramètre
recherché: on parle d’intervalle de confiance
– Ex: … 5,4% avec une marge d’erreur de ±1% (entre 4,4% et 6,4%),
le niveau de confiance étant fixé à 95% (95 fois sur 100)
13:16 5
Estimation d’un paramètre
Trois sortes de distribution à distinguer
■ Distribution d’une population
– Distribution des scores dans N. Elle donne un paramètre

■ Distribution d’un échantillon


– Distribution des scores dans n. Elle donne une statistique

■ Distribution d’échantillonnage N=3 n=2


– Distribution d’une statistique
quelconque [moyenne ou %] de A1
tous les échantillons possibles
[n] d’une taille donnée [dans N].
Elle est au fondement de B2 C3
l’inférence statistique
Estimation d’un paramètre
Distribution d’échantillonnage: Théorème central limite
■ Au fur et à mesure que la taille de n augmente, la
distribution des moyennes X ou proportions p provenant d’
échantillons aléatoires tend à se distribuer normalement
autour de la moyenne μ ou de la proportion π
■ La moyenne de la distribution d’échantillonnage des X (μx)
est semblable à celle de la population μ et son écart-type
σx , appelé encore erreur-type, est : σx = σ / √ n
■ La moyenne de la distribution d’échantillonnage des p (μp)
est semblable à la proportion de la population π et son
écart-type σp, appelé aussi erreur-type, est: σp = √ pq / n
Distribution d’une population, distribution d’un échantillon
et distribution d’échantillonnage d’une moyenne

Variable= Nbre de
cigarettes fumées/j
Distribution d’une population (n=235 fumeurs)
N = Sénégalais (15 ans et plus)
μ = Moyenne de la population

1er échant. 2e échant. 3e échant. 4e échant. 5e échant. Der. échant.


n = 235 n = 235 n = 235 n = 235 n = 235 … n = 235
X = 9,4 X = 9,0 X = 10 X = 8,5 X = 8,0 X=?

Distribution d’échantillonnage
μX = μ
Intervalle de confiance d’une moyenne
Illustration
Moyennes de tous les
échantillons possibles

3,8 5,2 6,6 8,0 9,4 10,8 12,2 13,6 15,0

Moyenne observée
Intervalle de confiance d’une moyenne
Illustration
Moyennes de tous les
échantillons possibles

Marge d’erreur

−2,58σx −1,96σx −1σx 9,4 +1σx +1,96σx +2,58σx


68,3% des échant
95 % des échantillons
99% des échantillons
Intervalle de confiance d’une moyenne
Formule
■ Pour le trouver, rappelons-nous de deux choses:
– La distribution d’échantillonnage d’une moyenne suit N (μ, σ x )
– Or, 95% des données d’une distribution normale N sont comprises
à l’intérieur de 1,96 écart-type de part et d’autre de la moyenne

■ Pour connaître les limites inf. et sup. de l’intervalle, il faut :


– Soustraire 1,96 erreur-type de la moyenne de l’échantillon
– Et additionner 1,96 erreur-type à la moyenne de l’échantillon

■ Formule de l’intervalle de confiance (IC) d’une moyenne:


IC à 95% = X ± 1,96σx σx = σ / √ n
IC à 99% = X ± 2,58σx 1,96 | 2,58 = z
– 95% | 99% = niveau de confiance, 1,96σx | 2,58σx = marge d’erreur
Intervalle de confiance d’une moyenne
Exemple d’application
Un sondage aléatoire montre que chez les 235 (n)
fumeurs sénégalais, le nbre moyen de cigarettes fumées/
jour est de 9,4 avec un écart-type de 4,7. Estimez par
inter-valle de confiance à 95%, la vraie moyenne dans la
pop. = 4,7/√235 =0,31
1. Calculez l’erreur-type: σx = σ / √ n = 1,96*0,31 =0,6
2. Calculez la marge d’erreur à 95%: E = 1,96σ
= 8,8x et 10
3. Déterminez l’intervalle à 95%: IC= X ± E
4. Représentez graphiquement l’intervalle
On est sûr au moins à 95% que le nbre
moyen de cig. fumées par jour se situe entre 8,8 IC
et 10 dans la population sénégalaise adulte. Ou 95%
le nbre moyen est de 9,4 cigarettes, avec une
marge d’erreur de ±0,6, 95 fois sur 100 8,8 9,4 10
Distribution d’une population, distribution d’un échantillon
et distribution d’échantillonnage d’une proportion
Variable =
proportion de
fumeurs (n=4347
Distribution d’une population adultes)
N = Sénégalais (âgés de 15 et plus)
Π = Proportion de la population

1er échant. 2e échant. 3e échant. 4e échant. 5e échant. Der. échant.


n = 4347 n = 4347 n = 4347 n = 4347 n = 4347 … n = 4347
p = 5,4 p = 5,0 p = 4,8 p = 6,0 p = 5,9 p=?

Distribution d’échantillonnage
μp = Π
Intervalle de confiance d’une proportion
Illustration
p Proportions de tous les
échantillons possibles
p p p

p p p

p p p p p

p p p p p
p p
p p p p p p p p p
11 11,5 12 12,5 5,4 13,5 14 14,5 15

Proportion observée
Intervalle de confiance d’une proportion
Illustration
p Proportions de tous les
échantillons possibles
p p p

p p p

p p p p p Marge d’erreur
Marge d’erreur
p p p p p
p p
p p p p p p p p p
−2,58σp −1,96σp −1σp 5,4 +1σp +1,96σp +2,58σp
68,3% des échant
95 % des échantillons
99% des échantillons
Intervalle de confiance d’une proportion
Formule
■ Comme la moyenne, un pourcentage (ou proportion) peut
se situer à l’intérieur d’un intervalle de confiance
■ Exemple du sondage où 5,4% des 4347 sénégalais
sondés en 2002 fument du tabac
– p: probabilité ou pourcentage à estimer, soit 5,4%
– q: probabilité ou pourcentage complémentaire, soit 100-p = 94,6%
– n : nombre de cas enquêtés, soit 4347

■ Formule de l’intervalle de confiance (IC) d’une proportion:


IC à 95% = p ± 1,96σp σp = √ pq / n
IC à 99% = p ± 2,58σp 1,96 | 2,58 = z
• 95% | 99% = niveau de confiance, 1,96σp | 2,58σp = marge d’erreur
Intervalle de confiance d’une proportion
Exemple d’application
Un sondage aléatoire sur 4347 (n) sénégalais âgés de 15
ans et plus révèle que 5,4% fument du tabac. Estimez par
intervalle de confiance à 95%, la vraie proportion de la pop.
1. Calculez l’erreur type: σp = √ (pq)/n = √5,4*94,6/4347 =0,35
2. Calculez la marge d’erreur à 95%: E = 1,96σp = 1,96*0,35 =0,7
3. Déterminez l’intervalle à 95%: IC= p ± E = 4,7% et 6,1%
4. Représentez graphiquement l’intervalle

On est certain au moins à 95% que la


proportion de fumeurs se situe entre 4,7% et
6,1% dans la population sénégalaise adulte. Ou
IC
la proportion de fumeurs est de 5,4%, avec une 95%
marge d’erreur de ±0,7%, 95 fois sur 100
4,7 5,4 6,1
Au programme

■ Comment inférer à toute la population des résultats


obtenus à partir d’un échantillon aléatoire?
– Comprendre la logique de l’inférence statistique:
❖ statistique vs paramètre; distribution d’échantillonnage;
❖ Estimation ponctuelle vs par intervalle de confiance
– Estimer par intervalle de confiance une moyenne d’une
population à partir de la moyenne d’un échantillon
– Estimer par intervalle de confiance une proportion d’une
population à partir de la proportion d’un échantillon

■ Résolution de problèmes pratiques en lien avec


l’estimation par intervalle de confiance
13:16 18
Résolution de problèmes
Problème 1 (estimation ponctuelle): application
sociologique
Dans le cadre d'une étude sur la qualité des services
universitaires, un chercheur souhaite estimer le niveau de
satisfaction des étudiants d’une université. Une enquête est
réalisée auprès d'un échantillon aléatoire de 100 étudiants. Les
scores de satisfaction varie de 0 à 100. Les résultats indiquent :
– Taille de l'échantillon : n=100
– Somme des scores observés : 8 600
– Parmi les étudiants, 68 sont satisfaits (score ≥ 60)
2. Calculez la valeur estimée de la satisfaction moyenne et
interprétez l’estimation ponctuelle
3. Calculez la valeur estimée de la proportion d’étudiants
satisfaits et interprétez l’estimation ponctuelle
4. Les deux estimations ponctuelles sont-elles fiables? Justifiez!
Résolution de problèmes
Problème 2 (estimation ponctuelle): application
sociologique
Une enquête est réalisée dans une commune rurale, pour
estimer le revenu mensuel moyen des ménages ainsi que la
proportion de ménages vivant sous le seuil de pauvreté. Un
échantillon aléatoire de 100 ménages donne ces résultats :
– Nombre de ménages enquêtés : n=100
– Somme des revenus mensuels observés : 6 000 000 FCFA
– Parmi les ménages, 45 ont un revenu mensuel inférieur au
seuil de pauvreté fixé à 30 000 FCFA par personne.
2. Calculez la valeur estimée du revenu mensuel moyen et
interprétez l’estimation ponctuelle
3. Calculez la valeur estimée de la proportion de ménages vivant
sous le seuil de pauvreté et interprétez l’estimation ponctuelle
4. Expliquez pourquoi ces estimations sont appelées ponctuelles
Résolution de problèmes
Problème 3 (IC d’une moyenne): application sociologique
Un sondage aléatoire d’Afrobaromètre mené en 2023
montre que chez les 1200 (n) sénégalais enquêtés, l’indice
moyen de pauvreté vécue est de 1,63 (échelle 0-4) avec un
écart-type de 0,84. Estimez par intervalle de confiance à
95%, la vraie moyenne dans la population étudiée.
1. Calculez l’erreur type: σx = σ / √ n
2. Calculez la marge d’erreur à 95%: E = 1,96σx
3. Déterminez l’intervalle à 95% : IC= X ± E
4. Représentez graphiquement l’intervalle
5. Interprétez l’erreur-type, E et IC
Résolution de problèmes
Problème 4 (IC d’une proportion): application
sociologique
Un sondage aléatoire d’Afrobaromètre mené en 2023 sur
1200 (n) sénégalais âgés de 18 ans et plus montre que 65%
estiment que la gestion de la réponse à la COVID-19 est
satisfaisante. Estimez par intervalle de confiance à 99%, la
vraie proportion de la population étudiée.

1. Calculez l’erreur type à 99%: σp = √ (pq)/n


2. Calculez la marge d’erreur à 99%: E = 1,96σp
3. Déterminez l’intervalle à 99%: IC= p ± E
4. Représentez graphiquement l’intervalle
5. Interprétez l’erreur-type, E et IC
Résolution de problèmes
Problème 5 (IC d’une moyenne)
Soit les données suivantes:
❖ Moyenne = 100
❖ Écart-type = 20
❖ n = 30

[Link] l’intervalle de confiance à 95% de la moyenne en


suivant les différentes étapes d’une estimation. Autrement
dit, quelle est la plus grande et la plus petite moyenne
échantillonnale que le hasard peu donner?
Résolution de problèmes
Problème 6 (IC d’une proportion)
Soit les données suivantes:
❖ p = 0,40
❖ n = 100

[Link] l’intervalle de confiance à 99% de la proportion en


suivant les différentes étapes d’une estimation. Autrement
dit, quelle est la plus grande et la plus petite proportion
échantillonnale que le hasard peu donner?
Résolution de problèmes
Problème 7
■ Selon un sondage effectué au hasard sur 2000 Québécois âgés de
18 à 34 ans, ces derniers passent en moyenne 8 heures par semaine
sur le site de médias sociaux. Ces résultats sont précis à ± 56
minutes, avec un risque d’erreur de 5%. Précisez les informations
demandées ci-dessous:
Variable analysée
Population étudiée
Taille de l’échantillon
Mode d’échantillonnage
Statistique mesurée
Valeur ponctuelle estimée du paramètre
Marge d’erreur
Intervalle estimé du paramètre
Probabilité d’erreur :
Niveau de confiance :
Que signifie la valeur de la marge d’erreur ?
Que13:16
signifie l’expression « risque d’erreur»? 25
Résolution de problèmes
Problème 8
■ Un sondage aléatoire effectué par CROP en mars 2012 sur 1000
Québécois révèle que 51 % des répondants demeurent en faveur de
la hausse des frais de scolarité de 1625 $ sur cinq ans. Ces résultats
sont précis à ± 3,09%, 19 fois sur 20. Précisez les informations
demandées ci-dessous:
Variable analysée
Population étudiée
Taille de l’échantillon
Mode d’échantillonnage
Statistique mesurée
Valeur ponctuelle estimée du paramètre
Marge d’erreur
Intervalle estimé du paramètre
Probabilité d’erreur :
Niveau de confiance :
Que signifie la valeur de la marge d’erreur ?
Que13:16
signifie l’expression « 19 fois sur 20 »? 26
Résolution de problèmes
Problème 9
■Le changement climatique constitue un phénomène préoccupant et
émergeant. C’est ce que laisse croire une étude effectuée, en 2011,
par Léger Marketing auprès de 1214 Canadiens adultes sélectionnés
aléatoirement, 80% croient au réchauffement de la terre. Par contre,
parmi les 805 Américains sélectionnés aléatoirement, 68% seulement
croient à ce phénomène
1. Estimez par intervalle de confiance (99%) le pourcentage de la
population canadienne qui croit au réchauffement de la terre
2. Estimez par intervalle de confiance (99%) le pourcentage de la
population américaine qui croit au réchauffement de la terre
3. Pourquoi la marge d’erreur est-elle plus importante dans le
sondage américain que dans le sondage canadien concernant la
croyance au changement climatique?
Tout prochainement
■ À faire cette semaine
– Résoudre le restant des problèmes (exercices-maisons)

■ Prochain cours
– Introduction aux tests d’hypothèse

13:16 28
MIASS 121.1
MATHÉMATIQUES 2
(APPLIQUÉES AUX SCIENCES SOCIALES)

© El Hadj Touré, PhD. Sociologie


Département de sociologie, UGB de St-Louis

Leçon 7
Introduction aux tests d’hypothèses

15:00 1
Au programme

■ Comment tester une hypothèse à propos d’une moyenne


ou d’une proportion d’une population, après avoir accédé
à l’intelligence des tests d’hypothèses ?
– Comprendre la logique des tests de validation d’hypothèses :
estimation d’un paramètre vs test d’hypothèse; hypothèses
statistiques nulle et alternative; erreur-type I et II
– Procéder au test d’hypothèse basé sur une moyenne d’une
population
– Procéder au test d’hypothèse basé sur une proportion d’une
population

■ Résolution de problèmes pratiques en lien avec les


méthodes d’échantillonnage
15:00 2
Logique des tests d’hypothèses
Estimation d’un paramètre vs test d’hypothèse
■ Estimation: connaissant une statistique n, on cherche à estimer le
paramètre de N. Un sondage auprès de 100 citoyens montre que 60%
font confiance aux institutions. Peut-on généraliser?

Estimation par 95%


s P niveau de
intervalle de confiance confiance
Inférence
statistique
Test de validation 5%
P s risque
d’hypothèse d’erreur
■ Test: connaissant un paramètre supposé de N (hypothèse), on cherche
à le tester, valider à partir d’une statistique de n. Un sociologue affirme
que 65% des citoyens font confiance aux institutions. Est-ce vrai?
3
15:00
Logique des tests d’hypothèses
Hypothèse de recherche & hypothèses statistiques
■ L’hypothèse de recherche (paramètre supposé de N) à tester
doit être traduite en 2 hypothèses statistiques pour qu’elle soit
intelligible au raisonnement inférentiel
– H0 : Hypothèse nulle (égalité) Objet du test statistique
❖ Prédit une valeur donnée qui sera égale au paramètre théorique N
❖ On suppose qu'il n'y a pas de changement ou d'effet
H0 : μ = μt H0 : π = πt
– H1 : Hypothèse alternative (différence) Hypothèse du chercheur
❖ Prédit un écart entre une valeur donnée et le paramètre théorique N
❖ Elle représente le changement, l'effet ou la différence
H 1 : μ ≠ μt H 1 : π ≠ πt
4
15:00
Logique des tests d’hypothèses
Analogie avec la décision d’un jury
■ Certes, on cherche à rejeter l’hypothèse nulle H0, mais on
n’est jamais à l’abri d’erreur quant au rejet ou à l’acceptation
■ Un jury de recrutement peut commettre deux types d’erreur:
– Rejeter un candidat alors qu’il est bon
❖ Rejeter H0 alors qu’elle est vraie (erreur de type I)
– Accepter un candidat alors qu’il est mauvais
❖ Accepter H0 alors qu’elle est fausse (erreur de type II)

■ Toutefois, on peut déterminer la probabilité de commettre


une erreur en rejetant H0 (type I): c’est l’objet des tests
d’hypothèse.
15:00 5
Test d’hypothèse sur une moyenne
Exemple d’application & formulation des hypothèses
■ Un chercheur affirme que le nombre moyen de cigarettes
fumées par jour est de 10.4 au Sénégal. Si une étude
récente menée auprès de 235 fumeurs donne plutôt une
moyenne de 9.4, avec un écart-type de 4.7, peut-on dire
qu’il y a un écart significatif et qu’il y a un changement?
👉 Principe: Comparer une moyenne observée à une référence
1. Formulons les hypothèses statistiques
– Hypothèse nulle: H0 : μ = 10.4
❖ Le nombre moyen de cigarettes fumées est égal à 10.4 dans N
– Hypothèse alternative: H1 : μ ≠ 10.4
❖ Le nombre moyen de cigarettes fumées est différent de 10.4
15:00 dans N 6
Test d’hypothèse sur une moyenne
Calcul de la statistique z

Différence entre moy. observée et moyenne théorique


Erreur-type de la moyenne de la population

= 9,4 – 10,4 = -1

= 4,7/√235 = 0,31

15:00 7
Test d’hypothèse sur une moyenne
Valeur critique & visualisation de la décision
3. Fixons la valeur 4. Représentons graphiquement la
critique: prise de décision statistique
Avec un risque Les valeurs z de tous
z
d’erreur de 5% les échantillons
z z z possibles
(seuil de
signification z z z
α=0,05), la z z z z z
valeur critique z z z
z z
est: z = ±1,96 z z
z z z z z z z z z
0
Test d’hypothèse sur une moyenne
Valeur critique & visualisation de la décision
3. Fixons la valeur 4. Représentons graphiquement la
critique: prise de décision statistique
α=0,05
Avec un risque 95% des
d’erreur de 5% échantillons
(seuil de possibles
signification: 1−α = 0,95
α=0,05), la Zone
valeur critique Zone d’acceptation de H0 Zone
est: z = ±1,96 de rejet de rejet

zcritique zcritique |zcalculé|


0
-1,96 1,96 3,23
Test d’hypothèse sur une moyenne
Décision & conclusion

5. Prenons une décision statistique et concluons


– Décision :
❖ La statistique calculée absolue (z=3,23) étant supérieure à
la valeur critique (1,96) au seuil de 0,05, on rejette
l’hypothèse nulle H0 pour accepter l’hypothèse alternative
H1. Les données fournissent des preuves suffisantes pour
rejeter l’hypothèse nulle

– Conclusion:
❖ On sûr au moins à 95% que le nombre moyen de cigarettes
de l’étude (9,4) est différent de la moyenne théorique du
chercheur (10,4), qui a tort en conséquence. Il y a eu du
changement: les fumeurs ont réduit leur consommation.
15:00 10
Test d’hypothèse sur une proportion
Exemple d’application & formulation des hypothèses
■ Un chercheur affirme que la proportion de fumeurs est de 6%
au Sénégal. Si une étude récente menée auprès de 4347 (n)
fumeurs donne plutôt une proportion de 5,4%, peut-on dire
qu’il y a un écart significatif et qu’il y a eu changement?

👉 Principe: Comparer une proportion observée à une référence


1. Formulons les hypothèses statistiques
– Hypothèse nulle: H0 : Π = 6
❖ La proportion de fumeurs est égale à 6 dans la population N
– Hypothèse alternative: H1 : Π ≠ 6
❖ La proportion de fumeurs est différente de 6 dans la population N
15:00 11
Test d’hypothèse sur une proportion
Calcul de la statistique z

Différence entre prop. observée et prop. théorique


Erreur-type de la proportion de la population

= 5,4 – 6 = -0,6

15:00 12
Test d’hypothèse sur une proportion
Valeur critique & visualisation de la décision
3. Fixons la valeur 4. Représentons graphiquement la
critique: prise de décision statistique
Avec un risque Les valeurs z de tous
z
d’erreur de 5% les échantillons
z z z possibles
(seuil de
signification z z z
α=0,05), la z z z z z
valeur critique z z z
z z
est: z = ±1,96 z z
z z z z z z z z z
0
Test d’hypothèse sur une proportion
Valeur critique & visualisation de la décision
3. Fixons la valeur 4. Représentons graphiquement la
critique: prise de décision statistique
α=0,05
Avec un risque 95% des
d’erreur de 5% échantillons
(seuil de possibles
signification: 1−α = 0,95
α=0,05), la Zone
valeur critique Zone d’acceptation de H0 Zone
est: z = ±1,96 de rejet de rejet

zcritique |zcalculé|zcritique
0 1,67 1,96
-1,96
Test d’hypothèse sur une moyenne
Décision & conclusion

5. Prenons une décision statistique et concluons


– Décision :
❖ La statistique calculée absolue (z=1,67) étant inférieure à la
valeur critique (1,96) au seuil de 0,05, on accepte
l’hypothèse nulle H0. Les données ne permettent pas de
rejeter l’hypothèse nulle

– Conclusion:
❖ On sûr au moins à 95% que la proportion de fumeurs de l’
étude (5,4%) est égal à la proportion théorique du chercheur
(6%), qui a raison en conséquence. Il n’y a pas eu du
changement: les différences entre les proportions sont dues
au hasard de l’échantillonnage.
15:00 15
Test de validation d’hypothèses
Étapes à suivre
1. Formulez les hypothèses nulle H0 et alternative H1
2. Calculez la statistique z, en relativisant la différence entre
la valeur observée et la valeur théorique, sur l’erreur-type

3. Fixez la valeur critique : avec un risque d’erreur de 5%


(α=0,05), elle est de 1,96; Si α=0,01, elle est de 2,58
4. Représentez graphiquement la prise de décision
5. Prenez une décision statistique (rejet H0 si zcal > zcrit) et
concluez en précisant le niveau de confiance (95%)
15:00 16
Au programme

■ Comment tester une hypothèse à propos d’une moyenne


ou d’une proportion d’une population, après avoir accédé
à l’intelligence des tests d’hypothèses ?
– Comprendre la logique des tests de validation d’hypothèses :
estimation d’un paramètre vs test d’hypothèse; hypothèses
statistiques nulle et alternative; erreur-type I et II
– Procéder au test d’hypothèse basé sur une moyenne d’une
population
– Procéder au test d’hypothèse basé sur une proportion d’une
population

■ Résolution de problèmes pratiques en lien avec les


méthodes d’échantillonnage
15:00 17
Résolution de problèmes
Problème 1 (test d’une moyenne)
■ Une université affirme que les étudiants consacrent en
moyenne 15 heures par semaine à l’étude. Un échantillon
de 100 étudiants montre une moyenne de 13 h, et un
écart-type de 5 h. Tester cette affirmation au seuil de 5 %.
1. Formulez les hypothèses nulle et alternative
2. Calculez la statistique z comparant les deux moyennes
3. Déterminez la valeur critique z
4. Représentez la prise de décision statistique
5. Décidez et concluez à propos du test d’hypothèse

15:00 18
Résolution de problèmes
Problème 2 (test d’une moyenne)
■ Une entreprise affirme que le salaire moyen est de 400 000
FCFA. Un échantillon de 100 employés montre :
– moyenne : 410 000
– écart-type : 50 000
1. Tester cette affirmation au seuil de 5 % en respectant les
étapes d’un test d’hypothèse.

15:00 19
Résolution de problèmes
Problème 3 (test d’une moyenne)
■ Une étude nationale affirme que les étudiants universitaires
passent en moyenne 4 heures par jour sur les réseaux
sociaux. Un sociologue pense que l’usage des réseaux
sociaux a augmenté chez les étudiants de l’Université
Gaston Berger. Il réalise une enquête auprès d’un
échantillon aléatoire de 100 étudiants et obtient les résultats
– Moyenne observée : 4,5 heures par jour
– Écart-type de l’échantillon : 2 heures
1. Le chercheur souhaite tester si le temps moyen d’utilisation
des réseaux sociaux est différent de 4 heures par jour avec
un risque d’erreur de 1%.
2. 2)
15:07 Le test est-il significatif au seuil de 0,05 %? 20
Résolution de problèmes
Problème 4 (test d’une proportion)
■ Seulement 65% des Sénégalais sont confiants envers leurs
institutions. Si une étude récente menée en 2023 auprès de
1200 sénégalais donne 60%, peut-on dire qu’il y a un écart
significatif au seuil de 0,05? Est-ce que, par exemple, la
crise sociopolitique n’est pas en cause?
1. Formulez les hypothèses nulle et alternative
2. Calculez la statistique z comparant les deux proportions
3. Déterminez la valeur critique z
4. Représentez la prise de décision statistique
5. Décidez et concluez à propos du test d’hypothèse

15:00 21
Résolution de problèmes
Problème 5 (test d’une proportion)
■ Seulement 30% des étudiants d’une université utilisent le
service électronique pour payer leurs frais de scolarité.
Après avoir organisé une session pour inciter les étudiants à
adopter ce mode de paiement, le responsable des RH veut
en vérifier l’efficacité. Dans un échantillon de 100 clients, 35
ont utilisé le paiement direct. Peut-on accepter l’hypothèse
que la session a été efficace? Effectuer un test avec un
risque d’erreur de 5%. Après avoir calculé la proportion
observée, suivez les différentes étapes.

15:00 22
Résolution de problèmes
Problème 6 (test d’une proportion)
■ Un e-commerçant affirme que 20% des visiteurs achètent
un produit. Sur 400 visiteurs, on observe 68 achats (p =
0,17). Le taux réel est-il différent de celui de l'affirmation au
seuil de signification de 0,01. Procédez au test d’hypothèse,
en suivant les différentes étapes.

15:00 23
Résolution de problèmes
Problème 7 (test d’une proportion)
■ Un gouvernement affirme : « 60 % des citoyens sont
satisfaits de notre politique ». Un sociologue réalise une
enquête auprès de 500 citoyens et observe 55 % de
satisfaction. Cette différence de 5 points est-elle simplement
due au hasard de l’échantillonnage ? Ou peut-on conclure
que le taux réel de satisfaction est différent de 60 % ?
Procédez au test d’hypothèse avec un risque d’erreur de
1%, en suivant les différentes étapes.

15:00 24
Tout prochainement
■ À faire cette semaine
– Résoudre le restant des problèmes (exercices-maisons)

■ Prochain cours
– Révision TDs

15:00 25

Vous aimerez peut-être aussi