Introduction
Partie 1: Théorie de l’échantillonnage
Partie 2: Estimation
Partie 3: Tests d’hypothèses
Un phénomène aléatoire sera entièrement déterminé
si on connaît la loi de probabilité suivie par la variable
aléatoire X donnée dans la population.
On a alors deux cas de figure :
Ø soit la loi suivie par X est inconnue, dans ce cas, il est
nécessaire d’estimer les paramètres de cette loi à partir des
paramètres établis sur un échantillon de la population.
(partie 2 : estimation)
Pour résoudre les problèmes d’estimation de ces paramètres
inconnus, il faut étudier la distribution d’échantillonnage
la loi de probabilité suivie par l’estimateur
(partie 1: théorie d’échantillonnage).
Ø Soit la loi suivie par X est connue et on vérifie si les
observations faites à partir d’un échantillon sont en accord
avec elle. On effectue alors un test d’ajustement entre la
distribution théorique et la distribution observée
(partie 3: test d’hypothèses).
La population cible est généralement trop nombreuse et pour des
raisons de coûts, de délais, il est pratiquement impossible d'effectuer un
recensement. L'échantillonnage est donc une partie importante de la
statistique. Elle nous permet de comprendre la population sans avoir à
Interroger tous les individus de la population.
Un échantillon représentatif est un échantillon qui reproduit les caractéristiques
d'une population de manière à ce que les conclusions obtenues avec cet
échantillon se généralisent à la population
La statistique inférentielle ne conduit jamais à une conclusion Stricte, elle
attache toujours une probabilité à cette conclusion. Cela provient du fait que l’on
tente de tirer des conclusions sur une population à Partir des observations
réalisées sur un échantillon.
Méthodes de prélèvement d’un échantillon
Pour avoir de bonnes analyses statistiques, il est important de savoir et
de comprendre le type d'échantillonnage utilisé. Il existe deux méthodes
pour constituer un échantillon:
Méthode probabiliste
Les échantillons probabilistes ou aléatoires sont constitués par tirage au sort
dans la population mère pour laquelle on dispose de la liste Complète de toutes
les unités de sondage qui la composent (individus, familles, entreprises, etc.).
Chaque membre de la population a une chance égale d'être inclus à l'intérieur
de l'échantillon. On distingue 4 méthodes :
Ø Echantillonnage aléatoire simple
Ø Echantillonnage aléatoire systématique
Ø Echantillonnage stratifié
Ø Echantillonnage en grappes
Ø Echantillonnage aléatoire simple
Mode d'administration
on doit dresser une liste de toutes les unités incluses dans la
Population observée pour sélectionner un échantillon aléatoire
simple. La sélection peut s'effectuer avec ou sans remise.
Avantages : facile à mettre en œuvre.
Inconvénients : La non-représentativité, le coût.
Remarque: pour la sélection on utilise des logiciels qui possèdent
Des fonctionnalités permettant de faire la sélection au hasard (Excel,
SPSS,…).
Ø Echantillonnage systématique
Il existe un écart, ou un intervalle, entre chaque unité sélectionnée qui
Est incluse dans l'échantillon.
Mode d'administration
1- Numéroter de 1 à N les unités incluses dans votre base de sondage (où N
est la taille de la population ).
2 - Déterminer l'intervalle d'échantillonnage ou pas de sondage (K ) en
divisant la population N par la taille de l'échantillon que vous désirez
obtenir(K=N/n)
3- Sélectionner au hasard un nombre de la population.
4- Sélectionner chaque K ième unité après ce premier nombre.
Avantages : La probabilité d'être sélectionnée = celle d'un EAS.
Inconvénients : Le coût, problème si la population est ordonnée.
Ø Echantillonnage stratifié
Mode d'administration
1- On divise la population en groupes homogènes (appelés
strates), qui sont mutuellement exclusifs (selon l'âge, le sexe, la
province de résidence, le revenu, etc.)
2- On sélectionne à partir de chaque strate des échantillons
indépendants.
3- La méthode d'échantillonnage peut varier d'une strate à une autre.
Avantages :
La probabilité d'être sélectionnée = celle d'un EAS.
Echantillon plus représentatif.
Inconvénients : Le coût.
Exemple:
Si on s’intéresse à un caractère qui dépend de l’âge des
individus :
Population Echantillon
[0,10[ 20% 20%
[10, 20[ 25% 25%
[20, 50[ 25% 25%
[50 et plus[ 30% 30%
Ø Echantillonnage en grappes:
Une grappe est un ensemble d'unités d'une population qu'on constitue à l'aide de
Critères bien définis.
- un ménage est une grappe de personnes physiques
- une entreprise est une grappe de salariés
- une association est une grappe de membres
Principe
Limiter les zones géographiques qui font l'objet de l'enquête
Mode d'administration
Chaque grappe devrait être une population « miniaturisée ». comme c’est rarement le cas,
On effectue un tirage aléatoire de plusieurs grappes, tous les individus appartenant aux
grappes sélectionnées étant interrogés
Avantages : réduire les coûts
Inconvénients : effet de grappe (variance intra qui est faible) dû à l'existence de
similarité Entre individus d'une même grappe.
Méthode non-probabiliste
La méthode d'échantillonnage non-probabiliste est utilisée lorsqu'il
n'est pas possible de constituer une liste exhaustive de toutes les unités
du sondage
Ø Echantillonnage par quotas
Il s'effectue jusqu'à ce qu'un nombre précis d'unités (de quotas) pour
diverses sous-populations ait été sélectionné.
Les quotas peuvent être fondés sur des proportions de la population.
(par exemple 50% d'hommes et 50% de Femmes).
Avantages : L'échantillonnage par quotas est généralement moins
coûteux que l'échantillonnage aléatoire. Il est également facile à
administrer.
Inconvénients : Certaines unités peuvent n'avoir aucune chance d'être
sélectionnées.
Remarque: on retient qu'un nombre restreint de quotas. Au delà de 2
ou 3 quotas, on complique la tâche des enquêteurs.
1-Définition:
La distribution d'échantillonnage des moyennes est la distribution
des moyennes arithmétiques de tous les échantillons possibles de
taille donnée n pouvant être formés à partir de la population.
La variation de ces moyennes est appelée variation
d'échantillonnage.
Remarque :
Il y a trois types de distributions de probabilité .
On va étudier deux méthodes d’estimation à
savoir :
I- Estimation ponctuelle : Calcul d’une valeur
unique (estimateur).
II- Estimation par intervalle : Il est alors
nécessaire de déterminer la précision de ces
estimations en établissant un intervalle de
confiance autour des valeurs prédites
1. Moyenne :
De manière générale, on choisit la
moyenne d’un échantillon prélevé au
hasard dans une population comme
meilleure estimation ponctuelle de la
moyenne inconnue de cette
population.
2 n
On choisit le nombre s n 1 s² ,
n
où n est l’effectif et s² la variance d’un
échantillon prélevé au hasard dans une
population, comme meilleure estimation
ponctuelle de la variance inconnue ² de
cette population.
n
s s
On prend n
n 1 comme meilleure
estimation ponctuelle de l’écart-type
inconnue de cette population.
3. Proportion
De même, on choisit la proportion des
éléments possédant une certaine propriété
dans un échantillon prélevé aléatoirement
dans une population comme meilleure
estimation ponctuelle de la proportion
inconnue p des éléments de cette population
ayant cette propriété.
^
X 2,28 cartes de crédits
2 n 2 50
s
n s 4 , 362
n 1 49
^
2 ,11 carte
^
p 28 %
Les estimations ponctuelles sont liées au
choix de l’échantillon ; il faut donc rechercher
un nouveau type d’estimation de la moyenne
d’une population ou d’un pourcentage.
1- Définition:
L ’estimation par intervalle de confiance consiste
à établir un intervalle de valeurs qui nous permet
d ’affirmer, avec un certain niveau de confiance ou de
certitude 1 prédéterminé (en général: 90%, 95%
ou 99%), que la vraie valeur du paramètre de la
population se trouve dans cet intervalle.