0% ont trouvé ce document utile (0 vote)
30 vues73 pages

Théorie et Méthodes de Sondage

Sondage

Transféré par

bebouyoh
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
30 vues73 pages

Théorie et Méthodes de Sondage

Sondage

Transféré par

bebouyoh
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Contents

1 GENERALITE SUR LA THEORIE DE SONDAGE 5


1.1 Concepts et définitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.1.1 Notion de population et individu . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.1.2 Recensement et Enquête . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.1.3 Base de Sondage et Échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.1.4 Variable d’intérêt et paramètre . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.2 Principes et formalisations . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.2.1 Objectif d’un sondage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.2.2 Notations et principes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7

2 Les différentes méthodes de sondage 8


2.1 Les méthodes probabilistes ou aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
2.2 Les méthodes empiriques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
2.2.1 La méthode des quotas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
2.2.2 La méthode des unités types . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.2.3 Méthode du volontariat . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.2.4 La méthode de boule de neige . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.2.5 La méthode des itinéraires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.2.6 La méthode sur place . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.3 Les erreurs inhérents aux méthode de sondages . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.3.1 Erreur d’échantillonnage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.3.2 Erreur de couverture . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.3.3 Erreur de mesure . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.3.4 L’erreur du au non réponse . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.4 les étapes d’une enquête par sondage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.4.1 Objectif et contrainte . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
2.4.2 base de sondage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
2.4.3 L’échantillonnage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
2.4.4 Conception du questionnaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12

3 Le sondage aléatoire simple 13


3.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
3.2 Notation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
3.3 Probabilité d’inclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14

1
CONTENTS 2

3.3.1 Tirage avec remise . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14


3.3.2 Tirage sans remise . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
3.4 Estimation de la moyenne Y , du total et intervalle de confiance . . . . . . . . . . . . . . . . . 15
3.4.1 Estimateur . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
3.4.2 La variance de Y . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
3.4.3 L’intervalle de confiance de Y . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
3.4.4 Estimation du total TY . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
3.4.5 Intervalle de confiance pourTY . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
3.5 Tirage aléatoire sans remise (PESR) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
3.5.1 Calcule de la variance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
3.6 Comparaison de deux estimateurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
3.7 Estimation d’un proportion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
3.7.1 Cas du tirage avec remise . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
3.8 Problème de taille de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20

4 SONDAGE PAR STRATIFICATION 23


4.1 Principe et justification . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
4.2 Cas du tirage aléatoire simple (sans remise) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
4.2.1 Notation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
4.3 Estimation de la moyenne . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
4.4 Sonde stratifié proportionnel . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
4.4.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
4.5 La répartition de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
4.5.1 Plan stratifie avec allocation proportionnelle . . . . . . . . . . . . . . . . . . . . . . . 26
4.5.2 Expression de la variance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
4.5.3 Plan stratifie avec allocation optimale de Neyman . . . . . . . . . . . . . . . . . . . . 27
4.5.4 Répartition Optimale avec contrainte de coût . . . . . . . . . . . . . . . . . . . . . . . 27
4.6 Formation des strates . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
4.6.1 Homogénéité des strates . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
4.6.2 Choix des limites des strates . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
4.7 Le nombre de strates (le choix de K) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
4.8 Retour sur la répartition optimale de l’échantillon : cas de plusieurs estimations . . . . . . . . 29
4.8.1 Estimation des moyennes de plusieurs variables . . . . . . . . . . . . . . . . . . . . . . 29
4.9 la post-stratification ou stratification a posteriori . . . . . . . . . . . . . . . . . . . . . . . . . 31
4.9.1 Exemple . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
4.9.2 L’estimateur y post (propriété) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31

5 Le tirage systématique 35
5.1 Cadre d’utilisation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
5.1.1 Définition: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
5.1.2 Aspect Probabiliste de la méthode: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
5.2 Estimation de la moyenne dans un sondage à grappe systématique . . . . . . . . . . . . . . . 37
5.3 Estimation de la variance de y sys . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37
5.3.1 Prise en compte des variances successives: . . . . . . . . . . . . . . . . . . . . . . . . . 37
5.3.2 Utilisation de la formule du tirage aléatoire simple en lieu et simple du tirage systématique 38
5.3.3 Conséquence de l’ordre des individus dans la base: . . . . . . . . . . . . . . . . . . . . 38
5.3.4 Population à trend linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
5.3.5 Population à variabilité périodique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
5.4 Choix du nombre de grappes (k) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
5.4.1 Cas de listage circulaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
5.4.2 Utilisation d’intervalle fractionnel . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
CONTENTS 3

6 SONDAGE PAR GRAPPE 42

7 Sondage à probabilité inégale et sans remise 43


7.1 mode d’obtention de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
7.1.1 Méthode 1: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
7.1.2 Méthode 2: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
7.2 Déterminons les échantillons possibles: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 44
7.3 Le sondage à probabilité inégale avec remise: . . . . . . . . . . . . . . . . . . . . . . . . . . . 44
7.3.1 Mode d’obtention de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 44

8 SONDAGE A PLUSIEURS DEGRES 46


8.1 Définition et opportunité : . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
8.1.1 Définition du sondage à 2 degrés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
8.1.2 Remarque . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
8.2 Problème de répartition optimale de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . 47
8.3 La formule de l’estimateur et de l’operateur de l’espérance mathématique dans un sondage à
2 degrés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
8.3.1 l’operateur de l’espérance mathématique . . . . . . . . . . . . . . . . . . . . . . . . . 48
8.3.2 Formule des estimateurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
8.3.3 Estimation de Y . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
8.3.4 la variance de y D2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
8.3.5 Estimation de la variance de YD2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50

9 SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 52


9.1 Introduction: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52
9.2 Tirage avec remise-Tirage sans remise . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
9.3 Probabilité de tirage et probabilité d’inclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
9.3.1 Cas avec remise: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
9.3.2 Cas sans remise: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
9.4 Le sondage à probabilité inégale avec remise: . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
9.4.1 Mode d’obtention de l’échantillon .P . . . . . . . . . . . . . . . . .P. . . . . . . . . . . . 54
1 N N
9.4.2 Estimation de la moyenneY = N i=1 Y i et du total Yb = i=1 Y i = NY = Y 55
9.4.3 Estimation de la variance de ypiar . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55
9.5 Sondage à probabilité inégale et sans remise . . . . . . . . . . . . . . . . . . . . . . . . . . . . 56
9.5.1 mode d’obtention de l’échantillon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 56
9.5.2 Estimation : Estimateur de Horwitz-THOMSOM du total. . . . . . . . . . . . . . . . 57

10 SONDAGE A DEUX DEGRES A PROBABILITE INEGALE 60


10.1 Sondage à deux degrés: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
10.1.1 Notation: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
10.1.2 Estimateur de Y . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
10.1.3 cas particulier . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61

11 ESTIMATION PAR LA REGRESSION 62


11.1 Estimation de Y avec SAS sans remise de taille n dans une population P de taille N . . . . . 62
11.1.1 Dans la population . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
11.1.2 Dans l’échantillon: . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
11.1.3 Calcul de Yb reg . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
11.2 Comparaison de Yb , y et y . . . . . . .
reg q . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
CONTENTS 4

12 ESTIMATION PAR LE QUOTIENT 65


12.1 Définition et opportunité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
12.1.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
12.1.2 Opportunité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
12.2 Espérance mathématique de l’estimateur par le quotient . . . . . . . . . . . . . . . . . . . . . 66
12.2.1 Cas général E(r) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 66
12.3 Expression approximative du biais de r lorsque sont des estimateurs sans biais de et . . . . . 67
12.3.1 Cas d’un sondage aléatoire simple sans remise . . . . . . . . . . . . . . . . . . . . . . . 68
12.3.2 Calcul de l’erreur totale dans le cas de l’estimation par le quotient . . . . . . . . . . . 68
12.3.3 L’expression approximative de l’erreur lorsque ỹ et x̃ sont sans biais . . . . . . . . . . 68
12.3.4 Cas particulier d’un sondage aléatoire simple . . . . . . . . . . . . . . . . . . . . . . . 69
12.4 Comparaison dans le cas du SAS . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
12.4.1 Interprétation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
12.5 Estimation par le quotient dans le cas d’un sondage stratifié . . . . . . . . . . . . . . . . . . . 69
12.5.1 Méthode 1 Ratio stratifié . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
12.5.2 Méthode 2 Ratio combiné . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 70
12.5.3 Comparaison des deux méthodes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 70
1.1.1

1.1.4

FF

1
1.1.2

1.1.3

GENERALITE SUR LA THEORIE DE


SONDAGE

1.1 Concepts et définitions


1.1.1 Notion de population et individu
Généralement, une enquête porte sur un ensemble d’individu très large appelé population. C’est l’ensemble
des unités élémentaires sur lesquels porte l’enquête. Dans une population, chaque individu doit être
identifié sans ambiguïté.
Un individu ou unité statistique est un élément de la population à étudier. On l’appelle aussi unité
d’observation. Selon la problématique de l’étude, les éléments de la population peuvent être d’une autre
nature.

• Population de ménage pour une enquête auprès des ménages.


• Population de logement pour une enquête portant sur les logements.
• Population d’entreprise pour une enquête entreprise,. . . .

5
CHAPTER 1. GENERALITE SUR LA THEORIE DE SONDAGE 6

En général, étudier une population consiste à vouloir déterminer la valeur d’une ou de plusieurs carac-
téristiques quantitatives de cette dernière.

• la proportion de travailleurs à temps partiel dans une population.

• La proportion d’individus souffrant d’une certaine maladie dans une population


de malades.
• Le nombre moyen d’enfants par ménage dans la population des ménages consid-
érée.

• Le chiffre d’affaires totale d’une certaine population d’entreprise.

1.1.2 Recensement et Enquête


Définition
Le recensement ou la méthode exhaustive consiste à observer chacun des individus de la pop-
ulation selon les critères étudiés. C’est une opération très lourde avec un coûts très élevé et elle est
toutefois utile pour faire une situation de référence ou pour disposer d’une base de sondage pour la
conduite des enquêtes non exhaustive.

Enquête

On appelle enquête ou sondage l’opération qui consiste à observer une partie de la population
totale. C’est une opération légère par rapport au recensement mais aussi moins coûteuse. Le
sondage permet de fournir des informations complémentaires au recensement

. Il est fondé sur la loi des grands nombres. Ce qui constitue une limite car il faut enquêter un nombre
d’individus suffisamment grand.

1.1.3 Base de Sondage et Échantillon


Une base de sondage est une liste exhaustive et complète sans omission ni double compte de l’ensemble
des unités statistiques de la population. Dans la base de sondage, chaque unité est représentée par
un identifiant unique généralement désigné par un nombre compris entre 1 et N .

Chaque banque détient un fichier qui répertorie l’ensemble des personnes qui détiennent
au moins un compte chez elle; ce fichier peut être considéré comme une base de sondage
pour la population des clients de la banque.

Dans une étude, on ne dispose pas toujours une base de sondage. Par exemple, si on désire mener une
étude sur la population des sans-abris présents au Sénégal pour une période donnée, il n’y a aucun moyen de
retrouver une base de sondage pour cette population.
Une bonne base de sondage de la population doit avoir une correspondance avec la grande population ;
C’est-à-dire pour chaque individu de la population, il existe un et un seul numéro qui lui correspond.
Un échantillon est un sous ensemble de la population. Pour une enquête par sondage l’échantillon doit être
représentatif c’est-à-dire que la répartition de certaines catégories de variables est similaire à celle de ces
catégories dans la population. Par exemple, si la population est constituée de 35% des femmes, on doit
retrouver un pourcentage similaire dans l’échantillon. En résumé, l’échantillon, pour être représentatif, doit
être un modèle réduit de la population. Un sondage doit toujours se baser sur un bon échantillon.
CHAPTER 1. GENERALITE SUR LA THEORIE DE SONDAGE 7

1.1.4 Variable d’intérêt et paramètre


Dans une étude statistique, on s’intéresse aux différentes valeurs prises par une certaine variable dans une
population: c’est la variable d’intérêt. On cherche à caractériser la population par un certain nombre de
paramètres fonction de la variable d’intérêt. Pour obtenir ces paramètres qualifiés de paramètre population,
une solution consiste à réaliser un recensement pour recueillir la valeur que peut prendre la variable sur chaque
individu de la population; mais c’est une opération difficile à réaliser. Une alternative consiste à prélever un
échantillon d’unités statistiques dans la population interrogée, cette dernière se base sur la variable d’intérêt
des réponses recueillis sur cette échantillon pour déterminer des paramètres échantillons. Ces paramètres
échantillons seront utilisés comme une approximation des paramètres populations qui nous intéressent.

1.2 Principes et formalisations


1.2.1 Objectif d’un sondage
L’objectif du sondage est de déterminer la valeur d’un caractère quantitative ou paramètre population à
partir des observations réalisées dans un échantillon prélevé de la population.

1.2.2 Notations et principes


Nous désignerons par la lettre U l’ensemble représentant les individus de la population. Cette population est
composée de N unités statistiques noté u1 , u2 ,. . . , uN . On dit que la population est de taille N. La variable
d’intérêt est la variable que l’on s’intéresse dans la cadre de l’étude, elle sera notée Y. Sa distribution est
déterminée par les valeurs qu’elle prend sur chaque individu de la population. Nous désignerons ses valeurs
par Y1 , Y2 , . . . , YN . Par exemple Y1 est la valeur de la variable d’intérêt prise par l’individu u1 . La variable
d’intérêt peut être de nature quantitative ou qualitative. L’objectif du sondage sera donc de déterminer une
estimation d’un paramètre population synthétisant la distribution de la variable d’intérêt Y . Ce paramètre
peut être la moyenne de Y dans la population U ou le total de Y ou encore une proportion d’unité de la
population U chez lesquelles la variable d’intérêt prend une valeur X donnée.
On adoptera les notations suivantes τ = y1 + y2 + · · · + yN = yi le total de Y dans la population.
i∈u
1
X τ
µ= N yi = la moyenne Y dans la population. On note par π la proportion d’individus pour laquelle
i∈u
N
Y prend une valeur donnée. De façon générale, tout paramètre de population θ synthétisant la distribution
de Y est une fonction deY1 , Y2 , . . . , Yn : θ=θ(y1 , y2 , . . . , yN ). Si on ne peut pas réaliser un recensement pour
déterminer θ(y1 , y2 , . . . , yN ) on fait appelle à un sondage afin d’obtenir une estimation de Θ. Cet estimateur
sera noté par Θb et sera déterminé à partir d’un échantillon représentatif noté S. τb sera l’estimateur du total
τ ,µb l’estimateur de la moyenne Y et π b sera l’estimateur de π
2Les différentes méthodes de sondage

Il existe principalement deux méthodes de sondages: les méthodes probabilistes ou aléatoires et les méthodes
empiriques.
Les méthodes de sondages aléatoires nécessitent la disponibilité d’une base de sondage pour le prélèvement
de l’échantillon. Les résultats issues de sondage peuvent être extrapolés sur l’ensemble de la population.
Quant aux méthodes empiriques, elles ne nécessitent pas une base de sondage et les résultats ne peuvent être
extrapolés sur l’ensemble de la population car contrairement aux méthodes probabilistes le prélèvement de
l’échantillon ne suit pas une procédure aléatoire.

8
CHAPTER 2. LES DIFFÉRENTES MÉTHODES DE SONDAGE 9

2.1 Les méthodes probabilistes ou aléatoires


Définition
Une notion importante qui caractérise les méthodes aléatoires est la méthode du plan de sondage. Le
plan de sondage associé à une méthode de sondage aléatoire est définit par :

• La donnée de l’ensemble S de tous les échantillon qui est a priori possible de sélectionner avec la
méthode de tirage.
• La probabilité pour chaque échantillon d’être sélectionné: cette probabilité est notée p(s) et est
appelé
X probabilité de sélection de l’échantillon. La probabilité p(s) est strictement positive et
P(S) = 1
s∈S

Pour avoir ainsi, il faut nécessairement disposer une base de sondage complète (base dans laquelle toutes
les unités y sont) de sorte que chaque individu ait une probabilité d’être tiré. Le plan de sondage permet
de calculer pour chaque individu la probabilité pour qu’il fasse partie de l’échantillon, cette probabilité est
appelée probabilité d’inclusion de l’individu. Après avoir
Xdéfinit la plan de sondage, on calcule la probabilité
d’inclusion de l’individu I par la formule P(i ∈ S) = P (s): c’est la somme des probabilités de tous les
i∈s
échantillons contenant l’individu. Si tous les individus de la population ont la même probabilité, on parle
de sondage aléatoire à probabilité égale. Par contre, si la probabilité d’inclusion diffère d’un individu à un
autre, on parle de sondage aléatoire de probabilité inégale.
Dans la catégorie des méthodes aléatoires on distingue:
• le sondage aléatoire simple
• le sondage stratifié
• le sondage par grappe

• le sonde par plusieurs degrés

2.2 Les méthodes empiriques


Les méthodes de sondages empiriques se caractérisent par le fait qu’il ne n’est pas possible de déterminer à
priori la probabilité que chaque individu de la population appartient à l’échantillon. On utilise en générale
cette méthode lorsqu’on ne dispose pas de basse de sondage. Cette absence de base de sondage est pallié par
un ensemble de consignes donnés aux enquêteurs pour limiter les erreurs liées des unités à enquêter. Il existe
plusieurs méthodes de sondage empiriques.

2.2.1 La méthode des quotas


C’est la méthode empirique la plus fréquemment utilisée. Elle consiste à faire de sorte que la structure
de l’échantillon soit exactement similaire à celle de la population totale selon certains critères choisis au
préalable. Par exemple, si on sait que la population est constituée de 35% d’hommes et 65% de femmes, on
cherchera à avoir 35% d’hommes et 65% femmes dans la population. On cherche à respecter certains quotas
dans la constitution de l’échantillon pour le choix des quotas à fixer, on cherche des variables qui sont liées à
la variable d’intérêt de l’enquête. Pour chaque variable identifiée liée à la variable d’intérêt, on fixe un quota
à respecter.
CHAPTER 2. LES DIFFÉRENTES MÉTHODES DE SONDAGE 10

Methode de quotas

Ces quotas doivent être fixés sur la base de statistiques fiables et disponibles. Les variables de quotas
les plus utilisées sont:
• Pour un échantillon d’individu on a le sexe l’âge, la région et les caractères socioprofessionnels
du chef de ménage.

• Pour un échantillon de ménage on a aussi la région, l’activité socioprofessionnel du chef de


ménage, la taille du ménage,
Ces variables de quotas sont aussi appelées des variables auxiliaires.
Exemple : Pour un échantillon de 16 individus à enquêter on peut établir la feuille de quotas
ci-après :
Selon cette feuille de quotas l’enquêteur doit interroger 8 hommes et 8 femmes, 3 enquêtés âgée
de 15 à 24 ans . . .

2.2.2 La méthode des unités types


Cette méthode consiste à subdiviser en des groupes homogènes. les individus appartenant au même groupe se
ressemble et deux individus de groupe différents ne se ressembles pas. On choit en suite dans chaque groupe
une unité statistique représentant le groupe. cette unité statistique s’appelle unité type. Elle est censée situé
dans la moyenne du groupe par rapport à certain caractéristique. on choisit donc d’enquêter l’individu moyen
pour chaque groupe.

2.2.3 Méthode du volontariat


Pour cette méthode on interroge uniquement aux personnes acceptants de répondre au questions c’est-à-dire
les volontaires.
Par exemples les lecteurs de journal les adhérants d’une association, les usagers utilisant un certain produit
exceptant de répondre à des questions

2.2.4 La méthode de boule de neige


Cette méthode est adaptée pour les enquêtes auprès des individus possédants une certaines caractéristiques
rares On identifie une première personnes appartenant au population cible puis on luis demandes d’indiquer
d’autres personnes présentant les mêmes caractéristiques

2.2.5 La méthode des itinéraires


cette méthode est utilisée pour obtenir un échantillon de logement on impose a l’enquêteur un itinéraire en
lus indiquant exactement le circuit à suivre pour réaliser l’interview. l’itinéraire peut être retracer sur une
carte pour bien situes les adresses.

2.2.6 La méthode sur place


L’échantillon est dite surplace lorsque le choix de l’individu à enquêter est effectué sur le lieu. par exemple
le cinquième patient a se présenté a l’entrée d’une hôpital
CHAPTER 2. LES DIFFÉRENTES MÉTHODES DE SONDAGE 11

Donner la méthode d’enquête qui convienne

• on demande à 20 parent d’élèves des 3 collèges d’une commune d’indiquer chacun


le nombre de trois autres parent d’élèves de même âges qui pourront être enquêter
• Un questionnaire pour évaluer la raison de leur visite à l’hôpital est administre a
100 personnes qui se présentent dans le service concerné par l’enquête au cours
d’une semaine donnée
• un cabinet d’étude présente un sondage d’opinion de la façon suivante: sondage
effectuer du 20 au 30 décembre 2018 auprès d’un échantillon de 100 personnes
représentatif de l’ensemble de la population âgée de 18 ans et plus
• Pour construire un échantillon de canton l’INSEE précédant en 1942 de la façon
suivante elle divisa la France en 600 régions agricole et dans chaque région, désig-
nant un canton type
• Pour mener un sondage auprès des visiteur des musée la consigne suivante fut
donnée aux enquêteurs: une fois que vous avez terminé un questionnaire interroger
la cinquième personnes présente à l’entrée

• un psychologue dans le cadre de ces recherches à solliciter l’ensemble des étudiant


de la faculté psychologique. Son échantillon sera finalement constitué de 50 étu-
diants qui se sont choisi pour porter volontaire pour participer à cette expérience

2.3 Les erreurs inhérents aux méthode de sondages


Les méthodes de sondages permettent d’estimer les valeurs inconnues des paramètres population. ces valeurs
estimer sur la base d’un échantillon peuvent être différente des vraie valeurs des paramètres à causes de
certaine valeur erreurs qui peuvent se produire lors de la réalisation de l’enquête. l’erreur totale commises
lors d’une enquête par sondage peut être décomposé principalement en quatre types d’erreurs: L’erreur
d’échantillonnage, l’erreur de couverture, l’erreur de mesurer et l’erreur dûs à la non réponse.

l
’erreur total = erreur d’échantillonnage + erreur de couverture + erreur de mesure + erreur de non
réponses

2.3.1 Erreur d’échantillonnage


c’est l’erreur liée à la procédure d’estimation. elle est inévitable puisqu’on estime paramètre population à
partir d’un échantillon

2.3.2 Erreur de couverture


cette erreur a lieu lorsque lorsque le base de sondage n’est pas exhaustive, les unités ne figurants pas dans la
base de sondage auront une probabilité nulle de faire partir de l’échantillon. Il y’ a également les cas où la
base de sondage inclus certain individu ne faisant pas partir de la population cible
CHAPTER 2. LES DIFFÉRENTES MÉTHODES DE SONDAGE 12

2.3.3 Erreur de mesure


erreur de mesure intervient lorsque l’enquêteur ne collecte pas la bonne information. cette erreur peut être
dus à l’enquêteur ou à l’enquêté lui même. elle peut être également être dû à une mauvaise formulation du
questionnaire de l’enquête

2.3.4 L’erreur du au non réponse


Il y’ a une non réponse dès qu’il existe au moins un individu pour le quelle au moins une question n’a pas
reçu de réponse on dit qu’il y à une valeur manquante

2.4 les étapes d’une enquête par sondage


Les étapes à suivre pour réaliser une enquête par sondage peuvent être résumé dans le schéma ci après

2.4.1 Objectif et contrainte


La première étape consiste à définir les objectifs de l’enquête et les contraintes. On précise le domaine
d’étude, le paramètre à estimer, la variable d’intérêt, le champs de l’enquête et les précisions souhaités pour
les estimateurs. Quant aux contraintes elles sont essentiellement liées au coût de l’enquête a la disponibilité
d’information auxiliaire . . . .

2.4.2 base de sondage


cette étapes consiste à la recherche d’une base de sondage complète pour le tirage de l’échantillon. A ce
niveau on peut combiner plusieurs sources pour constituer la base de sondage finale

2.4.3 L’échantillonnage
C’est l’étape où l’on choisit les unités à enquêter. Il existe plusieurs algorithme pour le tirage de l’échantillon.
Tout dépend du plan de sondage

2.4.4 Conception du questionnaire


C’est l’étape de formulation des questions Vienne ensuite les autres étapes telles que la collecte, le traitement
l’analyse des données et la publication des résultats
3
Le sondage aléatoire simple

3.1 Définition
Définition
Le SAS est la méthode de base des sondages probabiliste. Il est très peut utiliser dans la pratique
mais constitue un point de départ pour la maîtrise des autres méthodes d’aléatoire de sondage. C’est
un sondage à un seul degré où l’unité échantillonné coïncide avec l’unité d’observation. Pour cette
méthode tous les unités ont la même probabilité d’être tiré. Dans le mode de tirage on distingue deux
cas:
Le tirage des unités se faite avec remise, On parle de probabilité égale avec remise (PEAR)
Le tirage se fait sans remise, on parle de probabilité égale sans remise(PESR).
Dans le première cas un individu peut être tiré deux fois et dans le second cas on obtient un échantillon
sans répétition

13
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 14

3.2 Notation
Dans la suite du cours on adoptera les notations suivantes:

n
1 X
Y = Yi :la moyenne de la variable d’intérêt Y dans la population.
N i=1
n
1 X
σY2 = (Yi − Y )2 : La variance ou la dispersion de Y dans la population
N i=
N : la taille de la population
TY = N Y : le total Y dans la population
n
2 1 X
SY = (Yi − Y )2 : la variance corrige ou la quasi-variance
N − 1 i=1
N
SY2 = σ2
N −1 Y

Pour ce qui est de l’échantillon on note n: la taille de l’échantillon

Yj : la valeur de la variance d’intérêt pour l’individu j de l’échantillon


yj : est une valeur aléatoire qui peut prendre les valeurs Y1 , Y2 , . . . , YN sa valeur dépend de l’individu tiré.
n
1X
y= yi : la moyenne dans l’échantillon
n i=1
tj = ny:le total
n
1 X
s2y = (yi − y)2
n − 1 i=1
n
1X
σy2 = (yi − y)2
n i=1

Ces valeurs dépendent de l’échantillon tirés. Ce sont donc des variables aléatoires.
Le rapport n/N = f est le taux de sondage.

3.3 Probabilité d’inclusion


3.3.1 Tirage avec remise
La probabilité pour que l’individu fasse partir de l’échantillon πi = P (i ∈ S) est :

1 − πi = p(i 6∈ S)
= (N − 1)/N × (N − 1)/N × . . . (N − 1)/N
n
= [(N − 1)/N ]

Alors πi = 1 − [(1 − 1/N )]n ∀i = 1 à n


Si n  N (la taille de l’échantillon est faible) alors πi ≈ n/N
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 15

3.3.2 Tirage sans remise

1 − πi = P (i 6∈ S)
= (N − 1)/N × (N − 2)/(N − 1) × (N − 3)/(N − 2) × · · · × (N − n)/(N − n − 1)
1 − πi = (N − n)/N

Soit la population {1, 2, 3} et le plan de sondage suivants:


1 1 1
P [{1, 2}] = 2 P [{1, 3}] = 4 P [{2, 3}] = 4

1. Est-ce un sondage aléatoire simple?

2. Calculer π1 , π2 et π3
3. Calculer π12 et π23
4. Quel est le π-estimateur de Y (on notera Y1 , Y2 et Y3 les valeurs respectives de la
variable Y)

(a) si l’échantillon {1,2} est tiré?


(b) si l’échantillon {1,3} est tiré?
(c) si l’échantillon {2,3} est tiré?
(d) Vérifiez que π-estimateur est un estimateur sans biais.

5. Ecrire ce que seraient les probabilités d’échantillon P et les probabilités d’inclusion


π pour un sondage aléatoire simple à probabilités égales sans remise

3.4 Estimation de la moyenne Y , du total et intervalle de confiance


3.4.1 Estimateur
Soit yi une variable aléatoire dans {y1 , . . . , yn }
P(yi = Yi ) = 1/N
PN PN
E(yj ) = i=1 Yi P (yi ) = N1 i=1 Yi = Y
Donc la moyenne de l’échantillon estime sans biais( est un estimateur sans biais (ESB) de la moyenne Y ).

3.4.2 La variance de Y

n
!
1X
V ar(y) = V ar yj
n i=1
n
1 X
= [V ar(yj )]
n2 i=1
N
1 X 2
V ar(yj ) = Yi − Y = σ 2
N i=1

σ2
1
Pn
Alors V ar(y) = n2 i=1 σ2 = n
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 16

La variance de y ne dépend pas de la taille de la population N . Comme y est sans biais, l’erreur totale est
2
égale à la variance σn .
La variance est inconnue, on peut cependant l’estimer à partir de l’échantillon pour avoir une idée de la
précision de l’estimateur.

s2 1
Pn
Vb (y) = n , où S 2 = (n−1 j=1 (yj − y)2 est E.S.B de σ 2

3.4.3 L’intervalle de confiance de Y


Si µ est la moyenne que l’ont veut estimer c’est-à-dire Y , On a:

y−µ
 √
P σ/ √
n
≤ zα = α =⇒ Y ∈ [y ± zα × σ/ n]

où Y est la moyenne observée dans la population.

1
Pn
Montrons que s2 = n−1 i=1 (yi − y)2 est un estimateur sans biais de σy2

Comme σy est inconnue, on l’estime par s2 et donc un intervalle de confiance au niveau α de l’estimateur
de la moyenne y est:
 √ √ 
IC(y) = y − z1− α2 s/ n; y + z1− α2 s/ n
avec z1− α2 est la quantité d’ordre (1 − α2 ) de la loi normale centrée réduite N (0, 1)

3.4.4 Estimation du total TY


Puisque y est un estimateur de Y et que N est connue alors Tc
Y = N y est un estimateur sans biais du total.
Xn

Y ) = E(N y) = N E(Y ) =
En effet on E(Tc yi .
i=1
Donc la moyenne de l’echantillon multipliée par la taille N de la population est l’estimateur sans biais du
total de Y dans la population

3.4.5 Intervalle de confiance pourTY


2
cy ) = V (N y) = N 2 V (y) = N 2 σy
V (T n

Puisque s2 est un estimateur sans biais de σy2


2
\ cy ) = N 2 sy
V (T n

On déduit donc de même que:


 q 
IC(Ty ) = tby ± µ1− α2 V\
ar(ty )

est un intervalle de confiance au seuil de α% pour le total de la population

3.5 Tirage aléatoire sans remise (PESR)


Comme dans la cas avec remise, y estime sans biais Y et tby estime sans biais Ty (on utilise le même raison-
nement que dans le cas avec remise)
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 17

3.5.1 Calcule de la variance


Xn
1
V (y) = n2 V ( yj )
j=1

Ici les yj ne sont pas indépendantes car le tirage est sans remise
V (y) = E(y − E(y))2
(
1 si i∈ s n
Soit εi P (εi ) = πi = N
0 sinon

n n

∆kk = V ar(1k (S)) = N 1− N = f (1 − f )
n(n−1) n n f (1−f )
∆kl = cov(1k (S), 1l (S)) = N (N −1) − N N = − N −1

n N
1
X 1X 1
PN
y= n yi = Yi εi et Y = n i=1 Y εi Ainsi
i=1
n i=1

N N
!2
2 1X 1X
y−Y = Yi εi − Y εi
n i=1 n i=1
N
!2
1 X
= 2 (Yi − Y )εi
n i=1
 
N
1 X X
= 2 (Yi − Y )2 ε2i + (Yi − Y )(Yj − Y )εi εj 
n i=1 i,j
 
N
1 X X
E(y − Y )2 = 2  (Yi − Y )2 E(εi ) + (Yi − Y )(Yj − Y )E(εi εj )
n i=1 i,j

or
n
E(i ) = P (i ∈ s) =
N
n(n − 1)
E(εi εj ) = P (i et j ∈ s) = d’autre part
N (N − 1)
X n
X
(Yi − Y )(Yj − Y ) = − (yi − Y )2
i,j i=1

"N n
#
1 X n n(n − 1) X
V (y) = 2 (Yi − Y )2 − (yi − Y )2
n i=1 N N (N − 1) i=1
n
N −n X
= (yi − Y )2
nN (N − 1) i=1
s2
=(1 − f )
n
On en déduit ainsi les intervalles de confiances pour le total et la moyenne au seuil de α%
 q q 
s 2 s 2
IC(Y ) = y − U1− α2 (1 − f ) n ; y + U1− α2 (1 − f ) n
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 18

On donne N = 4

i 1 2 3 3
Y 11 10 8 11

1. Déterminer la distribution de Y
2. Calculer E(Y ), var(Y ) et SY2
3. On considère un échantillon n = 2 sans remise à probabilité égale

(a) Combien d’échantillon possible?


b et s2 sa variance corrigée.
(b) Pour chaque échantillon, calculer la moyenne µ
b et s2 ?
(c) Quelle est la distribution de µ
µ) ,E(s2 ) et var(s2 )
(d) En déduire E(b
(e) Analyser les résultats

4. Reprendre les même questions avec remise

3.6 Comparaison de deux estimateurs


pour comparer le tirage sans remise et le tirage avec remise, on compare la précision (la variance) des
estimateurs dans les deux tirages
2
Dans le cas avec remise, on a V ar(y1 ) = nσ dans l’autre cas, V ar(y2 ) = (1 − f ) sn

s2
V ar(y2 ) =(1 − f ) −
n
N − n σ2

=
N −1 n
 
N −n
= V ar(y1 )
N −1

• Si n > 1, alors V (y2 ) < V (y1 ) Le tirage sans remise est meilleur que le tirage avec remise.
(N −n)
• Lorsque n est très petit devant N , (N −1) ≈ 1, dans ces conditions les deux tirages sont peu près pareils.

La variance dépend beaucoup plus de n que de N . Ainsi, un échantillon de taille 1000 sera pratiquement
aussi performant pour étudier une variable dans une population de taille 100.000 ( 1 − f ≈ 0, 99 ) que dans
une population de taille ( 1.000.000) : (1 − f = 0, 999) 1 − f est appelé coefficient de correction finie ou
coefficient d’exhaustivité

3.7 Estimation d’un proportion


Dans cette section, on s’intéresse à l’estimation d’une proportion p de la population présentant une certaine
caractéristique donnée. Soit Y la variable aléatoire définie comme suit:
(
1si i possède la caractéristique
Yi Le caractère Y peut représenter la possession, le fait d’être atteint
O sinon
d’une maladie, le fait de posséder ou pas un compte dans une banque etc.
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 19

De manière générale Y peu représenter ou pas le fait de posséder une certaine caractéristique. La
proportion p à estimer le nombre d’individus présentant la caractéristique sur la population totale:
PN
p = N1 i=1 Yi

Estimer p revient donc à estimer la moyenne Ȳ dans la population

3.7.1 Cas du tirage avec remise


1
PN
P
c1 = yb1 =
n i=1 Yi : La moyenne de l’échantillon
2
V (pb1 ) = σn = p(1−p)
n
s2
Vb (pb1 ) = y n

or
n
1 X
s2y = (yi − pb1 )
n − 1 i=1
" n #
n 1X
= (yi − pb1 )
n − 1 n i=1
pb1 (1 − pb1 )
=
n−1
L’intervalle de confiance pour la proportion à estimer est:
" r #
pb1 (1−p 1)
IC(p1 ) = pb1 ± µ1−α/2
c
n−1

Pour le cas sans remise, on a


2
Vb (pb2 ) = (1 − f ) s2 = (1 − f ) pb2 (1−p 2)
c
n−1

ce qui donne
" r #
IC(p2 ) = pb2 ± µ1−α/2 (1 − f ) pb2 (1− p 2)
c
n−1

L’erreur relatif est donné par;


σ
εr = pb1 et la taille de l’échantillon s’écrtit: n = 1−pb21
E(pb1 ) pb1 r

P 0.5 0.1 0.01 0.001


n≈ 100 900 9900 99000

Plus la proportion à estimer est faible plus n est grand; si se fixe l’erreur relative a un niveau donné (10%).
Autrement dit si on a un seul échantillon de taille n on ne peut pas estimer plusieurs proportions avec la
même précision. Il devient donc difficile d’observer les individus rares au moyen d’enquête par sondage de
manière aléatoire simple. Quand n est grand T.L.C nous permet d’avoir :

√ pb − p
np →T CL N (0, 1
p(1 − p)
Si l’on cherche un intervalle de confiance à partir de cette formule, on aura
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 20


 
p−p
P n √b ≤α =1−α
p(1−p)
√ p  p √
p − p| ≤ α p(1 − p) = 1 − α or p(1 − p) ≤ 12 ⇐⇒ P p − p| ≤ α 21 ≥ 1 − α

P n|b n|b
L’intervalle de confiance de niveau 1 − α
h i
IC 1−α = Pb ± µ1− α2 × 2√1 n

On veut estimer le taux de couverture vaccinale des enfants de 12 à 23 mois avec une
erreur relative de 10% prés. Le taux estimé lors d’une enquête antérieure est de 40%.
La même moyenne de ménage est mn =6 personnes.
Les enfants de 12 à 23 mois représentent 4% de la population. Calculer la taille de
l’échantillon des ménages pour que l’estimation donne soit dans une marge d’erreur de
10% de la vraie proportion P avec un IC de 95%.
NB : l’expérience a montré que pour ce genre d’enquête le taux de non réponse est de
8%.

3.8 Problème de taille de l’échantillon


Il existe plusieurs solutions à ce problème dépendant du contexte dans lequel on se trouve

Cas tirage sans remise


1. La contrainte budgétaire peut imposer la taille de l’échantillon :
Soit C le coût unitaire et B le budget total, la taille de l’échantillon n = B
C
Toutefois, cette taille ne garantit pas de bons résultats en termes de précision
2. Si l’on peut se considérer comme affranchi de la contrainte budgétaire
Sy2
(a) Quelle sera la variance de y2 pour une valeur une valeur de n donnée. V (y2 ) = (1 − f ) n ,
cependant, cela nécessite la connaissance de Sy2 en général inconnue.
(b) Qu’est-ce-qu’il faut prévoir comme taille de l’échantillon n pour avoir une 
précision donnée ?
Sy2 N Sy2

On a V (y2 ) = (1 − f ) n on peut donc tirer n à partir de cette égalité N V (y2 )+S 2 On peut
y

s’intéresser à la précision relative de l’estimation r2 (y) coefficient de variation


V (y2 ) 1−f Sy2
r2 (y) = [E(y2 )]2
= n × y2
≤α
(c) On peut fixer une marge d’erreurs E0 qu’on ne doit pas dépasser et comme Eα pour un niveau
donné, on aura:

s2
Eα ≤ E0 =⇒ µ21−α/2 (1 − f ) ≤ E02
n
=⇒ nE02 ≥ µ21−α/2 (1 − f )s2
n
µ21−α/2 (1 − N )s
2
=⇒ n ≥
E02
N S 2 µ1−α/2
=⇒ n ≥
N E02 + S 2 µ1−α/2
CHAPTER 3. LE SONDAGE ALÉATOIRE SIMPLE 21

On veut estimer la superficie moyenne d’une population de 1800 exploitation agricole.


Une enquête antérieure a permis d’obtenir s2 = 250. Quelle doit être la taille de
l’échantillon si l’on ne veut pas dépasser une marge d’erreur de 2ha par rapport à la
vraie valeur et avec un niveau de confiance de 95%
On donne E0 = 2, α = 0, 05, N = 1800, µ1− α2 = 1, 96
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

22
4SONDAGE PAR STRATIFICATION

4.1 Principe et justification


La précision des estimateurs d’un SAS dépend de la dispersion de la variable de la variable d’intérêt. Le
SAS donnera des estimations plus précises que si la population est homogène suivant la variable d’intérêt. Si
la population est hétérogène, on peut rendre les estimations plus précises en constituant des sous- groupes
homogènes appelés « strates ». La variable qui sert à former les strates (critère de stratification) doit être
corrélée avec la variable d’intérêt. Une fois les strates formées, on peut repartir les individus entre elles
et on procède au tirage à l’intérieur de chaque strate. L’avantage principal de la stratification est que ça
permet d’obtenir des gains de précision par rapport au SAS et de faire des estimations par strate à des fins
de comparaison
La stratification permet aussi d’employer les méthodes de sondage ou de collecte d’information différentes
suivant les sous-populations. L’information supplémentaire permettant de diviser la population en strate doit
être disponible pour chaque unité d’échantillonnage afin que l’on puisse affecter chaque unité à une et une
seule strate. Une fois cette variable disponible, les problèmes à résoudre sont les suivants :
i . Combien de strates retenir ?
ii . Comment procéder au découpage (où mettre les coupures) ?
iii . Comment repartir l’échantillon entre les strates ?
iv . Comment procéder à l’estimation?
Nous allons répondre à ces questions dans l’ordre inverse auquel elles ont été posé

23
CHAPTER 4. SONDAGE PAR STRATIFICATION 24

4.2 Cas du tirage aléatoire simple (sans remise)


4.2.1 Notation
Pour ce chapitre on utilisera les notations suivantes
PN . La population P est découpée en K strates d’effectifs
Nh pour chaque strate, h = {1, . . . , K}, N = h=1 Nh , Nh , . . . Nh connus, On note Yhi la valeur de la
variable d’intérêt Y mesurée sur l’individu i de la strate h.

Yhi = La valeur de Y mesurée sur l’individu i de la strate h


Nh
X
Yh = Yh ile total de Y dans la strate h
h=1
NH
1 X Yh
Yh = Yhi = moyenne de Y dans la strate h
Nh i=1 Nh
h N
2 1 X
Syh = (Yhi − Yh )2 variance corrigée de la strate h.
Nh − 1 i=1
K
Y X Nh
Y = = Yh moyenne de Y dans la population
N N
h=1
K
X
Ty = Nh Yh : Le total
h=1
Nh
1 X
σh2 = (yh i − Yh )2
Nh i=1
K Nh K
1 XX 2 X Nh 2
S2 = Yhi − Yh + Yh − Y
N −1 j=1
N −1
h=1 h=1
K K
1 X
2
X Nh 2
= (Nh − 1)Syh + Yh − Y
N −1 N −1
h=1 h=1
K K
X Nh 2 X Nh 2
≈ S + Yh − Y
N yh N
h=1 h=1
nh = La taille de l’échantillon dans la strate h
K
X
nh = n : La taille de l’échantillon
h=1
nh
: Le taux de sondage dans la strate h
Nh
PK
n h=1 nh
f= = PK : Le taux de sondage global
N h=1 Nh
nh
1 X
yh = yhj
nh j=1
hn
1 X 2
s2h = (yhj − yh )
nh − 1 j=1
CHAPTER 4. SONDAGE PAR STRATIFICATION 25

4.3 Estimation de la moyenne


l’estimateur y = Yb de la moyenne dans le cas de la sondage stratifie est donnes par:
PK
y = N1 h=1 Nh yh
En effet puisqu’on réalise un SAS dans dans chaque strate yh est estimateur sans biais de la moyenne Yh
dans la strate h
Le total de la strate h est estimé par T
ch = th = Nh yh le total de la population est estime par la somme des
P K ch d’où la moyenne est Yb = 1 Tb = PK Nh yh et on vérifie aisément
totaux dans chaque strate Tb = h=1 T N h=1
que
PK PK PK
E(Yb ) = E( N1 h=1 Nh yh ) = N1 h=1 Nh E(yh ) = N1 h=1 Nh Yh = Y =⇒ E(Yb ) = E(Y ) = Y .
La variance de y est donnée par:
PK Nh 2 S2
V (y) = h=1 ( N ) (1 − fh ) nhh
avec fh = nh /Nh le taux de sondage dans la strate h
. En effet on a :
PK Nh
V (y) = V ( h=1 N yh )

or le tirage se fait de façons indépendante entre les strates, on a donc:


PK PK
V (yh ) = i=1 V ( NNh yh ) = h=1 ( NNh )2 V (yh )
S2
or on fait un SAS dans chaque strate, d’après le cours précèdent on a V (yh ) = (1 − fh ) nhh d’où :
PK Nh 2 S2
V (y) = h=1 ( N ) (1 − fh ) nhh
La question que l’on se pose à ce niveau est de savoir lequel des deux estimateurs y2 etys est le meilleur ? Si
y2 est meilleur, on ne fera jamais de sondage stratifié. Nous allons donc comparer les deux estimateurs. Dans
le cas général, on ne peut pas conclure (cela signifie que toute stratification n’est pas bénéfique a priori).
Pour conclure, on doit restreindre le champ et on se donnera une clé de répartition entre les strates.

4.4 Sonde stratifié proportionnel


4.4.1 Définition
Définition
C’est une procédure qui repose sur l’une des notions intuitives de la représentativité. Elle correspond
à une photo réduction de la population en respectant les structures et les rapports. L’échantillon aura
donc, au regard du caractère de contrôle, la même structure que celle de la population.

Interpretation
• - les strates auront les mêmes poids dans l’échantillon que dans la population, c’est-à-dire ∀h =
1, . . . , K, nnh = NNh
• - le taux de sondage est le même dans toutes les strates,
∀h = 1, . . . , K, nnh = NNh =⇒ N
nh
h
n
=N =⇒ fh = f ,
Ce sondage est aussi appelé sondage représentatif mais on préfère l’expression, « sondage auto-
pondéré » à cause du résultat suivant :
CHAPTER 4. SONDAGE PAR STRATIFICATION 26

PK PK Pnh PK N 1 Pnh
Désignons ys par y prop = h=1 NNh yh = h=1 NNh N1 j=1 yhj or Nh N
nh n =⇒ y prop = h=1 n N j=1 yhj
PK Pnh
y prop = n1 h=1 j=1 yhj
On constate l’extrême simplicité de cette somme. Bien que le sondage stratifié, il se dépouille comme un
recensement.

Comparaison avec le SAS


Les deux estimateurs étant sans biais, on compare donc leurs variances :
V (y prop )
V (y2 ) = 1−f 2 2
n × S =⇒ V (y2 ) = η ≤ 1 d’où le sondage auto-pondéré est meilleur que le SAS si η 6= 0
Ce résultat permet de voir que :
• V (y prop ) ≤ V (y2 )

• Le gain par rapport au SAS est d’autant plus grand que la corrélation entre la variable d’intérêt et
la variable de contrôle est élevée. C’est la raison pour laquelle on cherchera toujours une variable de
contrôle fortement liée à la variable d’intérêt. Cependant, on n’est souvent pas libre dans le choix de
la variable de contrôle car tout simplement l’information n’est pas disponible. On est donc conduit à
retenir des critères de contrôle tels que le sexe, l’Age, la taille des unités économiques . . .

On cherchera donc à construire des strates avec des moyennes aussi hétérogènes que possibles entre les strates
(variance inter élevée) et des individus aussi homogènes que possible à l’intérieur de chaque strate (variance
intra faible).
Quoiqu’il en soit , en pratique, le gain est relativement faible et peut être obtenu moyennant une augmentation
de la taille de l’échantillon ( si cette augmentation est possible).

4.5 La répartition de l’échantillon


l’expression de la variance de l’estimateur de la moyenne montre que la précision der l’estimateur a la taille
des strates. Le statisticien dans le mise en oeuvre du plan stratifié doit choisir les petit nh de sorte à avoir
une bonne précision des estimateurs. Il s’intéresse sur la façon de choisir les nh il existe plusieurs solutions a
cette question parmi lesquelles: l’allocation proportionelle et l’allocation optimale de Neyman

4.5.1 Plan stratifie avec allocation proportionnelle


c’est le plan le plus utilisé et le plus simple en mettre en oeuvre il consiste a fixer les nh de sorte que le poids
de la strate soit le même dans l’échantillon et dans la population. Dans l’échantillon la strate h a un poids
nh /n ce poids est égale Nh /N dans la population. L’allocation proportionnelle est donc telle que nh = n× NNh
ceci revient à appliquer le même taux de sondage dans toutes les strates
NB
il arrive dans parfois dans le calcule de nP h que le résultat ne soit pas un entier il faut donc recourir a une
K
procédure d’arrondir et vérifie que l’on a h=1 nh =n

4.5.2 Expression de la variance


la variance de l’estimateur de la moyenne pour un plan stratifier avec une allocation proportionnelle est
K
X
V (yp ) = 1
n (1 − n 1
N )N Nh Sh2
h=1

En effet
CHAPTER 4. SONDAGE PAR STRATIFICATION 27

K
X Nh 2 S2
V (yp ) = ( ) (1 − fn ) n
N nh
h=1

Si le plan est à allocation proportionnelle, on a nh /Nh = n/N = fn = g = f


K
X Nh 2 S2
V (yp ) = ( ) (1 − fn ) nNhh
N N
h=1
K
1 n X Nh2 N
= (1 − ) × × Sn2
n N N2 Nh
h=1
K
1 n 1 X
= (1 − ) Nh Sh2
n N N
h=1

D’où le résultat
Si Nh est grand alors Sh2 ' σh2 donc
1 2 1
V (yp ) = n (1 − f )σintra ≤ n (1 − f )σ 2
1
Dans le cas d’un SAS, on a V (yp ) = n (1 − f )σ 2 donc
V (yp ) ≤ V (ys )
D’où l’allocation proportionnelle donne de meilleures précisions que le SAS.
Ce résultat est d’autant plus vrai que le variable des stratification (variable auxiliaire) est liée à la variable
d’intérêt. Il faut donc toujours stratifier selon une variable liée à la variable d’intérêt

4.5.3 Plan stratifie avec allocation optimale de Neyman


Pour ce plan on cherche l’allocation de l’échantillon entre les strates de sorte à minimiser la variance de
l’estimateur. On distingue l’allocation qui tient contre la contrainte des coûts et celle qui n’en tient pas
compte Allocation optimale sans contraint de coût. On résout le programme

K
 X Nh 2 S2
M in V (y) = ( ) (1 − fh ) h



 N nh
h=1
PK


 SC h=1 nh = n

n ≤ N
h h

La solution de ce programme de minimisation est:


Nh Sh
nh = n × K
X
Nh Sh
h=1

4.5.4 Répartition Optimale avec contrainte de coût


Ici, on résout le programme


 M in V (ys )
SC PK n = n

h=1 h


 n h ≤ N h
PK
C = h=1 nh Ch

On trouve comme solution


N
√h Cn c
nh = Cn
× PK
Nh Sh
h=1
CHAPTER 4. SONDAGE PAR STRATIFICATION 28

Remarque

I
l est difficile d’approcher les fonctions de cout par strate. Il serait donc préférable de déterminer la taille
de l’échantillon à partir du budget disponible tout en faisant abstraction des Ch (Ch =constante= C).
La méthode Neymann n’est conseillée que si les Sh sont très différentes p entre elles. Elles n’est donc
pas adaptée à l’estimation d’une proportion car on aura Sh = ph (1 − ph ) , ce qui varie lorsque
ph ∈ [0, 1; 0, 9]
La méthode est par contre recommandée lorsque le critère de stratification est une mesure de la
taille de l’échantillon. Il faut par ailleurs noter que l’allocation optimale pour une variable Y ne
l’est pas forcément pour une variable Z. Ainsi, dans de telle situation, on cherchera un compromis,
c’est-à-dire un dénominateur commun aux variables et on fera notre stratification selon cette variable.
L’allocation de l’échantillon pour le calcul de la moyenne générale.

on a deux strates et on veut comparer Y1 − Y2 et y1 − y2


S2 S2
V (y1 − y2 ) = V (y1 ) + V (y2 ) = n11 + n22
En minimisant cette variance sous la contrainte que n1 + n2 = n et Ch =constante , on
aura nS11 = nS22 et n1 = n × PKN1 S1
Nh Sh
h=1

4.6 Formation des strates


4.6.1 Homogénéité des strates
Le fils conducteur dans cette phase est la recherche de l’homogénéité interne des stratespar rapport à la
PK 2 S2
variable étudiée. En général, on a V(ys )= h=1 NNh (1 − fh ) nhh qui est une fonction de Sh2
. Ainsi, plus Sh2 est petite, plus la variance de l’estimateur est faible. Par ailleurs, y étant inconnu, on
prendra une variable de contrôle x fortement corrélée avec y dans l’espoir que si les strates sont homogènes
par rapport à x, elles le seront avec y.
Supposons que si x est à valeurs dans R ; on peut définir les k strates comme suite :
Soient x1 , x2 . . . xK−1 , (K − 1 ∈ R)

p1 = {i ∈ p/Xi ≤ x1 }
p2 = {i ∈ p/x1 ≤ Xi ≤ x2 }
ph = {i ∈ p/xh−1 ≤ Xi ≤ xh } . . .
pK = {i ∈ p/Xi > xk−1 }

Si xh est proche de xh−1 , la strate ph sera homogene au regard de la variable x et du coup, homogène
par rapport à y. La variable x sera donc choisi comme une mesure de la taille des unités d’échantillonnage
fortement corrélée à d’autres variables (souvent économiques). Par exemple, les entreprises seront classées
selon le nombre d’employés. Or, le nombre d’employés est fortement corrélé au chiffre d’affaire. Dans le cas
des ménages, ils sont classés selon le nombre d’adultes.

4.6.2 Choix des limites des strates


il s’agit de voir comment choisir au mieux les x1 , x2 . . . xK−1 , c’est-à-dire où placer les coupures.
CHAPTER 4. SONDAGE PAR STRATIFICATION 29

Cas d’un échantillon proportionnel


X h +X h+1
On choisit :xh = 2 , on procède par approximation successive

Répartition de Neymann
S 2 +(X −X ) S2 +(X −X
h h+1)
Neymann propose de choisir h de telle sorte que : h Shh h = h+1 Sh+1 Sur le plan théorique, la
question du choix des limites de strates est d’une importance très limitée. Car on a généralement pas de
grandes possibilités de choix entre plusieurs variables de contrôle. Les critères de contrôle seront généralement
de types qualitatifs définissant les domaines géographiques et /ou une répartition géographique.

4.7 Le nombre de strates (le choix de K)


La précision des estimateurs augmente avec le nombre de strate. On peut à la limite former autant de strate
que l’on a d’unité d’échantillonnage et tirer une unité par strate
• Il faut cependant noter que k est soumis à certaines contraintes :

• K≤n
n
• Il faut au moins 02 individus par strate pour estimer Sh2 =⇒ K ≤ 2

• Si la précision augmente avec le nombre de strate, le gain devient de plus en plus faible lorsque K
augmente, ce qui justifie qu’à partir d’un certain niveau, l’Investissement nécessaire a la construction
d’une strate supplémentaire devient supérieur au gain. Il faut noter que tout ceci s’applique lorsque la
stratification est faite pour gagner en précision.

4.8 Retour sur la répartition optimale de l’échantillon : cas de


plusieurs estimations
4.8.1 Estimation des moyennes de plusieurs variables
Nous avons vu que l’allocation optimale pour une variable peut ne pas être optimale pour une autre. Pour
résoudre ce problème , nous avons 02 solutions :

Une solution empirique


• Les variables Y , Z et T sont quantitatives

Si les variables d’intérêt Y , Z et T sont liées à la variable de contrôle X, on prendra l’allocation optimale
pour l’estimation de la moyenne X et X.
• Les variables Y , Z et T sont qualitatives

Il s’agit donc d’estimer des proportions. En général, on fait recours à la répartition de Neymann dans le cas
de l’estimation des proportions.
Les variables Y , Z et T sont quantitatives et qualitatives;
On peut prendre la répartition optimale pour les variables quantitatives;
Examiner la précision de cet échantillon pour les variables qualitatives. Si la précision est bonne, on garde
l’échantillon ; Sinon, on augmente la taille de l’échantillon dans les strates où la variance est trop grande pour
atteindre le niveau de précision souhaité. On ramène ainsi par homothétie, l’échantillon à la taille désirée
pour l’ensemble des variables.
CHAPTER 4. SONDAGE PAR STRATIFICATION 30

i) Le recours à la programmation
On peut par exemple fixer pour chaque variable le niveau de précision souhaité.

V (ys ) ≤ t1 (1)
V (Zs ) ≤ t2 (2)
V (ts ) ≤ t3 (3)

( PK
M in h=1 nh
S/C(1), (2), (3)

Estimation de la moyenne au niveau global et au niveau de certaines domaine d’études


Exemple : « National et Régional » On prend alors le domaine d’étude comme étant les strates naturelles et
on aura région = strates. On fixe le niveau de précision pour chaque domaine et on obtient un programme
équivalente à ce qui suit :
 PK


 M in h=1 nh
S/C



V (ys ) ≤ t1

V (Zs ) ≤ t2




V (t ) ≤ t
s 3

Si le niveauPde précision est fixé pour chaque strate, on ressoude le programme dans les strates et on aura nh
K
donne n = h=1 nh
Si le niveau de précision est fixé au niveau global, on aura par exemple dans le cas d’une allocation propor-
tionnelle et pour une seule variable.
K
1 − f X Nh
V (Y prop ) = × Sh2
n N
h=1
K
1 − f X Nh
Kα2 V (Y prop ) = Kα2 × Sh2 ≤ E02
n N
h=1
PN
N h=1 Nh × Sh2
nprop =  2 P
E0 N
N2 K α
+ h=1 Nh × Sh2
P 2
N 2
N
h=1 h × Sh
nN ey =  2 P
E0 N
N2 K α
+ h=1 Nh × Sh2
√ PN 2 √

(Nh Sh Ch )
h=1
Nh ×Sh / Ch
si l’on dispose d’un cout Ch : nN ey (cout) = E0 2
PN
N 2 ( Kα ) + h=1 Nh ×Sh2

4.9 la post-stratification ou stratification a posteriori


Dans le sondage stratifié a priori, le statisticien contrôle la répartition des strates. On suppose que cela n’est
pas possible compte tenu d’un manque d’information dont il a besoin n’est pas très liée à celle qui figure dans
la base de sondage. Il effectue alors un SAS sans stratification. Il souhaite cependant prendre en compte
dans l’analyse l’appartenance de telle ou telle catégorie d’individus.
CHAPTER 4. SONDAGE PAR STRATIFICATION 31

4.9.1 Exemple

: on tire un échantillon aléatoire simple sans stratification et on veut prendre en


compte dans l’analyse les catégories socio-professionnelles. Si on connait la caté-
gorie socio-professionnelle de chaque individu et le poids NNh de chaque catégorie
socio-professionnelles dans la population totale, cette information peut êtrePn exploitée
utilement dans l’estimation. Au lieu de prendre l’estimation SAS y2 = n1 j=1 yj dans
le cas où la catégorie socio-professionnelle est fortement liée à la variable d’intérêty on
utilise l’estimateur
PK de la post-stratification :
y post = h=1 NNh × y h s= l’échantillon
la post-stratification nécessite donc un certain nombre d’information : -de l’information
a priori sur l’importance relative NNh de chaque strate dans la population totale.
-de l’information a posteriori pour classer les individus dans les strates. Il
faut que l’information a priori dont on dispose sur la population soit compat-
ible avecPK l’information
Pnh a posteriori.
Pnh PourquoiPK faire une post-stratification ?
K PK
y2 = n1 h=1 j=1 yhj = h=1 × n1 j=1 yhj = h=1 nNh × y h et y post = h=1 NNh × y h
P

On constate que la stratification a posteriori est à recommander lorsque nnh est très
diffèrent de NNh , autrement dit, la distribution de l’échantillon est très différente dans
la population.

4.9.2 L’estimateur y post (propriété)


Nature aléatoire y post
( PK
y post = h=1 NNh × y h
On a PK y post n’est pas de même nature que y s bien que les deux estimateurs se
y s = h=1 NNh × y h
ressemblent. En effet, chaque y h est deux fois aléatoire car le nombre d’observations nh sur lequel il repose
est un nombre aléatoire non connu a priori. De plus, les observations yjh sont aussi aleatoires. Les nh suivent
une loi hyper géométrique de paramètres (N, n, ph ), avec ph = Nnh
nh théoriquement peut etre nulle et dans ce cas, y h = 0
2
Cependant, lorsque n est assez grand, P (nh = 0) = 1 − NNh ≈ 0, (négligeable)
Par ailleurs, le découpage en strates a eu lieu a posteriori et il sera fait de manière qu’aucune strate ne sera
vide quitte à procéder à des regroupent.

y post est Estimateur sans biais de y

 
E(y post ) = EE y post /n1 . . . nk
"K  #
X Nh   
=E × E y post /n1 . . . nk
N
h=1
"K  #
X Nh 
= yh
N
h=1
= E[Y ]
=Y
CHAPTER 4. SONDAGE PAR STRATIFICATION 32

La variance de y post

   
V (y post ) = E V (y post /nh ) + V E(y post /nh )
 
Or E(y post /nh ) = 0 et V E(y post /nh ) = 0
On a donc
K
X Sh2
V (y post /nh ) = (1 − fh )
nh
h=1
" K   #
X Nh
=V × yh /nh
N
h=1
K  2  
X Nh 1 1
= − Sh2
N nh Nh
h=1

or

V (y post = EV (y post /nh )


K  2  
X Nh 1 1
= E − Sh2
N nh Nh
h=1
 
N −n N (Nn ) Nh
On aura E n1h − 1

Nh ≈ nNh + nNh2
1− N

PK Nh 1−f PK
D’où V (y post ) = EV (y post /nh ) = 1−f n−Nh
2

n h=1 N × Sh + n2 h=1 N × Sh2
Le premier terme est la V (y prop ) (cas d’une allocation proportionnelle). Le second terme, Nh est infiniment
petit de n toujours positive, d’où une stratification a priori est toujours meilleure qu’ne stratification a
posteriori. Cependant, une stratification a posteriori peut être de la stratification a priori lorsque la taille de
l’échantillon n est grand. y prop est meilleure que y2 surtout lorsque la distribution de la variable de contrôle
est déformée dans l’échantillon. Enfin, la post-stratification fait partie des méthodes de redressement de la
moyenne.
CHAPTER 4. SONDAGE PAR STRATIFICATION 33

La variable d’intérêt est le chiffre d’affaire moyen réalisé par un ensemble de 1060 en-
treprises. Celles-ci étant de tailles très différentes, on a constitue 5 strates en fonction
du nombre de salariés dans chaque entreprise:
Nombre de salariés 0à9 10 à 19 20 à 49 50 à 499 500 et +
Nombre d’entreprise 500 300 150 100 10

1. A l’intérieur de chaque strate on réalise un sondage aléatoire simple a PESR avec


les tailles d’échantillon suivantes : n1 = 130; n2 = 80; n3 = 60; n4 = 25; n5 = 5:
Les résultats sont les suivants:

H 1 2 3 4 5
µ
ch 5 1 30 150 600
Sh2 1.5 4 8 100 2500

2. Donner une estimation du chiffre d’affaire moyen avec un intervalle de confiance.


3. En conservant toujours la même taille globale d’échantillon, quels effectifs
d’échantillon faut-il considérer dans chaque strate

(a) Pour une allocation proportionnelle ?


(b) Pour une allocation optimale ? (Faire attention que l’on a toujours évidem-
ment nh ≤ Nh .)
4. En supposant inchangées les variances dans les strates, calculer les variances de
l’estimateur pour le plan avec allocation proportionnelle et celui avec allocation
optimale.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

34
5Le tirage systématique

5.1 Cadre d’utilisation


5.1.1 Définition:
On a vu au chapitre 1 (SAS) que le SAS n’est pas d’une mise en oeuvre simple car il demande le tirage
de n nombres au hasard entre 1 et N et chaque valeur désignant une unité d’échantillon par son rang dans
l’échantillon. Bien que sa nature probabiliste ne soit pas tout à fait la même, le tirage systématique est
souvent utilisé en lieu et place du tirage aléatoire simple. Il suppose également qu’une base de sondage est
disponible, une façon simple de définir le tirage systématique est la suivante: le rang des individus échantillon
est en progression arithmétique, le premier est tiré au hasard et la raison est calculée de telle sorte que toute
la population soit balayée ou soit parcourue. Supposons dans un premier cas que nous avons: N = n.k

N : taille de la population totale; n: taille de l’échantillon.


On prend alors un nombre au hasard entre 1 et k. Soit ce nombre, l’échantillon sera constitué alors des
individus suivants: α, α + k, α + 2k. . .. . .. . .. . .α + (n − 1)k.

5.1.2 Aspect Probabiliste de la méthode:


On suppose que N=n.k
n 1
Nous avons comme taux de sondage f = N = k

35
CHAPTER 5. LE TIRAGE SYSTÉMATIQUE 36

1 k + 1, 2k + 1 ... ... ... (n − 1)K + 1


2 k + 2, 2k + 2 ... ... ... (n − 1)K + 2

..
.
..
.
..
.

α K +α 2K + α ... ... ... (n − 1)K + α

..
.
..
.
..
.

k−1 2k − 1 3k − 1 ... ... ... nk − 1


k 2k 3k ... ... ... n.k = N

Ce tableau permet de voir que le tirage de l’échantillon de taille n équivaut au tirage d’une ligne du
tableau. Ici, l’unité d’échantillonnage n’est pas l’individu mais la ligne du tableau que l’on appelle grappe.
On a πi = k1 ∀ i ∈ P et πii0 =0 si i et i’ n’appartiennent pas à la même ligne.
Ainsi, on aura beaucoup d’échantillons qui seront éliminés ce qui n’est pas le cas du tirage aléatoire simple.

On suppose que N = nk+ avec 0 < c< k

N=2005 et n=250 donc k=8 et c=5.


Dans ce cas , ce grappes contiennent n+1 individus et k −c en contiennent n . En tirant
un nombre au hasard entre 1 et k, on ne maitrise pas totalement la taille de l’échantillon
à une unité près. Le tirage systématique est bien aléatoire (tirage probabiliste) mais
seulement, on tire une unité d’échantillonnage.

Remarque (choix des k): N ne se met pas toujours sous la forme nk+c avec 0 < c< k

N=1872 et n=250 Donc N n =7,488


Si k=7, la taille de l’échantillon varie de 267 à 268 différent de 250.
Si k=8, la taille de l’échantillon sera égale à 234 et différent de 250.

Comment choisir entre k=7 et k=8?

5.2 Estimation de la moyenne dans un sondage à grappe systéma-


tique
Pk TL le total de y sur la ligne L
Soit
i TL =Y le total de Y ;
CHAPTER 5. LE TIRAGE SYSTÉMATIQUE 37

Pk
T = 1
k iTL = Y est la moyenne par ligne.
1
Pk k 2 1 Pk Y 2
V (L) = k L=1 (TL − T ) = k L=1 (TL − k ) est la variance des totaux par ligne.
Soit l le nombre au hasard tiré entre 1 et k, tl le total de Y sur la ligne (l) obtenue.
Pk
On a: E (tl ) = k1 i TL = overlineT = Yk = N.Y k

k
y sys = N tl est un ESB de Y . Par ailleurs, on a:

k 2
k
Pk 2
V (y sys )= N 2 V (tl )= N 2 L=1 (TL − T ) . Nous avons donc:

 k
Pk Y 2
V y sys = N2 L=1 (TL − k )
On observe cependant que cette formule ne permet aucune précision quant à la comparaison de y sys et de
y 2 . D’autre part, on ne sait pas qu’en augmentant la taille de l’échantillon n, on améliore la précision de
l’estimateur y sys .

5.3 Estimation de la variance de y sys


On a vu que l’unité d’échantillonnage égale grappe ( ligne dont une seule est tirée). Ceci ne permet pas le
tirage d’une seule ligne. Le tirage d’une seule ligne ne permet pas d’estimer la variance de y sys (la procédure
de tirage systématique n’est pas mesurable). On peut cependant s’affranchir de cette difficulté.

5.3.1 Prise en compte des variances successives:


Supposons que n est paire, on assimile le tirage systématique au tirage suivant : on a m strates avec m= n2
N
de taille m = 2k ; k= N
k
Dans chacune des strates h, on tire deux individus échantillons.
k
Pm
y sys = N tl = n1 tl = 2m
1
h=1 (y1h + y2h )
1
P m
y sys = m y
h=1 h et

m
 1 X
V y sys = 2 V (y h )
m
h=1
m
1 X 2 Sh2
= 2 (1 − )
m 2k 2
h=1
m
1 X 1 Sh2
= (1 − ) d’où
m2 k 2
h=1
m
 1 1 X Sh2
V y sys = 2 (1 − )
m k 2
h=1

Ainsi, la variance estimée aura pour expression:


1 P
2 (1− k 1
k2 ) (1− k )
k
Pk m 2
Pm 2
Vb (y sys ) = N 2 V (tl ) = N 2 L=1 (TL − T ) 2m2 h=1 sh = 2m2 h=1 (y1h − y2h )
Ce résultat ne prend en compte que le différence pour 2 individus. La prise en compte des n-1 différences
donne ou permet de d’avoir un estimateur car les individus sont rangés dans l’ordre.
c2 (y sys ) = (1−f ) Pn−1 (yj+1 − yj )2
V 2n(n−1) j=1

Cependant, cet estimateur est légèrement biaisé vers une surestimation de la variance.
CHAPTER 5. LE TIRAGE SYSTÉMATIQUE 38

5.3.2 Utilisation de la formule du tirage aléatoire simple en lieu et simple du


tirage systématique
Généralement et plus simplement, on utilise avec le tirage systématique (procédure de sélection) , les résultats
consécutifs du tirage aléatoire simple(procédure d’estimation). Ceci est tout à fait fondé si dans la base de
sondage les individus peuvent être considérés comme étant rangés de façon aléatoire.
Malheureusement, dans les bases de sondages, les individus ne sont pas toujours rangés de manière
aléatoire et c’est à ce point que la méthode du tirage systématique trouve ses limites.

5.3.3 Conséquence de l’ordre des individus dans la base:


On s’intéresse à deux cas:
1. Une population à trend linéaire (tendance linéaire) ;

2. Une population à variabilité périodique ;

5.3.4 Population à trend linéaire

Un exemple d’école permet de cerner la nature du problème. Soit Y la variable de


l’individu i tel que Yi =i. Pour simplifier, on suppose que N=n.k. On peut alors comparer
les 3 méthodes de tirages , on a le tirage aléatoire simple, le tirage systématique et le
tirage stratifié. Pour le tirage stratifié, on suppose que l’on a n strates de k individus
chacun et on tire un individu par strate. Les estimateurs des trois modes de tirages sont
tous sans biais. E(y 2 )=E(y sys )=E(y s )=Y

2
n Sh
Pn (k−1)(N +1)
1. y 2 = n1 j=1 yj ; V (y 2 ) = (1 − N) n ce qui implique V (y 2 ) = 12
k(n−1)
2. y sys = 1
n[ l + l + k + . . . . . . . . . · · · + l + (n − 1)k ] d0 où y sys =l + 2

l est le premier individu tiré. La valeur de y sys fluctue en fonction de l. Sa variabilité est d’amplitude
commune pour toutes les variables.
 
V y sys = V l + k(n−1)

2 = V (l)
Ainsi
2 Pn Pn Pn
V y sys = V (l)= k 12−1 car l ∈ [1, k] y s = h=1 y h NNh = 1 1
(1 − k1 ) Sh2

n h=1 yh .V (y s ) = n2 h=1

Donc Sh2 est la variance dans la strate h ∀ h, Sh2 est une constante, donc nous avons:
n
1 X 1
V (y s ) = 2
(1 − )Sh2
n k
h=1
 
1 1
= 1− Sh2
n k
 
1 k−1
V (y s ) = Sh2
n k
1
V (y s ) = V (k)
n
1 k2 − 1

=
n 12

En conclusion, on a : V (y 2 ) ≥ V y sys ≥ V (y s ) dans une tendance linéaire.
CHAPTER 5. LE TIRAGE SYSTÉMATIQUE 39

5.3.5 Population à variabilité périodique

Variation du trafic routier en un point au cour de la journée.


Cet exemple permet de saisir la nature du problème, de celui d’une base de sondage ou
les individus sont dans l’ordre tel que yi soit sinusoïdale.

Soit α le premier nombre. Il est clair que si k est proche de la période, tous les individus
auront la même valeur de Y. Si k est proche de la demi-période et que le nombre α désigne
une valeur extrême, la situation est beaucoup plus favorable. Il est donc nécessaire de
faire un investissement au préalable. De façon générale, un échantillon dans le temps
nécessite un investissement préalable qui permettra de savoir s’il existe oui ou non une
variation périodique. Si oui, de déterminer la période.

5.4 Choix du nombre de grappes (k)


5.4.1 Cas de listage circulaire
On tire un nombre au hasard entre 1 et N (α). Les individus échantillons sont des rangs modulo k. α; k +
α, 2k + α, . . .. . .. . .. . .. . .. . .. . .. . .. . .. . .(n − 1)k + α.
k peut être à priori n’importe quel nombre mais on choisira de façon générale l’entier le plus proche de N 1
n = f

K
1

2
N −2 3

5.4.2 Utilisation d’intervalle fractionnel


Le tirage systématique peut être considéré comme respectant les distances aussi stables que possible.
CHAPTER 5. LE TIRAGE SYSTÉMATIQUE 40

Soit N= 1872, n=250 nous avons Nn = 7, 488 = k


Donc, on tire un nombre décimal α entre 1 et k. Soitalpha = 3, 654. L’individu qui
sera tiré correspond au numéro 3. Le second est obtenu en faisant : α + k=3,654
+7,488=11,142 ce qui correspond au numéro 11. Le troisième est α + 2k=18,630 ce qui
correspond au numéro 18. Le quatrième est α + 3k=33,606 ce qui correspond au numéro
33. On remarque que le pas peut être égal à 7 ou 8.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

41
6
SONDAGE PAR GRAPPE

42
7Sondage à probabilité inégale et sans
remise

7.1 mode d’obtention de l’échantillon


7.1.1 Méthode 1:
La méthode la plus intuitive a déjà été évoquée au paragraphe 2. On éffectue un tirage conformément
Pi
aux probabilités P1 , . . . , Pi , . . . PN . On éffectue un deuxième tirage conformément aux probabilités 1−P j
avec i 6= j (si l’individui est tiré au preimier tirage). On effectue un troisième tirage conformément aux
probabilités 1−PPji−Pk avec i 6= j, i 6= jk et j 6= k. malgré la lourdeur de la mise en œuvre et les calculs
impliqués dans ce cas générale, cette méthode est utilisée lorsqu’une stratification poussée a donné des strates
d’effectifs faibles et la taille de l’échantillon dans la strate h n’est que de quelques unités (1, 2, 3, . . . ).

7.1.2 Méthode 2:
Une seconde méthode s’inspire du tirage systématique. Les unités i = 1 à N sont de taille Xi et on veut un
échantillon de taille n. On forme les cumules successifs des nXi . la plage de taille nXi étant attribuée à
l’unité i. Exemple on suppose que n = 2 P
On tire un nombre aléatoire λ entre 1 et Xi = X. Dans ce cas, l’échantillon est constitué de λ, λ +
X, . . . ., λ + (n − 1)X

43
CHAPTER 7. SONDAGE À PROBABILITÉ INÉGALE ET SANS REMISE 44

7.2 Déterminons les échantillons possibles:


6 2
π1 = 23 , π2 = 23 , π3 = 22 12 4
23 π4 = 23 π5 = 23
On constate que les πi sont proportionnelles aux tailles (Xi ) . Mais il faut noter que la probabilité de certains
échantillons est nulle telle π14 = 0 , π15 = 0 , π12 = 0,. les πii0 dépendent de l’ordre initial dans lequel est
rangée la population. Cette dépendance etant cependant nuancé par les valeurs de Xi et Xi0 . Aucun résultat
général à propos des πii0 n’est établi. Le statisticien se placera dans l’un des deux cas suivant :

1. Ou bien la population est d’effectif important, l’ordre initial est considéré comme acquis et les πii0 sont
ce qu’ils sont pratiquement impossible à calculer ;

2. Ou bien l’effectif de la population est très modeste auquel cas les N permutations peuvent être consid-
érées pour les calculs des πii0 .

R
P
emarque: En général Ple pas des tirages Xi = X est supérieur à l’amplitude de toutes les plages,
c’est-à-dire nX i P
< Xi = X. Un problème peut se poser lorsque certains Xi sont trop grand et
telle que nX i > Xi = X ; de telles unités sont forcément tirées, c’est-à-dire Pi = 1, voir plusieurs
fois, ce qui peut déranger dans une procédure de tirage sans rémise. Une solution pratique est alors
de constituer une strate de (grosse) unités qui seront retenu exhaustivement. Dans cette strate, il n’y
aura donc pas d’erreur d’échantillonnage, mais l’effectif ne doit pas être trop important de sorte que
dans les autres strates il y ait suffisamment d’unités.

7.3 Le sondage à probabilité inégale avec remise:


7.3.1 Mode d’obtention de l’échantillon
i) Méthode 1:
Les unités sont rangées dans un ordre quelconque et leurs tailles sont cumulées. Une «plage» de longueur
égal à la taille est allouée à chaque unité . On tire un nombre au hasard entre 1 et 23, le nombre tiré est dans
une plage et une seule, l’unité correspodante est désigné, il est claire que chaque unité a ainsi une probabilité
proportionnelle à sa taille d’être tiré on réitère le procédé n fois pour avoir un échantillon de taille n. Et
n
πi = 1 − (1 − Pi ) . Et on peut calculer πi pour un échantillon de 1, 2, 3. . .
La méthode se conçoit aisément, mais est d’une mise en œuvre difficile voir coûteuse dès que la population
est de taille appréciable. Il est en effet nécessaire de calculer tous les cumuls. Ce qui invite la deuxième
méthode. Méthode 2 : C’est une méthode qui est de Lahiri. Soit X le critère taille et Xi taille de i
avec X0 = maxi=1àN Xi . On prend un nombre au hasard entre 1 et , l’unité portant le numéro est provi-
soirement désigné. Soit j cette unité. Dans un second temps on prend un nombre au hasard entre 1 et X0 .
Si ce nombre est inférieur à Xj , alors l’unité j est définitivement retenu. Si non on réitère la procédure
en 2 temps. On procède ainsi en remettant chaque fois l’unité tiré jusqu’à l’obtention des n P individus.
X N
P (uj : j soit désigné dans une procédure) = N1 ∗ X0j = πj P (la procédure soit infructueuse) = 1 − i=1 πj =
1 − XX0 = q
1 1 Xi 1 Xi
P (ui ) = Pi = πi + qπi + q 2 πi + · · · = πi × 1−q = N × X0 × X
= NX
Cette méthode attribue à chaque
X0
individu une probabilité Pi proportionnelle à sa taille. Elle peut cependant nécessiter un certain nombre de
rejets d’autant plus que les Xi sont dispersés.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

45
8SONDAGE A PLUSIEURS DEGRES

8.1 Définition et opportunité :


Définition
Le sondage à plusieurs degrés se justifie pour les mêmes raisons que le sondage par grappe et surtout
pour la non disponibilité d’une base de sondage des unités d’observations. Nous allons nous limiter
dans le cas d’un sondage à 2 degrés.

8.1.1 Définition du sondage à 2 degrés


Le sondage à 2 degrés peut se définir comme un sondage en grappes dans lequel au lieu d’observer toutes les
unités qui composent une grappe d’échantillon, on en observe une partie ou un échantillon :
• le premier degré consiste à tirer un échantillon de grappe, ce sont les Unités Primaires du sondage (UPS
ou UP)
• le second degré consiste à tirer dans chaque UP d’échantillon et indépendamment d’une UP à une autre
; un échantillon d’unité d’observation, ce sont les Unités Secondaires du sondage (USS ou US)
On devra donc retenir une procédure d’estimation prenant en compte les deux procédures de tirage

46
CHAPTER 8. SONDAGE A PLUSIEURS DEGRES 47

8.1.2 Remarque
• Si la définition du sondage à plusieurs degrés s’inspire du sondage par grappe il faut tout de même noté
que les UP sont souvent plus grosses que les grappes. Ainsi un ménage peut être considéré comme une
grappe d’individus mais ne sera jamais retenu comme UP. En effet il convient de pouvoir tirer dans
chaque UP échantillon un échantillon assez grand d’US
• Le sondage à 2 degré présente un avantage non négligeable lorsque l’on ne dispose pas d’une base
de sondage des unités d’observation. En effet il suffit de disposer d’une base de sondage des unités
primaires (District de Recensement DR) quitte à constituer pour chaque unité primaire d’échantillon
une base de sondage des unités secondaires (ménages)
• On peut à priori imaginer toute sorte de procédure de tirage pour chaque degré . Cependant en pratique
on réalise souvent une stratification des unités primaire de façon à faire diminuer la part de variabilité
des estimateurs du au premier degré de tirage. Cette stratification étant réalisé on procèdera le plus
souvent de l’une des 2 façons suivantes.

Méthode1 : au premier degré on tire les UP avec probabilité égale et on pose f1 le taux de sondage au
premier degré. Au second degré on tire dans chaque UP échantillon un échantillon d’US à probabilité égale
au taux de sondage des (UP) et on pose f2i le taux de sondage dans (UP) . Un cas particulier est celui ou le
taux de sondage au second degré est indépendant des UP et est constant f2 =constante. Le taux de sondage
final des unités d’observation est donc f = f1 f2 . Ce cas particulier ce dépouille comme un recensement
c’est-à-dire l’estimateur de la moyenne est égale à la moyenne des échantillons.
Méthode2 : on tire au premier degré les unités primaires avec probabilité inégale le plus souvent propor-
tionnelle à la taille des UP et cette taille est exprimée en nombre d’US. Au second degré on tire dans chaque
échantillon d’UP un échantillon d’US à probabilité égale.
Un cas particulier est celui ou on tire les même nombre d’US dans chaque UP échantillon alors le sondage
va se dépouiller comme un recensement. La première méthode sera préférable à la seconde lorsque l’on ne
dispose pas d’information sur les unités primaires en particulier lorsque le nombre d’US par UP est inconnu
ce qui ne permet pas l’application de la seconde méthode. On préfèrera encore la première méthode lorsque
le premier degré est commun à plusieurs plans de sondage destinés à obtenir des échantillons. Par exemple
les exploitations agricoles ; les ménages etc. . .
Les modalités d’étude (estimation de la moyenne ; calculs de la variance etc. . . ) sont communes aux deux
méthodes. Cependant nous étudierons dans ce chapitre la première méthode ; la seconde méthode sera
étudiée au prochain chapitre.

8.2 Problème de répartition optimale de l’échantillon


Le problème majeur qui se pose lorsqu’on fait un sondage à deux degré est celui de calcul de la variance des
estimateurs et partant de ceci celui de la répartition optimale entre les UP lorsque le cout global est fixé.
Soit n le nombre d’UP échantillon et m le nombre myen d’US par UP échantillon ; la variance de l’estimateur
sera très souvent de la forme V = A B
n + nm où A représente la dispersion inter UP et B la dispersion moyenne
entre US d’un même UP (variance intra). Considérons l’expression de V sous la seule contrainte d’effectif
; il apparait donc que V est d’autant plus petit que n’est plus grand et la variance sera minimal lorsque n
sera maximal c’est-à-dire si on tire autant d’UP que d’US prévue(c’est-à-dire une US par UP) dans ce cas
l’échantillon est alors dispersé au maximum. L’idée de ce tirage est de celle d’un tirage à un seul degré qui
est en opposition à celle d’un tirage à 2 degré. Il faut noter que n est au dénominateur des deux termes A
et B et que A est souvent considérer comme étant plus élevé que B. ainsi on a intérêt à ce que n soit aussi
grand que possible. Globalement les UP efficace doivent répondre autant que faire se peut aux considérations
suivantes :
• les UP doivent être assez nombreuses ; pas très grosses mais aussi pas très petite pour que l’on puisse
tirer un échantillon d’US assez important.
CHAPTER 8. SONDAGE A PLUSIEURS DEGRES 48

• les UP ne doivent pas être trop dissemblable (une condition nécessaire mais pas suffisante est que les
UP doivent avoir les même US pour pouvoir se ressembler)
• on doit avoir une hétérogénéité autant que possible à l’intérieur de chaque UP

8.3 La formule de l’estimateur et de l’operateur de l’espérance


mathématique dans un sondage à 2 degrés
8.3.1 l’operateur de l’espérance mathématique
L’espérance mathématique d’un estimateur consécutif à un sondage à plusieurs degré doit prendre en compte
l’aléa relatif aux différents degrés de sondage.
   
Pour un sondage à deux degrés on a E θb = E1 [E2 (θ)] b et V θb = V1 [E2 (θ)]b + E2 [V2 (θ)]
b si θb est un

 sans biais de θ alors E2(θ)


estimateur b est constant et donc V1 [E2 (θ)]
b = 0 pour un sondage à trois degrés on

aura E θ = E1 (E2 [E3 (θ)]) et V θ = V1 (E2 [E3 (θ)]) + E1 (V2 [E3 (θ)])
b b b b b + E1 (E2 [V3 (θ)])
b
Chaque degré apporte sa contribution à la variance de l’estimateur ce qui nous conforte dans l’idée intuitive
selon laquelle qu’un sondage est d’autant moins précis qu’il comporte de degré de tirage

8.3.2 Formule des estimateurs


Les tirages s’effectuent comme suit : 1er degré on tire des UP à part égale au taux de sondage f1 , au 2em
degré on tire dans chaque UP échantillon un nombre d’US à probabilité égale au taux de sondage f2i : taux
de sondage UPi .
a) Notation N : nombre total d’UP: 1 à N
Mi : Pnombre d’US dan UPi : la taille de l’UP
M: M i : nombre total d’US dans la population
PN
M = N1 i=1 M i : nombre moyen d’US par UP taille moyen d’UP
Dans l0 U Pi les individus sont numérotés de 1 à Mi
Valeur de Y pour l’individu k de l0 U Pi
Yik : P
Mi
Yi = k=1 y : le total da Y dans l’UPi
PMi ik PN PMi PN
Y = i=1 Y i = i=1 k=1 Yik : le total de Y dans la population total Y = N1 i=1 Y i
1
PN PMi 1
PN 1
PN PMi 1
PN Yi
Y =M i=1 k=1 Yik = M i=1 Y i = M .N i=1 k=1 Yik Y i = Mi k=1 Y ik = Mi
N 2 Mi 2
; S12 = N 1−1 i=1 (Yi − Y ) et S2i 2
= Mi1−1 k=1
P P
(Yik − Y i ) n: nombre d’UP échantillon : les tirages sont
repérés par l’indice j = 1àn (U P )j : l’UP obtenu au j e me tirage Mj : nombre d’US dan US de l’UP obtenu
au jéme tirage Yj : total de Y dans l0 (U P )j ; S2j
2
: quasi variance dans l0 U Pj Ces trois caractéristiques sont
de variable aléatoire par rapport au premier degré de tirage et non au 2nd degré. Mj : nombre d’US tirés
dans l0 U Pj . Les tirages à l’intérieur des UP sont numérotés de l à mj , Yjl la valeur de Y sur l’individu l’US
obetnu au l tirage dans l’UP obtenu au j e me tirrage.
CHAPTER 8. SONDAGE A PLUSIEURS DEGRES 49

8.3.3 Estimation de Y

N
1 X
On a Y = Mi Y i
N ∗ M i=1
n
1 X
Yb = mj y j avec
M ∗ n j=1
mj
1 X
yj = ylj
mj i=1

y D2 = Y
b
n mj
1 X Mj X
= ylj y D2
N ∗ M j=1 mj l=1
n
1 X
= ybj
N ∗ M j=1
n
1 NX
= ∗ ybj y D2 est un ESB de Y car on a :
M n j=1
E(y D2 ) = E 1 E 2 (y D2 )
mj
n
" #
1 X Mj X
= E1[ ∗N E2 ylj ]
N ∗M j=1
mj
l=1
 
n
1 X
= E1  ∗N Yj 
M ∗n j=1
n
N X
= ∗ Yj
M N j=1
n
1 X
= ∗ Yj = Y
M j=1

1
Pn 1
Pmj
En fonction des taux de sondage y D2 = f1 ∗M j=1 f2j l=1 ylj Dans le cas particulier ou f2j = cst = f2
1
Pn Pmj
y D2 = f1 ∗f2 ∗M j=1 l=1 ylj f2 ∗ f1 = f taux de sondage global

f2 ∗ f1 ∗ M : la taille de la population en US

Pour ce cas particulier le sondage à 2 degrés se dépouille comme un recensement et le nombre d’US
échantillon est une variable aléatoire qui ne sera pas comme avant l’échantillonnage.

8.3.4 la variance de y D2
V (y D2 )=V1 [E2 (y D2 )] + E1 [V2 (y D2 )] calculons terme par terme
n n
1 X N X
E2 (y D2 ) = N E2 (ybj ) = Yj
Mn 1
Mn 1

N2  n  S21
V1 [E2 (y D2 )] = 1 −
M2 N n
CHAPTER 8. SONDAGE A PLUSIEURS DEGRES 50

n n n
N2 1 N2 1 N2 1 X mj S 2 2j
X X  
2
V2 (y D2 )] = V 2 ( Y
b j ) = V 2 ( M Y
j j ) = M j 1 −
M 2 n2 1
M 2 n2 1
M 2 n2 1 Mj mj
 
N2 1
Pn 2 mi S 2 2i
E1 [V2 (y D2 )] = M 2 nN 1 Mi 1− M i mi on pourra ensuite simplifier le N au dénominateur
On obtient finalement   2
n S2 1 n
Pn 2 mi S 2i
V(y D2 )= M12 [N 2 1 − N

n +N 1 Mi 1− M i mi ]
Et pour le cas particulier
 où f =cst=
2j 2 f 2 on a
Pn
V(y D2 )= + 1 Mi 2 1 − M mi
i
S 2i
mi ]
L’expression de la variance met en évidence la part de la variabilité dû à chaque degré de tirage. S 2 1 la
dispersion des totaux dans chaque UP est à concevoir assez forte est ce d’autant plus forte que les UP sont de
taille différente. On retrouve ainsi le résultat énoncé au niveau de l’introduction à savoir que l’effort fournit
en terme d’unité tiré devra surtout porter sur les UP
En comparant les variance des estimateurs consécutifs au sondage à deux degré ; tirage stratifié et au
tirage en grappe on constate que:
1. le sondage stratifié est un sondage à deux degré mais exhaustif au premier degré (UP =strate et n=N)
2. le sondage en grappe est un sondage à deux degré mais exhaustif au second degré

(US=unités d’observation et mi )
V2 (y D2 ) dépend de tous le mi ce qui veut dire que les mi doivent etre connue à priori

8.3.5 Estimation de la variance de YD2


on a V (y D2 )=V1 [E2 (y D2 )] + E1 [V2 (y D2 )]
N2 n S2 1
 2
on a V1 [E2 (y D2 )] = M 2 1 − N n on trouve un estimateur de S 1 qui est donné par
n n m 2
1 mi S 2i
yj − yb)2 − n1 1 Mjj 1 − M
P P
n−1 1 (b i mi
P2
  2
1 N2 m S
N −n 1
Pn N M
Finalement l’estimateur de V(y D2 ) est M 2 [ n ∗ N ∗ n−1 1 (b y )∧2 + n mj j 1 − Mjj m2j
j−by j

1. L’expression de l’estimateur de V (y D2 ) semble exactement calquer sur celle de V (y D2 ).cependant chacun


des termes de cet estimateur n’estime pas son homologue dans V(y D2 )(voir l’estimateur de S 2 1

2. L’estimateur de S 2 1 obtenu par differencec peut prendre des valeurs négatives ce qui car est gênant car
S 2 1 est positive
3. Le calcul de l’erreur n’est pas un fin en soit il doit viser à améliorer les enquêtes futures qui exige
d’estimer les deux termes de ce V(y D2 ) afin de juger de leur poids respectifs

Exercice donner l’estimateur de V( y D2 ) dans le cas particulier où f 2i est


constant et égale à f 2
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

51
9SONDAGE AVEC PROBABILITE PRO-
PORTIONNELLE A LA TAILLE

9.1 Introduction:
On a jusqu’à présent étudié des sondages ou les unités d’échantillonnage ont toutes la même probabilité d’être
tiré et ceux principalement dans 2 cas :

1. Une unité «en vaut» bien une autre il n’y a aucune raison à priori de privilégier une par rapport à une
autre dans le tirage. C’est le cas notamment des personnes individuelles, des ménages. . .

2. Ou bien on prétend que les unités ne sont pas régulièrement substituables entre elles. Qu’il y a lieu d’en
privilégier certaines, mais on en dispose d’aucune information permettant d’effectuer ce genre de tirage.
C’est le cas des grappes de tailles inégales, d’UP de tailles différentes, d’exploitation agricole de tailles
inégales. Plaçons-nous dans ce cas ou les unités sont de tailles résolument et nettement différentes. Une
première façon d’en prélever un échantillon à probabilité inégale est de stratifier les unités suivant leur
taille (Grosse, moyenne, petite. . . ) puis de retenir dans chaque strate un taux de sondage différent. On
utilise ainsi de façon assez sommaire l’information supplémentaire que représente la taille des unités.

Le sondage à probabilité inégale consiste à utiliser de façon beaucoup plus fine cette connaissance et
réponde de façon plus intuitive qu’une unité à plus de chance d’appartenir à l’échantillon qu’une autre.
De façon générale on essayera d’attribuer à chaque unité une probabilité d’inclusion proportionnelle à la
taille. Cela peut ne pas être possible tout le temps, souvent même impossible.

52
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 53

9.2 Tirage avec remise-Tirage sans remise


Dans le sondage à probabilité égale, les deux procédures de sondage sont sensiblement égale dès que la taille
de la population est généralement grand et que n est faible par rapport à .
Dans le cas de sondage à probabilité proportionnelle à la taille, rien en permet de considérer les deux procé-
dures comme équivalentes et surtout les jeux de probabilités peuvent différer sensiblement.

: La population comporte N unité, i = 1 à N . L’unité i à la taille rélative Pi avec


P N
i=1 Pi = 1. Supposons avoir défini une procédure ou un mécanisme permettant de
tirer une unité parmi les N , chacune ayant la probabilité Pi d’être tiré. On procède de
la sorte, l’unité j est tiré et à la 2e étape on veut tirer une seconde unité.

1. Si l’unité j est obtenu au premier tirage et le tirage est «avec remise», le second tirage se présente en
terme de probabilité comme le premier et il en est tout à fait différent ;
2. Si l’unité j est tiré au premier tirage et le tirage est « sans remise », le second tirage se présente
en terme différent de probabilité. En effet, la nouvelle population comporte N − 1 individus pour ,
i = 1 à N et i 6= j. L’individu i qui dans la population total avait un poids Pi se retrouve avec un
Pi
poids 1−P j
. Dans ce cas le tirage d’une nouvelle unité modifie le schéma probabiliste d’une façon que
le statisticien ne peut pas contrôler. C’est la difficulté de l’étude d’un sondage à probabilité
inégale sans remise. Nous disons probabilité inégale et non probabilité proportionnelle à la taille
(PPT) car à ce niveau le statisticien (ou la statisticienne) ne maitrise pas la situation.

9.3 Probabilité de tirage et probabilité d’inclusion


9.3.1 Cas avec remise:
Dans le cas d’un tirage avec remise, le schéma probabiliste est connu d’un tirage à l’autre et il y a indépendance
entre les tirages. Il convient de distinguer entre la probabilité de l’individu i d’être tiré à un tirage et la
probabilité qu’à cet individu d’appartenir à l’échantillon. SoitPpar exemple à tirer un échantillon de taille n
N n
l’unité i ayant à chque tirage la probabilité d’être tiré. On a i=1 Pi = 1. Et P (i ∈ s) = πi = 1 − (1 − Pi ) .
On constate qu’il ne suffit pas que Pi soit proportionnelle à la taille pour qu’il en soit pour πi . Dans le cas
n
ou Pi = αTi avec Ti : la taille on aura πi = 1 − (1 − αTi ) . Cependant si toutes les Pi sont suffisamment
1 n
petites, en particulier plus petite que N . On aura πi = 1 − (1 − αTi ) ≈ nPi = nαTi Dans ce cas on aura
presque la proportionnalité.

9.3.2 Cas sans remise:


Dans le cas général ou les jeux de probabilité étant donné pour le premier tirage et ou on procède sans remise.
La probabilité πi que l’unité i soit dans l’échantillon est pratiquement incalculable. Théoriquement, cette
probabilité peut se calculer comme suit : La probabilité d’obtenir l’échantillon ordonné (u1 , u2 , . . . , un est
P (u1 ) ∗ P (u2 /u1 ) ∗ · · · ∗ P (u2 /u1 . . . un−1 ). P (i ∈ s) = πi = somme des probabilité si-déçus. La somme étant
pour tous les échantillons possibles contenant l’individu i et ce quel que soit l’ordre de i dans l’échantillon.
La difficulté comporte deux aspects :

1. recenser tous les échantillons afin de tirer ceux dans lesquels on retrouve l’individu i;
2. choisir un jeu initial de probabilité (les Pi ) qui assure au moins approximativement que les Pi possèdent
effectivement les valeurs souhaitées à priori.
Remarque:
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 54

PN PN 1 si i ∈ s
1. On remarque que i=1 πi = n .En effet, i=1 εi = n avec εi =
0 sinon
PN PN PN
Et On a: E( i=1 εi ) = i=1 E(εi ) = i=1 πi = n
P P
Démontrer que: i i6 =i πii0 = n(n − 1)

P P
Pour la démonstration on utilisera i i6 =i εii0 L’attribution d’une probabilité d’inclusion à chaque unité
doit être conçue en terme relatif, telle qu’une unité aura α fois plus de chance qu’une autre d’appartenir à
léchantillon. Dans un second temps les poids ainsi attribués seront normés, lissés de façon à ce que leur somme
valle n. Cependant tout systéme de poids ne permet pas la constitution d’un échantillon «sans remise» de
taille quelconque. En effet, supposons avoir fixé un systémePquelconque de poids wi pour i = 1 à N . La
N
normalisation s’écrit πi = λwi pour i = 1 à N . Et on a i=1 πi = n. De (1) on a: 0 < λwi ∀i = 1 à
1
PN n 1 Nw
N =⇒ λ ≤ M axwi De (2) on a i=1 λwi = λN w = n ⇒ λ = N w ≤ M axwi On a donc : n ≤ M axwi Si n
augmente on peut être amené à modifier les poids wi . On retient donc qu’un système de poids donné à priori
n’est pas toujours normalisable par rapport à n.

9.4 Le sondage à probabilité inégale avec remise:


9.4.1 Mode d’obtention de l’échantillon
Méthode 1:
Les unités sont rangées dans un ordre quelconque et leurs tailles sont cumulées.
Unité i Taille de Cumule de (Ti ) «plage» de i Pi
i(Ti )
1 3 3 1-3 3/23
2 1 4 4 1/23
3 11 15 5-15 11/23
4 6 21 16-21 6/23
5 2 23 22-23 2/23
Une «plage» de longueur égal à la taille est allouée à chaque unité . On tire un nombre au hasard entre
1 et 23, le nombre tiré est dans une plage et une seule, l’unité correspodante est désigné, il est claire que
chaque unité a ainsi une probabilité proportionnelle à sa taille d’être tiré on réitère le procédé n fois pour
n
avoir un échantillon de taille n. Et πi = 1 − (1 − πi ) . Et on peut calculer πi pour un échantillon de 1, 2,
3. . .
N Individu 1 Individu 2 Individu 3 Individu 4 Individu 5
1 0.1304 0.0434 0.4782 0.2608 0.0869
2 0.2438 ...
3 0.3425 ....
La méthode se conçoit aisément, mais est d’une mise en œuvre difficile voir coûteuse dès que la population
est de taille appréciable. Il est en effet nécessaire de calculer tous les cumuls. Ce qui invite la deuxième
méthode.

Méthode 2: C’est une méthode qui est de Lahiri.


Soit X le critère taille et Xi taille de i avec X0 = maxi=1àN Xi . On prend un nombre au hasard entre 1 et ,
l’unité portant le numéro est provisoirement désigné. Soit j cette unité. Dans un second temps on prend un
nombre au hasard entre 1 et X0 . Si ce nombre est inférieur à Xj , alors l’unité j est définitivement retenu.
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 55

Si non on réitère la procédure en 2 temps. On procède ainsi en remettant chaque fois l’unité tiré jusqu’à
X
l’obtention des n individus. P (uj : j soit désigné dans une procédure) = N1 ∗ X0j = πj

N
X X
P (la procédure soit inf ructueuse) = 1 − πj = 1 − =q
i=1
X0

1 1 Xi 1 Xi
P (ui ) = Pi = πi + qπi + q 2 πi + · · · = πi ∗ 1−q = N ∗ X0 ∗ X
= NX
Cette méthode attribue à chaque
X0
individu une probabilité Pi proportionnelle à sa taille. Elle peut cependant nécessiter un certain nombre de
rejets d’autant plus que les Xi sont dispersés.

1 PN c = PN Y =
9.4.2 Estimation de la moyenneY = N i=1 Yi et du total Y i=1 i
NY = Y
- On a un échantillon de taille n
Tirage ave remise (Pi )i=1àN
y
Soit la variable aléatoire pjj dans { PY11 , . . . , PYN
N
} comme les pj sont connues , on a :

  N
yj X Yi
E = Pi ∗ ( )=Y
pj i=1
Pi
yj
Comme est E.S.B. de Y alors l’estimateur du total pour échantillon de taille n est :
pj
1
Pn yj
Y piar = n
b
i=1 pj (Estimateur de : Hansen-Horwitz)
Ce estimateurPest un E.S.B du total d’où l’estimateur de la moyenne est :
n y
y piar = N1n i=1 pj C’est un E.S.B de Y .
j
c) La variance de y piar

n N 2
 1 X yj 1 X Yi
Var ypiar = 2 2 var( ) = 2 Pi ( − Y )
N n j=1 pj N n i=1 Pi

Yi0 2
Montrer que Var ypiar = 2N12 n i i0 6=i Pi Pi0 ( PYii −
 P P
Pi0 )

Cette expression montre que si les Pi sont proportionnelles à Yi . On aura PYii = constante alors

Var ypiar = 0 Ce qui ne doit pas surprendre : les Pi sont connues en avance, par définition leur proportionnal-
PN
ité aux Yi implique la connaissance de celles-ci et le sondage est sans objet. (Pi = k×Yi et comme i=1 Pi = 1 = k × Y ⇒
1
k . Si nous avons connaissance d’une variable X qui soit à peu près proportionnelle à Y on retiendra des
probabilités Pi proportionnelles aux Xi ce qui nous assurera une variance petite.

9.4.3 Estimation de la variance de ypiar

Montrer que
 La variance est estimé sans biais par:
1
Pn y 2
Var ypiar = N2 n(n−1) j=1 pj ( pjj − N ypiar )
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 56

9.5 Sondage à probabilité inégale et sans remise


9.5.1 mode d’obtention de l’échantillon
iMéthode 1:
La méthode la plus intuitive a déjà été évoquée au paragraphe 2. On effectue un tirage conformément
Pi
aux probabilitésP1 , . . . , Pi , . . . PN . On effectue un deuxième tirage conformément aux probabilités 1−P j
avec
i 6= j (si l’individui est tiré au premier tirage). On effectue un troisième tirage conformément aux probabilités
Pi
1−Pj −Pk avec i 6= j, i 6= jk et j 6= k. malgré la lourdeur de la mise en œuvre et les calculs impliqués dans ce
cas générale, cette méthode est utilisée lorsqu’une stratification poussée a donné des strates d’effectifs faibles
et la taille de l’échantillon dans la strate h n’est que de quelques unités (1, 2, 3, . . . ).
Méthode 2 :
Une seconde méthode s’inspire du tirage systématique. Les unités i = 1 à N sont de taille Xi et on veut
un échantillon de taille n. On forme les cumules successifs des nXi . la plage de taille nXi étant attribuée à
l’unité i. Exemple on suppose que n = 2
i Xi 2Xi Cumul «plage»
2Xi
1 3 6 6 1-6
2 1 2 8 7-8
3 11 22 30 9-30
4 6 12 42 31-42
5 2 4 46 43-46
P
On tire un nombre aléatoire λ entre 1 et Xi = X. Dans ce cas, l’échantillon est constitué de λ, λ +
X, . . . ., λ + (n − 1)X
1. Déterminons les échantillons possibles :
Nombre de cas λ échantillon
6 1-6 {1, 3}
1 7 {2, 3}
1 8 {2, 4}
11 9-19 {3, 4}
4 20-23 {4, 5}
6 2
π1 = 23 , π2 = 23 , π3 = 22 12 4
23 , π4 = 23 et π5 = 23 On constate que les πi sont proportionnelles aux tailles
(Xi ) . Mais il faut noter que la probabilité de certains échantillons est nulle telle π14 = 0 , π15 = 0 , π12 = 0,
π13 = 0 . les πii0 dépendent de l’ordre initial dans lequel est rangée la population. Cette dépendance etant
cependant nuancé par les valeurs de Xi et Xi0 . Aucun résultat général à propos des πii0 n’est établi. Le
statisticien se placera dans l’un des deux cas suivant :
1. Ou bien la population est d’effectif important, l’ordre initial est considéré comme acquis et les πii0 sont
ce qu’ils sont pratiquement impossible à calculer ;
2. Ou bien l’effectif de la population est très modeste auquel cas les N permutations peuvent être consid-
érées pour les calculs des πii0 .
P
Remarque : En P général le pas des tirages Xi = X est supérieur à l’amplitude de toutes les plages,
nX i <
c’est-à-dire P Xi = X. Un problème peut se poser lorsque certains Xi sont trop grand et telle
que nX i > Xi = X; de telles unités sont forcément tirées, c’est-à-dire Pi = 1, voir plusieurs fois, ce qui
peut déranger dans une procédure de tirage sans rémise. Une solution pratique est alors de constituer une
strate de (grosse) unités qui seront retenu exhaustivement. Dans cette strate, il n’y aura donc pas d’erreur
d’échantillonnage, mais l’effectif ne doit pas être trop important de sorte que dans les autres strates il y ait
suffisamment d’unités.
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 57

9.5.2 Estimation : Estimateur de Horwitz-THOMSOM du total.


PN
Il s’agit d’estimer moyenne Y = N1 i=1 Yi
πi = P (i ∈ echantillon) Comme N est connu, connaitre Y revient à connaitre Y : T otal et vis-vers-ça
Pn y
YbHT = j=1 πjj On a :
Pn y
E(Yb HT ) = j=1 E( πjj ) Or

Pn yj PN Yi 1 si i ∈ s
YHT = j=1 πj = i=1 πi εi avec εi =
b :
0 sinon
PN PN PN
E(Yb HT ) = i=1 Yπii E(εi ) = i=1 Yπii ∗ πi = i=1 Yi = Y Donc YbHT est un E.S.B de Y .
On aura

Yb HT = y pisr
1
= YbHT
N
n
1 X yj
= qui est un E.S.B de Y .
N j=1 πj

et
N
!
 1 X Yi
V ar y pisr = V ar εi
N2 π
i=1 i
 
N
1 X πi (1 − πi ) 2 X X πii0 − πi πi0
= Yi + Yi Yi00 
N 2 i=1 πi 2 0
i i 6=i
π i π i0

N
!
 1 X Yi
V ar y pisr = 2
V ar εi
N π
i=1 i
 
2
1  X X Yi Yi0 
= (πi πi0 − πii0 )( − ) :
2N 2 i 0i 6=i
π i π i0

 
Si les πi sont proportionnelles à Yi alors Yb HT se réduit à une constante et sa variance est nulle V ar Yb HT =
0. D’où l’intérêt de retenir un critère de taille X proportionnel à Y et πi proportionnel à Xi .
Remarque:

1. La méthode requière qu’aucune πi ne soit nulle faute de quoi il n’y a pas d’estimateur sans biais ;
2. Sauf lorsque la population est d’effectif très réduit, la probabilité d’inclusion πii0 d’ordre 2 ne se calcul
pas aisément ;

3. La dernière formule de V ar y pisr permet de voir que dans le sondage PIAR toute paire d’individu
i et i0 apporte une contribution positive à la variance, dans le sondage PISR, toute paire d’individu
telle que πi πi0 < πii0 apporte une contribution négative à la variance.

4. Estimation de V ar y pisr
Pn πj (1−πj ) 2
πj 2
yj Pn
 j=1 (1−πj ) 2
La première partie de V ar y pisr peut être estimée par ; πj = j=1 π j 2 yj
π 0 −π π 0
La seconde partie par: j j 0 6=j jjπj π j0 j yj yj 0 /πjj 0
P P
j
CHAPTER 9. SONDAGE AVEC PROBABILITE PROPORTIONNELLE A LA TAILLE 58
hP i
 1 n (1−πj ) 2 P P πjj 0 −πj πj 0 yj yj 0
c1 y pisr =
Finalement On aura: V N2 j=1 πj 2 yj + j j 0 6=j πjj 0 πj πj 0

H.T. (1952)
 
 1
P P (πj πj0 −πjj0 ) y y 0 2
V
c2 y pisr =
2N 2 j j 0 6=j πjj 0 ( πjj − πj 0 ) :
j

Sen − Y ates − Grandy (1953)


PN
En effet, si l’on veut estimer un Total T = i=1 Zi avec Zi la probabilité d’inclusion πi l’estimateur du
Pn z
total estTb = j=1 πjj
L’estimateur sans biais de la variance requière qu’aucune πjj 0 ne soit nulle. Toutes les paires doivent avoir
une probabilité non nulle d’inclusion.
Il faut aussi noté que les deux estimateurs
 peuvent prendre des valeurs négatives.
 Des expériences de
simulation semblent montrer que V c2 y pisr est plus satisfaisante que V c1 y pisr laquelle prend souvent des
valeurs négatives.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

59
10
SONDAGE A DEUX DEGRES A
PROBABILITE INEGALE

Le sondage à probabilité inégale est utilisé lorsque les unités sont de taille très différentes ceci est vraie
pour une population d’entreprise dont on prend généralement un échantillon à un degré, c’est également
vraie dans un sondage à plusieurs degrés (par exemple à deux degrés). Les unités primaires seront presque
toujours tirées avec probabilité proportionnelle à la taille exprimée en nombre d’US (dans le cas d’un sondage
en deux degrés). Le tirage d’un nombre fixe d’US par UP échantillon assure alors la même probabilité
d’inclusion à toutes les US des UP.

10.1 Sondage à deux degrés:


Premier degré : Tirage avec probabilité inégale et avec remise de n UP parmi N . A chaque tirage l’UP
i à la probabilité Pi d’être désignée.
Deuxième degré : Tirage à probabilité égale et sans remise. Si l’UP i est tirée on l’en prélève un
échantillon de mi US.
Si l’UP est désignée (αi ) fois au premier degré, alors on prélèvera (αi ) échantillon indépendant de taille
mi .

60
CHAPTER 10. SONDAGE A DEUX DEGRES A PROBABILITE INEGALE 61

10.1.1 Notation:
 
2
M, Yi , Y, Y , Y , Y i , Y i , S2i Sont les mêmes que dans le sondage à probabilité égale de même que Yik
et yjl

10.1.2 Estimateur de Y
PN h P i
1 N 1 N PN PN
Y = M i=1 Yi = M N i=1 Yi On remplace N1 i=1 Yi par son estimateur or nous savons que i=1 Yi
Pn y PN Pn y
est estimé par Ybpiar = i=1 npj d’où N1 i=1 Yi est estimé par N1 i=1 npj or yj n’est pas connu quand on
j j
M Pmj
tire l’UP j il faut dons l’estimé par : ybj = mjj l=1 yjl . Notre estimateur final de la moyenne est donc :
n n mj
1 X ybj 1 X 1 Mj X
y D2 = = yjl
M i=1 npj M i=1 npj mj
l=1
 
V ar(y D2 ) = V1 E2 (y D2 ) +E1 V2 (y D2 )
 
 1
Pn E(b yj )
V1 E2 (y D2 ) =V1 M i=1 np or E(by j ) =yj
j
h P i 2
 1 n yj 1 1
P N Yi
V1 E2 (y D2 ) =V1 M i=1 npj = M 2 n i=1 Pi ( pi −Y ) et
2
PN −mi S2i
E1 V2 (y D2 ) = M12 n1 i=1 P1i Mi2 ( MiM

i
) mi On aura donc :
"N 2 XN
#
2

   1 1 X Yi 1 2 Mi −mi S2i
V ar y D2 = V1 E2 y D2 +E1 V2 y D2 = 2 Pi −Y + M ( )
M n i=1 pi P i
i=1 i
Mi mi

Son estimateur est : 2


2 Mj −mj s2j 2
Pn Pmj
E1 \ V2 (y D2 ) = M12 n12 j=1 1
avec s22j = mj1−1
 2
pj M j ( M j ) mj l=1 (yjl −yj ) ESB de S2j
On a aussi :
X ybj 2n
1 1
V ar\

y D2 = 2 ( − M y D2 )
M n(n − 1) j=1 pj

\  \  \ 
On déduit que : V1 E 2 (y D2 ) =V ar y D2 − E1 V2 (y D2 )

10.1.3 cas particulier


Pi = M Mi
M et mi =m0 Pi = M : probabilité proportionnelle à la taille
i

mi = m0 même nombre d’US dans chaque UP échantillon


Pn 1
Pn Pm0
j=1 mi = nm0 On aura dans ce cas y D2 = n∗m0 j=1 l=1 yjl
Remarque
n m0 Mi m0 m0
πi : la probabilité d’inclusion d’une US i est: πi = [1 − (1 − Pi ) ] × Mi ≈n M Mi =n M
11
ESTIMATION PAR LA REGRESSION

Si la liaison entre X et Y est approximativement linéaire et que la droite de régression passe «loin» de
l’origine (B > Y2 ) , il est préférable d’utiliser l’estimation par régression plutôt que l’estimation par le
quotient (l’estimation par la régression n’est pas souvent utilisée car les calculs sont compliqués) .

11.1 Estimation de Y avec SAS sans remise de taille n dans une


population P de taille N .
11.1.1 Dans la population

: Yi = A Xi − X + Y + Ui pour i = 1 à N car Yi = AXi + Ui Donc Y = AX + 0
 PN
(Xi −X )(Yi −Y )
A = i=1P

2
PN ( i )
X −X

i=1 Ui = 0

11.1.2 Dans l’échantillon:


yj = a (xj − x) + y + ej pour j = 1 à n
 Pn
(xj −x)(yj −y)
a = j=1(x −x)2

Avec Pn
j

j=1 ej = 0 avec ej = résidus


62
CHAPTER 11. ESTIMATION PAR LA REGRESSION 63

Pour un individu i appartenant à l’échantillon S on : pour i ∈ s on a : Yi = a (Xi − x) + y + ei pour i


n’appartenant pas à s Ybi = a (Xi − x) + y On a donc:
P P 
Ybreg = i∈s Yi + i∈s / Yi = N y + a (Xi − x) = N [y + a X − x ]
b

Ybreg 
Yb reg = =y+a X−x
N
On remarque que Y pouvait être régressé par plusieurs variables on a :
 
Yb reg =y+a X−x +b Z−z + . . . .

11.1.3 Calcul de Yb reg


y= n1
P  
i∈s Yi or Yi = A Xi − X + Y + Ui donc y=Y + a x−X +u ainsi on a donc :

Ybreg  
Yb reg = =y+a X−x =Y + (a−A) x−X +u
N
 
Pour un grand échantillon a → A d’où (a − A) = 0 on adonc : Yb reg − Y = U =⇒ E Yb reg − Y = E (u) =
E (Ui ) = 0
Ainsi Yb reg est
 assymptotiquement sans biais.
2
Su PN
: V ar Y reg = V ar U = (1 − f ) n avec Su2 = N 1−1 i=1 Ui2
b 

s2
  Pn 2
1
Et Vdar Yb reg = (1 − f ) ne avec s2e = n−2 i=1 ei on divise par (n − 2) au lieu de (n − 1) à cause du
P P
degré de Liberté n − N ombre de contre et ici on a deux contrainte ej = 0 et Xj ej = 0

11.2 Comparaison de Y reg , y q et y


c

 
Par définition des MCO on V ar Yb reg < V ar (y) donc Yb reg est meilleur que y
S2
  
V ar Yb reg = V ar U = (1 − f ) nu Or Su2 = (1 − ρ2xy )SY2 d’où si n → N
 
V ar Yb reg = (1 − ρ2xy )V ar (y) < V ar (y)

En ce qui concerne la comparaison de Yb reg et Y q on a :

2 1−f 2
E(y q − Y ) = (SY − 2RSXY + R2 SX
2
)
n
  2 2
D’où V ar Yb reg < E(y q − Y ) ⇒ (1 − ρ2xy )SY2 < SY2 − 2RSXY + R2 SX 2
⇒ 0 < (ρSY − RSX ) ce qui est
toujours vraie donc la régression est toujours meilleure que l’estimation par le quotient.

Remarque : Yb reg = y + a X − x dans le cas particulier ou a = 1 on parle d’estimation par la différence.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

64
12
ESTIMATION PAR LE QUOTIENT

12.1 Définition et opportunité


12.1.1 Définition
U
ne estimation de type quotient est défini par le rapport de deux estimateurs d’un même sondage.
Cette définition met directement en cause la procédure d’estimation, la procédure de tirage n’est
qu’implicitement évoquée par les estimateurs présents au numérateur et au dénominateur. Les estima-
teurs considérés jusqu’à présent sont tous linéaires par rapport aux observations, ce qui a permis une
utilisation privilégiée de l’opérateur espérance mathématique. L’estimateur par le quotient sera de la
forme rb = yb/b
x avec yb et x
b non indépendants car issus d’un même sondage. La linéarité ne «joue» plus
pleinement même si chacun des deux estimateurs yb et x b sont linéaires par rapport aux observations.
C’est la raison qui justifie l’étude particulière de l’estimation par le quotient.

12.1.2 Opportunité
On distingue principalement deux cas relevant de l’estimation par le quotient :

1. Jusqu’à présent les différents estimateurs de la moyenne que nous avons étudié nécessitaient générale-
ment la connaissance de l’effectif total de la population N, supposé connu a priori. Cependant, en

65
CHAPTER 12. ESTIMATION PAR LE QUOTIENT 66

1
Pn yj
pratique on ne connait pas toujours N, qui intervient au dénominateur de y P IAR = nN j=1 Pj .

1
Pn yj
Pn n pj
Si N est inconnue, il faudra l’estimer par : N
b = 1
n
1
j=1 pj y P IAR =
d’oùl’estimateur e 1= Yb
Pj=1
n 1
n Nbj=1 pj
qui est un estimateur de la moyenne dont les propriétés ne sont pas les mêmes que celles de y P IAR . Un
cas particulier est celui de l’estimateur d’une proportion, le numérateur et le dénominateur étant estimés
séparément.

On a un échantillon de points de vente de type grand magasin et on prend Xi égal au


chiffre d’affaire total
PN du magasinP i ; Yi égal au chiffre d’affaire du rayon alimentaire du
N
magasin i. X = i=1 Xi , Y = i=1 Yi Et la proportion oùle poids de l’alimentation
Y
est X
A partir d’un échantillon et en fonction d’une procédure de tirage, on estimera le chiffre
d’affaire global X et le chiffre d’affaire des rayons alimentaires Y et on fera le rapport
des deux estimateurs pour avoir un estimateur du poids de l’alimentaire.
Dans le cas oùl’échantillon a été obtenu par sondage aléatoire simple on a :
Y Y /N Y b y
N = X/N = X = R donc R = x

Le second cas d’utilisation est celui consistant à faire un redressement supplémentaire


à partir d’une information supplémentaire disponible.

Reprenons l’exemple ci-dessus et supposons que l’on veut estimer Y . La solution spontanée si l’échantillon
est aléatoire est d’utiliser y. Mais si X est connue (la vraie moyenne du chiffre d’affaire total) un autre
estimateur possible de Y qui relève de la règle de trois est : Yb = y ∗ X = R
x
b∗X
Cet estimateur est l’estimation par le quotient de Y et sa mentalité est la suivante : le rapport de
deux variables aléatoires est souvent moins fluctuant que chacune des deux variables aléatoires considérées
isolément.
Cependant les statistiques X et x doivent être homogènes. Globalement l’estimation par le quotient
comme méthode d’utilisation de l’information supplémentaire consiste en quelque sorte à redresser l’estimateur
y
y par le coefficient X
x . On aura donc Y = x ∗ X
b
L’hypothèse étant que la déformation de Y à y induit par la procédure de tirage et d’estimation est la
même que celle qui existe entre X et x.
Dans le cas du sondage aléatoire simple on aura intérêt à ce que les variables X et Y soient de corrélation
aussi étroite que possible et s’annulent en même temps.

12.2 Espérance mathématique de l’estimateur par le quotient


Soit une population sur laquelle on définit deux variables X et Y et on a :
X=X N et Y = N
Y

Y Y
Le problème général est d’estimer le rapport R = X =X

Soit ỹ un estimateur de Y et x̃ un estimateur de X. Considérons r = x̃ un estimateur de R.

12.2.1 Cas général E(r)

cov (r, x) = E (rx) − E (r) × E(x)


= E (ỹ) − E (r) × E(x)
CHAPTER 12. ESTIMATION PAR LE QUOTIENT 67

Donc
E (ỹ) − cov (r, x)
E (r) = B (r)
E(x̃)
= E (r) − R
E (ỹ) − cov (r, x) Y
= −
E (x̃) X
cov (r, x̃) E (ỹ) Y
=− + −
E (x̃) E (x̃) X
Si ỹ et x̃ sont sans biais alors B (r) = − cov(r,x̃)
X
. C’est en cela qu’en général on dit que «l’estimateur par le
quotient» est généralement biaisé. Il faut remarquer que cette affirmation dépend des procédés des tirages
ayant donné ỹ et x̃.

B (r) = − cov(r,x̃)
X
Si on a une connaissance suffisante sur le caractère X qui est le caractère de référence, on peut affirmer
que le biais est faible devant la variance si CV = σXx̃ est faible. Il faut noter qu’il existe des modes
de tirage qui permettent d’avoir un estimateur sans biais de R, donc l’estimateur par le quotient peut
être sans biais.

12.3 Expression approximative du biais de r lorsque sont des es-


timateurs sans biais de et
On a: E (x̃) = X et
E (x̃) = Y B (r)
= E (r − R)
 

=E −R

 
ỹ − x̃R
=E

ỹ − x̃R
= E( )Avec
X + δ (x̃)
δ (x̃) = x̃ − X
Posons:
ỹ − x̃R
ρ (θ) = E( )ρ (1)
X + θδ (x̃)
00 θ2
= B(r)ρ (θ) = ρ (0) + ρ0 (0) .θ + ρ (0) . + σ(θ)B (r)
2
(ỹ − x̃R)δ 2 (x̃)
    
ỹ − x̃R (ỹ − x̃R)δ(x̃)
=E +E − + E 3
X X2 X
Or
 
ỹ − x̃R 1
E = [E (ỹ) − R ∗ E(x̃)]
X X
1 
= Y − RX =0
X
CHAPTER 12. ESTIMATION PAR LE QUOTIENT 68

Donc
" #
(ỹ − x̃R)δ(x)
e
B (r) = −E 2
X
1
=− 2 cov(ỹ − x̃R; δ (x̃))
X
1 
=− 2 cov ỹ − x̃R; x̃ − X
X
1
=− 2 [cov (ỹ; x̃) − RV ar (x̃)]
X
D’où
1
B (r) = 2 [RV ar (x̃) − cov(ỹ; x̃)]
X

12.3.1 Cas d’un sondage aléatoire simple sans remise


h 2 i
1−f 1 SX
− SXY = R∗ 1−f SXY
 2

On a: B (r) = n X2 RSX n 2 − Dans le cas particulier oùle biais est un infiniment
X XY
1
petit en n B(r)tend vers 0 lorsque n → ∞; on obtient un estimateur du biais en remplaçant chaque terme
par son estimateur.

12.3.2 Calcul de l’erreur totale dans le cas de l’estimation par le quotient


L’estimateur étant biaisé on a: ET = V ar (r) + B 2 (r)
On a:
2
E(r − R) = V ar (r − R) + E 2 (r − R) = V ar (r) + B 2 (r)

12.3.3 L’expression approximative de l’erreur lorsque ỹ et x̃ sont sans biais


( 2 )
h
2
i ỹ − x̃R
E (r − R) = E
X + θδ (x̃)
" # " !#
2 2
y − x̃R)
(e ỹ − x̃R)
=E 2 − 2E 3 × δ 2 (x̃)
X X
" #
2
(ỹ − x̃R)
=E 2
X
1 
= 2 V ar (ỹ − 2Rcov (x̃; ỹ)) + R2 V ar(x̃)

X

12.3.4 Cas particulier d’un sondage aléatoire simple


x̃ = x et ỹ = y donc
h i PN
2 1−f 1
 2  1−f 1 1 2
E (r − R)) = n X2 SY − 2RSXY + R2 SX
2
= n X 2 N −1 i=1 (Yi − RXi )

1
Ici l’erreur totale est un infiniment petit en n et elle peut être obtenue de façon grossière en remplaçant
chaque terme par son estimateur.
CHAPTER 12. ESTIMATION PAR LE QUOTIENT 69

12.4 Comparaison dans le cas du SAS


h 2
i h 2
i
y
Il s’agit de comparer y et V (y) = 1−fn SY
2
avec y q = x ∗ X = rXE (y q − Y ) = E (rX − RX) =
2
h i
2
X E (r − R) = 1−f
 
n SY2 − 2RρSX SY + R2 SX
2
L’estimateur y q est meilleur que y si et seulement si:

RSX 1 SX /X
R2 SX
2
− 2RρSX SY < 0 ⇐⇒ ρ > 2SY = 2 SY /Y avec R >0

12.4.1 Interprétation
: On se place dans la population P et on considère la relation: Yi = AXi + B + ui i = 1, . . ., N
Avec la méthode MCO on a:
cov(Y ;X)
A= V (X) et B = Y − AX

On obtient donc ρ = AS 1 RSX


SY > 2 SY d’où A > 2
X R

B − Y2 = X R2 − A < 0 donc B < Y2




Si les variables X et Y représentent le même caractère mesuré à des dates différentes, on peut considérer que
le coefficient de variation n’a pas varié et la condition revient à : ρ > 12

12.5 Estimation par le quotient dans le cas d’un sondage stratifié


12.5.1 Méthode 1 Ratio stratifié

H
X Nh
Y = Yh
N
h=1
H
X Nh
ys = y
N h
h=1
H
X Nh
y qs = y et
N qh
h=1
y qh = rh × X h
Yh
Rh =
Xh

La méthode suppose X h est connue pour chaque strate et l’erreur totale de y qs se déduit facilement à partir
de ce qui précède de même que son estimation.
h i hP 2 i PH h i
2 H Nh Nh 2 2 2

E (y qs − Y ) = E h=1 N X (r
h h − Rh ) = h=1 N X h E (rh − R h )

Car les strates sont indépendantes donc les doubles sommes sont nulles.
CHAPTER 12. ESTIMATION PAR LE QUOTIENT 70

12.5.2 Méthode 2 Ratio combiné

H
X Nh
ys = y
N h
h=1
H
X Nh
xs = xh
N
h=1
ys
y qs = × X = rs × X
xs

La méthode suppose que X ne soit connue que globalement. xs et y s sont sans biais ; ainsi tous les calculs
valables lorsque x̃ et ỹ sont sans biais sont valables ici :
h 2
i
ET = E (y qs − Y ) = V ar (y s ) − 2Rcov (xs ; y s ) + R2 V ar(xs )

2
PH Nh 2

Avec cov (y s ; xs ) = h=1 N cov (y h ; xh )

12.5.3 Comparaison des deux méthodes


Les deux méthodes ne sont pas directement comparables, il faut cependant noter qu’avec la méthode 1 on a un
estimateur de type quotient pour chaque strate et que dans chaque strate l’erreur totale n’est qu’approximée.
Ainsi si les strates sont nombreuses la sommation d’approximation peut être dangereuse.
Yh
La méthode 1 est cependant préférable si Rh = X varie fortement d’une strate à l’autre et l’échantillon
h
est de taille suffisante dans chaque strate.

1. Estimation par le quotient lorsque X n’est pas connue

On ne dispose pas de X mais de X 0 l’estimation issue d’un échantillon important (important par la taille
de l’échantillon) ; indépendant de l’échantillon considéré.
On a alors: y q0 = x0 r

E y q0 = E (r.x0 ) = E (r) ∗ E (x0 ) = X 0 E(r) car r et X 0 sont indépendants et x0 est un estimateur sans
biais.
Ainsi le biais n’est donc pas modifié
 par rapport à la situation oùX est connue.
La variance de y q0 est: V y q0 = V (rx0 ) = E1 [V2 (rx0 )] + V2 [E1 (rx0 )]

1. La première partie est relative au sondage antérieur ;


2. La seconde partie est relative au sondage présent.
  
On a: V y q0 = V rX + E r2 ∗ V (x0 )

V rX est la variance de y q dans le cas oùX est connue.

Et comme le second terme E r2 ∗ V (x0 ) est positif, on constate qu’une estimation de X augmente la

variance de E r2 ∗ V (x0 ) avec x0 un estimateur sans biais de X alors que le biais reste inchangé.
En définitif, on peut dire que dans le cas oùX n’est pas connue, en le remplaçant par son estimateur on
augmente l’erreur quadratique.
On retient que ‘estimateur par le quotient est une méthode de redressement d’un mauvais échantillon.
EXERCICES

Exercice 1

1 t

2 s
a a

3 t
4 d

5 c
6 v
7 h
8 k

9 t

71
CORRECTION DES EXERCICES

12.1 Solution
sh

12.2 Solution
sh

12.3 Solution
sh

12.4 Solution
sh

72
PRATIQUE DE SONDAGE AVEC
LOGICIEL R

73

Vous aimerez peut-être aussi