0% ont trouvé ce document utile (0 vote)
2 vues47 pages

Cours

Le document présente des services de formation et de coaching en géomatique, ainsi qu'une introduction à la statistique descriptive utilisant le logiciel SPSS. Il décrit les mesures de tendance centrale (moyenne, médiane, mode) et de dispersion (écart-type, variance, étendue), ainsi que les types de variables (quantitatives et qualitatives). Enfin, il aborde l'utilisation pratique de SPSS pour la gestion et l'analyse des données.

Transféré par

Mahamadou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues47 pages

Cours

Le document présente des services de formation et de coaching en géomatique, ainsi qu'une introduction à la statistique descriptive utilisant le logiciel SPSS. Il décrit les mesures de tendance centrale (moyenne, médiane, mode) et de dispersion (écart-type, variance, étendue), ainsi que les types de variables (quantitatives et qualitatives). Enfin, il aborde l'utilisation pratique de SPSS pour la gestion et l'analyse des données.

Transféré par

Mahamadou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Nos services :

 Formation et coaching
 Développement des solutions Géomatique
 Vente des logiciels SIG et d’ESRI (ARCGIS, Collector …..)
 Collecte des données

Site Web : [Link]


Statistique descriptif avec SPSS
Dans ce module, il sera question d’abordé la statistique descriptif avec
le logiciel SPSS qui est un logiciel couramment utiliser et facile à
manipuler.

Présentateur: Ayouba Hamza Abdoulaye


Définition de la statistique descriptif:

• Le statistique descriptif est une branche de la statistique qui consiste


à résumer et à interpréter les données collectées. Elle permet de
décrire les caractéristiques importantes d'un échantillon ou d'une
population, sans effectuer d'inférence ou de généralisation sur la
population totale.
Mesures couramment utilisées en statistique
descriptive :
Mesures de tendance centrale :

• Moyenne : la somme des valeurs divisée par le nombre total de


valeurs.
• Médiane : la valeur centrale qui sépare les données en deux parties
égales.
• Mode : la valeur qui apparaît le plus fréquemment dans les données.
Calcule de la moyenne

• Supposons que nous ayons l'ensemble de données suivant : 5, 8, 12,


4, 9.
• Addition des valeurs : 5 + 8 + 12 + 4 + 9 = 38.
• Nombre total de valeurs dans l'ensemble de données : 5.
• Pour calculer la moyenne, divisez la somme par le nombre total de
valeurs : 38 / 5 = 7.6.
• Donc, la moyenne de cet ensemble de données est 7.6.
La moyenne est une mesure de tendance
centrale couramment utilisée pour
représenter la valeur typique d'un ensemble
de données.
Calcule de la médian

• Triez les données par ordre croissant ou décroissant, selon votre préférence.
• Identifiez le nombre total de données (n), qui correspond à la taille de votre
échantillon.
• Utilisez la formule suivante pour déterminer la position de la médiane :
• Si le nombre total de données (n) est impair : la médiane est la valeur située à la
position (n + 1) / 2 dans l'ordre trié des données. Par exemple, si vous avez 11
données, la médiane sera à la position (11 + 1) / 2 = 6.
• Si le nombre total de données (n) est pair : la médiane est la moyenne des deux
valeurs situées aux positions n / 2 et (n / 2) + 1 dans l'ordre trié des données. Par
exemple, si vous avez 12 données, la médiane sera la moyenne des valeurs à la
position 6 et 7 dans l'ordre trié.
• Trouvez la valeur correspondante à la position de la médiane dans l'ordre
trié des données. Si la position de la médiane est un nombre entier, vous
obtenez directement cette valeur. Si la position de la médiane est un nombre
décimal, vous devez prendre la moyenne des deux valeurs les plus proches.
Calcule de la médian

• Voici un exemple pour illustrer le calcul de la médiane :


• Supposons que nous ayons l'ensemble de données suivant : 7, 2, 1, 4,
5, 3, 6.
• Tri des données : 1, 2, 3, 4, 5, 6, 7.
• Nombre total de données (n) : 7.
• La position de la médiane est (7 + 1) / 2 = 4.
• La valeur à la position 4 dans l'ordre trié est 4.
• Donc, la médiane de cet ensemble de données est 4.
• Il est important de noter que la médiane est moins sensible aux
valeurs extrêmes que la moyenne, ce qui en fait une mesure de
tendance centrale robuste dans certains cas.
Calcule de la mode

• Identifiez la valeur qui apparaît le plus fréquemment dans l'ensemble


de données. C'est la mode.
• Si plusieurs valeurs apparaissent avec la même fréquence maximale,
l'ensemble de données est dit multimodal et peut avoir plusieurs
modes. S'il n'y a aucune valeur répétée, l'ensemble de données est
dit sans mode.
Calcule de la mode

• Supposons que nous ayons l'ensemble de données suivant : 2, 4, 6, 4, 7, 4, 9, 4.


• Dans cet exemple, la valeur 4 apparaît le plus fréquemment, à quatre reprises.
Donc, la mode de cet ensemble de données est 4.
• Il est important de noter que la mode peut ne pas être unique ou que l'ensemble
de données peut ne pas avoir de mode si toutes les valeurs sont différentes et
apparaissent avec la même fréquence.
La mode est une mesure de tendance centrale
utile pour identifier les valeurs les plus fréquentes
ou les plus courantes dans un ensemble de
données. Cependant, contrairement à la moyenne
et à la médiane, elle ne fournit pas
nécessairement une représentation de la valeur
centrale de l'ensemble de données.
Mesures de dispersion :

• Écart-type : une mesure de la dispersion des valeurs autour de la


moyenne.
• Variance : le carré de l'écart-type.
• Étendue : la différence entre la valeur maximale et la valeur
minimale.
Calcule de l’Ecart-type

• L'écart-type est une mesure importante pour évaluer la dispersion


des valeurs autour de la moyenne. Plus l'écart-type est élevé, plus les
valeurs sont dispersées, tandis qu'un écart-type faible indique une
dispersion plus faible.
• Il permet de quantifier à quel point les valeurs sont éloignées de la
moyenne.
Calcul de la variance

• La variance est une mesure de dispersion qui indique à quel point les
valeurs dans un ensemble sont dispersées par rapport à leur
moyenne. Cependant, la variance est exprimée en unités au carré, ce
qui peut être moins intuitif. Par conséquent, on utilise souvent
l'écart-type (la racine carrée de la variance) pour obtenir une mesure
de dispersion exprimée dans les mêmes unités que les données
originales.
Calcul de l’ Étendue

• L'étendue est une mesure simple de dispersion qui fournit une


indication de la distance entre les valeurs extrêmes dans un
ensemble de données. Cependant, elle ne tient pas compte de la
répartition des valeurs entre la valeur minimale et la valeur
maximale. Par conséquent, il est important de l'utiliser en
conjonction avec d'autres mesures de dispersion, telles que l'écart-
type ou la variance, pour obtenir une image plus complète de la
variabilité des données.
L'étendue est une mesure de dispersion qui donne la différence entre
la valeur maximale et la valeur minimale dans un ensemble de
données. Elle permet d'évaluer la gamme complète des valeurs
observées.
Graphiques :

• Histogramme : représente graphiquement la répartition des données


en barres.
• Diagramme en boîte (box plot) : présente graphiquement les
quartiles, l'étendue et les valeurs aberrantes des données.
La variable:

• Une variable est un concept fondamental en statistiques et en


recherche, et elle représente une caractéristique ou une propriété
qui peut varier d'une observation à une autre. Dans un ensemble de
données, une variable est représentée par une colonne et chaque
valeur dans cette colonne correspond à une observation spécifique.
La variable:

• Il est important de bien identifier le type de variable que vous


manipulez, car cela influencera les méthodes d'analyse statistique
appropriées à utiliser. Les variables quantitatives peuvent être
soumises à des calculs mathématiques et à des mesures de tendance
centrale ou de dispersion, tandis que les variables qualitatives
peuvent nécessiter des analyses de fréquence, des tests de
proportions ou des analyses de contingence.
Il existe deux types principaux de variables :

• Variables quantitatives : Aussi appelées variables numériques, elles


représentent des mesures numériques ou des quantités. Les
variables quantitatives peuvent être continues ou discrètes. Les
exemples incluent l'âge, la taille, le revenu, le nombre de ventes, etc.
• Variables qualitatives : Aussi appelées variables catégorielles, elles
représentent des caractéristiques ou des attributs qui ne peuvent pas
être mesurés numériquement. Les variables qualitatives peuvent être
nominales ou ordinales. Les exemples incluent le genre, la couleur
des yeux, le niveau d'éducation (diplôme obtenu), etc.
Variables quantitatives :

• Les variables quantitatives permettent d'effectuer diverses analyses


statistiques, telles que le calcul de la moyenne, de l'écart-type, des
corrélations, des régressions, des analyses de variance, etc. Ces
analyses permettent de comprendre les tendances, les relations et
les différences entre les valeurs numériques et d'obtenir des insights
plus approfondis à partir des données.
• Il est important de noter que le type de variable quantitative
(continue ou discrète) influence le choix des méthodes statistiques
appropriées. Les variables continues sont mesurées sur une échelle
continue et peuvent prendre n'importe quelle valeur dans une plage
donnée, tandis que les variables discrètes sont des nombres entiers
ou des catégories distinctes.
Variables qualitatives :

• Les variables qualitatives, également appelées variables catégorielles,


sont des types de variables qui représentent des caractéristiques ou
des attributs qui ne peuvent pas être mesurés numériquement. Elles
se divisent en deux catégories : les variables nominales et les
variables ordinales.
les variables nominales

• Les variables nominales représentent des catégories ou des groupes


distincts qui ne sont pas ordonnés. Les valeurs de ces variables sont
des noms, des étiquettes ou des identifiants de catégories. Par
exemple :
• Genre : Homme, Femme
• Couleur des yeux : Bleu, Marron, Vert
• Nationalité : Français, Allemand, Espagnol
• Type de véhicule : Voiture, Moto, Vélo
Dans ce type de variable, il n'y a pas d'ordre ou de hiérarchie entre
les catégories.
les variables ordinales.

• Les variables ordinales représentent des catégories ou des groupes


qui sont ordonnés selon une échelle ou une hiérarchie. Les valeurs de
ces variables indiquent l'ordre relatif ou la position des catégories.
Par exemple :
• Niveau de satisfaction : Très insatisfait, Insatisfait, Neutre, Satisfait,
Très satisfait
• Classe sociale : Bas, Moyen, Élevé
• Niveau d'éducation : Primaire, Secondaire, Universitaire
Dans ce type de variable, les catégories ont une séquence logique ou
une relation d'ordre entre elles.
Les variables qualitatives sont souvent utilisées pour décrire des
caractéristiques démographiques, des opinions, des préférences, des
groupes ou des catégories dans les données. Elles sont analysées à l'aide
de méthodes statistiques appropriées, telles que les tests de proportions,
les analyses de contingence (tableau croisé), les modèles de régression
logistique, etc.
Spss

• Utilisation pratique de logiciel Spss la prochain séance et de la


statistique descriptif avec spss
Nos services :
Formation et coaching
Développement des solutions Géomatique
Vente des logiciels SIG et d’ESRI (ARCGIS, Collector …..)
Collecte des données
Formation sur traitement de données avec SPSS

1. Présentation de l’environnement SPSS


2. Ouvrir, importer, exporter et sauvegarder des fichiers de données
3. Gérer les variables
4. Transformer les variables
5. Manipuler les fichiers de données
1. Présentation de l’environnement SPSS

SPSS est l’un des logiciels pionniers en matière de traitement d’analyse statistique des données, lancé à la fin
des années 60 et commercialisé par la société SPSS Inc. Le logiciel SPSS dont le sigle signifie « Statistical
Package for Social Sciences » permet de traiter des données dans plusieurs domaines notamment en économie,
en science de la santé, en marketing, etc.
1.1 Aperçu des menus principaux de SPSS
Fichier/File ✓ Ouvrir les fichiers (données, syntaxes, Analyse/Analyze ✓ Réaliser les tableaux ;
résultats, script) ;
✓ Modéliser les données ;
✓ Importer des données;
✓ Analyser les données d’enquêtes ;
✓ Enregistrer les fichiers;
✓ Etc.
✓ Etc.
Edition/Edit ✓ Copier les variable
Graphiques/Graphs ✓ Créer plusieurs types de graphiques
Affichage/View ✓ Afficher les variables;
• histogrammes,
✓ Afficher les données ;
• boîtes à moustaches,
✓ Personnaliser l’affichage des variables ;
• courbes,
✓ Etc.
Données/Data ✓ Définir les rôles des variables ; • etc.

✓ Trier les données ;


✓ Trier les variables ; Extensions/Extensions ✓ Installer les extension
✓ Sélectionner les données ; Fenêtre/Window ✓ Figer les volets (découper la fenêtre en plusieurs
cadrant)
✓ Agréger les données ;
✓ Pondérer les observations Aide/Help ✓ Accéder

✓ Etc. • Au support et forum SPSS


Transformer/Transform ✓ Transformer les variables ; • A la documentation en ligne
✓ Créer de nouvelles variables ; • au manuel de référence des commandes SPSS
✓ Recoder les variables ; (en local)

✓ Etc.
1.2 Les types de fichiers

Le logiciel SPSS gère quatre principaux fichiers. Il s’agit des :


• Fichiers de données/ Data : Les formats de données SPSS sous sauvegardées avec l’extension «.sav »
• Fichiers de syntaxe/ Syntax : Les listes d’instructions (commandes) sont gérées en SPSS par des fichiers d’extension
« .sps » ;
• Fichiers de résultats/Output : Les sorties de SPSS peuvent être exportées ou copiées vers divers format (MS Excel,
MS Word, etc.). Toutefois, pour exploitation de ces résultats sous SPSS, ils devront être enregistrés avec l’extension
appropriée «. spo »
• Scripts : Depuis la version 14 l’intégration du plug in Python permet d’exécuter des codes en codes sous SPSS. Les
scripts sont des programmes en Python d’extension « .py » ; « .pyc » ou « .pyo ».
2. Ouvrir, importer, exporter et sauvegarder des fichiers de données

Pour un travail organisé, nous allons créer des répertoires de travail. Pour ce faire, créez un répertoire par exemple
« C:\Formation SPSS» et copiez-y les dossiers » les dossiers « Données, Données traitées, Sortie, Programme ».
• Données: Ce répertoire devrait, dans vos pratiques, contenir les données brutes.
• Données traitées: Vous veillerez à y sauvegarder les données destinées à vos analyses.
• Sortie: Tous les résultats seront enregistrés dans ce répertoire
• Programme: Ce répertoire contient vos fichiers syntaxes
2.1 Création d’un masque de saisie SPSS

Le logiciel SPSS offre deux fenêtres pour la visualisation des données (« Vue des données/Data View » et « Vue des
variables/ Variable View »). La « Vue des variables » donne un aperçu des attributs de chaque variable du fichier de données,
pour créer un masque de saisie les attributs suivants sont à renseigner:

• Nom/Name : Il s’agit du nom de la variable


• Type : Numérique ou Chaîne.
• Largeur : largeur de la variable
• Décimales/Decimals: Le nombre de décimales si la variable en comporte ;
• Libellé/Label : Il s’agit de l’étiquette de la variable ;
• Valeurs/Values : Ce sont les étiquettes des valeurs
• Manquant/Missing : Permet de définir pour une variable donnée les valeurs qui doivent être traitées comme valeurs
manquantes. Par défaut, la valeur manquante pour SPSS est le point pour les variables de « Type » numérique ou « Date ».
• Colonne/Colomns : largeur de la colonne d’affichage de la variable dans la vue des données. Permet donc d’élargir ou
réduire la colonne d’affichage de la variable sans aucune incidence sur le format de celle-ci.
• Alignement/Align : Alignement à gauche (Left), au centre (Center) ou à droite (Right).
• Mesure/Measure:
-Nominale/Nominal : Lorsque les catégories de la variable n’ont pas d’ordre défini. Exemple : Variable « Sexe »
avec les catégories 1 Homme 2 Femme
- Ordinale/Ordinal : Lorsque les catégories de la variable sont établies dans un certain ordre. Exemple : Variable «
Niveau d’instruction » 1 Aucun 2 Primaire 3 Secondaire 4 Supérieur
- Echelle/Scale: Les catégories de la variable sont dans un ordre avec une métrique de telle sorte que leurs
différences ont une signification. Exemple : Variable « Age en années révolues »
• Rôle : Permet de définir les rôles des variables pour les analyses entre les variables qui jouent le rôle de :
-« entrée/Input» dans les modèles. Comme des variables indépendantes.
- « Cible/Target » ce sont les variables dépendantes
- « les deux/Both » lorsqu’elles jouent à la fois le rôle d’entrée et de cible ;
- « aucun/None » la variable n’a pas de rôle prédéfinie
- « partition/Partition » variable de partition des données pour tester, entraîner ou valider le modèle
- « scindée/Split » : Pour les versions de « IBM SPSS » les variables avec ce rôle ne sont pas utilisées comme telles
. ce rôle a été introduit pour « IBM SPSS Modeler ».
2.2 sauvegarder un fichier sous SPSS

Pour enregistrer un fichier de données sous SPSS, aller au menu « File » puis choisir « Save » si l’on souhaite
sauvegarder sous le nom déjà existant ou « Save as » si l’on veut donner un nouveau nom au fichier de données ou
changer de répertoire. Ce qui permet de laisser ce dernier intouché. Cette dernière commande est très importante
dans la mesure où elle laisse le fichier initial intouché. La première par contre altère le fichier initial de façon
permanente, ce qui est en général un désastre.
En outre la procédure « Enregistrer sous » permet de sélectionner les variables à sauvegarder ou à supprimer selon
les besoins de l’analyste.

2.3 ouvrir un fichier de données sous SPSS

Un fichier de données sous SPSS est un fichier d’extension «.sav ». Pour ouvrir un fichier de données sous SPSS, aller dans le
menu « File » puis « Open/Data » et indiquer le nom du fichier ainsi que le chemin d’accès.
2.3 Importer des données sous SPSS

SPSS permet d’ouvrir/importer des données de plusieurs formats en l’occurrence les données (Stata, SAS, Excel etc.).
Pour ce faire, aller dans le menu « File » puis « Import Data » et sélectionner le format du fichier à ouvrir dans le menu
déroulant « Fichiers de type » (Excel, CSV, Délimité, Texte fixe, stata, etc.). .
2.4 Exporter des fichiers
Pour exporter des données sous SPSS vers d’autres formats, il faut aller au menu « File », puis « Export » et sélectionner
le format d’exportation souhaitée (Excel, CSV, Délimité, Texte fixe, stata, etc.). Les fenêtres, qui suivent, permettent de
définir ce qui doit être exporté (Noms ou libellés, valeurs ou étiquettes, etc.) pour certains formats d’exportation comme
MS Excel ou ASCII qui ne peuvent conserver à la fois les valeurs et les étiquettes.
La procédure d’exportation peut être également réalisée à travers le menu « File » puis « Save as » et en choisissant le
type de format d’exportation dans le menu déroulant « Enregistrer sous le type »
3. Gérer les variables
Les données ne sont pas très souvent disposées selon les besoins immédiats de l’analyste. Très souvent, l’analyste est
appelé à réorganiser les données pour qu’elles correspondent à ses besoins. Parmi ces travaux préliminaires, on peut noter
entre autres l’étiquetage des variables, le recodage, la génération de nouvelles variables à partir de celles existantes etc.

3.1 Etiquetage des variables

Dans le cas précis le libellé de la variable sexe est « Sexe de l’enquêté ». SPSS permet avec une grande flexibilité
de décrire les variables. Pour ce faire, aller dans la « vue des variables », se positionner dans la colonne « Libellé
» puis saisir le l’étiquette de la variable sur la ligne correspondante à son nom dans la colonne « Nom ».
Les étiquettes peuvent également être ajoutées aux variables sous SPSS à l’aide de lignes de commandes «
VARIABLE LABELS »
3.2 Ajout d’étiquettes de valeur

Il est plus aisé, en matière de gestion des données et particulièrement en ce qui concerne les données d’enquêtes
statistiques, de travailler avec des codes que du texte. C’est ainsi dès la collecte, nous préférions codifier les réponses aux
différentes questions. C’est ainsi par exemple que pour enregistrer l’information sur le sexe de l’enquêté, nous allons créer
des codes pour les différentes modalités possibles (Homme, Femme). Dans la base, la variable renseigne sur le sexe de
l’enquêté ses valeurs sont pourtant 1 ou 2.

Pour les étiquettes de valeurs, il faut plutôt se positionner la


colonne , il faut plutôt se positionner la colonne « Value ». Une
fenêtre apparaît comme représente la Figure ci-contre. Saisir les
valeurs et les étiquettes correspondantes à chaque valeur en
cliquer sur le bouton « Add ». Lorsque les étiquettes auront été
définies pour toutes les valeurs, valider le processus en cliquant
sur le bouton « OK »
4. Transformer les variables

L’analyste des données est amené à créer de nouvelles variables qui correspondent à ses besoins à partir des variables
déjà existantes. La création de nouvelles variables se fait soit à travers une transformation fonctionnelle ou simplement
par regroupement de certaines modalités d’une variable, et ce, dans le but de répondre à une question d’analyse que les
variables présentes ne permettent pas.

4.1 Créer des variables


Pour créer/générer une nouvelle variable, aller au menu « Transformer » puis « Calculer la variable ». Une fenêtre
apparait comme à la figure qui suit permettant de :
a) saisir le nom de la nouvelle variable (1) ;
b) définir le format (Chaîne ou numérique) de la variable (2) ;
c) définir une condition si la transformation ne s’applique pas à toutes les observations du fichier (3) ;
d) entrer l’expression de la variable comme transformée des variables existantes (4) par combinaison des
opérateurs (6) et/ou des fonctions (8).
(5) Saisir
(1) Saisir le nom l’expression
de la nouvelle numérique de la
variable nouvelle variable

(2) Définir le
format de la (6) Pavé des
variable et son opérateurs
libellé

(3) Liste des (7) Groupe de


variables du fonctions
fichier actif (Ensemble de
fonctions
rangées
(4) Définir un
filtre (8) Pavé des
conditionnel fonctions
disponibles
4.2 Recoder des variables

Les besoins de l’analyste peuvent l’amener à préférer un regroupement de modalités pour une variable donnée. Par
exemple, au lieu de travailler avec la variable âge , l’on décide d’analyser les classes d’âge.
Considérons la variable « Age» qui correspond à l’âge de l’individu en années révolues. On souhaite étudier certaines
caractéristiques des membres de ménages en considérant 5 classes d’âge :
1-Entre 15 et 29ans
2-Entre 30 et 44 ans
3-Entre 45 et 59ans
4-Entre 60 et 74 ans
5-Entre 75 ans à plus
SPSS permet de recoder une variable sous le même ou créer d’une nouvelle par recodage d’une ancienne. Pour créer une
nouvelle variable par recodage d’une autre variable sous SPSS, aller au menu « Transformer » puis « Recodage de
variables ». Une fenêtre s’ouvre comme l’indique la figure suivante
(1) Liste (2) Variable à recoder
des choisie parmi les variables
variables de la base (1)
de la base
active

(3) définir le nom


de la variable
recodée et son
étiquette. Le
bouton «changer»
(4) Offre une permet d’appliquer
fenêtre les changements
permettant
de définir les
classes
Dans cette nouvelle, procéder par les étapes
a) Choisir la variable à recoder (variable d’entrée) dans le quadrant (1) vers le quadrant (2);
Saisir le nom de la nouvelle variable, son étiquette au cas échéant et valider cette opération en cliquant
sur le bouton « changer » ;
b) Définir au cas échéant les observations auxquelles s’applique le recodage ;
c) Le bouton « Anciennes et nouvelles valeurs » ouvre une nouvelle fenêtre (Figure suivante) qui
permet véritablement de définir les différents codages.
5. Manipuler les fichiers de données

Les manipulations couramment lors des fichiers qui s’imposent de traitement des données (en dehors bien sûr de
l’ouverture et de la sauvegarde) sont les opérations de fusion, de sélection et d’agrégation.

5.1 Opérations usuelles sur les données : tri et sélection des données
• Tri des observations (SORT CASES BY)

Pour ordonner les observations d’un fichier suivant une ou


plusieurs variables, on utilise la commande « SORT CASES BY
» du menu « Data » suivie de la variable ou de ces variables.
Les données du fichier «.sav» sont triées par ordre croissant
suivant les variables de tri. L’option (A) indique le sens ascendant
du tri. Pour trier dans l’ordre décroissant, il suffit de préciser le
sens avec l’option (D). La figure ci-contre nous donne un aperçu
de cette opération
• Sélection des observations

Il arrive souvent que les besoins de l’analyste portent une partie des données et non l’intégralité. M. le Gouverneur de
la région de Niamey souhaite avoir des informations sur sa région, il n’est donc pas nécessaire de travailler avec
l’ensemble des données du Niger. On va donc procéder à la sélection des données de la région de Niamey. Sous SPSS,
on utilise la commande « SELECT IF » pour faire une sélection.
Toutes les observations pour lesquelles la variable « région » n’est pas égale à 8 seront supprimées de la base de
données. Il faut donc faire attention à ne pas écraser le fichier de données initial après une sélection. La figure ci-
dessous résume la procédure de sélection.
5.2 Agrégation des données

Considérons une base de données . Chaque observation de cette base de données renferme des informations sur les
caractéristiques d’un individu bien donné (identifié par des variables). L’analyste souhaite constituer de niveau
ménage comprenant les données comme fonction des données individuelles de ses membres. Soit par exemple, pour
chaque ménage :
• L’âge moyen des membres ;
• L’âge maximum des membres ;
• La taille (nombre de membres) ;
• Le sexe du chef du ménage ;
• Etc.

Chaque observation du nouveau fichier ainsi constitué à renvoie à un groupe d’observations du fichier initial. Le processus
permettant de passer des informations individuelles à des données plus groupées est une « agrégation de données ».
La procédure d’agrégation des données sous SPSS se réalise à l’aide de l’assistant « Agréger » disponible dans le menu «
Données ». L’aperçu de sa boîte de dialogue est donné par la Erreur ! Source du renvoi introuvable..
• Le quadrant (1) contient la liste de toutes les variables du fichier.
• Le quadrant (2) permet sélectionner les variables d’agrégation à
partir de la liste du quadrant (1). Si on veut avoir les informations
sur l'âge moyenne enquêté par région, la variable « région » et la
variable « âge » qui identifie chaque région de façon unique 2
constitue les variables d’agrégation. Toute autre variable qui
n’altère pas cette unicité du ménage peut être ajoutée à la liste des
variables d’agrégation.
• Le quadrant (3) est réservé aux variables à agréger. Celles-ci sont
sélectionnées à partir du quadrant (1). 3
• Le quadrant (4) concerne les boutons « Fonction » et « Libellé ».
Le bouton « Fonction » donne accès à une boîte des fonctions 4
prédéfinies. 1 5
• Le quadrant (5) permet d’ajouter aux données le nombre
d’observations du fichier initial ayant servi à constituer chaque
observation du fichier final. Il suffit pour cela de cocher la case «
Nombre d’observations ». La variable « Nombre d’observations » 6
sera créée dans le fusion agrégée sous le nom renseigné dans la
partie « N_BREAK ». Par défaut, cette variable aura pour nom «
N_BREAK »
• Le quadrant (6) est très explicite. Il permet de choisir comment
sont gérer les nouvelles variables issues de l’agrégation. On peut
soit sauvegarder ces variables dans un nouveau fichier, soit les
ajouter à l’ensemble de données actif ou dans un nouvel ensemble
de données.
5.3 Fusion deux ou plusieurs ensembles de données

On distingue deux types de fusion de données. Lorsqu’on a une partition de données en deux ou plusieurs fichiers que
l’on veut assembler dans un seul fichier de données, la fusion est appelée ajout de cas. Il s’agit dans ce cas d’empiler
verticalement les enregistrements (observations). En revanche, lorsque pour deux fichiers de données, des informations
(en termes de variables) sont disponibles sur l’un et pas dans l’autre, on parle d’ajout de variables.
• Ajout de cas
Supposons deux base de données comportant les même caractéristiques ont été saisies séparément dont la base A
comprend les observation de 1 à 500 et la base B est la suite de la base A . A l’issue de la saisie, le statisticien d’enquête
dispose par conséquent de deux fichiers soit « [Link]» et « [Link]» avec des variables similaires.

Pour constituer un fichier de ménage unique avec les deux fichiers, il doit les
superposer ou empiler, c’est-à-dire ajouter les observations du fichier «[Link]» à
la suite de celles du fichier «[Link]» (vice versa). Ce type de superposition de
fichiers s’appelle fusion par ajout de cas. Sa mise en œuvre sous SPSS se fait dans le
menu « Data » puis «Merge Files» et «add cases». Une boîte de dialogue vous
permet alors de sélectionner les fichiers à fusionner. Après s’ouvre une fenêtre
comme celle à coté qui vous permet de faire la fusion.
• Ajout de variables

Considérons deux bases de données, l’une contenant les caractéristiques des chefs de ménages « [Link] » et l’autre
« [Link] » les caractéristiques telles que les membre de ménages. L’on souhaite produire des statistiques du genre «
pourcentage de la population ayant pour femme cheffe de ménages ». Pour ce faire, nous avons besoin d’un fichier
d’analyse comprenant à la fois les chefs de ménages et les informations sur leurs membre.
Ce type de fusion a le même chemin des commandes que celui de l’ajout des cas, à l’exception d’un seul changement au
niveau de l’ajout des variables « add Variables »

Cette opération exige que les observations des deux fichiers :


a) aient une clé de fusion. Il s’agit d’une ou plusieurs variables communes aux deux fichiers à fusionner et qui
permettent d’identifier les observations de part et d’autre,
b) soient préalablement triées suivant la clé de fusion

Vous aimerez peut-être aussi