ANALYSES DES DONNEES M1 FINANCE
Outils informatiques
Pour l’analyse statistique
– Le Sphinx –
DÉROULEMENT DES SÉANCES
Contenu
Prise en main d’un outil d’analyse afin :
• d’illustrer succinctement les résultats collectés pour une question, dépouillement des données
• d’analyser les réponses à une question, tri à plat
• de déterminer l’existence ou non de liens forts entre les réponses à deux questions, analyse bivariée
• d’identifier ces liens pour l’ensemble des questions. analyse multivariée
Mise en œuvre
Utilisation du logiciel Sphinx sur 4 séances de travaux dirigés
Groupe G1 : Lundi de 9h à 12h les 5, 12 et 19 octobre ainsi que le 2 novembre
Groupe g2 : Mercredi de 13h à 16h les 7, 14 et 21 octobre ainsi que le 4 novembre
Bibliographie relative
• Moscarola J. Enquêtes et analyse de données avec le Sphinx, Vuibert Gestion.
• [Link]
• Lagarde J. Analyse statistique de données, Dunod.
Evaluation
Dernière séance : examen sur machine
ENQUÊTE PAR QUESTIONNAIRE
Enquête par questionnaire
Quatre étapes distinctes :
1. Définition des objectifs et la détermination de l’échantillon
2. Elaboration et diffusion du questionnaire
3. Collecte de données
4. Analyse et diffusion des résultats
Pour ce cours, nous aborderons la saisie des questions/réponses 2-3 (en guise de rappel) mais surtout l’analyse des données 4.
Gestion des enquêtes Vue conceptuelle du questionnaire
ENQUÊTE PAR QUESTIONNAIRE
Edition d’une question
Trois éléments :
1. Le libellé de la question
2. Le type attendu des réponses (contrainte 1)
1. Fermé (unique) : une réponse parmi un lexique
2. Fermé (multiple) : plusieurs réponses à partir d’un lexique
3. Fermé (échelle) : une réponse parmi un lexique ordonné
4. Numérique : un nombre
5. Texte : un texte libre
6. Code : une réponse abrégée (emploi d’un dictionnaire)
7. Data / heure
3. Un identifiant (le nom d’une variable pour l’analyse)
Bibliothèque : des questions prédéfinies Contrôles (contrainte 2) et Modalités (contrainte 3)
• Réponse obligatoire ou facultative,
• Mode d’attribution automatique (ex. date de saisie)
• Masquer des questions en fonction des réponses apportées (ex.
pas de question relative au montant des salaires si aucune activité
professionnelle rémunérée n’est déclarée)
• Proposition de question ouverte en cas de réponse distincte de
celles prédéfinies
• Nombre de caractères, intervalle de valeurs numériques,
nombre de décimales, format de date
• Inventaire attendu des différentes réponses (zone employée
pour les échelles)
LA RÉALISATION D’UN FORMULAIRE
Mise en page d’un questionnaire
Apporter de la lisibilité
Vérification orthographique
Grouper des questions (selon le type de réponse, les modalités)
Déplacer une question / un groupe
Fournir un titre de partie
Quelle saisie (différents médias)
Mise en page (colonne, couleur, police, taille des caractères, taille des emplacements pour les réponses libres
Collecte de données
Saisie
rapide
CAS D’UTILISATION
Manipulation : Saisie d’un questionnaire (40 minutes max)
[Link]
/Gestion_Patrimoine/eval_questionnaire.html
Manipulation : Saisie de réponses au sein du groupe de TD (15 minutes max)
Emploie des 3 interfaces disponibles
ANALYSE DE DONNÉES
Taux de remplissage global et par question faible
Homogénéité des réponses pour une même question
ANALYSE DE DONNÉES
Dépouillement automatique (tableaux croisés) Dépouillement automatique (tableaux de groupes)
Dépouillement automatique (tableaux à plat) Dépouillement automatique (tableaux récapitulatifs)
ANALYSE DE DONNÉES
Dépouillement automatique (tableaux croisés) Dépouillement automatique (tableaux de groupes)
Dépouillement automatique (tableaux à plat & variance) Définition de strate (filtrage des données)
ANALYSE DE DONNÉES
Caractérisation de données (valeur numérique)
Quelques indicateurs particuliers
• Moyenne (arithmétique) : valeur observée si la somme des valeurs était équitablement répartie (chaque observation contribue dans la
même proportion que les autres),
NOTE : lorsqu’on souhaite extrapoler les résultats sur une population plus conséquente
que l’échantillon d’un sondage, les observations peuvent être pondérées.
• Médiane : valeur observée au milieu de des observations si celles-ci sont ordonnées (50% des observations ont une valeur inférieure ou
égale)
NOTE : à l’inverse de la moyenne, cette valeur apparaît réellement parmi les observations.
• Quantiles : série de valeurs permettant de décomposer l’ensemble des observations en des sous-ensembles de même taille
• Mode : valeur la plus fréquemment observée
Caractérisation de l’homogénéité des observations vis-à-vis de la moyenne
• Etendue : écart entre les valeurs extrêmes
• Intervalle interquartile : écart entre le 1er et le 3e quartile (25% et 75% des observations)
• Si moyenne > médiane : des valeurs supérieures à la médiane font croître la moyenne
• Si moyenne < médiane : des valeurs inférieures à la médiane font chuter la moyenne
• Ecart type : écart (au carré) moyen à la moyenne (le carré de l’écart type est appelé variance)
Exemple
Indicateurs Valeur
Moyenne 13,23
Médiane 13
Mode 13
Etendue 18-5
Intervalle interquartile 15-12
Ecart type 2,43
ANALYSE DE DONNÉES
Distribution Normale
Répartition des observations « classique » telles que l’histogramme (le profil)
correspond à une courbe du type :
- Répartition symétrique autour de la moyenne (de la médiane, du mode),
- Majeure partie des observations est située au niveau de la moyenne.
Si un phénomène est caractérisé par une variable suivant une loi normale, la probabilité
d’observer une certaine valeur est directement proportionnelle à l ’écart entre cette valeur
et la moyenne de cette loi.
Valeurs particulières : entre moyenne – écart type et moyenne + écart type nous avons 68% des observations,
entre moyenne – écart type fois 2 et moyenne + écart type fois 2 nous avons 95% des observations,
entre moyenne – écart type fois 2,6 et moyenne + écart type fois 2,6 nous avons 95% des observations.
Souhaitant généralement se ramener à une distribution normale, on vérifie la pertinence de cette hypothèse à partir :
• Du coefficient d’asymétrie : ratio entre l’écart (au cube) moyen à la moyenne et le cube de l’écart type (skewness)
si valeur négative [positive], les éléments inférieurs [supérieur] à la moyenne sont plus fréquents
Hypothèse rejetée si, en valeur absolu, ce ratio est supérieur à 2
• Du coefficient d’aplatissement : ratio entre l’écart (à la puissance 4) moyen à la moyenne et le carré de la variance (kurtosis)
pour une distribution normale, ce coefficient vaut 3
Revient à vérifier si les effectifs sont présents dans les proportions attendues
Hypothèse rejetée si …
Source : [Link]
ANALYSE DE DONNÉES
Tableau de bord (dépouillement automatique)
ANALYSE DE DONNÉES
Arbre de composition Graphe de relation (Datamining)
Décomposition automatique : expliquer la cible MARQUE, Principales relations (seuillage de la significativité)
modalité=citroën TENUE
SECURITE +S DE
ROUTE
-S
+S
FIDELITE Parm i "Oui ; ENTRETIEN
Probablem ent pas"
TS NOTE -S ANCIENNETE
Population totale TS
34 observations (17,0%)
17,0% du noeud précédent S
Renault 36 20,6% TS TS
MARQUE - Citroën = 8 (38,1%)
POLLUTION
Peugeot 21 12,0% TS -S
ESTHETIQUE Parm i "Plutôt MARQUE
Citroën 21 12,0%
non ; Moyennem ent" S TS
Volksw agen 18 10,3%
37 observations (18,5%) CONSOMMATION VITESSE
Fiat 12 6,9% 27,6% du noeud précédent TS
Ford 14 8,0% MARQUE - Citroën = 6 (28,6%)
TS
Toyota 3 1,7%
FIDELITE : Autres CARBURANT = "Sans +S
BMW 9 5,1% plom b" DEPENSE TS TS
134 observations (67,0%)
Mercedes 8 4,6% 67,0% du noeud précédent 10 observations (5,0%)
Opel 10 5,7% ESTHETIQUE : Autres 10,3% du noeud précédent
+ TS ESTHETIQUE
97 observations (48,5%) MARQUE - Citroën = 2 (9,5%)
Volvo 3 1,7%
72,4% du noeud précédent
Autre 20 11,4% CARBURANT : Autres
KILOMETRAGE
87 observations (43,5%)
89,7% du noeud précédent CONFORT + TS ESPACE
CAS D’UTILISATION
Manipulation : analyse des données collectées pour l’enquête « Automobiles » (restant de la séance)
• Visualisez les données à plat
• Visualisez le tableau de bord
• Ajoutez au tableau de bord une nouvelle vue (tableau de bord, construction pas à pas)
en sélectionnant les variables Marque, Ancienneté, Note, Kilométrage, Dépense
le tableau et le graphique
Plusieurs fonctionnalités sont accessibles par différentes techniques. Vous utiliserez principalement le « clic droit » sur un objet du tableau,
et le menu « modifier le format »
• testez les options de l’onglet « graphique » pour l’objet associé à la variable Marque,
• affichez le mode, le nombre de réponses distinctes, l’effectif moyen, la moyenne, la médiane, les valeurs extrêmes pour l’objet associé
à la variable Ancienneté,
• Pour la Note, affichez le taux de réponse, la moyenne, la médiane, les valeurs extrêmes, les percentiles à 25% et 75%, avec 4 classes de
résultats de même amplitude, les effectifs et les pourcentages seront cumulés (onglet tableau) et supprimez le graphique,
• Pour le Kilométrage, sélectionnez 5 classes autour de la moyenne, ainsi qu’un graphique de type courbe,
• Pour Dépense, affichez une analyse en filtrant les résultats aux seuls détenteurs d’une voiture de marque renault (Limiter au profil), un
graphique de type barres,
• Ajoutez une nouvelle analyse sur la Dépense (clic zone gauche), pour tous les échantillons, avec le même type de graphique. Ajustez les
classes de manière personnalisée (onglet calcul) pour que les deux contextes d’analyse puissent être comparés,
• Ajoutez une nouvelle analyse sur la Consommation. Naffichez que le graphique, de type radar en spécifiant le nom des modalités
• Insérez une analyse sur la Pollution.
• Copiez le format utilisé pour la Consommation et l’appliquez à l’analyse de la Pollution,
• Ajoutez une analyse sur l’Esthétique,
• Choisissez le format utilisé pour la Consommation,
• Ajoutez une analyse sur l’Entretien,
• Modifiez la propriété de la vue, en limitant le profil aux voitures à Carburant sans plomb. Observez.
• Retirez le profil. Observez.