0% ont trouvé ce document utile (0 vote)
34 vues14 pages

Analyse de données avec Sphinx

Le document présente un cours sur l'analyse des données en finance, utilisant le logiciel Sphinx pour traiter des enquêtes par questionnaire. Il décrit les étapes de l'enquête, la création de questionnaires, et les méthodes d'analyse des données, y compris des techniques statistiques comme l'analyse bivariée et multivariée. Enfin, il aborde des concepts statistiques tels que la moyenne, la médiane, et la distribution normale, ainsi que des cas d'utilisation pour manipuler et visualiser les données collectées.

Transféré par

tohainarlm
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
34 vues14 pages

Analyse de données avec Sphinx

Le document présente un cours sur l'analyse des données en finance, utilisant le logiciel Sphinx pour traiter des enquêtes par questionnaire. Il décrit les étapes de l'enquête, la création de questionnaires, et les méthodes d'analyse des données, y compris des techniques statistiques comme l'analyse bivariée et multivariée. Enfin, il aborde des concepts statistiques tels que la moyenne, la médiane, et la distribution normale, ainsi que des cas d'utilisation pour manipuler et visualiser les données collectées.

Transféré par

tohainarlm
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

ANALYSES DES DONNEES M1 FINANCE

Outils informatiques
Pour l’analyse statistique
– Le Sphinx –
DÉROULEMENT DES SÉANCES
Contenu

Prise en main d’un outil d’analyse afin :


• d’illustrer succinctement les résultats collectés pour une question, dépouillement des données
• d’analyser les réponses à une question, tri à plat
• de déterminer l’existence ou non de liens forts entre les réponses à deux questions, analyse bivariée
• d’identifier ces liens pour l’ensemble des questions. analyse multivariée

Mise en œuvre

Utilisation du logiciel Sphinx sur 4 séances de travaux dirigés


Groupe G1 : Lundi de 9h à 12h les 5, 12 et 19 octobre ainsi que le 2 novembre
Groupe g2 : Mercredi de 13h à 16h les 7, 14 et 21 octobre ainsi que le 4 novembre

Bibliographie relative
• Moscarola J. Enquêtes et analyse de données avec le Sphinx, Vuibert Gestion.
• [Link]
• Lagarde J. Analyse statistique de données, Dunod.
Evaluation

Dernière séance : examen sur machine


ENQUÊTE PAR QUESTIONNAIRE
Enquête par questionnaire

Quatre étapes distinctes :

1. Définition des objectifs et la détermination de l’échantillon


2. Elaboration et diffusion du questionnaire
3. Collecte de données
4. Analyse et diffusion des résultats

Pour ce cours, nous aborderons la saisie des questions/réponses 2-3 (en guise de rappel) mais surtout l’analyse des données 4.

Gestion des enquêtes Vue conceptuelle du questionnaire


ENQUÊTE PAR QUESTIONNAIRE
Edition d’une question

Trois éléments :
1. Le libellé de la question
2. Le type attendu des réponses (contrainte 1)
1. Fermé (unique) : une réponse parmi un lexique
2. Fermé (multiple) : plusieurs réponses à partir d’un lexique
3. Fermé (échelle) : une réponse parmi un lexique ordonné
4. Numérique : un nombre
5. Texte : un texte libre
6. Code : une réponse abrégée (emploi d’un dictionnaire)
7. Data / heure
3. Un identifiant (le nom d’une variable pour l’analyse)

Bibliothèque : des questions prédéfinies Contrôles (contrainte 2) et Modalités (contrainte 3)

• Réponse obligatoire ou facultative,


• Mode d’attribution automatique (ex. date de saisie)
• Masquer des questions en fonction des réponses apportées (ex.
pas de question relative au montant des salaires si aucune activité
professionnelle rémunérée n’est déclarée)
• Proposition de question ouverte en cas de réponse distincte de
celles prédéfinies
• Nombre de caractères, intervalle de valeurs numériques,
nombre de décimales, format de date

• Inventaire attendu des différentes réponses (zone employée


pour les échelles)
LA RÉALISATION D’UN FORMULAIRE
Mise en page d’un questionnaire

Apporter de la lisibilité
Vérification orthographique
Grouper des questions (selon le type de réponse, les modalités)
Déplacer une question / un groupe
Fournir un titre de partie
Quelle saisie (différents médias)
Mise en page (colonne, couleur, police, taille des caractères, taille des emplacements pour les réponses libres
Collecte de données

Saisie
rapide
CAS D’UTILISATION
Manipulation : Saisie d’un questionnaire (40 minutes max)

[Link]
/Gestion_Patrimoine/eval_questionnaire.html

Manipulation : Saisie de réponses au sein du groupe de TD (15 minutes max)

Emploie des 3 interfaces disponibles


ANALYSE DE DONNÉES
Taux de remplissage global et par question faible
Homogénéité des réponses pour une même question
ANALYSE DE DONNÉES
Dépouillement automatique (tableaux croisés) Dépouillement automatique (tableaux de groupes)

Dépouillement automatique (tableaux à plat) Dépouillement automatique (tableaux récapitulatifs)


ANALYSE DE DONNÉES
Dépouillement automatique (tableaux croisés) Dépouillement automatique (tableaux de groupes)

Dépouillement automatique (tableaux à plat & variance) Définition de strate (filtrage des données)
ANALYSE DE DONNÉES
Caractérisation de données (valeur numérique)

Quelques indicateurs particuliers


• Moyenne (arithmétique) : valeur observée si la somme des valeurs était équitablement répartie (chaque observation contribue dans la
même proportion que les autres),
NOTE : lorsqu’on souhaite extrapoler les résultats sur une population plus conséquente
que l’échantillon d’un sondage, les observations peuvent être pondérées.
• Médiane : valeur observée au milieu de des observations si celles-ci sont ordonnées (50% des observations ont une valeur inférieure ou
égale)
NOTE : à l’inverse de la moyenne, cette valeur apparaît réellement parmi les observations.
• Quantiles : série de valeurs permettant de décomposer l’ensemble des observations en des sous-ensembles de même taille
• Mode : valeur la plus fréquemment observée

Caractérisation de l’homogénéité des observations vis-à-vis de la moyenne


• Etendue : écart entre les valeurs extrêmes
• Intervalle interquartile : écart entre le 1er et le 3e quartile (25% et 75% des observations)
• Si moyenne > médiane : des valeurs supérieures à la médiane font croître la moyenne
• Si moyenne < médiane : des valeurs inférieures à la médiane font chuter la moyenne
• Ecart type : écart (au carré) moyen à la moyenne (le carré de l’écart type est appelé variance)

Exemple
Indicateurs Valeur

Moyenne 13,23

Médiane 13

Mode 13

Etendue 18-5

Intervalle interquartile 15-12

Ecart type 2,43


ANALYSE DE DONNÉES
Distribution Normale

Répartition des observations « classique » telles que l’histogramme (le profil)


correspond à une courbe du type :
- Répartition symétrique autour de la moyenne (de la médiane, du mode),
- Majeure partie des observations est située au niveau de la moyenne.

Si un phénomène est caractérisé par une variable suivant une loi normale, la probabilité
d’observer une certaine valeur est directement proportionnelle à l ’écart entre cette valeur
et la moyenne de cette loi.
Valeurs particulières : entre moyenne – écart type et moyenne + écart type nous avons 68% des observations,
entre moyenne – écart type fois 2 et moyenne + écart type fois 2 nous avons 95% des observations,
entre moyenne – écart type fois 2,6 et moyenne + écart type fois 2,6 nous avons 95% des observations.

Souhaitant généralement se ramener à une distribution normale, on vérifie la pertinence de cette hypothèse à partir :
• Du coefficient d’asymétrie : ratio entre l’écart (au cube) moyen à la moyenne et le cube de l’écart type (skewness)
si valeur négative [positive], les éléments inférieurs [supérieur] à la moyenne sont plus fréquents

Hypothèse rejetée si, en valeur absolu, ce ratio est supérieur à 2

• Du coefficient d’aplatissement : ratio entre l’écart (à la puissance 4) moyen à la moyenne et le carré de la variance (kurtosis)
pour une distribution normale, ce coefficient vaut 3

Revient à vérifier si les effectifs sont présents dans les proportions attendues

Hypothèse rejetée si …

Source : [Link]
ANALYSE DE DONNÉES
Tableau de bord (dépouillement automatique)
ANALYSE DE DONNÉES
Arbre de composition Graphe de relation (Datamining)

Décomposition automatique : expliquer la cible MARQUE, Principales relations (seuillage de la significativité)


modalité=citroën TENUE
SECURITE +S DE
ROUTE
-S
+S
FIDELITE Parm i "Oui ; ENTRETIEN
Probablem ent pas"
TS NOTE -S ANCIENNETE
Population totale TS
34 observations (17,0%)
17,0% du noeud précédent S
Renault 36 20,6% TS TS
MARQUE - Citroën = 8 (38,1%)
POLLUTION
Peugeot 21 12,0% TS -S
ESTHETIQUE Parm i "Plutôt MARQUE
Citroën 21 12,0%
non ; Moyennem ent" S TS
Volksw agen 18 10,3%
37 observations (18,5%) CONSOMMATION VITESSE
Fiat 12 6,9% 27,6% du noeud précédent TS
Ford 14 8,0% MARQUE - Citroën = 6 (28,6%)
TS
Toyota 3 1,7%
FIDELITE : Autres CARBURANT = "Sans +S
BMW 9 5,1% plom b" DEPENSE TS TS
134 observations (67,0%)
Mercedes 8 4,6% 67,0% du noeud précédent 10 observations (5,0%)
Opel 10 5,7% ESTHETIQUE : Autres 10,3% du noeud précédent
+ TS ESTHETIQUE
97 observations (48,5%) MARQUE - Citroën = 2 (9,5%)
Volvo 3 1,7%
72,4% du noeud précédent
Autre 20 11,4% CARBURANT : Autres
KILOMETRAGE
87 observations (43,5%)
89,7% du noeud précédent CONFORT + TS ESPACE
CAS D’UTILISATION
Manipulation : analyse des données collectées pour l’enquête « Automobiles » (restant de la séance)
• Visualisez les données à plat
• Visualisez le tableau de bord

• Ajoutez au tableau de bord une nouvelle vue (tableau de bord, construction pas à pas)
en sélectionnant les variables Marque, Ancienneté, Note, Kilométrage, Dépense
le tableau et le graphique
Plusieurs fonctionnalités sont accessibles par différentes techniques. Vous utiliserez principalement le « clic droit » sur un objet du tableau,
et le menu « modifier le format »

• testez les options de l’onglet « graphique » pour l’objet associé à la variable Marque,
• affichez le mode, le nombre de réponses distinctes, l’effectif moyen, la moyenne, la médiane, les valeurs extrêmes pour l’objet associé
à la variable Ancienneté,
• Pour la Note, affichez le taux de réponse, la moyenne, la médiane, les valeurs extrêmes, les percentiles à 25% et 75%, avec 4 classes de
résultats de même amplitude, les effectifs et les pourcentages seront cumulés (onglet tableau) et supprimez le graphique,
• Pour le Kilométrage, sélectionnez 5 classes autour de la moyenne, ainsi qu’un graphique de type courbe,

• Pour Dépense, affichez une analyse en filtrant les résultats aux seuls détenteurs d’une voiture de marque renault (Limiter au profil), un
graphique de type barres,

• Ajoutez une nouvelle analyse sur la Dépense (clic zone gauche), pour tous les échantillons, avec le même type de graphique. Ajustez les
classes de manière personnalisée (onglet calcul) pour que les deux contextes d’analyse puissent être comparés,
• Ajoutez une nouvelle analyse sur la Consommation. Naffichez que le graphique, de type radar en spécifiant le nom des modalités
• Insérez une analyse sur la Pollution.

• Copiez le format utilisé pour la Consommation et l’appliquez à l’analyse de la Pollution,


• Ajoutez une analyse sur l’Esthétique,
• Choisissez le format utilisé pour la Consommation,
• Ajoutez une analyse sur l’Entretien,

• Modifiez la propriété de la vue, en limitant le profil aux voitures à Carburant sans plomb. Observez.
• Retirez le profil. Observez.

Vous aimerez peut-être aussi