Introduction aux Statistiques et Données
Introduction aux Statistiques et Données
INTRODUCTION
Il est extrêmement difficile de définir la statistique et, à ce sujet, le plus difficile dans un
Peu de mots. Aucune définition des statistiques n'est peut-être exempte de controverse. Avant qu'une tentative ne soit faite
fait pour définir le sujet, il est nécessaire de souligner que le terme Statistiques est utilisé dans
trois sens distincts :
1) Par statistiques, nous entendons souvent des données numériques relatives à tout domaine d'enquête.
par exemple, "statistiques de la production agricole", "statistiques des prix"
statistiques des naissances et des décès, et ainsi de suite.
2) Par statistiques, nous entendons la méthode scientifique par laquelle nous collectons, éclaircissons
(expliquer), analyser et interpréter des données numériques.
Bien que le terme soit utilisé dans trois sens différents, il est généralement clair d'après le
le contexte de ce que cela signifie dans une instance particulière et il y a à peine de la place pour
confusion dans la pratique.
Ces derniers temps, cela a également été défini comme la théorie de la prise de décision dans le
visage de l'incertitude.
STATISTIQUES
Types de statistiques
L'étude des statistiques est généralement divisée en deux catégories : les statistiques descriptives et
statistiques inférentielles.
Statistiques inférentielles :Les méthodes utilisées pour estimer une propriété d'une population sur le
La base d'un échantillon est appelée statistiques inférentielles.
La plupart des méthodes statistiques ont été initialement développées pour étudier des problèmes dans
biologie et agriculture. Ce fait même indiquerait que les méthodes statistiques ont
applications étendues dans ces sciences.
En fait, il est impossible de visualiser la recherche empirique dans la plupart des sciences sans
l'aide des méthodes statistiques.
Comme toute autre méthode scientifique, les statistiques peuvent être mal utilisées au travers de
ignorance, idée préconçue ou manipulation délibérée des données. En comparant
certaines variétés ou traitements, il est important de s'assurer que les unités expérimentales
recevoir différentes variétés ou traitements sont équivalents à tous égards. Le manque de
La précaution à cet égard a souvent donné lieu à des résultats trompeurs. C'est de la plus haute importance.
importance d'assurer que les données primaires sont exemptes d'erreurs ou que l'échantillon étudié est
aléatoire comme les statisticiens le supposent si souvent. Si cette condition de base n'est pas remplie, aucun
la quantité d'analyse statistique peut éclairer le phénomène étudié. Statistique
les méthodes ne peuvent en aucun cas révéler quoi que ce soit qui n'est déjà implicite dans les données. A
Une réponse "significative" ne prouve pas qu'une hypothèse soit vraie ou fausse ; c'est tout à fait
possible qu'un événement peu probable se soit produit. Encore une fois, certaines différences peuvent être
significatif s'il est basé sur des nombres suffisamment grands. En conclusion, nous pourrions dire que
Les statistiques sont un outil très puissant mais plutôt délicat et doivent être manipulées avec précaution.
et prudence. Des conseils d'experts peuvent être nécessaires à différentes étapes d'une enquête statistique.
Population et Échantillon
La population et l'échantillon sont deux termes très importants en statistique. Il est nécessaire
définir ces termes et aussi, faire la distinction entre eux.
Les matières premières des statistiques consistent en des chiffres ou des observations.
généralement obtenue par un processus de comptage ou de mesure est désignée collectivement
en tant que données.
Sources de données
Données primaires : Nous pouvons collecter des données nous-mêmes, alors les données sont appelées primaires.
données. Par exemple, les données collectées à partir de nos propres parcelles expérimentales ou de notre propre enquête ou
Une enquête personnelle ou une propre enquête est appelée les données primaires.
Données secondaires : Nous pouvons également obtenir des données à partir de sources disponibles et ce type de
Les données sont appelées données secondaires. Les principales sources de données secondaires dans notre pays sont,
BBS, ICDDRB, BRAC, NIPORT (Institut National de Recherche et de Formation sur la Population)),
d'autres ONG et la plus grande source secondaire est Internet.
Variable :
Une variable est une quantité mesurable qui varie d'un à l'autre. Pour
exemple
etc.
Variable aléatoire L
: a variable associée à la probabilité est appelée la variable aléatoire.
variable.
Types de variables :
Variables qualitatives : Dans certaines enquêtes statistiques, nous ne nous intéressons qu'à
la présence ou l'absence de certaines caractéristiques dans un ensemble d'objets ou d'individus. Dans ce cas
dans cette situation, nous ne comptons que combien d'individus possèdent ou ne possèdent pas la caractéristique.
C'est-à-dire, lorsque les variables sont mesurées sur la base de leur caractère caractéristique.
appelée la variable qualitative et ce type de données est appelé données qualitatives. Le
La caractéristique utilisée pour classer un individu dans différentes catégories s'appelle un
attribut. Parmi les exemples de variables qualitatives, on trouve le sexe, l'affiliation religieuse, l'état civil.
statut, lieu de naissance, marque de PC, etc.
Variable quantitative : Une variable est une quantité mesurable, qui peut varier dans ses
Domaine. Par exemple, le rendement d'une culture est une variable, car c'est une mesure quantifiable.
dans son domaine. Conceptuellement, le domaine d'une variable est défini par toutes les possibilités
mesures qui peuvent être prises par la variable. Ainsi, nous pouvons dire que toutes les valeurs possibles
d'une variable constituera son domaine. Pour la variable, rendement d'une culture, si le plus bas
la valeur dans les mesures est considérée comme 0 et la valeur la plus élevée est 30, alors le
le domaine de rendement de cette culture est évidemment (0-30).
Variable quantitative :
Variable discrète : Lorsqu'une variable ne peut assumer que des valeurs isolées, on l'appelle une
variable discrète. Par exemple, si le nombre d'étudiants dans différents départements est
la variable d'intérêt, il est évident qu'elle ne peut pas prendre de valeurs fractionnaires et
d'où il s'agit d'une variable discrète. Enfants dans une famille, Nombre de fruits sur un arbre,
Le nombre de téléphones portables dans une famille, etc. sont des exemples de variables discrètes.
Variable continue : Une variable est dite continue si elle peut théoriquement
supposez n'importe quelle valeur dans une plage ou des plages données. De tels variables, par exemple,
hauteur des élèves, revenu mensuel d'une famille, température de l'air, etc.
Level of Measurement
Les données statistiques, qu'elles soient qualitatives ou quantitatives, sont générées par quelques
processus de mesure ou d'observation. La mesure est essentiellement la tâche d'assigner
nombres aux observations selon certaines règles. La manière dont les nombres sont
attribué aux observations détermine l'échelle de mesure utilisée. Il y a quatre
levels of measurement. These are (a) Nominal level (b) Ordinal level (c) Interval level (d)
Niveau de ratio
Niveau nominal :
Toutes les mesures qualitatives sont nominales, peu importe si les catégories
sont désignés par des noms (rouge, blanc, masculin) ou des numéraux (20 juin, numéro de chambre 10, compte)
non, numéro d'identification, etc. Dans le niveau de mesure nominal, les catégories se distinguent les unes des autres
uniquement dans les noms. Ce que l'on doit s'assurer à ce niveau de mesure, c'est que les catégories
doit être homogène, mutuellement exclusif et sans hypothèses sur l'ordre
relations entre les catégories. Quelques exemples sont la couleur des yeux, la religion, le lieu de
résidence etc.
Pour le niveau nominal de mesure, les observations d'une variable qualitative peuvent
seulement être classés et comptés. Il n'y a pas d'ordre particulier pour les étiquettes.
Niveau ordinal :
Lorsque les catégories sont dans une relation d'ordre, nous atteignons ce que nous
appelé le niveau ordinal de mesure. Les catégories sont distinctes, mutuellement
exclusif et exhaustif également. Exemple de données ordinales : les diplômes académiques (MA.
BA, etc.), Statut socio-économique (élevé, moyen, faible), Classement au travail, etc.
Le niveau de données supérieur suivant est le niveau ordinal. Le tableau 1-2 répertorie les étudiants
évaluations du Professeur James Brunner dans un cours d'Introduction à la Finance. Chaque étudiant dans
la classe a répondu à la question « Globalement, comment avez-vous évalué l'instructeur dans ce cours ? »
La variable d'évaluation illustre l'utilisation de l'échelle de mesure ordinale. Un
la classification est "supérieure" ou "meilleure" que la suivante. C'est-à-dire, "Supérieur" est meilleur que
"Bon," "Bon" est mieux que "Moyen," et ainsi de suite : Cependant, nous ne sommes pas en mesure de
distinguer l'ampleur des différences entre les groupes. Quelle est la différence entre
"Supérieur" et "Bon" c'est la même chose que la différence entre "Pauvre" et "Inférieur" ? Nous
Je ne peux pas dire. Si nous substituons un 5 pour "Supérieur" et un 4 pour "Bon," nous pouvons conclure que
la note « Supérieur » est meilleure que la note « Bon », mais nous ne pouvons pas ajouter un classement
de "Supérieur" et d'un classement de "Bon", le résultat étant significatif. De plus, nous
on ne peut pas conclure qu'une note de "Bon" (note de 4) est nécessairement deux fois plus élevée qu'un
"Pauvre" (la note est de 2). Nous ne pouvons que conclure qu'une note de "Bon" est meilleure qu'une note
de "Pauvre." Nous ne pouvons pas conclure à quel point la note est meilleure.
Évaluation Fréquence
Supérieur 6
Bon 28
Moyenne 25
Pauvre 12
Inférieur 3
Niveau d'intervalle
Le niveau d'intervalle de mesure inclut toutes les propriétés du nominal et
niveau ordinal mais une propriété supplémentaire que la différence (intervalle) entre les valeurs est
connu et de taille constante. Ici, un point zéro arbitraire est supposé. Quelques exemples sont
Température
Un autre exemple de l'échelle d'intervalle de mesure est la taille des robes pour femmes.
Ci-dessous se trouvent des informations sur plusieurs dimensions d'une robe pour femme standard aux États-Unis.
Pourquoi l'échelle de "taille" est-elle une mesure d'intervalle ? Observez comment la taille change de 2.
unités (par exemple, de la taille 10 à la taille 12 ou de la taille 24 à la taille 26) chacune des mesures
augmente de 2 pouces. Pour le dire autrement, les intervalles sont les mêmes.
Niveau de ratio :
En pratique, toutes les données quantitatives relèvent du niveau de mesure rasio. Il a
toutes les propriétés d'ordre et de distance de niveau d'intervalle. De plus, un 'point zéro' peut
soit désigné de manière significative et ainsi le rapport entre deux nombres est également significatif.
Des exemples incluent la taille, le poids, la graisse consommée, les salaires, etc.
Pratiquement toutes les données quantitatives sont enregistrées au niveau de mesure de rapport. Le
Le niveau de ratio est le niveau de mesure le plus "élevé". Il possède toutes les caractéristiques de la
niveau d'intervalle, mais en plus, le point 0 a une signification et le ratio entre deux
les nombres ont un sens. Des exemples de l'échelle de mesure à rapport incluent les salaires,
unités de production, poids, variations des prix des actions, distance entre les bureaux de branche,
et de taille. L'argent est une bonne illustration. Si vous avez zéro dollar, alors vous n'avez pas de
argent. Le poids est un autre exemple. Si l'aiguille de la balance d'une balance correctement calibrée
L'appareil est à 0, alors il y a une absence complète de poids. Le rapport de deux nombres est
aussi significatif. Si Jim gagne 40 000 $ par an à vendre des assurances et que Rob gagne 80 000 $
par an en vendant des voitures, alors Rob gagne deux fois plus que Jim.
Types de variables
Qualitatif Quantitatif
Paramètre et statistique
Statistique : Toute fonction des valeurs d'échantillon qui est une estimation du paramètre et
une valeur connue est appelée une statistique. Une statistique est également appelée un estimateur quand elle
est utilisé pour estimer un paramètre. D'un point de vue pratique, si nous pouvions obtenir le
valeur numérique d'un estimateur, alors cette valeur numérique est appelée une estimation de la
paramètre.
Une population peut être étudiée selon l'une de deux approches : effectuer un recensement ou sélectionner un échantillon.
Il est important de noter que, qu'un recensement ou un échantillon soit utilisé, les deux fournissent des informations qui peuvent être
utilisé pour tirer des conclusions sur l'ensemble de la population.
Acensus est une étude de chaqueunité, tout le monde ou tout, dans une population. Il est connu sous le nom de
une énumération complète, ce qui signifie un compte complet.
Un échantillon est un sous-ensemble d'unités dans une population, sélectionné pour représenter toutes les unités d'une population.
C'est une énumération partielle car c'est un comptage d'une partie de la population.
Les informations des unités échantillonnées sont utilisées pourestimerles caractéristiques de l'ensemble de la population de
intérêt.
Une fois qu'une population a été identifiée, il faut prendre une décision quant à savoir si
prendre un recensement ou sélectionner un échantillon sera l'option la plus adaptée. Il
Il y a des avantages et des inconvénients à utiliser un recensement ou un échantillon pour étudier une population.
- fournit une mesure réelle de la population (non - il peut être difficile d'énumérer toutes les unités de la
erreur d'échantillonnage population dans le temps disponible
- des données de référence peuvent être obtenues pour l'avenir - des coûts plus élevés, tant en termes de personnel que monétaires, que
études pour un échantillon
- informations détaillées sur les petits sous-groupes - prend généralement plus de temps à collecter, traiter et
au sein de la population, il est plus probable que... données de sortie que d'un échantillon
disponible
Avantages d'un ÉCHANTILLON Inconvénients d'un ÉCHANTILLON
- les coûts seraient généralement inférieurs à ceux d'un - les données peuvent ne pas être représentatives du total
recensement population, notamment lorsque la taille de l'échantillon est
- les résultats peuvent être disponibles dans un délai plus court petit
- si de bonnes techniques d'échantillonnage sont utilisées, le - souvent pas adapté pour produire des données de référence,
les résultats peuvent être très représentatifs de l'actualité les données sont collectées à partir d'un sous-ensemble d'unités et
population inférences faites sur l'ensemble de la population, le
les données sont sujettes à une erreur d'échantillonnage