Résumé : Cours de Statistiques
Les statistiques sont une branche des mathématiques qui consiste à collecter, organiser,
analyser et interpréter des données pour en tirer des conclusions. Elles sont largement utilisées
dans de nombreux domaines, tels que l'économie, la médecine, les sciences sociales,
l'ingénierie et bien d’autres.
1. Les Types de Données
Données qualitatives (ou catégorielles) : Ce sont des données qui décrivent des
qualités ou des catégories. Par exemple : le genre, la couleur des yeux, le type de
véhicule.
o Nominales : Pas d’ordre entre les catégories (par exemple, couleur des yeux :
bleu, vert, marron).
o Ordinales : Il existe un ordre entre les catégories (par exemple, niveau
d’éducation : primaire, secondaire, universitaire).
Données quantitatives : Ce sont des données qui peuvent être mesurées et exprimées
numériquement. Elles sont divisées en :
o Discrètes : Les valeurs sont finies ou comptables (ex. : nombre d’enfants).
o ** continues** : Les valeurs peuvent être infinies et mesurées avec une
précision infinie (ex. : taille, poids, temps).
2. Organisation des Données
Avant d'analyser les données, il faut les organiser, souvent sous forme de tableaux de
fréquence ou de diagrammes. Les outils principaux sont :
Tableaux de fréquence : Indiquent le nombre de fois que chaque valeur apparaît dans
un ensemble de données.
Diagrammes :
o Histogrammes : Utilisés pour les données continues, représentant la fréquence
des données par des barres.
o Diagrammes en barres : Utilisés pour les données qualitatives.
o Diagrammes circulaires (camemberts) : Utilisés pour représenter des
proportions dans les données qualitatives.
3. Mesures de Tendance Centrale
Ces mesures permettent de résumer un ensemble de données par une valeur centrale.
Moyenne : La moyenne est la somme des valeurs divisée par le nombre de valeurs.
Elle est la plus utilisée pour mesurer la tendance centrale.
Moyenne=∑XiN\text{Moyenne} = \frac{\sum X_i}{N}Moyenne=N∑Xi
Médiane : La médiane est la valeur qui sépare un ensemble de données en deux parts
égales. Si les données sont organisées par ordre croissant, c'est la valeur au milieu.
Mode : Le mode est la valeur qui apparaît le plus fréquemment dans un ensemble de
données. Il peut y avoir plusieurs modes (unimodal, bimodal, multimodal).
4. Mesures de Dispersion
Les mesures de dispersion indiquent à quel point les données sont étendues autour de la
tendance centrale.
Écart-type : Mesure de la dispersion des données autour de la moyenne. Plus l'écart-
type est grand, plus les données sont dispersées.
Eˊcart-type=∑(Xi−μ)2N\text{Écart-type} = \sqrt{\frac{\sum (X_i - \mu)^2}
{N}}Eˊcart-type=N∑(Xi−μ)2
Variance : La variance est l'écart-type au carré et donne une idée de la variabilité des
données.
Plage (ou étendue) : Différence entre la valeur maximale et la valeur minimale dans
un ensemble de données.
5. Probabilité
La probabilité est une mesure de la chance qu'un événement se produise. Elle est comprise
entre 0 (impossible) et 1 (certain). Elle est fondamentale en statistiques, notamment pour les
distributions de probabilités.
Les concepts clés incluent :
Événements indépendants : Deux événements qui n'affectent pas l'un l'autre.
Événements dépendants : Quand la survenue d'un événement influence la probabilité
de l'autre.
Probabilité conditionnelle : Probabilité d’un événement donné un autre événement.
6. Inférence Statistique
L'inférence statistique permet de faire des généralisations à partir d'un échantillon de données
pour une population entière. Elle repose sur deux principaux concepts :
Estimation : Il s'agit d’estimer les paramètres d'une population (comme la moyenne
ou l'écart-type) à partir d'un échantillon. L'estimation peut être ponctuelle (un seul
nombre) ou par intervalle (ex : intervalle de confiance).
Exemple : Un intervalle de confiance à 95% signifie qu'il y a 95% de chances que
l'estimation se situe dans cet intervalle.
Test d'hypothèse : Il s'agit de vérifier si une hypothèse concernant une population est
vraie en utilisant un échantillon de données. Cela inclut :
o Hypothèse nulle (H₀) : Hypothèse de départ, généralement selon laquelle il
n'y a pas d'effet ou de différence.
o Hypothèse alternative (H₁) : Hypothèse selon laquelle il existe un effet ou
une différence.
o Valeur p : La probabilité d'observer un résultat aussi extrême que celui
observé, si l'hypothèse nulle est vraie. Si p < 0.05, on rejette généralement
l'hypothèse nulle.
7. Régressions et Corrélation
Corrélation : La corrélation mesure la relation entre deux variables. Une corrélation
positive signifie que les deux variables augmentent ensemble, tandis qu'une
corrélation négative signifie que l'une augmente quand l'autre diminue.
Le coefficient de corrélation (noté rrr) peut varier entre -1 et +1.
Régression : La régression est utilisée pour prédire la valeur d'une variable
dépendante en fonction d'une ou plusieurs variables indépendantes. La régression
linéaire est la plus courante et modélise une relation linéaire entre les variables.
y=a+bxy = a + bxy=a+bx
Où :
o yyy : variable dépendante
o xxx : variable indépendante
o aaa : ordonnée à l'origine
o bbb : pente de la droite
8. Applications des Statistiques
Les statistiques sont utilisées dans une variété de domaines pour :
Analyse de données économiques : Calcul des indices de croissance, études des
tendances économiques, etc.
Médecine : Études cliniques, analyse de l'efficacité des traitements, etc.
Éducation : Analyse des résultats des tests et évaluations des élèves.
Industrie : Contrôle qualité, études de marché, etc.
Conclusion
Les statistiques sont un outil essentiel pour analyser et interpréter des données dans de
nombreux domaines. Elles permettent de prendre des décisions éclairées basées sur des faits
et des données quantitatives, plutôt que sur des suppositions ou des intuitions.
Ce résumé te convient-il pour un aperçu général du cours ? Si tu souhaites des détails
supplémentaires sur certains concepts ou des exemples plus spécifiques, fais-le moi savoir !