0% ont trouvé ce document utile (0 vote)
6 vues36 pages

Comprendre la Loi Normale en Statistiques

La loi normale, ou distribution gaussienne, est une distribution de probabilité essentielle en statistiques, caractérisée par une courbe en cloche symétrique autour de la moyenne. Elle est utilisée pour modéliser divers phénomènes naturels et humains, et son importance se manifeste dans des domaines tels que l'analyse de données, les tests statistiques et l'apprentissage automatique. Le théorème central limite explique pourquoi la loi normale apparaît fréquemment, même lorsque les données d'origine ne suivent pas cette distribution.

Transféré par

mininoulilou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues36 pages

Comprendre la Loi Normale en Statistiques

La loi normale, ou distribution gaussienne, est une distribution de probabilité essentielle en statistiques, caractérisée par une courbe en cloche symétrique autour de la moyenne. Elle est utilisée pour modéliser divers phénomènes naturels et humains, et son importance se manifeste dans des domaines tels que l'analyse de données, les tests statistiques et l'apprentissage automatique. Le théorème central limite explique pourquoi la loi normale apparaît fréquemment, même lorsque les données d'origine ne suivent pas cette distribution.

Transféré par

mininoulilou
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

EXPOSE DE MATHEMATIQUES

THEME : LA LOI NORMALE

NOMS DES PARTICIPANTS :


PLAN DE LEXPOSE

1-INTRODUCTION ET DEFINITION DE LA LOI


NORMALE

2-CARACTERISTIQUES MATHEMATIQUES DE LA
LOI NORMALE

3-IMPORTANCES ET APPLICATIONS DE LA LOI


NORMALE

4-LA LOI NORMALE ET LE THEOREME CENTRAL


LIMITE
5-LOI NORMALE STANDARD ET
TRANFORMATION

6-TESTS STATISTIQUES BASES SUR LA LOI


NORMALE

7-CAS OU LA LOI NORMALE DE NE SAPPLIQUE


PAS ET LIMITES
Introduction et Définition de la
Loi Normale
Qu’est-ce que la loi normale ?:
La loi normale, également connue sous le nom de
distribution gaussienne, est l'une des
distributions de probabilité les plus importantes
en statistiques. Elle est utilisée pour modéliser
des phénomènes où la majorité des observations
sont regroupées autour d'une valeur moyenne,
avec une probabilité de plus en plus faible à
mesure que l'on s'éloigne de cette moyenne.
Cette distribution forme une courbe
caractéristique en forme de cloche, appelée
courbe de Gauss, qui est symétrique.
Pourquoi est-elle si importante ?:
La loi normale joue un rôle central dans de
nombreux domaines. Elle permet de décrire des
phénomènes naturels, comme la taille des
individus, le QI, ou encore les erreurs de mesure
en physique. C’est pour cela qu’elle est aussi
omniprésente dans les analyses statistiques et
probabilistes. Ce n’est pas seulement une
curiosité mathématique, c’est un outil puissant
pour comprendre et analyser le monde réel.
Origines et histoire :
L’histoire de la loi normale est liée à plusieurs
grands mathématiciens. Abraham de Moivre a
introduit cette distribution en 1733 pour analyser
des jeux de hasard, mais c’est Carl Friedrich
Gauss qui a réellement popularisé cette courbe
au 19ème siècle, lorsqu’il l’a utilisée pour
modéliser des erreurs dans les observations
astronomiques. Depuis lors, la distribution
normale a été adoptée dans de nombreux autres
domaines, et elle est souvent appelée "courbe de
Gauss" en son honneur.
Notations associées
En statistique, la loi normale est représentée par
l’expression N(μ, σ²), où :
 μ (mu) désigne la moyenne, qui est le centre
de la distribution.
 σ (sigma) est l’écart-type, qui indique la
dispersion des valeurs autour de la moyenne.
Lien avec l'informatique :
Dans le domaine informatique, la loi normale est
utilisée pour modéliser une grande variété de
phénomènes. Par exemple, elle intervient dans
l’analyse des erreurs dans les systèmes de
communication, le bruit dans les images, ou
encore la distribution des performances des
algorithmes. En apprentissage automatique, on
suppose souvent que les données suivent une
distribution normale, ce qui simplifie le
traitement des erreurs et permet d’optimiser la
précision des modèles prédictifs.
2. Caractéristiques Mathématiques de
la Loi Normale

Fonction de densité de probabilité (fdp)


La loi normale est définie par une fonction de
densité de probabilité (fdp) qui permet de
modéliser la probabilité d’observer une certaine
valeur pour une variable aléatoire. Cette fonction
est donnée par la formule suivante :
f(x)=1σ2πe−(x−μ)22σ2f(x) = \frac{1}{\sigma \
sqrt{2\pi}} e^{-\frac{(x - \mu)^2}{2\
sigma^2}}f(x)=σ2π1e−2σ2(x−μ)2
Où :
 μ est la moyenne (le centre de la
distribution),
 σ est l’écart-type (qui mesure la dispersion
des données),
 x est la variable aléatoire.
Interprétation simple :
Cette formule montre que la probabilité
d’observer une valeur xxx est d’autant plus
élevée que cette valeur est proche de la moyenne
μμμ. Inversement, plus xxx s’éloigne de μμμ, plus
la probabilité d’observer cette valeur diminue
rapidement. Ce comportement se traduit
graphiquement par une courbe en cloche.

Étude de la fonction de densité


[Link] de la fonction :
o La fonction f(x)f(x)f(x) atteint son
maximum en x=μx = μx=μ, indiquant que
la valeur la plus probable est la moyenne.
o La fonction décroît à mesure que xxx
s’éloigne de μμμ, reflétant la baisse de
probabilité pour les valeurs éloignées de
la moyenne.
[Link] :
o La fonction de densité de probabilité n’a
pas d’asymptotes classiques. Bien que
les valeurs de f(x)f(x)f(x) deviennent très
proches de zéro pour xxx tendant vers
l’infini (à droite et à gauche), la fonction
n’atteint jamais exactement zéro. Cela
signifie qu'il existe toujours une
probabilité non nulle, même pour des
valeurs extrêmes, mais celle-ci est très
faible.
[Link] des dérivées :
o La première dérivée de la fonction de
densité, f′(x)f'(x)f′(x), permet d’analyser
les variations de la fonction : f′(x)=−
(x−μ)σ2f(x)f'(x) = -\frac{(x - \mu)}{\
sigma^2} f(x)f′(x)=−σ2(x−μ)f(x)
o La dérivée est nulle lorsque x=μx = μx=μ,
ce qui indique un maximum local en ce
point.
o Elle est négative pour x>μx > μx>μ et
positive pour x<μx < μx<μ, confirmant
que la fonction est croissante jusqu’à μμμ
et décroissante au-delà. Cela montre la
symétrie parfaite autour de la moyenne.
[Link] et points d’inflexion :
o En traçant la fonction f(x)f(x)f(x), on
obtient une courbe symétrique en forme
de cloche centrée autour de μμμ.
o Les points d’inflexion, où la concavité de
la courbe change, se trouvent aux
abscisses μ−σμ - σμ−σ et μ+σμ + σμ+σ.
Ces points marquent les endroits où la
pente de la courbe diminue plus
lentement, indiquant que la majeure
partie des données se trouve entre ces
points.

Courbe en cloche
La courbe de la loi normale, également appelée
courbe en cloche, présente plusieurs
caractéristiques :
 Symétrie : La courbe est parfaitement
symétrique autour de la moyenne μμμ.
 Concentration des valeurs : Dans une
distribution normale, les valeurs sont
concentrées autour de la moyenne. Les
probabilités de s’éloigner significativement
de la moyenne sont faibles.
 68-95-99,7% : Un principe fondamental de la
loi normale est que :
o Environ 68 % des valeurs se situent à
moins d’un écart-type σσσ de la moyenne
μμμ,
o Environ 95 % des valeurs se trouvent à
moins de deux écarts-types,
o Environ 99,7 % des valeurs se trouvent à
moins de trois écarts-types.

Moments de la distribution
Les moments d’une distribution sont des
paramètres statistiques qui caractérisent sa
forme. Dans le cas de la loi normale, les moments
les plus importants sont les suivants :
 La moyenne (μ) : C’est le premier moment, et
il indique le centre de la distribution, autour
duquel les données sont symétriquement
réparties.
 La variance (σ²) : Le deuxième moment, qui
mesure la dispersion des valeurs autour de la
moyenne. L’écart-type σσσ est la racine
carrée de la variance et détermine la largeur
de la courbe.
 L’asymétrie (skewness) : La loi normale est
parfaitement symétrique, donc son
coefficient d’asymétrie est nul. Dans des
distributions asymétriques, ce coefficient
serait différent de zéro.
 La kurtose (kurtosis) : Ce moment décrit la
forme des queues de la distribution. La loi
normale a une kurtose de 3, ce qui signifie
que ses queues ne sont ni trop épaisses (plus
de valeurs extrêmes) ni trop fines (moins de
valeurs extrêmes).

Objectif de cette section :


 Comprendre les bases mathématiques de la
loi normale en analysant la fonction de
densité de probabilité.
 Explorer les variations de la fonction de
densité pour mieux visualiser la courbe en
cloche.
 Appréhender les moments de la distribution
pour décrire des caractéristiques clés comme
la moyenne, la variance et l’asymétrie.
3. Importance et Applications de la Loi
Normale

La loi normale est fondamentale dans de


nombreuses disciplines grâce à ses propriétés
universelles. Elle permet de modéliser une
grande variété de phénomènes naturels et
humains, et elle joue également un rôle essentiel
en informatique, notamment dans l’analyse des
données, la prise de décision et l’optimisation.

Application en statistiques
La loi normale est souvent utilisée pour
modéliser la distribution des données,
particulièrement lorsqu’un grand nombre de
facteurs indépendants influencent un
phénomène.
Pourquoi la loi normale est-elle si utile ?
[Link]èle des phénomènes naturels : De
nombreuses variables naturelles suivent une
distribution normale, telles que la taille des
individus, les notes d’examen ou les erreurs
de mesure.
[Link] des probabilités : Grâce à la loi
normale, on peut estimer la probabilité
d’observer des valeurs spécifiques dans un
échantillon.
[Link] statistiques : La loi normale sert
souvent d’approximation pour d’autres
distributions, permettant l’utilisation d’outils
statistiques comme les tests d’hypothèses.

Exemples concrets
 Taille des individus : La distribution des
tailles dans une population suit généralement
une loi normale. La plupart des individus ont
une taille proche de la moyenne, tandis que
peu sont extrêmement petits ou
extrêmement grands.
 Intelligence (QI) : Le QI suit une loi normale
avec une moyenne de 100 et un écart-type de
15.
 Erreurs de mesure : Les erreurs dans les
instruments scientifiques sont souvent
normalement distribuées, car elles résultent
de perturbations indépendantes.

Importance en sciences sociales et naturelles


Dans les sciences sociales, la loi normale
modélise des phénomènes comme les
comportements humains ou les performances
académiques. En sciences naturelles, elle
intervient dans la mesure des phénomènes
physiques ou biologiques, comme la pression
sanguine.

Applications dans l’informatique


[Link] de données bruitées dans
l’apprentissage automatique :
o Exemple : Supposons que tu développes
un modèle de classification pour détecter
les spams dans les emails. Les données
peuvent contenir des erreurs (bruit),
comme des emails mal étiquetés. En
modélisant ce bruit avec une loi normale,
tu peux ajuster ton algorithme pour
mieux filtrer ces erreurs, améliorant ainsi
la précision des prédictions.
o Application concrète : L’algorithme
Gaussian Naive Bayes utilise la loi
normale pour modéliser chaque classe
avec une distribution gaussienne,
permettant ainsi une classification
efficace.
2.Réduction de dimension avec l’analyse en
composantes principales (PCA) :
o Exemple : Si tu traites un dataset massif
avec des milliers de variables (comme un
dataset d’images), la PCA permet de
réduire le nombre de variables tout en
conservant l’information principale. Cela
facilite l’entraînement de modèles
d’apprentissage automatique.
o Application concrète : En reconnaissance
faciale, la PCA est utilisée pour réduire le
nombre de pixels à analyser, tout en
maintenant les caractéristiques
distinctives du visage. Cela est
représenté par les eigenfaces (visages
propres).
[Link] gaussien en traitement d’images :
o Exemple : Dans une application de
traitement d’images pour améliorer des
photos floues, tu peux utiliser un filtre
gaussien pour lisser l’image et réduire le
bruit, tout en préservant les bords
importants.
o Application concrète : Des logiciels
comme Photoshop ou GIMP utilisent des
filtres gaussiens pour lisser ou flouter
des images, offrant un contrôle précis sur
la qualité de l’image.
4.A/B testing pour l’optimisation de produits
numériques :
o Exemple : Sur une plateforme web, tu
testes deux versions d’une page d’accueil
pour déterminer laquelle génère un
meilleur taux de conversion. Le test A/B,
basé sur la loi normale, permet de
comparer les performances des deux
versions et de choisir la meilleure.
o Application concrète : Des outils comme
Google Optimize ou Optimizely utilisent
des tests A/B pour optimiser les
interfaces web, et la loi normale aide à
déterminer la significativité statistique
des résultats.
[Link]élisation des performances systèmes :
o Exemple : Lors de la modélisation des
temps de réponse dans les systèmes
informatiques, comme les réseaux, on
utilise souvent la loi normale pour
estimer le comportement sous différentes
charges. Cela permet de prévoir les
goulets d’étranglement et d’optimiser les
ressources.
o Application concrète : Dans la gestion des
infrastructures informatiques, des
modèles prédictifs basés sur la loi
normale sont utilisés pour anticiper les
pics d’utilisation et ajuster les ressources
en conséquence.

Résumé des Applications


 Analyse de données bruitées, réduction de
dimension (PCA) et modélisation statistique
sont des applications courantes de la loi
normale en informatique.
 Simulation, modélisation de la performance
des systèmes et génération de nombres
aléatoires dans les jeux et simulations
utilisent également cette loi.
 En traitement d’image, le filtrage gaussien
améliore la qualité des images en atténuant
le bruit.
 Dans la cybersécurité, elle aide à modéliser
les risques et incidents de sécurité.
4. La Loi Normale et le Théorème
Central Limite

Le théorème central limite (TCL) est l’une des


théories les plus importantes en statistiques, et il
explique pourquoi la loi normale apparaît si
fréquemment, même lorsque les phénomènes
observés ne semblent pas suivre une distribution
normale à l’origine.

Énoncé du théorème central limite


Le théorème central limite stipule que, sous
certaines conditions, la moyenne de plusieurs
variables aléatoires indépendantes et
identiquement distribuées converge vers une
distribution normale, quel que soit le type de
distribution d’origine, à mesure que le nombre
d'échantillons augmente.
 Formellement : Soit X1,X2,…,XnX_1, X_2, \
dots, X_nX1,X2,…,Xn une suite de variables
aléatoires indépendantes et identiquement
distribuées avec une espérance μ\muμ et une
variance σ2\sigma^2σ2. La somme
normalisée de ces variables suit
approximativement une loi normale lorsque
nnn est grand : 1n∑i=1nXi≈N(μ,σ2n).\frac{1}
{n} \sum_{i=1}^{n} X_i \approx \mathcal{N}
(\mu, \frac{\sigma^2}{n}).n1i=1∑nXi
≈N(μ,nσ2).

Implications du théorème
 Universalité : Peu importe la distribution
initiale des variables (ex. : uniformes,
exponentielles, binomiales), la moyenne de
ces variables tend à suivre une loi normale
pour un grand nombre d’observations.
 Simplification statistique : Ce résultat
explique pourquoi tant de phénomènes
observables sont modélisés par la loi
normale, même lorsque les données brutes
ne le sont pas. Par exemple, dans les
processus de mesure en physique, les erreurs
individuelles peuvent ne pas suivre une loi
normale, mais les erreurs moyennes sur de
nombreuses mesures suivent une loi normale.
Exemples pratiques en informatique
[Link] des serveurs et des réseaux :
o Exemple : Lors de la surveillance des
temps de réponse dans un réseau ou un
serveur, on enregistre plusieurs mesures
indépendantes (temps de latence,
requêtes traitées). Même si la
distribution des mesures individuelles
peut être non normale (ex. : pics et
anomalies), la moyenne des temps de
réponse sur une période donnée suit une
distribution normale en raison du TCL.
o Application concrète : Les ingénieurs
réseau utilisent ces informations pour
prédire la performance moyenne des
systèmes sous diverses charges et pour
détecter les anomalies (qui seraient des
déviations de la courbe normale).
[Link]égation de résultats dans les systèmes
distribués :
o Exemple : Dans un système distribué, les
résultats de calculs parallèles sur
plusieurs nœuds peuvent suivre
différentes distributions (en fonction des
performances matérielles ou des données
traitées). Grâce au TCL, la moyenne des
résultats agrégés est souvent modélisée
comme une loi normale.
o Application concrète : Les algorithmes de
calcul distribué, comme MapReduce,
tirent parti de ces propriétés pour
agréger efficacement les données et
prédire la variabilité des résultats.
3.Échantillonnage dans l’analyse de données :
o Exemple : En apprentissage automatique,
on travaille souvent avec des échantillons
de données pour optimiser les modèles.
Même si la distribution des données
originales est complexe, la moyenne des
caractéristiques dans les échantillons
converge vers une distribution normale,
ce qui permet d'utiliser des techniques
statistiques comme les tests
d’hypothèses.
o Application concrète : Lors de
l'entraînement de modèles de régression
ou de classification, les données brutes
peuvent être biaisées ou suivre une
distribution non normale, mais le TCL
garantit que les moyennes ou les sommes
des erreurs résiduelles suivent une loi
normale.
[Link] de l’incertitude dans les
algorithmes de Monte Carlo :
o Exemple : Les algorithmes de Monte
Carlo, utilisés pour estimer des
probabilités ou résoudre des problèmes
d'optimisation, reposent sur de nombreux
échantillons aléatoires. Grâce au TCL, les
résultats moyens de ces échantillons sont
normalement distribués, facilitant
l’estimation des intervalles de confiance.
o Application concrète : Ces méthodes sont
employées dans des domaines comme
l’estimation des risques financiers, les
simulations de systèmes complexes et la
génération de nombres pseudo-aléatoires
pour des modèles stochastiques.

Visualisation et interprétation
 Courbes de distribution : Montre comment,
au fur et à mesure que la taille de
l’échantillon augmente, la forme de la
distribution de la moyenne des échantillons
converge vers une courbe en cloche (loi
normale), même si la distribution d'origine
est différente.
 Applications logicielles : Il existe des outils
pour visualiser ce phénomène, tels que
Python avec NumPy et Matplotlib, ou des
environnements comme R ou Excel, qui
permettent de simuler des distributions et de
vérifier l'effet du TCL.

Exemples d’applications concrètes du TCL dans


l’analyse des données :
 Tests de performance réseau : Lors d’un test
de stress sur un réseau informatique, le
temps de réponse ou les erreurs de paquets
peuvent être enregistrés sur des centaines
d’échantillons. Le TCL permet de modéliser
ces résultats et d’en estimer la moyenne avec
une distribution normale, ce qui facilite la
prédiction des performances sous différentes
charges.
 Systèmes distribués : Les résultats des
calculs dans un système distribué comme
Hadoop ou Spark peuvent être agrégés et
moyennés en s'appuyant sur le TCL, afin
d’évaluer les performances globales ou de
modéliser les anomalies dans les résultats.
5. Loi Normale Standard et
Transformations

Une loi normale qui a une moyenne de 0 et un


écart-type de 1 est appelée loi normale standard.
Cette transformation est souvent utilisée pour
simplifier les calculs et les comparaisons entre
différentes distributions normales.

Définition de la loi normale standard


La loi normale standard, notée N(0,1)\
mathcal{N}(0, 1)N(0,1), est une distribution
normale dont la moyenne (μ\muμ) est 0 et l'écart-
type (σ\sigmaσ) est 1. Sa fonction de densité est
donnée par :
f(x)=12πe−x22.f(x) = \frac{1}{\sqrt{2 \pi}}
e^{-\frac{x^2}{2}}.f(x)=2π1e−2x2.
Elle est centrée autour de 0, et la courbe
présente une symétrie parfaite.

Transformation en loi normale standard


Pour transformer une variable suivant une loi
normale N(μ,σ2)\mathcal{N}(\mu, \
sigma^2)N(μ,σ2) en une variable suivant une loi
normale standard N(0,1)\mathcal{N}(0, 1)N(0,1),
on utilise la transformation suivante :
Z=X−μσ.Z = \frac{X - \mu}{\sigma}.Z=σX−μ.
Où :
 XXX est une observation tirée de la
distribution normale N(μ,σ2)\mathcal{N}(\
mu, \sigma^2)N(μ,σ2),
 ZZZ est la variable transformée suivant la loi
normale standard N(0,1)\mathcal{N}(0,
1)N(0,1),
 μ\muμ et σ\sigmaσ sont la moyenne et
l'écart-type de la distribution d'origine.
Cette transformation permet de rendre
comparables des variables ayant des moyennes
et des écart-types différents, en les
standardisant.

Table de Z : Présentation et usage


La table de Z est un outil qui permet de trouver la
probabilité associée à une valeur donnée de la
variable standardisée ZZZ dans une loi normale
standard. Elle indique la probabilité qu'une
variable aléatoire ZZZ soit inférieure à une
certaine valeur zzz, c'est-à-dire :
P(Z≤z).P(Z \leq z).P(Z≤z).
Utilisation :
 Pour calculer la probabilité d’un événement
dans une distribution normale, on transforme
d'abord la variable en utilisant la formule de
transformation (voir ci-dessus).
 Ensuite, on consulte la table de Z pour
obtenir la probabilité associée à la valeur
ZZZ.
Exemple : Si X∼N(10,2)X \sim \mathcal{N}(10,
2)X∼N(10,2) et que l'on veut savoir quelle est la
probabilité que XXX soit inférieur à 12, on
applique la transformation :
Z=12−102=1.Z = \frac{12 - 10}{2} =
1.Z=212−10=1.
En consultant la table de Z pour Z=1Z = 1Z=1, on
trouve la probabilité associée.

Applications en informatique
[Link] des probabilités dans les systèmes
distribués :
o Lors de la gestion de la charge serveur,
les temps de réponse peuvent suivre une
loi normale, mais avec différentes
moyennes et écart-types selon les
serveurs. En standardisant ces valeurs,
on peut comparer les performances de
manière uniforme.
o Exemple : Dans un système de
recommandation basé sur les données
des utilisateurs, la transformation en loi
normale standard peut être utilisée pour
comparer les évaluations des produits
(ex. : notes de films sur une échelle
différente) sur un même pied d’égalité.
2.Évaluation de la performance des modèles en
machine learning :
o Lors de l'évaluation de la précision d'un
modèle d'apprentissage automatique, on
peut standardiser les erreurs de
prédiction afin de comparer la
performance de modèles ayant des
échelles différentes.
o Exemple : Si on évalue la performance de
modèles de classification sur des
datasets ayant des caractéristiques
numériques dans des plages différentes,
la transformation en loi normale standard
permet d'obtenir des scores normalisés
(tels que le z-score) et d’effectuer des
comparaisons cohérentes.
[Link] statistiques dans l'analyse des données
:
o La transformation en loi normale
standard est fréquemment utilisée dans
les tests d'hypothèses, où l'on compare la
moyenne d'un échantillon à celle d'une
population de référence. Cela permet de
déterminer si les différences observées
sont significatives.
o Exemple : Un test de z-test utilise la
transformation en loi normale standard
pour déterminer si la moyenne d'un
échantillon diffère de manière
significative de la moyenne d'une
population.

Pourquoi cette transformation est-elle utile ?


[Link] des calculs : Lorsque les
données suivent des distributions normales
de moyennes et écart-types différents, la
standardisation permet de les rendre
directement comparables.
[Link] l’application de tests statistiques :
Beaucoup de tests statistiques, comme le z-
test ou les intervalles de confiance,
nécessitent des variables standardisées pour
être appliqués correctement.
[Link] à la prise de décision : En informatique,
des techniques comme le machine learning et
l’analyse de données nécessitent souvent de
transformer les variables en loi normale
standard pour que les modèles soient plus
précis et les décisions plus robustes.
6. Tests Statistiques Basés sur la Loi
Normale

Les tests statistiques basés sur la loi normale


jouent un rôle crucial dans l’analyse de données
et la prise de décision. Ces tests permettent de
vérifier des hypothèses sur une population ou un
échantillon et sont souvent utilisés pour estimer
des paramètres, tester des différences ou évaluer
des relations.
Intervalle de confiance : Estimation d’un
paramètre
Un intervalle de confiance est une estimation
d’un paramètre (comme la moyenne ou la
proportion) dans une population, accompagné
d’un niveau de confiance. Cela signifie que l’on
peut dire avec une certaine probabilité que le
paramètre recherché se trouve dans cet
intervalle.
L'intervalle de confiance est généralement
construit en utilisant la loi normale lorsque la
population suit une loi normale ou lorsque la
taille de l’échantillon est suffisamment grande
(ce qui, grâce au théorème central limite, permet
de supposer que la moyenne des échantillons suit
une loi normale).
La formule de l’intervalle de confiance pour la
moyenne d’une population, lorsqu’on connaît
l'écart-type σ\sigmaσ, est donnée par :
IC=μ±z×σn\text{IC} = \mu \pm z \times \frac{\
sigma}{\sqrt{n}}IC=μ±z×nσ
Où :
 μ\muμ est la moyenne de l'échantillon,
 zzz est la valeur de la statistique ZZZ (tirée
de la table de Z pour un certain niveau de
confiance, par exemple 1,96 pour un
intervalle de confiance à 95 %),
 σ\sigmaσ est l’écart-type de la population,
 nnn est la taille de l’échantillon.
Exemple : Supposons que nous mesurons la
hauteur de 100 personnes et que la moyenne
observée est μ=170\mu = 170μ=170 cm, avec un
écart-type de σ=10\sigma = 10σ=10 cm. Pour un
niveau de confiance de 95 %, nous utilisons la
valeur z=1,96z = 1,96z=1,96 pour obtenir
l’intervalle de confiance :
IC=170±1,96×10100=170±1,96×1=[168,04,171,9
6]IC = 170 \pm 1,96 \times \frac{10}{\sqrt{100}}
= 170 \pm 1,96 \times 1 = [168,04,
171,96]IC=170±1,96×10010
=170±1,96×1=[168,04,171,96]
Cela signifie qu'avec 95 % de confiance, la vraie
moyenne des hauteurs dans la population se
situe entre 168,04 et 171,96 cm.

Test d’hypothèse : Utilisation de la loi normale


Un test d’hypothèse est utilisé pour tester une
affirmation (ou hypothèse) concernant un
paramètre d’une population. La loi normale est
utilisée pour tester si la différence entre une
valeur observée et une valeur théorique est
statistiquement significative.
Le test le plus couramment utilisé pour une
variable suivant une loi normale est le test de Z.
La formule du test de Z est la suivante :
Z=Xˉ−μ0σ/nZ = \frac{\bar{X} - \mu_0}{\sigma / \
sqrt{n}}Z=σ/nXˉ−μ0
Où :
 Xˉ\bar{X}Xˉ est la moyenne de l’échantillon,
 μ0\mu_0μ0 est la valeur hypothétique de la
moyenne,
 σ\sigmaσ est l’écart-type de la population,
 nnn est la taille de l’échantillon.
Si le calcul de ZZZ dépasse une valeur critique
(dépendant du niveau de signification, par
exemple Z=1,96Z = 1,96Z=1,96 pour un test
bilatéral à 95 % de confiance), on rejette
l'hypothèse nulle.
Exemple : Imaginons que l'on veuille tester si la
moyenne des salaires dans une entreprise est de
50 000 € par an. Nous prenons un échantillon de
30 employés et calculons une moyenne
d’échantillon Xˉ=52000\bar{X} = 52
000Xˉ=52000 €, avec un écart-type de σ=5000\
sigma = 5 000σ=5000 €. Le test de Z devient :
Z=52000−500005000/30=2000912,87=2,19.Z = \
frac{52 000 - 50 000}{5 000 / \sqrt{30}} = \
frac{2 000}{912,87} = 2,19.Z=5000/30
52000−50000=912,872000=2,19.
En consultant la table de Z, on trouve que
Z=2,19Z = 2,19Z=2,19 correspond à une
probabilité p-value de 0,0143 (inférieure à 0,05),
donc on rejette l'hypothèse nulle et concluons
que la moyenne des salaires est significativement
différente de 50 000 €.
Applications dans les sondages et études de
marché
Les tests basés sur la loi normale sont largement
utilisés dans les sondages et études de marché,
où l'on doit estimer les caractéristiques d'une
population à partir d'un échantillon. Ces tests
aident à :
 Estimer les moyennes et proportions,
 Tester des hypothèses concernant les
préférences des consommateurs, par
exemple,
 Déterminer si une nouvelle politique de prix a
un impact significatif sur les ventes.
Par exemple, dans une étude de satisfaction
client, un échantillon de 200 clients peut être
interrogé sur leur expérience avec un produit. En
utilisant un test d'hypothèse basé sur la loi
normale, l'entreprise peut déterminer si une
différence de satisfaction entre deux produits est
significative, ou simplement due au hasard.
7. Cas où la Loi Normale Ne s’Applique
Pas et Limites

Bien que la loi normale soit largement utilisée en


statistiques et dans de nombreuses applications
pratiques, elle n’est pas toujours applicable.
Certaines distributions de données ne suivent
pas une forme normale, et il existe des situations
où l’utilisation de la loi normale pourrait donner
des résultats trompeurs. Voici quelques cas où la
loi normale n’est pas adaptée, ainsi que les
méthodes alternatives pour ces situations.

Exemples de distributions non normales


[Link] asymétriques : Dans de
nombreuses situations, les données sont
fortement asymétriques, ce qui signifie que
les valeurs sont concentrées d’un côté de la
distribution. Par exemple :
o Les revenus individuels dans une
population sont souvent fortement
biaisés à droite, car la majorité des gens
gagnent des salaires moyens ou bas, et
quelques personnes ont des revenus très
élevés.
o Les durées de vie d'appareils
électroniques suivent souvent une
distribution biaisée, où la majorité des
appareils fonctionnent un certain temps
avant de tomber en panne.
[Link] avec des queues lourdes :
Certaines distributions, comme la distribution
de Pareto ou la distribution de Cauchy, ont
des queues plus lourdes que la loi normale.
Cela signifie qu'il y a plus de chances
d'observer des valeurs extrêmes que ce que
prédirait une distribution normale. Ces types
de distributions sont courants dans les
systèmes financiers (par exemple, les
variations de prix d’actifs financiers peuvent
être très extrêmes).
[Link] binaires ou discrètes : Les
données binaires (par exemple, succès/échec,
oui/non) ou les données discrètes (par
exemple, nombre d’enfants dans une famille)
ne suivent pas une loi normale. Dans ces cas,
des distributions comme la loi binomiale ou la
loi de Poisson sont plus appropriées.

Tests de normalité
Lorsque l'on traite des données réelles, il est
souvent important de vérifier si la loi normale est
un modèle approprié. Il existe plusieurs tests
statistiques qui permettent de vérifier si un
ensemble de données suit une distribution
normale. Ces tests sont souvent appelés tests de
normalité.
[Link] de Shapiro-Wilk : Ce test est utilisé pour
évaluer si un échantillon provient d’une
distribution normale. Il est particulièrement
efficace pour de petits échantillons. Si la
valeur p obtenue est inférieure à un certain
seuil (généralement 0,05), on rejette
l’hypothèse de normalité.
[Link] de Kolmogorov-Smirnov : Ce test
compare la distribution d’un échantillon de
données à une distribution de référence (par
exemple, la loi normale). Si la distance entre
les deux distributions est suffisamment
grande, on peut conclure que les données ne
suivent pas une loi normale.
[Link] de Jarque-Bera : Ce test se base sur la
kurtosis et l’asymétrie (skewness) d’un
ensemble de données. Si ces deux mesures
s’écartent significativement de celles d’une
distribution normale, on rejette l’hypothèse
de normalité.

Alternatives à la loi normale


Quand la loi normale ne s’applique pas, on utilise
souvent d’autres distributions qui correspondent
mieux aux données observées.
[Link] t de Student : Lorsqu’on a des
échantillons de petite taille et qu’on ne
connaît pas l’écart-type de la population, la
loi t de Student est une alternative plus
appropriée à la loi normale. Elle ressemble à
la loi normale mais possède des queues plus
épaisses, ce qui permet de mieux capturer les
variations dans de petits échantillons.
Exemple : Lorsqu’on réalise un test d’hypothèse
sur un petit échantillon de données et qu’on ne
connaît pas l’écart-type de la population, on
utilise la distribution t au lieu de la loi normale
pour calculer les probabilités.
[Link] binomiale : Pour les données
binaires ou les résultats de type
succès/échec, la loi binomiale est une
alternative courante. Elle est utilisée pour
modéliser le nombre de succès dans une
série d’expériences indépendantes.
Exemple : Si tu veux évaluer la probabilité qu’un
certain nombre de personnes sur 100 préfèrent
un produit donné (succès/échec), tu utiliseras la
distribution binomiale plutôt que la loi normale.
[Link] exponentielle : La loi
exponentielle est utilisée pour modéliser le
temps entre des événements dans un
processus de Poisson, où les événements se
produisent à un taux constant dans le temps.
Exemple : Le temps d’attente entre deux appels
dans un centre d’appels suit souvent une
distribution exponentielle, car les appels arrivent
à un rythme constant mais de manière aléatoire.

Vous aimerez peut-être aussi