0% ont trouvé ce document utile (0 vote)
23 vues3 pages

Frns

Le document présente une synthèse des méthodes de statistique descriptive, incluant la description des distributions, la mesure de la tendance centrale et l'analyse des relations entre variables. Il distingue les types de données en qualitatives et quantitatives, et aborde les statistiques univariées et bivariées, ainsi que les indicateurs d'évaluation des modèles numériques. Enfin, il explique les concepts d'erreur, de biais et de corrélation pour mesurer la performance des modèles.

Transféré par

ahmed.delli31
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
23 vues3 pages

Frns

Le document présente une synthèse des méthodes de statistique descriptive, incluant la description des distributions, la mesure de la tendance centrale et l'analyse des relations entre variables. Il distingue les types de données en qualitatives et quantitatives, et aborde les statistiques univariées et bivariées, ainsi que les indicateurs d'évaluation des modèles numériques. Enfin, il explique les concepts d'erreur, de biais et de corrélation pour mesurer la performance des modèles.

Transféré par

ahmed.delli31
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Résumé statistique

Statistique descriptive : regroupe l’ensemble des méthodes permettant de décrire, résumer, représenter un ensemble de
données sans chercher à généraliser au-delà de l’échantillon observé. Elle se divise en 3 grands volets :

Description des distributions. Mesure de la tendance centrale Analyse des relations entre
(moyenne) et de la dispersion. variables.

Types de données :

Variables qualitatives Variables quantitatives

Nominales Ordinales Continues Discrètes


Homme/ Femme Petit/ Grand T°, humidité Nombre d’enfants

Modalités ne peuvent Modalités ont un ordre Prend une infinité de prend un nombre fini ou
pas être ordonnées de naturel. valeurs dans un dénombrable de
manière logique. intervalle. valeurs.

1. Statistique univariée : Description d’une seule variable. Ex : T°.


𝟏
A. Tendance centrale (moyenne) : ̅ = ∑𝒏𝒊=𝟏 𝒙i
𝒙
𝒏
Mediane : Valeur qui partage la description en 2 parties égaux.
Mode : Valeur la plus fréquente.

B. Dispersion :

✓ Etendu : Xmax – Xmin


𝟏
✓ Variance : Var 2 = ∑𝐧𝐢=𝟏(𝐱i - 𝐱̅)2
𝐧
𝟏
✓ Equart-type S (Sx Sy) : √𝑽𝒂𝒓 2 = √ ∑𝐧𝐢=𝟏(𝒙𝒊 − 𝐱̅)2
𝐧
𝑬𝒒𝒖𝒂𝒓𝒕 𝒕𝒚𝒑𝒆
✓ Coefficient de variation : 𝑴𝒐𝒚𝒆𝒏𝒏𝒆

C. Formes de distribution :
Asymétrie (SKEWNESS) : mesure la symétrie (parité) de la distribution.
Aplatissement : Mesure la concentration autour de moyenne.
2. Statistique bivariée : étudier les relations entre 2 variables.
Variables catégorielles : Pour 2 variables catégorielles on utilise :
• Table de contingence : table d’observation des variables catégorielles.
Malade Total
Oui Non
Fumeur Oui 40 60 100
Non 30 70 100
• Test de Chi-deux (𝝌)2 : compare les efforts observés (o) avec les efforts
attendus (E). Total 70 130 200

Si A et B sont indépendants :
𝑻𝒐𝒕𝒂𝒍 𝒅𝒆𝒔 𝒍𝒊𝒈𝒏𝒆𝒔∗𝒕𝒐𝒕𝒂𝒍 𝒅𝒆𝒔 𝒄𝒐𝒍𝒐𝒏𝒏𝒆𝒔
Ei j =
𝑻𝒐𝒕𝒂𝒍 𝒈é𝒏é𝒓𝒂𝒍
100∗70
E1 1 = = 35 Tableau des attendus E :
200
100∗70 Malade
E2 1 = = 35
200
Oui Non
100∗130
E1 2 = = 65 Fumeur Oui 35 65
200
100∗130
E2 2 = = 65 Non 35 65
200

(𝒐−𝑬)𝟐 Cellule o E 𝝌2
𝝌 2= ∑
𝑬
Fumeur
𝜒 2 mesure à quel point les o s’écartent de l’indépendance. Oui 40 35 0.714
Malade
+ 𝝌 2 ↗ → Relation forte entre les variables. Fumeur Oui
60 65 0.385
Malade Non
𝝌 2 = 2.198 → Relation faible. Fumeur Non
30 35 0.704
Malade Oui
Fumeur
Non 70 65 0.385
Malade
• V de CRAMER (force de l’association) : 𝜒 2 ne donne pas
l’intensité de la relation donc on utilise le V de CRAMER.

𝝌𝟐 V Relation
V=√
𝒏 (𝒌−𝟏)
[0 ; 0.1] Presque aucune
k : nombre de ligne/colonne minimum.
[0.1 ; 0.2] Faible
[0.2 ; 0.4] Modérée
𝟏
Covariance : cov (X, Y) = ∑(𝒙𝒊 − 𝒙
̅) (𝒚𝒊 − 𝒚
̅) [0.4 ; 0.6] Forte
𝒏
> 0.6 Très forte
𝐜𝐨𝐯 (𝐗,𝐘)
Coefficient de corrélation de PEARSON : R =
𝑺𝒙 𝑺𝒚

𝟏 𝟏
Sx = √𝐕𝐚𝐫 2 = √ ∑𝐧𝐢=𝟏(𝐱 𝐢 − 𝐱̅)2 Sy = √𝐕𝐚𝐫 2 = √ ∑𝐧𝐢=𝟏(𝐲𝐢 − 𝐲̅)2
𝐧 𝐧

Indicateurs statistiques d’écart :


Généralement on compare :
• L’observation : oi (marégraphe, bouée, satellite).
• Le modèle : Mi (numérique, IA).
Objectif : mesurer : l’erreur, biais, dispersion capacité prédictive globale du modèle.
1/ Erreur :

a. Instantanée : Analyser les erreurs locales dans le temps. ei = Mi - Oi


𝟏
b. Mine absolute error : MAE = ∑|𝑴𝒊 − 𝑶𝒊 |
𝑵

𝟏 𝟏
c. Erreur quadratique Moyenne : MSE = ∑𝑵 𝟐 𝑵
𝒊=𝟏(𝑴𝒊 − 𝑶𝒊 ) RMSE = √ ∑𝒊=𝟏(𝑴𝒊 − 𝑶𝒊 )
𝟐
𝑵 𝑵

d. Erreur normalisée : permet de comparer plusieurs sites/ variables.


𝑹𝑴𝑺𝑬
NRMSE = 𝝈𝒐 = omax - omin
𝝈𝒐
𝝈𝒐 : Ecart-type des observations. omax : observation max omin : observation min.
𝟏
2/ Biais : ∑𝑵
𝒊=𝟏(𝑴𝒊 − 𝑶𝒊 )
𝑵

Biais > 0 : Modèle surestimé. Biais < 0 : Modèle sous-estimé. Biais ≈ 0 : Modèle parfait mais
faut voir les autres indicateurs.

Coefficient de corrélation de PEARSON : mesure le sens de la variation des 2 courbes, l’une par rapport à l’autre (modèle ≈
observation). Bonne corrélation à partir de 0.5.
𝒄𝒐𝒗 (𝑿,𝒀)
R=
𝝈𝒎 − 𝝈𝒐

R = -1 : Anti corrélation. R = 1 : Corrélation parfaite. R = 0 : Aucune corrélation.

Coefficient de détermination : exprime la variance expliquée, très utilisé en régression.

∑(𝑴 −𝑶𝒊 )𝟐
R2 = 1 - ∑(𝑴𝒊 ̅̅̅𝒊 )𝟐
𝒊 −𝑶

Scatter index : mesure la dispersion relative.


𝑹𝑴𝑺𝑬
SI = ̅
𝑶
Ce qu’il faut retenir :
Pour évaluer un modèle numérique/ IA, on utilise les indicateurs statistiques d’écart :

Biais Scatter index RMSE Coefficient de corrélation +/- de détermination

Vous aimerez peut-être aussi