ADEB 1ère Année Master Biochimie 2020-2021 Dr.
Djemaa DRIS
Introduction
La statistique a envahi aujourd'hui tous les champs scientifiques. Les statistiques, dans le sens
populaire du terme, traitent des populations (dans des études démographiques), ce qui est très difficile dans
le cas de la Bio-statistique. La statistique constitue, en science, l’outil permettant de répondre à de
nombreuses questions qui se posent en permanence.
- Le traitement A est-il plus efficace que le traitement B ?
- Quelle sont les valeurs normales de grandeurs biologiques (taille, poids, glycémie, ...) ?
- Les modifications de poids d’un individu sont-elles liées aux modifications de cholestérolémie ?
- Un test de dépistage est-il fiable ?
Leur objectif consiste à caractériser une population à partir d'une image plus ou moins floue
constituée à l'aide d'un échantillon issu de cette population. On peut alors chercher à extrapoler une
information obtenue à partir de l'échantillon.
On trouve des applications de la statistique dans tous les domaines : industrie, environnement,
médecine, finance, marketing, sport, ... etc.
Le programme se compose de trois parties.
1) Généralités et notions de base ;
2) Statistiques descriptives (à une et à deux dimensions) ;
3) Statistiques inférentielles (tests de comparaison : tests paramétriques et non paramétriques).
Objectifs de cours
Connaître le vocabulaire particulier de la biostatistique ;
Comprendre les principes du traitement des données ;
Le choix de la méthode statistique opportune à chaque situation particulière ;
La réalisation des calculs et des tests de base pour une et deux variables.
La réalisation de ces calculs simplement et efficacement à l’aide de l’utilisation des logiciels
statistiques (Excel, R, XLSTAT, SAS, ZAR, SPSS, …).
1
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Chapitre I : Généralités et notions de base
La Bio-statistique
Définition
Ensemble de méthodes à partir desquelles on recueille, organise, résume, présente et analyse des
données afin d’en tirer des conclusions et de prendre des décisions avec prudence.
Notions importantes
Parmi les notions importantes nous avons :
La variabilité
Disposition à varié, qualité de ce qui est variable.
La variabilité en biologie est la somme d’une variabilité métrologique et d’une variabilité proprement
biologique.
Var. intra-individuelle
Variabilité
biologique
Variabilité Var. interindividuelle
totale
Var. expérimentale
Variabilité
métrologique
Var. liée à l’appareil de mesure
Population : Ensemble des individus objets de l'étude, ou Ensembles des éléments ou d’individus de même
nature, visés par une problématique scientifique.
Elément : Les éléments sont les unités qui composent une population.
Synonymes : Objet, individu, unité statistique, unité d’échantillonnage, sujet, événement, comportement,
Echantillon : C'est un sous ensemble de la population considérée, prélevé pour juger de cet ensemble.
Echantillon représentatif : Échantillon qui reflète fidèlement la complexité et la composition de la
population. Le tirage au sort ainsi que l’inventaire exhaustif (recensement), sont deux façons d’obtenir un
échantillon représentatif d’une population.
Caractère statistique (ou variable statistique)
C'est ce qui est observé ou mesuré sur les individus d'une population statistique. Ce variable peut être
quantitative (numérique) ou qualitative (non numérique).
Variable quantitative : C’est un paramètre expérimental qui s’exprime par un nombre.
2
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Pouvant être classées en variables continue (taille, poids) ou discontinue (discrète) (nombre d’enfants dans
une famille, nombre d’œufs pondus par un oiseau).
Variable qualitative : Une variable qualitative se caractérise par un ensemble discontinu d’états.
Pouvant être classées en variables catégorielles (nominales) (couleurs des plumes des oiseaux) ou ordinales
(résistance d’une plante vis-à-vis un ravageur classée en faible, moyenne, importante).
Notion d'hypothèse
L'hypothèse est une relation hypothétique (provisoire, postulée par le chercheur).
On distingue deux formes d'hypothèses :
Hypothèse nulle (H0) et Hypothèse significative (H1) ou alternative.
Hypothèse nulle (H0): m1 = m2 ou l’absence d’une différence significative entre les moyennes ;
Hypothèse alternative (H1): m1 ≠ m2 ou l’existence d’une différence significative entre les
moyennes.
Seuil de signification
En statistique, il n'existe pas de règle rigide permettant de tirer une conclusion concernant les hypo-
thèses ; aucun test ne nous fournit une réponse en terme de oui ou non, mais indique dans quelle mesure
nous pouvons être certain de tirer des conclusions ; cette mesure se nomme niveau ou seuil de signification,
ou encore probabilité d'erreur.
La loi normale
Une distribution normale correspond à la distribution de probabilités d'une variable aléatoire conti-
nue dont la courbe est parfaitement symétrique et en forme de cloche.
Lorsqu'une variable (x) se distribue de telle sorte que les fréquences de ses différentes éventualités suivent la
loi normale, alors elle est dite variable normale.
Types de test
On parle de tests paramétriques lorsque l’on stipule que les données sont issues d’une distribution
paramétrée. Dans ce cas, les caractéristiques des données peuvent être résumées à l’aide de paramètres esti-
més sur l’échantillon (moyenne, mode et médiane). La distribution des données suit la loi normale.
Les tests non paramétriques ne font aucune hypothèse sur la distribution sous-jacente des données
(la distribution des données ne suit pas la loi normale). On les qualifie souvent de tests distribution free.
3
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Chapitre II : Statistiques descriptives
Les méthodes statistiques peuvent être classées en deux groupes :
1) Les Statistiques descriptives : Elle regroupe les méthodes dont l'objectif principal est la description
des données étudiées. Cette description des données se fait à travers leur représentation graphique, et
le calcul de résumés numériques. Dans cette optique, on ne fait pas appel à des outils de type proba-
biliste.
On cite trois types des statistiques descriptives : Statistique descriptive uni-variée : étude de la po-
pulation selon une seule variable. Statistique descriptive bi-variée : étude des corrélations et rela-
tions éventuelles entre deux variables de la même population. Statistique descriptive multi-variée :
étude des relations éventuelles entre plusieurs variables de la même population.
2) La statistique inférentielle : Ce terme regroupe les méthodes dont l'objectif principal est de préciser
un phénomène sur une population globale, à partir de son observation sur un échantillon de cette po-
pulation. Ce passage ne se fait que moyennant des hypothèses de type probabiliste.
II.1. Statistiques descriptives à une dimension
Paramètres de position Paramètres de dispersion
L'étendue E= xmax - xmin
La moyenne m ou
Le mode (Mo) : C'est la valeur ou classe
correspondant à l'effectif (ou fréquence) le plus élevé. La variance S2X = S2X = 1/n ∑ f (xi - x)2
La médiane (Me) : valeur centrale de la série L’écart-type Sx = Racine carrée de la variance
statistique.
Les quartiles Le coefficient de variation C.V. = S/m ×100.
Les quartiles partagent la série en quatre groupes.
Le premier quartile : C’est la plus petite donnée de la 1) CV < 5% : Les valeurs sont très homogènes.
liste telle qu’au moins un quart des données de la liste 2) 5%<CV< 10% : Les valeurs sont homogènes.
sont inférieures ou égales à Q1 = N/4 3) 10%<CV< 15% : Les valeurs sont moyennement homogènes.
Le troisième quartile : C’est la plus petite donnée de la 4) 15%<CV< 30% : Les valeurs sont hétérogènes.
liste telle qu’au moins les trois quarts des données de 5) CV> 30% : Les valeurs sont très hétérogènes.
la liste sont inférieures ou égales à Q3 = N× 3/4
II.2. Statistiques descriptives à deux dimensions
La statistique descriptive à deux dimensions a essentiellement pour but de mettre en évidence une
éventuelle variation simultanée des deux variables, que nous appellerons alors liaison. Dans certains cas,
cette liaison peut être considérée a priori comme causale, une variable X expliquant l’autre Y ; dans
d’autres, ce n’est pas le cas, et les deux variables jouent des rôles symétriques. Dans la pratique, il
conviendra de bien différencier les deux situations et une liaison n’entraîne pas nécessairement une
causalité. Sont ainsi introduites les notions de covariance, coefficient de corrélation linéaire, régression
linéaire, rapport de corrélation, indice de concentration, khi-deux et autres indicateurs qui lui sont liés. De
4
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
même, nous présentons les graphiques illustrant les liaisons entre variables : nuage de points (scatter plot),
diagrammes-boîtes parallèles, diagramme de profils.
La série statistique est alors une suite de n couples des valeurs prises par les deux variables sur
chaque individu : (x1, y1),.............,(xn, yn). L'effectif associe à l'observation (xi, yj) est noté nij. Et sa
fréquence notée : fij=nijn. Les résultats sont regroupés dans un tableau appelé tableau de contingence.
Deux variables qualitatives
Tableau de contingence des effectifs
On s'intéresse à une éventuelle relation entre X : le sexe de n=200 personnes et Y: la couleur des
yeux.
X/Y Bleu Vert Marron Total
Homme n11=10 n12=50 n13=20 n1•=80
Femme n21=20 n22=60 n23=40 n2•=120
Total n•1=30 n•2=110 n•3=60 n=200
n1•, n2• et n•1, n•2, n•3 sont appelés effectifs marginaux.
n11+n12+n13=n1•,
n21+n22+n23=n2•,
n11+n21=n•1,
n12+n22=n•2,
n13+n23=n•3,
n11+n12+n13+n21+n22+n23=n.
Tableau de contingence des fréquences
X/Y Bleu Vert Marron Total
Homme f11=0,05 f12=0,25 f13=0,10 f1•=0,40
Femme f21=0,10 f22=0,30 f23=0,20 f2•=0,60
Total f•1=0,15 f•2=0,55 f•3=0,30 1
f1•, f2• et f•1, f•2, f•3 sont appelées fréquences marginales.
fij=nij/n, fi•=ni•/n, f•j=n•j/n
f11+f12+f13=f1•,
f21+f22+f23=f2•,
f11+f21=f•1,
f12+f22=f•2,
f13+f23=f•3,
f11+f12+f13+f21+f22+f23=1.
5
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Une variable quantitative et une variable qualitative
Diagramme à boîtes à moustaches :
La boîte, (verticale ou bien horizontale), est la partie du graphique comprise entre les premier et
troisième quartiles, (ces quartiles séparent la population en quatre parties égaux en effectifs). La médiane est
située à l'intérieur de la boîte et représentée par un trait horizontal. Dans les parties basse et haute du
graphique figurent les moustaches, joignant le minimum au premier quartile et le troisième quartile au
maximum.
Deux variables quantitatives
La corrélation
La corrélation est la netteté ou l’intensité de la relation existante entre deux séries de données.
1. Notion de covariance
Nous notons par Cov (X, Y) la covariance entre les variables X et Y. La covariance est un paramètre qui
donne la variabilité de X par rapport à Y. La covariance se calcule par l’expression suivante :
6
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Figure : La covariance et la variabilité
2. Le coefficient de corrélation
Pour des variables quantitatives, choisissez le coefficient de corrélation de Pearson ou Spearman.
Coefficient de corrélation de Pearson (r)………………………………………………………………………
Rho de Spearman (ρ) …………………………………………………………………………………………..
Propriétés
Si le coefficient de corrélation est positif, les points du nuage sont alignés le long d'une droite
croissante. Dans ce cas X et Y évoluent dans le même sens (figure 1).
Si le coefficient de corrélation est négatif, les points sont alignés le long d'une droite décroissante.
Dans ce cas X et Y évoluent dans des sens opposés (figure 1).
Si le coefficient de corrélation est nul ou proche de zéro, il n'y a pas de dépendance linéaire (figure
1).
Figure 1: Exemples de diagrammes de dispersion avec différentes valeurs de coefficient de corrélation.
3. Droite de régression
L’idée est de transformer un nuage de point en une droite. Celle-ci doit être la plus proche possible de
chacun des points. On cherchera donc à minimiser les écarts entre les points et la droite. Cette méthode vise
à expliquer un nuage de points par une droite qui lie y à x (figure 2).
y = a.x + b avec a=cov(X, Y)/Var(X)
7
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Figure 2 : La droite la plus proche possible de chacun des points.
Ajustement linéaire
L’ajustement linéaire consiste à remplacer le nuage de points par une droite à l’aide d’une équation
de la régression.
Remarque
Le coefficient de corrélation permet de justifier le fait de l’ajustement linéaire. On adopte les critères
numériques suivants (voir figure 3).
Si | r |< 0,7 ; alors l’ajustement linéaire est refusé (droite refusée).
Si | r | ≥ 0,7 ; alors l’ajustement linéaire est accepté (droite acceptée).
Figure 3 : La zone d’acceptation ou de refus de l’ajustement linéaire.
Exemple d’application : La fécondité du poisson Scorpaenichtys marmoratus s’avère être un paramètre
fastidieux à définir. Afin de simplifier une étude sur la dynamique de population de cette espèce, le nombre
y d’œufs (en milliers) présent chez 11 femelles matures a été compté en relation avec leur poids (kg).
Poids X Nbre d’œufs Y
14 61
17 37
24 65
25 69
27 54
33 93
34 87
37 89
40 100
41 90
42 97
8
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
Analyser les résultats.
Résultat…………………………………………………………………………………………………………
………………………………………………………………………………………………………………….
…………………………………………………………………………………………………………………
Conclusion……………………………………………………………………………………………………
…………………………………………………………………………………………………………………
Chapitre III : Statistiques inférentielles (Tests de comparaison : Tests paramétriques ou non
paramétriques)
Introduction :
La majorité des tests repose sur le principe suivant : On définit une hypothèse nulle notée H0 contre
l'hypothèse alternative H1. Le test a pour objectif d'accepter ou de rejeter H0 avec un risque connu à partir
des données dont on dispose.
On détermine alors une statistique qui est une variable aléatoire construite à partir des données.
Sous H0, cette variable suit une loi de probabilité connue (normale, student, khi-deux,...)
On détermine alors l'intervalle de confiance dont le quel doit tomber la statistique avec une
probabilité donnée (1−α), (le plus souvent 95% pour α=5%).
On définit alors la règle de décision suivante :
Si la statistique tombe dans l'intervalle, on accepte H0. Attention, cela ne veut pas dire que
H0 est vraie mais que le test et les données ne permettent pas de voir un écart significatif à
H0.
Si la statistique ne tombe pas dans l'intervalle, on rejette H0 avec le risque α de se tromper,
(par exemple α=5%).
I. Variables quantitatives
Tests paramétriques usuels
1) Test t ou test Student
Il existe plusieurs formes du test-t de Student :
• Le test-t de Student pour échantillon unique.
• Le test-t de Student comparant deux groupes d’échantillons indépendants (on parle de test de Student non
apparié).
• Le test-t de Student comparant deux groupes d’échantillons dépendants (on parle de test de Student appa-
rié).
Ces différents tests peuvent être utilisés seulement sous certaines conditions :
9
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
➢Dans le cas du test de Student pour un échantillon unique :
✓Si les données suivent la loi normale.
➢Dans le cas du test de Student indépendant :
✓Si les deux groupes d’échantillons (x et y), à comparer, suivent une loi normale.
✓Si les variances des deux groupes sont égales ou pas.
➢Pour le test de student apparié :
✓Si la différence d (= x-y) suit une loi normale.
1) Comment tester la normalité des données ?
La normalité peut être vérifiée par une inspection visuelle [Histogramme] ou par des tests de significativité.
•L’histogramme permet un jugement visuel à savoir si la distribution est une courbe en cloche (courbe de
Gauss).
•Le test de significativité compare la distribution d’un échantillon donné à celle de la loi normale et renvoie
une p-value. Plusieurs méthodes existent pour le test de normalité, notamment le test de Kolmogorov-
Smirnov (K-S) et le test de Shapiro-Wilk.
2) Comment tester l’égalité des variances ?
Le test de Student indépendant classique suppose l’homogénéité des variances des deux groupes à comparer.
Si les deux échantillons suivent une loi normale, le test F peut être utilisé pour comparer les variances.
3) Que faire lorsque les conditions d’application du test de Student ne sont pas remplies ?
La procédure suivante, à deux étapes, est largement acceptée :
➢Si la normalité est acceptée, le test de Student est utilisé.
➢Si les échantillons à comparer ne sont pas distribués selon une loi normale, un test non-paramétrique tel
que le test de Wilcoxon est recommandé comme une alternative au test de Student.
➢Si les deux groupes d’échantillons suivent une loi normale, mais de variances inégales, le test t de Welch
peut être utilisé.
1.1) Test t pour échantillon unique (test de conformité)
But: Les tests de conformité sont destinés à vérifier si un échantillon peut être considéré comme extrait
d’une population donnée ou représentatif de cette population, vis-à-vis d'un paramètre comme la moyenne.
Il s’agit de comparer une moyenne observée à une moyenne théorique (μ).
Exemple : Le taux de cholestérol dans la population est connu et vaut 4,3 mg/l. Les résultats de 15 pesées
sont présentés dans le tableau suivant.
La moyenne de l’échantillon conforme la valeur de la population ?
10
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
4,5 5 3,8 4,5 4,9
4,8 5,2 5,1 4,6 5,2
4,3 3,9 5,2 4,8 5,1
Résultat…………………………………………………………………………………………………………
………………………………………………………………………………………………………………….
……≤……………………………………………………………………………………………………………
Conclusion……………………………………………………………………………………………………
…………………………………………………………………………………………………………………
1.2) Test t pour deux échantillons
1.2.1) Test t pour deux échantillons indépendants (Test de Mann-Whitney)
Il s'agit de deux séries de mesure pour lesquelles il n'y a aucune correspondance entre les éléments de
la première série et ceux de la deuxième ; les deux séries de mesures sont obtenues avec des sujets diffé-
rents. Dans ce cas le but de l'application du test t est de voir si les deux moyennes calculées sur les deux
échantillons diffèrent significativement.
Conditions d’applications
1) Vérification de la normalité ;
2) Homogénéité des variances.
Exemple d’application
Dans le cadre d’une étude écotoxicologique, la concentration en DDT et en ses dérivés a été mesurée
chez les brochets âgés respectivement de 2 et 3 ans. Les résultats obtenus sont les suivants :
[Pesticides] 2 ans [Pesticides] 3 ans
0,144 0,285
0,171 0,295
0,178 0,321
0,184 0,354
0,193 0,359
0,197 0,361
0,198 0,362
0,199 0,364
Les moyennes de ces deux échantillons prélevés indépendamment différent elles de façon significative ?
Résultat…………………………………………………………………………………………………………
………………………………………………………………………………………………………………….
Conclusion
…………………………………………………………………………………………………………………
……………………………………………………………………………………………………
11
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
1.2.2) Test t pour deux échantillons dépendants ou appariés (Test de Wilcoxon)
Il s'agit de deux séries de mesures pour lesquelles il y a une correspondance stricte, terme à terme, entre les
éléments de l'une et les éléments de l'autre.
Conditions d’applications
1) Vérification de la normalité.
Exemple d’application : La quantité de bactéries par cm3 de lait provenant de 8 vaches différentes est
estimée juste après la traite et 24 h plus tard.
Vache Juste après la traite 24h après la traite
1 12000 14000
2 13000 20000
3 21500 31000
4 17000 28000
5 15000 26000
6 22000 30000
7 11000 16000
8 21000 29000
Existe-t-il un accroissement significatif du nombre de bactéries par cm3 de lait au cours du temps ?
Résultat…………………………………………………………………………………………………………
…………………………………………………………………………………………………………………..
Conclusion
……………………………………………………………………………………………………...………….
2. Analyse de la variance à un facteur (ANOVA one way) (Test de Kruskal-Wallis)
C’est un test permet de chercher et de comparer la différence entre plusieurs échantillons (moyennes)
quantitatifs.
C’est un test permet d’étudier l’effet d’un facteur (variable qualitative) sur une variable quantitative.
Conditions d’application
a) Condition de normalité ;
b) Homogénéité des variances.
On doit prélever des échantillons aléatoires et simples dans chaque population. Les moyennes des P
échantillons et la moyenne générale de l’ensemble des observations permettent de définir deux types de
variations :
- Les écarts existant entre les différents échantillons (variation entre échantillons ou variation
factorielle).
12
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
- Les écarts existant à l’intérieure des échantillons (variation résiduelle).
L’importance de ces deux sources de variations est mesurée par deux quantités, appelés communément
carré moyen ou variance.
- Carré moyen factoriel, défini à partir des écarts entre les moyennes des échantillons et la moyenne
générale.
- Et le carré moyen résiduel, qui est fonction des écarts existant entre les observations et la moyenne
de l’échantillon correspondant.
Tableau de l’ANOVA :
Conclusion
On compare la valeur calculée de Fischer Fobs avec la valeur critique appropriée de Fischer avec (P-1)
et (N.-P) degrés de liberté et un risque α%.
Le degré de liberté qui correspond à la variation factorielle est porté au numérateur (colonnes de la table
F), celui qui correspond à la variation résiduelle est porté au dénominateur (lignes de la table F).
- Si Fobs est inférieur à la valeur lue dans la table de Fischer, la différence n’est pas significative. On
accepte H0.
- Si Fobs est supérieur ou égal à la valeur lue dans la table de Fischer, la différence est significative.
On rejette H0 : chercher la ou les moyennes différentes.
Exemple d’application : La quantité d’oxygène consommée par la patelle Acmaea scabra (μlO2/mg/min) a
été mesurée pour différentes conditions expérimentales. Les résultats sont les suivants :
13
ADEB 1ère Année Master Biochimie 2020-2021 Dr. Djemaa DRIS
100% eau de mer 75% eau de mer 50% eau de mer
12,1 10,4 14,6
8,9 7,2 11,7
13,6 6,4 16,9
9,7 13,3 18,8
9,7
7,2
14,1
8,3
La salinité affecte-t-elle la respiration des patelles (α= 0,05) ?
Résultat ………………………………………………………………………………………………………
…………………………………………………………………………………………………………………
Conclusion……………………………………………………………………………………………………
…………………………………………………………………………………………………………………
14