Cours
Cours
Expérimentation statistique
appliquée à la biologie
Table des matières
2
Table des matières
2. Corrélation ...........................................................................................33
2.1. Relation entre corrélation et régression..................................................................34
2.2. Corrélation de Pearson ...........................................................................................35
2.3. Corrélation de Spearman ........................................................................................35
2.4. Corrélation de Kendall ...........................................................................................35
2.5. Corrélation bi-sérique.............................................................................................36
2.6. Corrélation multiple ...............................................................................................36
2.7. Corrélation partielle ...............................................................................................38
3. Régression............................................................................................39
3.1. Régression linéaire simple .....................................................................................40
3.2. Colinéarité ..............................................................................................................43
3
Introduction à l'expérimentation
et au traitement informatique des
données
Objectifs
1. Expérimentation
Définition
L'expérimentation est une méthode scientifique qui consiste à tester par des expériences
répétées la validité d'une hypothèse et à obtenir des données quantitatives permettant de
l'affiner. Elle est pratiquée par un ou plusieurs chercheurs mettant en œuvre des méthodes
expérimentales.
Exemple
Culture des plantes dans un milieu semi contrôlé par exemple différentes teneurs de
salinité, différents niveaux de température… etc.
4
Introduction à l'expérimentation et au traitement informatique des données
2. Types d'expériences
2.1. Expériences de confirmation
Définition
Exemple
Confirmer l'activité antioxydante in vivo après avoir obtenu des résultats satisfaisants dans
une étude in vitro.
Exemple
Par exemple, de nombreuses expériences de puces à ADN dans lesquelles la régulation vers
la hausse ou vers le bas de plusieurs milliers de gènes est testée chez chaque animal
pourrait être classée comme expériences exploratoires car l'objectif principal est
généralement de rechercher des modèles de réponse plutôt que de tester certaines
hypothèses prédéfinies.
Attention
Il y a souvent un certain chevauchement entre ces deux types d'expérience. Par exemple,
une expérience peut être créée pour tester si un composé produit un effet spécifique sur le
poids corporel des rats - une étude confirmatoire. Cependant, les données peuvent
également être collectées sur l'hématologie et la biochimie clinique, et des recherches
exploratoires utilisant ces données peuvent suggérer des hypothèses supplémentaires à
tester dans de futures expériences de confirmation.
5
Introduction à l'expérimentation et au traitement informatique des données
3. Qualité de l’expérimentation
Fondamental
Pour être acceptables sur le plan éthique, les expériences doivent être :
Bien conçues ;
Exécutées efficacement ;
Correctement analysées ;
Clairement présentées ;
Correctement interprétées.
Complément
4. Plan de l’expérience
Définition
La conception expérimentale dépend des objectifs de l'étude. Il doit être planifié en détail, y
compris l'élaboration de protocoles écrits et l'examen des méthodes statistiques à utiliser,
avant de commencer les travaux.
Complément
En principe, une expérience bien conçue évite les biais et elle est suffisamment puissante
pour pouvoir détecter des effets susceptibles d'être d'importance biologique. Cela ne devrait
pas être si compliqué que des erreurs soient commises dans son exécution.
6
Introduction à l'expérimentation et au traitement informatique des données
5. Unité expérimentale
Chaque expérience implique un certain nombre d'unités expérimentales, qui peuvent être
attribuées à un traitement au hasard.
L'unité expérimentale devrait également être l'unité d'analyse statistique. Il doit être
possible, en principe, d'assigner deux unités expérimentales quelconques à des traitements
différents. Un traitement est donné dans le régime alimentaire et tous les animaux de la
même cage ont donc le même régime.
Exemple
7. Exercice
Énoncé
Lire le passage ci-dessous et répondre aux question.
Plan expérimental
Deux études expérimentales in vivo (étude de toxicité subaiguë sur une seul génération) sont
réalisée sur 20 rats Wistar mâles adultes chaque une, pesant (280-350 g) âgés de 12 sem. Les
animaux ont été choisis et divisés en huit groupes égaux de cinq rats chaque un. Les animaux
sont nourris ad libitum par un aliment de rangeurs (contenant 7% de cellulose et 18% de
protéines) et d’eau potable. Les rats sont logés à une température de 25 °C, et sont exposés à
un cycle de 12 h lumière/12 h obscurité, pendant une période de 15 jours par gavage.
Dans la première étude, le premier groupe (T) est maintenu comme témoin et reçu 1 ml d’eau
distillé, tandis que le deuxième groupe (P) a reçu 100 milligrammes par kilogramme du poids
corporel du rat par jour (mg/kg/PC/j) d’un extrait hydro-éthanolique de pollen d’abeille en
volume de 1 ml d’eau distillé. Dans le troisième groupe (Pb) l’acétate de plomb est administré
à 30 mg/kg/PC/j (Elgawish et Abdelrazek, 2014) en volume de 1 ml d’eau distillé et le
quatrième groupe (P + Pb) ont reçus l’acétate de plomb de 30 mg/kg/bw/j en association avec
100 mg/kg/PC/j d’un extrait hydro-éthanolique de pollen d’abeille (Eraslan et al., 2009a;
Eraslan et al., 2009b; Bharti et al., 2017).
Partant du même principe de la première expérience, et prenant en considération les
caractéristiques physico-chimiques du facteur limitant. Le groupe témoin (T) a reçu 1 ml
d’eau distillé et 1 ml de l’huile de tournesol, le groupe intoxiqué (DBP) a reçu 500
7
Introduction à l'expérimentation et au traitement informatique des données
Indice :
Expérience exploratoire ;
Expérience confirmatoire ;
Les deux.
Indice :
Plan simple ;
Plan croisé ;
Plan fractionné.
8
Traitement des données
expérimentales
Objectifs
L’analyse des données peut se définir comme l’ensemble des méthodes permettant une
étude approfondie d’informations quantitatives.
Exemple
9
Traitement des données expérimentales
Fondamental
Exemple
10
Traitement des données expérimentales
Les fichiers Excel peuvent contenir plusieurs feuilles de calcul. Par défaut, l'éditeur de
données lit la première feuille. Pour lire une autre feuille de calcul, sélectionnez là dans la
liste.
Plage Définition
Vous pouvez également lire une plage de cellules. Utilisez la même méthode pour spécifier
des plages de cellules que celle que vous utiliseriez dans Excel. Par exemple : A1:D10.
Vous pouvez lire le nom des variables sur la première ligne du fichier ou sur la première
ligne de la plage définie. Les valeurs qui ne sont pas conformes aux règles de dénomination
de variable sont converties en noms de variable valides et les noms initiaux sont utilisés
comme libellés de variables.
11
Traitement des données expérimentales
Un cache de données est une copie complète du fichier de données, stockée dans un espace
disque temporaire. La création d'un cache du fichier de données peut améliorer les
performances.
12
Traitement des données expérimentales
Attention
En cas de rupture de courant ou l'ordinateur est éteint les données serons perdus.
Fondamental
13
Traitement des données expérimentales
Evitez les noms de variable se terminant par un point car celui-ci peut être interprété
comme un caractère de fin de commande. Vous ne pouvez créer des variables se
terminant par un point que dans une syntaxe de commande. Vous ne pouvez pas créer
de variables se terminant par un point dans une boîte de dialogue de création de
variables.
Evitez d'utiliser des noms de variable se terminant par des traits de soulignement,
étant donné que ceux-ci peuvent entrer en conflit avec des noms de variable
automatiquement créés par les commandes et les procédures.
Les mots clés réservés ne peuvent pas être utilisés pour les noms de variables : Les
mots clés réservés sont ALL, AND, BY, EQ, GE, GT, LE, LT, NE, NOT, OR, TO et
WITH.
Les noms de variables peuvent être définis par n'importe quelle combinaison de
majuscules et de minuscules. La casse est respectée pour des raisons d'affichage.
Lorsque des noms longs de variable occupent plusieurs lignes au niveau de la sortie,
les sauts de ligne sont segmentés au niveau des traits de soulignement, des virgules et
des passages de minuscule à majuscule.
Remarque
Les lettres incluent tout caractère autre que ceux de ponctuation utilisé dans l'écriture de
mots courants dans les langues prises en charge dans le jeu de caractères de la plateforme.
1.6. Exercice
Énoncé
Lire le passage ci-dessous et répondre aux question.
Étude statistique
L’analyse statistique a été conduite de façon descriptive pour les caractéristiques générales des
enquêtes et d’inférence pour les données nutritionnelles.
Les données sur les caractéristiques générales obtenues, ainsi que les données alimentaires ont
été saisies, après avoir été convertis, à l’aide de Microsoft office Excel 2013. Les analyses ont
été établies à l’aide du logiciel, IBM SPSS version 22.
14
Traitement des données expérimentales
Objectifs
Fondamental
15
Traitement des données expérimentales
Exemple
Historique Rappel
les progiciels statistiques les plus répandus étaient BMDP® (Biomedical Computer
Programs), SPSS® (Statistical Package for the Social Sciences) et SAS® (Statistical
Analysis System). Des versions de ces packages, initialement développées pour les
ordinateurs centraux, sont désormais également disponibles pour les micro-ordinateurs. Un
large éventail d'autres programmes et packages ont également été développés pour les
micro-ordinateurs, offrant aux utilisateurs un large choix. La sélection d'un package donné
pour une tâche spécifique peut être guidée par sa disponibilité pour la machine préférée de
l'utilisateur, les méthodes qu'il contient et sa convivialité informatique. Dans le travail
quotidien, les écologistes s'appuient aujourd'hui sur plusieurs packages, chacun spécialisé
pour des tâches spécifiques telles que le regroupement, l'ordination, l'analyse canonique,
l'analyse de séries chronologiques, l'analyse spatiale, les graphiques, la cartographie, le
16
Traitement des données expérimentales
traitement de texte, etc. les tâches d'analyse de données, les machines haut de gamme ou les
ordinateurs centraux conservent leur utilité pour analyser de grandes bases de données ou
pour des méthodes de test statistique à base de permutation et à forte intensité informatique.
b) Logiciels spécialisés
Pour l'analyse multivariée, trois programmes clés doivent être mentionnés : Canoco,
PRIMER et PC-ORD. Tous les programmes d'arbres sont des outils populaires pour
l'analyse multivariée, mais l'utilisateur aura besoin d'au moins un autre programme pour
l'exploration des données et les méthodes univariées.
Canoco Exemple
Canoco pour Windows est un outil logiciel pour l'ordination contrainte et non contrainte.
Les méthodes d'ordination sont intégrées à la méthodologie de régression et de
permutation, afin de permettre une modélisation statistique solide des données écologiques.
Canoco contient à la fois des méthodes linéaires et unimodales, notamment DCA, PCA,
CCA, RDA, db-RDA ou PCoA. Les diagrammes d'ordination peuvent être affichés peuvent
être affichés et exportés en qualité de publication juste après la fin d'une analyse. Canoco
est unique dans sa capacité à tenir compte de la variation de fond spécifiée par les
covariables et dans ses installations étendues pour les tests de permutation, y compris les
tests des effets d'interaction. Canoco a été conçu pour les écologistes, mais il est également
utilisé en toxicologie, en science du sol, en géologie ou en recherche en santé publique,
pour n'en nommer que quelques-uns.
PRIMER Exemple
PRIMER est populaire dans les domaines benthiques marins, et ses principaux atouts sont
des mesures d'association combinées avec ANOSIM, BVSTEP et des méthodes d'auteur qui
effectuent des tests de permutation. PRIMER a également été conçu dans un souci de
facilité d'utilisation et ne fournit que les outils d'analyse les plus robustes, ce qui en fait un
bon choix pour les moins expérimentés.
PC-ORD Exemple
PC-ORD est un programme Windows qui effectue une analyse multivariée des données
écologiques saisies dans des tableurs. Il met l'accent sur les outils non paramétriques, la
représentation graphique et les tests de randomisation pour l'analyse des données
communautaires. En plus des utilitaires de transformation des données et de gestion des
17
Traitement des données expérimentales
Complément
D'autres programmes multivariés axés sur l'analyse écologique sont le PATN, le MVSP, le
CAP et l'ECOM. Les deux derniers proviennent de Pisces conservation Ltd. Cependant, les
auteurs ont peu ou pas d'expérience avec ces programmes.
En fait, les écologistes doivent maîtriser à fond les méthodes numériques qu'ils utilisent.
S'ils ne le font pas, ils peuvent finir par utiliser des approches incompatibles avec leurs
données, ou sélectionner des techniques qui ne correspondent pas à l'objectif de la
recherche, ou encore interpréter les résultats de manière incomplète ou incorrecte. Le seul
rôle de l'ordinateur est de soulager l'utilisateur des calculs ; il ne porte aucune appréciation
sur la pertinence de la méthode retenue, ni sur l'interprétation des résultats. En effet, une
sortie informatique n'est pas en soi une conclusion et elle ne remplacera jamais les
écologistes pour l'interprétation des résultats.
Les programmes pour toutes les techniques numériques peuvent être trouvés dans un ou
plusieurs paquages. Il est donc beaucoup plus efficace pour les écologistes d'utiliser ces
ressources éprouvées que de reprogrammer des méthodes. Les données écologiques sont, la
plupart du temps, si complexes qu'une seule analyse ne peut en extraire toutes les
informations utiles. Par conséquent, les écologues qui utilisent judicieusement les
programmes existants ont accès à une variété de méthodes numériques, nécessaires pour
couvrir le large éventail de situations écologiques rencontrées dans les études de terrain.
Conseil
Tous les logiciels statistiques se ressemblent. Quatre éléments vont surtout jouer dans le
choix d’un logiciel de traitement des données :
L’apprentissage : le logiciel dans lequel on a appris le traitement des données a une
certaine longueur d’avance sur les autres (on évite de réapprendre le maniement d’un
logiciel).
L’accessibilité : le produit est-il accessible dans notre ville ou dans notre région ?
La maniabilité : la simplicité dans l’entrée des données et dans les commandes
générales et particulières.
18
Traitement des données expérimentales
Le coût du logiciel.
Complément
Des revues du contenu des principaux progiciels statistiques disponibles sur le marché
peuvent être trouvées dans des revues statistiques, par exemple « The American
Statistician », « Applied Statistics » ou « Statistics and Computing ».
Exemple
Le tableau ci-dessous contient une liste de certaines méthodes statistiques et montre quels
programmes peuvent être utilisés pour chaque méthode. Il convient de noter que plusieurs
autres programmes peuvent effectuer la majorité de ces méthodes statistiques.
PC-
Brodgar Genstat Canoco PRIMER R
Ord
Exploration de données IR ✔️ ✔️ ✔️
Régression linéaire R ✔️ ✔️ ✔️ ✔️
Régression linéaire partielle R SS ✔️ SS
Modèles linéaires
généralisés GLM
R ✔️ ✔️ ✔️
Modélisation mixte R ✔️ ✔️
Moindres carrés généralisés
GLS
R ✔️ ✔️
Modèles d'arbres R ✔️ ✔️
Les réseaux de neurones R SS ✔️ ✔️
Mesures d'association IR ✔️ ✔️ ✔️ ✔️ ✔️
Analyse en composante
principale ✔️ ✔️ ✔️ ✔️ ✔️ ✔️
Analyse de redondance ✔️ ✔️ ✔️
Analyse de redondance
partielle
✔️ ✔️ ✔️
19
Traitement des données expérimentales
Analyse de corrélation
canonique partielle ✔️ ✔️ ✔️
Analyse discriminante ✔️ ✔️ ✔️ ✔️ ✔️
Mise à l'échelle
multidimensionnelle non ✔️ ✔️ ✔️ ✔️ ✔️
métrique
Analyse morphométrique
géométrique ✔️ SC ✔️ SC
Désaisonnalisation ✔️ ✔️ ✔️
Lissage répété de LOESS R SC SC
Analyse factorielle
d'autocorrélation Min/max ✔️ SC SC
MAFA
Regroupement chronologique ✔️ SC SC
Radar
d'ouverture R ✔️
synthétique
Moyenne mobile
spatiale
R ✔️
Statistiques
spatiales Variogrammes R ✔️ ✔️
Variogramme de
surface
R ✔️ ✔️
Krigeage R ✔️ ✔️
✔️ :intégré dans le programme ;
R : nécessite usage d'un package R ;
IR : intégré et usage d'un package R ;
SS : nécessite un scripte simple ;
SC : nécessite un scripte complexe.
20
Traitement des données expérimentales
Parmi les exemples suivants identifiez les logiciels généralisés et ceux spécialisés.
Questions de synthèse
1. Pourquoi utiliser un logiciel ?
2. Es que je dois utiliser un seul ou plusieurs logiciels ?
3. Comment choisir le bon logiciel ?
4. Es que je peux utiliser un logiciel sans avoir des connaissances préalables sur les
méthodes de traitement des données ?
21
Les outils de l'analyse des
données
Objectifs
L'ANOVA 1est utilisée pour faire des inférences sur plusieurs groupes (k ≥ 2). Les groupes
sont organisés selon un seul et unique facteur et sont « parallèles » en ce sens que les
observations entre les groupes sont indépendantes. Dans les applications médicales ou
biologiques, le facteur impliqué est généralement différents types de traitement, différents
niveaux de caractéristiques démographiques ou biologiques, ou différents modes
d'intervention.
Exemple
l'effet des huiles diététiques sur les taux lipidiques de triglycérides dans le cerveau des rats.
Soixante-douze rats ont été divisés en six groupes et ont reçu des régimes alimentaires
composés de composants de différents types d'huiles. Le résultat d'intérêt était le taux de
triglycérides dans le cerveau des rats. Les résultats
22
Les outils de l'analyse des données
Conditions Fondamental
Le facteur fixe est un facteur dans lequel les données sont expérimentales donc les facteurs
sont des Variables indépendantes provoquées
Le facteur aléatoire est un facteur dans lequel les données sont issus de simples
observations donc les facteurs varient librement
23
Les outils de l'analyse des données
Exemple
Teneur du nitrogène
Variété
1
Variété
2
Le plan randomisé à blocs aléatoires est un plan dans lequel les unités (appelées unités
expérimentales) auxquelles les traitements sont appliqués sont subdivisées en groupes
homogènes appelés blocs, de sorte que le nombre d'unités expérimentales dans un bloc est
égal au nombre (ou à un multiple du nombre) de traitements à l'étude. Les traitements sont
ensuite attribués au hasard aux unités expérimentales de chaque bloc. Il convient de
souligner que chaque traitement apparaît dans chaque bloc et que chaque bloc reçoit chaque
traitement.
Exemple
Lavendula
45 43 51
Dentata
Lavendula
47 46 52
multifida
Lavendula Stoica 48 50 55
24
Les outils de l'analyse des données
Exemple
On prend l'exemple précédant, les plantes sont issus de trois forêts différentes, Notre budget
est limité et on ne dispose pas des moyens pour réaliser Le plan randomisé à blocs
aléatoires.
Tableau 5 : Teneur des flavonoïdes totaux en fonction des espèces des organes et des forêts
Lavendula
Tessala (26,6) Mssid (19,4) Télagh (22,8)
multifida
Un schéma split plot est une généralisation d’un plan randomisé avec blocs.
Exemple
25
Les outils de l'analyse des données
Exemple
Traitement Sujet T1 T2 T3 T4
1 1
1 2
1 3
2 4
2 5
2 6
3 7
3 8
3 9
26
Les outils de l'analyse des données
Exemple
1 2 3 4 5
Phase 1 A P A P A
Phase 2 P A P A P
Interactions Définition
L'ANOVA vous permet de tester non seulement les variables individuelles, mais également
leurs combinaisons. C'est une préoccupation importante. Les combinaisons de variables ont
parfois un effet différent de celui que vous attendez des variables seules. Cet effet est
important et, en tant qu'expérimentateurs, nous voulons le savoir. En termes statistiques, on
dit qu'il y a un effet d'interaction entre la variable X et la variable Y.
27
Les outils de l'analyse des données
Interaction Exemple
Figure 8 : Interaction
Moyennes dans une ANOVA à deux facteurs, montrant divers effets des deux facteurs et
leur interaction. (a) Aucun effet du facteur A (indiqué par les signes plus à la même hauteur
verticale sur l'axe X), un petit effet du facteur B (observé comme les cercles étant
seulement à une petite distance l'un de l'autre verticalement), et aucune interaction des
facteurs A et B (vus comme les lignes étant parallèles). (b) Grand effet du facteur A, petit
effet du facteur B et aucune interaction (ce qui est le cas dans la figure 1). (c) Aucun effet
de A, effet important de B et aucune interaction. (d) Grand effet de A, grand effet de B et
aucune interaction. (e) Aucun effet de A, aucun effet de B, mais interaction entre A et B. (f)
Grand effet de A, aucun effet de B, avec une légère interaction. (g) Aucun effet de A, grand
effet de B, avec grande interaction. (h) Effet de A, grand effet de B, avec grande interaction.
28
Les outils de l'analyse des données
Espèce 1
🚹 🚺 🚹 🚺 🚹 🚺
Espèce 2
🚹 🚺 🚹 🚺 🚹 🚺
Espèce 3
🚹 🚺 🚹 🚺 🚹 🚺
Fondamental
Analyse de deux facteurs ou plus dans une hiérarchie répliquée avec des niveaux de chacun
imbriqués dans (appartenant à) des niveaux du suivant
1. Modèle hiérarchique à deux facteurs ;
2. Modèle hiérarchique à trois facteurs.
Exemple
29
Les outils de l'analyse des données
Conditions Fondamental
Analyse d'un ou plusieurs facteurs catégoriels avec des niveaux, ou des combinaisons de
niveaux, attribués dans des unités d'échantillonnage à mesures répétées de sujets testés à
plusieurs reprises dans une séquence temporelle ou spatiale, et répliqués uniquement entre
les sujets.
Exemple
30
Les outils de l'analyse des données
Année
Fondamental
on peut effectuer une analyse de la covariance lorsque l’on dispose d’observations sur une
ou plusieurs variables corrélées provenant de chaque unité expérimentale, ainsi que
d’observations sur la variable de réponse considérée. Ces variables additionnelles reliées
sont appelées covariables ou variables accessoires ou concomitantes. Il est indispensable
qu’elles soient associées à la variable à l’étude. Par exemple, dans les essais de rendement,
la variation du volume sur pied initial due à des facteurs externes, les effets résiduels des
plantes antérieurement cultivées sur le site etc…, peuvent faire office de covariables.
Exemple
Tableau 11 : Hauteur initiale (x) et hauteur quatre mois plus tard (y),
en cm, de trois variétés de Leucaena leucocephala
x y x y x y
31
Les outils de l'analyse des données
Exemple
Gousses Feuilles
Conditions Fondamental
Définition
Exemple
32
Les outils de l'analyse des données
Polyphénols
T° Sucres
Organes Proline solubles Protéines Lipides
totaux
2. Corrélation
Objectifs
33
Les outils de l'analyse des données
Corrélation Définition
La relation entre deux variables peut être celle d'une dépendance fonctionnelle de l'une par
rapport à l'autre. Autrement dit, la magnitude de l'une des variables (la variable
dépendante) est supposée être déterminée par la magnitude de la deuxième variable (la
variable indépendante), alors que l'inverse n'est pas vrai.
Exemple
Dans la relation entre la pression artérielle et l'âge chez l'homme, la pression artérielle peut
être considérée comme la variable dépendante et l'âge comme la variable indépendante ;
nous pouvons raisonnablement supposer que bien que l'ampleur de la pression artérielle
d'une personne puisse être fonction de l'âge, l'âge n'est pas déterminé par la pression
artérielle. Cela ne veut pas dire que l'âge est le seul déterminant biologique de la pression
artérielle, mais nous le considérons comme un facteur déterminant.
Remarque
Le terme dépendant n'implique pas nécessairement une relation de cause à effet entre les
deux variables.
Régression Définition
La régression est une méthode d'analyse utilisée dans des études observationnelles pour
prédire ou expliquer une variables dite dépendante selon une ou plusieurs variables dites
indépendantes ou prédicteurs.
Attention
On ne peux pas utiliser la régression entre deux variable sauf si elles sont corrélées.
34
Les outils de l'analyse des données
Définition
La corrélation de Pearson est une analyse d'association entre deux variables quantitatives
selon les conditions ci-dessous :
Conditions Fondamental
Coefficient r de Pearson
[cf. Test de corrélation (Pearson).pdf]
Définition
La corrélation de Pearson est une analyse d'association entre deux variables quantitatives
selon les conditions ci-dessous :
Conditions Fondamental
35
Les outils de l'analyse des données
Méthode
Équation 1 : τ = 1
C−D
n(n−1)
2
Conditions Complément
Fondamental
En se basant sur le principe qu'une variable qualitative est dans l'origine une variable
quantitative
Exemple
La variable diabète est à l'origine une variable quantitative qui est la glycémie à certain
seuil on dit que la personne est diabétique au dessous de ce seuil on dit que la personne est
non diabétique.
Définition
La corrélation bi-sérique est une analyse d'association entre une variable qualitative binaire
et une variable quantitative.
Méthode
Équation 2 : ρ bis = r
√pq
Définition
36
Les outils de l'analyse des données
Complément
Exemple
Un coefficient R2 = 0,73, par exemple, signifierait que les relations linéaires des variables
y1, y2, …, yj, … et yp avec yk expliquent 73 % de la variabilité de yk autour de sa
moyenne. Le coefficient de corrélation multiple (R) est la racine carrée du coefficient de
détermination multiple :
Rappel
Méthode
Fondamental
37
Équation 3 :
A =
R1.23 = √
R1.23 = √
R1.23 = √
∣
é
0,4
0,8
r11
r21
r31
R1.23 = √
2
R1.23 = √ 0,64
R1.23 = 0,8
0,4
0,5
r12
r22
r32
2
0,8
0,5
r13
r23
r33
1
1−(r23 )
2
(0,4) +(0,8) −2×0,4×0,8×0,5
1−(0,5)
0,16+0,64−0,32
1−0,25
0,48
0,75
2
2
Les outils de l'analyse des données
La corrélation partielle est l'analyse d'association entre deux variables après exclusion de
leurs association linéaire due à d'autres variables.
Définition
Exemple
38
Équation 4 :
3. Régression
Objectifs
A =
A =
r23.1 =
r23.1 =
r23.1 =
r23.1 =
∣é
0,70
0,61
√
r11
r21
r31
√ 1−r
r23.1 =
1
0,40
r12
r22
r32
2
12
0,40−0,70×0,61
1−(0,70) ×
r23.1 = −0,048
r13
r23
r33
×√ 1−r
1−(0,61)
0,40−0,427
√ 1−0,49×√ 1−0,3721
−0,027
√0,51×√ 0,6279
−0,027
0,566
1
Les outils de l'analyse des données
1 0,70 0,61
2
13
39
Les outils de l'analyse des données
Le terme régression simple fait référence au type de régression le plus simple, celui dans
lequel seules deux variables sont prises en compte.
Fondamental
Équation 5 : b = ȳ − a × x̄
y = ax + b + ϵ
Exemple
Longueur de
Âge (jours)
l'aile (cm)
3 1,4
4 1,5
5 2,2
6 2,4
8 3,1
9 3,2
10 3,2
11 3,9
12 4,1
14 4,7
40
Les outils de l'analyse des données
Longueur de
Âge (jours)
l'aile (cm)
15 4,5
16 5,2
17 5,0
y = 0,270 x +0,715
Prédiction Méthode
b ± tα(2),(n−2) sy
^
LI = b − tα(2),(n−2) sy
^
LS = b + tα(2),(n−2) sy
^
2
1 (xi −x̄)
2
sy
^
= √ sxy ( + n
2
)
n ∑i=1 x
n 2
(∑ xy)
n 2 i=1
(∑ y − n
)
i=1 2
∑ x
i=1
sxy =
n−2
41
Les outils de l'analyse des données
42
Les outils de l'analyse des données
Résidus Complément
a : homosocialité ;
b : hétérosocialité ;
c : erreur de calcul ou relation nécessite une autre variable ;
d : relation non linéaire.
Figure 12 : Régression
3.2. Colinéarité
Colinéarité Définition
Figure 13 : Colinéarité
Déterminant Définition
43
Les outils de l'analyse des données
d'une équation de régression multiple. Comme dans la régression linéaire simple, c'est le
rapport de la somme des carrés des distances des valeurs estimées ^y à la moyenne y, à la
somme des carrés des distances des valeurs de la variable de réponse d'origine y à la
moyenne : y
Méthode
n 2
∑ (y
ˆi −ȳ )
Équation 7 : R 2
=
i=1
n 2
∑ (yi −ȳ )
i=1
Tolérance
La tolérance est
Équation 8 : T olérance = 1 − R 2
Objectifs
Définition
L'analyse en composantes principales (ACP) est une méthode multivariée dont le but est de
décrire les relations existant entre les colonnes d’un tableau à plusieurs variables et
s’applique à un ensemble de variables numériques. L'ACP est très pratique lorsque l'on
44
Les outils de l'analyse des données
Exemple
45
Les outils de l'analyse des données
Pt : Poids total des fruits (kg par arbre) ; Pm : Poids moyen de fruits par arbre (g) ; Ht :
hauteur totale de l’arbre (m) ; Hf : hauteur fût de l’arbre (m) ; Hhoup : hauteur houppier de
l’arbre (m) ; DPH : Diamètre à 1,3 m de l’arbre (cm) ; G : surface terrière de l’arbre
(m2/ha); Dhoup : diamètre du houppier de l’arbre (m).
c) Tracé d'effondrement
Autant de facteurs que de variables mesurées peuvent être extraits pour l'analyse factorielle
exploratoire (AFE), mais il est généralement possible d'expliquer la majorité de la variance
avec un plus petit nombre de facteurs. Le problème se pose de déterminer le nombre exact
de facteurs à retenir pour l'interprétation.
Un équilibre délicat entre exhaustivité et parcimonie est nécessaire pour parvenir à une
solution interprétable. Malheureusement, aucune méthode infaillible pour déterminer le
"vrai" nombre de facteurs à retenir n'a été découverte
46
Les outils de l'analyse des données
Pour analyser un diagramme d'éboulis, tracez une ligne droite à travers les valeurs propres
de droite à gauche. Les valeurs propres au-dessus et à gauche de la droite sont les facteurs à
retenir (Pett et al., 2003). Un tracé d'effondrement idéal, tel qu'illustré à la figure ci-
dessous (cf. p.46), peut être relativement facile à interpréter. Les trois plus grandes valeurs
propres sont nettement au-dessus de la trajectoire de la droite. Cependant, la plupart des
tracés d'effondrement sont plus ambigus et les chercheurs ont tendance à être peu fiables
lorsqu'ils utilisent des tracés d'effondrement pour déterminer le nombre de facteurs à retenir
(Streiner, 1998).
La variance expliquée par la solution initiale, les composantes extraites, et les composants
pivotés s'affiche. Cette première section du tableau montre les valeurs propres initiales.
La colonne Total donne la valeur propre ou la quantité de variance dans les variables
d'origine prises en compte par chaque composant. La colonne % de variance donne le
rapport, exprimé en pourcentage, de la variance expliquée par chaque composante à la
variance totale de toutes les variables. La colonne % cumulé donne le pourcentage de
variance expliqué par les n premières composantes. Par exemple, le pourcentage cumulé
pour le deuxième composant est la somme du pourcentage de variance pour les premier et
deuxième composants.
Exemple
Pour la solution initiale, il y a autant de composantes que de variables, et dans une analyse
de corrélations, la somme des valeurs propres est égale au nombre de composantes. Vous
avez demandé que les valeurs propres supérieures à 1 soient extraites, de sorte que les trois
premières composantes principales forment la solution extraite.
% de la
Composante Total % cumulé
variance
3 0,78 8,67
4 0,31 3,51
5 0,24 2,67
6 0,07 0,84
7 0,01 0,16
47
Les outils de l'analyse des données
% de la
Composante Total % cumulé
variance
La deuxième section du tableau montre les composants extraites. elles expliquent près de
84 % de la variabilité des dix variables d'origine, vous pouvez donc réduire
considérablement la complexité de l'ensemble de données en utilisant ces composantes,
avec seulement une perte d'informations de 16 %.
Exemple
% de la
Composante Total % cumulé
variance
Exemple
% de la
Composante Total % cumulé
variance
48
Les outils de l'analyse des données
Complément
Composantes
Variables 1 2
49
Les outils de l'analyse des données
Composantes
Variables 1 2
f) Carte factorielle
Fondamental
50
Les outils de l'analyse des données
51
Les outils de l'analyse des données
g) Interprétation de l'ACP
La première composante est celle qui résume le mieux les informations contenues dans le
tableau en concentrant le plus d’information. La deuxième apporte un pourcentage
d'information inférieur mais complémentaire, et ainsi de suite. La somme des pourcentages
d'explication des composantes permet de déduire le taux de déperdition d'information à
partir des données de base. Ainsi, la première composante résume 62 % du tableau et la
seconde 21 %, l'information représentée sur le graphique est de 83 %. L’information «
perdue » est donc de 17 % sur 9 dimensions (neuf variables) réduit à deux dimensions
(deux axes), néanmoins, une meilleure vue d'ensemble est acquise. Généralement, on
estime qu’une concentration d’information de 50 % du tableau de départ est suffisante pour
garantir une précision d’analyse et sert de critère de choix du nombre de composantes
principales à retenir. Les points individus sont représentés sur le graphique en fonction de
leurs coordonnées sur les axes. Plus deux individus sont semblables par rapport aux
variables mesurées, plus ils sont proches sur le diagramme d’ordination. Les variables sont
également représentées. Les variables sont présentées comme des vecteurs dont la longueur
indique l'importance de la variable. Deux vecteurs qui pointent à peu près dans la même
direction sont corrélés. Leur représentation indique leur corrélation avec les axes, à
l'intérieur d'un système d’axes formant un cercle de corrélation. Ces variables renseignent
sur le sens à donner aux axes. Ainsi, une variable proche du cercle de corrélation
(corrélation forte) et proche d'un axe a plus participé à la formation de cet axe.
52
Les outils de l'analyse des données
Taille de l'échantillon
Au-delà des participants à inclure dans une ACP, il est également important de savoir
combien de participants inclure. Les coefficients de corrélation ont tendance à être moins
fiables lorsqu'ils sont estimés à partir de petits échantillons. Par exemple, avec une vraie
corrélation de population de zéro et une taille d'échantillon de 100, environ 95 % des
corrélations se situeront entre −0,20 et +0,20. En revanche, environ 95 % des corrélations
se situeront entre -0,09 et +0,09 lorsque la taille de l'échantillon est de 500.
Deux considérations supplémentaires pour déterminer la taille d'échantillon appropriée sont
le type de données et la quantité de données manquantes.
Inertie
Au moins une inertie du plan de 30 % doit expliquer la variation des données, de préférence
le taux d'inertie du plan doit dépasser 50 % pour une meilleur interprétation, quoi qu'un
pourcentage proche de 70 % indique une perte d'information de 30 %.
53
Les outils de l'analyse des données
4.3. Évaluation
Exercice 1 [solution n°10 p. 60]
Qualitatives
Quantitatives
Deux individus sont proches s’ils prennent des valeurs proches sur au moins une
variable
Deux individus sont proches s’ils prennent des valeurs proches sur toutes les variables
Parmi les indicateurs suivants, quel(s) est (sont) les indicateurs de liaison entre variables
quantitatives
Coefficient de corrélation
Moyenne
Variance
Écart type
54
Les outils de l'analyse des données
Deux individus proches sur le plan 1-2 sont nécessairement proche dans l’espace global
Deux individus proches sur le plan 1-2 mais mal projetés sont nécessairement éloignés
dans l’espace global
Deux individus éloignés sur le plan 1-2 sont nécessairement éloignés dans l’espace
global
La qualité de projection d’un individu, mesurée par le cosinus carré, peut s’additionner
sur deux axes uniquement
55
Les outils de l'analyse des données
Deux variables mal projetées sur un plan sont très corrélées (positivement ou
négativement)
La qualité de projection d’une variable sur un axe est égale au coefficient de corrélation
de la variable avec l’axe
La qualité de projection d’une variable sur un axe est égale au carré du coefficient de
corrélation de la variable avec l’axe
56
Les outils de l'analyse des données
25 %
40 %
65 %
10 %
25 %
40 %
65 %
57
Solutions des exercices
Il s'agit d'une étude exploratoire car l'objectif est de vérifier l’effet du pollen d’abeille sur
la reprotoxicité masculine d’un métal lourd (Pb) et d’un plastifiant (DBP).
Il s'agit d'un plan d'expérience simple car dans chaque groupe (cage)tout les rat on subit le
même traitement et durant toute l'expérience.
Étude descriptive
58
Solutions des exercices
Parmi les exemples suivants identifiez les logiciels généralisés et ceux spécialisés.
S-PLUS Canoco
MATLAB PRIMER
SAS PC-ORD
StatBox PATN
Sphinx MVSP
SPSS CAP
STATA ECOM
STATISTICA
SYSTAT
Tableau
Minitab
59
Solutions des exercices
MapInfo
BMDP
Microsoft Office Excel et LibreOffice Calc sont des tableurs alors que l'ACP, l'AFC,
CHA et l'ACM sont des méthodes d'analyses multivariées
Quantitatives
Les variables sont quantitatives même si certaines variables qualitatives peuvent être
utilisés pour aider à interpréter les résultats de l’analyse en composantes principales.
Deux individus sont proches s’ils prennent des valeurs proches sur au moins une
variable
Deux individus sont proches s’ils prennent des valeurs proches sur toutes les variables
60
Solutions des exercices
Parmi les indicateurs suivants, quel(s) est (sont) les indicateurs de liaison entre variables
quantitatives
Coefficient de corrélation
Moyenne
Variance
Écart type
Deux individus proches sur le plan 1-2 sont nécessairement proche dans l’espace global
Deux individus proches sur le plan 1-2 mais mal projetés sont nécessairement éloignés
dans l’espace global
Deux individus éloignés sur le plan 1-2 sont nécessairement éloignés dans l’espace
global
La qualité de projection d’un individu, mesurée par le cosinus carré, peut s’additionner
sur deux axes uniquement
61
Solutions des exercices
La qualité de projection d’une variable sur un axe est égale au carré du coefficient de
corrélation de la variable avec l’axe
62
Solutions des exercices
25 %
40 %
65 %
Il suffit de calculer le pourcentage de variables bien représentées sur la première
dimension en comptant le nombre de variables bien projetées (4/9)
25 %
40 %
63
Solutions des exercices
65 %
Il suffit de calculer le pourcentage de variables bien représentées sur le plan en comptant
le nombre de variables bien projetées (7/9)
64
Bibliographie
[[3]] Kurban, S., Mehmetoglu, I., and Yilmaz, G. (2007), Effect of diet oils on lipidlevels of
the brain of rats, Indian J. Clin. Biochem., 22(2), 44–47.
[1] Child, D. (2006). The essentials of factor analysis (3rd ed.). Continuum.
[2] Marley W. Watkins A step-by-step guide to exploratory factor analysis with SPSS New
York, NY : Routledge Taylor & Francis Group , 2021
65