Cours
Cours
statistique
appliquée à la
biologie
2. Corrélation ....................................................................................................... 34
2.1. Relation entre corrélation et régression .............................................................................. 34
2.2. Corrélation de Pearson ......................................................................................................... 35
2.3. Corrélation de Spearman ..................................................................................................... 36
2.4. Corrélation de Kendall .......................................................................................................... 36
2.5. Corrélation bi-sérique ........................................................................................................... 37
2.6. Corrélation multiple .............................................................................................................. 37
3
Table des matières
3. Régression ...................................................................................................... 40
3.1. Régression linéaire simple ................................................................................................... 40
3.2. Colinéarité ............................................................................................................................. 44
4
I Introduction à l'expérimentation et au
traitement informatique des données
Objectifs
Lors de cet apprentissage vous allez atteindre les objectifs suivants :
1. Objectifs spécifiques des connaissance :
Connaître l'expérimentation et ces types ;
Connaitre la composition d'un plan d'expérience.
2. Objectifs spécifiques des méthodes :
Être capable de rédiger un plan d'expérience
3. Objectifs spécifiques des attitudes :
Être capables de conduire une expérimentation.
1. Expérimentation
Définition
L'expérimentation est une méthode scientifique qui consiste à tester par des expériences
répétées la validité d'une hypothèse et à obtenir des données quantitatives permettant de
l'affiner. Elle est pratiquée par un ou plusieurs chercheurs mettant en œuvre des méthodes
expérimentales.
Exemple
Culture des plantes dans un milieu semi contrôlé par exemple différentes teneurs de salinité,
différents niveaux de température… etc.
2. Types d'expériences
2.1. Expériences de confirmation
Définition
Une expérience confirmatoire visent à tester une hypothèse spécifique et à confirmer ou
infirmer une théorie. La recherche confirmatoire implique normalement des tests formels
d'une ou plusieurs hypothèses prédéfinies.
5
Introduction à l'expérimentation et au traitement informatique des données
Caractéristiques Complément
Planification rigoureuse avec un nombre de répétitions suffisant ;
Contrôle strict des variables ;
Analyse statistique pour tester les hypothèses et déterminer la significativité des
résultats.
Exemple
Tester l'efficacité d'une nouvelle méthode de culture in vitro pour la production de
plantes transgéniques ;
Évaluer l'impact d'un traitement biofertilisant sur le rendement d'une culture.
Caractéristiques Complément
Souvent menées avec un nombre limité de répétitions ;
Peu de contrôle sur les variables ;
Analyse exploratoire des données pour identifier des tendances et des relations.
Exemple
Étudier l'effet de différentes concentrations d'un herbicide sur la croissance de
différentes variétés de plantes ;
Examiner les relations entre la composition du sol et la diversité des espèces végétales
dans une zone donnée ;
Déterminer les paramètres de croissance à surveiller (hauteur des plantes, nombre de
feuilles, etc.).
Attention
Il y a souvent un certain chevauchement entre ces deux types d'expérience.
6
Introduction à l'expérimentation et au traitement informatique des données
Exemple
une expérience peut être créée pour tester si un composé produit un effet spécifique sur le
poids corporel des rats - une étude confirmatoire. Cependant, les données peuvent également
être collectées sur l'hématologie et la biochimie clinique, et des recherches exploratoires
utilisant ces données peuvent suggérer des hypothèses supplémentaires à tester dans de
futures expériences de confirmation.
Le nombre de répétitions ;
L'objectif de l'expérience ;
Elle permet de tester une hypothèse spécifique et de confirmer ou infirmer une théorie ;
Quel type d'expérience est le plus approprié pour étudier l'impact d'un changement climatique
sur la distribution géographique d'une espèce végétale?
Expérience exploratoire ;
Expérience confirmatoire.
7
Introduction à l'expérimentation et au traitement informatique des données
Confirmatoire
Exploratoire
Exploratoire
Exploratoire
3. Qualité de l’expérimentation
Fondamental
Pour être acceptables sur le plan éthique, les expériences doivent être :
Bien conçues ;
Exécutées efficacement ;
Correctement analysées ;
Clairement présentées ;
Correctement interprétées.
Complément
Pour être clairement présenté certains points sont essentiels :
Connaissance de la conception expérimentale et les statistiques ;
Description suffisamment complète des modèles expérimentaux et des méthodes
statistiques ;
Les objectifs de la recherche et/ou les hypothèses à tester ;
La raison du choix de leur modèle ;
Les détails de chaque expérience distincte signalée,
La conception de l’étude et le nombre d’unités statistiques utilisés ;
Les méthodes statistiques utilisées pour l’analyse.
4. Plan de l’expérience
Définition
La conception expérimentale dépend des objectifs de l'étude. Il doit être planifié en détail, y
compris l'élaboration de protocoles écrits et l'examen des méthodes statistiques à utiliser,
avant de commencer les travaux.
8
Introduction à l'expérimentation et au traitement informatique des données
Complément
En principe, une expérience bien conçue évite les biais et elle est suffisamment puissante
pour pouvoir détecter des effets susceptibles d'être d'importance biologique. Cela ne devrait
pas être si compliqué que des erreurs soient commises dans son exécution.
5. Unité expérimentale
Chaque expérience implique un certain nombre d'unités expérimentales, qui peuvent être
attribuées à un traitement au hasard.
L'unité expérimentale devrait également être l'unité d'analyse statistique. Il doit être possible, en
principe, d'assigner deux unités expérimentales quelconques à des traitements différents. Un
traitement est donné dans le régime alimentaire et tous les animaux de la même cage ont donc le
même régime.
Exemple
Deux groupes d’animaux infecté et non infecté
7. Exercice
Énoncé
Lire le passage ci-dessous et répondre aux question.
Plan expérimental
Deux études expérimentales in vivo (étude de toxicité subaiguë sur une seul génération) sont
réalisée sur 20 rats Wistar mâles adultes chaque une, pesant (280-350 g) âgés de 12 sem. Les
animaux ont été choisis et divisés en huit groupes égaux de cinq rats chaque un. Les animaux sont
nourris ad libitum par un aliment de rangeurs (contenant 7% de cellulose et 18% de protéines) et
d’eau potable. Les rats sont logés à une température de 25 °C, et sont exposés à un cycle de 12 h
lumière/12 h obscurité, pendant une période de 15 jours par gavage.
Dans la première étude, le premier groupe (T) est maintenu comme témoin et reçu 1 ml d’eau
distillé, tandis que le deuxième groupe (P) a reçu 100 milligrammes par kilogramme du poids
corporel du rat par jour (mg/kg/PC/j) d’un extrait hydro-éthanolique de pollen d’abeille en volume
de 1 ml d’eau distillé. Dans le troisième groupe (Pb) l’acétate de plomb est administré à 30
mg/kg/PC/j (Elgawish et Abdelrazek, 2014) en volume de 1 ml d’eau distillé et le quatrième groupe
(P + Pb) ont reçus l’acétate de plomb de 30 mg/kg/bw/j en association avec 100 mg/kg/PC/j d’un
extrait hydro-éthanolique de pollen d’abeille (Eraslan et al., 2009a; Eraslan et al., 2009b; Bharti et al.,
2017).
9
Introduction à l'expérimentation et au traitement informatique des données
Indice :
Expérience exploratoire ;
Expérience confirmatoire ;
Les deux.
Indice :
Plan simple ;
Plan croisé ;
Plan fractionné.
Indice :
Bien conçues ;
Exécutées efficacement ;
Correctement analysées ;
Clairement présentées ;
Correctement interprétées.
Indice :
Connaissance de la conception expérimentale et les statistiques ;
Description complète des modèles expérimentaux et des méthodes statistiques ;
Les objectifs de la recherche et/ou les hypothèses à tester ;
La raison du choix de leur modèle ;
Les détails de chaque expérience distincte signalée,
La conception de l’étude et le nombre d’unités statistiques utilisés ;
Les méthodes statistiques utilisées pour l’analyse.
10
II Traitement des données expérimentales
1. Le traitement des données
Objectifs
Lors de cet apprentissage vous allez atteindre les objectifs suivants :
1. Objectifs spécifiques des connaissance :
Connaître les étapes et les types du traitement des données ;
Connaitre les fichiers des données.
2. Objectifs spécifiques des méthodes :
Être capable de déclarer les variables.
3. Objectifs spécifiques des attitudes :
Être capables d'enregistrer et manipuler les données.
Exemple
Dans l’analyse des données, on distingue habituellement :
L’analyse univariée, qui porte sur l’étude des variables prises une à une dans la
présentation et l’interprétation ;
L’analyse bivariée, qui a pour objectif d’examiner les relations de deux variables en
même temps ;
L’analyse multivariée, qui vise l’étude de plusieurs variables en même temps.
Fondamental
Le traitement des données passe par trois étapes cruciale :
Collecte des données ;
Analyse des données ;
Présentation des données.
11
Traitement des données expérimentales
Exemple
Différents fichiers ont des extensions différentes :
Fichier SPSS ;
Fichier Excel ;
Fichier CSV ;
Fichier SAS…
12
Traitement des données expérimentales
Plage Définition
Vous pouvez également lire une plage de cellules. Utilisez la même méthode pour spécifier
des plages de cellules que celle que vous utiliseriez dans Excel. Par exemple : A1:D10.
Vous pouvez lire le nom des variables sur la première ligne du fichier ou sur la première ligne
de la plage définie. Les valeurs qui ne sont pas conformes aux règles de dénomination de
variable sont converties en noms de variable valides et les noms initiaux sont utilisés comme
libellés de variables.
13
Traitement des données expérimentales
14
Traitement des données expérimentales
Attention
En cas de rupture de courant ou l'ordinateur est éteint les données serons perdus.
Fondamental
Les règles suivantes s'appliquent pour les noms des variables :
Chaque nom de variable doit être unique ;
Les noms de variable peuvent contenir jusqu'à 64 octets, le premier caractère étant une
lettre ou l'un des caractères suivants : @, # ou $. Les caractères suivants peuvent être
une combinaison de lettres, de chiffres, un point (.) et des caractères autres que ceux
de ponctuation. En mode page de code, soixante-quatre octets correspondent à 64
caractères dans les langues sur un octet (anglais, français, allemand, espagnol, italien,
hébreu, russe, grec, arabe et thaï par exemple) et à 32 caractères dans les langues sur
deux octets (japonais, chinois et coréen par exemple).
Les noms de variable ne doivent pas contenir d'espaces.
Le caractère # au début du nom de la variable désigne une variable temporaire. Vous ne
pouvez créer des variables temporaires qu'avec une syntaxe de commande. Vous ne
pouvez pas entrer le signe # comme premier caractère d'une variable dans une boîte de
dialogue de création de variables.
Le symbole $ en début de nom indique que la variable est une variable système. Vous
ne pouvez pas utiliser le symbole $ comme premier caractère d'une variable définie par
l'utilisateur.
Le point, le trait de soulignement et les caractères $, # et @ peuvent être utilisés dans
les noms de variable. Par exemple, A._$@#1 est un nom de variable valide.
Evitez les noms de variable se terminant par un point car celui-ci peut être interprété
comme un caractère de fin de commande. Vous ne pouvez créer des variables se
terminant par un point que dans une syntaxe de commande. Vous ne pouvez pas créer
de variables se terminant par un point dans une boîte de dialogue de création de
variables.
Evitez d'utiliser des noms de variable se terminant par des traits de soulignement, étant
donné que ceux-ci peuvent entrer en conflit avec des noms de variable
automatiquement créés par les commandes et les procédures.
Les mots clés réservés ne peuvent pas être utilisés pour les noms de variables : Les
mots clés réservés sont ALL, AND, BY, EQ, GE, GT, LE, LT, NE, NOT, OR, TO et WITH.
Les noms de variables peuvent être définis par n'importe quelle combinaison de
majuscules et de minuscules. La casse est respectée pour des raisons d'affichage.
Lorsque des noms longs de variable occupent plusieurs lignes au niveau de la sortie,
les sauts de ligne sont segmentés au niveau des traits de soulignement, des virgules et
des passages de minuscule à majuscule.
15
Traitement des données expérimentales
Remarque
Les lettres incluent tout caractère autre que ceux de ponctuation utilisé dans l'écriture de
mots courants dans les langues prises en charge dans le jeu de caractères de la plateforme.
1.6. Exercice
Énoncé
Lire le passage ci-dessous et répondre aux question.
Étude statistique
L’analyse statistique a été conduite de façon descriptive pour les caractéristiques générales des
enquêtes et d’inférence pour les données nutritionnelles.
Les données sur les caractéristiques générales obtenues, ainsi que les données alimentaires ont
été saisies, après avoir été convertis, à l’aide de Microsoft office Excel 2013. Les analyses ont été
établies à l’aide du logiciel, IBM SPSS version 22.
Les outils appliqués comprennent :
Les moyennes des apports nutritionnels ainsi ont été comparées à l’aide de l’analyse de la
variance, et du test a posteriori de Bonferroni et par le test du χ2 pour les pourcentages (%).
L’analyse des composantes principales a permis l’évaluation des facteurs expliquant la distribution
des apports nutritionnels. Le niveau de significativité est de 0,05.
16
Traitement des données expérimentales
Fondamental
Le traitement de jeux de données écologiques complexes nécessite presque toujours
l'utilisation d'un ordinateur, tant pour la quantité de données à traiter que pour le fait que les
opérations à effectuer sont souvent fastidieuses et répétitives. Le travail avec des ordinateurs
est rendu simple par les programmes et logiciels statistiques disponibles sur les micro-
ordinateurs ou sur les ordinateurs centraux. Pour ceux qui souhaitent développer de nouvelles
méthodes, des langages de programmation avancés tels que S-PLUS ou MATLAB, ou le
langage SAS, peuvent être extrêmement utiles. On peut aussi compléter des programmes
écrits dans l'un des langages informatiques standard avec des sous-programmes statistiques
tirés de bibliothèques telles que NAG ou IMSL, qui sont disponibles dans les centres de calcul
et contiennent des sous-programmes pour la résolution numérique des problèmes
numériques les plus courants. La facilité d'utilisation des ordinateurs présente cependant
deux écueils que les écologistes doivent garder à l'esprit : le fait que les calculs soient
exécutés ne garantit pas que les données satisfassent aux conditions requises par la
méthode, ou que les résultats produits par l'ordinateur sont interprétés correctement en
termes écologiques.
Exemple
Les logiciels de traitement des données sont nombreux :
Le tableur Excel, produit par Microsoft, est sûrement le plus connu et le plus utilisé ; la
version la plus récente contient une partie des procédures statistiques utilisées dans
les analyses des données.
Le logiciel StatBox et Question, mis au point par la fime Grimmer Logiciels, sont des
logiciels conçus spécialement pour l’analyse des données d’enquête ; ces logiciels
fonctionnent à partir du logiciel Excel de Microsoft.
Le logiciel Sphinx, dont le concepteur est Jean Moscarola, professeur à Grenoble, est
un logiciel utilisé surtout pour la recherche marketing.
Le logiciel Minitab est un logiciel statistique puissant qui propose un grand nombre de
procédures statistiques.
17
Traitement des données expérimentales
Le logiciel SAS (système d’analyse statistique) a été conçu au départ pour le calcul
économique et les modèles de régression ; par la suite, on l’a adapté de façon à y
inclure les méthodes les plus connues de l’analyse des données.
Le logiciel SPSS (Statistical Package for the Social Sciences) a été créé, au tout début,
pour les besoins des psychologues. Avec le temps (cette entreprise existe depuis
1965), on a intégré un grand nombre de procédures statistiques tout en facilitant le
travail de manipulation des données.
Historique Rappel
les progiciels statistiques les plus répandus étaient BMDP® (Biomedical Computer
Programs), SPSS® (Statistical Package for the Social Sciences) et SAS® (Statistical
Analysis System). Des versions de ces packages, initialement développées pour les
ordinateurs centraux, sont désormais également disponibles pour les micro-ordinateurs. Un
large éventail d'autres programmes et packages ont également été développés pour les
micro-ordinateurs, offrant aux utilisateurs un large choix. La sélection d'un package donné
pour une tâche spécifique peut être guidée par sa disponibilité pour la machine préférée de
l'utilisateur, les méthodes qu'il contient et sa convivialité informatique. Dans le travail
quotidien, les écologistes s'appuient aujourd'hui sur plusieurs packages, chacun spécialisé
pour des tâches spécifiques telles que le regroupement, l'ordination, l'analyse canonique,
l'analyse de séries chronologiques, l'analyse spatiale, les graphiques, la cartographie, le
traitement de texte, etc. les tâches d'analyse de données, les machines haut de gamme ou les
ordinateurs centraux conservent leur utilité pour analyser de grandes bases de données ou
pour des méthodes de test statistique à base de permutation et à forte intensité
informatique.
b) Logiciels spécialisés
Pour l'analyse multivariée, trois programmes clés doivent être mentionnés : Canoco, PRIMER et PC-
ORD. Tous les programmes d'arbres sont des outils populaires pour l'analyse multivariée, mais
l'utilisateur aura besoin d'au moins un autre programme pour l'exploration des données et les
méthodes univariées.
Canoco Exemple
Canoco pour Windows est un outil logiciel pour l'ordination contrainte et non contrainte. Les
méthodes d'ordination sont intégrées à la méthodologie de régression et de permutation, afin
de permettre une modélisation statistique solide des données écologiques. Canoco contient
à la fois des méthodes linéaires et unimodales, notamment DCA, PCA, CCA, RDA, db-RDA ou
PCoA. Les diagrammes d'ordination peuvent être affichés peuvent être affichés et exportés en
qualité de publication juste après la fin d'une analyse. Canoco est unique dans sa capacité à
tenir compte de la variation de fond spécifiée par les covariables et dans ses installations
18
Traitement des données expérimentales
étendues pour les tests de permutation, y compris les tests des effets d'interaction. Canoco a
été conçu pour les écologistes, mais il est également utilisé en toxicologie, en science du sol,
en géologie ou en recherche en santé publique, pour n'en nommer que quelques-uns.
PRIMER Exemple
PRIMER est populaire dans les domaines benthiques marins, et ses principaux atouts sont
des mesures d'association combinées avec ANOSIM, BVSTEP et des méthodes d'auteur qui
effectuent des tests de permutation. PRIMER a également été conçu dans un souci de facilité
d'utilisation et ne fournit que les outils d'analyse les plus robustes, ce qui en fait un bon choix
pour les moins expérimentés.
PC-ORD Exemple
PC-ORD est un programme Windows qui effectue une analyse multivariée des données
écologiques saisies dans des tableurs. Il met l'accent sur les outils non paramétriques, la
représentation graphique et les tests de randomisation pour l'analyse des données
communautaires. En plus des utilitaires de transformation des données et de gestion des
fichiers, PC-ORD offre de nombreuses techniques d'ordination et de classification qui ne sont
pas disponibles dans d'autres progiciels statistiques majeurs. De très grands ensembles de
données peuvent être analysés. La plupart des opérations acceptent une matrice jusqu'à
32000 lignes ou 32000 colonnes à condition que vous ayez suffisamment de mémoire dans
votre machine. La terminologie est adaptée aux écologistes.
Complément
D'autres programmes multivariés axés sur l'analyse écologique sont le PATN, le MVSP, le CAP
et l'ECOM. Les deux derniers proviennent de Pisces conservation Ltd. Cependant, les auteurs
ont peu ou pas d'expérience avec ces programmes.
19
Traitement des données expérimentales
Conseil
Tous les logiciels statistiques se ressemblent. Quatre éléments vont surtout jouer dans le
choix d’un logiciel de traitement des données :
L’apprentissage : le logiciel dans lequel on a appris le traitement des données a une
certaine longueur d’avance sur les autres (on évite de réapprendre le maniement d’un
logiciel).
L’accessibilité : le produit est-il accessible dans notre ville ou dans notre région ?
La maniabilité : la simplicité dans l’entrée des données et dans les commandes
générales et particulières.
Le coût du logiciel.
Complément
Des revues du contenu des principaux progiciels statistiques disponibles sur le marché
peuvent être trouvées dans des revues statistiques, par exemple « The American
Statistician », « Applied Statistics » ou « Statistics and Computing ».
Exemple
Le tableau ci-dessous contient une liste de certaines méthodes statistiques et montre quels
programmes peuvent être utilisés pour chaque méthode. Il convient de noter que plusieurs
autres programmes peuvent effectuer la majorité de ces méthodes statistiques.
Exploration de données IR ✔️ ✔️ ✔️
Régression linéaire R ✔️ ✔️ ✔️ ✔️
Régression linéaire partielle R SS ✔️ SS
20
Traitement des données expérimentales
Modélisation mixte R ✔️ ✔️
Moindres carrés généralisés
GLS
R ✔️ ✔️
Modèles d'arbres R ✔️ ✔️
Les réseaux de neurones R SS ✔️ ✔️
Mesures d'association IR ✔️ ✔️ ✔️ ✔️ ✔️
Analyse en composante
principale
✔️ ✔️ ✔️ ✔️ ✔️ ✔️
Analyse de redondance ✔️ ✔️ ✔️
Analyse de redondance partielle ✔️ ✔️ ✔️
Analyse des correspondance ✔️ ✔️ ✔️ ✔️ ✔️ ✔️
Analyse de corrélation
canonique
✔️ ✔️ ✔️ ✔️
Analyse de corrélation
canonique partielle
✔️ ✔️ ✔️
Analyse discriminante ✔️ ✔️ ✔️ ✔️ ✔️
Mise à l'échelle
multidimensionnelle non ✔️ ✔️ ✔️ ✔️ ✔️
métrique
Analyse morphométrique
géométrique
✔️ SC ✔️ SC
Désaisonnalisation ✔️ ✔️ ✔️
Lissage répété de LOESS R SC SC
Analyse factorielle
d'autocorrélation Min/max ✔️ SC SC
MAFA
Regroupement chronologique ✔️ SC SC
Radar d'ouverture
synthétique
R ✔️
Statistiques
Moyenne mobile
spatiales
spatiale
R ✔️
Variogrammes R ✔️ ✔️
21
Traitement des données expérimentales
Variogramme de
surface
R ✔️ ✔️
Krigeage R ✔️ ✔️
Tableau 1 Comparaison de quelques programmes statistiques
Parmi les exemples suivants identifiez les logiciels généralisés et ceux spécialisés.
22
Traitement des données expérimentales
23
III Les outils de l'analyse des données
1. Modèles linéaires générales
Objectifs
À l'issue de cette activité d'apprentissage l'étudient va atteindre les objectifs suivants :
1. Objectifs spécifiques des connaissances :
Connaître l'utilité des MLG;
Connaître la démarche d'une analyse du MLG ;
2. Objectifs spécifiques des méthodes :
Être capable de conduire une analyse du MLG ;
Être capable d'interpréter une analyse du MLG ;
3. Objectifs spécifique d'attitude :
Être capable d'étudier les effets de facteurs et leurs interactions en utilisant une MLG.
Exemple
l'effet des huiles diététiques sur les taux lipidiques de triglycérides dans le cerveau des rats.
Soixante-douze rats ont été divisés en six groupes et ont reçu des régimes alimentaires
composés de composants de différents types d'huiles. Le résultat d'intérêt était le taux de
triglycérides dans le cerveau des rats. Les résultats
de l'étude sont résumées dans le tableau ci-dessous [3] p.66.
Groupe n TG (mg/g protéine)
24
Les outils de l'analyse des données
Conditions Fondamental
Pour réaliser ANOVA 1 il faut :
Une variable dépendante quantitative continue (appelée aussi variable réponse, cible ou
résultats) ;
Une seule variable indépendante (appelée aussi groupe, facteur ou prédicteur) ;
Indépendance des observations (pas de mesure répétée) :
La variable dépendante doit être distribuée normalement, symétrique et unimodale
dans chaque groupe ;
Homogénéité de la variance entre les groupe.
Exemple
Teneur du nitrogène
Variété 1
Variété 2
25
Les outils de l'analyse des données
Exemple
On dispose de 3 variétés différentes de la lavande et on veut faire une extraction alcoolique
des flavonoïdes totaux en utilisant 3 solvants différents. le fait de varier les solvant ajout un
élément à l'expérience, on est alors en présence d'un deuxième facteur.
Lavendula Dentata 45 43 51
Lavendula multifida 47 46 52
Lavendula Stoica 48 50 55
Exemple
On prend l'exemple précédant, les plantes sont issus de trois forêts différentes, Notre budget
est limité et on ne dispose pas des moyens pour réaliser Le plan randomisé à blocs
aléatoires.
Tableau 5 Teneur des flavonoïdes totaux en fonction des espèces des organes et des forêts
26
Les outils de l'analyse des données
Exemple
On veut étudier simultanément les espèces de plante (I = 3 modalités) et la concentration
d’engrais (K = 3 modalités) sur la production (Y) de fraise. Pour ce faire on dispose disons de
J = 3 champs ( ou blocs). Il y a en tout 9 traitements (plants, concentration) et on dispose de
3 blocs pour réaliser l’expérience.
Pour planifier cette expérience on pourrait utiliser un plan randomisé avec blocs. On diviserait
chaque champ en 9 parcelles et on randomiserait les 9 traitements dans chaque bloc.
Supposons maintenant qu’un des deux facteurs, disons concentration, est plus important et
que l’on aimerait réduire au maximum l’erreur expérimentale pour ce facteur. On pourrait
procéder en deux temps:
1. On divise chaque bloc en 3 grandes parcelles et on randomise les modalités de plante
dans chaque grande parcelle. On dispose ainsi de 9 grandes parcelles et un schéma
avec blocs est utilisé pour comparer les modalités de plant (unité d’observation=grande
parcelle).
2. Pour assigner la modalité de concentration, on traite chaque grande parcelle comme un
bloc. On la divise en 3 et on assigne au hasard une concentration `a chaque sous-
parcelle (unité d’observation=sous-parcelle).
Avec ce type d’expérience il y a deux niveaux d’analyse. Pour le facteur plant les unités
d’observation sont les grandes parcelles et on a un plan avec blocs ordinaire. Par contre, pour
concentration, et l’interaction plante × concentration les unités sont les sous parcelles. Donc il
y a deux parties `a l’analyse; une est intra grande parcelles l’autre est inter grande parcelles.
Exemple
Traitement Sujet T1 T2 T3 T4
1 1
1 2
1 3
2 4
2 5
27
Les outils de l'analyse des données
Traitement Sujet T1 T2 T3 T4
2 6
3 7
3 8
3 9
Exemple
1 2 3 4 5
Phase 1 A P A P A
Phase 2 P A P A P
Interactions Définition
L'ANOVA vous permet de tester non seulement les variables individuelles, mais également
leurs combinaisons. C'est une préoccupation importante. Les combinaisons de variables ont
parfois un effet différent de celui que vous attendez des variables seules. Cet effet est
important et, en tant qu'expérimentateurs, nous voulons le savoir. En termes statistiques, on
dit qu'il y a un effet d'interaction entre la variable X et la variable Y.
28
Les outils de l'analyse des données
Interaction Exemple
Graphique 8 Interaction
Moyennes dans une ANOVA à deux facteurs, montrant divers effets des deux facteurs et leur
interaction. (a) Aucun effet du facteur A (indiqué par les signes plus à la même hauteur
verticale sur l'axe X), un petit effet du facteur B (observé comme les cercles étant seulement
à une petite distance l'un de l'autre verticalement), et aucune interaction des facteurs A et B
(vus comme les lignes étant parallèles). (b) Grand effet du facteur A, petit effet du facteur B et
aucune interaction (ce qui est le cas dans la figure 1). (c) Aucun effet de A, effet important de
B et aucune interaction. (d) Grand effet de A, grand effet de B et aucune interaction. (e) Aucun
effet de A, aucun effet de B, mais interaction entre A et B. (f) Grand effet de A, aucun effet de
B, avec une légère interaction. (g) Aucun effet de A, grand effet de B, avec grande interaction.
(h) Effet de A, grand effet de B, avec grande interaction.
🚹 🚺 🚹 🚺 🚹 🚺
Espèce 2
🚹 🚺 🚹 🚺 🚹 🚺
29
Les outils de l'analyse des données
Espèce 1
🚹 🚺 🚹 🚺 🚹 🚺
Espèce 3
🚹 🚺 🚹 🚺 🚹 🚺
Fondamental
Analyse de deux facteurs ou plus dans une hiérarchie répliquée avec des niveaux de chacun
imbriqués dans (appartenant à) des niveaux du suivant
1. Modèle hiérarchique à deux facteurs ;
2. Modèle hiérarchique à trois facteurs.
Exemple
Conditions Fondamental
Pour réaliser ANOVA hiérarchique il faut :
Une variable dépendante quantitative continue (appelée aussi réponse ou résultats) ;
Deux variables indépendantes ou plus (appelée aussi groupes, facteurs ou
prédicteurs) ;
30
Les outils de l'analyse des données
Exemple
Année
31
Les outils de l'analyse des données
Fondamental
on peut effectuer une analyse de la covariance lorsque l’on dispose d’observations sur une ou
plusieurs variables corrélées provenant de chaque unité expérimentale, ainsi que
d’observations sur la variable de réponse considérée. Ces variables additionnelles reliées sont
appelées covariables ou variables accessoires ou concomitantes. Il est indispensable qu’elles
soient associées à la variable à l’étude. Par exemple, dans les essais de rendement, la
variation du volume sur pied initial due à des facteurs externes, les effets résiduels des
plantes antérieurement cultivées sur le site etc…, peuvent faire office de covariables.
Exemple
x y x y x y
Tableau 11 Hauteur initiale (x) et hauteur quatre mois plus tard (y), en
cm, de trois variétés de Leucaena leucocephala
Exemple
Gousses Feuilles
32
Les outils de l'analyse des données
Conditions Fondamental
4 statistiques sont usuellement proposées :
La trace de Pillai : P
Le lambda de Wilks : W
La trace d’Hotelling : H
La plus grande racine de Roy : R.
Propriétés des statistiques :
0 ≤ P, P ↑ quand l’effet ↑
0 ≤ W ≤ 1, W ↓ quand l’effet ↑
0 ≤ H, H ↑ quand l’effet ↑
P<H et P ≈ H ⇒ le facteur a peu d’effet
0 ≤ R, R ↑ quand l’effet ↑ et R<H
R ≈ H ⇒ le facteur a peu d’effet ou les VD sont très liées ou l’effet ne concerne qu’une
VD.
Définition
MANCOVA est une combinaison entre l'analyse multivariée et l'analyse de la covariance
Exemple
Polyphénols
T° Sucres
Organes Proline solubles Protéines Lipides
totaux
33
Les outils de l'analyse des données
2. Corrélation
Objectifs
À l'issue de cette activité d'apprentissage l'étudient va atteindre les objectifs suivants :
1. Objectifs spécifiques des connaissances :
Connaître l'utilité de la corrélation ;
Connaitre les différents types des corrélations ;
Connaître la démarche d'un test de corrélation ;
2. Objectifs spécifiques des méthodes :
Être capable de conduire un test de corrélation ;
Être capable d'interpréter une corrélation ;
3. Objectifs spécifique d'attitude :
Être capable d'étudier l'association des descripteurs en utilisant une corrélation.
Corrélation Définition
La relation entre deux variables peut être celle d'une dépendance fonctionnelle de l'une par
rapport à l'autre. Autrement dit, la magnitude de l'une des variables (la variable dépendante)
est supposée être déterminée par la magnitude de la deuxième variable (la variable
indépendante), alors que l'inverse n'est pas vrai.
Exemple
Dans la relation entre la pression artérielle et l'âge chez l'homme, la pression artérielle peut
être considérée comme la variable dépendante et l'âge comme la variable indépendante ;
nous pouvons raisonnablement supposer que bien que l'ampleur de la pression artérielle
d'une personne puisse être fonction de l'âge, l'âge n'est pas déterminé par la pression
artérielle. Cela ne veut pas dire que l'âge est le seul déterminant biologique de la pression
artérielle, mais nous le considérons comme un facteur déterminant.
34
Les outils de l'analyse des données
Remarque
Le terme dépendant n'implique pas nécessairement une relation de cause à effet entre les
deux variables.
Régression Définition
La régression est une méthode d'analyse utilisée dans des études observationnelles pour
prédire ou expliquer une variables dite dépendante selon une ou plusieurs variables dites
indépendantes ou prédicteurs.
Attention
On ne peux pas utiliser la régression entre deux variable sauf si elles sont corrélées.
Définition
La corrélation de Pearson est une analyse d'association entre deux variables quantitatives
selon les conditions ci-dessous :
Conditions Fondamental
Effectif supérieur ou égale à 30 ;
distribution normale des deux variables ;
pas de valeurs manquantes ;
Indépendance des observations.
Coefficient r de Pearson
(cf. Test de corrélation de Pearson.mp4)
(cf. Test de corrélation (Pearson).pdf)
35
Les outils de l'analyse des données
Définition
La corrélation de Pearson est une analyse d'association entre deux variables quantitatives
selon les conditions ci-dessous :
Conditions Fondamental
Effectif strictement inférieur à 30 ;
Effectif supérieur ou égal à 12 ;
Non respect de la distribution normale des deux variables ;
pas de valeurs manquantes ;
Indépendance des observations.
Méthode
τ= 1
C−D
n(n−1)
2
Formule 1
Conditions Complément
Pour réaliser la corrélation de Kendall il faut :
Interprétation des résultats selon la concordance et la discordances des paires ;
En cas de deux variables ordinales ;
Taille de l'échantillon moins de 12.
36
Les outils de l'analyse des données
Fondamental
En se basant sur le principe qu'une variable qualitative est dans l'origine une variable
quantitative
Exemple
La variable diabète est à l'origine une variable quantitative qui est la glycémie à certain seuil
on dit que la personne est diabétique au dessous de ce seuil on dit que la personne est non
diabétique.
Définition
La corrélation bi-sérique est une analyse d'association entre une variable qualitative binaire et
une variable quantitative.
Méthode
ρ bis
= r
√ pq
Formule 2
Définition
Le coefficient de corrélation multiple mesure l'intensité de la relation entre une variable
réponse et une combinaison linéaire de plusieurs variables explicatives.
Complément
Le carré du coefficient de corrélation multiple, appelé coefficient de détermination multiple
(R2), mesure la fraction de la variance de la variable réponse ( yk ) qui s'explique par une
combinaison linéaire des variables explicatives : y1 y2, …, yj, … et yp.
37
Les outils de l'analyse des données
Exemple
Un coefficient R2 = 0,73, par exemple, signifierait que les relations linéaires des variables y1,
y2, …, yj, … et yp avec yk expliquent 73 % de la variabilité de yk autour de sa moyenne. Le
coefficient de corrélation multiple (R) est la racine carrée du coefficient de détermination
multiple :
Rappel
Le coefficient de détermination multiple est l'extension, au cas multidimensionnel, du
coefficient de détermination entre deux variables.
Méthode
Le coefficient de corrélation multiple peut être calculé à partir de la matrice des corrélations
entre les variables explicatives et du vecteur des corrélations entre les variables explicatives
et de réponse. Il peut être calculé aussi à partir du déterminant de la matrice des corrélations
entre variables explicatives et de celui de la matrice des corrélations entre toutes les
variables impliquées. Il peut être calculé aussi à partir du produit d'une série de compléments
de coefficients de détermination partielle.
Fondamental
R1.23 explique l'impacte multiple des variables indépendantes x2 et x3 sur la variable
dépendante x1 ;
R2.13 explique l'impacte multiple des variables indépendantes x1 et x3 sur la variable
dépendante x2 ;
R3.12 explique l'impacte multiple des variables indépendantes x1 et x2 sur la variable
dépendante x3.
38
2.7. Corrélation partielle
A =
A =
R 1.23 = √
R 1.23 = √
∣
é
Soitlamatricedecorr lationde3variablesx 1 ,x 2 etx 3 :
0,4
0,8
R 1.23 = √
1
r 11
r 21
r 31
R 1.23 = √
0,4
R 1.23 = √ 0,64
R 1.23 = 0,8
Formule 3
1
0,5
r 12
r 22
r 32
2
0,8
0,5
r 13
r 23
r 33
1
(r 12 ) +(r 13 ) −2×r 12 ×r 13 ×r 23
1−(r 23 )
2
(0,4) +(0,8) −2×0,4×0,8×0,5
1−(0,5)
0,16+0,64−0,32
1−0,25
0,48
0,75
2
2
Les outils de l'analyse des données
La corrélation partielle est l'analyse d'association entre deux variables après exclusion de
leurs association linéaire due à d'autres variables.
Définition
Exemple
39
Les outils de l'analyse des données
3. Régression
Objectifs
A =
A =
r 23.1 =
r 23.1 =
∣
r 23.1 =
r 23.1 =
é
Soitlamatricedecorr lationde3variablesx 1 ,x 2 etx 3 :
0,70
0,61
r 11
r 21
r 31
√ 1−r
0,70
0,40
r 12
r 22
r 32
2
√ 1−(0,70) ×√ 1−(0,61)
0,40−0,427
√ 1−0,49×√ 1−0,3721
−0,027
√0,51×√ 0,6279
r 23.1 =
r 23.1 = −0,048
Formule 4
−0,027
0,566
0,61
0,40
r 13
r 23
r 33
r 23 −r 12 ×r 13
2
12
0,40−0,70×0,61
×√ 1−r
2
13
2
Méthode
40
1. Objectifs spécifiques des connaissances :
Connaître l'intérêt de la régression ;
Connaitre les différents types des régressions ;
Connaître la démarche d'une régression ;
Faire la différence entre la corrélation et la régression.
2. Objectifs spécifiques des méthodes :
Être capable de conduire un test de corrélation ;
Être capable d'interpréter une corrélation ;
3. Objectifs spécifique d'attitude :
Être capable d'étudier les effets des facteurs en utilisant une régression.
Fondamental
Le principe est de donner une équation de l'ordre de :
y = a x +b
qui explique la variation de y en fonction de x et qui sert à prédire y à partir de x ou de prédire
x à partir de y.
b = ȳ − a × x̄
y = ax + b + ϵ
Formule 5
Exemple
Longueur de l'aile
Âge (jours)
(cm)
3 1,4
4 1,5
5 2,2
6 2,4
8 3,1
9 3,2
10 3,2
11 3,9
12 4,1
14 4,7
15 4,5
16 5,2
17 5,0
41
Les outils de l'analyse des données
Prédiction Méthode
b ± t α(2),(n−2) s y
^
LI = b − t α(2),(n−2) s y
^
LS = b + t α(2),(n−2) s y
^
2
1 (x i −x̄)
2
sy
^
= √ s xy ( + n
2
)
n ∑ x
i=1
n 2
(∑ xy)
n 2 i=1
(∑ y − n
)
i=1 2
∑ x
i=1
s xy =
n−2
42
Les outils de l'analyse des données
Tableau 15 Calcule de la prédiction de la taille de l'aile d'un moineau d'un âge de 13 jours
43
Les outils de l'analyse des données
Résidus Complément
Le résidu est l'écart entre la valeurs prédite et une valeur observée.
ϵ=y i
− y
^
Formule 6
a : homosocialité ;
b : hétérosocialité ;
c : erreur de calcul ou relation nécessite une autre variable ;
d : relation non linéaire.
Graphique 12 Régression
3.2. Colinéarité
Colinéarité Définition
La colinéarité est l'existence de corrélation significative entre les variables indépendantes
supérieur à 0,7.
Graphique 13 Colinéarité
Déterminant Définition
44
Les outils de l'analyse des données
équation de régression multiple. Comme dans la régression linéaire simple, c'est le rapport de
la somme des carrés des distances des valeurs estimées ^y à la moyenne y, à la somme des
carrés des distances des valeurs de la variable de réponse d'origine y à la moyenne : y
Méthode
n 2
¯ ∑ (y
ˆi −y )
2 i=1
R = n 2
¯
∑ (y i −y )
i=1
Formule 7
Tolérance
La tolérance est
é
T ol rance = 1 − R
2
Formule 8
Formule 9
Définition
L'analyse en composantes principales (ACP) est une méthode multivariée dont le but est de
décrire les relations existant entre les colonnes d’un tableau à plusieurs variables et
s’applique à un ensemble de variables numériques. L'ACP est très pratique lorsque l'on
travaille sur un ensemble d'observations ayant des valeurs quantitatives. Le tableau de départ
pour l'ACP comporte les individus (ou objets) en ligne et les variables en colonne, avec, dans
chaque case, la valeur numérique de l'individu pour la variable concernée. L'algorithme de
45
Les outils de l'analyse des données
Exemple
la caractérisation morphologique et de production des arbres (cas du karité) concerne
souvent un nombre d’arbres suffisamment élevé avec relativement plus de variables.
L’exemple ci-dessous est relatif à 16 arbres et 9 variables.
Il est évidemment plus fastidieux voire impossible de résumer à vue d’œil l’information en
décrivant les caractéristiques morphologiques et de production du karité. Dans ces
conditions on devra recourir aux méthodes multivariées.
46
Les outils de l'analyse des données
Pt : Poids total des fruits (kg par arbre) ; Pm : Poids moyen de fruits par arbre (g) ; Ht : hauteur
totale de l’arbre (m) ; Hf : hauteur fût de l’arbre (m) ; Hhoup : hauteur houppier de l’arbre (m) ; DPH :
Diamètre à 1,3 m de l’arbre (cm) ; G : surface terrière de l’arbre (m2/ha); Dhoup : diamètre du
houppier de l’arbre (m).
c) Tracé d'effondrement
Autant de facteurs que de variables mesurées peuvent être extraits pour l'analyse factorielle
exploratoire (AFE), mais il est généralement possible d'expliquer la majorité de la variance avec un
plus petit nombre de facteurs. Le problème se pose de déterminer le nombre exact de facteurs à
retenir pour l'interprétation.
Un équilibre délicat entre exhaustivité et parcimonie est nécessaire pour parvenir à une solution
interprétable. Malheureusement, aucune méthode infaillible pour déterminer le "vrai" nombre de
facteurs à retenir n'a été découverte
47
Les outils de l'analyse des données
Exemple
Pour la solution initiale, il y a autant de composantes que de variables, et dans une analyse de
corrélations, la somme des valeurs propres est égale au nombre de composantes. Vous avez
demandé que les valeurs propres supérieures à 1 soient extraites, de sorte que les trois
premières composantes principales forment la solution extraite.
% de la
Composante Total % cumulé
variance
3 0,78 8,67
4 0,31 3,51
5 0,24 2,67
6 0,07 0,84
7 0,01 0,16
Exemple
% de la
Composante Total % cumulé
variance
48
Les outils de l'analyse des données
Exemple
% de la
Composante Total % cumulé
variance
Complément
Dans le cas présent, la première composante résume 69 % du tableau et la seconde 15 %,
l'information représentée sur le graphique est de 84 %. L'information « perdue » est donc de 16
%. L'ACP permet ainsi de mettre en évidence la structuration de ces variables en montrant le
regroupement des observations selon des combinaisons de variables. Les axes du graphique
ne correspondent généralement pas à l'une ou l'autre des variables mais à un regroupement
optimal de plusieurs variables : l’âge, le poids total des fruits, le poids moyen de fruits par
arbre, la hauteur totale de l’arbre, la hauteur fût de l’arbre, la hauteur houppier de l’arbre, le
diamètre de l’arbre à 1,3 m et la surface terrière des arbres de karité participent ensemble à la
formation de l’axe 1 dans la mesure où elles sont fortement corrélées à cet axe. La hauteur
fût de l’arbre et le diamètre du houppier des arbres de karité participent ensemble à la
formation de l’axe 2.
Composantes
Variables 1 2
49
Les outils de l'analyse des données
Composantes
Variables 1 2
Composantes
Variables 1 2
50
Les outils de l'analyse des données
f) Carte factorielle
Fondamental
L’analyse en composantes principales appliquée à cette matrice va résumer l’information sur
la morphologie et la production des 16 arbres en décrivant les relations entre les 9 variables
considérées. Cela se fait à travers un positionnement des arbres sur un plan en deux
dimensions, en fonction de leurs valeurs pour deux ou plusieurs macro-variables appelées
composantes principales ou axes.
51
Les outils de l'analyse des données
g) Interprétation de l'ACP
La première composante est celle qui résume le mieux les informations contenues dans le tableau
en concentrant le plus d’information. La deuxième apporte un pourcentage d'information inférieur
mais complémentaire, et ainsi de suite. La somme des pourcentages d'explication des
composantes permet de déduire le taux de déperdition d'information à partir des données de base.
Ainsi, la première composante résume 62 % du tableau et la seconde 21 %, l'information
représentée sur le graphique est de 83 %. L’information « perdue » est donc de 17 % sur 9
dimensions (neuf variables) réduit à deux dimensions (deux axes), néanmoins, une meilleure vue
d'ensemble est acquise. Généralement, on estime qu’une concentration d’information de 50 % du
tableau de départ est suffisante pour garantir une précision d’analyse et sert de critère de choix du
nombre de composantes principales à retenir. Les points individus sont représentés sur le
graphique en fonction de leurs coordonnées sur les axes. Plus deux individus sont semblables par
rapport aux variables mesurées, plus ils sont proches sur le diagramme d’ordination. Les variables
sont également représentées. Les variables sont présentées comme des vecteurs dont la longueur
indique l'importance de la variable. Deux vecteurs qui pointent à peu près dans la même direction
sont corrélés. Leur représentation indique leur corrélation avec les axes, à l'intérieur d'un système
d’axes formant un cercle de corrélation. Ces variables renseignent sur le sens à donner aux axes.
Ainsi, une variable proche du cercle de corrélation (corrélation forte) et proche d'un axe a plus
participé à la formation de cet axe.
52
Les outils de l'analyse des données
Child (2006) 1 p.66a mis en garde contre l'utilisation d'échantillons collectés auprès de différentes
populations pour calculer les corrélations, car les facteurs spécifiques à une population peuvent
être masqués lorsqu'ils sont regroupés. Tabachnick et Fidell (2019) et Comrey et Lee (1992) ont
également mis en garde contre la mise en commun des résultats de plusieurs échantillons ou du
même échantillon mesuré dans le temps. Les procédures d'échantillonnage sont acceptables,
mais il faut bien comprendre les différences entre l'échantillon et la population (Widaman, 2012).
De plus, les réponses négligentes de participants non motivés peuvent introduire un biais. Woods
(2006) a constaté que les résultats de l'analyse factorielle étaient affectés lorsque plus de 10 %
des participants répondaient négligemment. Ainsi, la validité des réponses des participants doit
être prise en compte.
Taille de l'échantillon
Au-delà des participants à inclure dans une ACP, il est également important de savoir combien de
participants inclure. Les coefficients de corrélation ont tendance à être moins fiables lorsqu'ils sont
estimés à partir de petits échantillons. Par exemple, avec une vraie corrélation de population de
zéro et une taille d'échantillon de 100, environ 95 % des corrélations se situeront entre −0,20 et
+0,20. En revanche, environ 95 % des corrélations se situeront entre -0,09 et +0,09 lorsque la taille
de l'échantillon est de 500.
Deux considérations supplémentaires pour déterminer la taille d'échantillon appropriée sont le type
de données et la quantité de données manquantes.
Inertie
Au moins une inertie du plan de 30 % doit expliquer la variation des données, de préférence le taux
d'inertie du plan doit dépasser 50 % pour une meilleur interprétation, quoi qu'un pourcentage
proche de 70 % indique une perte d'information de 30 %.
53
Les outils de l'analyse des données
4.3. Évaluation
Exercice 1 [solution n°14 p. 61]
Qualitatives et quantitatives
Qualitatives
Quantitatives
B Deux individus sont proches s’ils prennent des valeurs proches sur au moins une variable
C Deux individus sont proches s’ils prennent des valeurs proches sur toutes les variables
Parmi les indicateurs suivants, quel(s) est (sont) les indicateurs de liaison entre variables
quantitatives
Coefficient de corrélation
Moyenne
Variance
Écart type
54
Les outils de l'analyse des données
A
Chaque individu prend k valeurs et peut être considéré comme un point dans un espace à
k dimensions
A Deux individus proches dans l’espace global sont nécessairement proche sur le plan 1-2
B Deux individus proches sur le plan 1-2 sont nécessairement proche dans l’espace global
C
Deux individus proches sur le plan 1-2 mais mal projetés sont nécessairement éloignés
dans l’espace global
D
Deux individus éloignés sur le plan 1-2 sont nécessairement éloignés dans l’espace global
E
La qualité de projection d’un individu, mesurée par le cosinus carré, peut s’additionner sur
deux axes uniquement
A
Un individu qui prend des valeurs proches de la moyenne pour toutes les variables ne
contribue à la construction d’aucun axe
55
Les outils de l'analyse des données
C
Un individu qui contribue beaucoup à la construction du premier axe de l’ACP ne peut pas
contribuer beaucoup à la construction du 2ème axe
D
Un individu qui a une forte coordonnée sur un axe contribue beaucoup à la construction de
cet axe
A
Une variable est bien projetée sur un plan si la flèche qui la représente est courte et loin du
cercle des corrélations
B
Deux variables mal projetées sur un plan sont très corrélées (positivement ou
négativement)
C
La qualité de projection d’une variable sur un axe est égale au coefficient de corrélation de
la variable avec l’axe
D
La qualité de projection d’une variable sur un axe est égale au carré du coefficient de
corrélation de la variable avec l’axe
C
Les variables qualitatives supplémentaires sont représentées via leurs modalités sur le
graphe des individus
D
Une modalité de variable qualitative supplémentaire est au barycentre des individus qui
prennent cette modalité dans l’espace global
56
Les outils de l'analyse des données
0%
10 %
25 %
40 %
65 %
0%
10 %
25 %
40 %
65 %
57
Solutions des exercices
[exercice p. 7]
Solution n°1
Choisissez la bonne réponse parmi les options proposées.
Quelle est la principale différence entre une expérience exploratoire et une expérience
confirmatoire?
Le nombre de répétitions ;
L'objectif de l'expérience ;
[exercice p. 7]
Solution n°2
Quel est l'avantage principal d'une expérience confirmatoire?
Elle permet de tester une hypothèse spécifique et de confirmer ou infirmer une théorie ;
[exercice p. 7]
Solution n°3
Quel type d'expérience est le plus approprié pour étudier l'impact d'un changement climatique
sur la distribution géographique d'une espèce végétale?
Expérience exploratoire ;
Expérience confirmatoire.
58
Solutions des exercices
[exercice p. 7]
Solution n°4
Faites correspondre chaque description à la catégorie d'expérience appropriée (exploratoire ou
confirmatoire).
Tester l'efficacité d'un nouvel engrais organique pour augmenter le rendement d'un champ
Confirmatoire
Examiner les relations entre la température et la germination des graines d'une espèce
végétale
Exploratoire
Étudier l'impact d'une sécheresse sur la diversité des espèces végétales dans un écosystème
Exploratoire
[exercice p. 10]
Solution n°5
Il s'agit d'une étude exploratoire car l'objectif est de vérifier l’effet du pollen d’abeille sur la
reprotoxicité masculine d’un métal lourd (Pb) et d’un plastifiant (DBP).
[exercice p. 10]
Solution n°6
Il s'agit d'un plan d'expérience simple car dans chaque groupe (cage)tout les rat on subit le même
traitement et durant toute l'expérience.
[exercice p. 10]
Solution n°7
Discutez entre vous
[exercice p. 10]
Solution n°8
Discutez entre vous
[exercice p. 16]
Solution n°9
Étude descriptive
[exercice p. 16]
Solution n°10
Microsoft Excel 2013 ;
IBM SPSS v 22.
59
Solutions des exercices
[exercice p. 16]
Solution n°11
Analyse de la variance (ANOVA) ;
Test a posteriori de Bonferroni ;
Test du χ2 ;
Analyse des composantes principales (ACP).
[exercice p. 16]
Solution n°12
Le niveau de significativité est de 0,05
[exercice p. 22]
Solution n°13
Parmi les exemples suivants identifiez les logiciels généralisés et ceux spécialisés.
S-PLUS Canoco
MATLAB PRIMER
SAS PC-ORD
StatBox PATN
Sphinx MVSP
SPSS CAP
STATA ECOM
STATISTICA
SYSTAT
Tableau
Minitab
MapInfo
BMDP
Microsoft Office Excel et LibreOffice Calc sont des tableurs alors que l'ACP, l'AFC, CHA et
l'ACM sont des méthodes d'analyses multivariées
60
Solutions des exercices
[exercice p. 54]
Solution n°14
En analyse en composantes principales, les variables sont :
Qualitatives et quantitatives
Qualitatives
Quantitatives
Les variables sont quantitatives même si certaines variables qualitatives peuvent être
utilisés pour aider à interpréter les résultats de l’analyse en composantes principales.
[exercice p. 54]
Solution n°15
En analyse en composantes principales,
B Deux individus sont proches s’ils prennent des valeurs proches sur au moins une variable
C Deux individus sont proches s’ils prennent des valeurs proches sur toutes les variables
[exercice p. 54]
Solution n°16
En analyse en composantes principales,
61
Solutions des exercices
[exercice p. 54]
Solution n°17
Parmi les indicateurs suivants, quel(s) est (sont) les indicateurs de liaison entre variables
quantitatives
Coefficient de corrélation
Moyenne
Variance
Écart type
[exercice p. 54]
Solution n°18
Si on réalise l’analyse en composante principale d’un tableau de i individus et k colonnes
A
Chaque individu prend k valeurs et peut être considéré comme un point dans un espace à
k dimensions
[exercice p. 55]
Solution n°19
Dans la représentation des individus
A Deux individus proches dans l’espace global sont nécessairement proche sur le plan 1-2
B Deux individus proches sur le plan 1-2 sont nécessairement proche dans l’espace global
62
Solutions des exercices
C
Deux individus proches sur le plan 1-2 mais mal projetés sont nécessairement éloignés
dans l’espace global
D
Deux individus éloignés sur le plan 1-2 sont nécessairement éloignés dans l’espace global
E
La qualité de projection d’un individu, mesurée par le cosinus carré, peut s’additionner sur
deux axes uniquement
[exercice p. 55]
Solution n°20
Contribution des individus
A
Un individu qui prend des valeurs proches de la moyenne pour toutes les variables ne
contribue à la construction d’aucun axe
C
Un individu qui contribue beaucoup à la construction du premier axe de l’ACP ne peut pas
contribuer beaucoup à la construction du 2ème axe
D
Un individu qui a une forte coordonnée sur un axe contribue beaucoup à la construction de
cet axe
[exercice p. 56]
Solution n°21
Dans la représentation des variables
A
Une variable est bien projetée sur un plan si la flèche qui la représente est courte et loin du
cercle des corrélations
B
Deux variables mal projetées sur un plan sont très corrélées (positivement ou
négativement)
C
La qualité de projection d’une variable sur un axe est égale au coefficient de corrélation de
la variable avec l’axe
63
Solutions des exercices
D
La qualité de projection d’une variable sur un axe est égale au carré du coefficient de
corrélation de la variable avec l’axe
[exercice p. 56]
Solution n°22
Les éléments supplémentaires
C
Les variables qualitatives supplémentaires sont représentées via leurs modalités sur le
graphe des individus
D
Une modalité de variable qualitative supplémentaire est au barycentre des individus qui
prennent cette modalité dans l’espace global
[exercice p. 56]
Solution n°23
Le pourcentage d’inertie associé à la première dimension est proche de
0%
64
Solutions des exercices
10 %
25 %
40 %
65 %
[exercice p. 57]
Solution n°24
Le pourcentage d’inertie associé au plan présenté est proche de
0%
10 %
25 %
40 %
65 %
65
Bibliographie
[[3]] Kurban, S., Mehmetoglu, I., and Yilmaz, G. (2007), Effect of diet oils on lipidlevels of the brain
of rats, Indian J. Clin. Biochem., 22(2), 44–47.
[1] Child, D. (2006). The essentials of factor analysis (3rd ed.). Continuum.
[2] Marley W. Watkins A step-by-step guide to exploratory factor analysis with SPSS New York, NY :
Routledge Taylor & Francis Group , 2021
66