Surveillance intelligente en agriculture
Surveillance intelligente en agriculture
Titre :
Analyse intelligente des images pour la surveillance dans une agriculture
de précision
Ecole doctorale :
Aéronautique-Astronautique (AA)
Unité de recherche :
Laboratoire Génie de Production de l'ENIT (E.N.I.T-L.G.P.)
Directeurs de Thèse :
M. BERNARD KAMSU-FOGUEM
M. DANTOUMA KAMISSOKO
Rapporteurs :
M. DENIS POMORSKI, UNIVERSITE LILLE 1
M. ENGELBERT MEPHU NGUIFO, UNIVERSITE CLERMONT AUVERGNE
Membres du jury :
MME CARMEN GERVET, UNIVERSITE DE MONTPELLIER, Présidente
M. ANNIG LACAYRELLE, UNIVERSITE DE PAU ET DES PAYS DE L ADOUR, Membre
M. BERNARD KAMSU-FOGUEM, ECOLE NATIONALE D'INGENIEUR DE TARBES, Membre
M. DANTOUMA KAMISSOKO, UNIVERSITE DE SEGOU, Membre
M. DAOUDA TRAORE, UNIVERSITE DE SEGOU, Membre
THÈSE
En vue de l’obtention du
DOCTORAT DE L’UNIVERSITÉ DE TOULOUSE
Délivré par l’Institut National Polytechnique de Toulouse
Cotutelle internationale : Institut polytechnique rural de formation et de recherche
appliquée de Katibougou
Les avancées technologiques de la vision par ordinateur et l’utilisation des systèmes d’in-
telligence artificielle (comme l’apprentissage automatique ou profond) ont eu un fort impact
dans l’agriculture en la faisant passer à une nouvelle ère digitalisée. Il s’agit d’une agriculture
numérique ou de précision dans laquelle on assiste à une forte utilisation des données, de l’in-
formatique intelligente, des drones, et des capteurs pour produire davantage. A cet effet, cette
thèse propose de nouvelles réponses aux enjeux de la surveillance des cultures menacées par
des attaques fongiques. Ce qui nous a amené à donner de nouvelles contributions visant à rele-
ver les défis d’une agriculture de précision.
Partant de là, nous avons effectué une étude bibliométrique sur les apports de l’apprentissage
profond en agriculture. Nous avons discuté les contributions des chercheurs principalement im-
pliqués, en vue d’apporter de nouvelles réponses aux défis de l’agriculture de précision. Cette
étude a été clôturée par des recommandations essentielles dans la réalisation d’un système agri-
cole intelligent. Il s’agit de (i) considérer la perception des acteurs humains du système ; (ii)
exiger la prise en compte des tests statistiques et des validations croisées des données d’en-
traı̂nement lors de la comparaison des performances de plusieurs classificateurs ; (iii) analyser
la performance d’un classificateur sur les données d’entraı̂nement en faible quantité.
Dans un premier temps, pour consolider cette étude, nous avons étudié la classification de la
maladie mildiou au niveau de la culture du mil, une des cultures vivrières des régions d’Afrique
et d’Asie. Dans ce travail, un accent a été mis sur la faible quantité de données d’entraı̂nements
supervisées, nécessaires pour former de tels classificateurs.
Dans un second temps, nous avons proposé une nouvelle tâche de classification des réseaux de
neurones convolutifs en augmentant les espaces de caractéristiques des données d’entraı̂nement.
Cette approche se base sur les principes de l’apprentissage multitâches dans l’élaboration d’un
modèle de classification multi-labels avec la comparaison de plusieurs classificateurs.
Durant des années, les recherches en apprentissage automatique étaient beaucoup plus concentrées
sur la performance des modèles de prédiction plutôt que sur leur compréhension, leur in-
terprétation et leur pouvoir de décision. Si nous comprenions ce que le modèle a appris, il
est possible de garantir la qualité des résultats obtenus. Dans un troisième temps, nous avons
observé les propriétés de visualisation d’un modèle profond afin d’obtenir des résultats signifi-
catifs, explicables par un utilisateur quelconque. Nous avons qualitativement analysé des cartes
de visualisation des méthodes d’explicabilité lors de la localisation des insectes ravageurs des
cultures. Au-delà d’une prédiction à base du calcul de probabilité, nous avons guidé le proces-
sus de la localisation d’insectes en employant la théorie de l’information mutuelle.
L’apprentissage profond requiert assez souvent une grande quantité de données et une puis-
sance de calcul pour entraı̂ner un réseau de neurones profonds. Les résultats obtenus par nos
travaux ont prouvé que, l’apprentissage par transfert, l’augmentation des données et le partage
des tâches constituent des moyens efficients pour améliorer la capacité des réseaux de neurones
i
profonds.
Notons que les systèmes ont pour vocation d’interagir avec des utilisateurs humains. Ils doivent
donc être en mesure d’expliquer, de justifier leur comportement et les décisions qu’ils prennent
afin que ces utilisateurs puissent comprendre les actions réalisées. Les contributions de cette
thèse ont dévoilé que, l’exploration des méthodes de l’explicabilité est un moyen pertinent
et utile pour le déploiement des outils d’intelligence artificielle au service de l’agriculture de
précision.
Mots clés : agriculture de précision, vision par ordinateur, apprentissage supervisé, réseau
de neurones, apprentissage profond, apprentissage par transfert, explicabilité des réseaux de
neurones, apprentissage multitâches, détection des maladies, détection des insectes ravageurs
ii
Abstract
Technological advances in computer vision and the use of artificial intelligence systems
(such as automatic or deep learning) have had a strong impact on this field, bringing it into
a new digitalized era. This is digital or precision agriculture in which there is a strong use of
data, intelligent computing, drones, and sensors to produce even more. In this thesis, we pro-
pose new answers to the challenges of monitoring crops threatened by fungal attacks. This has
led us to make new contributions to the challenges of precision agriculture. Based on this, we
conducted a bibliometric study on the contributions of deep learning in agriculture. We discus-
sed the contributions of the researchers mainly involved, in order to provide new answers to the
challenges of precision agriculture. This study was closed with essential recommendations in
the realization of an intelligent agricultural system. These are (i) to consider the perception of
the human actors of the system ; (ii) to require the consideration of statistical tests and cross-
validations of the training data when comparing the performances of several classifiers ; (iii) to
analyze the performance of a classifier on the low quantity training data.
First, to consolidate this study, we studied the classification of late blight disease in millet, one
of the food crops in African and Asian regions. In this work, emphasis was placed on the small
amount of supervised training data needed for such classifiers.
In a second step, we improved the classification tasks of convolutional neural networks by in-
creasing the feature spaces of the training data. This approach is based on the principles of
multi-task learning in the development of multi-label classification model the comparison of
several classifiers.
For years, research in artificial intelligence was much more focused on the performance of
learning models rather than on their understanding, interpretation, and decision power. If we
understood what the model learned, we could guarantee the quality of the results obtained. In a
third step, we observed the visualization properties of a deep model in order to obtain meaning-
ful results that can be explained by any user. We have qualitatively analyzed the explanatory
capacity of deep neural networks when locating crop pests. In addition to a prediction based
on a probability value, we have guided the process of insect localization by using the mutual
information theory.
Deep learning requires a large amount of data to build a deep neural network and computational
power to train it. The results obtained from our work have proven that transfer learning, data
augmentation, and task sharing are efficient ways to improve the capacity of deep neural net-
works.
Note that learning systems based on artificial intelligence are intended to interact with human
users. They must therefore be able to explain and justify their behavior and the decisions they
make so that these users can understand the actions they take. The contributions of this thesis
have revealed that the exploration of the explanation methods is a useful and beneficial tool for
farmers. They aim to shed light on the process of scaling up the concerns and challenges of the
iii
new form of agriculture that is precision agriculture.
Keywords : precision agriculture, computer vision, supervised learning, neural network, deep
learning, transfer learning, explainable Artificial Intelligence, multi-task learning, disease de-
tection, insect pest detection
iv
Remerciements
v
Table des matières
Résumé i
Abstract iii
Remerciements v
Introduction générale 1
Contexte . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 1
Objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
Contributions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
L’apprentissage profond à la rencontre de l’agriculture de précision : une ana-
lyse bibliométrique . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
Partage de réseaux de neurones convolutifs pour la classification multi-labels
des images . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
Classification des maladies du mil à l’aide d’un réseau de neurones convolutifs
profonds et de l’apprentissage par transfert . . . . . . . . . . . . . . . 7
Explicabilité des réseaux de neurones convolutifs pour la localisation des in-
sectes ravageurs dans les cultures . . . . . . . . . . . . . . . . . . . . 8
Organisation du mémoire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
1 Etat de l’art 11
1.1 Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.2 Définitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.2.1 Apprentissage automatique . . . . . . . . . . . . . . . . . . . . . . . . 11
1.2.2 Vision par ordinateur . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
1.2.3 Classification d’images . . . . . . . . . . . . . . . . . . . . . . . . . . 13
1.3 Concepts de l’apprentissage profond . . . . . . . . . . . . . . . . . . . . . . . 14
1.3.1 Apprentissage profond ou Deep Learning . . . . . . . . . . . . . . . . 14
1.3.2 Réseau de neurones artificiels . . . . . . . . . . . . . . . . . . . . . . 18
1.3.3 Réseaux de neurones convolutifs . . . . . . . . . . . . . . . . . . . . . 19
1.3.4 Architectures des réseaux de neurones profonds . . . . . . . . . . . . . 25
1.3.5 Explicabilité des réseaux de neurones profonds . . . . . . . . . . . . . 26
1.3.6 Métriques d’évaluation . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1.3.7 Framework et ensemble de données . . . . . . . . . . . . . . . . . . . 34
1.4 Agriculture de précision . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
1.5 Apprentissage profond et limitation des données . . . . . . . . . . . . . . . . . 41
1.5.1 Augmentation des données . . . . . . . . . . . . . . . . . . . . . . . . 41
vii
Table des matières
viii
Table des matières
Bibliographie 119
ix
Table des figures
xi
Table des figures
5.1 Système d’identification des parasites basé sur l’explicabilité du réseau de neu-
rones convolutifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 103
5.2 Ajustement de l’architecture d’inception-v3 pour la classification des insectes
ravageurs. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 104
5.3 Relation entre l’entropie, l’entropie conjointe et l’information mutuelle . . . . . 106
5.4 Alignement des images en une seule image en utilisant les opérateurs OR, AND,
and XOR . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107
5.5 Exemples de résultats de classification explicables. class désigne la vérité
terrain, pred classe prédite. . . . . . . . . . . . . . . . . . . . . . . . . . . 111
5.6 Carte d’explication d’une observation avec Grad-CAM sur les couches pro-
fondes mixed0 à mixed10 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 112
5.7 Paramètres d’apprentissage affectant la visualisation LIME. . . . . . . . . . . . 112
5.8 Alignement des images avec les mesures de l’information mutuelle (MI) sui-
vantes : MI (image 1 et 2) = 0.33 ; MI (image 1 et 3) = 0.56 ; MI (image 2 et 3)
= 0.398. Les images image 1, image 2 et image 3 correspondent respectivement
aux résultats des méthodes Grad-CAM, LIME et Integrated Gradient . . . . . . 113
5.9 Alignement des images avec les mesures de l’information mutuelle (MI) sui-
vantes : MI (image 1 et 2) = 0.20 ; MI (image 1 et 3) = 0.36 ; MI (image 2 et 3)
= 0.25. Les images image 1, image 2 et image 3 correspondent respectivement
aux résultats des méthodes Grad-CAM, LIME et Integrated Gradient . . . . . . 113
5.10 Un exemple d’alignement négatif avec MI (image 1 et 2) = 0.20 . . . . . . . . 114
xii
Liste des tableaux
2.1 Top-5 des publications des auteurs par rapport à H Index, TC (Total de Citation)
et NP (Nombre de Publication) . . . . . . . . . . . . . . . . . . . . . . . . . . 55
2.2 Documents les plus cités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
2.3 Présentation des travaux de recherche sur la détection de mauvaises herbes . . . 60
2.3 Présentation des travaux de recherche sur la détection de mauvaises herbes . . . 61
2.3 Présentation des travaux de recherche sur la détection de mauvaises herbes . . . 62
2.4 Présentation des travaux de recherche sur les maladies de culture . . . . . . . . 62
2.4 Présentation des travaux de recherche sur les maladies de culture . . . . . . . . 63
2.4 Présentation des travaux de recherche sur les maladies de culture . . . . . . . . 64
2.5 Présentation des travaux de recherche sur la reconnaissance des parasites . . . . 64
2.5 Présentation des travaux de recherche sur la reconnaissance des parasites . . . . 65
2.6 Publication des pays pour les auteurs en correspondance. . . . . . . . . . . . . 66
xiii
Introduction générale
Contexte
L’agriculture est l’ensemble des pratiques ayant pour objet les activités de production végétale
et animale. Avec l’augmentation des populations, ce secteur doit faire face aux demandes ali-
mentaires croissantes tout en tenant compte des enjeux sociétaux (comme la disponibilité de
la main-d’œuvre), environnementaux (comme la rareté de l’eau, la perte de biodiversité, la
dégradation des terres . . .) et économiques (comme la perte de rendement, la faible production).
Les contraintes de son développement sont devenues nombreuses compte tenu des variabilités
saisonnières et un régime climatique extrême. À cet effet, il est plus que jamais nécessaire de
trouver des pratiques innovantes pour le développement du secteur agricole.
Les opportunités offertes par les innovations technologiques ont fortement fait progresser l’agri-
culture vers une industrialisation. Cette mécanisation a donc fait passer l’agriculture à une
nouvelle ère, l’agriculture 4.0 où l’agriculture intensive s’impose désormais en contribuant à
l’efficience des procédés de production agricole. Avec une forte croissance de la population
mondiale, l’agriculture intensive a apporté de nouveaux défis dont la résolution conditionne
l’amélioration de la qualité et la quantité des produits et du sol tout en respectant l’homme et
l’environnement.
Le secteur subit ainsi une forte transformation numérique pour relever les nouveaux défis tout en
augmentant la productivité des sols, des cultures et en consommant moins d’intrants. L’intégration
du numérique a considérablement modifié les connaissances sur la gestion des parcelles avec
l’utilisation des technologies innovantes, notamment le géopositionnement par satellite (Global
Positioning System ou GPS), des capteurs embarqués sur les engins agricoles, des robots ou des
drones.
L’usage de ces technologies incite les data-scientists et les agronomes à concevoir des outils et
des techniques d’analyse pour organiser avec précision la gestion et la surveillance des parcelles,
relever les nouveaux défis qui s’imposent (la détection des attaques fongiques, la prédiction du
rendement des cultures, la pulvérisation de pointe). Ces nouvelles pratiques nécessitent une as-
sistance technique des agriculteurs pour répondre à leurs besoins et les aider à optimiser (ou
maximiser) le rendement de leurs cultures.
Toutefois, cette nouvelle forme de l’agriculture soulève aussi de nombreux problèmes et défis
relatifs à la transition écologique du système agricole, tels que la réduction de la consomma-
tion d’énergie, la minimisation des intrants et la place de l’humain dans la mise en place des
systèmes intelligents. Plusieurs sociétés agricoles proposent des équipements programmables,
autonomes, dotés d’un système intelligent. À partir des données collectées sur les exploitations,
ces systèmes sont capables de recommander des opérations spécifiques avec parcimonie. Par
exemple, la proxy-détection (avec l’Internet des objets, smartphone, casque, lunette virtuelle,
etc.) offre un avantage dans la surveillance des champs et des cultures et fournit des données
1
Liste des tableaux
de précision (zone infectée, espèces de parasites ou d’adventices par exemple) aux agriculteurs
ou conseillers agricoles dans les prises de décisions. La démocratisation du secteur et la so-
phistication des équipements ont produit un grand nombre de volumes de données diversifiées
par la qualité (éléments structurés ou brutes, etc.), et la nature (images, valeurs numériques ou
textuelles, etc.). Cette explosion quantitative de données massives (big data) peut devenir ra-
pidement une source possible d’erreurs dans la prise de décisions pour le pilotage des travaux
d’exploitation agricole. Le déploiement des solutions d’analyse ou de traitement de données
contraignent les scientifiques à trouver de nouvelles manières de voir et d’analyser le monde.
Ceci est notamment manifeste dans les sous-domaines de l’intelligence artificielle qui s’ap-
puient sur des outils mathématiques, d’électronique, d’informatique pour permettre des progrès
dans l’extraction de connaissances sur des ensembles de données.
Les technologies de l’intelligence artificielle (IA) ont eu un impact profond dans plusieurs
domaines dans ces dernières décennies. Ces diverses applications ont contribué à une progres-
sion significative des solutions basées sur la vision par ordinateur lors du développement des
systèmes automatisés, nouveaux et robustes. Au fil des années, les chercheurs ont donc construit
plusieurs familles d’algorithmes selon la taille du problème considéré. On peut citer en autres :
la méthode de k plus proches voisins (KNN), les machines à vecteur de support (SVM), les
arbres de décision et les forêts aléatoires (Random Forest), les réseaux de neurones. Selon
[Res17], le marché de l’IA en agriculture était évalué à 518,7 millions USD en 2017. Avec
un taux de croissance de 32,7%, il va atteindre 312,4 milliards USD d’ici 2027. Avec une
utilisation croissante de la technologie de vision par ordinateur, les applications agricoles ont
transformé les pratiques conventionnelles de l’agriculture en opportunités de générations de
configurations incroyablement plus productives. Leurs usages ont eu un impact très positif sur
la production et la rentabilité du secteur. Parmi ces avantages dans l’agriculture, citons l’uti-
lisation optimisée et précise des produits chimiques (pesticides, insecticides, ou intrants), la
planification du travail des agriculteurs, la reconnaissance d’images de plantes, la surveillance
continue et l’analyse de la santé des cultures ainsi que la réduction de la dégradation de l’en-
vironnement. De ce fait, l’agriculture est en mesure de faire face à de nombreuses contraintes
nouvelles poussant les agronomes à chercher de nouveaux outils dans la chaı̂ne de valeurs agri-
coles avec de meilleures perspectives. Les récents progrès de l’apprentissage profond ont tenté
d’apporter des réponses encourageantes en y associant les connaissances expertes des agricul-
teurs [ALG+ 19, LBM+ 18, KP18, HS15].
En 2012, les réseaux de neurones profonds ont produit un résultat spectaculaire dans les
travaux [KSH12] lors de la compétition ImageNet Large Scale Visual Recognition Challenge
(ILSVRC) a fait renaı̂tre l’apprentissage profond. Par la suite, un ensemble de nouvelles
méthodes d’analyse de données comme les réseaux de neurones profonds apparaissent. Elles
constituent aujourd’hui l’écosystème du Deep learning ou apprentissage profond . L’appren-
tissage profond concerne aujourd’hui tous les secteurs d’activité : l’industrie, la télédétection,
le traitement de la langue naturelle, la médecine y compris l’agriculture. Il s’inspire du fonc-
tionnement du cerveau humain pour traiter et analyser des données. Il permet à la machine
d’effectuer des opérations complexes sur des données brutes, en fournissant des prédictions
avec des résultats prometteurs. Presque toujours alimenté par la disponibilité croissante de la
puissance de calcul, l’amélioration de la connectivité et les données massives, l’apprentissage
profond offre des moyens novateurs caractérisés par l’automatisation de la gestion des exploi-
2
Liste des tableaux
tations agricoles.
La transformation numérique de l’agriculture soutenue par l’apprentissage profond constitue
une nouvelle carte de méthodes et d’outils qui ont changé la vision des agriculteurs en appor-
tant de nombreux avantages pour gérer les changements fréquents et les conditions extérieures
dans les pratiques agricoles. Les solutions réalisées ont permis de compléter les technologies
(agronomiques et informatiques) déjà mises en œuvre pour accroı̂tre la production et moderniser
la surveillance des cultures en temps réel. Cette mise à niveau a stimulé les recherches scien-
tifiques (pluridisciplinaires) pour la revitalisation des secteurs applicatifs avec de meilleures
perspectives. Les scientifiques sont en mesure de construire des systèmes agricoles durables
et robustes avec un grand potentiel pour l’atteinte de certains objectifs tels que l’identification
des maladies, des cultures, de mauvaises herbes ou des insectes ravageurs, l’augmentation de
la fertilité des sols ou réduire les faiblesses dans la chaı̂ne d’approvisionnement. Leur succès
dépend de la performance et de l’efficience des modèles d’apprentissage et le développement
d’approches sûres, efficaces, transparentes et compréhensibles par les agriculteurs. La bonne
mise en œuvre de ces approches augmentera la capacité des agriculteurs à maintenir leur profit
et à faire face aux diverses menaces des cultures et des sols. Pour cela, les techniques d’analyse
des données avec les réseaux de neurones devront tenir compte des variations climatiques ou
environnementales qui peuvent impacter ces mêmes données.
Par exemple, les réseaux de neurones convolutifs (CNN) profonds présentés par [LBBH98] ont
eu un grand succès dans le domaine de la vision par ordinateur pour la reconnaissance d’objets.
Ils ont obtenu un regain de performance dans les traitements d’images et peuvent être employés
pour la reconnaissance des parasites, des maladies de cultures, l’établissement des cartes d’oc-
cupation des sols, etc. L’utilisation des CNN ne se limite pas à l’analyse d’image, nous pouvons
les exploiter dès lors qu’il est possible d’extraire des sous-éléments caractéristiques des données
(données tabulaires, signaux, etc.) comme les pixels d’une image. Les réseaux de neurones
convolutifs se composent principalement de couches convolutives et d’autres couches de trai-
tement qui extraient des cartes de caractéristiques sur un ensemble de données (d’images). En-
suite, des catégories d’étiquettes ou de valeurs sont exprimées en sortie du réseau pour désigner
le résultat de la classification ou de la régression. Les couches d’un CNN renferment un nombre
important de paramètres de calcul à apprendre et une organisation hiérarchique qui sont ex-
ploités par les algorithmes d’apprentissage dans la résolution du problème considéré. Mais,
tout dépend de l’ampleur des données recueillies pour le fonctionnement des solutions. Plus le
problème est compliqué, plus la quantité des données pour entraı̂ner l’algorithme d’apprentis-
sage est cruciale.
Le coût élevé de la collecte de données d’apprentissage (données d’entraı̂nement, de validation
et de test) est un facteur majeur qui freine la croissance et le développement de l’agriculture de
précision. Néanmoins, certaines pistes d’amélioration concernant la production de données pu-
bliques peuvent apporter des contributions pendant les expérimentations ou le passage à l’école
des algorithmes. Des projets agricoles comme PlantVillage [HS15] Pl@ntNet [ALG+ 19], ou les
ensembles de données de références IP102 [WZL+ 19], AgriPest [WLX+ 21] sont des exemples
de base de données à accès publique. Par ailleurs, nous pouvons avoir recours à des techniques
d’augmentation de données, ou des techniques plus sophistiquées comme l’apprentissage par
transfert ou les réseaux de neurones de type réseaux adverses génératifs (en anglais Generative
Adversarial Networks ou GAN) pour enrichir, augmenter la taille des ensembles de données ou
faire appel aux connaissances acquises pendant la résolution d’une nouvelle tâche.
3
Liste des tableaux
4
Liste des tableaux
Les systèmes qui ont une vocation d’interagir avec des utilisateurs humains doivent être
en mesure d’expliquer, de justifier leur comportement et les décisions qu’ils prennent afin que
les utilisateurs puissent comprendre les actions suggérées. Durant de nombreuses années, les
nombreuses recherches en apprentissage machine se sont beaucoup plus concentrées sur la per-
formance des modèles d’apprentissage plutôt que sur leur compréhension, leur interprétation et
leur capacité d’aide à la décision. Si nous comprenions ce que le modèle a appris, il est possible
de garantir la qualité des résultats obtenus. Cette capacité est cruciale et importante pour les
utilisateurs du domaine de l’agriculture. Dans cette thèse, nous nous intéressons aux propriétés
de visualisation des prédictions d’un modèle profond afin d’obtenir des résultats significatifs.
Plusieurs méthodes pour l’explicabilité des réseaux de neurones (comme Grad-CAM, LIME,
Integrated Gradient, etc.) ont été explorées pour démontrer leurs complémentarités dans la lo-
calisation des objets. Nous avons ainsi analysé qualitativement la capacité d’explicabilité des
réseaux de neurones lors de la localisation des insectes ravageurs des cultures. Au-delà d’une
prédiction à base du calcul de probabilité, nous avons guidé le processus de la localisation d’in-
sectes en employant la théorie de l’information mutuelle.
Les résultats ainsi obtenus dans nos travaux ont prouvé que, l’apprentissage par transfert,
l’augmentation ou le partage des tâches constituent des moyens efficients pour améliorer les
performances des réseaux de neurones. Les différentes contributions de thèse ont aussi dévoilé
que, l’exploration des techniques de l’explicabilité des réseaux de neurones est un moyen utile
et bénéfique pour les agriculteurs afin d’éclairer le processus de résolution de problèmes liés
aux défis de la nouvelle forme de l’agriculture qui est l’agriculture de précision. Enfin l’intérêt
des tests statistiques constitue un enjeu dans l’évaluation de plusieurs modèles profonds.
Objectifs
Dans ce travail, nous nous sommes intéressés aux réseaux de neurones convolutifs, qui
ont démontré une efficacité pour les tâches de reconnaissance d’objets. Nous avons étudié les
différents apports scientifiques sur les réseaux de neurones profonds au travers d’une étude
bibliométrique. L’intérêt a été d’apporter de nouvelles réponses aux défis de l’agriculture de
précision, ce qui constitue notre motivation pour les travaux qui seront dans cette thèse. Ce tra-
vail s’intéresse donc à de nouvelles possibilités d’exploration des données (images) agricoles
avec des méthodes ou des outils de l’apprentissage profond pour consolider la surveillance
de la santé des cultures. Il s’agit de proposer de nouvelles approches qui pourront rendre les
réseaux de neurones convolutifs efficients et transparents durant une tâche de classification. Ces
réseaux de neurones profonds utilisent une approche d’apprentissage supervisé où les données
en entrées sont des images et la sortie des classes d’objets. Rappelons que l’utilisation des CNN
exige l’utilisation de bases de données d’entraı̂nement et de test. Pour cela, quatre bases de
données publiques PascalVOC [EVGW+ 07, EVGW+ 12], NusWide [CTH+ 09], Amazon rain-
forest [Pla17], IP102 [WZL+ 19] et une base de donnée Mildiou du Mil [CKKT19] construite
par nous-mêmes, ont été utilisées.
5
Liste des tableaux
Contributions
Cette thèse apporte quatre contributions dans le domaine agricole en utilisant des modèles
de classifications bâtis sur l’apprentissage profond. Un accent particulier est mis sur les réseaux
de neurones convolutifs profonds (Deep CNN) à travers les méthodes de l’apprentissage mul-
titâches ou le phénomène de l’explicabilité de ces réseaux de neurones. Nous passons en revue
ces contributions ci-après.
6
Liste des tableaux
de la tâche de classification avec une analyse appropriée des caractéristiques de l’image. Cepen-
dant, différents types de réseaux de neurones profonds peuvent être utilisés pour concevoir le
MBNN, mais notre proposition se compose de réseaux de neurones convolutifs (CNN), formés
et joints pour prédire les sorties. Le travail proposé permet donc d’effectuer des changements
incrémentiels sur les architectures d’apprentissage multitâches (MTL) pour une adaptation au
scénario multi-labels. Ces séries de transformation ou d’adaptation de données et d’architecture
de réseau de neurones nous amènent à proposer deux méthodes d’apprentissage alternatives
pour la classification multi-labels :
1. Une première méthode appelée réseau de neurones à sorties multiples où l’architecture
est constituée d’un ensemble de classificateurs binaires disposés parallèlement, dont un
classificateur est mis pour chaque label. Dans cette méthode, un CNN pré-entraı̂nées est
utilisé pour extraire les caractéristiques des images.
2. Une deuxième méthode appelée réseau de neurones à caractéristiques multiples où
il y a plusieurs CNN parallèles pour extraire différentes propriétés caractéristiques des
images. Ces CNN sont ensuite fusionnés en un réseau de neurones unique pour former le
classificateur final.
Une contribution concerne les possibilités de généricité de l’approche proposée permettant
la réutilisation dans d’autres systèmes d’apprentissage. Par ailleurs, la méthode d’apprentissage
par transfert est engagée dans la prédiction des classes dont le but est d’obtenir un modèle
performant et efficient. L’expérimentation a été validée avec les réseaux pré-entraı̂nés sur l’en-
semble de données ImageNet : VGG16 [SZ14], ResNet [HZRS15] et Inception-v3 [SVI+ 15].
Les démonstrations empiriques sont effectuées sur les ensembles de données de références
(Amazon rainforest, Pascal VOC, et NusWide) et elles ont prouvé que la modélisation architec-
turale conduit à un apprentissage accru et à une meilleure performance du réseau de neurones.
7
Liste des tableaux
une analyse des données rapide et intéressante (de manière pertinente et efficace). L’avantage
attendu de la proposition est de fournir un soutien aux parties prenantes (chercheurs et agricul-
teurs) grâce aux informations et aux connaissances générées par le processus de raisonnement
d’une agriculture de précision. Ce travail a conduit à une publication dans une revue internatio-
nale.
Coulibaly, S., Kamsu-Foguem, B., Kamissoko, D., Traore, D., 2019. Deep neural net-
works with transfer learning in millet crop images. Computers in Industry 108, 115 –
120. [Link]
Organisation du manuscrit
La structure de cette thèse est organisée en cinq (5) chapitres. Le chapitre 1 fournit un état
de l’art sur les techniques de l’intelligence artificielle. Il introduit les concepts et mots-clés per-
mettant de situer le cadre de notre travail. Ensuite, nous présentons en détail les concepts de
l’agriculture de précision, de l’apprentissage profond, de l’architecture des réseaux de neurones
8
Liste des tableaux
Les chapitres 3 à 5 discutent de nos autres contributions. Chaque chapitre commence par une
introduction du contexte suivi de la description des travaux connexes. Ensuite, nous décrivons
et évaluons la méthode proposée sur un ou plusieurs ensembles de données.
Le chapitre 3 décrit une nouvelle approche de l’apprentissage profond, la classification multi-
labels appliquée à la classification d’images. Dans ce contexte, deux méthodes d’apprentissage
profond multi-branches et multitâches ont été développées pour résoudre le problème de clas-
sification multi-labels. Nous utilisons des réseaux de neurones convolutifs pré-entraı̂nés bien
connus pour développer ces approches.
Le chapitre 4 présente une méthode de classification pour reconnaı̂tre la maladie du mildiou du
mil. Le mil est une culture des régions d’Afrique et d’Asie. Cette culture est favorable à l’attaque
du mildiou qui conduit une perte énorme de productions en termes de rendement. Ce chapitre
fournit une description détaillée de la méthode proposée ainsi que les résultats expérimentaux
obtenus.
Le fonctionnement des réseaux de neurones profonds permet d’apprendre à partir d’un jeu de
données certains comportements, afin d’associer une entrée à une sortie. Cependant, leur in-
terprétation reste floue, car les calculs qui se produisent entre les deux ne sont pas faciles à
expliquer aux humains qui les utilisent. L’étude de ce comportement qui qualifie de boı̂te
noire les réseaux de neurones profonds permet d’augmenter la confiance dans les résultats
produits. Cette préoccupation est étudiée dans le chapitre 5 qui présente des cartes de visuali-
sation pour comprendre les décisions du réseau de neurones profonds. Il décrit également dans
ses différentes sections comment identifier et localiser les insectes ravageurs dans les cultures à
l’aide d’un réseau de neurones convolutifs.
Le dernier chapitre conclut cette thèse avec les perspectives.
9
Chapitre 1
Etat de l’art
1.1 Introduction
Dans ce chapitre, nous présentons un état de l’état de l’art sur les concepts qui sont pertinents
pour ce travail. Nous commençons par définir les terminologies de l’apprentissage automatique
et ses types qui sont l’apprentissage supervisé et non supervisé dans la section 1.2. Nous pas-
sons en revue dans la section 1.3, l’apprentissage profond. Nous présentons particulièrement les
réseaux de neurones convolutifs, l’apprentissage par transfert et les méthodes pouvant donner
un aperçu des prédictions d’un modèle. Nous accordons une attention particulière à l’agriculture
de précision qui constitue la base de cette thèse dans la section 1.4. Au fil des années grâce à
des dispositifs automatiques intelligents et à des modèles prédictifs qui utilisent des algorithmes
d’apprentissage automatique, les pratiques agricoles subissent d’énormes changements. Ils sont
à l’origine de la révolution agricole expliquée dans cette section. Les techniques de contour-
nement du problème de la limitation des données sont expliquées dans la section 1.5. Les al-
gorithmes d’apprentissage automatique ont besoin de données pour apprendre. Dans la section
1.6, nous présentons les jeux de données utilisés dans ce travail de thèse pour l’entraı̂nement
des réseaux de neurones conçus. La section 1.7 conclut ce chapitre.
1.2 Définitions
Dans cette section, nous définissons quelques concepts pertinents pour ce travail, à savoir
l’apprentissage automatique, l’apprentissage supervisé/non supervisé, la vision par ordinateur
et la classification des images.
11
Chapitre 1. Etat de l’art
— Apprentissage supervisé
Lors d’un apprentissage supervisé, les données d’entrées sont associées à des sorties que
nous voulons prédire. L’objectif est d’apprendre une règle générale liant les entrées aux
sorties. Une sortie peut être une valeur réelle, discrète ou catégorique (ou étiquette). Par
exemple, les modèles de régression estiment les sorties à valeurs réelles, tandis que les
modèles de classification estiment les sorties à valeurs discrètes. Un algorithme d’appren-
tissage supervisé analyse les données et produit une fonction inférée qui peut être utilisée
pour mapper de nouveaux exemples (non étiquetés) à la sortie désirée.
— Apprentissage non supervisé
En apprentissage non supervisé, l’algorithme d’apprentissage automatique reçoit un en-
semble de donnée d’entrée sans aucune valeur de sortie (cible) correspondante. On le
laisse seul pour qu’il trouve les groupes d’exemples similaires dans les données en entrée
(groupement) ou déterminer la distribution des données dans l’espace d’entrée (estima-
tion de la densité) ou projeter les données d’un espace à grande dimension vers un espace
à dimension réduit (e.g, deux ou trois) pour la visualisation.
12
1.2. Définitions
Préparation des données d’apprentissage : elle divise l’ensemble des données en trois
sous-ensembles de données : entraı̂nement, validation et test sur la base des étiquettes. Au
préalable, les images peuvent subir un prétraitement qui consiste à les nettoyer afin d’ob-
tenir des éléments représentatifs du problème considéré où un encodage des noms de classes
d’une chaı̂ne de caractères en numérique est souvent nécessaire.
13
Chapitre 1. Etat de l’art
Apprentissage : elle comprend une étape d’extraction des caractéristiques qui décrit les
informations (caractéristiques) pertinentes contenues dans l’image. L’apprentissage utilise le
classificateur conçu précédemment. Le classificateur détermine la classe d’une image en entrée
du système tout en minimisant l’erreur de classification, grâce aux données de validation. Ce
classificateur est ensuite utilisé pour classer les images non vues (appartenant aux données de
test ou du terrain) durant son entraı̂nement. Les données de validation sont donc bien utiles
pour trouver une bonne configuration du modèle de classification. En effet, l’entraı̂nement d’un
modèle profond implique toujours des réglages comme le choix du nombre de couches, leurs
tailles ou le taux d’apprentissage. Ces réglages sont possibles en utilisant les retours d’informa-
tions de l’ensemble des données de validation.
Lors de la classification d’images, toutes ces étapes sont essentielles pour la construction et
l’évaluation d’un système de classification.
14
1.3. Concepts de l’apprentissage profond
Les réseaux de neurones convolutifs sont vus comme une forme particulière de réseau de
neurones artificiels multi-couches (Multi Layer Perceptron ou MLP) dont l’architecture des
connexions est inspirée de celle du cortex visuel des mammifères. Dans les années 1990, Yan
LeCun [LBD+ 89] a présenté la première démonstration des réseaux de neurones convolutifs,
qui utilisent la théorie de rétropropagation sur la reconnaissance de chiffres manuscrits. Ces
réseaux n’admettent que des connexions locales, de plus, les paramètres de ces connexions sont
partagés au sein d’une couche donnée. Cela réduit consid-érablement le nombre de paramètres.
Les modèles prédictifs (modèle de classification ou de régression) sont entraı̂nés sur de données
15
Chapitre 1. Etat de l’art
historiques pour prédire de futurs résultats. L’extraction de caractéristiques est cruciale dans le
processus de modélisation prédictive. Dans certaines situations, la transformation des données
devient essentielle avant de construire un tel modèle. Elle implique la transformation des données
brutes en caractéristiques pertinentes afin de réduire les erreurs de modélisation et d’améliorer
les performances prédictives du modèle. Dans une démarche d’analyse d’image classique par
exemple, si on cherche à reconnaı̂tre une attaque fongique, les méthodes utilisées étaient basées
sur la réflectance, la morphologie, la texture. Cette extraction des caractéristiques demande une
bonne connaissance de la tâche de prédiction et un travail d’ingénierie permet d’adapter la
méthode d’extraction. Une mauvaise extraction conduit donc à une mauvaise performance de
l’algorithme d’apprentissage. Cette méthode d’extraction a été largement simplifiée par la ca-
pacité des réseaux de neurones profonds qui extraient eux-mêmes les caractéristiques dans les
couches du réseau (Figure 1.3). Chaque couche apprend une représentation des données en son
entrée qui doit être utile à la couche suivante. Ainsi les informations obtenues dans chacune des
couches sont de plus en plus riches (voir la Figure 1.4). Grâce à cette capacité de généralisation,
un réseau de neurones entraı̂né pour une tâche peut être réutilisé pour une tâche similaire, dans
un autre contexte. En ce moment, on parle d’apprentissage par transfert 1.5.2 où il est possible
de changer certaines couches pour l’adapter à la nouvelle tâche.
16
1.3. Concepts de l’apprentissage profond
meilleurs paramètres d’entraı̂nement. L’un des enjeux étant de trouver des méthodes pour ajus-
ter ces paramètres le plus rapidement et le plus efficacement possible en tirant donc parti des
symétries permettant la détermination des invariants. Cette symétrie se retrouve dans l’architec-
ture des réseaux de neurones convolutifs dans lesquels les poids des neurones sont eux invariants
par translation. L’entraı̂nement des modèles d’apprentissage fait appel à des algorithmes d’op-
timisation dont un des plus importants est le principe de la descente de gradient qui permet de
trouver le minimum de n’importe quelle fonction convexe en convergeant progressivement vers
celui-ci.
L’organisation et le principe de fonctionnement des réseaux de neurones leur permettent de
traiter des problèmes non linéaires d’une manière plus efficace que le type de modèle standard
comme celui de l’apprentissage automatique. Cependant, ces interprétations restent floues dans
de nombreux cas d’où la nécessité des méthodes de l’explicabilité pour comprendre ce que les
réseaux ont appris. Cette problématique est expliquée dans la section 1.3.5.
17
Chapitre 1. Etat de l’art
n
X
y = f wi xi + b
(1.1)
i=1
En général les réseaux de neurones apprennent à minimiser l’erreur entre la vérité terrain
(valeur réelle notée yi ) et celle prédite (valeur réalisée notée b
yi ) lorsqu’un échantillon est fourni
au modèle en mettant à jour les poids. Ce processus est appelé rétropropagation et repose sur
l’hypothèse qu’une fonction de perte (Loss function) ou fonction objective j(θ) peut-être mi-
nimisée par la descente du gradient afin de trouver un minimum (Figure 1.6). Plus sa valeur
diminue, plus le réseau est performant.
La fonction objective j(θ) est minimisée en modifiant la valeur des paramètres θ du réseau
sur un ensemble de données d’entraı̂nement. Les paramètres d’apprentissags θ représentent les
différents poids du réseau.
Dans le cas d’un problème de régression ou une certaine valeur est prédite, il est courant d’utili-
ser la fonction de perte de l’erreur quadratique moyenne (mean squared error ou MSE), définie
par la formule 1.2.
n
1X 2
MS E = E (1.2)
n i=1 i
n
1X
MS E = yi )2
(yi − b
n i=1
18
1.3. Concepts de l’apprentissage profond
Où n est le nombre d’observations, E étant l’erreur locale se focalisant sur une observation
donnée en comparant la valeur réelle et sa valeur prédite : Ei = yi − byi .
Pour les tâches de classification binaire ou multi-classification, la fonction de perte est basée
sur le calcul de l’entropie croisée. Elle quantifie la différence entre deux distributions probabi-
listes. Une petite valeur représente un meilleur modèle contrairement à d’une grande valeur. Les
fonctions 1.3 et 1.4 définissent l’entropie croisée binaire (binary cross-entropy) et catégorique
(categorical cross-entropy).
n
1X
L = yi log(ŷi ) + (1 − yi ) log(1 − ŷi ) (1.3)
n i=1
Xn
L = − yi )
yi log(b (1.4)
i=1
La couche de sortie du réseau de neurones est définie avec n nœud (un pour chaque classe)
et plus la valeur de la fonction perte est proche de 0, plus elle est fiable est de 0 et meilleur est
le réseau de neurones.
19
Chapitre 1. Etat de l’art
est calculée à partir de la couche précédente. La Figure 1.7 présente le modèle architectural
CNN.
Aujourd’hui, ces réseaux sont devenus un standard pour résoudre les tâches de vision telles
que la reconnaissance d’images. Techniquement, un réseau de neurones convolutifs se compose
généralement d’une combinaison des couches suivantes :
— Couche de convolution (convolutional layers),
— Couche de mise en commun (pooling layer),
— Couche d’activations (activation layer),
— Couche complètement ou entièrement connectée (fully-connected ou dense layer).
20
1.3. Concepts de l’apprentissage profond
21
Chapitre 1. Etat de l’art
premières couches de convolution peuvent extraire les traits ou les arrondis de l’image tan-
dis que les couches qui suivent peuvent être utilisées pour reconnaı̂tre le nez ou la bouche et
reconnaı̂tre le visage entier par la suite.
En mathématique, une opération de convolution entre deux fonctions, f et g est définie comme
suit :
Z ∞
( f ∗ g)(x) = f (z)(x − z)dz
−∞
Dès que nous avons des objets discrets, l’intégrale se transforme en une somme. Ainsi nous
obtenons la formule suivante :
X
( f ∗ g)(i) = f (a)g(i − a)
a
Dans le cas des images, les deux fonctions sont en général définies sur un espace à deux di-
mensions correspondant à une convolution 2D. Dans ce cas la convolution discrète correspond
à une somme pour une image f et un noyau g
XX
( f ∗ g)(i, j) = f (a, b)g(i − a, j − b)
a b
Figure 1.10 – Exemple de convolution de deux matrices. Chaque valeur de la matrice d’entrée
représente un pixel.
22
1.3. Concepts de l’apprentissage profond
moyenne des valeurs. Les couches de mise en commun ne sont pas en réalité des couches de
neurones, elles mettent en corrélation les motifs détectés par les couches convoluées dans les
couches précédentes. Le pooling offre l’avantage de réduire le volume du calcul pour analyser
les données par la réduction des dimensions et le contrôle ainsi que le sur-apprentissage.
Figure 1.11 – Exemple d’opération de pooling (max-pooling) de taille avec un pas (stride) de
1. La taille du filtre est 2x2.
Les couches entièrement connectées sont généralement suivies d’une couche d’abandon ou
Dropout [SHK+ 14] qui agit sur le poids des couches du réseau en désactivant certains neurones
23
Chapitre 1. Etat de l’art
(Figure 1.13). C’est une technique de régularisation couramment utilisée dans les réseaux de
neurones pour contrôler le surapprentissage pouvant être causé par un nombre important de
paramètres.
La fonction Rectified Linear Units ou ReLU : définie si l’entrée est négative ou nulle, la
sortie est 0. Si l’entrée est positive, la sortie est égale à l’entrée. Elle est calculée comme suit :
f (x) = max(0, x)
x, x > 0
(
f (x) =
0, sinon
La fonction sigmoı̈de : elle utilise une exponentielle en réduisant l’entrée entre 0 et 1. Sa
formule est la suivante :
1
f (x) =
1 + e−x
La fonction tangente hyperbolique : elle prend une entrée de valeurs et réduit à une valeur
entre [−1, 1] comme suit :
1 − e−2x
f (x) = tanh(x) =
1 + e−2x
La fonction softmax : elle transforme un vecteur d’entrée en une distribution de probabilité
dont leur somme est de i ŷ = 1. On l’utilise souvent dans la couche finale d’un modèle de
P
classification, notamment pour les problèmes multi-classes. Sa formule est la suivante :
e xi
ŷi = so f tmax(xi ) PN x
j e
j
24
1.3. Concepts de l’apprentissage profond
25
Chapitre 1. Etat de l’art
26
1.3. Concepts de l’apprentissage profond
Figure 1.16 – Bloc résiduel standard. x est l’entrée d’un bloc résiduel. F désigne une fonction
à apprendre. [HZRS15]
du nombre élevé de paramètres d’entraı̂nement, des relations entre les couches et d’opérations
de calculs. Il est donc difficile de comprendre mathématiquement les raisons de ce succès, et
27
Chapitre 1. Etat de l’art
encore plus difficile d’expliquer la prise de décisions pour les utilisateurs humains. Selon Doshi-
Velez et Kim, les modèles (ou algorithmes) d’apprentissage automatique doivent être capables
de fournir des preuves accessibles à un utilisateur humain dans un format sémantique complet,
suffisant en soi [DK17]. Cependant, la nature en boı̂te noire (Figure 1.18) des modèles pro-
fonds leur confère une difficulté fondamentale pour comprendre les détails techniques et les
prédictions qui sont critiques dans certaines tâches (diagnostic médical, détection des attaques
fongiques des cultures). Cette propriété prouve que la performance des modèles est placée au
centre des préoccupations au détriment de sa compréhension alors qu’elle a un rôle essentiel
dans le futur des systèmes basés sur l’IA. Pour utiliser efficacement les réseaux de neurones
profonds, il est important que les utilisateurs puissent être capables d’expliquer et de justifier
leurs réponses.
28
1.3. Concepts de l’apprentissage profond
le résultat d’apprentissage avec des concepts qu’un humain (un utilisateur final ou un non-expert
en apprentissage automatique) peut utiliser pour éclaircir l’analyse d’un système prédictif.
29
Chapitre 1. Etat de l’art
L’explicabilité intrinsèque (Intrinsic Methods) vise à concevoir des DNN qui fournissent
une explication en même temps que leurs sorties. Ainsi, il est possible d’optimiser simul-
tanément les performances et certaines qualités souhaitées des explications générées par le
modèle. Les techniques d’explicabilité intrinsèque sont organisées en deux catégories :
— Les mécanismes d’attention (ou Attention Mechanisms) sont inspirés de la façon dont les
humains prêtent attention à différentes parties d’une image ou d’autres sources de données
complexes pour les analyser. Le module d’attention évalue la pertinence de chaque pixel
en entrée étant donné une représentation de celui-ci et le contexte de prédiction.
— L’entraı̂nement conjoint (ou Joint Training) fonctionne en ajoutant une tâche d’explica-
tion sup- plémentaire à la tâche initiale du modèle, et en entraı̂nant simultanément les
deux tâches.
30
1.3. Concepts de l’apprentissage profond
Les explications apportées par les méthodes de visualisation ou d’approximation locale (Fi-
gure 1.21) sont des outils d’aide à la décision qui peuvent aider à mieux comprendre le com-
portement des réseaux et donner plus de confiance dans les prédictions des modèles de classifi-
cation.
Par ailleurs, plusieurs librairies sont développées pour fournir les implémentations des tech-
niques sur l’explicabilité des réseaux de neurones. Certaines parmi elles supportées sur le Fra-
mework TensorFlow sont énumérées dans la Table 1.1. Celle de tfexplain a été considérée dans
nos expérimentations pour débloquer la boı̂te noire d’une IA agricole.
La précision calcule les échantillons positifs qui sont correctement prédits par rapport à
tous les échantillons prédits dans une classe positive (Équation 1.5).
31
Chapitre 1. Etat de l’art
32
1.3. Concepts de l’apprentissage profond
Le rappel décrit la capacité du classificateur à trouver tous les exemples positifs (Équation
1.6).
TP
Precision = (1.5)
T P + FP
TP
Rappel = (1.6)
T P + FN
TP + TN
Accuracy = (1.7)
T P + T N + FP + FN
n
1X
Accuracy(y, ŷ) = 1(byi = yi )
n i=1
avec byi est la valeur prédite de la i-ème observation (échantillon) et yi sa valeur réelle et n le
nombre d’observations (d’échantillons).
Les métriques de rappel ou de précision sont des bonnes mesures du succès de la prédiction
lorsque les classes ne sont pas équilibrées. La métrique Fβ− score est une moyenne harmonique
de la précision et du rappel. Avec un meilleur score à 1 et un pire score à 0, elle est calculée
comme suit (Équation 1.8) :
Precison ∗ Rappel
Fβ = (1 + β2 ) (1.8)
β2 Precison+ Rappel
Lorsque β = 1, la formule devient :
Precison ∗ Rappel
F1 = 2 (1.9)
Precison + Rappel
Ces métriques peuvent être ”pondérées” pour chaque étiquette lorsqu’il faut tenir compte du
déséqui- libre de données dans l’évaluation. Elles calculent pour chaque étiquette la moyenne
pondérée par support (le nombre d’échantillons vrais pour chaque étiquette) :
!
T Pi
Precisionweighted = wi
T Pi + FPi
!
T Pi
Rappelweighted = wi
T Pi +FN i
!
Precisioni ∗ Recalli
F1 S coreweighted = wi
Precisioni + Recalli
l
X
avec wi = ki
i
où ki indique les étiquettes uniques à compter pour la proportion totale de toutes les étiquettes
et TP, TN, FP, FN sont les vrais positifs (true positive), les vrais négatifs (true negative), les faux
positifs (false positive) et les faux négatifs (false negative).
Une autre métrique d’évaluation efficace est celle de la moyenne de précision (AP) [PVG+ 11].
Cette métrique nous aidera à comparer les performances de différentes architectures en fournis-
sant la valeur de prédiction pour chaque étiquette. La moyenne de précision est un résumé d’une
33
Chapitre 1. Etat de l’art
courbe précision-rappel en faisant varier un seuil de décision et elle est calculée par la formule
suivante (Équation 1.10) :
X
AP = (Rn − Rn−1 ) Pn , n > 0 (1.10)
n
Une autre mesure courante pour comparer les modèles de prédiction est celle de la courbe
ROC (receiver operating characteristic curve). C’est un graphique montrant les performances
d’un modèle de classification. Elle résume le compromis le taux de vrais positifs (synonyme de
rappel) et le taux de faux positifs pour un modèle prédictif à l’aide de différents seuils de pro-
babilité. Elle est créée en traçant le taux de faux positifs sur l’axe des x par rapport au taux de
vrais positifs sur l’axe des y. Cette courbe sert également à comparer différents classificateurs.
Elle est généralement associée à une mesure AUC (area under the curve) qui calcule l’aire sous
la courbe ROC. Plus une courbe a des valeurs élevées, plus l’aire sous la courbe est grande,
moins le classificateur fait d’erreurs.
34
1.3. Concepts de l’apprentissage profond
35
Chapitre 1. Etat de l’art
dans plusieurs formats (texte, images, signal, etc.). Quelques-uns d’entre eux (représentés par
la Table 1.3) sont exploités dans les expérimentations lors de l’entraı̂nement des réseaux de
neurones.
36
1.4. Agriculture de précision
protection des cultures. Cela était possible parce que les parcelles étaient de petites tailles et il
y avait des manques de moyens techniques et économiques. La donne a changé par l’agrandis-
sement des exploitations, partagées en plusieurs unités d’hectares. Dans ces conditions, l’ap-
proche conventionnelle de l’agriculture manque de lucidité notamment avec les limites de sous-
utilisation des intrants et le risque environnemental.
Les opportunités offertes par les nouvelles technologies du numérique ont donc fortement fait
progresser l’agriculture vers une industrialisation. Cette mécanisation a fait passer l’agriculture
à une nouvelle ère, l’Agriculture 4.0 où l’agriculture intensive s’impose désormais en contri-
buant à l’efficience des procédés de production agricole. Grâce aux progrès fournis par les tech-
nologies, l’agriculture a subi d’énormes changements visant à la rendre plus intelligente et plus
précise. Les technologies de positionnement (comme le global positioning system, ou GPS) et
l’informatique embarquée permettent d’obtenir des informations géographiques et de réaliser
des interventions modulaires sur les exploitations. Cette réflexion est à l’origine du concept
agriculture de précision, concept qui se traduit par la bonne intervention au bon endroit et au
bon moment [Zim08, ZLB97] .
En pratique, l’agriculture de précision est fondée sur l’intégration des technologies et de
la communication dans la gestion des parcelles (Figures 1.23 et 1.25). Elle vise à moduler les
pratiques culturales en fonction de la variabilité (sol, couverture végétale, etc.) intraparcellaire
afin de piloter correctement le processus de production agricole et optimiser avec précision les
interventions culturales.
À l’aube d’une croissance de la population mondiale, le défi actuel à relever est d’améliorer
la qualité et la quantité des produits agroalimentaires tout en respectant la santé de l’homme
et de son environnement. L’agriculture de précision répond donc aux besoins des agriculteurs
comme étant un système agricole intégré basé sur l’information et la production. Son objectif
est d’accroı̂tre l’efficacité, la productivité et la rentabilité de la production à long terme, sur un
site spécifique et sur l’ensemble de l’exploitation, tout en minimisant les impacts involontaires
sur la faune et l’environnement [TN07]. Selon [Gan05], l’agriculture de précision se définit
comme un ensemble de technologies qui ont contribué à propulser l’agriculture dans le monde
informatisé de l’information et qui est conçu pour aider les agriculteurs à obtenir un plus grand
contrôle sur la gestion des opérations agricoles. En effet, l’agriculture de précision est une mise
à niveau des stratégies conventionnelles de prise de décision spécifique concernant la produc-
tion des cultures.
Nous assistons dans ses dernières décennies à l’existence d’une volonté des entreprises agro-
industrielles et des coopératives agricoles, d’explorer les potentialités du numérique pour contri-
buer au développement des modèles d’amélioration de la santé des exploitations agricoles. Il
s’agit des technologies des grandes données, de l’Internet des objets, de l’informatique en nuage
(cloud) et de l’intelligence artificielle. Pour illustrer cette floraison d’outils pour l’agriculture de
précision, nous pouvons citer les exemples suivants à titre illustratif :
AIRINOV offre une application avec tous les services agronomiques dont le but est de gui-
der l’agriculteur dans ses premiers pas vers la modulation de la dose d’azote avec la géolocalisation
des tracteurs dans les parcelles.
Le projet international dirigé par l’Université de Twente aux Pays-Bas et financé par l’Union
européenne Spurring a Transformation for Agriculture through Remote Sense (STARS)
avait pour vocation de favoriser la transformation de l’agriculture par la télédétection grâce aux
images satellitaires à haute définition et des drones. Cela est rendu possible par l’acquisition des
images multi-spectrales des parcelles à surveiller à l’aide d’objets connectés.
37
Chapitre 1. Etat de l’art
La société Geosys offre des solutions s’appuyant sur les résultats de recherches en Agrono-
mie, des Systèmes d’Information et du Web, et de données géographiques (imagerie satellite,
données climatiques. . .). Celles-ci fournissent des systèmes des systèmes d’aide à la décision
pour les professionnels du monde agricole permettant par exemple de corriger les problèmes
liés à la variabilité intraparcellaire.
Farmstar a conçu un outil d’agriculture de précision et accompagne des milliers d’agri-
culteurs soucieux de combiner rendement, qualité de récolte et respect environnemental. Cet
outil est basé sur expertise agronomique associée à la télédétection par satellite permettant par
exemple de fournir des services (indicateur de biomasse, chlorophylle, etc.) en production d’in-
formations agricoles.
SkyWatch propose une nouvelle technologie satellitaire pour collecter des images panchro-
matiques haute résolution et multi-spectrales pour diverses applications dans le domaine agri-
cole (par exemple le suivi de la santé des cultures) et de la surveillance environnementale.
Agrimeteo - NewFarm Agriconsult est un réseau collaboratif d’experts d’agronomes, de
scientifiques, d’informaticiens et de fabricants d’objets connectés fournissant des solutions aux
agriculteurs afin d’optimiser leurs décisions agronomiques.
Figure 1.23 – Usage de la donnée sur les exploitations agricoles (Source : JEMS Group)
38
1.4. Agriculture de précision
sur les parcelles par voie terrestre, par les objets connectés ou par voie aérienne par les ou-
tils satellitaires (Figure 1.23). Il en découle donc le réel besoin de développer des outils et des
méthodes pour stocker, analyser, interpréter, visualiser et diffuser les données collectées afin
d’en tirer des valeurs ajoutées (Figure 1.25). Ces applications agricoles représentent les moyens
de production de connaissances utiles au service des systèmes d’aide à la décision [WGVB17]
pouvant accompagner les exploitants agricoles et les décideurs publics ou privés.
À l’ère moderne de la révolution industrielle, l’intelligence artificielle, l’apprentissage automa-
tique et l’apprentissage profond sont devenus très populaires dans les recherches scientifiques
avec de nombreuses applications en traitement de langue naturelle, classification d’images,
diagnostic de maladies, fouille de texte, etc. Aujourd’hui, l’apprentissage profond connaı̂t de
nombreux cas d’exemples appliqués à la gestion des cultures et des sols. Pour ces raisons,
l’apprentissage profond apparaı̂t comme une réponse pertinente qui dépasse les modèles agro-
nomiques classiques pour mieux aider les agricultures dans le positionnement dans la chaı̂ne de
valeur agricole (Figure 1.24).
Figure 1.24 – Apprentissage automatique pour des usages agricoles d’après l’étude couvrant
une période de 2004 à 2018 [LBM+ 18]
39
Chapitre 1. Etat de l’art
tionnent des cas d’exemple de détection des maladies ou des insectes nuisibles. À cela s’ajoute,
la sélection des cultures, le rendement, des détections des mauvaises herbes qui jouent un rôle
clé dans la détermination du rendement. Toutes ces nouvelles pratiques nécessitent une assis-
tance technique des agriculteurs pour une agriculture durable. Ainsi l’apprentissage profond est
devenu une force motrice de l’agriculture pour le changement.
En résumé, les applications de l’intelligence artificielle ou de l’apprentissage profond offrent de
40
1.5. Apprentissage profond et limitation des données
nombreuses possibilités (opportunités) pour améliorer les diverses étapes de l’agriculture afin
de faire face aux différentes difficultés et atteindre les objectifs de l’agriculture de précision
[Gup19, ZLL+ 18] :
1. Le traitement de l’information agricole : Le suivi de l’état des plantes et des animaux est
vital pour la production agricole.
2. Les modèles font de la détection des maladies un processus réalisable, ce qui améliore le
potentiel de production de cultures saines.
3. Le contrôle optimal des systèmes de production agricole : Les stratégies de contrôle des
systèmes de production agricole reposent souvent sur l’expérience de l’agriculteur ou sur
les connaissances d’un expert, ce qui ne tient pas compte de l’état physiologique des
plantes (animaux) ou de la demande en temps réel.
4. Les pratiques de gestion des cultures ont atteint de nouveaux sommets, et il est devenu
assez pratique pour les agriculteurs de gérer les cultures avec un minimum d’efforts.
5. Les équipements intelligents des machines agricoles : la production agricole implique de
nombreux types de tâches.
6. Les données agricoles sont analysées efficacement par les modèles de l’apprentissage
profond afin de faire des prédictions précises.
7. La gestion du système économique agricole : Le rendement agricole en lui-même n’est
pas suffisant pour l’agriculture. De nombreux autres facteurs doivent être pris en compte,
tels que les prix et la qualité des produits agricoles. Il est très important de prévoir les prix
des produits agricoles.
8. L’IA a considérablement révolutionné le système de prévision météorologique dans l’agri-
culture, ce qui joue un rôle essentiel dans l’agriculture.
Le secteur agricole a été remodelé par les techniques de l’apprentissage profond. Plusieurs
pratiques de l’agriculture ont été impactées par l’évolution des technologies. Cependant, l’hu-
main doit rester la clé de ce changement pour contrôler les risques émis par les diverses intégrations
technologiques et l’interprétation des informations.
41
Chapitre 1. Etat de l’art
42
1.5. Apprentissage profond et limitation des données
de nouveaux domaines). Autrement dit, il est possible de transférer des connaissances sur les
données d’un domaine source au domaine cible (Figure 1.28).
La première option utilise un réseau déjà entraı̂né que nous pouvons réutiliser ou appliquer
sur un domaine source. Dans ce cas, nous retiendrons deux cas d’usage : le réglage ou l’ajus-
43
Chapitre 1. Etat de l’art
La deuxième option est basée sur l’adaptation du domaine où deux approches sont en-
visageables : le transport optimal [CFHR17, CFT14, RCFT18] et l’information mutuelle
[ARS18] pour guider la sélection de la meilleure source de données. Il s’agit de minimiser l’er-
reur ou la divergence entre les deux domaines, conduisant ainsi à un transfert dit négatif.
Le problème de l’adaptation de domaine a refait surface avec les travaux de [CFT14] qui
évaluent la distance entre domaines. Les techniques proposées par le transport optimal et l’in-
formation mutuelle permettent de réduire cette distance entre les domaines source et cible. La
théorie du transport optimal a été formulée par le géomètre français Gaspard Monge au 18e
siècle. Il revient dans le travail de Kantorovitch [Kan58] et revisité dans [Vil09]. La théorie du
transport optimal définit une Distance de Wasserstein (ou distance de transport optimal) pour
3. [Link]
44
1.6. Les bases de données utilisées
mesurer la distance entre des distributions de probabilité sur un espace métrique spécifié. Le
transport optimal s’est avéré utile pour l’adaptation au domaine dans le cadre de l’apprentis-
sage non supervisé [CFHR17, CFT14] qui consiste à trouver de bonne source de données. Dans
ce sens, [BEF19] ont pu réaliser par une approche modulaire composée de trois étapes : (i) le
calcul des distances entre ensembles de données par paires (ii) la transformation des distances
en scores, et (iii) la garantie de la variété des ensembles d’entraı̂nement.
Il semble intuitivement raisonnable que des procédures appropriées permettent de sélectionner
la source la plus proche à partir des caractéristiques extraites par le réseau de neurones pour un
apprentissage par transfert optimal (transférabilité maximale). Ces procédures supposent que les
caractéristiques extraites d’un domaine source doivent donner des informations supplémentaires
et pertinentes qui ne sont pas précédemment prises en compte par les données d’entraı̂nement du
domaine cible [ARS18]. La transférabilité maximale peut être calculée en utilisant des sources
ouvertes sélectionnées sur les critères basés sur la théorie de l’information mutuelle. Dans les
deux cas de figure, le réseau de neurones est testé sur une ou plusieurs sources de données afin
de sélectionner celle qui est la plus efficace.
(a) basé sur le calcule de distance [BEF19, (b) basée sur l’information mutuelle [ARS18].
CFHR17]).
45
Chapitre 1. Etat de l’art
1.6.2 IP102
Cet ensemble de données de référence IP102 est utilisé dans les expérimentations du cha-
pitre 5. C’est un ensemble de données à grande échelle pour la reconnaissance des insectes
ravageurs [WZL+ 19]. L’ensemble de données IP102 contient plus de 75 000 images pour 102
classes ou catégories de ravageurs avec 737 images en moyenne par classe. L’ensemble des
données est subdivisé comme suit : 45 095 images dans l’ensemble d’entraı̂nement (train set),
7 508 images dans l’ensemble de validation (validation set) et 22 619 images dans l’ensemble
de test (test set). La Table 1.5 fournit un extrait de l’ensemble de données, à savoir le nombre
d’images, l’identifiant des classes à prédire et le nom de la super-classe.
Le jeu de données IP102 est considéré comme l’un des plus grands jeux de données sur
les insectes nuisibles, lancé en 2019. Il comporte plusieurs défis pour évaluer les performances
de classification : (i) la couleur de fond de l’objet est similaire à la couleur de l’objet ; (ii) les
images couvrent tout le cycle du ravageur ; (iii) certains ravageurs se ressemblent. La Figure
1.31 montre quelques exemples d’images.
46
1.6. Les bases de données utilisées
mentation. Le jeu de données d’images contient 20 étiquettes ou classes d’objets (telles que
personne, chien, avion, bouteille, etc.). Ce jeu de données contient 9 963 images réparties entre
les jeux de données d’entraı̂nement/validation (trainval) et de test (Figure 1.32). Les jeux de
données d’entraı̂nement et de test comprennent respectivement 5 011 et 4 952 échantillons. Le
Pascal VOC propose un autre référentiel, par exemple le Pascal VOC 2012, largement utilisé
dans les expérimentations d’apprentissage profond. Le jeu de données VOC 2012 contient 22
531 images pour 20 catégories. Le jeu de données est divisé en sous-ensemble d’entraı̂nement,
de validation et de test avec 11 540 images dans l’entraı̂nement et la validation.
47
Chapitre 1. Etat de l’art
étiquetés à travers dix-sept (17) classes d’étiquettes. On peut citer par exemple, l’agriculture, la
rivière, les routes et ainsi de suite (Figure 1.33).
1.6.5 NUS-WIDE
Le jeu de données NusWide [CTH+ 09] contient 269 648 images et 5 018 tags provenant
de Flickr. Ces images sont annotées manuellement avec 81 concepts ou classes. Les images
sont très diverses et comprennent des concepts tels que des événements (e.g la natation), des
scènes/lieux (e.g des aéroports), des personnes (e.g la police), des objets (e.g des animaux) (Fi-
gure 1.34. En plus, les images sont très différentes les unes des autres. Dans le cadre expérimental,
nous considérons ce jeu de données contenant 5000 images pour l’entraı̂nement et 1000 images
pour les tests.
1.7 Conclusion
Ce chapitre a présenté un aperçu de l’apprentissage profond et exposé les concepts fonda-
mentaux des réseaux de neurones artificiels en passant par les réseaux de neurones convolutifs.
Nous avons ensuite présenté quelques techniques permettant de remédier au phénomène de sur-
apprentissage à savoir l’augmentation des données ou et l’apprentissage par transfert. Comment
48
1.7. Conclusion
faire confiance ou justifier la recommandation d’un réseau de neurones profonds ? Les travaux
présentés sur les méthodes de l’explicabilité permettent d’obtenir une explication du processus
ayant conduit à cette recommandation.
A partir de la présentation de l’agriculture de précision, nous remarquons que, les modèles
émergents de réseaux de neurones convolutifs (CNN) ont intégré dans la chaı̂ne de valeur agri-
cole. Nous avons trouvé un intérêt d’étudier ces diverses applications pour la surveillance de
la santé des cultures. De ce fait, le prochain chapitre présente notre première contribution qui
définisse la place occupée par l’apprentissage profond dans le domaine de l’agriculture. Il est
recensé à travers cette étude, un ensemble de travaux de recherches sur les deux thématiques
afin de dégager les apports et manques qui déboucheront sur nos perspectives de recherches.
49
Chapitre 2
2.1 Introduction
L’agriculture est une pratique qui consiste à cultiver des produits alimentaires. Cette pratique
nécessite une assistance technique pour éviter la surproduction et l’insuffisance alimentaire. De
nos jours, le secteur agricole est en pleine transformation numérique afin d’augmenter sa pro-
ductivité. Les défis liés à son développement sont nombreux (comme la détection des maladies,
la prédiction du rendement des cultures ou la pulvérisation de pointe).
L’introduction de l’intelligence artificielle et de l’apprentissage automatique a eu un fort im-
pact dans ce domaine en le faisant passer à une nouvelle ère digitale. Il s’agit de l’agriculture
numérique ou de précision dans laquelle on assiste à une forte utilisation de l’informatique
intelligente, de la robotique, des drones ou des capteurs. Les opportunités offertes par ces tech-
nologies numériques ont favorisé l’industrialisation, la surveillance des processus de production
et déclenché l’Agriculture 4.0. Elles consistent à améliorer la vie des agriculteurs en fournis-
sant de précieux conseils d’optimisation des processus d’exploitation agricole s’appuyant sur
les données et l’automatisation des tâches.
L’observation visuelle des plantes par les experts était généralement effectuée par le biais d’un
diagnostic lorsque cela est nécessaire. Néanmoins, cette méthode peu rentable prend habituelle-
ment beaucoup de temps. Pour résoudre ces problèmes, il est nécessaire d’utiliser des techniques
avancées et intelligentes. A cet effet, les algorithmes classiques (machine à vecteur de support,
foret aléatoire, k plus proches voisins) de l’apprentissage automatique ont été appliqués dans de
nombreuses études. [AHRM14, ASAV13, YGYN14, HRDR21]. Cependant, les récentes perfor-
mances de l’apprentissage profond, un sous-ensemble de l’apprentissage automatique, ont été
efficaces pour plusieurs domaines. Il permet à la machine d’effectuer des traitements complexes
sur des données volumineuses, en fournissant des prédictions avec des résultats prometteurs. En
conséquence, le domaine agricole s’est orienté vers des solutions basées sur l’apprentissage pro-
fond. Dans ce sens, des entreprises agro-industrielles et des coopératives agricoles explorent ces
potentialités pour contribuer au développement des modèles de surveillance des exploitations
agricoles. Les progrès accomplis jusqu’à présent sont encourageants. De nombreux aspects ont
été traités notamment la reconnaissance de mauvaises herbes [LBMS18, PKA19, RvHB+ 20],
51
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
l’identification des maladies des plantes [CKKT19, KHC20, GZY+ 20], la détection des in-
sectes [DLJ+ 19, CHL20b, ASB20], la récolte des fruits [MC17, BBSF19, GXF]. Toutefois,
cette agriculture de précision soulève aussi de nombreux problèmes et défis relatifs à la tran-
sition écologique du système agricole, tels que la réduction de la consommation d’énergie,
la minimisation des intrants et la place de l’humain dans la réalisation des systèmes intel-
ligents. Ainsi, dans ce chapitre, nous présentons les résultats d’une étude bibliométrique de
440 récentes recherches liées à l’implication de l’apprentissage profond en agriculture. Nous
évaluons les contributions des chercheurs de ces sous-domaines de l’intelligence artificielle qui
sont principalement impliqués dans le développement d’une agriculture intelligente. Ce chapitre
est organisé de la manière suivante : la section 2.2 présente la technique ainsi que les logiciels
bibliométriques, la section 2.3 décrit les analyses bibliographiques effectuées sur les données
collectées, tandis que la section 2.4 concerne la discussion avec des observations sur les défis
identifiés, et enfin la section 2.5 souligne les informations conclusives ainsi que les perspectives.
La première étape est une recherche par mots-clés de documents de conférences ou d’ar-
ticles de journaux, de chapitres de livres et autres moyens de communication afin d’obtenir des
données bibliographiques. Cette étape a été effectuée dans les bases de données scientifiques
IEEE Xplore digital library et Association for Computing Machinery (ACM) digital library,
ainsi que dans les services d’indexation scientifique comme Web of Science (WoS), Elsevier
52
2.3. Analyse bibliométrique : Vue d’ensemble
Scopus ou Google Scholar. WoS semble être très utilisé grâce à sa pluridisciplinarité. En effet,
les bases de données peuvent être très généralistes comme Google Scholar ou très spécialisées
comme IEEE Xplorer. Par ailleurs, Scopus, développé par Elsevier ne répond clairement pas aux
critères d’accès libre. Par conséquent, dans ce travail, nous nous concentrons sur WoS qui offre
également des fonctionnalités de recherche avancée utiles pour sélectionner des ensembles si-
gnificatifs d’articles pouvant être considérés comme une base intéressante pour construire notre
analyse bibliométrique. Il convient de souligner que les données recueillies ont été traitées afin
d’éliminer les informations parasites qui auraient entravé les étapes ultérieures de notre ana-
lyse.
Il existe un certain nombre d’outils pour analyser les résultats des requêtes de recherche bi-
bliographique. Nous pouvons citer Bibliometrix [AC17] ou VOSviewer [vW10] qui sont d’une
utilisation simple avec des interfaces graphiques intuitives.
La question a intentionnellement été formulée d’une manière très générale afin d’élargir le
champ de recherches observées. Ainsi, nous avons identifié 440 articles publiés de 2016 à 2021
grâce à la requête ci-dessus. Les données bibliographiques ont été téléchargées sous forme de
fichier au format BibTeX et analysées à l’aide de l’outil Biliometrix.
53
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
base de données WoS. Nous observons que le nombre de publications a augmenté de manière
significative à 2020.
Par ailleurs, les journaux spécialisés des études agronomiques ou de l’imagerie satellitaire
sont les plus actifs en termes de publications d’articles scientifiques (Figure 2.3). Par exemple,
Computers and Electronics In Agriculture d’Elsevier couvrant le développement et l’applica-
tion des systèmes informatiques, des logiciels, de l’électronique et des systèmes de surveillance
pour résoudre les problèmes de l’agriculture est la source ou le journal le plus utilisé pour les
publications avec 66 publications. Il est suivi des journaux en télédétection comme Remote
Sensing avec 45 publications au total. Parmi les sources les plus citées, nous avons IEEE
Access de l’Institute of Electrical and Electronics Engineers avec 34 publications au total.
La Table 2.1 présente l’impact des cinq (5) premiers auteurs (top-5 ranking) (respectivement
des pays) les plus productifs en fonction de l’indice h (h-index), du nombre total de citations
54
2.3. Analyse bibliométrique : Vue d’ensemble
Table 2.1 – Top-5 des publications des auteurs par rapport à H Index, TC (Total de Citation) et
NP (Nombre de Publication)
A la lecture de la Table 2.1, LIU X. et CHEN C. sont les auteurs les plus influents en termes
de h-Index. KUSSUL N., LAVRENIUK M. et SKAKUN S. obtiennent un TC de 398 chacun.
LIU X. (respectivement CHEN C., LUO J, ZHAO Y.) atteint une valeur de 5 (respectivement 4)
en termes de h-index. En termes du nombre de publications, LIU X possède 8 documents. Les
autres auteurs ont écrit chacun 6 contributions.
Par ailleurs, les pays comme la Chine et les États-Unis d’Amérique arrivent en tête du clas-
sement grâce à leurs TC et NP. La Chine obtient un total de 745 citations provenant de 109
publications (contributions). Ces résultats s’expliquent par le fait que la Chine et les États-Unis
ont connu une transformation radicale des systèmes agricoles en ayant pour conséquence une
forte production agroalimentaire 2 . Pour mieux conduire les exploitations, ces pays ont mis en
avant l’intégration et la mise en œuvre d’outils numériques dans les industries agricoles. La di-
gitalisation des moyens de production et de surveillance vise à augmenter considérablement les
économies numériques et agricoles des pays concernés. Par exemple, d’ici 2025, l’économie
numérique agricole de la Chine devrait représenter 15% de la valeur ajoutée de l’agriculture
chinoise, 70% des zones rurales étant alors couvertes par Internet [Xin20].
2. [Link]
55
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
56
2.3. Analyse bibliométrique : Vue d’ensemble
57
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
sNet, leur algorithme compte le nombre exact de fruits ou des fleurs. Les résultats expérimentaux
entraı̂nés sur des données simulées ont donné une précision moyenne de 91% sur un ensemble
d’images réelles.
Aujourd’hui, les technologies des objets connectés (IoT) existants doivent ajouter des éléments
intelligents et passer de la perception à la cognition en combinant l’IoT avec des méthodes
cognitives [Fou20]. Dans l’IoT cognitif, la technologie de mise en réseau d’auto-organisation
peut utiliser la collaboration de groupes entre les nœuds pour accomplir la mission commune,
qui reflète le raisonnement, la distribution et la robustesse de l’IoT [SDMC20]. L’IoT cogni-
tif permet aux organisations d’apprendre à partir des données provenant d’appareils connectés,
de capteurs, de machines et d’autres sources, et infuse l’intelligence dans les opérations indus-
trielles et les expériences des acteurs sur les produits et les machines. En effet, ils constituent
un levier de développement pour l’agriculture du futur avec l’augmentation de la capacité d’ap-
prendre, de penser et de comprendre des problèmes dans des situations complexes. Dans cette
digitalisation du système agricole, les utilisateurs ont un fort besoin d’automatisation de la col-
lecte et l’analyse des données sur les sites d’exploitation et d’amélioration des défaillances du
système productif (désherbage, récolte, traitement, etc.). Zhu et al. mettent en œuvre un nou-
veau mécanisme d’ordonnancement de transmission des informations entre les objets connectés
avec une technique d’apprentissage profond par renforcement (Deep Q-Learning) [ZSJS18]. La
méthode Q-Learning permet d’apprendre une politique, qui indique quelle action effectuer dans
chaque état du système. Ceci facilite la comparaison des récompenses probables sur la prise
des actions disponibles à optimiser sans avoir la connaissance initiale des états de l’environ-
nement. L’apprentissage de l’algorithme Q-Learning est un processus d’optimisation graduelle
jusqu’à l’atteinte d’une convergence par la sélection des actions optimales. De ce fait, le Deep
Q-Learning joue un rôle important dans la transmission et la réception des paquets de données
dans les réseaux sans fil pour maximiser le débit du système lors des échanges entre les nœuds
de ce système.
58
2.3. Analyse bibliométrique : Vue d’ensemble
ment. Pour lever ces difficultés, une piste de solution prometteuse consiste à la digitalisation de
l’agriculture traditionnelle offrant des opportunités d’automatisation du traitement des données
collectées. Les méthodes avancées d’automatisation des données de l’agriculture consistent à
appliquer les techniques d’apprentissage automatique comme les réseaux de neurones convo-
lutifs qui ont montré des résultats encourageants, en particulier dans le domaine de la vision
par ordinateur. Le principe de fonctionnement de ces techniques d’apprentissage profond fa-
cilite l’extraction des caractéristiques, l’apprentissage par transfert ou la télédétection dans le
contrôle et la gestion des exploitations agricoles. Ceci encourage l’identification précoce des
problèmes dans les cultures avec des leviers de limitation de l’utilisation des intrants (produits
phytosanitaires, traitements chimiques, etc.), et d’amélioration des rendements agricoles. Des
travaux s’y rapportant à des auteurs recueillis sur WoS sont présentés dans la section suivante.
59
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
plusieurs images prises à partir d’un système d’acquisition de données. Cette vision par or-
dinateur est basée sur la localisation ou la reconnaissance automatique des objets et améliore
considérablement la qualité des activités agricoles. Les Tableaux 2.3 à 2.5 fournissent une clas-
sification des certains travaux de recherche d’apprentissage automatique appliquée au secteur
agricole en fonction de leur approche, du type de problèmes et des résultats obtenus.
60
2.3. Analyse bibliométrique : Vue d’ensemble
61
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
62
2.3. Analyse bibliométrique : Vue d’ensemble
63
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
64
2.3. Analyse bibliométrique : Vue d’ensemble
Les avancées techniques de l’apprentissage profond à base des réseaux de neurones convo-
lutifs (CNN) ont été largement appliquées avec succès dans la classification des cultures, l’iden-
tification de mauvaises herbes, la détection des maladies, le dénombrement des fruits, même à
des stades précoces de l’apparition des infections. Cependant, les modèles CNN ne tiennent pas
compte des relations spatiales entre les caractéristiques d’une image et ils sont sensibles aux
variations dans les images d’une classe à prédire, d’où la nécessité d’avoir une grande quantité
de données d’apprentissage. Dans certaines études, ce problème est résolu par la technique de
65
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
l’augmentation de données qui s’effectue par la rotation, l’agrandissement d’une zone ou autres
méthodes de transformation de l’image comme par l’utilisation des GANs.
Par ailleurs, les CNN comme les modèles utilisant les architectures AlexNet, VGGNet, Goo-
gleNet, ReseNet ou DenseNet qui ont déjà montré leur performance lors des concours Ima-
geNet Large Scale Visual Recognition Competition (ILSVRC) ont fourni des résultats satis-
faisants lors des évaluations expérimentales. Ces résultats sont parfois améliorés par les tech-
niques d’apprentissage par transfert, la combinaison de plusieurs réseaux de convolutions ou le
pré-traitement (comme la segmentation) des données d’apprentissage. Les mesures (métriques)
d’évaluation, considérées comme Justesse (Accuracy), F-mesure (F-score), Précision (Preci-
sion), Rappel (Recall), Moyenne des moyennes de précisions (mAP pour mean Average
Precision) sont les plus utilisées. Elles indiquent chacune le pourcentage des instances mal clas-
sifiées par rapport aux instances correctement classifiées. Cependant, les mesures F1-score ou
mAP semblent être des bons compromis lorsqu’il y a lieu de comparer plusieurs classificateurs
sur des ensembles de données distincts (différents).
Les ensembles de données d’apprentissage généralement constitués d’images en couleur au for-
mat Rouge Vert Bleu (RVB ou Red Green and Blue ou RGB) et spectrales sont multi-sources
(diverses et variés). Pour certains ensembles, elles sont acquises sur le terrain (dans des condi-
tions réelles) par des drones, des appareils photos ou fournies par des systèmes satellitaires ;
pour beaucoup d’autres, il s’agit des données de références disponibles en libre accès sur Inter-
net (PlantVillage 3 , AgriPest [WLX+ 21] ou NBAIR 4 ).
3. [Link]
4. [Link] (National Bureau of Agricultural Insect
Resources
66
2.4. Discussion
2.4 Discussion
Les résultats expérimentaux des travaux étudiés présentent certaines limites liées à la vi-
sualisation des facteurs influents dans la prédiction et à l’utilisation de multiples classificateurs
(classificateurs) :
En premier lieu, si divers classificateurs sont inclus dans les expériences, alors il devient
nécessaire d’effectuer des tests statistiques pour analyser la signification des résultats obtenus
[BCDZ17]. Demšar et al. ont examiné plusieurs [Dem06] tests statistiques non paramétriques,
sûrs, robustes et étudié leur adéquation dans le domaine de l’apprentissage automatique pour
analyser les différences significatives dans les performances de classification. Les tests qui ont
été recommandés sont le test des rangs signés de Wilcoxon pour la comparaison de deux clas-
sificateurs et le test de Friedman avec les tests post-hoc pour la comparaison de plusieurs clas-
sificateurs sur plusieurs ensembles de données. Les résultats de ce test peuvent être présentés à
l’aide des diagrammes de différence critique (Critical Difference ou CD) pour plus de clarté.
En second lieu, lorsque nous voulons estimer la fiabilité d’un modèle prédictif basé sur
l’échantillonnage, la technique de validation croisée (voir la section 1.3.6) sur les données d’ap-
prentissage est utile. Autrement, les résultats du processus d’apprentissage vont dépendre d’un
choix aléatoire particulier pour les ensembles d’entraı̂nement et de validation. Cette technique
effectue une suite de découpage distincte des données en un ensemble d’entraı̂nement et de
validation.
En troisième lieu, l’exactitude de la prédiction d’un modèle est inversement proportion-
nelle à son explicabilité, i.e les modèles d’apprentissage profond ont un fonctionnement opaque
pour les humains. Ce concept d’explicabilité ou d’intelligence artificielle explicable (eXplai-
nable AI ou XAI) a été soutenu par l’Agence du Département de la Défense des États-Unis
(DARPA) donnant lieu à une réorientation des problématiques liées à l’apprentissage automa-
tique [GA19]. On note l’absence d’éléments relatifs à cette nouvelle préoccupation d’une in-
telligence artificielle explicable dans la plupart des travaux étudiés. L’objectif de l’explicabilité
est de fournir aux utilisateurs, une garantie, une justification, une confiance dans l’utilisation
des modèles d’apprentissage et de proposer des recommandations pour l’amélioration de leurs
67
Chapitre 2. Apprentissage profond à la rencontre de l’agriculture de précision
Figure 2.8 – Développement d’un système agricole intelligent (SSD : Solid-State Drive ; UAV :
Unmanned Aerial Vehicle)
2.5 Conclusion
L’agriculture de précision est une science récente qui se retrouve certainement encore dans
sa phase de jeunesse. L’intelligence artificielle peut avoir une contribution déterminante dans
l’analyse des données agricoles, en l’occurrence en utilisant la vision par ordinateur permettant
68
2.5. Conclusion
à une machine d’analyser et de comprendre automatiquement le monde visuel. Ceci offre l’op-
portunité de développer des systèmes intelligents qui apparaissent comme l’un des moyens pour
répondre aux défis de performance économique, environnementale et sociale en agriculture.
La revue de littérature effectuée montre une floraison de travaux décrivant le développement
au cours des dernières années de divers systèmes utilisant l’apprentissage automatique pro-
fond dans la résolution de divers problèmes de l’agriculture de précision. Les problèmes traités
concernent principalement les pertes de rendements occasionnées par les facteurs affectant la
bonne croissance des cultures agricoles et la fertilité des sols. Sur ce domaine de recherche
scientifique, les analyses bibliométriques montrent que les pays les plus actifs sont la Chine, les
États-Unis, l’Inde et le Brésil. Les thématiques abordées recouvrent entre autres les mots-clés
identification des maladies , extraction des caractéristiques , apprentissage par transfert ,
lution , traitement d’images . Les réseaux de neurones à convolution (CNN) sont l’une des
architectures les plus couramment utilisées du fait de ses applications performantes dans les
méthodes d’apprentissage profond.
Toutefois, l’usage des outils intelligents en agriculture de précision soulève de nombreux défis
dont la résolution est utile pour renforcer ce domaine et faciliter son appropriation par les ac-
teurs du domaine :
— La faiblesse des données d’apprentissage en termes de quantité et de qualité constitue
un important frein pour plus précisions dans les décisions suggérées par les systèmes
intelligents (les systèmes d’aide à la décision ou les outils d’analyses spatiales) dans le
domaine agricole en pleine évolution numérique avec de nouvelles contraintes de respect
de normes environnementales.
— La profondeur des couches dans les réseaux de neurones profonds, le nombre élevé des
paramètres et la complexité des algorithmes d’apprentissage de données ne simplifient pas
les temps de calcul. Ceci peut engendrer des procédures additionnelles (e.g. contraintes
supplémentaires pour les systèmes embarqués) en vue de leur déploiement de manière
appropriée sur les objets connectés en agriculture.
— La compréhension des mécanismes de raisonnement sous-jacents aux systèmes d’appren-
tissage automatique profond doit être améliorée. Il s’avère donc utile de fournir des pistes
d’explications pour une meilleure compréhension des prédictions fournies.
Une tentative de contournement du problème de la faiblesse des données peut augmenter la
précision des architectures issues de l’apprentissage profond. Cette problématique est discutée
dans le prochain chapitre qui met l’accent sur la réutilisation ou le partage des connaissances
provenant des tâches précé- demment apprises pour une nouvelle tâche.
69
Chapitre 3
3.1 Introduction
L’apprentissage profond est très utilisé pour les tâches de classification d’images binaire
et multi-classes [ASM17, SS19, SSC17]. Dans ces nombreux cas, la segmentation d’objet
[GOO+ 18, LKAL16], la détection d’objets [CH16, GKCA17], la télédétection [ALYS17, FK18]
et autres applications [SGAS17, Was18], l’apprentissage profond obtient de meilleurs résultats.
La classification multi-labels est une classe importante du problème d’apprentissage automa-
tique qui trouve ses applications dans l’annotation d’images [BLSB04, WYZZ09], la catégorisation
de textes, l’annotation de fonctions génétiques [LYG+ 10, YLCL18]. Elle consiste à apprendre
simultanément plusieurs étiquettes pour une donnée quelconque. Lorsque l’on résout les problèmes
de MLC, on s’attend généralement à ce que l’algorithme tienne compte la corrélation entre
des étiquettes des données pour améliorer les performances de prédiction [HYG+ 19, HLW+ 17,
PPZM18]. L’extraction de la corrélation cachée est habituellement une tâche difficile lorsqu’on
traite des images cas avec plusieurs objets en avant ou arrière-plan. D’un côté, le fait d’ignorer
les relations entre les étiquettes risque d’aboutir a des prédictions incohérentes, et d’un autre
côte, le fait de prendre en compte ces relations risque de propager l’erreur de prédiction d’une
étiquette a tous les autres qui lui sont reliées [LMR17]. L’approche que nous proposons permet
l’apprentissage des relations entre les étiquettes au travers d’une description vectorielle binaire
de chaque étiquette et d’un apprentissage des multiples caractéristiques de chaque image.
71
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
(comme le modèle génératif probabiliste, les champs aléatoires conditionnels, l’approche de
déconvolution) afin de manipuler directement des données à étiquettes multiples pour faire des
prédictions multi-labels. Par exemple, l’algorithme des champs aléatoires conditionnels cherche
à exploiter la corrélation entre les étiquettes pour une meilleure classification.
Les méthodes de classification d’images courantes avec les réseaux de neurones profonds sont
celles d’une classification binaire et multi-classes. Ces méthodes ont besoin d’une adaptation
pour relier les probabilités d’appartenance d’une observation à des catégories d’images lors
d’une classification multi-labels. Dans ce contexte, nous proposons une nouvelle approche de
classification multi-labels en construisant un réseau de neurones à multiples branches. Nous
essayons de répondre aux problèmes et questions suivantes : tout d’abord, comment trans-
former un problème de classification multi-labels en un problème de classification binaire ?
Deuxièmement, comment résoudre chaque problème afin de trouver les classes d’étiquettes
pertinentes ? La solution à ce problème utilise la technique de diviser pour mieux régner dont
chaque problème considéré comme une tâche à résoudre, est subdivisé en des sous-tâches. Nous
combinons ces différentes sous-tâches pour construire l’espace final des étiquettes. Partant de
là, la tâche de classification consiste en (i) la construction d’un modèle multi-branches (ii) le
traitement par chaque branche d’une partie du problème et (iii) la combinaison des résultats de
chaque branche pour construire l’espace d’étiquette final qui est résultat de la prédiction.
Ce travail est organisé comme suit : la section 3.2 présente quelques travaux connexes, la sec-
tion 3.3 explique le principe fondamental de l’apprentissage multitâches, la section 3.4 décrit
les architectures du réseau de neurones à multiples branches, les sections 3.5 et 3.6 évaluent des
performances du réseau de neurones à multiples branches dans la classification multi-labels, la
section 3.7 discute des résultats obtenus et la section 3.8 conclut ce chapitre.
72
3.2. Travaux connexes
complexe qui se compose de trois sous-réseaux [ZYC+ 18] : le premier sous-réseau est le réseau
de détection des visages (Face detection Network ou FNet), le deuxième est appelé réseau d’ap-
prentissage multi-labels (Multi-label learning Network ou MNet) et le dernier sous-réseau est le
réseau d’apprentissage par transfert (Transfer learning Network ou TNet). Le FNet qui se base
sur Faster RCNN est réentraı̂né pour la détection des visages. Le MNet est également ajusté
par le FNet et sert à prédire divers attributs du visage avec des données étiquetées. TNet est
basé sur MNet pour la prédiction à partir des ensembles de données ayant des attributs du vi-
sage non étiquetés. Les résultats expérimentaux sur des données de visage montrent l’efficacité
de la méthode proposée par rapport aux méthodes standards en entraı̂nant plusieurs attributs
simultanément. Le MNet proposé exploite la corrélation entre 40 attributs pour construire le
groupement d’attributs.
Zu et al. définissent un réseau de neurones convolutifs appelé Multi-Label Convolutional Net-
work ou MLCNN pour prédire les attributs des piétons [ZLLL17] tels que le sexe, les vêtements,
la jupe, etc. À partir d’un jeu de données appelé PETA : (i) l’image entière est divisée en
plusieurs segments de taille égale et intégrée dans le MLCNN ; (ii) chaque partie est filtrée
indépendamment et entièrement connectée pour construire une représentation des caractéristiques.
Dans cette méthode, le réseau de neurones multi-labels développé est constitué d’une combinai-
son de plusieurs fonctions de coût de classification d’attributs binaires. L’ensemble de données
utilisé comprend 19 000 images de piétons, où chaque image est annotée avec un ou plusieurs
attributs considérés. Les auteurs utilisent la fonction softmax pour chaque nœud afin de prédire
chaque attribut. Ils calculent une fonction de coût qui regroupe tous les classificateurs d’attri-
buts. Leurs expériences ont montré que la méthode proposée est considérablement plus perfor-
mante que la méthode SVM proposée dans d’autres articles cités par les auteurs. Ils obtiennent
un meilleur score de classification de 44 attributs sur 45 pour diverses métriques telles que la
justesse de classification, les taux de rappel et les régions sous les courbes ROC (Areas Under
Curves ou AUC).
Wosiak et al. étudient la classification multi-labels pour l’identification de la comorbidité, chez
les patients affectés par plusieurs maladies [WGZ18]. Les auteurs proposent deux méthodes
de classification, à savoir (i) la méthode Independent Label (IL) qui prédit tous les labels sans
tenir compte des données de corrélation et (ii) la méthode Label Chain (LC) qui fait usage
des dépendances tout au long du processus de classification. Leurs résultats expérimentaux
sont évalués par plusieurs métriques (justesse, distance de hamming, précision, rappel, f1-
score). Les résultats obtenus sont également consolidés par inférence statistique, dans trois
ensembles de données médicales sur les enfants. Les classificateurs suivants ont été évalués
pour les méthodes IL et LC : k-Nearest Neighbors, Naive Bayes, Support Vector Machine. Ils
ont conclu que la méthode LC fournit de meilleurs résultats que la méthode IL pour toutes les
mesures d’évaluation et d’inférence statistique.
En médecine, Maxwell [MLY+ 17] a exploité l’apprentissage profond pour identifier les pa-
tients atteints de plusieurs maladies en même temps. Il s’agit des maladies chroniques (telles que
le diabète, l’hypertension artérielle, la stéatose hépatique, etc.) examinées sur 110 300 examens
médicaux. Leur analyse a montré que l’apprentissage profond peut être utilisé pour apprendre
les contributions de chaque caractéristique qui ont un impact sur le risque de maladie chronique
d’un patient. Dans leur processus de classification, les auteurs ont mis en œuvre un réseau de
neurones profonds basé sur la transformation des problèmes et l’adaptation des algorithmes.
Les résultats sont comparés aux méthodes traditionnelles (RAndom k-labELsets ou RAkEL),
73
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
Multi-label k-Nearest Neighbors ou MLkNN à l’aide des métriques de classification : justesse,
précision, rappel et F-score. Ils ont obtenu un score de précision de 92,07% pour le DNN contre
51,03% pour MLKNN ou 85,67% pour RAKEL.
D’autres cas d’applications de la classification multi-labels existent dans la littérature : la par-
ticipation des membres à des communautés d’innovation en ligne [DCDR18], la classification
des genres de films [WB17], la recherche visuelle à grande échelle [XFLH17] et bien d’autres
[GV15, MGCV18].
Ce travail vise à améliorer les réseaux de neurones profonds pour une classification multi-
labels des images. Cette préoccupation présente des similitudes avec certains des travaux brièvement
décrits ci-dessus. Premièrement, nous partageons avec la catégorie de transformation du problème ,
la nécessité d’aborder les difficultés liées à la transformation des données multi-labels. Deuxièmement,
notre problème nécessite également l’adaptation des algorithmes apprentissage profond pour
la tâche de classification. Par conséquent, nous avons conjointement engagé ces deux prin-
cipes à l’aide des réseaux de neurones convolutifs pour construire une approche générique
appelée, réseau de neurones multi-branches. Ce réseau offre deux cas d’usages de classifica-
tion multi-labels : (i) réseau de neurones à sorties multiples incluant plusieurs branches pour
prédire simultanément les étiquettes (labels) des données d’entrée et (ii) réseau de neurones à
caractéristiques multiples qui renferment plusieurs branches de réseaux pré-entraı̂nés pour ex-
traire les caractéristiques des données d’entrée.
La réalisation d’une prédiction avec un réseau de neurones à multiples branches est un concept
sous-jacent de l’apprentissage multitâche qui se construit par la formation de plusieurs tâches
conjointes. En conséquence, nous présentons dans la section suivant le cadre de l’apprentissage
multitâche.
En raison des performances des réseaux neuronaux formés individuellement pour une seule
tâche, les chercheurs ont porté leur attention sur la formation de réseaux capables de résoudre
plusieurs tâches en même temps. Ainsi, l’apprentissage multitâche connaı̂t une large applica-
74
3.4. Méthodologie
bilité dans les problèmes du monde réel, mais elle nécessite la mise en œuvre de méthodes
spécifiquement adaptées. Les sous-tâches ou tâches auxiliaires liées au problème traité doivent
être considérées comme un tout. Leur exécution en silos (sans partage d’informations) peut
provoquer un transfert de connaissance négatif entre les tâches. Le transfert négatif se traduit
par la détérioration des performances du modèle d’apprentissage profond pendant l’apprentis-
sage [ARS18]. Nous pouvons corriger ce problème à l’aide d’une technique de régularisation
qui consiste à introduire des informations supplémentaires telles qu’une pénalité (par exemple,
la régularisation L1 ou L2, la régularisation du dropout, la pondération des pertes) pour la
prévention du sur- et du sous-ajustement [YXA18].
Un important cadre MTL sur l’apprentissage profond a été décrit dans [Rud17]. Le MTL est uti-
lisé dans des situations où nous aimerions obtenir des prédictions de plusieurs tâches en même
temps. Il s’agit d’un apprentissage conjoint avec des tâches auxiliaires, qui peut améliorer l’ef-
ficacité de la tâche principale. Durant la phase d’apprentissage, les informations et les connais-
sances sont partagées entre les tâches auxiliaires pour permettre une meilleure efficacité de
généralisation de la tâche principale. Il est considéré comme une forme d’apprentissage par
transfert inductif qui contient deux méthodes génériques dans l’apprentissage profond : le par-
tage dur et souple des paramètres des couches cachées.
Le partage dur des paramètres : il soutient que des couches cachées sont partagées entre
toutes les tâches et que certaines couches de sortie spécifiques aux tâches sont conservées. Afin
de réduire le risque de sur-apprentissage le modèle est entraı̂né avec une représentation qui en-
globe toutes les tâches auxiliaires.
Le partage souple des paramètres : chaque tâche est définie indépendamment avec son
propre modèle et ses propres paramètres dans un premier temps. Ensuite, des techniques de
régularisation sont utilisées pour ajuster la distance entre les paramètres du modèle en fonction
de leur similarité.
3.4 Méthodologie
3.4.1 Vue d’ensemble
L’apprentissage profond requiert une grande quantité de données pour entraı̂ner un réseau
de neurones profonds. La collecte de données multi-labels à grande échelle est une tâche com-
plexe et fastidieuse. Il est donc possible de transposer les idées véhiculées par le principe
”Diviser et Conquérir” dans le MTL pour la classification de données multi-labels. Ainsi, la
résolution d’une tâche nécessite sa décomposition pour obtenir la résolution de plusieurs tâches
auxiliaires dont leur exécution est imbriquée, faı̂te séquentiellement ou parallèlement. Ces in-
formations nous ont permis de construire deux architectures de réseaux de neurones profonds
basées sur le partage dur (réseau de neurones à sorties multiples) et souple (réseau de neurones
75
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
à caractéristiques multiples) des caractéristiques de couches cachées. Le résultat attendu vise à
améliorer la performance d’un modèle de classification multi-labels.
La première architecture appelée réseau de neurones à sorties multiples est formée d’un
réseau pré-entraı̂né partagé entre plusieurs classificateurs binaires i.e autant d’étiquettes (la-
bels) que de classificateurs binaires avec la taille de la sortie à 1. En second lieu, la deuxième
architecture appelée réseau de neurones à caractéristiques multiples , formée à partir de plu-
sieurs réseaux pré-entraı̂nés pour un classificateur dont la taille en sortie est égale au nombre
d’étiquettes à prédire. Notre approche combine le MTL et transformation de données. Elle offre
une forme d’apprentissage par transfert à travers le déploiement d’un ou plusieurs extracteurs
de caractéristiques. Ainsi, nous pouvons nous servir des connaissances acquises par un réseau
de neurones pré-entraı̂nés lors des tâches de classification (Figure 3.1) :
Cette figure 3.1 montre séparément l’entrée du réseau, le module d’extraction de caractéristiques
d’une entrée et le module de classification :
— Au niveau de la couche d’entrée, le type de données est une image multi-labels (une image
appartenant à une ou plusieurs classes/catégories).
— Le module d’extraction de caractéristiques est constitué de couches d’entrée, de convolu-
tion, de mise en commun (dropout layer), entièrement connectées (fully-connected layer)
et de sorties (output layer). Chaque image reçue en entrée sera filtrée, réduite et cor-
rigée plusieurs fois par ce module. Son but est d’extraire les éléments caractéristiques de
l’image (contours, coins, etc.).
— En général, le module de classification comprend les couches d’abandon (facultatives)
et les couches entièrement connectées qui déterminent le lien entre la position des ca-
ractéristiques dans l’image. Ce type de couche reçoit un vecteur en entrée et produit un
nouveau vecteur qui sera utilisé pour calculer la sortie du réseau de neurones. Pendant
l’apprentissage par transfert, les couches du module de classification seront remplacées
par une ou plusieurs nouvelles couches pour la classification des données du domaine
cible.
76
3.4. Méthodologie
des données multi-labels nous amène à proposer deux systèmes d’apprentissage alternatifs :
(i) un système appelé un réseau de neurones à sorties multiples (Neural Networks with
multi-outputs) dont l’architecture est constituée d’un ensemble de classificateurs binaires dis-
posés parallèlement.
Les couches (cachées) partagées entre les sous-réseaux sont acquises pour le processus
d’extraction de caractéristiques à partir d’un réseau pré-entraı̂né. Les tâches auxiliaires définies
(décrivant des tâches spécifiques) sont formées comme suit :
— Si L est la taille de l’ensemble d’étiquettes, L ≥ 2, nous aurons L sous-réseaux (c’est-à-
dire L branches) constitués de plusieurs couches de neurones associés à L tâches auxi-
liaires.
— Chaque sous-réseau contribue à prédire une sortie j souhaitée liée à l’étiquette Ybj , j =
1...L .
Lors de la conception du modèle de classification, les couches partagées sont étendues
(comme dans lÉquation 3.1) par des couches supplémentaires, les couches entièrement connectées,
77
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
les couches d’abandon ou dropout et une couche d’activation dans toutes les branches (pour
toutes les tâches auxiliaires ou spécifiques). La fonction d’activation ajoutée permet le passage
ou non de l’information si le seuil de stimulation est atteint. Concrètement, son rôle est de
décider si la réponse du neurone doit être activée ou non. Dans cette situation, les fonctions
d’activation choisies sont employées pour produire la sortie de chaque branche.
joinlayer = f use X, I j j = 1 . . . L (3.1)
où X désigne la sortie des couches partagées et I j la couche d’entrée d’une branche j. La
couche I j est complété par d’autres couches complètement connectées ou d’abandon (dropout).
Une fonction d’activation après la dernière couche complètement connectée est créée. Elle
reçoit une valeur d’entrée, la transforme et retourne une valeur de probabilité qui sera utilisée
pour associer un échantillon à une étiquette. Par conséquent, les étiquettes de vérité terrain sont
déduites par cette fonction de seuillage (Équation 3.3). Deux options sont possibles pour établir
ces étiquettes depuis l’entrée : (i) un seuil global est donné pour toutes les étiquettes ou (ii) un
seuil spécifique est donné pour chaque étiquette.
La détermination du seuil global s’effectue en trois étapes (Équation 3.4) :
Étape 1 : Supposons que θ soit un ensemble avec une progression arithmétique ayant une
séquence de nombres. Par conséquent θi est tel que la différence entre les termes consécutifs,
donc θi est constant (représentée par Équation 3.2).
Par exemple, l’ensemble θ a des valeurs ajustées par unité de 10% (de 0% à 100%) avec θ0 =
0, θ1 = 10% et θn = 100%. Les opérations d’incrémentation peuvent être effectuées par une
autre valeur r (différente de 10%), ainsi θi serait incrémenté de r, puis θi+1 + r se voit attribuer
la valeur de :
θ0 = 0
θn+1 = θn + r (3.2)
où les valeurs θ sont comprises entre 0 et 1 ; r est la différence commune (ou raison), dont
les valeurs sont comprises entre 0% et 100%.
Étape 2 : Nous calculons successivement la valeur métrique choisie Mv pour tous les θi
0, x < θm
(
Mv = (3.3)
1, x ≥ θm
où x ∈ Mv
78
3.4. Méthodologie
joinlayer = concatenate x j , j = 1..k (3.5)
où x j représente les sorties des sous-réseaux pré-entraı̂nés et k la taille du sous-réseau pré-
entraı̂né utilisé.
79
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
3.4.5 Algorithme de réseau neurones profonds multi-branches
Dans cette sous-section, nous présentons les algorithmes de classification multi-labels et le
processus d’apprentissage profond. La tâche de classification réalisée par le réseau de neurones
à caractéristiques multiples est décrite par la Figure 3.4. Dans un premier temps, nous utilisons
la méthode de transformation binarisée multi-labels dans le prétraitement des données. Cette
transformation attribue à chaque échantillon un vecteur binaire [y1j , y2j , yij . . . yLj ], j = 1 . . . L, y ∈
Y indiquant la présence ou l’absence d’un label. Si yij = 1 (respectivement yij = 0) cela indique
la présence du label i (respectivement l’absence du label i) dans l’échantillon x j . La taille du
vecteur binaire est égale au nombre d’étiquettes L.
Ensuite, des réseaux pré-entraı̂nés sont mis en avant pour extraire les caractéristiques des données
d’entrée. Dans l’étape suivante, l’opération de concaténation de ces modèles est effectuée en
ajoutant une ou plusieurs couches entièrement connectées, des couches d’abandons et une fonc-
tion d’activation. Le modèle profond obtenu est utilisé pour les ensembles de données d’en-
traı̂nement et de validation.
Figure 3.4 – Procédure de classification d’un réseau avec des caractéristiques multiples
80
3.5. Expérimentons
vous avez L classes, vous aurez L tâches spécifiques soit L sorties sont générées. Le modèle
pré-entraı̂né et les couches additionnelles sont fusionnés pour former un réseau à sorties mul-
tiples. La définition du réseau peut être assez complexe lorsque nous avons un nombre élevé
d’étiquettes. Une technique de simplification peut consister à établir des groupes d’étiquettes
afin de réduire le nombre de tâches.
3.5 Expérimentons
3.5.1 Jeux de données
L’architecture proposée est entraı̂née, validée et évaluée sur les jeux de données Pascal Vi-
sual Object Classes (VOC) 2007 & 2012 [EVGW+ 07], NusWide [CTH+ 09] et Amazon rainfo-
rest [Pla17]. Tous les jeux de données sont décrits dans la section 1.6
81
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
de la fonction d’arrêt précoce afin de contrôler l’arrêt du processus d’entraı̂nement, utile pour
éviter les problèmes de sur- et de sous-apprentissage. Cependant, le déséquilibre des données
peut augmenter de manière significative le risque de problèmes de sur-apprentissage. Dans de
tels cas, il est recommandable d’utiliser l’échantillonnage stratifié pour que les fréquences re-
latives des classes soient approximativement préservées dans chaque pli de formation durant
l’entraı̂nement.
Plusieurs autres éléments sont nécessaires pour optimiser l’apprentissage d’un modèle et le
rendre efficace pour les tâches de classification ultérieures. Pour accomplir cette tâche d’opti-
misation, nous avons utilisé l’optimiseur appelé Adam 1 . Il est également nécessaire de fournir
d’autres moyens pour les tâches d’optimisation qui concernent les principaux hyper-paramètres,
à savoir le taux d’apprentissage, les époques et la taille du lot. La Table 3.1 présente les valeurs
des hyper-paramètres utilisés dans l’apprentissage des deux architectures proposées.
Hyper-paramètres Value
Optimiseur Adam
Taux d’apprentissage 1e-4
Époque 30
Taille du lot 32
82
3.6. Résultats
est insérée entre les couches entièrement connectées et possède une valeur de 0,3 pour
l’expérimentation.
— La dernière couche est une couche entièrement connectée à une dimension (nœuds) et
la fonction sigmoı̈de est ajoutée pour obtenir la probabilité que les étiquettes aient une
valeur comprise entre 0 et 1.
La structure du réseau à caractéristiques multiples est décrite explicitement comme suit :
— La couche 1 est l’entrée du réseau, et elle possède 256x256 pixels.
— La couche 2 (respectivement la couche 3) forme la première (respectivement la deuxième)
branche pour extraire les caractéristiques des données à l’aide du réseau pré-entraı̂né
VGG16 (respectivement Inception-v3).
— La couche 4 est obtenue en concaténant les sorties des couches 2 et 3.
— Les trois dernières couches sont entièrement connectées avec 4096 neurones. Les étiquettes
sont prédites avec la fonction d’activation sigmoı̈de qui donne le score des étiquettes ayant
une valeur entre 0 et 1.
— Entre la dernière couche et les couches entièrement connectées, la couche d’abandon
(dropout) est insérée avec une valeur de 0,3 pour l’expérimentation
.
3.6 Résultats
3.6.1 Evaluation de la performance prédictive
Nous opposons les modèles de classification basés sur ResNet50, Inception-v3, VGG16,
réseau de neurones à sorties multiples basé sur Inception-v3, réseau à caractéristiques
multiples formé par VGG16 et Inception-v3 en termes de performance prédictive de classi-
fication pour montrer leurs efficacités. Tous les modèles sont implémentés dans le framework
Keras [C+ 15]. Ils sont entraı̂nés et testés avec 1 GPU Nvidia, 50G de mémoire fournis par le
centre de Calcul CALMIP 2 en Midi-Pyrénées.
Les Tables 3.2 à 3.5 montrent les résultats expérimentaux des classificateurs pour les quatre (4)
métriques d’évaluation choisies et quatre (4) ensembles de données. Les résultats collectés de
toutes les observations sont comparés et interprétés à l’aide des tests statistiques. Les scores en
gras indiquent les meilleurs résultats sur les tableaux de résultats.
83
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
Jeux de resnet50 inception- vgg16 réseau de réseau
données v3 neurones à de neu-
sorties mul- rones à ca-
tiples ractéristiques
multiples
Amazon 87.05 62.27 84.27 55.26 83.41
rainforest
Voc2007 83.21 85.01 44.20 85.18 92.63
Voc2012 83.21 86.19 59.35 90.58 92.87
Nuswide 70.90 72.51 3.12 80.57 88.17
Table 3.2 – Comparaison des performances entre les différents classificateurs avec la mesure
précision .
Table 3.3 – Comparaison des performances entre les différents classificateurs avec la mesure
rappel .
— H1 : rejet de l’hypothèse nulle selon laquelle il existe au moins une différence statistique-
ment significative entre les classificateurs.
Ainsi, pour comparer plus de deux classificateurs sur plusieurs ensembles de données, le
test de Friedman est employé pour analyser les différences significatives dans les performances
de classificateurs. Ce test est défini comme suit (Équation 3.6) :
1X i
Rj = r (3.7)
N j j
84
3.6. Résultats
Table 3.4 – Comparaison des performances entre les différents classificateurs avec la mesure
f1-score .
Table 3.5 – Comparaison des performances entre les différents classificateurs avec la mesure
moyenne de precision .
En conséquence le test post-hoc de Nemenyi (Nemenyi post-hoc test) qui compare tous les
classificateurs entre eux, est appliqué avec le niveau de signification de 5% (le plus souvent
défini). Ce niveau de signification est un seuil qui détermine si le résultat d’une étude peut être
considéré comme statistiquement significatif après la réalisation des tests statistiques prévus.
Ce test nous montre dans quelle mesure il existe une différence statistique significative entre
les classificateurs ou non. Pour cela, un seuil de différence critique (critical difference) (Table
3.6) est calculé pour établir le niveau de signification de performance entre les classificateurs.
La différence de critique (CD) est calculée comme suit par lÉquation 3.8 :
r
k(k + 1)
CD = qα (3.8)
6N
avec qα la valeur critique du test post-hoc de Nemenyi.
Avec cinq classificateurs, la valeur de CD est de 1.53. Si la différence des rangs entre deux
classificateurs est plus grande que cette valeur, la différence de performance est significative
(Table 3.6).
À partir de la Table 3.6, les résultats montrent que les différences de rang entre réseau de
neurones à caractéristiques multiples et ResNet50 (soit une valeur de 1,69) ; entre réseau
85
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
ResNet50 3,0
Inception-v3 4,0
VGG16 4,25 1,53
de neurones à sorties multiples et VGG16 (soit 1,81) sont supérieures à la valeur 1,53 de
CD. En conséquence, ces résultats ont des différences statistiquement significatives.
Les différences entre les rangs moyens comme ResNet50 et Inception-v3 ou réseau
de neurones à caractéristiques multiples et réseau de neurones à sorties multiples qui font
respectivement 1.0 et 1.12, tous plus petits que CD, ne sont pas statistiquement significatives.
En conséquence, ces architectures ont donc des performances équivalentes.
Figure 3.6 – Diagramme critique pour Nemenyi test. NetMF : réseau de neurones à ca-
ractéristiques multiples et NetMO : réseau de neurones à sorties multiples.
La Figure 3.6 présente le diagramme critique (Critical diagrams) qui donne une représentation
visuelle de ce calcul de distance. Les chiffres sur l’axe horizontal indiquent la valeur moyenne
du rang de chaque classificateur. La différence de performance n’est pas significative pour les
classificateurs qui sont reliés par un trait noir. En conséquence, il n’y a aucune différence signi-
ficative au sein des groupes suivants :
— NetMF, NetMO
— NetMO, Resnet50
— Resnet50, VGG16
— Resnet50, InceptionV3
— Inception-v3, VGG16
3.7 Discussions
86
3.7. Discussions
87
Chapitre 3. Réseaux de neurones convolutifs pour la classification multi-labels
des images
rejetée. La différence critique de ce test est utilisée comme seuil pour déterminer si les perfor-
mances entre deux classificateurs sont significativement différentes. Le classement est établi en
attribuant le rang le plus élevé au meilleur classificateur (Table 3.6).
Les quatre points suivants vont décrire l’avantage de notre approche. Les classificateurs sont
évalués sur quatre ensembles de données de référence. Les expériences statistiques montrent
une amélioration notable de nos deux classificateurs par rapport aux divers classificateurs multi-
labels simples.
2°) Les données traitées et leurs sources Pour chaque expérimentation d’apprentissage
profond, la qualité et le volume des données d’entraı̂nement et de test peuvent contribuer à
améliorer la performance du modèle de classification. Certes, nous n’avons pas de préférence
pour les données utilisées (Pascal VOC, Amazon rainforest, et NusWide) qui ne sont pas de
même nature (section 1.6). Dans cette étude, c’est leur caractère multi-labels qui a été étudié.
Néanmoins, les techniques d’apprentissage par transfert et de l’augmentation des volumes des
données sources ont été d’une grande aide pour l’entraı̂nement des modèles.
88
3.8. Conclusion
3.8 Conclusion
Dans ce chapitre, nous avons proposé une nouvelle approche de classification multi-labels.
Les travaux ainsi décrits définissent un cadre adaptatif des réseaux de neurones profonds par le
biais d’un apprentissage multi-tâches appelé réseau de neurones profonds à plusieurs branches .
Ce cadre comprend un mécanisme de partage dur et souple des paramètres du réseau de neu-
rones profonds. Les réseaux de neurones à plusieurs branches sont capables d’améliorer les
performances des classificateurs multi-labels avec les notions de réseaux de neurones convolu-
tifs à sorties multiples et caractéristiques multiples. Dans les deux cas considérés, les réseaux
pré-entraı̂nés ont servi à construire des tâches d’apprentissage.
Les expériences ont été réalisées sur quatre jeux de données constitués d’images à étiquettes
multiples. Ils ont montré que le partage souple des paramètres dans le cas d’un réseau à ca-
ractéristiques multiples fournit un meilleur résultat de la classification des images par rapport
au partage dur des paramètres pour un réseau à sorties multiples. Les résultats obtenus nous
permettent de conclure que les classificateurs conçus ont une performance comparable à celle
des autres classificateurs standards en apprentissage profond. Pour une analyse significative des
résultats, le test de Friedman suivi du test post-hoc de Nemenyi a été exploré avec un niveau
de signification de 5%, pour la comparaison de plusieurs classificateurs. La visualisation des
résultats de test est établie à l’aide de diagramme critique de différence.
L’architecture d’un réseau de neurones profond est un élément essentiel pour obtenir plus de
performances désirées durant la phase d’entraı̂nement. Par conséquent, l’application de différentes
architectures ne conduit pas nécessairement à des résultats de même précision. Damodaran et
ses collègues ont montré que les techniques de régularisation telles que l’initialisation aléatoire
des poids, les critères d’abandon ou d’arrêt précoce doivent être évaluées avec soin et leurs va-
leurs comparées à des seuils requis [DFSC19]. Les hyper-paramètres que nous utilisons pendant
l’expérimentation sont liés à la nature des données d’entraı̂nement et ils vont influencer sur le
temps du processus d’apprentissage. Certains hyper-paramètres peuvent être plus robustes que
d’autres en fonction des applications considérées. Trouver le bon équilibre en ajustant leur va-
leur nécessite beaucoup d’expérimentations afin de se conformer aux exigences explicites dans
une grande variété de domaines d’application. En conséquence, des modifications de ces pa-
ramètres sont possibles à l’avenir.
Des progrès considérables ont été accomplis dans la reconnaissance d’objets avec l’appren-
tissage profond, grâce à la disponibilité d’un ensemble de données annoté à grande échelle. Ce-
pendant, la taille limitée de l’ensemble de données devient un handicap pour former un réseau
de neurones profonds. Par conséquent, le prochain chapitre étudie l’efficacité de l’apprentissage
par transfert sur un tel ensemble de données pour la classification de la maladie du mildiou du
mil.
89
Chapitre 4
4.1 Introduction
Le mil est l’une des cultures vivrières les plus cultivées dans les régions d’Afrique et d’Asie.
L’Inde, le Niger, la Chine, le Mali ont été les plus gros producteurs mondiaux en 2019 1 . La
présence des maladies au niveau de cette culture conduit à une perte au niveau de sa produc-
tion. Les agriculteurs (avec les phytopathologistes) cherchent à lutter contre les maladies des
plantes depuis des siècles. Ces maladies sont généralement causées par des virus, des bactéries
ou des champignons qui apparaissent dans certaines conditions climatiques ou environnemen-
tales comme la dégradation des sols, les problèmes hydriques, le dérèglement climatique. À la
base, elles sont sources de pertes économiques considérables pour les agriculteurs et menacent
l’autosuffisance alimentaire de la population. Pour résoudre ces problèmes, il est nécessaire de
détecter les maladies des plantes par des techniques avancées et intelligentes.
Pour relever ce défi, les chercheurs en relation avec les coopératives agricoles ont exploité
les potentialités de l’intelligence artificielle (IA) dans le domaine de l’agriculture. Leurs rôles
consistent à suivre l’état de santé des cultures pour prévenir la propagation des maladies. Une
approche innovante de l’IA, l’apprentissage profond a montré un résultat prometteur, en parti-
culier pour la vision par ordinateur en employant les réseaux neurones convolutifs (CNN). Ils
offrent une nouvelle voie de détection basée sur la reconnaissance automatique des formes. À
travers un CNN, il est possible d’analyser, d’interpréter et de visualiser une image afin d’obtenir
des résultats significatifs (comme les motifs). Ainsi une analyse des images des cultures ou des
parcelles à l’aide des CNN va permettre de générer un support de connaissances pour aider les
agriculteurs à prendre des décisions grâce à l’exécution des systèmes d’aide à la décision. En
conséquence, les agriculteurs peuvent choisir des méthodes appropriées de protections perti-
nentes des cultures et innover leur système de production.
Récemment, plusieurs applications de l’apprentissage profond ont trouvé des solutions à de
1. [Link]
91
Chapitre 4. Classification des maladies du mil à l’aide d’un réseau de neurones
convolutifs profonds et de l’apprentissage par transfert
nombreux problèmes de reconnaissance d’images et ont obtenu les meilleurs résultats dans
de nombreux domaines de recherche, tels que les détections des maladies végétales [FYLP18,
LYZ+ 17, MHS16] ou le diagnostic médical [CLX18, DCP+ 19, WRH17] et bien d’autres. D’une
manière générale la motivation principale de ce travail consiste à identifier la maladie mildiou
chez le mil. Cette maladie se caractérise par la transformation partielle ou totale de l’épi ou
la feuille avec l’apparition des tâches brunâtre. Par la suite, les tâches vont s’étendre et provo-
quer la mort de la plante si elles n’ont pas été enrayées rapidement. La recherche des voies et
moyens pour diminuer ou remédier aux problèmes causés par le mildiou fait l’objet de cette
étude. Pour ce faire, nous présentons le développement d’un modèle en utilisant une approche
d’apprentissage profond, en particulier les réseaux de neurones convolutifs en utilisant l’image
de la culture du mil. L’approche proposée dans ce travail applique la technique d’apprentissage
par transfert pour compenser le manque de données d’entraı̂nement et comprend trois étapes
principales : (i) l’acquisition d’images (ii) la définition d’un réseau de neurones composé d’un
”modèle pré-entraı̂né” pour une ”extraction de caractéristiques” et (iii) la classification de la
maladie du mildiou.
Le classificateur réalisé est basé sur le modèle VGG16 pré-entraı̂né ImageNet comme jeu de
données sources. Nous avons un petit jeu de données de 126 images pour les catégories malades
et saines pour identifier ou pas le mildiou. La tâche de classification à l’aide de VGG16 fournit
les résultats suivants : (i) le classificateur des images non étiquetées est construit (ii) la méthode
proposée a été utilisée pour l’extraction de caractéristiques afin d’identifier ou pas la maladie
dans l’image d’entrée.
Ce chapitre est structuré comme suit : les travaux connexes sont présentés dans la section 4.2,
la section 4.3 décrit la méthodologie adoptée. Dans la section 4.4, le contexte expérimental et
les résultats de test sont présentés et la dernière section 4.5 conclut le travail et présente les
recherches futures.
Le riz est l’une des cultures vivrières les plus importantes au monde. Ses maladies ont un
92
4.3. Méthodologie proposée
effet dévastateur sur sa production et constituent également une grande menace pour la sécurité
alimentaire. Lu et ses collègues [LYZ+ 17] ont identifié les maladies du riz à l’aide d’un CNN.
L’étude a catégorisé dix (10) classes de maladies pour un total de 500 images de feuilles et de
tige de riz. L’expérience a montré que le CNN donne un meilleur résultat comparativement aux
modèles d’apprentissages automatiques conventionnels qui utilisent des techniques de bases de
la reconnaissance des formes. Dans le cadre d’une stratégie de validation croisée à 10 plis, le
modèle CNN proposé atteint une justesse de 95,48 %.
Shiqi Yu et al. proposent un modèle CNN capable de classifier une image hyperspectrale, ce
qui est une bonne pratique pour l’agriculture de précision ou la surveillance de l’environnement
[SSC17]. Dans le cadre d’un apprentissage supervisé, ils définissent un CNN qui a appris à partir
des images étiquetées (bâtiment, colline, pâturage, etc.). L’expérimentation fournit un résultat
de 81,75 % de justesse par rapport aux méthodes traditionnelles d’apprentissage automatique
comme les K plus proches voisins et la machine à vecteur de support.
Amara et al. réalisent une approche qui automatise le processus de classification des maladies
de bananiers [ABA17] grâce à l’apprentissage profond. Les auteurs déploient l’architecture
LeNet comme réseau de neurones convolutifs profonds pour classer les maladies sigatoka et
speckle du bananier causées par des champignons déposés sur les feuilles. Sur deux ensembles
de données d’images (en couleur, noir et blanc), ils obtiennent 98,61% de justesse avec les
images en couleur et 94,44% pour les images en noir et blanc.
Les travaux de [RBM+ 17] évaluent la pertinence de l’apprentissage par transfert à partir d’un
modèle de réseaux de neurones convolutif profonds sur les ensembles de données d’images
de manioc. Leur modèle a identifié trois maladies et deux types de dommages causés par les
ravageurs avec les résultats qui suivent : 98% pour la tache brune de la feuille, 96% pour les
dommages causés par les acariens rouges, 95% pour les dommages causés par les acariens
verts (GMD), 98% pour la maladie des stries brunes du manioc et 96% pour la maladie de la
mosaı̈que du manioc (cassava mosaic disease ou CMD).
Rangarajan et al. [RPR18] ont utilisé deux modèles pré-entraı̂nés, AlexNet et VGG16 pour
classifier des feuilles de tomates (six maladies et une classe saine) obtenues à partir du jeu de
données PlantVillage [HS15]. La justesse de la classification a été de 99,24% pour VGG16 et
de 96,51% pour AlexNet.
La détection des maladies des plantes à l’aide des réseaux de neurones convolutifs fournit une
meilleure précision dans la tâche classification par rapport aux techniques traditionnelles de
traitement d’images ou celles de l’apprentissage automatique conventionnel comme la machine
à vecteurs de support.
93
Chapitre 4. Classification des maladies du mil à l’aide d’un réseau de neurones
convolutifs profonds et de l’apprentissage par transfert
menter la capacité de prédiction du réseau de neurones.
94
4.4. Expérimentation et résultats
obtenir un résultat escompté. Nous proposons donc une architecture modifiée pour offrir une
adaptation cohérente.
95
Chapitre 4. Classification des maladies du mil à l’aide d’un réseau de neurones
convolutifs profonds et de l’apprentissage par transfert
les 2/3 (respectivement 80%) de la taille du jeu de données sont utilisés pour l’entraı̂nement et
les 1/3 (respectivement 20%) pour la validation.
Nous retiendrons dans ce travail, pour les données d’entraı̂nement et de validation 80% des
images (soit 99 images) et les 20% des images restantes (soit 27 images) sont utilisés pour le
test (Table 4.1). Pour mesurer la performance du classificateur, plusieurs subdivisions ont été
appliquées : 80/20 (respectivement 70/30, et 60/40) signifie 80% (respectivement 70%, et 60%)
du jeu de données d’entraı̂nement et 20% (respectivement 30%, et 20%) du jeu de données de
validation.
Les images en entrée du réseau sont redimensionnées en 150x150 pixels pour extraire les ca-
ractéristiques importantes. Le processus d’optimisation choisi est la descente de gradient sto-
chastique (SGD) qui fournit une approche itérative pour minimiser l’erreur d’apprentissage. La
Table 4.2 résume les paramètres d’apprentissage initiaux de la phase d’entraı̂nement.
Paramètres Valeur
Taux d’apprentissage (Learning rate) 1e-4
Moment (Momentum) 0.9
Epoque 100
96
4.5. Conclusion
4.5 Conclusion
Dans cette étude, nous avons introduit un réseau de neurones convolutif pré-entraı̂né VGG16
pour l’identification de la maladie du mildiou chez le mil. Nous avons montré l’efficacité de
l’apprentissage par transfert sur un petit jeu de données. L’architecture pré-entraı̂née VGG16 a
été modifiée sur ses couches hautes pour apprendre nos données et effectuer une classification
binaire. La performance observée du modèle durant les expérimentations atteint une justesse de
95%.
Dans les perspectives de ce travail, notre objectif est d’identifier la maladie mildiou observable
chez diverses cultures comme le coton ou la pomme de terre. Notre solution peut s’intégrer à
un dispositif embarqué (appareil photo numérique, un téléphone intelligent, drone) pour aider
les agriculteurs à identifier les maladies des plantes. De plus, nous aimerons utiliser d’autres
réseaux de neurones pour affiner et réduire le taux d’erreur du classificateur.
Il est communément admis que les réseaux de neurones profonds entrent dans la catégorie des
modèles à boı̂tes noires. Cependant, grâce à une technique de visualisation de l’image, il est pos-
sible de sélectionner la zone infectée et voir l’étendue. Cette information peut aider un agricul-
teur à comprendre et communiquer aux autres la prise de décision d’un modèle profond pour la
classification effectuée. Ce point, nommé l’explicabilité de l’intelligence artificielle sera étudié
dans le chapitre suivant. À ce niveau, nous explorons une autre application de l’apprentissage
profond en agriculture, en particulier l’identification et la localisation des insectes parasites.
97
Chapitre 5
5.1 Introduction
Les attaques fongiques des cultures représentent une menace pour la sécurité alimentaire,
car elles réduisent considérablement le rendement et la qualité des cultures. Déterminer les
causes de leur apparition permet une amélioration des performances des systèmes agricoles et
alimentaires. Une attention particulière est accordée aux insectes ravageurs comme un cas res-
ponsable de ces attaques. La détection, l’identification et la localisation efficaces des ravageurs
en temps opportun constituent de véritables défis dans le contexte de l’agriculture de précision.
Résoudre ces défis permettrait de prendre des mesures appropriées pour lutter contre les dom-
mages causés tout en contribuant à la réduction du taux de pesticides utilisés.
Nous assistons aujourd’hui aux différents succès de l’intelligence artificielle pour présenter des
avancées dans diverses tâches automatiques. Son sous-domaine qui est l’apprentissage profond
a été très bénéfique et fait l’objet de plusieurs projets de recherches. Les tâches de recon-
naissance des formes, de traitement automatique des langues, de reconnaissance vocale ou de
diagnostic médical sont largement influencées par ses progrès. Grâce aux réseaux de neurones
profonds dits convolutifs, le développement des systèmes intelligents a permis d’améliorer la
précision des modèles de classification d’images dans tous les domaines y compris l’agriculture
sur son volet gestion de la santé des cultures.
Les réseaux de neurones convolutifs se composent principalement de couches convolutives et
d’autres couches de traitement qui extraient des cartes de caractéristiques sur un ensemble
d’images. Ensuite, des catégories d’étiquettes sont exprimées en sortie du réseau pour désigner
le résultat de la classification. Ces couches renferment un nombre important de paramètres
d’apprentissage et une organisation hiérarchique qui sont exploités par les algorithmes d’ap-
prentissage. Il est difficile, voire compliqué d’expliquer ou de comprendre les décisions prises
par les modèles d’apprentissage pour obtenir les résultats. Malgré leurs résultats satisfaisants
des réseaux de neurones profonds lors des tâches de classification des images, l’un des in-
convénients est la difficulté de comprendre ce que le réseau a appris. En conséquence, ils
sont considérés comme des boı̂tes noires (avec très peu de transparence) dans la mesure où
les différentes couches qui les composent peuvent être difficiles à déchiffrer. De ce fait, il est
99
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
souvent difficile et compliqué d’expliquer ou de comprendre les décisions qu’ils prennent pour
prédire les sorties. Par conséquent, si nous comprenions ce que le modèle a appris, il est pos-
sible de garantir la qualité des résultats obtenus. Cette capacité est cruciale et importante pour
les utilisateurs dans les domaines comme l’imagerie médicale ou le suivi de la santé des exploi-
tations agricoles.
À présent, nous assistons à une croissance des exigences utilisateurs dans la transparence des
algorithmes de l’apprentissage profond. En premier lieu, il s’agira d’offrir une compréhension
du processus d’extraction des caractéristiques au niveau des couches dans un environnement in-
terprétable par les utilisateurs. En second lieu, il faudrait aider les utilisateurs à faire confiance
dans les recommandations des modèles profonds. Troisièmement, nous devons permettre aux
utilisateurs néophytes de distinguer un réseau de neurones fort par rapport à un réseau de neu-
rones faible, même lorsque les deux réseaux font des prédictions similaires. Il est difficile de
répondre à ces attentes si l’utilisateur n’a pas accès à une explication satisfaisante de leur pro-
cessus de décision. Des efforts ont donc été faits pour prendre en compte les exigences de la
transparence, de la clarté et la capacité d’explication qui sont utiles à l’évolution des systèmes
d’intelligence artificielle. La Defense Advanced Research Projects Agency (DARPA) des États-
Unis a lancé une initiative à cet égard appelée eXplainable Artificial Intelligence (XAI) [GA19]
avec l’objectif de généraliser le développement de plateformes explicables (Figure 1.19). En
général, l’idée derrière l’explicabilité des modèles d’apprentissage consiste à fournir aux utili-
sateurs un aperçu des prédictions du modèle. À cet effet, il a émergé un nombre croissant de
recherches sur les techniques qui visualisent les prédictions [BADDS+ 20, DR20, GA19]. Ils per-
mettent d’expliquer les mécanismes complexes ou le fonctionnement des algorithmes et montrer
les possibilités de les décloisonner. Par exemple, certaines techniques ont permis de visualiser
les importantes régions d’une image en utilisant les effets de la déconvolution, la carte d’ac-
tivation de classe (CAM), et la rétropropagation. Ces techniques apportent des améliorations
qualitatives de la prédiction par des modifications du gradient.
La méthode proposée dans ce travail consiste à identifier les insectes ravageurs dans les cultures
à l’aide un réseau de neurones convolutif (CNN) explicable. Une telle approche est utile pour
la surveillance de la santé des cultures. Elle met en évidence les importantes régions de l’image
d’entrée que la méthode de l’explicabilité a déterminé comme étant importantes pour la prédiction.
En effet, nous démontrons que l’approche de l’explicabilité améliore efficacement la qualité de
prédiction d’un modèle. La plupart des explications ont une forte ressemblance avec les données
utilisées pour entraı̂ner le modèle. Afin de fournir aux agriculteurs, des explications qualita-
tives des images par la localisation de la région infectée et interpréter les résultats obtenus, il
est nécessaire d’évaluer quantitativement le modèle développé. Par conséquent, les principales
contributions de la méthode proposée sont les suivantes :
1. Cette étude est une tentative qui étudie ce que les CNN apprennent durant le diagnostic
de la culture. Nous construisons un processus d’interprétation du modèle par l’analyse de
la culture à partir d’une image en entrée.
2. D’un point de vue informatique, cette étude fournit des cartes de visualisations d’un CNN
appliqué à l’analyse de la culture. En général, ces cartes fournies par les méthodes de l’ex-
plicabilité (méthodes xai) sont sensiblement différentes pour la localisation d’objet. Nous
nous servons de cette différence pour construire un schéma de localisation des insectes
parasites.
3. Nous utilisons la théorie de l’information mutuelle pour montrer qu’il est possible de
100
5.2. Travaux connexes
combiner les visualisations des méthodes de l’explicabilité et créer des visualisations plus
fines de la cible qui facilite sa localisation.
4. Lors de la classification d’images, nos visualisations donnent un aperçu des faiblesses
du CNN montrant la présence de l’insecte ravageur pour des prédictions apparemment
déraisonnables ou à faible probabilité.
Ce travail est organisé comme suit. La section 5.2 passe en revue les travaux existants liés
à la détection des insectes ravageurs y compris les techniques de l’explicabilité. La méthode
proposée est présentée dans la section 5.3. La section 5.4 présente les données expérimentales et
la mise en œuvre de la méthode proposée. La section 5.5 explique les résultats, les discussions et
les différentes analyses des résultats. Enfin la dernière section présente la conclusion de l’étude
et les travaux futurs.
101
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
Les résultats expérimentaux ont montré que le Bi-LSTM a obtenu une bonne prédiction de per-
formance de l’aire sous la courbe (Area Under the Curve ou AUC) de 95%.
Plusieurs réseaux de neurones convolutifs sont discutés dans les travaux de [FYKP17, LW20],
pour reconnaı̂tre les insectes ravageurs sur les tomates. Dans [FYKP17], les auteurs offrent une
méta-architecture qui repose sur trois familles de détecteurs et de localisateurs des mala-
dies et des ravageurs : le réseau de neurones convolutifs basé sur une répartition géographique
plus rapide (Faster Region-based Convolutional Neural Network ou Faster R-CNN), le réseau
pleinement convolutif par région (Region-based Fully Convolutional Network ou R-FCN) et
le détecteur multi-boı̂tes à coup unique (Single Shot Multibox Detector ou SSD). Chaque
structure est combinée avec des réseaux de neurones renommés comme VGGNet ou ResNet.
Les images utilisées dans le système sont collectées dans des conditions saisonnières variées.
L’expérimentation a montré une performance de 83% comme moyenne des précisions (mean
Average Precision) avec le cas Faster R-CNN pour VGG-16. Malgré la complexité des certaines
classes pour les ravageurs en raison de la forte variation intra-classe et de certaines similitudes
inter-classes Faster R-CNN avec VGG-16 montre de meilleurs résultats. L’utilisation de la tech-
nique d’augmentation des données a également permis à leur système d’améliorer la précision
moyenne pour chaque cas par rapport à un système entraı̂né sans utiliser l’augmentation des
données.
Dans [FYLP18], les auteurs ont proposé d’améliorer le modèle de détection des maladies et
ravageur de la tomate dont la tâche de classification est confrontée à un problème bien connu,
le déséquilibre des données d’entraı̂nement. La méthode proposée affine leur précédente étude
[FYKP17] et obtient 13.70% de gain supplémentaire, c’est-à-dire 96.25 % de moyenne des
précisions (mean Average Precision). Ce résultat est dû à la conception d’unité d’intégration
de diagnostic qui conserve les échantillons correctement classés afin d’éliminer les échantillons
mal classés indiquant à tort la présence d’un insecte ravageur ou d’une maladie.
Liu et Jun ont amélioré le modèle de détection YoloV3 lors de l’identification des tomates dans
[LW20]. Ils ont validé leur expérience en comparant les modèles SDD, Faster-R-CNN et le
modèle original YoloV3 en mesurant la moyenne des précisions (mean Average Precision). Le
nouveau modèle construit est plus performant que les trois autres avec une justesse (accuracy)
de 92,39 % et un faible temps d’exécution pour la détection. Une série de transformations du
modèle original a permis d’obtenir cette performance : la conversion des couches entièrement
connectées pour réduire le nombre de paramètres du réseau par la création des multiples couches
combinées (couche 2 et couche 4 convolutives sont combinées en couche 5).
Alves et al ont proposé ResNet34* un nouveau modèle qui est basé sur ResNet34 pour clas-
sifier dix types d’insectes ravageurs du coton. Ce modèle de classification utilise la technique
de l’apprentissage par transfert pour atteindre finalement une valeur de 98% pour le F-score
[ASB20] par rapport aux méthodes standards comme Restnet50, Alexnet ou RestNet34. Le
ResNet34* remplace la dernière couche linéaire du modèle original ResNet34 par 7 couches
supplémentaires.
Yafen Li et al ont affiné le modèle GoogleNet pour améliorer la tâche classification de dix
types d’insectes ravageurs [LWD+ 20]. L’expérimentation a atteint une justesse de classifica-
tion de 6,22% supérieure à celles des autres modèles ResNet ou VGGNet, et 5,91% de plus
supérieurs à celle du modèle original, soit un score de 98,91%. L’ensemble de données ini-
tial a subi des prétraitements avant l’étape d’entraı̂nement : la suppression de l’arrière-plan de
l’image et l’augmentation de l’ensemble de données. L’implémentation de leur approche com-
prenait différentes combinaisons de paramètres d’apprentissage, notamment les optimiseurs, et
102
5.3. Méthode proposée
Figure 5.1 – Système d’identification des parasites basé sur l’explicabilité du réseau de neurones
convolutifs
103
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
permet aux réseaux de neurones convolutifs d’apprendre à identifier les caractéristiques de
l’image à l’aide de couches cachées. Les premières couches (couches basses) peuvent apprendre
par exemple à détecter les contours de l’image et les dernières couches (couches hautes) à
découvrir les motifs pour l’ensemble des images. Pendant l’extraction, les informations et les
connaissances sont partagées entre les différentes couches du réseau. Étant donné la nature pro-
fonde des couches du réseau, l’augmentation des données et l’apprentissage par transfert sont
combinés pour rendre efficace ce processus d’extraction. L’augmentation de données va enrichir
notre jeu de données tandis que l’apprentissage par transfert facilite la rapidité de l’entraı̂nement
et le réentraı̂nement de tous les poids du réseau. Le CNN pré-entraı̂né inception-v3 est utilisé
comme modèle de base (Figure 5.2). Son architecture est décrite en détail dans [SVI+ 15].
Figure 5.2 – Ajustement de l’architecture d’inception-v3 pour la classification des insectes ra-
vageurs.
5.3.2 Classification
Les caractéristiques extraites par le modèle pré-entraı̂né sont introduites dans le module de
classification pour prédire la classe correspondante de l’entrée parmi les 102 classes de IP102
(voir 1.6.2). Nous utilisons l’approche ajustement fin ou fine-tuning, qui est une approche de
l’apprentissage par transfert pour adapter le modèle CNN pré-entraı̂né inceptionv3 à notre étude.
Les couches hautes du modèle sont remplacées par trois couches supplémentaires : une couche
globale average pooling, deux couches entièrement connectées (fully connected). La dernière
couche entièrement connectée prend la fonction d’activation softmax. Le schéma global du
modèle proposé est présenté à la Figure 5.2. Nous avons fixé les valeurs des couches fully
connected à 1024 et à 102 neurones. Le modèle final reçoit une image d’entrée à trois canaux
d’une résolution de 224 x 224 pixels et renvoie un vecteur à 102 dimensions, ce qui correspond
aux 102 classes de IP102. Le résultat de la classification peut être déterminé en fonction de la
valeur maximale de la probabilité des 102 classes grâce à la fonction d’activation.
104
5.3. Méthode proposée
Cette génération des cartes visuelles a pour objectif final de choisir une représentation sa-
tisfaisante qui localise la cible. Le choix de la méthode est si difficile parce qu’il s’agit de faire
un compromis entre la performance du modèle fourni d’une part et d’autre part la raison de la
nature locale / globale des explications. Sa conception ne doit pas se limiter à l’utilisation de
ces méthodes, mais de juger leurs utilités et la structure des explications. La démarche adoptée
pour lever cette limitation consiste à fusionner ou combiner les représentations locales Ei de la
donnée d’entrée D prédite comme classe C afin de former la représentation finale E D,C optimale
comme ce qui suit :
où f représente une fonction de transformation des données à partir d’un opérateur de calcul
θ.
Bien que les méthodes explicables soient assez générales dans le sens où elles peuvent être
utilisées pour expliquer les fonctions d’activations dans n’importe quelle couche d’un réseau de
neurones profonds, dans ce travail, nous nous concentrons sur l’explication des décisions de la
couche de sortie uniquement. La section suivante décrit en détail ce processus d’unification des
explications visuelles.
105
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
5.3.4 Combinaison des méthodes de l’explicabilité pour une localisation
fine des insectes ravageurs dans les cultures
Dans ce travail, nous proposons d’utiliser des outils mathématiques pour construire une
image combinée qui désigne le résultat final de l’explicabilité. Cette opération vise à augmen-
ter la capacité du modèle de classification par une localisation plus fine d’un objet. Pour ce
faire, nous faisons appel à des opérations telles que l’union ou le chevauchement des valeurs
d’intensité de pixels correspondantes des images. Dans la littérature, d’autres techniques de
transformations peuvent être employées comme l’addition, la soustraction, la moyenne pour
construire une image combinée. Le défi à relever est un alignement des images pour mettre en
évidence les importantes régions relatives à l’information recherchée.
Le principal problème que pose un alignement d’images est que, l’information contenue dans
chaque image utilisée peut être perdue dans le processus de fusion. Afin de remédier à ce
problème, l’information mutuelle est utilisée comme mesure pour déterminer la combinaison
favorable par paire d’images. L’information mutuelle (MI) obtenue fournit un classement sur le
degré de similitude pouvant exister entre les images. Par ailleurs, la MI aide à réduire l’incerti-
tude dans la visualisation et la localisation des insectes ravageurs.
Fondamentalement, l’information mutuelle est une mesure de dépendance statistique entre deux
variables aléatoires X et Y. Elle mesure la quantité d’information apportée par une variable X
étant donné une valeur connue de l’autre variable Y (Figure 5.3). La dépendance entre les va-
riables est importante lorsque la mesure augmente tandis que la valeur nulle signifie que les
variables sont indépendantes.
106
5.3. Méthode proposée
XX
H(X, Y) = − pXY (x, y) log(pXY (x, y))
x∈X y∈Y
où I(X ; Y) est l’information mutuelle pour X et Y, H(X) est l’entropie de X et H(X | Y)
est l’entropie conditionnelle de X sachant Y connue (observée). Cette mesure est symétrique,
l’échange de X avec Y fournit le même résultat.
Lorsque l’information mutuelle entre plusieurs images est faible, nous déduisons que les
méthodes ayant fourni ces résultats ne sont pas proches dans la résolution du problème considéré.
Cet état de fait est possible du moment où la localisation d’un objet cible (insecte ravageur) peut
être biaisée (ou confuse) uniquement dans certaines configurations : la sortie d’une méthode se
différencie grandement de celles des autres méthodes. À cet effet, nous avons croisé (aligné)
les cartes visuelles explicatives des différentes méthodes XAI, par chevauchement (overlap) ou
union (comme montré par la Figure 5.4). Le chevauchement est l’intersection (correspondant
à l’opérateur AND) des espaces d’images tandis que l’union (correspondant à l’opérateur OU)
représente la fusion de ces espaces, c’est-à-dire un remplissage des espaces non définis avec des
zéros. La disjonction exclusive (correspondant à l’opérateur XOR) est définie par l’union moins
l’intersection.
Figure 5.4 – Alignement des images en une seule image en utilisant les opérateurs OR, AND,
and XOR
L’importance de ces opérations vient du fait suivant : certaines images issues de l’applica-
tion des méthodes XAI peuvent être porteuses d’informations absentes ou faiblement décrites
par d’autres méthodes qui n’ont pas réussi à localiser correctement l’objet cible.
Par exemple, l’union permet de tirer profit de la complémentarité des méthodes en utilisant
ensemble les informations issues des caractéristiques de chacune de ces méthodes. Ainsi, des
besoins de résolution de problème (comme la localisation d’objets dans une image) non cou-
verts par une méthode A, peuvent être satisfaits par une méthode B.
L’intérêt de l’intersection est de vérifier la similarité entre les résultats fournis par les méthodes
107
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
employées. Son objectif est de montrer la concordance des méthodes et éventuellement la fiabi-
lité des résultats obtenus. De ce fait, dans des circonstances analogues, une méthode A peut-être
remplacée par une méthode B similaire.
Le processus d’alignement est appliqué sur des images de même dimension. Il est composé en
trois étapes définies comme suit :
Etape 1 : elle consiste à convertir des images en couleurs en des images de niveaux de gris
d’intensité.
Etape 2 : elle comprend la détection des bords d’images en utilisant un seuil permettant
d’obtenir des images en blanc sur noir. La valeur du seuil est déterminée grâce à des tech-
niques de seuillage qui partitionne une image dans le premier plan (en avant) et à l’arrière-plan.
Cette technique modifie la représentation d’une image en une autre plus facile à traiter. D’une
manière générale, les méthodes de seuillage remplacent chaque pixel de l’image source avec
un pixel noir si l’intensité est inférieure à la valeur du seuil ou blanc si l’intensité de pixel est
supérieure à cette valeur du seuil. Le procédé d’Otsu [Ots79, YSLC12] est une technique de
seuillage d’image utilisée pour la segmentation d’une image en niveau de gris bimodal. C’est
une technique robuste pour la détection, le suivi et la reconnaissance des objets. Dans ce travail,
la combinaison des algorithmes d’inversion binaire (Inverse-Binary Thresholding) et d’Otsu,
convenaient le mieux à nos images pour extraire l’objet cible, à savoir le ravageur de l’arrière-
plan. L’algorithme d’Otsu repose sur des informations statistiques dérivées de l’histogramme
(comme l’entropie). Il calcule automatiquement la valeur optimale du seuil qui sépare les pics
de l’histogramme.
Etape 3 : elle permet la combinaison entre les paires des cartes visuelles issues de deux
transformations précédentes en une seule image en utilisant l’opération d’union, de chevauche-
ment, ou de différence. Le résultat de la fusion constitue une description fine de la localisation
du ravageur. Cette combinaison (voir la section 5.6) est guidée par l’information mutuelle qui
donne un score à chaque paire. Un score élevé signifie une meilleure combinaison.
5.4 Expérimentation
5.4.1 Paramètres d’apprentissage
Dans ce travail, l’optimiseur Adam 1 a été sélectionné pour optimiser la pondération des
poids de la fonction de combinaison. L’entraı̂nement du modèle est effectué avec un taux d’ap-
prentissage de 1e-4 et un ensemble de paramètres supplémentaires β1 = 0, 9 et β2 = 0, 999.
Seule la valeur du taux d’apprentissage a été mise à jour avec 1e-4. Pour classifier les ca-
ractéristiques extraites, nous utilisons la fonction d’activation softmax avec 102 unités de va-
leurs. La distance entre les prédictions du modèle et le vrai label est définie par la fonction de
perte, l’entropie croisée catégorique. Le reste des paramètres est présenté dans la Table 5.1.
Dans notre jeu de données, nous avons en moyenne 737 instances par classes. Nous améliorons
l’entraı̂nement du modèle profond par séries de transformations géométriques des données : ro-
tation aléatoire, retournement horizontal et vertical, etc. Enfin, nous prétraitons les images en
1. Algorithme d’estimation du mouvement adaptatif (Adaptive Movement Estimation en anglais)
108
5.5. Résultats et discussions
Paramètre Valeur
normalisant chaque pixel entre 0 et 1. Toutes les images sont aussi redimensionnées à la taille
de 224x224 pixels. Nous définissons le reste des paramètres supplémentaires dans la Table 5.1.
5.4.2 Implémentation
Nos implémentations ont été réalisées à l’aide de la bibliothèque Python. Les traitements
accomplis pendant l’alignement d’images ainsi que les calculs de l’information mutuelle sont
implémentés avec les librairies open source OpenCV 2 et Scikit Learn 3 . Les réseaux de neurones
proposés ont été mis en œuvre à l’aide du Framework TensorFlow en utilisant 1 GPU Nvidia,
50G de mémoire pour l’entraı̂nement et le test.
2. [Link]
3. [Link]
109
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
5.5.1 Résultat de la classification
Pour la classification d’images, le CNN ajusté inception-v3 a été appliqué avec succès. La
Table 5.2 présente les valeurs de justesse de la classification et F1 sur l’ensemble test. Avec un
meilleur score à 1 et un pire score à 0, le CNN inception-v3 fournit les valeurs de 52,99% pour
la justesse et 48,77% pour le score F1 après 60 époques.
La Table 5.2 fournit aussi les résultats comparatifs avec le travail original effectué par
[WZL+ 19]. Ces résultats démontrent que l’utilisation de inception-v3 a son intérêt en raison
du traitement parallèle (bloc inception) et de la profondeur optimale de son architecture, ce
qui améliore l’apprentissage des caractéristiques de l’image. Les CNN du travail de [WZL+ 19]
sont entraı̂nés par la technique de l’augmentation des données qui a donné de meilleurs résultats
par rapport au système d’entraı̂nement sans augmentation de données. Ces résultats justifient,
l’apport de l’augmentation des données dans l’apprentissage d’un modèle prédiction.
4. [Link]
5. [Link]
110
5.5. Résultats et discussions
Figure 5.5 – Exemples de résultats de classification explicables. class désigne la vérité ter-
rain, pred classe prédite.
Nous pouvons vérifier visuellement et progressivement que certaines améliorations sont ob-
tenues au niveau des couches de neurones en augmentant les effets de perturbation avec la
méthode (Figures 5.6 et 5.7). Dans certaines situations, les méthodes de l’explicabilité peuvent
échouer (ou générer des explications inappropriées) lorsque les infections ne couvrent pas une
grande surface (c’est le cas par exemple de la première ligne sur la Figure 5.5).
111
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
Figure 5.6 – Carte d’explication d’une observation avec Grad-CAM sur les couches profondes
mixed0 à mixed10
(a) 500 séries de per- (b) 1000 séries de per- (c) 1500 séries de per- (d) 2000 Séries de per-
turbations turbations turbations turbations
Il est essentiel de garder à l’esprit que si les cartes visuelles sont l’un des moyens les plus cou-
rants et les plus naturels de présenter une explication de modèle, elles sont également sujettes à
interprétation par le praticien. Les praticiens peuvent interpréter l’explication différemment, en
particulier lorsque la méthode d’explication est inconnue.
112
5.6. Combinaison des méthodes de l’explicabilité
Figure 5.8 – Alignement des images avec les mesures de l’information mutuelle (MI) suivantes :
MI (image 1 et 2) = 0.33 ; MI (image 1 et 3) = 0.56 ; MI (image 2 et 3) = 0.398. Les images
image 1, image 2 et image 3 correspondent respectivement aux résultats des méthodes Grad-
CAM, LIME et Integrated Gradient
Figure 5.9 – Alignement des images avec les mesures de l’information mutuelle (MI) suivantes :
MI (image 1 et 2) = 0.20 ; MI (image 1 et 3) = 0.36 ; MI (image 2 et 3) = 0.25. Les images image
1, image 2 et image 3 correspondent respectivement aux résultats des méthodes Grad-CAM,
LIME et Integrated Gradient
113
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
respectivement les résultats des méthodes Grad-CAM et Integrated Gradient donne en premier
lieu des informations les plus significatives de la localisation de l’insecte ravageur compara-
tivement aux autres. Les transformations d’images avec les opérateurs binaires OR, AND, et
XOR sont des évaluations logiques qui nous permettent d’extraire les objets du premier plan de
l’image. Parmi les opérateurs logiques employés, celui qui localise le mieux le ravageur dans
l’arrière-plan de l’image est l’opérateur OR. L’opérateur OR prend deux arguments et effectue
l’opération OR sur chaque bit de la valeur de l’opérande. Nous avons donc un moyen d’appro-
fondissement de la recherche d’information dans les paires d’images alignées. Lorsque l’objet
cible est présent dans le plan de l’image, cet opérateur met un 1 et un 0 s’il est absent de ce plan.
Le résultat fourni mérite des analyses plus poussées permettant une compréhension plus fine des
mécanismes sous-jacents à cette observation et la marge d’erreur d’appréciation associée.
Notre étude a montré que les méthodes de visualisation pour localiser des insectes ravageurs
ouvrent une nouvelle voie pour les études de la science des plantes, dans un contexte pluridis-
ciplinaire où les informaticiens et les scientifiques des plantes travaillent en synergie grâce aux
modèles d’apprentissage automatique. Grâce à l’accompagnement de ces experts du domaine,
nous pouvons apprécier si les caractéristiques découvertes ont une signification physiologique
concrète afin d’effectuer un ajustement adéquat aux égards des réalités du terrain.
5.7 Conclusion
Cependant, les modèles d’apprentissage profond sont généralement considérés comme des
boı̂tes noires et il est difficile de comprendre ce que le modèle a appris. L’approche proposée
dans ce chapitre utilise des méthodes de visualisation pour comprendre ce que le modèle a ap-
pris, ce qui non seulement garantit la pertinence des résultats générés, mais aussi améliore leur
qualité. Si des biais présents dans les données affectent le processus d’entraı̂nement, ces tech-
114
5.7. Conclusion
niques de visualisation permettent d’éclaircir les impacts sur le modèle et de visualiser ces biais.
Nous avons formulé une proposition de renforcement de l’explicabilité par la combinaison des
résultats des méthodes de visualisation. Cette combinaison guidée par théorie de l’informa-
tion mutuelle a permis de mettre en évidence les régions les plus problématiques dans chaque
image contenant les ravageurs. Elle constitue une preuve visuelle claire mise à disposition de
l’utilisateur pour une meilleure perception de la façon dont un ravageur est identifiable dans
l’image. En effet, certaines méthodes ont montré des potentialités d’explicabilité plus avanta-
geuses par rapport à d’autres. Par exemple, Grad-CAM suggère des éléments visuels offrant
une meilleure explication que la méthode Occlusion Sensitivity. Lorsque l’utilisateur regarde
les résultats fournis, la région où l’insecte apparaı̂t est facilement visible grâce à l’observation
de la carte visuelle explicable, ce qui facilite une bonne identification du problème considéré.
Ce travail est mené sur le jeu de données de référence IP102 qui contient une variété d’insectes
nuisibles avec différentes caractéristiques dans des environnements réels. IP102 est l’un des
plus grands jeux de données contenant plus 75 000 images pour 102 classes et 737 images en
moyenne par classe. Pour la tâche de classification réalisée, l’apprentissage par transfert et la
technique d’augmentation des données ont contribué à l’amélioration la précision du modèle.
Grâce à cela, le CNN pré-entraı̂né inception-v3 a atteint une précision de 52,99% sur l’ensemble
de test, ce qui est meilleur que le résultat du travail original considéré.
Pour étendre le travail actuel à court terme, nous envisageons d’étudier de manière plus
détaillée les éléments pouvant contribuer à une meilleure compréhension de la mauvaise clas-
sification des images mal caractérisées. Par conséquent, il peut être possible d’identifier les
modifications à appliquer afin de fournir des informations supplémentaires pour obtenir une
explication claire du modèle de classification. À moyen terme, nous songeons à une utilisa-
tion comparative avec d’autres architectures d’apprentissage profond telles que DenseNet, et
InceptionResNet qui sont susceptibles de fournir aussi des résultats de classification tout aussi
intéressants sur le même jeu de données.
À travers nos discussions, nous comprenions qu’il est nécessaire de connaı̂tre comment les
modèles prédictifs arrivent à leurs conclusions pour leur déploiement. Même si les méthodes
de visualisation génèrent des résultats significatifs, les humains jouent toujours le rôle le plus
important dans l’appréciation des résultats. Ils relient les résultats produits par l’ordinateur avec
ceux des professionnels des plantes. Ils sont capables d’expliquer pourquoi le modèle a fait une
prédiction particulière. Néanmoins, ces professionnels peuvent interpréter l’explication donnée
différemment, en particulier lorsque la méthode est inconnue.
115
Conclusion et perspectives
117
Chapitre 5. Réseau de neurones convolutif explicable pour la reconnaissance des
insectes nuisibles
présente plusieurs défis scientifiques et technologiques qui ouvrent de nouvelles manières de
voir et d’analyser le monde. Nous nous sommes focalisés sur les réseaux de neurones convolu-
tifs qui ont exhibé des performances intéressantes, en particulier dans le domaine de la vision
par ordinateur. Ils vont donc permettre l’extraction de connaissances à partir de données pour ai-
der contextuellement les agriculteurs dans le processus de prise de décision avec les éléments de
support explicatifs. En conséquence, les agriculteurs peuvent choisir des méthodes appropriées
pour élaborer de pertinentes stratégies de protection des cultures afin de favoriser la durabilité
des systèmes agricoles considérés.
Les travaux de recherche décrits dans ce manuscrit nous ont permis de cerner la dimension
du traitement des données (agricoles) avec l’apprentissage profond, qui tire sa force dans les
théories mathématiques au service du traitement des données avec une considérable puissance
des calculs. Il est difficile de définir clairement, quelles représentations en couches du réseau de
neurones profond, il faudrait pour un apprentissage efficient. Les architectures standards convo-
lutives comme VGGNet, ResNet, Inception servent de bases pour vérifier de nombreux travaux
de recherches ainsi que le transfert d’apprentissage pour partager les connaissances apprises sur
les données tout en limitant les temps de calcul.
Par essence, les méthodes d’apprentissage profond s’appuient sur des jeux de données larges
pour l’entraı̂nement. C’est ainsi que l’apprentissage profond combiné avec l’augmentation des
données apparaı̂t comme une solution alternative en présence de la faiblesse des données. Au-
jourd’hui, même, si, les pratiques agricoles pilotées par les systèmes intelligents gagnent du
terrain, de nombreuses difficultés existent ouvrant la voie à des perspectives futures :
La robotique et l’intelligence artificielle (IA) permettent de réduire les défis les plus impor-
tants ou compliqués pour les humains. Ainsi, les nouvelles techniques doivent s’appuyer sur
des objets connectés pour répondre à la demande de cultiver plus avec moins de charges pour
les producteurs et rendre l’agriculture accessible à tous.
Les algorithmes développés lors de nos travaux de recherches peuvent être déployés sur les
objets connectés ou embarqués sur des engins (drones et tracteurs) ou des humains (lunettes
connectées, smartphones, appareils photos) dans les pratiques agricoles.
Le coût d’investissement dans l’agriculture numérique peut s’avérer énorme. Nombreux
sont les agriculteurs qui ne disposent pas d’un budget suffisant pour un investissement. La
création des portails collaboratifs à vocation agricole pour mettre à la disposition des agricul-
teurs, des données multiples (cartes de fertilité, cartes visuelles explicables, images satellitaires
et relevés météorologiques) est nécessaire dans ce cas.
Les algorithmes d’apprentissage pour détecter les attaques fongiques, gérer les intrants ou
cartographier le rendement des cultures doivent conduire à la réalisation des nouveaux services
exploitables en condition réelle.
L’utilisation d’images de drones dans l’agriculture est devenue un point chaud. Les images
qu’ils fournissent sont en haute définition et ils ont une grande flexibilité en termes d’acquisition
de données. En conséquence, leur utilisation répond à des perspectives de l’agriculture dans des
opérations ciblées comme la pulvérisation.
Les nouvelles recherches en agriculture de précision devront favoriser l’échange entre les
systèmes agricoles et les utilisateurs. L’objectif de cette intégration est de construire une IA
où un utilisateur peut faire confiance à sa recommandation et justifier son utilisation (ou ses
prédictions). Une telle solution aura la capacité de fournir aux utilisateurs les informations et
connaissances utiles à leurs exploitations pour des fins d’amélioration de leurs rendements.
118
Bibliographie
[AAMB18] Javad Abbasi Aghamaleki and Sina Moayed Baharlou. Transfer learning ap-
proach for classification and noise reduction on noisy web data. Expert Systems
with Applications, 105 :221–232, September 2018.
[ABA17] Jihen Amara, Bassem Bouaziz, and Alsayed Algergawy. A deep learning-based
approach for banana leaf diseases classification. Datenbanksysteme für Business,
Technologie und Web (BTW 2017)-Workshopband, 2017.
[ABC+ 19] Vijay Arya, Rachel K. E. Bellamy, Pin-Yu Chen, Amit Dhurandhar, Michael
Hind, Samuel C. Hoffman, Stephanie Houde, Q. Vera Liao, Ronny Luss,
Aleksandra Mojsilović, Sami Mourad, Pablo Pedemonte, Ramya Raghaven-
dra, John Richards, Prasanna Sattigeri, Karthikeyan Shanmugam, Moninder
Singh, Kush R. Varshney, Dennis Wei, and Yunfeng Zhang. One Explanation
Does Not Fit All : A Toolkit and Taxonomy of AI Explainability Techniques.
arXiv :1909.03012 [cs, stat], September 2019.
[AC17] Massimo Aria and Corrado Cuccurullo. Bibliometrix : An R-tool for compre-
hensive science mapping analysis. Journal of Informetrics, 11(4) :959–975, No-
vember 2017.
[ACÖG18] Marco Ancona, Enea Ceolini, Cengiz Öztireli, and Markus Gross. Towards bet-
ter understanding of gradient-based attribution methods for Deep Neural Net-
works, February 2018.
[AHRM14] Auzi Asfarian, Yeni Herdiyeni, Aunu Rauf, and Kikin Hamzah Mutaqin. A
computer vision for rice disease identification to support integrated pest mana-
gement. Crop Protection, (61) :103–104, 2014.
[AKS+ 19] Marko Arsenovic, Mirjana Karanovic, Srdjan Sladojevic, Andras Anderla, and
Darko Stefanovic. Solving current limitations of deep learning based approaches
for plant disease detection. Symmetry, 11(7), 2019.
[ALG+ 19] Antoine Affouard, Jean-Christophe Lombardo, Hervé Goëau, Pierre Bonnet, and
Alexis Joly. Pl@ntNet, April 2019.
[ALY+ 21] Pei An, Junxiong Liang, Kun Yu, Bin Fang, and Jie Ma. Deep structural infor-
mation fusion for 3d object detection on lidar-camera system. Computer Vision
and Image Understanding, page 103295, 2021.
[ALYS17] S. Atharva, X. Liu, X. Yang, and D. Shi. A patch-based convolutional neural
network for remote sensing image classification. Neural Networks. Volume 95,
pages 19–28, 2017.
119
Bibliographie
[ARS18] Muhammad Jamal Afridi, Arun Ross, and Erik M. Shapiro. On automated source
selection for transfer learning in convolutional neural networks. Pattern Recog-
nition, 73 :65–75, January 2018.
[ASAV13] Sai Arivazhagan, R Newlin Shebiah, S Ananthi, and S Vishnu Varthini. Detec-
tion of unhealthy region of plant leaves and classification of plant leaf diseases
using texture features. Agricultural Engineering International : CIGR Journal,
15(1) :211–217, 2013.
[ASB20] Adão Nunes Alves, Witenberg S.R. Souza, and Dı́bio Leandro Borges. Cotton
pests classification in field-based images using deep residual networks. Compu-
ters and Electronics in Agriculture, 174 :105488, July 2020.
[ASM17] Halimatu Sadiyah Abdullahi, Ray E. Sheriff, and Fatima Mahieddine. Convo-
lution neural network in precision agriculture for plant image recognition and
classification. In 2017 Seventh International Conference on Innovative Compu-
ting Technology (INTECH), pages 1–3, Luton, August 2017. IEEE.
[AZH+ 21] Laith Alzubaidi, Jinglan Zhang, Amjad J. Humaidi, Ayad Al-Dujaili, Ye Duan,
Omran Al-Shamma, J. Santamarı́a, Mohammed A. Fadhel, Muthana Al-Amidie,
and Laith Farhan. Review of deep learning : Concepts, CNN architectures, chal-
lenges, applications, future directions. Journal of Big Data, 8(1) :1–74, Decem-
ber 2021.
[BADDS+ 20] Alejandro Barredo Arrieta, Natalia Dı́az-Rodrı́guez, Javier Del Ser, Adrien Ben-
netot, Siham Tabik, Alberto Barbado, Salvador Garcia, Sergio Gil-Lopez, Da-
niel Molina, Richard Benjamins, Raja Chatila, and Francisco Herrera. Explai-
nable Artificial Intelligence (XAI) : Concepts, taxonomies, opportunities and
challenges toward responsible AI. Information Fusion, 58 :82–115, June 2020.
[BBM+ 15] Sebastian Bach, Alexander Binder, Grégoire Montavon, Frederick Klauschen,
Klaus-Robert Müller, and Wojciech Samek. On Pixel-Wise Explanations for
Non-Linear Classifier Decisions by Layer-Wise Relevance Propagation. PLOS
ONE, 10(7) :e0130140, July 2015.
[BBSF19] Philippe Borianne, Frederic Borne, Julien Sarron, and Emile Faye. Deep man-
goes : from fruit detection to cultivar identification in colour images of mango
trees, 2019.
[BCDZ17] Alessio Benavoli, Giorgio Corani, Janez Demšar, and Marco Zaffalon. Time
for a Change : A Tutorial for Comparing Multiple Classifiers Through Bayesian
Analysis. Journal of Machine Learning Research, 18(77) :1–36, 2017.
[BCSB20] Utpal Barman, Ridip Dev Choudhury, Diganto Sahu, and Golap Gunjan Bar-
man. Comparison of convolution neural networks for smartphone image based
real time classification of citrus leaf disease. Computers and Electronics in Agri-
culture, 177, October 2020.
[BEF19] Kevin Bascol, Rémi Emonet, and Elisa Fromont. Improving Domain Adaptation
By Source Selection. In ICIP 2019 - IEEE International Conference on Image
Processing, Taı̈pei, Taiwan, September 2019. IEEE.
[BHC18] M Dian Bah, Adel Hafiane, and Raphael Canals. Deep learning with unsupervi-
sed data labeling for weed detection in line crops in uav images. Remote Sensing,
10(11), 2018.
120
Bibliographie
[BLSB04] Matthew R. Boutell, Jiebo Luo, Xipeng Shen, and Christopher M. Brown. Lear-
ning multi-label scene classification. Pattern Recognition, 37(9) :1757–1771,
September 2004.
[BMS17] Simone Bianco, Davide Mazzini, and Raimondo Schettini. Deep Multibranch
Neural Network for Painting Categorization. In Sebastiano Battiato, Giovanni
Gallo, Raimondo Schettini, and Filippo Stanco, editors, Image Analysis and Pro-
cessing - ICIAP 2017, volume 10484, pages 414–423. Springer International Pu-
blishing, Cham, 2017.
[C+ 15] François Chollet et al. Keras. [Link] 2015.
[Car97] Rich Caruana. Multitask Learning. Machine Learning, 28(1) :41–75, July 1997.
[CCZ+ 20] Junde Chen, Jinxiu Chen, Defu Zhang, Yuandong Sun, and Y. A. Nanehkaran.
Using deep transfer learning for image-based plant disease identification. Com-
puters and Electronics in Agriculture, 173 :undefined–undefined, 2020.
[CFHR17] Nicolas Courty, Rémi Flamary, Amaury Habrard, and Alain Rakotoma-
monjy. Joint Distribution Optimal Transportation for Domain Adaptation.
arXiv :1705.08848 [cs, stat], May 2017.
[CFT14] Nicolas Courty, Rémi Flamary, and Devis Tuia. Domain Adaptation with Re-
gularized Optimal Transport. In Toon Calders, Floriana Esposito, Eyke Hüller-
meier, and Rosa Meo, editors, Machine Learning and Knowledge Discovery in
Databases, volume 8724, pages 274–289. Springer Berlin Heidelberg, Berlin,
Heidelberg, 2014.
[CH16] Gong Cheng and Junwei Han. A survey on object detection in optical remote sen-
sing images. ISPRS Journal of Photogrammetry and Remote Sensing, 117 :11–
28, July 2016.
[CHL+ 20a] Ching-Ju Chen, Ya-Yu Huang, Yuan-Shuo Li, Chuan-Yu Chang, and Yueh-Min
Huang. An AIoT based smart agricultural system for pests detection. IEEE
Access, 8 :180750–180761, 2020.
[CHL20b] Yuh-Shyan Chen, Chih-Shun Hsu, and Chia-Ling Lo. An entire-and-partial fea-
ture transfer learning approach for detecting the frequency of pest occurrence.
IEEE Access, 8 :92490–92502, 2020.
[CKKT19] Solemane Coulibaly, Bernard Kamsu-Foguem, Dantouma Kamissoko, and
Daouda Traore. Deep neural networks with transfer learning in millet crop
images. Computers in Industry, 108 :115–120, June 2019.
[CLX18] Yidong Chai, Hongyan Liu, and Jie Xu. Glaucoma diagnosis based on both hid-
den features and domain knowledge through deep learning models. Knowledge-
Based Systems, 161 :147–156, 2018.
[CR20] Dae-Kyoo Kim Chengjuan Ren, and Dongwon Jeong. A Survey of Deep Lear-
ning in Agriculture : Techniques and Their Applications. Journal of Information
Processing Systems, 16(5) :1015–1033, October 2020.
[CSHB18] Aditya Chattopadhay, Anirban Sarkar, Prantik Howlader, and Vineeth N Bala-
subramanian. Grad-cam++ : Generalized gradient-based visual explanations for
deep convolutional networks. 2018 IEEE Winter Conference on Applications of
Computer Vision (WACV), Mar 2018.
121
Bibliographie
[CTH+ 09] Tat-Seng Chua, Jinhui Tang, Richang Hong, Haojie Li, Zhiping Luo, and Yantao
Zheng. NUS-WIDE : A real-world web image database from National Univer-
sity of Singapore. In CIVR ’09, 2009.
[CX16] Guo Chen and Lu Xiao. Selecting publication keywords for domain analysis
in bibliometrics : A comparison of three methods. Journal of Informetrics,
10(1) :212–223, 2016.
[CXZ+ 20] Peng Chen, Qingxin Xiao, Jun Zhang, Chengjun Xie, and Bing Wang. Occur-
rence prediction of cotton pests and diseases by bidirectional long short-term
memory networks with climate and atmosphere circulation. Computers and
Electronics in Agriculture, 176 :105612, September 2020.
[CZ14] C. Zhang and Z. Zhang. Improving multiview face detection with multi-task
deep convolutional neural networks. In IEEE Winter Conference on Applications
of Computer Vision, pages 1036–1041, March 2014.
[CZC+ 17] Xi Cheng, Youhua Zhang, Yiqiong Chen, Yunzhi Wu, and Yi Yue. Pest iden-
tification via deep residual learning in complex background. Computers and
Electronics in Agriculture, 141 :351–356, September 2017.
[DB09] Nicola De Bellis. Bibliometrics and citation analysis : from the science citation
index to cybermetrics. scarecrow press, 2009.
[DBD16] A. Dey, Debasmita Bhoumik, and K. N. Dey. Automatic Detection of White-
fly Pest using Statistical Feature Extraction and Image Classification Methods.
2016.
[DCDR18] Steven Debaere, Kristof Coussement, and Tom De Ruyck. Multi-label classi-
fication of member participation in online innovation communities. European
Journal of Operational Research, 270(2) :761–774, October 2018.
[DCP+ 19] Jingcheng Du, Qingyu Chen, Yifan Peng, Yang Xiang, Cui Tao, and Zhiyong
Lu. ML-Net : Multi-label classification of biomedical texts with deep neural
networks. Journal of the American Medical Informatics Association : JAMIA,
June 2019.
[Dem06] Janez Demšar. Statistical Comparisons of Classifiers over Multiple Data Sets.
Journal of Machine Learning Research, pages 1–30, January 2006.
[DFSC19] Bharath Bhushan Damodaran, Rémi Flamary, Vivien Seguy, and Nicolas Courty.
An Entropic Optimal Transport loss for learning deep neural networks under la-
bel noise in remote sensing images. Computer Vision and Image Understanding,
page 102863, November 2019.
[DK17] Finale Doshi-Velez and Been Kim. Towards A Rigorous Science of Interpretable
Machine Learning. arXiv :1702.08608 [cs, stat], March 2017.
[DKC+ 21] P. Deepalakshmi, Prudhvi T. Krishna, Siri S. Chandana, K. Lavanya, and Par-
vathaneni Naga Srinivasu. Plant leaf disease detection using CNN algorithm.
International Journal of Information System Modeling and Design, 12(1, SI) :1–
21, January 2021.
[DLJ+ 19] Wang Dawei, Deng Limiao, Ni Jiangong, Gao Jiyue, Zhu Hongfei, and Han
Zhongzhi. Recognition pest by image-based transfer learning. Journal of the
Science of Food and Agriculture, 99(10) :4524–4531, August 2019.
122
Bibliographie
[DR20] Arun Das and Paul Rad. Opportunities and Challenges in Explainable Artificial
Intelligence (XAI) : A Survey. arXiv :2006.11371 [cs], June 2020.
[DSB17] Derek Doran, Sarah Schulz, and Tarek R. Besold. What Does Explainable AI
Really Mean ? A New Conceptualization of Perspectives. arXiv :1710.00794
[cs], October 2017.
[EC21] Benjamin Ejzenberg and Anna Choury. Objectif ia : initiez-vous à l’intelligence
artificielle, 2021.
[EMA+ 20] Borja Espejo-Garcia, Nikos Mylonas, Loukas Athanasakos, Spyros Fountas, and
Ioannis Vasilakoglou. Towards weeds identification assistance through transfer
learning. Computers and Electronics in Agriculture, 171, April 2020.
[EVGW+ 07] Mark. Everingham, L. Van Gool, C. K. I. Williams, J. Winn, and A. Zisserman.
The PASCAL Visual Object Classes Challenge 2007 (VOC2007) Results. 2007.
[EVGW+ 12] M. Everingham, L. Van Gool, C. K. I. Williams, J. Winn, and A. Zisserman. The
PASCAL Visual Object Classes Challenge 2012 (VOC2012). 2012.
[FAO20] FAO. Plant pests and diseases : FAO in Emergencies.
http ://[Link]/emergencies/emergency-types/plant-pests-and-diseases/en/,
2020.
[FK18] G.A. Fotso Kamga. A deep heterogeneous feature fusion approach for automatic
land-use classification. Information Sciences, Issue, 467 :199–218, 2018.
[Fou20] Fotis Foukalas. Cognitive IoT platform for fog computing industrial applica-
tions. Computers & Electrical Engineering, 87 :106770, October 2020.
[Fuk80] Kunihiko Fukushima. Neocognitron : A self-organizing neural network model
for a mechanism of pattern recognition unaffected by shift in position. Biological
Cybernetics, 36(4) :193–202, April 1980.
[FYKP17] Alvaro Fuentes, Sook Yoon, Sang Kim, and Dong Sun Park. A Robust Deep-
Learning-Based Detector for Real-Time Tomato Plant Diseases and Pests Re-
cognition. Sensors, 17(9) :2022, September 2017.
[FYLP18] Alvaro F. Fuentes, Sook Yoon, Jaesu Lee, and Dong Sun Park. High-
Performance Deep Neural Network-Based Tomato Plant Diseases and Pests
Diagnosis System With Refinement Filter Bank. Frontiers in Plant Science,
9 :1162, August 2018.
[GA19] David Gunning and David Aha. Darpa’s explainable artificial intelligence (xai)
program. AI Magazine, 40(2) :44–58, Jun. 2019.
[Gan05] Jean-Marc A Gandonou. Essays on precision agriculture technology adoption
and risk management. volume 227. University of Kentucky Doctoral Disserta-
tions, 2005.
[GBS+ 18] Sambuddha Ghosal, David Blystone, Asheesh K. Singh, Baskar Ganapathysu-
bramanian, Arti Singh, and Soumik Sarkar. An explainable deep machine vision
framework for plant stress phenotyping. Proceedings of the National Academy
of Sciences, 115(18) :4613–4618, May 2018.
[GBY+ 18] Leilani H. Gilpin, David Bau, Ben Z. Yuan, Ayesha Bajwa, Michael Specter,
and Lalana Kagal. Explaining Explanations : An Overview of Interpretability of
Machine Learning. pages 80–89, May 2018.
123
Bibliographie
124
Bibliographie
[HZC+ 17] Andrew G. Howard, Menglong Zhu, Bo Chen, Dmitry Kalenichenko, Wei-
jun Wang, Tobias Weyand, Marco Andreetto, and Hartwig Adam. Mobile-
Nets : Efficient Convolutional Neural Networks for Mobile Vision Applications.
arXiv :1704.04861 [cs], April 2017.
[HZRS15] Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Deep Residual Lear-
ning for Image Recognition. arXiv :1512.03385 [cs], December 2015.
[IL65] Alekseı̆ Grigor’evich Ivakhnenko and Valentin Grigorévich Lapa. Cybernetic
Predicting Devices. CCM Information Corporation, 1965.
[Iva68] A. G. Ivakhnenko. The Group Method of Data of Handling ; A rival of the
method of stochastic approximation. Soviet Automatic Control, 13 :43–55, 1968.
[Iva71] A. G. Ivakhnenko. Polynomial theory of complex systems. IEEE Transactions
on Systems, Man, and Cybernetics, SMC-1(4) :364–378, 1971.
[Kan58] L. Kantorovitch. On the Translocation of Masses. Management Science, 5(1) :1–
4, October 1958.
[KHC20] Mohamed Kerkech, Adel Hafiane, and Raphael Canals. Vine disease detection in
UAV multispectral images using optimized image registration and deep learning
segmentation approach. Computers and Electronics in Agriculture, 174, July
2020.
[KIP+ 08] Johanna Koskinen, Matti Isohanni, Henna Paajala, Erika Jääskeläinen, Pentti
Nieminen, Hannu Koponen, Pekka Tienari, and Jouko Miettunen. How to use bi-
bliometric methods in evaluation of scientific research ? an example from finnish
schizophrenia research. Nordic journal of psychiatry, 62 :136–43, 02 2008.
[KLSS17] Nataliia Kussul, Mykola Lavreniuk, Sergii Skakun, and Andrii Shelestov. Deep
Learning Classification of Land Cover and Crop Types Using Remote Sensing
Data. IEEE Geoscience and Remote Sensing Letters, 14(5) :778–782, May 2017.
[KP18] Andreas Kamilaris and Francesc X. Prenafeta-Boldú. Deep learning in agricul-
ture : A survey. Computers and Electronics in Agriculture, 147 :70–90, April
2018.
[KSH12] Alex Krizhevsky, Ilya Sutskever, and Geoffrey E Hinton. ImageNet classification
with deep convolutional neural networks. In F. Pereira, C. J. C. Burges, L. Bot-
tou, and K. Q. Weinberger, editors, Advances in Neural Information Processing
Systems, volume 25. Curran Associates, Inc., 2012.
[LBBH98] Y. Lecun, L. Bottou, Y. Bengio, and P. Haffner. Gradient-based learning applied
to document recognition. Proceedings of the IEEE, 86(11) :2278–2324, Novem-
ber 1998.
[LBD+ 89] Y. LeCun, B. Boser, J. S. Denker, D. Henderson, R. E. Howard, W. Hubbard, and
L. D. Jackel. Backpropagation Applied to Handwritten Zip Code Recognition.
Neural Computation, 1(4) :541–551, December 1989.
[LBM+ 18] Konstantinos Liakos, Patrizia Busato, Dimitrios Moshou, Simon Pearson, and
Dionysis Bochtis. Machine Learning in Agriculture : A Review. Sensors,
18(8) :2674, August 2018.
[LBMS18] Philipp Lottes, Jens Behley, Andres Milioto, and Cyrill Stachniss. Fully convo-
lutional networks with sequential information for robust crop and weed detection
125
Bibliographie
126
Bibliographie
[MCDG21] Omid Mohamad Nezami, Akshay Chaturvedi, Mark Dras, and Utpal Garain.
Pick-object-attack : Type-specific adversarial attack for object detection. Com-
puter Vision and Image Understanding, 211 :103257, 2021.
[MGCV18] Jose M. Moyano, Eva L. Gibaja, Krzysztof J. Cios, and Sebastián Ventura. Re-
view of ensembles of multi-label classifiers : Models, experimental study and
prospects. Information Fusion, 44 :33–45, November 2018.
[MHS16] Sharada P. Mohanty, David P. Hughes, and Marcel Salathé. Using Deep Learning
for Image-Based Plant Disease Detection. Frontiers in Plant Science, 7 :1419,
September 2016.
[MLY+ 17] Andrew Maxwell, Runzhi Li, Bei Yang, Heng Weng, Aihua Ou, Huixiao Hong,
Zhaoxian Zhou, Ping Gong, and Chaoyang Zhang. Deep learning architectures
for multi-label classification of intelligent health risk prediction. BMC Bioinfor-
matics, 18(S14), December 2017.
[NGMN19] Manuel Nunes, Enrico Gerding, Frank McGroarty, and Mahesan Niranjan. A
comparison of multitask and single task learning with artificial neural networks
for yield curve forecasting. Expert Systems with Applications, 119 :362–375,
April 2019.
[NJS+ 19] Koushik Nagasubramanian, Sarah Jones, Asheesh K. Singh, Soumik Sarkar, Arti
Singh, and Baskar Ganapathysubramanian. Plant disease identification using
explainable 3D deep learning on hyperspectral images. Plant Methods, 15(1),
August 2019.
[Ots79] Nobuyuki Otsu. A Threshold Selection Method from Gray-Level Histograms.
IEEE Transactions on Systems, Man, and Cybernetics, 9(1) :62–66, January
1979.
[PAW+ 17] Michael P. Pound, Jonathan A. Atkinson, Darren M. Wells, Tony P. Pridmore,
and Andrew P. French. Deep Learning for Multi-task Plant Phenotyping. In
2017 IEEE International Conference on Computer Vision Workshops (ICCVW),
pages 2055–2063, Venice, Italy, October 2017. IEEE.
[PKA19] Victor Partel, Charan Kakarla, and Yiannis Ampatzidis. Development and eva-
luation of a low-cost and smart technology for precision weed management utili-
zing artificial intelligence. Computers and Electronics in Agriculture, 157 :339–
350, February 2019.
[Pla17] Planet : Understanding the amazon from space, 2017.
[PPZM18] Rafael B. Pereira, Alexandre Plastino, Bianca Zadrozny, and Luiz H. C. Mersch-
mann. Correlation analysis of performance measures for multi-label classifica-
tion. Information Processing & Management, 54(3) :359–369, May 2018.
[PSA+ 19] Artzai Picon, Maximiliam Seitz, Aitor Alvarez-Gila, Patrick Mohnke, Amaia
Ortiz-Barredo, and Jone Echazarra. Crop conditional Convolutional Neural Net-
works for massive multi-crop plant disease classification over cell phone acqui-
red images taken on real field conditions. Computers and Electronics in Agri-
culture, 167, December 2019.
[PVG+ 11] F. Pedregosa, G. Varoquaux, A. Gramfort, V. Michel, B. Thirion, O. Grisel,
M. Blondel, P. Prettenhofer, R. Weiss, V. Dubourg, J. Vanderplas, A. Passos,
127
Bibliographie
128
Bibliographie
[RSG18] Marco Tulio Ribeiro, Sameer Singh, and Carlos Guestrin. Anchors : High-
precision model-agnostic explanations. In AAAI Conference on Artificial In-
telligence (AAAI), 2018.
[Rud17] Sebastian Ruder. An Overview of Multi-Task Learning in Deep Neural Net-
works. arXiv :1706.05098 [cs, stat], June 2017.
[RvHB+ 20] Thijs Ruigrok, Eldert van Henten, Johan Booij, Koen van Boheemen, and Gert
Kootstra. Application-specific evaluation of a weed-detection algorithm for
plant-specific spraying. Sensors, 20(24), 2020.
[RZ18] Bharath Ramsundar and Reza Bosagh Zadeh. TensorFlow for Deep Learning :
From Linear Regression to Reinforcement Learning. O’Reilly Media, Beijing,
first edition edition, 2018.
[SCD+ 16] Ramprasaath R. Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Ve-
dantam, Devi Parikh, and Dhruv Batra. Grad-CAM : Visual Explanations from
Deep Networks via Gradient-based Localization. arXiv :1610.02391 [cs], Octo-
ber 2016.
[SCJJ19] Uday Pratap Singh, Siddharth Singh Chouhan, Sukirty Jain, and Sanjeev Jain.
Multilayer convolution neural network for the classification of mango leaves in-
fected by anthracnose disease. IEEE Access, 7 :43721–43729, 2019.
[SDMC20] Arun Kumar Sangaiah, Jerline Sheebha Anni Dhanaraj, Prabu Mohandas, and
Aniello Castiglione. Cognitive IoT system with intelligence techniques in sus-
tainable computing environment. Computer Communications, 154 :347–360,
March 2020.
[SGAS17] A. Shahin, Y. Guo, K. Amin, and A.A. Sharawi. White blood cells identifica-
tion system based on convolutional deep neural learning networks. In Computer
Methods and Programs in Biomedicine, pages 1–12. 2017.
[SGSK17] Avanti Shrikumar, Peyton Greenside, Anna Shcherbina, and Anshul Kundaje.
Not Just a Black Box : Learning Important Features Through Propagating Acti-
vation Differences. arXiv :1605.01713 [cs], April 2017.
[SHK+ 14] Nitish Srivastava, Geoffrey Hinton, Alex Krizhevsky, Ilya Sutskever, and Rus-
lan Salakhutdinov. Dropout : A Simple Way to Prevent Neural Networks from
Overfitting. Journal of Machine Learning Research, 15 :1929–1958, 2014.
[SLJ+ 14] Christian Szegedy, Wei Liu, Yangqing Jia, Pierre Sermanet, Scott Reed, Dra-
gomir Anguelov, Dumitru Erhan, Vincent Vanhoucke, and Andrew Rabinovich.
Going Deeper with Convolutions. arXiv :1409.4842 [cs], September 2014.
[SM19] Wojciech Samek and Klaus-Robert Müller. Towards explainable artificial intel-
ligence. Lecture Notes in Computer Science, page 5–22, 2019.
[SS19] Y. Seo and K.-s Shin. Hierarchical convolutional neural networks for fashion
image classification. Expert Systems with Applications,, February. Volume,
116 :328–339, 2019.
[SSC17] Y. Shiqi, J. Sen, and X. Chunyan. Convolutional neural networks for hyperspec-
tral image classification. Neurocomputing, 219 :88–98, 2017.
[SSL20] Amitojdeep Singh, Sourya Sengupta, and Vasudevan Lakshminarayanan. Ex-
plainable Deep Learning Models in Medical Image Analysis. Journal of Ima-
ging, 6(6) :52, June 2020.
129
Bibliographie
[STY17] Mukund Sundararajan, Ankur Taly, and Qiqi Yan. Axiomatic Attribution for
Deep Networks. arXiv :1703.01365 [cs], June 2017.
[SVI+ 15] Christian Szegedy, Vincent Vanhoucke, Sergey Ioffe, Jonathon Shlens, and Zbi-
gniew Wojna. Rethinking the Inception Architecture for Computer Vision.
arXiv :1512.00567 [cs], December 2015.
[SVZ14] Karen Simonyan, Andrea Vedaldi, and Andrew Zisserman. Deep Inside Convo-
lutional Networks : Visualising Image Classification Models and Saliency Maps.
arXiv :1312.6034 [cs], April 2014.
[SWM17] Wojciech Samek, Thomas Wiegand, and Klaus-Robert Müller. Explainable Ar-
tificial Intelligence : Understanding, Visualizing and Interpreting Deep Learning
Models. arXiv :1708.08296 [cs, stat], August 2017.
[SZ14] Karen Simonyan and Andrew Zisserman. Very deep convolutional networks for
large-scale image recognition. arXiv preprint arXiv :1409.1556, 2014.
[TBSN12] T. Zhang, B. Ghanem, S. Liu, and N. Ahuja. Robust visual tracking via multi-
task sparse learning. In 2012 IEEE Conference on Computer Vision and Pattern
Recognition, pages 2042–2049, June 2012.
[TG20] Erico Tjoa and Cuntai Guan. A Survey on Explainable Artificial Intelligence
(XAI) : Towards Medical XAI. IEEE Transactions on Neural Networks and
Learning Systems, pages 1–21, 2020.
[TIT+ 21] Muhammad Tufail, Javaid Iqbal, Mohsin Islam Tiwana, Muhammad Shahab
Alam, Zubair Ahmad Khan, and Muhammad Tahir Khan. Identification of to-
bacco crop based on machine learning for a precision agricultural sprayer. IEEE
Access, 9 :23814–23825, 2021.
[TK07] Grigorios Tsoumakas and Ioannis Katakis. Multi-label classification : An over-
view. In Int J Data Warehousing and Mining, 2007.
[TN07] D. V. Tran and N. Nguyen. The concept and implementation of precision farming
and rice integrated crop management systems for sustainable production in the
twenty-first century. 2007.
[TR19] K. Thenmozhi and U. Srinivasulu Reddy. Crop pest classification based on deep
convolutional neural network and transfer learning. Computers and Electronics
in Agriculture, 164, September 2019.
[VCS20] Shradha Verma, Anuradha Chug, and Amit Prakash Singh. Exploring capsule
networks for disease classification in plants. Journal of Statistics and Manage-
ment Systems, 23(2) :307–315, 2020.
[Vil09] Cédric Villani. Optimal Transport : Old and New. Number 338 in Grundlehren
Der Mathematischen Wissenschaften. Springer, Berlin, 2009.
[vW10] Nees Jan van Eck and Ludo Waltman. Software survey : VOSviewer, a compu-
ter program for bibliometric mapping. Scientometrics, 84(2) :523–538, August
2010.
[Was18] Ritika Wason. Deep learning : Evolution and expansion. Cognitive Systems
Research, 52 :701–708, December 2018.
130
Bibliographie
[WB17] J. Wehrmann and R.C. Barros. Movie genre classification : A multi-label ap-
proach based on convolutions through time. Applied Soft Computing, Volume,
61 :973–982, 2017.
[WGVB17] Sjaak Wolfert, Lan Ge, Cor Verdouw, and Marc-Jeroen Bogaardt. Big Data in
Smart Farming – A review. Agricultural Systems, 153 :69–80, May 2017.
[WGZ18] A. Wosiak, K. Glinka, and D. Zakrzewska. Multi-label classification methods
for improving comorbidities identification. Computers in Biology and Medicine,
100 :279–288, September 2018.
[WLW+ 18] Wei Weng, Yaojin Lin, Shunxiang Wu, Yuwen Li, and Yun Kang. Multi-label
learning based on label-specific features and local pairwise label correlation.
Neurocomputing, 273 :385–394, January 2018.
[WLX+ 21] Rujing Wang, Liu Liu, Chengjun Xie, Po Yang, Rui Li, and Man Zhou. Agri-
Pest : A Large-Scale Domain-Specific Benchmark Dataset for Practical Agricul-
tural Pest Detection in the Wild. Sensors, 21(5) :1601, February 2021.
[WRH17] Sheng Wang, Ashwin Raju, and Junzhou Huang. Deep learning based multi-
label classification for surgical tool presence detection in laparoscopic videos. In
2017 IEEE 14th International Symposium on Biomedical Imaging (ISBI 2017),
pages 620–623, Melbourne, Australia, April 2017. IEEE.
[WWX+ 20] Fangyuan Wang, Rujing Wang, Chengjun Xie, Po Yang, and Liu Liu. Fusing
multi-scale context-aware information representation for automatic in-field pest
detection and recognition. Computers and Electronics in Agriculture, 169, Fe-
bruary 2020.
[WYZZ09] Changhu Wang, Shuicheng Yan, Lei Zhang, and Hong-Jiang Zhang. Multi-label
sparse coding for automatic image annotation. In 2009 IEEE Conference on
Computer Vision and Pattern Recognition, pages 1643–1650, 2009.
[WZL+ 19] Xiaoping Wu, Chi Zhan, Yukun Lai, Ming-Ming Cheng, and Jufeng Yang.
IP102 : A Large-Scale Benchmark Dataset for Insect Pest Recognition. In IEEE
CVPR, pages 8787–8796, 2019.
[XFLH17] Z. Xia, X. Feng, J. Lin, and A. Hadid. Deep convolutional hashing using pair-
wise multi-label supervision for large-scale visual search. In Signal Processing :
Image Communication, Volume, volume 59, pages 109–116. 2017.
[Xin20] Xinhuanews. http ://[Link]/2020-01/20/c [Link], Ja-
nuary 2020.
[XRvD20] Ning Xie, Gabrielle Ras, Marcel van Gerven, and Derek Doran. Explainable
Deep Learning : A Field Guide for the Uninitiated. arXiv :2004.14545 [cs, stat],
April 2020.
[YGYN14] Kyosuke Yamamoto, Wei Guo, Yosuke Yoshioka, and Seishi Ninomiya. On Plant
Detection of Intact Tomato Fruits Using Image Analysis and Machine Learning
Methods. Sensors, 14(7) :12191–12206, July 2014.
[YL18] Xi Yin and Xiaoming Liu. Multi-Task Convolutional Neural Network for
Pose-Invariant Face Recognition. IEEE Transactions on Image Processing,
27(2) :964–975, February 2018.
131
Bibliographie
[YLCL18] Yao-Yuan Yang, Yi-An Lin, Hong-Min Chu, and Hsuan-Tien Lin. Deep
Learning with a Rethinking Structure for Multi-label Classification.
arXiv :1802.01697 [cs, stat], February 2018.
[YSLC12] Xiaolu Yang, Xuanjing Shen, Jianwu Long, and Haipeng Chen. An Improved
Median-based Otsu Image Thresholding Algorithm. AASRI Procedia, 3 :468–
473, January 2012.
[YXA18] Xiaohui Yuan, Lijun Xie, and Mohamed Abouelenien. A regularized ensemble
framework of deep learning for cancer detection from multi-class, imbalanced
training data. Pattern Recognition, 77 :160–172, May 2018.
[ZF13] Matthew D. Zeiler and Rob Fergus. Visualizing and Understanding Convolutio-
nal Networks. arXiv :1311.2901 [cs], November 2013.
[ZF14] Matthew D. Zeiler and Rob Fergus. Visualizing and Understanding Convolutio-
nal Networks. In David Fleet, Tomas Pajdla, Bernt Schiele, and Tinne Tuytelaars,
editors, Computer Vision – ECCV 2014, volume 8689, pages 818–833. Springer
International Publishing, Cham, 2014.
[ZHZ19] Liheng Zhong, Lina Hu, and Hang Zhou. Deep learning based multi-temporal
crop classification. Remote Sensing of Environment, 221 :430–443, February
2019.
[Zim08] Cindy Zimmerman. The Five “R’s” of Precision — Precision.
https ://[Link]/2008/11/11/the-five-rs-of-precision/, 2008.
[ZLB97] P. Zwaenepoel and J.M. Le Bars. L’agriculture de précision. Ingénieries eau-
agriculture-territoires, (12) :p. 67 – p. 79, 1997.
[ZLL+ 18] Nanyang Zhu, Xu Liu, Ziqian Liu, Kai Hu, Yingkuan Wang, Jinglu Tan, Min
Huang, Qibing Zhu, Xunsheng Ji, Yongnian Jiang, Ya Guo, 1. Key Laboratory
of Advanced Process Control for Light Industry, Ministry of Education, Jiangnan
University, Wuxi 214122, China, 2. School of Internet of Things, Jiangnan Uni-
versity, Wuxi 214122, China, 3. Chinese Academy of Agricultural Engineering,
Beijing 100125, China, 4. Department of Bioengineering, University of Mis-
souri, Columbia, MO 65211, USA, and 5. Jiangsu Zhongnong IoT Technology
Co., LTD, Yixing 214200, China. Deep learning for smart agriculture : Concepts,
tools, applications, and opportunities. International Journal of Agricultural and
Biological Engineering, 11(4) :21–28, 2018.
[ZLLL17] Jianqing Zhu, Shengcai Liao, Zhen Lei, and Stan Z. Li. Multi-label convolutio-
nal neural network based pedestrian attribute classification. Image and Vision
Computing, 58 :224–229, February 2017.
[ZSJS18] Jiang Zhu, Yonghui Song, Dingde Jiang, and Houbing Song. A New Deep-Q-
Learning-Based Transmission Scheduling Mechanism for the Cognitive Internet
of Things. IEEE Internet of Things Journal, 5(4) :2375–2385, August 2018.
[ZYC+ 18] Ni Zhuang, Yan Yan, Si Chen, Hanzi Wang, and Chunhua Shen. Multi-label
Learning Based Deep Transfer Neural Network for Facial Attribute Classifica-
tion. Pattern Recognition, 80 :225–240, August 2018.
132