0% ont trouvé ce document utile (0 vote)
4 vues7 pages

Snihji Week3

Le document présente un jeu de données dérivé du dataset MFOOD-70, dédié à la reconnaissance de la gastronomie marocaine, contenant 1 500 images de 10 plats traditionnels. Une ingénierie spécifique a été appliquée pour optimiser l'extraction des caractéristiques, et le dataset a été soigneusement équilibré pour éviter les biais dans l'apprentissage machine. L'exploration initiale a révélé des défis liés à la qualité des images, nécessitant un prétraitement pour améliorer la précision des modèles.

Transféré par

younessnihji18
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues7 pages

Snihji Week3

Le document présente un jeu de données dérivé du dataset MFOOD-70, dédié à la reconnaissance de la gastronomie marocaine, contenant 1 500 images de 10 plats traditionnels. Une ingénierie spécifique a été appliquée pour optimiser l'extraction des caractéristiques, et le dataset a été soigneusement équilibré pour éviter les biais dans l'apprentissage machine. L'exploration initiale a révélé des défis liés à la qualité des images, nécessitant un prétraitement pour améliorer la précision des modèles.

Transféré par

younessnihji18
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

1.

Dataset Description Report

1.1. Présentation générale du jeu de données Le jeu de données sélectionné pour ce projet est
dérivé du dataset académique MFOOD-70, publié en (2024). Il s'agit de la première base de
données d'images spécifiquement conçue pour la reconnaissance de la gastronomie marocaine.
Dans sa version originale, MFOOD-70 contient 70 catégories de plats pour un total de 8 300
images. Cependant, pour répondre aux contraintes algorithmiques de ce mini-projet (qui impose
l'utilisation de modèles de Machine Learning classiques et non de réseaux de neurones
profonds), une ingénierie spécifique a été appliquée au périmètre des données.

1.2. Ingénierie et réduction du périmètre (Scope Adjustment)

Afin d'optimiser la phase d'extraction manuelle des caractéristiques (Feature Engineering)


inhérente au ML classique, le dataset a été filtré selon les critères suivants :

 Sélection des classes : Le périmètre a été réduit aux 10 classes de plats traditionnels
marocains les plus distinctives visuellement (Couscous, Harira, Chebakia, Tagine aux
légumes, Briouats, Pastilla, Zaalouk, Msemen, Maakouda, et Dattes).
 Volume de données : Le sous-ensemble final contient 1 500 observations (soit
exactement 150 images par classe).
 Justification du volume : Bien que l'objectif initial visait 500 images par classe,
l'analyse exploratoire a révélé que les images de MFOOD-70 ont été pré-traitées avec
l'algorithme de segmentation GrabCut, éliminant ainsi le bruit de fond. En Machine
Learning classique, 150 images parfaitement détourées fournissent un signal
d'apprentissage de bien meilleure qualité qu'un grand volume d'images non segmentées,
justifiant ainsi ce choix technique tout en respectant l'exigence globale du projet (> 500
observations au total).

1.3. Compréhension des données (Data Understanding) Dans le cadre d'une approche par
Machine Learning classique, la structure des données se définit comme suit :

 Variable cible (Target) :


o La variable à prédire est la catégorie du plat.
o Type de donnée : Catégorielle nominale, encodée numériquement sous forme de
labels discrets (de 0 à 9 représentant les 10 classes sélectionnées).
 Variables d'entrée (Inputs / Features) :
o État brut : Les données brutes sont des images numériques 2D en espace
colorimétrique RGB, uniformisées à une résolution de 150x150 pixels.
o Transformation prévue : Les images brutes ne pouvant être injectées directement
dans des modèles classiques (SVM, Random Forest), elles seront transformées
lors de l'étape de prétraitement en vecteurs de caractéristiques numériques
continus.
o Attributs (Features) identifiés : Le modèle s'appuiera sur des attributs extraits
mathématiquement couvrant la Couleur (Histogrammes RGB/HSV), la Texture
(Local Binary Patterns - LBP, matrices GLCM), et la Forme (Histogram of
Oriented Gradients - HOG).
2. Documentation des Sources et Processus de Collecte

2.1. Identification de la source optimale (Data Sources)

La recherche initiale d'images s'est orientée vers des méthodes d'extraction par Web Scraping
direct. Cependant, l'identification du dataset académique MFOOD-70 sur la plateforme de
science des données Kaggle a permis de redéfinir la stratégie d'acquisition. Kaggle a été
privilégié car cette base fournit un environnement de données structurées et validées par la
recherche scientifique (Mansouri et al., 2024). L'utilisation de cette source garantit le respect
strict du critère de qualité ("Reliable and accurate data") exigé par le cahier des charges du
projet.

2.2. Téléchargement et gestion de l'infrastructure matérielle (Collect & Download) Le jeu


de données a été acquis via le téléchargement direct de l'archive mise à disposition sur Kaggle.
La stratégie de collecte a été pensée pour optimiser les contraintes matérielles de la station de
travail. Afin de prévenir la saturation du stockage principal et d'éviter les dépassements de
capacité de la mémoire vive lors des futures itérations de calcul, l'intégralité des données a été
téléchargée, décompressée et stockée directement sur un disque dur externe de grande capacité.
Cette architecture de stockage externe garantira une lecture par lots (batch processing) efficace
et fluide lors de la phase très exigeante d'extraction des caractéristiques (Feature Engineering).

2.3. Intégration et structuration (Combine & Integrate)

Suite au téléchargement, l'archive originale présentait une arborescence de 70 répertoires.


L'intégration des données s'est effectuée par une extraction sélective : seuls les 10 dossiers
correspondant aux classes cibles de plats marocains traditionnels ont été migrés vers
l'environnement de travail du projet. Cette méthode a permis de filtrer le bruit inutile et de
consolider un jeu de données de travail parfaitement organisé. L'arborescence finale est
structurée en 10 sous-dossiers nominatifs, chacun contenant exactement 150 fichiers au format
standardisé, assurant un équilibre de classes parfait (balanced dataset) avant d'entamer la phase
de préparation des données.

3. Compréhension et Structure des Données (Data Understanding)

Dans le contexte d'un projet de Machine Learning classique appliqué à la vision par ordinateur,
la compréhension des données nécessite de distinguer la structure brute des fichiers de la
structure tabulaire finale qui sera injectée dans le modèle prédictif.

3.1. Structure organisationnelle brute

À l'état brut, le jeu de données est structuré de manière hiérarchique. Le répertoire racine
contient 10 sous-répertoires, chacun représentant une classe de plat marocain.
 Format des fichiers : Images numériques 2D non compressées avec perte (fichiers .jpg
ou .png).
 Dimensions : Matrices tridimensionnelles de 150 x 150 x 3 (Largeur x Hauteur x Canaux
de couleurs RGB).
 Volume par classe : Exactement 150 fichiers par dossier, garantissant un jeu de données
nativement équilibré.

3.2. Identification de la variable cible (Target Variable) La tâche de notre modèle est de
classifier les images. La variable cible est donc le label représentant la catégorie du plat.

 Nature de la variable : Catégorielle nominale (ex: "Couscous", "Harira", "Zaalouk").


 Typage et Encodage : Pour être traitée par les algorithmes de Machine Learning
(comme scikit-learn), cette variable de type texte (String) sera encodée numériquement
sous forme d'entiers discrets (Integer). Les 10 classes seront mappées de 0 à 9 (ex: 0 pour
Couscous, 1 pour Harira, etc.).

3.3. Identification des variables d'entrée (Features / Inputs)

Contrairement à l'apprentissage profond (Deep Learning) qui ingère les pixels bruts, notre
approche par Machine Learning classique exige une extraction de caractéristiques (Feature
Engineering). Les variables d'entrée ne seront pas les pixels individuels, mais des descripteurs
mathématiques globaux et locaux extraits de chaque image. Ces variables se divisent en trois
familles :

 A. Variables de Couleur (Color Features) :


o Description : Histogrammes mesurant la distribution des pixels dans les espaces
colorimétriques RGB (Red, Green, Blue) et HSV (Hue, Saturation, Value), ainsi
que les moments de couleur (moyenne, variance).
o Type de donnée : Vecteurs de valeurs numériques continues (Float).
 B. Variables de Texture (Texture Features) :
o Description : Descripteurs calculés via les motifs binaires locaux (LBP - Local
Binary Patterns) et la matrice de cooccurrence (GLCM) pour quantifier la
rugosité ou l'homogénéité du plat (ex: la granularité de la semoule).
o Type de donnée : Vecteurs de valeurs numériques continues (Float).
 C. Variables de Forme et de Contour (Shape & Edge Features) :
o Description : Utilisation des descripteurs HOG (Histogram of Oriented
Gradients) pour capturer la distribution des contours, et des moments de Hu pour
quantifier la géométrie globale du plat de manière invariante à la rotation.
o Type de donnée : Vecteurs de valeurs numériques continues (Float).

3.4. Typage et structure finale du jeu de données (Data Types Summary) Avant la phase
d'entraînement (Semaine 5), l'ensemble de ces caractéristiques sera concaténé
mathématiquement. La structure finale du jeu de données prendra la forme d'une matrice
bidimensionnelle (type DataFrame pandas) où :

 Les lignes (Observations) : Représentent les 1 500 images.


 Les colonnes (Variables) : Contiendront des centaines de variables numériques
continues (Float) issues de l'extraction HOG/LBP/Couleurs, accompagnées d'une colonne
finale contenant la variable cible encodée en entier discret (Integer).

4. Combinaison, Intégration et Équilibrage des Données

Cette étape du processus garantit que les données brutes téléchargées sont transformées en un
environnement de travail sain, structuré et statistiquement fiable pour l'entraînement des modèles
de Machine Learning classiques.

4.1. Combinaison des sources (Combine)

Bien que le jeu de données provienne d'un téléchargement unique (le dataset MFOOD-70), sa
nature intrinsèque est composite. Selon la documentation scientifique des auteurs originaux, ce
dataset est lui-même une combinaison complexe issue de techniques de Web Scraping (Google
Images, Bing) et de sous-ensembles extraits de bases de données internationales préexistantes
telles que UECFOOD256, Food-101 et Fruits-360. L'utilisation de cette base combinée nous
garantit une excellente diversité intra-classe (différents angles, éclairages, types de contenants)
qui est cruciale pour la robustesse de nos futurs modèles.

4.2. Intégration à l'environnement de travail (Integrate) L'intégration a consisté à adapter la


base de données brute à l'architecture logicielle de notre projet local.

 L'archive originale (contenant 70 classes et 8 300 images) a été auditée.


 Un script d'intégration a été conçu pour isoler et extraire uniquement les 10 classes
traditionnelles sélectionnées pour notre périmètre.
 Ces données ont été intégrées dans une arborescence locale stricte
(/dataset/nom_du_plat/), permettant aux futurs scripts Python (lors de la Semaine 4)
de parcourir les répertoires dynamiquement pour procéder à l'extraction des descripteurs
mathématiques (Features) sans erreur de chemin ou de lecture.

4.3. Stratégie d'équilibrage strict (Balance) L'équilibrage du dataset est l'intervention la plus
critique de cette phase. En Machine Learning classique, si un algorithme (comme un SVM ou un
arbre de décision) est entraîné sur un jeu de données déséquilibré (par exemple : 400 images de
Couscous mais seulement 50 de Zaalouk), il développera un biais majeur favorisant la classe
majoritaire.

 Audit initial : L'exploration a confirmé que nous disposions de volumes suffisants pour
nos 10 classes cibles.
 Mise à l'échelle (Undersampling) : Pour garantir une impartialité totale du modèle, une
règle d'équilibrage strict a été appliquée. Nous avons fixé un plafond exact de 150 images
pour chaque classe.
 Résultat : Le dataset final intégré est parfaitement équilibré. Il se compose de 1 500
images réparties de manière parfaitement symétrique (10 % des données pour chaque
classe). Aucune technique de génération artificielle de données (sur-échantillonnage /
SMOTE) ne sera donc nécessaire, ce qui garantit que l'algorithme s'entraînera
exclusivement sur des données réelles et authentiques de la gastronomie marocaine

5. Résumé de l'Exploration Initiale des Données (Initial Data Exploration


Summary)

L'exploration initiale a consisté en une inspection visuelle et technique d'un échantillon


représentatif des 1 500 images sélectionnées. Cette étape a permis de confronter la
documentation académique à la réalité des données brutes, afin d'anticiper les défis de la phase
de prétraitement (Semaine 4).

5.1. Bilan de qualité et contradiction avec la littérature

L'observation la plus marquante de cette exploration concerne une divergence majeure avec la
documentation officielle du dataset.

 Bien que les auteurs (Mansouri et al.) mentionnent l'utilisation de l'algorithme GrabCut
pour isoler les aliments, l'inspection visuelle des données publiques (Kaggle) révèle que
les images fournies sont à l'état brut. Elles contiennent des arrière-plans très chargés
(tables, théières en argent, morceaux de pain, mains).
 Impact pour le ML Classique : C'est un défi critique. Si l'extraction mathématique
(Histogrammes, HOG) est appliquée directement sur ces images brutes, le modèle
apprendra à reconnaître le décor (ex: la théière) plutôt que la signature visuelle du plat.
 Stratégie d'ingénierie (Semaine 4) : Le prétraitement devra obligatoirement inclure une
étape de nettoyage (Data Cleaning) en amont de l'extraction des features. Une technique
de rognage central (Center Crop) ou une segmentation automatisée devra être développée
pour atténuer ce bruit de fond.

5.2. Analyse de la diversité visuelle (Variance intra-classe) L'échantillonnage a montré une


excellente robustesse face aux conditions de capture :

 Angles de vue multiples : Les plats (comme la Pastilla ou la Chebakia) ont été
photographiés sous différents angles (zénithal, 45 degrés). Les descripteurs de forme
invariants (comme les Hu Moments) seront indispensables pour gérer cette rotation.
 Variations de recettes : Des classes comme le Tagine présentent une forte variance
colorimétrique (poulet jaune vs bœuf en sauce brune). L'algorithme ne pourra donc pas se
fier uniquement à la couleur globale ; la détection des contours (HOG) de la forme
géométrique du plat en terre cuite sera déterminante.

5.3. Identification des risques de confusion (Similarité inter-classes) L'exploration a permis


d'identifier un risque majeur pour le futur classifieur classique :

 Le cas des salades cuites : Le Zaalouk (aubergines) et la Taktouka (poivrons/tomates)


partagent une présentation très similaire (écrasées dans une petite assiette circulaire) et
des palettes de couleurs chaudes proches.
 Stratégie d'ingénierie envisagée : Pour différencier ces classes, les descripteurs de
texture (Local Binary Patterns - LBP et matrices GLCM) devront être optimisés pour
capter la différence de granularité microscopique entre la fibre de l'aubergine et les
morceaux lisses du poivron.

Vous aimerez peut-être aussi