Automatisation des rapports de production poisson
Automatisation des rapports de production poisson
Thème :
Fait le : 15/09/2022
Elaboré par :
BARAKA Hanae
Encadré par :
M. LAAGUID Hicham
M. DANANE Jaouad
entourée."
À mon Père;
efforts.
Hanae Baraka
1
Remerciements
Merci infiniment.
2
Résumé
Ce rapport décrit l’ensemble des étapes suivies lors de la réalisation d'un tableau
de bord analysant la production de poissons.
Le travail dans ce projet s'est déroulé comme suit : nous avons commencé par
analyser le besoin, nous avons passé à la conception de notre système décisionnel et nous
avons fini par la réalisation de notre tableau de bord.
Les technologies utilisées au cours de notre travail sont SSIS à travers Visual
Studio en tant qu’outils d'ETL et Power BI pour la visualisation des données ainsi que
SQL Server en tant que système de gestion de base de données.
Dans l’espérance d’être à la hauteur de vos attentes, nous vous souhaitons une
excellente lecture.
3
Abstract
This report is the result of our work completed as part of the Application Internship
Project within the National Fisheries Office. The aim of this project is to conceive and
realize a business intelligence solution.
This report describes all the steps taken in order to create a dashboard analyzing fish
production.
The work in this project went as follows: we started by analyzing the specification,
we moved on to the conception of our decision support system and we ended with the
realization of our dashboard.
The technologies used during our work are SSIS across Visual Studio as an ETL tool,
Power BI for the data visualization and SQL Server as a database management system.
4
ملخص
هذا التقرير هو نتيجة لعملنا المنجز في إطار مشروع التدريب للسنة الرابعة من سلك مهندسي دولة الذي
تم إنجازه في المكتب الوطني للصيد .الهدف من هذا المشروع هو تقديم حل لتحليل البيانات باستخدام ذكاء األعمال.
يصف هذا التقرير جميع الخطوات المتخذة أثناء إنشاء لوحة معلومات البيانات تحلل إنتاج األسماك.
سار العمل في هذا المشروع على النحو التالي :بدأنا بتحليل دفتر المواصفات ،ومن تم تصميم نظام
القرارات وانتهى بنا األمر إلى إنتاج لوحة معلومات البيانات.
التقنيات المستخدمة في هذا المشروع هي SSISكأداة استخراج وتحويل وتحميل البياناتPower BI ،
إلنتاج لوحة معلومات البيانات باإلضافة إلى SQL Serverكنظام إلدارة قواعد البيانات.
على أمل أن يرقى هذا العمل مستوى توقعاتكم ،نتمنى لكم قراءة جيدة.
5
Abréviations et Acronymes
ETL : Extract Load Transform
BI : Business Intelligence
DW : Data Warehouse
DM : Data Mart
6
Liste des figures
Figure 1 : Organigramme de l’Office National des Pêches 14
7
Liste des tableaux
Tableau 1 : Planification de projet 15
8
Liste des captures
Capture 1 : Schéma d'entrepôt de données 30
9
Sommaire
Chapitre 1 : Contexte général du projet : 12
1.1 Présentation de l’organisme d’accueil : 12
1.1.1 Missions : 12
1.1.2 Organisation : 13
1.2 Présentation du sujet : 14
1.3 Conduite de projet 15
1.3.1 Démarche : 15
1.3.2 Planning : 15
1.4 Conclusion : 16
10
4.1.1 Axes d'analyse : 28
4.1.2 Mesures : 29
4.1.3 Structure du datawarehouse : 30
4.2 Cube OLAP : 30
4.3 Conception ETL : 31
4.4 Conclusion : 32
Chapitre 5 : Réalisations : 33
5.1 Réalisation de la phase ETL : 33
5.1.1 Flux de contrôle : 33
5.1.2 Flux de données : Alimentation des dimensions : 34
5.1.3 Flux de données :Alimentation de la table des faits : 35
5.2 Restitution du tableau de bord : 36
5.2.1 Page 1 : Analyse de production : 36
5.2.2 Page 2 : Production halieutique et production aquaculture: 37
5.2.3 Page 3 : Capture de poissons en UK et Morue en Canada : 37
5.2.4 Page 4 : Analyse du secteur de la pêche au Maroc : 38
5.3 Conclusion : 38
11
Chapitre 1 : Contexte général du projet :
Dans la première section de ce chapitre, nous présenterons l'organisme d'accueil, à savoir l'Office
National des Pêches, ses missions et son organisation. La deuxième section donnera dans un
premier temps une description générale du projet et terminera par son objectif principal. La
dernière section étoffera la démarche et le planning adoptées pour mener à bien ce travail.
L’ONP a pour ambition d’être une entreprise publique de référence et un modèle d’entreprise
citoyenne, au service du développement et de l’accroissement de la compétitivité de la filière
pêche. Son action englobe :
Au cœur de la filière, l’ONP intervient dans tous les aspects de la création de valeur, depuis le
débarquement des produits de la pêche jusqu’à leur commercialisation.
1.1.1 Missions :
12
● Développer et encadrer la pêche côtière et artisanale.
1.1.2 Organisation :
L’ONP compte près de 900 femmes et hommes qui exercent des métiers tournés vers l’activité de
la pêche. L’organisation de l’ONP s’articule autour de 3 Pôles :
13
● Le Pôle Infrastructures et Équipements, qui assure la réalisation des études, le
suivi de la construction des infrastructures ainsi que la maintenance des bâtiments
et des équipements.
L’Office dispose également d’une Direction Stratégie et Marketing ainsi que d’une Direction
Inspection Générale, qui sont directement rattachées à la Direction Générale.
14
Ce projet est dédié aux responsables décisionnels de l'ONP, il s'agira d'assurer la préparation
des données dans la phase d'ETL et cela pour alimenter notre datawarehouse; ainsi qu'une
exploitation de ces données pour instaurer un système décisionnel de Reporting / Tableau de
bord.
En effet, notre contribution dans ce projet touche essentiellement au secteur de la pêche .À cet
effet, l'objectif majeur de notre tâche est de visualiser la production de poissons.
1.3.1 Démarche :
Afin d’atteindre les objectifs de ce projet il est tout d’abord nécessaire de mener une recherche
documentaire dans l’optique d’avoir une idée globale sur le secteur de la pêche avant de
pouvoir en venir au fait. S’ensuivra un apprentissage de certaines méthodologies de conception
d'entrepôt de données, d’extraction, de transformation, et de téléchargement de données.
Puis il sera question de choisir les meilleurs outils et technologies pour ce projet avant de passer
à la partie élaboration du tableau de bord ayant pour but d’offrir une analyse finale de la
production de poissons.
1.3.2 Planning :
La planification du projet est une phase importante d'avant-projet tout au long des phases
constituant la démarche de développement. Grâce aux réunions tenues avec les encadrants, nous
avons pu planifier dans le temps ces tâches.
15
Formation ETL avec SSIS 5 21/08/2022 25/08/2022
1.4 Conclusion :
À travers ce premier chapitre, nous avons pu nous placer dans le contexte général de notre projet
en introduisant le domaine de l’application ainsi que le cadre du travail. Le chapitre suivant sera
dédié à la spécification des besoins.
16
Chapitre 2 : Spécifications des besoins :
Ce chapitre comprend deux parties essentielles. Dans la première section de ce chapitre, nous
intéresserons à l'élaboration de cahier charge, le contexte du projet, son périmètre, ainsi que les
besoins fonctionnels. La deuxième partie sera dédiée aux outils techniques utilisés dans ce projet.
Le détail La description
17
Le détail La description
2.2.1 Données :
La solution exploite plusieurs sources de données en même temps . Ces sources sont des fichiers
texte CSV . La réalisation de ce tableau de bord nécessite un datawarehouse.
Ce tableau de bord constitué des représentations graphiques comporte quatre pages . Chacune
de ces pages a une fonctionnalité.
18
2 Visualisation de la production halieutique et la
production aquaculture.
Outils Description
19
SSIS est l'amélioration de la version 2005
d'un outil souvent plus connu, dans les
versions antérieures à 2005, sous le nom de
Data Transformation Services, soit DTS.
2.4 Conclusion :
Dans ce chapitre, j’ai décrit les principales technologies que j’ai utilisées pour mettre en place
notre solution . Dans ce cadre, j'explique aussi les détails à propos des fonctionnalités de chaque
page de notre tableau de bord . Dans le chapitre suivant, je vais décrire une partie théorique de la
solution informatique décisionnelle.
20
Chapitre 3 : Généralité sur l’informatique décisionnel :
Dans ce chapitre, nous exposerons toutes les parties théoriques de la Business Intelligence que
nous avons appliquées de manière pratique dans notre projet. Nous découvrirons ce qu’un
système décisionnel, un processus ETL et l’approche de conception d'un entrepôt de données.
“Terme générique qui englobe les applications, l’infrastructure, les outils et les meilleures
pratiques permettant l’accès et l’analyse de l’information afin d’améliorer et d’optimiser les
décisions et les performances.”
Source : Gartner
“Un ensemble de solutions informatiques permettant l’analyse des données de l’entreprise, afin
d’en dégager les informations qualitatives nouvelles qui vont fonder des décisions, qu’elles
soient tactiques ou stratégiques.”
L’informatique décisionnelle s’insère dans l’architecture plus large d’un système d'information,
mais n'est pas un concept concurrent du management du système d'information. Au même titre
que le management relève de la sociologie et de l'économie, la gestion par l'informatique est
constitutive de deux domaines radicalement différents (le management et l'informatique). Afin
d'enrichir le concept avec ces deux modes de pensées, il est possible d'envisager un versant
orienté ingénierie de l'informatique portant le nom d'informatique décisionnelle, et un autre
versant servant plus particulièrement les approches de gestion appelé management du système
d'information.
21
3.1.2 Architecture d’un système décisionnel :
➢ Ces données sont livrées aux divers domaines fonctionnels (direction stratégique, finance,
production, comptabilité, ressources humaines, etc.) à travers un système de sécurité ou
de datamart spécialisés à des fins de consultations, d'analyse, des alertes prédéfinies,
d'exploration de données, etc.
22
○ Étude des données existantes
➢ Modélisation et conception
○ Modélisation dimensionnelle
○ Architecture technique
○ Implémentation du DW et des DM
3.2 ETL :
3.2.1 Définition :
23
Les outils ETL permettent de récupérer les données quelles que soient leurs sources et les
systèmes qui les supportent, d’automatiser et d’industrialiser le processus d’alimentation, de
faciliter la maintenance des données et de limiter les développements spécifiques. Ces outils
permettent de construire, de mettre à jour et de maintenir le dictionnaire de métadonnées. Une
métadonnée représente une donnée sur une donnée. Le dictionnaire des métadonnées est le
référentiel du système d’information décisionnel.
Les ETL (extract-transform-load) sont les outils pour manipuler les données, comme pour la
construction et l'alimentation des datawarehouse (entrepôts de données).
Les ETL open source permettent d'effectuer un grand nombre de traitements pour l'extraction,
la transformation et le chargement de données, ceci depuis ou vers un grand nombre de
systèmes :
Etapes Description
24
Chargement ● Fonction de recherche (lookup)
d'informations additionnelles
permettant par exemple la jointure
entre deux SGBD différents.
● Fonctionnalités de récupération et
d’envoi de fichiers.
3.3.1 Définition :
Un entrepôt de données est une base de données regroupant une partie ou l'ensemble des
données fonctionnelles d'une entreprise. Il entre dans le cadre de l'informatique décisionnelle ;
son but est de fournir un ensemble de données servant de référence unique, utilisée pour la
prise de décisions dans l'entreprise par le biais de statistiques et de rapports réalisés via des
outils de reporting. D'un point de vue technique, il sert surtout à 'délester' les bases de données
opérationnelles des requêtes pouvant nuire à leurs performances.
Il existe trois méthodes pour regrouper tous les éléments afin de mettre en œuvre un entrepôt de
données, qui sont les suivantes :
• Top-Down : c'est la méthode la plus complexe et la plus contraignante mais aussi la plus
complète. Cette méthode implique un travail rigoureux: il est important de connaître à l'avance
toutes les dimensions et tous les faits de l'entreprise afin de les réaliser. L’avantage que cette
méthode est qu'elle offre une vision très claire et très conceptuelle des informations de
l'entreprise mais également du travail à fournir.
25
• Bottom-Up : Cette méthode est le contraire de la méthode précédente. Elle a pour but de créer
les étoiles une par une, puis les regrouper par des niveaux intermédiaires afin d’obtenir un
entrepôt de données sous forme pyramidale. La simplicité de cette méthode est un vrai avantage
pour les utilisateurs. Cependant, cette méthode demande un volume de travail d’intégration
important afin d’obtenir un entrepôt de données avec la possibilité de répétitions entre les étoiles.
• Middle-Out : Cette méthode est conseillée pour les professionnels du BI. Elle consiste à
réaliser la conception totale de l'entrepôt de données, ainsi que de créer des divisions plus petites
et plus simples à gérer. Cela correspond à découper la conception par éléments en commun et
réaliser les découpages un par un.
L'entrepôt de données a une structure de données qui peut en général être représentée par un
modèle de données normalisé 3FN pour les données de détail et/ou en étoile ou en flocon pour
les données agrégées et ce dans un SGBD relationnel (notamment lorsqu'il s'agit de données
élémentaires ou unitaires non agrégées). La traduction technique de ce modèle se fait souvent au
sein d'un cube OLAP.
L'entrepôt de données est conçu pour contenir les données en adéquation avec les besoins de
l’organisation, et répondre de manière centralisée à tous les utilisateurs. Il n’existe donc pas de
règle unique en matière de stockage ou de modélisation.
● Sous forme agrégée selon les axes ou dimensions d'analyse prévus (mais ces
agrégations sont plutôt réalisées dans les datamarts que dans les entrepôts de données
proprement dits). Les données agrégées présentent d'autres avantages (facilité
d'analyse, rapidité d'accès, moindre volume). Par contre, il est impossible de retrouver
le détail et la profondeur des indicateurs une fois ceux-ci agrégés : on prend le risque
de figer les données selon une certaine vue avec les axes d'agrégation retenus, et de ne
plus pouvoir revenir sur ces critères si l'on n'a pas conservé le détail.
26
Le modèle OLAP est une représentation logique des données, qui travaille sur des agrégats
suivant plusieurs dimensions. Il s´agit d´une modélisation sur n dimensions, sous forme d´un
[Link] données sont structurées suivant plusieurs axes d'analyse, comme le temps, la
localisation. Une cellule est l'intersection des différentes dimensions. Le calcul de chaque
cellule est réalisé au chargement du modèle, afin d´assurer des temps de réponse stables.
3.4 Conclusion :
Dans ce chapitre, j’ai exposé théoriquement tous les concepts que j’ai utilisés pour réaliser ce
projet, ce qui est une étape essentielle avant d’entrer dans les processus pratiques qui peuvent
nous servir à atteindre les exigences fonctionnelles mentionnées dans le chapitre des
spécifications. Le prochain chapitre contiendra donc la conception de notre datawarehouse ainsi
que la conception ETL.
27
Chapitre 4 : conception de la solution :
Dans ce chapitre, on va entamer la partie la plus critique de notre projet, c’est la conception. En
premier lieu nous commencerons par définir les axes d’analyse, les mesures et le schéma de
notre datawarehouse. Dans la deuxième partie, nous détaillerons la démarche ETL .
En fonction des besoins d'analyse et après une étude des sources de données, alors on a conclu
que les données pertinentes requises pour les analyses cibles vont être extraites pour constituer
les dimensions suivantes :
4.1.2 Mesures :
Les mesures ou les indicateurs recensés dans l'ensemble des analyses à considérer, se présentent
comme suivent :
28
Mesure Description
Nous avons choisi pour la réalisation du datawarehouse le modèle en étoile, constitué d'une
table de fait et 3 tables de dimensions. La table de faits est constituée des clés primaires de
chaque table de dimension, plus les entités mesurables.
29
Capture 1 : Schéma d'entrepôt de données
30
Dans les cubes OLAP, les données (ou mesures) sont classées par dimensions. Les cubes OLAP
sont souvent pré-synthétisés entre les dimensions, ceci afin d'accélérer considérablement
l'interrogation par rapport aux bases de données relationnelles.
➢ Étape 1 : Extraction
L'objectif d'ETL est de produire des données propres, faciles d'accès et qui peuvent être
exploitées efficacement par l'analytique. Les données brutes peuvent être extraites de différentes
sources, en particulier :
● Logs d'activité
● Événements de sécurité
➢ Étape 2 : Transformation
L'étape de transformation du processus ETL est celle des opérations les plus essentielles.
L'opération la plus importante de l'étape de transformation consiste à appliquer aux données
brutes les règles internes de l'entreprise de manière à répondre aux exigences en matière de
reporting : les données brutes sont nettoyées et converties aux formats de rapport qui
conviennent.
31
La transformation applique les règles définies en interne. Les normes qui garantissent la qualité
des données et leur accessibilité doivent tenir compte des pratiques suivantes :
● Autres tâches – Tâches dont vous avez besoin et que vous définissez et paramétrez
de telle sorte qu'elles s'exécutent en mode automatique.
➢ Étape 3 : Chargement
La dernière étape du processus ETL standard consiste à charger les données extraites et
transformées dans leur nouvel emplacement. En général, les data warehouses supportent deux
modes pour le chargement des données : chargement complet et chargement incrémentiel.
4.4 Conclusion :
32
Chapitre 5 : Réalisations :
Dans ce chapitre, nous montrerons ce que nous avons réalisé dans ce projet. Le chapitre
commencera par étoffer les différentes étapes de la phase “Extract, Load and Transform” et
terminera par expliquer la production de poisson avec une visualisation en tableau de bord en 4
pages.
Le Control Flow ou flux de contrôle permet de contrôler, d'ordonner et dissocier les tâches à
réaliser par le package.
33
Le Data Flow ou flux de données : permet de contrôler, d'ordonner et dissocier les flux de
données à traiter. C'est à cette étape que la sélection, la transformation et l'insertion des données
sont réalisées.
34
➢ Alimentation de la dimension pays :
35
Capture 8 : Entrepôt de données
36
Capture 10 : Page numéro 2 de tableau de bord
37
Capture 12 : Page numéro 4 de tableau de bord
5.3 Conclusion :
Dans ce chapitre, nous avons présenté discrètement les résultats de ce projet. Et à travers la
réalisation du projet, nous avons traversé l’étape de conception, ce qui nous permet de maintenir
toutes les parties théoriques.
38
Chapitre 6 : Conclusion générale :
Pour conclure , notre stage au cours de ce mois, m’a permis de voir l’aspect arrière-plan de
l'informatique décisionnel et comment la rendre utile pour l’environnement de l'organisme et
aussi, j'ai appris que le rôle d'un ingénieur BI est de transformer la donnée à une sagesse, pour la
rendre applicable et pratique.
Finalement, c'était une occasion de découvrir et maîtriser les méthodes et les outils de Business
Intelligence.
39
Références
Bibliographie
Data Visualisation, De l'extraction des données à leur représentation graphique, de Nathan Yau
Webographie
40