0% ont trouvé ce document utile (0 vote)
9 vues3 pages

Conception et Implémentation d'un Entrepôt de Données

Ce rapport détaille la conception, l'implémentation et l'alimentation d'un entrepôt de données pour exploiter les publications scientifiques dans le cadre du projet INF351. Il présente l'analyse des données, les choix de modélisation, l'utilisation de PostgreSQL pour l'implémentation, et le processus ETL réalisé avec Talend. L'objectif est de fournir des indicateurs pertinents pour les organisateurs de la conférence RecSys, avec une approche ROLAP pour une analyse efficace des données.

Transféré par

babyshark30072001
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
9 vues3 pages

Conception et Implémentation d'un Entrepôt de Données

Ce rapport détaille la conception, l'implémentation et l'alimentation d'un entrepôt de données pour exploiter les publications scientifiques dans le cadre du projet INF351. Il présente l'analyse des données, les choix de modélisation, l'utilisation de PostgreSQL pour l'implémentation, et le processus ETL réalisé avec Talend. L'objectif est de fournir des indicateurs pertinents pour les organisateurs de la conférence RecSys, avec une approche ROLAP pour une analyse efficace des données.

Transféré par

babyshark30072001
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Rapport sur la Conception, Implémentation et

Alimentation de l'Entrepôt de Données (Lot 2)

22U2079 LEUDJEU WOUAPPI Beautrel Horssel

22W2202 FORCHE Macbrain Abongwa

19M2066 KENMOE SIMO Boris

19M2269 MEDJO M'EVINA Josue Esnauld Rayane

Université de Yaoundé 1 - Département d'Informatique

February 8, 2025

1 Introduction
Ce rapport présente en détail le travail réalisé dans le cadre du Lot 2 du projet INF351,
portant sur la conception, l'implémentation et l'alimentation de l'entrepôt de données
décisionnel. L'objectif principal est de construire un système permettant d'exploiter les
données de publications scientiques issues de la base de données opérationnelle pour
fournir des indicateurs pertinents aux organisateurs de la conférence RecSys.

2 Analyse des Données et Identication des Composants de l'Entrepôt


2.1 Faits et Mesures
Les faits représentent les événements quantiables de notre entrepôt. Dans notre cas, le
fait principal est la publication d'un article.

2.1.1 Dictionnaire des mesures

ˆ Nombre d'articles publiés

ˆ Nombre d'auteurs par article

ˆ Nombre de publications par institution, ville, pays

ˆ Taux de publication par année

ˆ Nombre de publications par continent

2.2 Dimensions
Les dimensions permettent d'organiser les mesures sous diérents axes d'analyse.

1
2.2.1 Dictionnaire des dimensions

ˆ dim_auteur (ID, Nom)


ˆ dim_article (ID, Titre)
ˆ dim_aliation (ID, Nom, ID_ville)
ˆ dim_ville (ID, Nom, ID_pays)
ˆ dim_pays (ID, Nom)
ˆ dim_temps (ID, Annee)

2.3 Modèle en Flocon


Le modèle de l'entrepôt suit une approche en ocon, an de normaliser les données et
éviter les redondances.

3 Conception de l'Entrepôt de Données


3.1 Choix du Modèle Approprié
Nous avons opté pour un modèle en ocon en raison de la nature relationnelle des données
et pour améliorer la cohérence et la performance des requêtes analytiques.

3.2 Hiérarchies et Cardinalités


Les hiérarchies permettent une analyse multiniveau des données. Voici la principale
hiérarchie identiée :

ˆ Pays → Ville → Aliation

4 Implémentation de l'Entrepôt
4.1 Choix du SGBD
Nous avons choisi PostgreSQL pour implémenter l'entrepôt en raison de ses capacités
optimisées pour le traitement analytique (support du stockage en colonnes et indexation
avancée).

4.2 Schéma Relationnel


L'entrepôt a été implémenté sous PostgreSQL avec les tables suivantes :
ˆ Table Faits : publications
ˆ Tables Dimensions : dim_auteur, dim_article, dim_affiliation, dim_ville,
dim_pays, dim_temps

2
5 Alimentation de l'Entrepôt de Données
5.1 Processus ETL
L'ETL a été conçu avec Talend Open Studio for Data Integration (OS-DI). Le
processus suit les étapes suivantes :
1. Extraction : Récupération des données depuis la base de données opérationnelle.
2. Transformation :
ˆ Normalisation des données (noms, formats de date, ID uniés)
ˆ Jointure et agrégation des données
ˆ Gestion des valeurs manquantes

3. Chargement : Insertion des données transformées dans l'entrepôt

5.2 Dénition des Jobs Talend


Nous avons utilisé plusieurs composants dans Talend :
ˆ tDBInput : Chargement des chiers sources

ˆ tMap : Transformation et enrichissement des données

ˆ tDBOutput / tPostgresqlOutput : Insertion dans le Data Warehouse

6 Conclusion
Le Lot 2 a permis de structurer et de normaliser les données an de les rendre exploitables
pour la prise de décision. L'approche ROLAP choisie garantit une analyse ecace et
une grande exibilité dans l'exploration des données. La prochaine étape consistera à
construire les tableaux de bord et le reporting basés sur ces données consolidées.

Vous aimerez peut-être aussi