Rapport sur la Conception, Implémentation et
Alimentation de l'Entrepôt de Données (Lot 2)
22U2079 LEUDJEU WOUAPPI Beautrel Horssel
22W2202 FORCHE Macbrain Abongwa
19M2066 KENMOE SIMO Boris
19M2269 MEDJO M'EVINA Josue Esnauld Rayane
Université de Yaoundé 1 - Département d'Informatique
February 8, 2025
1 Introduction
Ce rapport présente en détail le travail réalisé dans le cadre du Lot 2 du projet INF351,
portant sur la conception, l'implémentation et l'alimentation de l'entrepôt de données
décisionnel. L'objectif principal est de construire un système permettant d'exploiter les
données de publications scientiques issues de la base de données opérationnelle pour
fournir des indicateurs pertinents aux organisateurs de la conférence RecSys.
2 Analyse des Données et Identication des Composants de l'Entrepôt
2.1 Faits et Mesures
Les faits représentent les événements quantiables de notre entrepôt. Dans notre cas, le
fait principal est la publication d'un article.
2.1.1 Dictionnaire des mesures
Nombre d'articles publiés
Nombre d'auteurs par article
Nombre de publications par institution, ville, pays
Taux de publication par année
Nombre de publications par continent
2.2 Dimensions
Les dimensions permettent d'organiser les mesures sous diérents axes d'analyse.
1
2.2.1 Dictionnaire des dimensions
dim_auteur (ID, Nom)
dim_article (ID, Titre)
dim_aliation (ID, Nom, ID_ville)
dim_ville (ID, Nom, ID_pays)
dim_pays (ID, Nom)
dim_temps (ID, Annee)
2.3 Modèle en Flocon
Le modèle de l'entrepôt suit une approche en ocon, an de normaliser les données et
éviter les redondances.
3 Conception de l'Entrepôt de Données
3.1 Choix du Modèle Approprié
Nous avons opté pour un modèle en ocon en raison de la nature relationnelle des données
et pour améliorer la cohérence et la performance des requêtes analytiques.
3.2 Hiérarchies et Cardinalités
Les hiérarchies permettent une analyse multiniveau des données. Voici la principale
hiérarchie identiée :
Pays → Ville → Aliation
4 Implémentation de l'Entrepôt
4.1 Choix du SGBD
Nous avons choisi PostgreSQL pour implémenter l'entrepôt en raison de ses capacités
optimisées pour le traitement analytique (support du stockage en colonnes et indexation
avancée).
4.2 Schéma Relationnel
L'entrepôt a été implémenté sous PostgreSQL avec les tables suivantes :
Table Faits : publications
Tables Dimensions : dim_auteur, dim_article, dim_affiliation, dim_ville,
dim_pays, dim_temps
2
5 Alimentation de l'Entrepôt de Données
5.1 Processus ETL
L'ETL a été conçu avec Talend Open Studio for Data Integration (OS-DI). Le
processus suit les étapes suivantes :
1. Extraction : Récupération des données depuis la base de données opérationnelle.
2. Transformation :
Normalisation des données (noms, formats de date, ID uniés)
Jointure et agrégation des données
Gestion des valeurs manquantes
3. Chargement : Insertion des données transformées dans l'entrepôt
5.2 Dénition des Jobs Talend
Nous avons utilisé plusieurs composants dans Talend :
tDBInput : Chargement des chiers sources
tMap : Transformation et enrichissement des données
tDBOutput / tPostgresqlOutput : Insertion dans le Data Warehouse
6 Conclusion
Le Lot 2 a permis de structurer et de normaliser les données an de les rendre exploitables
pour la prise de décision. L'approche ROLAP choisie garantit une analyse ecace et
une grande exibilité dans l'exploration des données. La prochaine étape consistera à
construire les tableaux de bord et le reporting basés sur ces données consolidées.