0% ont trouvé ce document utile (0 vote)
3 vues78 pages

Exemple

Ce document présente un projet visant à améliorer les modèles de langage à grande échelle pour le Fulfulde, une langue africaine peu représentée dans les technologies numériques. Il aborde l'état de l'art des modèles de langage, les défis rencontrés dans leur application aux langues à faible ressource, et propose une méthodologie de fine-tuning adaptée. Les résultats expérimentaux et les perspectives d'amélioration sont également discutés, soulignant l'importance de la préservation des langues locales dans le contexte numérique.

Transféré par

islemhadjslema4
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues78 pages

Exemple

Ce document présente un projet visant à améliorer les modèles de langage à grande échelle pour le Fulfulde, une langue africaine peu représentée dans les technologies numériques. Il aborde l'état de l'art des modèles de langage, les défis rencontrés dans leur application aux langues à faible ressource, et propose une méthodologie de fine-tuning adaptée. Les résultats expérimentaux et les perspectives d'amélioration sont également discutés, soulignant l'importance de la préservation des langues locales dans le contexte numérique.

Transféré par

islemhadjslema4
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

__________________________________________________________________________

Table des matières


Introduction générale.................................................................................................................. 1
Chapitre 1 Etude du projet ......................................................................................................... 3
1.1 Introduction ...................................................................................................................... 4
1.2 Présentation de l’Entreprise d’Accueil ............................................................................. 4
1.2.1 Historique de l'Entreprise .......................................................................................... 5
1.2.2 Domaines d'Activité .................................................................................................. 6
1.3 Contexte du Projet ............................................................................................................ 8
1.3.1 Origine du Projet ....................................................................................................... 9
1.3.2 Enjeux et Défis ........................................................................................................ 10
1.4 Problématique................................................................................................................. 12
1.4.1 Conséquences .......................................................................................................... 12
1.4.2 Hypothèses .............................................................................................................. 13
1.5 Objectifs du Projet .......................................................................................................... 13
1.5.1 Objectifs Spécifiques............................................................................................... 13
1.5.2 Indicateurs de Réussite ............................................................................................ 15
1.6 Conclusion ...................................................................................................................... 16
Chapitre 2 Etat de l’art ............................................................................................................. 17
2.1 Introduction .................................................................................................................... 18
2.2. Les modèles de langage à grande échelle (LLMs) ........................................................ 18
2.2.1 Background des Large Language Models (LLMs) ................................................. 18
2.2.2 Développement Historique et Jalons Clés ............................................................... 19
2.2.3 Évolution des modèles de traitement du langage naturel traditionnels vers les
modèles de pointe (LLMs) ............................................................................................... 19
2.3. Architecture Transformer .............................................................................................. 22
2.3.1 Requêtes, clés et valeurs.......................................................................................... 22
2.3.2 mécanismes d’attention ........................................................................................... 23
2.3.3 Multi-Head Attention .............................................................................................. 23
2.3.4 Piles d'Encodeur et de Décodeur ............................................................................. 24
2.4 Capacités des LLMs ....................................................................................................... 26
2.5. Limites et défis .............................................................................................................. 26
2.6 c’est quoi le Fine Tuning ................................................................................................ 27
2.7 Types de fine-tuning des LLMs ..................................................................................... 27
2.7.1 Fine-tuning non supervisé ....................................................................................... 27
2.7.2 Fine-tuning supervisé (SFT).................................................................................... 27
__________________________________________________________________________
2.7.3 Fine-tuning par instructions via l’ingénierie de prompts ........................................ 28
2.8 Techniques de Fine-Tuning Efficace en Paramètres (PEFT) ......................................... 28
2.8.1 Adaptateurs (Adapters) ........................................................................................... 28
2.8.2 Adaptation par basse-rang (LoRA) ......................................................................... 29
2.8.3 QLoRA .................................................................................................................... 30
2.9 les Metrics d’évaluation perplexity ................................................................................ 31
2.10 Conclusion .................................................................................................................... 31
Chapitre 3 Etudes de l’existant et la Solution proposée ........................................................... 32
3.1. Introduction ................................................................................................................... 33
3.2. Études de cas et projets existants .................................................................................. 33
3.2.1 Masakhane ............................................................................................................... 33
3.2.2 AfroLM ................................................................................................................... 34
3.2.3 BLOOM .................................................................................................................. 35
3.2.4 fuv_latn_full ............................................................................................................ 36
3.3. Langues africaines et ressources linguistiques .............................................................. 36
3.3.1. Contexte linguistique de l’Afrique ......................................................................... 37
3.3.2. Le cas particulier du Fulfulde (Pulaar) ................................................................... 37
3.3.3. Ressources existantes pour le Fulfulde .................................................................. 37
3.3.4. Enjeux de traitement automatique pour le Fulfulde ............................................... 38
3.3.5 Illustration de la chaîne de traitement ..................................................................... 39
3.4 Solution Proposée ........................................................................................................... 40
3.4.1 Méthodologie Adoptée ............................................................................................ 40
3.4.2 Architecture et Technologies Utilisées ................................................................... 43
3.4.3 Avantages et Innovation de la Solution................................................................... 44
3.4.4. Illustration du workflow ......................................................................................... 44
3.5 Planning de Réalisation .................................................................................................. 45
3.5.1 Phases du Projet ...................................................................................................... 45
3.5.2 Gestion des Risques ................................................................................................ 47
3.6 Conclusion ...................................................................................................................... 47
Chapitre 4 Résultats et expériences .......................................................................................... 49
4.1 Introduction .................................................................................................................... 50
4.2. Collecte des données ..................................................................................................... 50
4.2.1 Sources de données et méthodes de collecte ........................................................... 50
4.2.2 Distribution des données par source........................................................................ 51
4.3. Data Preprocessing ........................................................................................................ 52
__________________________________________________________________________
4.4 Tokenisation ................................................................................................................... 53
4.4.1 Résultats de la tokenisation avec les modèles testés ............................................... 54
4.4.2 Nécessité de développer un tokenizer spécifique pour le Fulfulde ......................... 58
4.4.3 Formation du Tokenizer Fulfulde BPE ................................................................... 58
4.5. Choix du Modèle ........................................................................................................... 59
4.5.1 Résultats après fine-tuning ...................................................................................... 61
4.5.2 Choix final ............................................................................................................... 63
4.6 Resultat Final.................................................................................................................. 65
4.7 Conclusion ...................................................................................................................... 69
Conclusion générale ................................................................................................................. 71
Bibliographie ............................................................................................................................ 72
__________________________________________________________________________

Table des figures


Figure 1. 1 organigramme de SMART MS SA .......................................................................... 5
Figure 1. 2 IOT ........................................................................................................................... 6
Figure 1. 3 énergie renouvelable ................................................................................................ 6
Figure 1. 4 ingénierie des infrastructures ................................................................................... 7
Figure 1. 5 développement des logiciels .................................................................................... 7
Figure 1. 6 Cloud Computing ..................................................................................................... 7
Figure 1. 7 Intelligence artificielle ............................................................................................. 8
Figure 1. 8 UI / UX .................................................................................................................... 8
Figure 1. 9 les langues parlé en Afrique................................................................................... 10

Figure 2. 1chronologie synthétique montrant l’évolution des grands modèles de langage


(LLMs) de 1990 à 2023 20
Figure 2. 2 un overview des SLMs 21
Figure 2. 3 Architecture des Transformers 22
Figure 2. 4 Multi-head Attention 24
Figure 2. 5 les capacité des LLM 26
Figure 2. 6 adapter 29
Figure 2. 7 LoRA 30
Figure 2. 8 QLoRA 31

figure 3. 1 Masakhane 34
figure 3. 2 AfroLM paper 35
figure 3. 3 langue reconnu par AfroLM 35
figure 3. 4 Illustration de la chaîne de traitement 39
figure 3. 5 processus de fine tuning 45
figure 3. 6 comparaison de perplexity 66

Figure 4. 1 distribution des donné par sources 52


Figure 4. 2 Chargement des différents Tokenizer 54
Figure 4. 3 Résultats de tokenisation avec le modèle Bloom 55
Figure 4. 4 Résultats de tokenisation avec le modèle Qwen 55
Figure 4. 5 Résultats de tokenisation avec le modèle NLLB-600 56
Figure 4. 6 Résultats de tokenisation avec le modèle DeepSeek 57
Figure 4. 7 Résultats de tokenisation avec Tokenizer fulfulde BPE 59
Figure 4. 8 les hyper paramètre de fine tuning 61
Figure 4. 9 diagramme de perplexity 62
Figure 4. 10 le courbe de fine tuning de Qwen avec Data3 64
Figure 4. 11 model deployé hugging face 69

Liste des tableaux


Table 2. 1 Récapitulatives des LLM ........................................................................................ 25
__________________________________________________________________________

Table 3. 1 resumé des projet existant ....................................................................................... 36


Table 3. 2 ressources existants ................................................................................................. 38
Table 3. 3 Gestion des Risques ................................................................................................ 47

Table 4. 1 les données que nous avons recollter ...................................................................... 51


Table 4. 2 Taille du vocabulaire ............................................................................................... 54
Table 4. 3 les hyper paramètres ................................................................................................ 60
Table 4. 4 resultats de fine tuning ............................................................................................ 61
Table 4. 5 des exemple du texte générer .................................................................................. 63
Table 4. 6 texte completion de Fulfulde LLM ......................................................................... 68
__________________________________________________________________________

Introduction générale
Dans un contexte de transformation numérique accélérée, les technologies d’intelligence
artificielle, et en particulier les modèles de langage à grande échelle (LLMs), jouent un rôle
de plus en plus central dans l’automatisation des tâches linguistiques, la traduction, le traitement
des textes, ou encore la génération de contenu. Toutefois, malgré leur performance
impressionnante dans les langues à forte ressource, leur application dans des contextes
linguistiques spécifiques, notamment les langues africaines à faible ressource comme le
Fulfulde, demeure encore très limitée.

Ce projet s’inscrit dans cette dynamique et ambitionne de combler le fossé technologique entre
les langues à fort soutien numérique et celles qui en sont dépourvues. Il a été mené au sein d'une
entreprise active dans le domaine des technologies et de la recherche des sciences des données,
avec pour objectif principal de concevoir et d’adapter un modèle de langage pour le
Fulfulde, en s’appuyant sur des techniques modernes de traitement automatique du langage
naturel (TALN), et en tenant compte des particularités linguistiques et culturelles de cette
langue.

Dans le premier chapitre, une étude détaillée du projet est présentée. Elle débute par une
présentation de l'entreprise d'accueil, de ses domaines d'activités et de l'origine du projet. Le
chapitre explore également la problématique posée, les objectifs poursuivis ainsi que le
L’objectif du projet.

Le deuxième chapitre propose un état de l’art approfondi, centré sur les modèles de langage
à grande échelle, leur évolution, leur architecture sous-jacente — en particulier les
Transformers —, leurs capacités et leurs limites. Cela permet de mieux comprendre les choix
technologiques effectués dans le cadre de ce travail.

Dans le Troisième Chapitre, une étude des projets existant et les ressources disponibles
actuellement comme ressources pour le fulfulde, la solution proposée, ainsi que le planning de
réalisation et les risques associés.

1
Introduction générale
__________________________________________________________________________
Le quatrième chapitre est consacré aux résultats expérimentaux. Il détaille les processus de
collecte de données, de prétraitement, de tokenisation, ainsi que le choix du modèle et les
résultats obtenus après fine-tuning. Une attention particulière est portée au développement d’un
tokenizer adapté au Fulfulde, une étape cruciale dans le traitement des langues peu dotées.

Enfin, ce rapport se conclut par une conclusion générale mettant en lumière les apports du
projet, ses limites, ainsi que les perspectives d’amélioration et de poursuite des travaux.

2
Chapitre 1 Etude du projet
__________________________________________________________________________

Chapitre 1 Etude du projet

Chapitre 1 Etude du projet ......................................................................................................... 3


1.1 Introduction ...................................................................................................................... 4
1.2 Présentation de l’Entreprise d’Accueil ............................................................................. 4
1.2.1 Historique de l'Entreprise .......................................................................................... 5
1.2.2 Domaines d'Activité .................................................................................................. 6
1.3 Contexte du Projet ............................................................................................................ 8
1.3.1 Origine du Projet ....................................................................................................... 9
1.3.2 Enjeux et Défis ........................................................................................................ 10
1.4 Problématique................................................................................................................. 12
1.4.1 Conséquences .......................................................................................................... 12
1.4.2 Hypothèses .............................................................................................................. 13
1.5 Objectifs du Projet .......................................................................................................... 13
1.5.1 Objectifs Spécifiques............................................................................................... 13
1.5.2 Indicateurs de Réussite ............................................................................................ 15
1.6 Conclusion ...................................................................................................................... 16

3
__________________________________________________________________________
1.1 Introduction

Dans le cadre de notre projet de fin d'étude, nous nous sommes intéressés à l'amélioration des
modèles de langage à grande échelle (LLM) pour les langues locales mauritaniennes, en
particulier le Pulaar/Fulfulde. Ces langues, bien que largement parlées en Mauritanie et dans
d'autres régions d'Afrique de l'Ouest, demeurent largement sous-représentées dans les corpus
numériques et les modèles de traitement automatique du langage naturel (TALN).

L'essor des LLM tels que Bloom, Qwen, GPT-3 et d'autres modèles basés sur l'architecture
Transformer a permis des avancées significatives en matière de génération de texte et de
compréhension du langage. Cependant, ces modèles sont principalement entraînés sur des
données provenant de langues à forte ressource comme l'anglais, le français ou l'espagnol etc.
Par conséquent, leur performance est souvent limitée lorsqu'il s'agit de traiter des langues
locales comme le Pulaar/Fulfulde.

Le projet que nous proposons vise à combler cette lacune en effectuant un fine-tuning de
modèles LLM préexistants en utilisant des corpus spécifiques en Pulaar/Fulfulde. Pour ce faire,
nous avons choisi d'utiliser des techniques avancées telles que LoRA (Low-Rank Adaptation)
et QLoRA (Quantized LoRA) afin d'optimiser les performances tout en limitant les besoins en
ressources matérielles.

Ce projet répond à un double enjeu : scientifique et social. D'un point de vue scientifique, il
permet de tester les limites de l'adaptabilité des LLM aux langues locales peu représentées. D'un
point de vue social, il contribue à la préservation et à la valorisation des langues locales, en
facilitant l'accès aux technologies numériques pour les communautés mauritaniennes et
africaines.

Ce chapitre vise à présenter le contexte dans lequel s'inscrit ce projet, en introduisant l'entreprise
d'accueil, la problématique rencontrée, les objectifs visés, la solution envisagée ainsi que le
planning de réalisation.

1.2 Présentation de l’Entreprise d’Accueil


Dans cette section nous allons présenter l’entreprise au sein duquel nous avons passé notre
stage.

4
__________________________________________________________________________
1.2.1 Historique de l'Entreprise

Figure 1. 1 organigramme de SMART MS SA

Depuis 2016, SMART a été à l'avant-garde de l'industrie informatique mauritanienne,


conduisant la transformation numérique à travers la région. Elle excelle dans la fourniture de
solutions d'infrastructure informatique de bout en bout, en collaborant avec des partenaires
technologiques mondiaux pour fournir des solutions innovantes et à fort impact qui répondent
aux demandes spécifiques de nos clients.

Depuis sa création, elle est animée par un engagement inébranlable en faveur de l'excellence
technologique et de l'innovation. Ce dévouement l’a permis de devenir un partenaire de
confiance pour les entreprises locales et internationales, en fournissant des solutions de bout en
bout dans divers secteurs. Des centres de données de niveau 3 aux solutions de cloud privé en
passant par les implémentations e-Gov, elle fournit des services sur mesure qui répondent aux
besoins uniques de chaque client.

5
__________________________________________________________________________
1.2.2 Domaines d'Activité
Les domaines d’activité de Smart MS SA sont les suivants

a. IoT et automatisation

SMART permet à ces clients d’exploiter la puissance de l'IoT et de l'automatisation avec leurs
solutions connectées pour une entreprise plus intelligente.

Figure 1. 2 IOT

b. Énergies renouvelables :

Approche de Smart MS SA propose des solutions innovantes pour une énergie propre et fiable,
adaptées aux objectifs écologiques.

Figure 1. 3 énergie renouvelable

c. Ingénierie des infrastructures :

Conception d’environnements flexibles assurant l’agilité et la durabilité des entreprises.

6
__________________________________________________________________________

Figure 1. 4 ingénierie des infrastructures

d. Logiciels et plates-formes :

Développement d'applications web et mobiles innovantes avec les dernières technologies.

Figure 1. 5 développement des logiciels

e. Cloud Computing :

SMART MS SA intègre la technologie cloud au cœur de l’entreprise pour transformer vos


opérations et maximiser votre valeur à 360°.

Figure 1. 6 Cloud Computing

7
__________________________________________________________________________
f. Intelligence artificielle :

SMART MS SA exploite l'IA avancée et l'analyse des données pour offrir des solutions
innovantes et des insights exploitables.

Figure 1. 7 Intelligence artificielle

g. UI / UX :

SMART MS SA fourni des Solutions UI/UX intuitives et sur mesure, conçues pour optimiser
l'engagement et l'interaction des utilisateurs.

Figure 1. 8 UI / UX

1.3 Contexte du Projet

Les modèles de langage à grande échelle (LLM), tels que GPT-3, GPT-4,DeepSeek ou
Qwen2.5-0.5B, ont révolutionné le traitement automatique du langage naturel (TALN) en
offrant des capacités avancées de génération et de compréhension de texte. Ces modèles sont
entraînés sur d'énormes volumes de données textuelles multilingues, mais leur efficacité reste

8
__________________________________________________________________________
principalement concentrée sur les langues à forte ressource comme l'anglais, le français ou
l'espagno.

En revanche, les langues locales africaines, notamment le Pulaar/Fulfulde, sont très peu
représentées dans ces corpus d'entraînement. Cela résulte en une faible précision des modèles
dans les tâches de génération et de compréhension lorsqu’ils sont appliqués à ces langues. Cette
absence de prise en charge constitue un frein majeur pour l'accès aux technologies modernes
pour les communautés locales, limitant l'utilisation d'applications telles que les assistants
vocaux, les traducteurs automatiques ou les systèmes de réponse automatisée.

En Mauritanie, le Pulaar/Fulfulde est l'une des langues nationales parlées par une part
significative de la population et en Afrique en générale. Pourtant, il n'existe actuellement aucun
modèle LLM spécifiquement optimisé pour cette langue, ce qui restreint considérablement les
possibilités d’intégration technologique au sein des communautés Pulaarophones.

1.3.1 Origine du Projet

L'idée de ce projet est née de la volonté d'intégrer les langues locales mauritaniennes dans les
technologies modernes. En travaillant avec des experts linguistiques et des chercheurs en
intelligence artificielle, nous avons identifié un besoin crucial : développer des modèles
capables de générer du texte et de comprendre des requêtes en Pulaar/Fulfulde de manière
cohérente et naturelle.

Ce projet répond également à un défi académique et scientifique : démontrer la capacité


d'adaptation des modèles LLM aux langues sous-représentées. Grâce aux avancées récentes en
fine-tuning, notamment avec des techniques comme LoRA (Low-Rank Adaptation) et QLoRA
(Quantized Low-Rank Adaptation), il est désormais possible d'optimiser efficacement des
modèles pré-entraînés en utilisant des données locales.

9
__________________________________________________________________________

Figure 1. 9 les langues parlé en Afrique

1.3.2 Enjeux et Défis

Ce projet revêt une importance particulière, non seulement sur le plan technologique, mais aussi
en termes d'impact social et culturel.

Enjeux Technologiques :

 Optimisation pour une langue à faible ressource : Le principal défi réside dans
l'adaptation des modèles LLM aux spécificités linguistiques du Pulaar/Fulfulde, alors
que les corpus disponibles sont limités et souvent hétérogènes en termes de qualité et
de format.
 Évaluation de la performance : La performance des modèles fine-tunés devra être
évaluée avec des critères adaptés, tels que la perplexité pour la génération de texte.
 Efficacité en ressources : La limitation des ressources matérielles (GPU, stockage)
nécessite l'utilisation de techniques légères comme LoRA pour réduire la charge
computationnelle tout en maintenant de bonnes performances.

10
__________________________________________________________________________
Enjeux Sociaux et Culturels :

 Valorisation des langues locales : En intégrant le Pulaar/Fulfulde dans des modèles


LLM, ce projet contribue à la préservation linguistique et à la modernisation des
pratiques numériques au sein des communautés locales.
 Réduction de la fracture numérique : Offrir des outils numériques adaptés permet aux
locuteurs de participer pleinement aux nouvelles dynamiques technologiques et de
bénéficier des avancées en traitement automatique du langage.
 Inclusivité numérique : En rendant les applications de génération de texte et d’autre
fonctionnalités accessibles en Pulaar, ce projet promeut l'égalité d'accès aux
technologies avancées.

Défis Techniques :

 Collecte de données linguistiques : L'absence de corpus standardisés en Pulaar


représente un obstacle majeur. Il est nécessaire d'exploiter des sources diversifiées,
notamment des médias locaux, des documents éducatifs et des corpus communautaires.
 Prétraitement et normalisation : Les variations dialectales et orthographiques au sein du
Pulaar/Fulfulde posent des défis en matière de nettoyage et d'uniformisation des
données.
 Fine-tuning adapté : La mise en œuvre de techniques de fine-tuning légères comme
LoRA nécessite des ajustements précis des hyperparamètres pour garantir une
convergence rapide et une généralisation efficace.

Impact attendu :

Le succès de ce projet apportera des avancées significatives pour la communauté linguistique


Pulaarophone en Mauritanie particulièrement et en Afrique généralement, notamment en
facilitant l'accès à des services numériques personnalisés et en renforçant l'inclusion numérique.
Les résultats obtenus pourront également servir de modèle pour le fine-tuning d'autres langues
locales africaines à faible ressource, ouvrant ainsi la voie à des projets similaires.

Ce contexte global et les enjeux identifiés justifient l'importance et la pertinence du projet. En


adaptant les LLM aux langues locales, nous proposons une solution durable et évolutive pour
l’intégration numérique des communautés mauritaniennes.

11
__________________________________________________________________________

1.4 Problématique

Malgré les progrès remarquables réalisés ces dernières années en traitement automatique du
langage naturel grâce aux modèles de langage à grande échelle (LLM), leur efficacité reste
fortement conditionnée par les langues sur lesquelles ils sont entraînés. Ces modèles sont
généralement optimisés pour des langues largement utilisées à l'échelle mondiale telles que
l'anglais, le français ou le chinois etc. Ainsi, les langues locales comme le Pulaar/Fulfulde,
largement parlées en Mauritanie et en Afrique de l'Ouest, restent faiblement représentées dans
les corpus d’entraînement disponibles. Cette absence ou faiblesse de données adaptées pose une
réelle difficulté dans l'utilisation des technologies modernes pour ces langues.

1.4.1 Conséquences

Ce manque de représentativité linguistique entraîne plusieurs conséquences notables :

 Faible performance des outils linguistiques : Les applications utilisant les modèles
généralistes existants ne parviennent pas à traiter efficacement le Pulaar/Fulfulde,
entraînant une qualité médiocre en génération automatique de texte, traduction et
reconnaissance vocale.
 Exclusion numérique : Les locuteurs de langues locales se trouvent désavantagés dans
l'accès aux technologies avancées telles que les assistants virtuels, les outils éducatifs
numériques, et d’autres services numériques reposant sur des modèles de langage.
 Risque de perte linguistique : À terme, l'insuffisance d'intégration technologique des
langues locales pourrait contribuer indirectement à leur marginalisation, voire à leur
disparition progressive au profit des langues dominantes.

Ces conséquences soulignent l’importance urgente de développer des modèles de langage


adaptés aux spécificités linguistiques et culturelles locales, afin d'améliorer l'accès équitable
aux ressources numériques modernes.

12
__________________________________________________________________________
1.4.2 Hypothèses

Pour répondre à cette problématique, nous formulons les hypothèses suivantes :

 Hypothèse 1 : L’utilisation de techniques de fine-tuning telles que FFT, LoRA et


QLoRA permettra d'adapter efficacement des modèles LLM pré-entraînés (comme
Qwen2.5-0.5B-Instruct, Qwen2.5-0.5B et Bloom560M etc) au Pulaar/Fulfulde malgré
la taille limitée des corpus disponibles qui est actuellement de quelques MBs.
 Hypothèse 2 : Une préparation minutieuse et un enrichissement approprié des corpus
textuels en Fulfulde influenceront positivement les performances des modèles fine-
tunés, améliorant ainsi significativement leur capacité à générer et à comprendre du
texte dans cette langue.

Ces hypothèses seront validées par des expérimentations rigoureuses et par des évaluations
systématiques des résultats obtenus en génération de texte et compréhension linguistique.

1.5 Objectifs du Projet

L'objectif principal de ce projet est d’améliorer significativement la capacité des modèles de


langage à grande échelle (LLM) à traiter efficacement la langue Pulaar/Fulfulde, grâce à une
approche de fine-tuning adaptée aux spécificités linguistiques et culturelles locales. En réalisant
cette adaptation, nous souhaitons non seulement renforcer la représentativité du Pulaar/Fulfulde
dans les outils technologiques avancés mais aussi contribuer à la valorisation et à la
pérennisation de cette langue à l’ère du numérique.

1.5.1 Objectifs Spécifiques

Pour atteindre cet objectif global, plusieurs objectifs spécifiques ont été définis clairement :

 Objectif Spécifique 1 : Constitution et prétraitement d'un corpus de 1GB adapté


o Collecter un corpus linguistique suffisamment représentatif en Pulaar/Fulfulde
à partir de diverses sources telles que les médias locaux (sites web, radio), les
archives numériques, les ressources communautaires disponibles en ligne, ainsi
que des données générées par OCR sur des textes manuscrits ou imprimés.

13
__________________________________________________________________________
o Effectuer un prétraitement approfondi des données collectées en réalisant des
tâches telles que le nettoyage des textes (élimination des erreurs typographiques
et caractères spéciaux), la normalisation orthographique et la segmentation
adéquate du texte pour optimiser leur utilisation durant la phase de fine-tuning.
 Objectif Spécifique 2 : Mise en œuvre des techniques avancées de fine-tuning
o Réaliser le fine-tuning des modèles de langage existants, spécifiquement
Qwen2.5-0.5B et Bloom560M, en utilisant des approches optimisées telles que
LoRA (Low-Rank Adaptation) et QLoRA (Quantized LoRA), qui permettent
une adaptation efficace tout en réduisant les ressources informatiques
nécessaires.
o Ajuster minutieusement les hyperparamètres d'entraînement (nombre d'époques,
taux d'apprentissage, taille des batchs etc) afin de maximiser les performances
tout en évitant les problèmes tels que le sur-apprentissage (overfitting) ou le
sous-apprentissage (underfitting).
 Objectif Spécifique 3 : Évaluation rigoureuse des modèles fine-tunés
o Évaluer systématiquement les performances des modèles obtenus à travers des
mesures quantitatives telles que la perplexité, la précision, la cohérence
linguistique et l’adaptabilité contextuelle des générations automatiques en
Pulaar/Fulfulde.
o Comparer les résultats des différents modèles fine-tunés (par exemple Qwen2.5-
0.5B versus Bloom560M) afin d’identifier celui qui présente les meilleures
performances et la plus grande capacité d’adaptation linguistique.
 Objectif Spécifique 4 : Mise à disposition et vulgarisation des résultats
o Produire une documentation claire et détaillée(Paper) destinée aux chercheurs,
développeurs et linguistes pour faciliter la reproductibilité des expériences et
encourager le développement ultérieur dans ce domaine.
o Vulgariser les résultats obtenus en proposant des applications pratiques comme
des outils de génération automatique de texte, de traduction assistée ou encore
d’aide à l’apprentissage et à la promotion de la langue Pulaar/Fulfulde.

14
__________________________________________________________________________
1.5.2 Indicateurs de Réussite

Afin de mesurer objectivement la réussite du projet, nous avons déterminé un ensemble


d’indicateurs de succès spécifiques :

 Indicateur 1 : Perplexité et précision des modèles

 Obtenir une perplexité significativement réduite (idéalement inférieure à celle


des modèles initiaux avant adaptation) montrant ainsi une meilleure prédiction
linguistique du modèle pour le Pulaar/Fulfulde.
 Atteindre un taux de précision élevé (>80%) dans des tâches spécifiques telles
que la génération cohérente de textes courts, les réponses contextuelles
pertinentes et la compréhension linguistique générale.

 Indicateur 2 : Capacité d’adaptation à différents contextes d'utilisation

 Vérifier l’efficacité du modèle fine-tuné à générer des contenus textuels variés


et pertinents dans des domaines diversifiés (information générale, santé
publique, dialogue conversationnel).
 Mesurer le taux d’acceptation et la satisfaction des utilisateurs finaux potentiels
à travers des sondages ou enquêtes auprès des communautés Pulaarophones.

 Indicateur 3 : Contribution scientifique et impact social

 Évaluer la valeur scientifique du projet en fonction de la qualité et de


l’originalité des résultats obtenus, notamment leur acceptation potentielle pour
des publications académiques ou des conférences scientifiques.
 Analyser l'impact social concret du projet sur la communauté linguistique
concernée, en termes de sensibilisation à l’importance des langues locales,
d’amélioration de l’accès à l'information numérique et d'encouragement à
l'utilisation accrue du Pulaar/Fulfulde dans le domaine numérique.

Ces indicateurs permettront de dresser un bilan précis et pertinent de l'efficacité du fine-tuning


des modèles LLM pour le Pulaar/Fulfulde, assurant ainsi une évaluation complète des objectifs
fixés pour ce projet.

15
__________________________________________________________________________

1.6 Conclusion
Ce chapitre présente le contexte général du projet, qui vise à améliorer les performances des
modèles de langage (LLM) pour le Pulaar/Fulfulde, une langue largement parlée en Mauritanie
mais encore peu représentée dans les technologies actuelles. Il décrit l’environnement
professionnel favorable offert par l’entreprise d’accueil et identifie une problématique claire :
l’absence de ressources adaptées pour le traitement automatique du Fulfulde.

16
Chapitre 2 Etat de l’art
__________________________________________________________________________

Chapitre 2 Etat de l’art


Chapitre 2 Etat de l’art ............................................................................................................. 17
2.1 Introduction .................................................................................................................... 18
2.2. Les modèles de langage à grande échelle (LLMs) ........................................................ 18
2.2.1 Background des Large Language Models (LLMs) ................................................. 18
2.2.2 Développement Historique et Jalons Clés ............................................................... 19
2.2.3 Évolution des modèles de traitement du langage naturel traditionnels vers les
modèles de pointe (LLMs) ............................................................................................... 19
2.3. Architecture Transformer .............................................................................................. 22
2.3.1 Requêtes, clés et valeurs.......................................................................................... 22
2.3.2 mécanismes d’attention ........................................................................................... 23
2.3.3 Multi-Head Attention .............................................................................................. 23
2.3.4 Piles d'Encodeur et de Décodeur ............................................................................. 24
2.4 Capacités des LLMs ....................................................................................................... 26
2.5. Limites et défis .............................................................................................................. 26
2.6 c’est quoi le Fine Tuning ................................................................................................ 27
2.7 Types de fine-tuning des LLMs ..................................................................................... 27
2.7.1 Fine-tuning non supervisé ....................................................................................... 27
2.7.2 Fine-tuning supervisé (SFT).................................................................................... 27
2.7.3 Fine-tuning par instructions via l’ingénierie de prompts ........................................ 28
2.8 Techniques de Fine-Tuning Efficace en Paramètres (PEFT) ......................................... 28
2.8.1 Adaptateurs (Adapters) ........................................................................................... 28
2.8.2 Adaptation par basse-rang (LoRA) ......................................................................... 29
2.8.3 QLoRA .................................................................................................................... 30
2.9 les Metrics d’évaluation perplexity ................................................................................ 31
2.10 Conclusion .................................................................................................................... 31

17
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.1 Introduction

Le traitement automatique des langues naturelles (TALN) connaît depuis la dernière décennie
une évolution spectaculaire grâce à l’émergence des modèles de langage à grande échelle
(Large Language Models - LLMs). Ces modèles, tels que GPT-3, BLOOM, QWEN ou LLaMA,
sont capables de traiter, comprendre et générer du texte avec une qualité proche de celle des
humains. En s'appuyant sur des architectures neuronales complexes comme le Transformer, les
LLMs ont été entraînés sur des volumes massifs de données textuelles dans plusieurs langues,
leur conférant une capacité impressionnante à accomplir une grande variété de tâches sans
entraînement spécifique préalable.

Le fine-tuning des LLMs — qui consiste à réajuster un modèle préexistant sur des données
spécifiques à une langue, une tâche ou un domaine — apparaît comme une solution prometteuse
pour combler ce fossé. En adaptant un modèle existant à une langue africaine donnée, il devient
possible d'améliorer considérablement la qualité de ses prédictions, sa compréhension des
structures linguistiques locales et sa pertinence culturelle.

Dans ce contexte, ce chapitre vise à présenter un état de l’art riche et structuré autour :

 des modèles de langage à grande échelle (LLMs),


 L’architectures des Transformers
 Les capacités et les limites des Transformers
 Les techniques de réductions des paramètres.

2.2. Les modèles de langage à grande échelle (LLMs)

L’avènement des modèles de langage à grande échelle (Large Language Models ou LLMs) a
marqué un tournant décisif dans le domaine du traitement automatique du langage naturel
(TALN). Ces modèles, basés principalement sur l’architecture Transformer introduite par le
l’article Attention Is All You Need. en 2017, ont démontré une capacité impressionnante à
comprendre, générer et traduire du texte, tout en s’adaptant à de nombreuses tâches
linguistiques sans entraînement spécifique.

2.2.1 Background des Large Language Models (LLMs)

Les grands modèles de langage (LLMs) représentent une avancée majeure dans la
compréhension et la génération du langage humain, surpassant les modèles traditionnels comme
18
Chapitre 2 Etat de l’art
__________________________________________________________________________
les N-grammes. Grâce à l'architecture Transformer et au mécanisme d'auto-attention, des
modèles tels que GPT-3 et GPT-4 capturent efficacement les dépendances à long terme. Les
techniques d'apprentissage en contexte et par renforcement avec retour humain (RLHF)
permettent d'améliorer la cohérence et la qualité des réponses générées, soutenues par des
approches comme le prompt engineering et les interactions conversationnelles.

2.2.2 Développement Historique et Jalons Clés

Les modèles de langage, fondamentaux pour le traitement automatique du langage naturel


(TALN), ont évolué des modèles statistiques (SLMs) aux LLMs modernes. Cette évolution a
permis de passer d'une approche purement mathématique à des modèles capables de traiter,
comprendre et générer du texte avec un niveau de performance proche des capacités humaines,
illustré par des jalons marquants dans l'histoire du TALN. 1

2.2.3 Évolution des modèles de traitement du langage naturel traditionnels vers les
modèles de pointe (LLMs)

Comprendre les LLMs nécessite de retracer le développement des modèles de langage à travers
plusieurs étapes, telles que les modèles de langage statistiques (SLMs), les modèles de
langage neuronaux (NLMs), les modèles de langage pré-entraînés (PLMs), jusqu'aux
modèles de langage de grande taille (LLMs). [1]

a. Modèles de langage statistiques (SLMs)

Apparus dans les années 1990, les SLMs analysent le langage naturel en utilisant des méthodes
probabilistes pour déterminer la probabilité des phrases dans les textes. Par exemple, la probabilité
P(S) de la phrase « Je suis très heureux » est donnée par :
P(S) = P(ω1,ω2,ω3,ω4) = P(je,suis,trop,heureux)

1
1706.03762

19
Chapitre 2 Etat de l’art
__________________________________________________________________________

Figure 2. 1chronologie synthétique montrant l’évolution des grands modèles de langage (LLMs) de 1990 à 2023

Cette progression commence avec les premiers modèles statistiques tels que les N-grammes,
passe par les modèles de langage neuronaux comme Word2Vec et RNN/LSTM, et évolue
vers l’ère des modèles pré-entraînés avec l’introduction des transformers et des mécanismes
d’attention.
La figure met en évidence les étapes clés, notamment le développement de BERT, de la série
GPT, ainsi que des innovations récentes telles que GPT-4 et ChatGPT, illustrant les avancées
rapides de la technologie des LLMs au fil du temps.

b. Modèles de langage neuronaux (NLMs) :


Les NLMs exploitent des réseaux neuronaux pour prédire des séquences de mots, dépassant
ainsi les limites des SLMs. Les vecteurs de mots permettent aux ordinateurs de comprendre le
sens des mots. Des outils comme Word2Vec représentent les mots dans un espace vectoriel
où les relations sémantiques sont reflétées par les angles entre les vecteurs.

Les NLMs sont constitués de neurones interconnectés organisés en couches, rappelant la


structure du cerveau humain.

 La couche d’entrée concatène les vecteurs de mots,


 la couche cachée applique une fonction d’activation non linéaire,
 et la couche de sortie prédit les mots suivants en utilisant la fonction Softmax, qui
transforme les valeurs en une distribution de probabilité.

20
Chapitre 2 Etat de l’art
__________________________________________________________________________
c. Modèles de langage pré-entraînés (PLMs)

Les PLMs sont d’abord entraînés sur de vastes volumes de textes non étiquetés afin de
comprendre les structures fondamentales du langage (pré-entraînement). Ils sont ensuite
ajustés (fine-tuned) sur un jeu de données plus petit et spécifique à une tâche.

Ce paradigme de « pré-entraînement et ajustement », illustré par GPT-2 et BERT, a donné


naissance à des architectures de modèles variées et performantes.

d. Large Language Models (LLMs)

Les LLMs tels que GPT-3, GPT-4, PaLM et LLaMA sont entraînés sur d’immenses corpus
textuels comprenant des dizaines de milliards de paramètres.

Les LLMs suivent un processus en deux étapes :

1. un pré-entraînement initial sur un vaste corpus,


2. suivi d’un alignement avec les valeurs humaines.

Cette approche permet aux LLMs de mieux comprendre les commandes et les valeurs
humaines. [2]

Voici une figure qui illustre l’apparitions des modèles depuis 2019 jusqu’au 2024 :

Figure 2. 2 un overview des SLMs

21
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.3. Architecture Transformer

L'architecture de base de la majorité des LLMs est le Transformer, qui repose sur le
mécanisme d'attention multi-têtes (Multi-head Attention). Ce mécanisme permet au modèle
de :

 Se concentrer sur différentes parties de la séquence d'entrée,


 Capturer des dépendances à longue distance entre les mots,
 Paralléliser efficacement les calculs.

Figure 2. 3 Architecture des Transformers

Source : Qu’est-ce qu’un mécanisme d’attention ? | IBM

2.3.1 Requêtes, clés et valeurs

L’article fondateur « Attention is All You Need » a formulé son mécanisme d’attention en
utilisant la terminologie d’une base de données relationnelle : requêtes, clés et valeurs. Les
bases de données relationnelles sont conçues pour simplifier le stockage et la récupération des

22
Chapitre 2 Etat de l’art
__________________________________________________________________________
données pertinentes : elles attribuent un identifiant unique (une « clé ») à chaque élément de
donnée et chaque clé est associée à une valeur correspondante. En NLP, la « base de données »
d’un modèle est le vocabulaire des tokens qu’il a appris grâce à son jeu de données
d’entraînement.

 Le vecteur de requête représente les informations recherchées par un token donné.


 Le vecteur de clé représente les informations que chaque token contient. L’alignement
entre la requête et la clé est utilisé pour calculer les pondérations d’attention.
 La valeur (ou vecteur de valeur) applique les informations pondérées par l’attention des
vecteurs de clé. Les contributions provenant des clés qui sont fortement alignées sur une
requête sont pondérées plus fortement ; les contributions des clés qui ne sont pas
pertinentes pour une requête sont pondérées selon une valeur proche de zéro [3]
2.3.2 mécanismes d’attention

L’objectif principal d’un mécanisme d’attention est de déterminer l’importance relative des
différentes parties de la séquence d’entrée, puis d’inciter le modèle à prêter attention
aux parties importantes et à ignorer les autres. [3]

2.3.3 Multi-Head Attention

Il est mathématiquement efficace de calculer la moyenne des contributions pondérées par


l’attention des autres tokens au lieu de tenir compte de chaque contribution individuellement,
mais cela entraîne une perte de détails. L’architecture transformatrice résout ce problème en
mettant en œuvre l’attention multitête.

Pour profiter de l’efficacité du calcul de la moyenne tout en tenant compte des relations
multiples entre les tokens, les modèles de transformeur calculent les opérations d’auto-attention
plusieurs fois en parallèle à chaque couche d’attention du réseau. Chaque plongement de token
d’entrée d’origine est divisé en h sous-ensembles de taille égale. Chaque élément du
plongement est introduit dans l’une des h matrices parallèles des poids Q, K et V , chacune étant
respectivement appelée tête de requête, tête de clé ou tête de valeur. Les vecteurs produits par

23
Chapitre 2 Etat de l’art
__________________________________________________________________________
chacun de ces triplets parallèles de têtes de requête, clé et valeur sont ensuite introduits dans
une tête d’attention correspondante.

Figure 2. 4 Multi-head Attention

2.3.4 Piles d'Encodeur et de Décodeur

a. Encodeur :
L'encodeur est composé d'une pile de N = 6 couches identiques. Chaque couche comporte deux
sous-couches.

 La première est un mécanisme d'auto-attention multi-tête.


 La seconde est un réseau de neurones entièrement connecté et positionnel.

Nous appliquons une connexion résiduelle autour de chacune des deux sous-couches, suivie
d'une normalisation de couche (Layer Normalization). Ainsi, la sortie de chaque sous-couche
est définie comme :

LayerNorm(x+Sublayer(x)) Où Sublayer(x) représente la fonction implémentée par la sous-


couche elle-même.

24
Chapitre 2 Etat de l’art
__________________________________________________________________________
Pour faciliter ces connexions résiduelles, toutes les sous-couches du modèle, ainsi que les
couches d'embedding, produisent des sorties de dimension dmodel = 512.

b. Décodeur :
Le décodeur est également composé d'une pile de N = 6 couches identiques. En plus des deux
sous-couches présentes dans chaque couche d'encodeur, le décodeur insère une troisième sous-
couche qui effectue une attention multi-tête sur la sortie de la pile d'encodeurs.

Tout comme pour l'encodeur, nous appliquons des connexions résiduelles autour de chaque
sous-couche, suivies d'une normalisation de couche.
Nous modifions également la sous-couche d'auto-attention dans la pile du décodeur pour
empêcher les positions d'attention vers les positions ultérieures.
Ce masquage, combiné au fait que les embeddings de sortie sont décalés d'une position,
garantit que les prédictions pour la position iii ne dépendent que des sorties déjà connues aux
positions inférieures à iii. [4]

Voici des exemples de modèles LLMs populaires basés sur les Transformers :

Modèle Organisation Paramètres Particularités

GPT-3 OpenAI 175B Auto-régressif, texte libre

BLOOM BigScience 176B Multilingue, open-source

LLaMA 2 Meta 7B–65B Performant avec peu de ressources

T5 Google 11B Encoder-decoder, multitâches

Falcon TII 7B–40B Optimisé pour vitesse et efficacité

Mistral Mistral AI 7B Modèle dense performant

Qwen2 Alibaba 0.5B–72B Plusieurs tailles, multilingue

Table 2. 1 Récapitulatives des LLM

25
Chapitre 2 Etat de l’art
__________________________________________________________________________
Chaque modèle a été entraîné sur des jeux de données massifs, allant de Common Crawl à des
corpus spécialisés, avec différentes méthodes d’optimisation et de prétraitement.

2.4 Capacités des LLMs

Les LLMs possèdent des capacités impressionnantes :

 Compréhension du langage : analyse de sentiments, classification de texte


 Génération de texte : rédaction d’articles, dialogues, histoires
 Traduction automatique : sans besoin de supervision directe (zero-shot)
 Raisonnement logique et mathématique : résolution de problèmes, chaînes de pensée
(chain-of-thought prompting)
 Adaptabilité : via fine-tuning ou prompting sur des tâches précises

Figure 2. 5 les capacité des LLM

2.5. Limites et défis

Malgré leurs performances, les LLMs présentent plusieurs limites :

 Coût computationnel élevé : entraînement sur plusieurs GPU A100 pendant des
semaines
 Biais et hallucinations : les modèles peuvent produire des affirmations incorrectes

26
Chapitre 2 Etat de l’art
__________________________________________________________________________
 Accessibilité limitée : certains modèles sont fermés ou peu adaptés aux langues sous-
représentées
 Empreinte écologique : la consommation énergétique est non négligeable

2.6 c’est quoi le Fine Tuning

Le fine-tuning utilise un modèle pré-entraîné, tel que la série GPT d’OpenAI, comme base. Le
processus consiste à poursuivre l’entraînement sur un jeu de données plus petit et spécifique
à un domaine.

Cette approche s’appuie sur les connaissances déjà acquises par le modèle, ce qui permet
d’améliorer ses performances sur des tâches spécifiques tout en réduisant les besoins en
données et en ressources de calcul.

2.7 Types de fine-tuning des LLMs

Il existe plusieurs approches de fine-tuning des modèles de langage (LLMs). Nous présenterons
ci-dessous les méthodes les plus couramment utilisées.

2.7.1 Fine-tuning non supervisé

Cette méthode ne nécessite pas de données étiquetées. Le LLM est simplement exposé à un
large corpus de textes non étiquetés provenant du domaine ciblé, ce qui permet d’affiner sa
compréhension du langage. Cette approche est utile pour des domaines nouveaux comme le
juridique ou le médical, mais elle est moins précise pour des tâches spécifiques telles que la
classification ou la résumé.

2.7.2 Fine-tuning supervisé (SFT)

Le SFT consiste à fournir au LLM des données étiquetées adaptées à la tâche cible. Par
exemple, un fine-tuning pour la classification de textes dans un contexte professionnel utilise
un jeu de données contenant des extraits de texte associés à des étiquettes de classe. Bien que
cette méthode soit efficace, elle nécessite une grande quantité de données étiquetées, ce qui
peut être coûteux et long à obtenir.

27
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.7.3 Fine-tuning par instructions via l’ingénierie de prompts

Cette méthode repose sur la fourniture d’instructions en langage naturel au LLM, ce qui est
particulièrement utile pour créer des assistants spécialisés. Elle réduit le besoin de grandes
quantités de données étiquetées, mais dépend fortement de la qualité des prompts. [5]

2.8 Techniques de Fine-Tuning Efficace en Paramètres (PEFT)

Le fine-tuning efficace en paramètres (PEFT) est une technique puissante en traitement


automatique du langage naturel (TALN), qui permet d’adapter de manière efficace les modèles
de langage pré-entraînés à diverses applications. Les méthodes PEFT consistent à ajuster
uniquement un petit sous-ensemble de paramètres supplémentaires, tout en maintenant la
majorité des paramètres du LLM pré-entraîné figés, réduisant ainsi de manière significative
les coûts de calcul et de stockage. Voici les 3 techniques les plus utilisé :

2.8.1 Adaptateurs (Adapters)

Les méthodes basées sur les adaptateurs consistent à introduire des paramètres entraînables
supplémentaires après les couches d’attention et les couches entièrement connectées d’un
modèle pré-entraîné figé.

L’objectif est de réduire l’utilisation de la mémoire et d’accélérer l’entraînement, tout en


maintenant la majorité des paramètres du modèle intact. [5]

28
Chapitre 2 Etat de l’art
__________________________________________________________________________

Figure 2. 6 adapter

2.8.2 Adaptation par basse-rang (LoRA)

La Low-Rank Adaptation (LoRA) est une technique conçue pour le fine-tuning des grands
modèles de langage, qui modifie le processus en gardant figés les poids d’origine du modèle
tout en appliquant des modifications à un ensemble distinct de poids ajoutés aux paramètres
initiaux. [5]

29
Chapitre 2 Etat de l’art
__________________________________________________________________________

Figure 2. 7 LoRA

2.8.3 QLoRA

QLoRA est une version étendue de LoRA conçue pour offrir une efficacité mémoire accrue
lors du fine-tuning des grands modèles de langage (LLMs), en quantifiant les poids du
modèle à une précision de 4 bits.

En général, les paramètres des LLMs sont stockés en format 32 bits, mais QLoRA les
compresse en 4 bits, ce qui réduit considérablement l’empreinte mémoire. Cela permet de
réaliser du fine-tuning sur du matériel moins puissant, y compris des GPU grand public.

QLoRA quantifie également les poids des adaptate. [5]

30
Chapitre 2 Etat de l’art
__________________________________________________________________________

Figure 2. 8 QLoRA

2.9 les Metrics d’évaluation perplexity

La perplexité est une mesure utilisée pour évaluer la qualité des modèles de langage,
notamment les modèles de type LLM (Large Language Model). Elle mesure dans quelle
mesure un modèle est "surpris" par une séquence de texte. Plus la perplexité est faible,
meilleur est le modèle, car cela signifie qu’il prédit bien les mots ou les phrases.

Perplexity(P) = exp(−N1i = 1∑NlogP(wi))

2.10 Conclusion

Les modèles de langage à grande échelle ont transformé les méthodes de traitement automatique
du langage naturel. Toutefois, leur adaptation à des contextes spécifiques – comme les langues
africaines à faible ressource – nécessite des ajustements, comme le fine-tuning ou la création
de jeux de données représentatifs. Le chapitre suivant explorera en détail des projets déjà réalisé
dans ce contexte ainsi que notre solution qu’on a proposée et le plan qu’on a suivi pour parvenir
aux meilleurs résultats.

31
__________________________________________________________________________

Chapitre 3 Etudes de l’existant et la Solution


proposée
Chapitre 3 Etudes de l’existant et la Solution proposée ........................................................... 32
3.1. Introduction ................................................................................................................... 33
3.2. Études de cas et projets existants .................................................................................. 33
3.2.1 Masakhane ............................................................................................................... 33
3.2.2 AfroLM ................................................................................................................... 34
3.2.3 BLOOM .................................................................................................................. 35
3.2.4 fuv_latn_full ............................................................................................................ 36
3.3. Langues africaines et ressources linguistiques .............................................................. 36
3.3.1. Contexte linguistique de l’Afrique ......................................................................... 37
3.3.2. Le cas particulier du Fulfulde (Pulaar) ................................................................... 37
3.3.3. Ressources existantes pour le Fulfulde .................................................................. 37
3.3.4. Enjeux de traitement automatique pour le Fulfulde ............................................... 38
3.3.5 Illustration de la chaîne de traitement ..................................................................... 39
3.4 Solution Proposée ........................................................................................................... 40
3.4.1 Méthodologie Adoptée ............................................................................................ 40
3.4.2 Architecture et Technologies Utilisées ................................................................... 43
3.4.3 Avantages et Innovation de la Solution................................................................... 44
3.4.4. Illustration du workflow ......................................................................................... 44
3.5 Planning de Réalisation .................................................................................................. 45
3.5.1 Phases du Projet ...................................................................................................... 45
3.5.2 Gestion des Risques ................................................................................................ 47
3.6 Conclusion ...................................................................................................................... 47

32
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.1. Introduction
Ce chapitre est consacré à l’analyse des projets similaires déjà réalisés, à l’examen des
ressources disponibles pour la langue Fulfulde, ainsi qu’à la présentation de la solution que
nous proposons. L’objectif principal est de développer un modèle de langage de grande taille
(LLM) dédié à la génération de texte en Fulfulde, spécifiquement adapté au contexte de la
Mauritanie.

3.2. Études de cas et projets existants


L'intégration des langues peu dotées, en particulier les langues africaines, dans le domaine du
traitement automatique des langues naturelles (TALN) constitue une préoccupation de longue
date. De nombreux projets ont été initiés dans cette optique. Dans cette section, nous présentons
quelques-uns des projets les plus notables et reconnus par la communauté scientifique pour leur
contribution à cette cause.

3.2.1 Masakhane
 Description : Masakhane est une organisation communautaire panafricaine dédiée à la

recherche en traitement automatique des langues (TAL) pour les langues africaines. Elle
se concentre sur la traduction automatique, la reconnaissance d'entités nommées (NER),
la classification de textes, et plus encore, en collaborant avec des chercheurs africains
pour développer des modèles adaptés aux langues locales. [6]

 Site officiel : [Link]

 GitHub : GitHub

 Publication académique : [Link]

33
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________

figure 3. 1 Masakhane

3.2.2 AfroLM
 Description : AfroLM est un modèle de langage multilingue pré-entraîné sur 23 langues

africaines, utilisant une approche d'apprentissage actif auto-supervisé. Il vise à


améliorer les performances sur des tâches telles que la reconnaissance d'entités
nommées, la classification de textes et l'analyse de sentiments, en particulier pour les
langues à faibles ressources. [7]

 Publication académique : [Link]

 Modèle sur Hugging Face : [Link]

34
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________

figure 3. 2 AfroLM paper

figure 3. 3 langue reconnu par AfroLM

Source : [Link]

3.2.3 BLOOM
 Description : BLOOM est un modèle de langage multilingue open-source développé

par le projet BigScience. Il prend en charge 46 langues humaines et 13 langages de


programmation. Bien que non spécifiquement conçu pour les langues africaines, il a été
utilisé comme base pour des projets de fine-tuning sur ces [Link]

35
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
 Modèle sur Hugging Face : [Link]

 Article de présentation : Medium

3.2.4 fuv_latn_full

Parmi les travaux existants, on trouve Goldfish, une suite de modèles de langue monolingues
développée pour environ 350 langues. Ces modèles sont particulièrement orientés vers les
langues peu dotées, avec un objectif de comparaison entre langues plutôt que de performance
brute. Le modèle correspondant au Fulfulde nigérian (écriture latine) a été entraîné sur un
corpus de 21 Mo, représentant l’ensemble des données disponibles dans cette langue. Il est à
noter que ce volume prend en compte un facteur d’ajustement (ou "surcoût en octets") estimé à
1,11, ce qui signifie que le Fulfulde nigérian nécessite en moyenne 1,11 fois plus d’octets en
encodage UTF-8 que l’anglais pour un contenu équivalent. Ainsi, bien que Goldfish ne vise pas
à concurrencer les grands modèles de langue (LLM) dans les langues riches en ressources, il
constitue une référence pertinente pour l’étude et le traitement des langues faiblement dotées
comme le Fulfulde. [8]

 Modèle sur Hugging Face : [Link]

Le tableau suivant est un résumé de ce qui précède

Projet Langue ciblée Modèle utilisé Approche

Diverses langues mBART,


Masakhane Fine-tuning complet
africaines BLOOM

AfroLM 23 langues africaines RoBERTa Multilingue, entraînement mixte

BLOOM- QLoRA avec datasets JW300 &


Bambara, Wolof, etc. BLOOM 7B
Afrique Bible

Table 3. 1 resumé des projet existant

3.3. Langues africaines et ressources linguistiques

L’Afrique est le continent avec la plus grande diversité linguistique au monde, comptant plus
de 2 000 langues vivantes réparties entre quatre grandes familles : afro-asiatique, nilo-
saharienne, nigéro-congolaise et khoïsan. Cette richesse culturelle et linguistique est toutefois

36
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
peu représentée dans les technologies modernes, notamment les systèmes d’intelligence
artificielle et les modèles de traitement du langage naturel (TALN).

3.3.1. Contexte linguistique de l’Afrique

Les langues africaines dites "à faibles ressources" sont celles pour lesquelles il existe peu ou
pas de :

 Corpus textuels numériques,


 Outils de traitement linguistique (tokenizers, POS taggers, etc.),
 Données annotées pour l’apprentissage machine.

3.3.2. Le cas particulier du Fulfulde (Pulaar)

Le Fulfulde, aussi appelé Pulaar, est une langue de la famille nigéro-congolaise, parlée par
plus de 36 millions de personnes à travers l’Afrique de l’Ouest (Mauritanie, Sénégal, Mali,
Guinée, Cameroun, Nigeria, etc.). Elle se distingue par :

 Une forte variation dialectale selon les régions (Pulaar, Fulfulde Adamawa,
Maasinankoore...),
 Une riche morphologie (flexions verbales, conjugaison complexe),
 Un usage à l’écrit parfois limité, bien que croissant grâce aux radios, traductions
religieuses et initiatives éducatives.

Malgré son importance sociolinguistique, le Fulfulde reste largement ignoré dans les LLMs
multilingues, ce qui rend nécessaire son intégration via le fine-tuning.

3.3.3. Ressources existantes pour le Fulfulde

Voici les principales certaines ressources disponibles qui peuvent servir de base pour le fine-
tuning d’un LLM en Fulfulde généralement :

Ressource Description Lien / Référence

JW300 (Fulfulde) Corpus parallèle multilingue (bible) JW300 - OPUS

37
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________

Masakhane Traductions Pulaar collectées


Masakhane GitHub
Corpus communautairement

RFI Fulfulde Articles d’actualité traduits [Link]/fulfulde

[Link] Traductions religieuses [Link]/fr/versions/fulfulde

Wikipedia
Contenu encyclopédique limité [Link]
Fulfulde

AfroLID Dataset pour identification de langue AfroLID - Meta AI

OSCAR Fulfulde Corpus multilingue dérivé du web OSCAR Corpus

Table 3. 2 ressources existants

Les ressources présentées dans ce tableau ne peuvent pas toutes être utilisées dans le cadre de
notre projet, qui se concentre exclusivement sur le Fulfulde tel qu’il est parlé en Mauritanie. En
raison de la diversité linguistique de cette langue à travers les régions, exploiter l’ensemble de
ces données risquerait de produire un modèle trop généraliste, ce qui irait à l’encontre de notre
objectif de spécialisation locale.

3.3.4. Enjeux de traitement automatique pour le Fulfulde


Nous citerons ici les enjeux de traitement de cette langue dans le cadre de notre projet :
a. Normalisation orthographique

 Multiples alphabets (latin, arabe ajami)


 Variations d'écriture selon les pays

b. Manque de corpus annotés et Faible représentation dans les LLMs

 Peu de données étiquetées pour des tâches comme NER, classification, QA


 Très peu de tokens Fulfulde dans les vocabulaires BPE ou SentencePiece préentraînés

c. Tokenisation difficile

 Langue agglutinante → mots longs complexes à découper


 Problèmes de segmentation en absence de dictionnaire

38
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________

3.3.5 Illustration de la chaîne de traitement


Cette Illustration donne une vue générale des étapes à suivre successivement pour obtenir un
LLM pouvant générer du contenue en fulfulde.

figure 3. 4 Illustration de la chaîne de traitement

En résumé Le Fulfulde, langue transfrontalière majeure en Afrique de l’Ouest, représente un


cas emblématique des langues sous-représentées dans les technologies modernes. Ce projet de
fine-tuning s’inscrit dans une volonté de combler cette lacune, en rendant les modèles de
langage plus inclusifs, adaptés et accessibles aux locuteurs de cette langue nous allons dans
la section suivante présenté la solution que nous avons proposé.

39
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.4 Solution Proposée

Pour répondre efficacement à la problématique définie précédemment, nous avons choisi une
solution technologique centrée autour de la technique dite de fine-tuning des modèles de
langage à grande échelle (LLM) existants, spécialement conçue pour la langue Pulaar/Fulfulde.
Concrètement, la solution proposée consiste à adapter finement des modèles de langage pré-
entraînés, tels que Qwen2.5-0.5B et Bloom560M, à partir de corpus spécifiquement construits
et préparés en Pulaar.

Cette approche, largement reconnue dans la communauté du TALN (Traitement Automatique


du Langage Naturel), consiste à réutiliser des modèles ayant acquis une compréhension
linguistique générale sur de vastes corpus multilingues, puis à les spécialiser davantage en
utilisant des données linguistiques ciblées. Cette spécialisation permet au modèle d'acquérir une
meilleure maîtrise des particularités lexicales, syntaxiques et sémantiques du Pulaar.

3.4.1 Méthodologie Adoptée

L’identification des défis et la mise en place de solutions appropriées n’ont pas été des tâches
aisées. Certains problèmes ont nécessité un temps considérable avant d’aboutir à des réponses
concrètes. Sans ces solutions, le projet aurait difficilement pu progresser, d’autant plus que
certains obstacles rencontrés étaient inédits dans le domaine de l’intelligence artificielle, ou du
moins, aucune référence pertinente n’a pu être trouvée sur le Web.

a. Collecte et Prétraitement des Données

Pour obtenir un modèle LLM performant en Fulfulde, nous devons passer par plusieurs étapes
essentielles, notamment la collecte et le prétraitement des données textuelles. Cependant, ces
étapes comportent de nombreux défis, surtout pour une langue à faible ressource comme le
Fulfulde.

Défis liés à la collecte de données :

 Peu de sources disponibles en Fulfulde :


Les ressources en ligne contenant du texte en Fulfulde sont rares. Par exemple, les sites
web ou les livres disponibles en Fulfulde représentent souvent des volumes de données

40
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
très réduits, généralement entre 2 et 10 MB. Atteindre un volume de 1 GB de données
nécessite donc de diversifier les sources.
 Sites non scrappables directement :
Certains sites pertinents, comme RFI Fulfulde, ne permettent pas un scraping direct à
cause de leur structure ou de leurs restrictions d'accès.
 Problèmes d'extraction de texte depuis les PDF :
Les livres disponibles sont souvent en format PDF, mais beaucoup ne sont pas
normalisés pour permettre une extraction de texte efficace via les bibliothèques OCR
classiques. De plus, une grande partie des documents sont en format physique, ce qui
implique de les photographier page par page pour ensuite appliquer un traitement OCR
et extraire leur contenue.
 Manque de prise en charge par les outils OCR existants :
Les logiciels OCR gratuits ne prennent généralement pas en charge la langue Fulfulde.
Même les outils qui prennent en charge des langues africaines proches (comme le
Bambara ou l’Haoussa) rencontrent des difficultés avec les spécificités linguistiques du
Fulfulde.
 Risques liés à l’augmentation de données (data augmentation) :
L'augmentation des données en utilisant un petit volume de texte initial peut conduire à
une génération répétitive ou incohérente, compromettant ainsi la diversité et la qualité
du corpus.

Solutions proposées :

 Génération de nouvelles phrases avec Markovify :


Pour pallier le manque de volume de données, nous avons utilisé la bibliothèque
Markovify pour générer de nouvelles phrases à partir des 35 MB de données déjà
collectées (provenant des sites web, livres, etc.). Cette approche nous a permis de
produire environ 5 MB de nouvelles données textuelles, sans trop influencé ensuite les
modèles fine-tuné.
 Outils de scraping alternatifs :
Pour les sites non accessibles directement via le scraping classique, nous avons exploré
des techniques telles que L’enregistrement local des pages web complètes pour
SCRAPPER le contenu de manière dynamique sans restrictions.

41
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
 OCR pour langues africaines similaires :
Pour traiter les livres en PDF(en image , ou numérique), nous avons testé des outils
OCR prenant en charge des langues africaines voisines (comme le Bambara ou le
Haoussa) qui utilisent des alphabets similaires au Fulfulde. Cette approche a permis
d'extraire du contenu textuel avec un taux de précision acceptable.
 Génération logique de phrases :
Nous envisageons de développer un générateur de phrases plus sophistiqué que
Markovify, capable de produire des phrases plus cohérentes et plus pertinentes en
combinant des modèles de séquence et des approches statistiques. Ce générateur nous
comptons dans le futur le rendre comparable avec le LLM dans le domaine de génération
du texte.

b. Choix et Fine-tuning du Modèle

Le choix du modèle à fine-tuner dépend en grande partie des ressources matérielles disponibles,
notamment des GPU. En effet, le fine-tuning d'un modèle LLM de grande taille nécessite des
capacités de calcul significatives, ce qui constitue un défi majeur.

Défis liés au fine-tuning :

 Coût élevé des ressources GPU :


Les environnements comme Google Colab Pro+ offrent des GPU performants mais à
un coût élevé. De plus, selon la taille des données, le fine-tuning peut durer de quelques
heures à quelques jours.
 Optimisation du temps d'entraînement

 Gestion de la mémoire GPU

Solutions proposées :

 Faire un fine tuning complet en première phase pour adapter le modèle à fulfulde en
utilisant des données réduites

 Utilisation de LoRA et QLoRA en deuxième phase pour le fine-tuning :


Ces techniques permettent de faire du fine-tuning efficace avec des ressources limitées
42
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
en ne mettant à jour que certaines couches du modèle. Cela réduit considérablement la
consommation de mémoire et le temps d'entraînement.
 Pour les modèles volumineux comme Qwen2.5-0.5B, nous avons adopté des techniques
de quantification (FP16 ou int8) afin de réduire l'empreinte mémoire.
 Optimisation des hyperparamètres :
Nous avons réglé des paramètres critiques comme le taux d'apprentissage, le nombre
d'époques et la taille du batch pour équilibrer la précision du modèle et le temps de
convergence.
 Sauvegarde et reprise des entraînements :
Pour éviter des pertes de temps en cas de coupure, nous avons mis en place des points
de sauvegarde réguliers et des mécanismes de reprise d'entraînement.

c. Tokenisation

 Création d'un tokenizer spécifique basé sur l’approche BPE (Byte-Pair Encoding)
adaptée à la langue Pulaar. Ce tokenizer permet une meilleure segmentation des mots et
des expressions courantes spécifiques au Pulaar, facilitant ainsi l’apprentissage du
modèle.
 Fixation optimale du vocabulaire de 30k de tokens: après analyse des corpus, un
vocabulaire adapté a été défini pour couvrir efficacement la richesse linguistique tout
en limitant la taille pour optimiser les performances.

d. Validation et Évaluation

 Évaluation des résultats finaux selon plusieurs métriques précises telles que la
perplexité, la cohérence linguistique, la précision dans la génération, et la pertinence
contextuelle.

3.4.2 Architecture et Technologies Utilisées

L’architecture technique retenue repose sur les éléments suivants :

 Modèles pré-entraînés : Qwen2.5-0.5B et Bloom560M, sélectionnés pour leur facilité


d’adaptation, leurs performances reconnues dans diverses tâches de génération
linguistique et leurs paramètres relativement faible de quelques millions.

43
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
 Framework d’entraînement : Hugging Face Transformers avec PyTorch pour assurer
une implémentation efficace, robuste et facilement reproductible.
 Plateforme de calcul : Google Colab avec utilisation de GPU pour permettre un
entraînement rapide et efficace des modèles.
 Technologie de tokenisation : Hugging Face Tokenizers avec la méthode Byte-Pair
Encoding (BPE), spécialement configurée pour la langue Pulaar.

3.4.3 Avantages et Innovation de la Solution

L'originalité de notre approche réside dans la combinaison de techniques de génération de


données (Markovify) et de fine-tuning optimisé (LoRA et QLoRA) pour une langue à faible
ressource et avec des diversités linguistiques. Nous avons également innové en explorant des
outils OCR alternatifs pour pallier les lacunes des logiciels traditionnels dans le contexte du
Fulfulde.

 Nettoyage approfondi des données collectées : élimination des doublons, des erreurs
typographiques, des caractères spéciaux non compatibles avec l’encodage UTF-8.
 Normalisation linguistique : harmonisation orthographique et vérification linguistique
par des experts en Pulaar pour garantir une qualité optimale des données d'entraînement.

En résumé, la solution proposée est une approche innovante et adaptée, combinant des
techniques modernes de TALN à des corpus spécifiquement conçus pour le Pulaar/Fulfulde.
Cette approche méthodologique structurée offre une réponse concrète et viable aux défis posés
par la sous-représentation de cette langue dans les technologies numériques modernes.

3.4.4. Illustration du workflow


La figure suivante est une illustration du workflow suivie d’une manière globale du processus
de fine-tuning

44
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________

figure 3. 5 processus de fine tuning

Le fine-tuning constitue une méthode puissante pour adapter les LLMs à des langues africaines
sous-représentées. Grâce aux méthodes légères comme LoRA et QLoRA, il est désormais
possible de réaliser cette adaptation avec des ressources limitées, tout en obtenant des résultats
significatifs. Cela ouvre la voie à une intelligence artificielle plus inclusive, linguistiquement
équitable et culturellement respectueuse.

3.5 Planning de Réalisation

Le projet est structuré en cinq grandes phases distinctes, chacune ayant un rôle précis dans la
réalisation finale des objectifs visés

3.5.1 Phases du Projet

Phase 1 : Recherche et Collecte des Données (4 semaines)

 Identification et collecte des corpus textuels en Pulaar provenant de différentes sources


: RFI Fulfulde,NLLB, Wikipedia Pulaar, transcriptions d'émissions radio et documents
digitalisés.
 Collaboration avec des linguistes pour valider l’authenticité et la pertinence des données
collectées.

45
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Phase 2 : Prétraitement et Préparation des Corpus (2 semaines)

 Nettoyage approfondi : élimination des doublons, correction orthographique,


suppression des données non pertinentes.
 Segmentation du texte, normalisation linguistique, création d’un corpus structuré et
homogène pour l’entraînement.
 Création et validation d’un tokenizer adapté à la langue Pulaar/Fulfulde.

Phase 3 : Fine-Tuning des Modèles LLM (4 semaines)

 Configuration des environnements de travail (Hugging Face, PyTorch, Google Colab).


 Application des techniques de LoRA et QLoRA sur les modèles Qwen2.5-0.5B et
Bloom560M.
 Optimisation minutieuse des hyperparamètres tels que le taux d'apprentissage, le
nombre d’époques, la taille du batch, ainsi que le gradient accumulation, drop out etc.

Phase 4 : Évaluation et Optimisation (2 semaines)

 Tests rigoureux des modèles entraînés à l’aide des métriques comme la perplexité, la
cohérence linguistique, et la précision dans les tâches de génération de texte.
 Comparaison des résultats obtenus par les différents modèles afin de sélectionner le
modèle optimal.
 Itérations supplémentaires si nécessaire, en fonction des résultats préliminaires obtenus.

Phase 5 : Documentation et Valorisation des Résultats (2 semaines)

 Rédaction complète du rapport final incluant l’ensemble des démarches, résultats


obtenus, limites rencontrées, ainsi que des recommandations pour des améliorations
futures.
 Préparation des supports de présentation (diaporama, graphiques et figures explicatives)
pour valoriser efficacement les résultats devant les encadrants académiques et
professionnels.
 Rédaction d’un article scientifique et présenter les résultats obtenus.

46
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.5.2 Gestion des Risques

Pour anticiper les éventuels problèmes pouvant survenir durant la réalisation du projet, nous
avons identifié les risques principaux suivants, ainsi que les stratégies d’atténuation adaptées :

Impact
Risque identifié Stratégie d’atténation
potentiel

Diversification des sources, OCR, mobilisation de


Manque de données
Élevé linguistes pour produire du contenu, Data
pertinentes en Pulaar
augmentation.

Difficultés techniques Tests préliminaires fréquents, formation préalable sur


Moyen
liées au fine-tuning LoRA/QLoRA

Limitation des ressources Optimisation du temps de calcul, utilisation de


Moyen
matérielles (GPU) techniques de quantification QLoRA

Retard dans la validation Collaboration étroite avec les linguistes, anticipation


Moyen
linguistique du calendrier des validations

Table 3. 3 Gestion des Risques

Cette planification détaillée permet d’assurer une conduite rigoureuse et efficace du projet tout
en minimisant les imprévus, favorisant ainsi la réalisation optimale des objectifs initialement
fixés.

3.6 Conclusion

Ce chapitre nous a permis de poser les bases nécessaires à la mise en œuvre de notre projet. À
travers l’étude des projets existants tels que Masakhane, AfroLM et BLOOM, nous avons pu
identifier les approches pertinentes ainsi que les limites rencontrées dans le traitement des
langues africaines. L’analyse du contexte linguistique du Fulfulde, de ses particularités et des
ressources actuellement disponibles, a mis en évidence les défis spécifiques liés à son
traitement automatique.

Sur cette base, nous avons formulé une solution adaptée au contexte mauritanien, en
proposant le développement d’un modèle de génération de texte en Fulfulde. Nous avons

47
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
détaillé la méthodologie envisagée, les choix technologiques, ainsi que les innovations que
notre solution entend apporter.

Le chapitre suivant sera consacré à la phase de réalisation concrète de cette solution, à sa mise
en œuvre technique, ainsi qu’aux expérimentations menées et aux résultats obtenus.

48
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Chapitre 4 Résultats et expériences

Chapitre 4 Résultats et expériences .......................................................................................... 49


4.1 Introduction .................................................................................................................... 50
4.2. Collecte des données ..................................................................................................... 50
4.2.1 Sources de données et méthodes de collecte ........................................................... 50
4.2.2 Distribution des données par source........................................................................ 51
4.3. Data Preprocessing ........................................................................................................ 52
4.4 Tokenisation ................................................................................................................... 53
4.4.1 Résultats de la tokenisation avec les modèles testés ............................................... 54
4.4.2 Nécessité de développer un tokenizer spécifique pour le Fulfulde ......................... 58
4.4.3 Formation du Tokenizer Fulfulde BPE ................................................................... 58
4.5. Choix du Modèle ........................................................................................................... 59
4.5.1 Résultats après fine-tuning ...................................................................................... 61
4.5.2 Choix final ............................................................................................................... 63
4.6 Resultat Final.................................................................................................................. 65
4.7 Conclusion ...................................................................................................................... 69

49
Chapitre 4 Résultats et expériences
__________________________________________________________________________
4.1 Introduction
L’objectif principal de ce chapitre est de présenter nos expériences menées dans le cadre de
l’adaptation de modèles de langage de grande taille (LLM) au Fulfulde Mauritanien, ainsi
nous avons analyser les résultats obtenus. Après avoir décrit les sources des données et la
méthodologie de fine-tuning appliquée aux corpus multilingues, nous évaluons les
performances des modèles, à l’aide de métriques de perplexité.

Dans ce chapitre nous allons également mettre en lumière les limites rencontrées lors de ce
travail expérimental, telles que la rareté des données de qualité, les particularités linguistiques
non codifiées, ou encore les contraintes matérielles liées à l'entraînement de modèles à grande
échelle. Les résultats obtenus ouvrent néanmoins des perspectives intéressantes pour la
promotion et la préservation numérique des langues locales à travers les technologies
d’intelligence artificielle.

4.2. Collecte des données

La collecte des données est une étape essentielle pour le fine-tuning des modèles de langage,
en particulier pour des langues peu représentées comme le Fulfulde. Nous avons collecté des
données provenant de plusieurs sources afin d'atteindre un total de 35 Mo de données brutes,
qu’on nommera ici data3 Cependant, cette tâche n’a pas été exempte de défis, notamment en
raison de la difficulté à extraire certaines données de livres en raison du manque d’outils OCR
adaptés pour la langue Fulfulde.

4.2.1 Sources de données et méthodes de collecte

Les sources utilisées pour collecter les données sont variées et comprennent des sites web, des
livres au format PDF, des sources en ligne spécialisées dans le Fulfulde, ainsi que des données
publiques téléchargées. Nous avons utilisé plusieurs méthodes pour récupérer ces données,
telles que le scraping, l’extraction de texte et le téléchargement direct.

Voici un résumé des sources et des méthodes utilisées pour collecter les données :

Sources Méthodes Type Quantité


RFI Fulfulde Scraping Site web 2.6 KB
Livre en PDF Extraction de texte Livre numérique 2.5 MB

50
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Sources Méthodes Type Quantité


Site Pulaar Org Scraping Site web 9.6 MB
Mauritian Data Téléchargement Données publiques 33 KB
RH Data Téléchargement Données publiques 4 MB
NLLB Téléchargement Données publiques 12.9 MB
Dewtefulfulfe Extraction de texte Livre numérique 2.9 MB
Autres Divers Divers 2 MB
Data Augmentation Markovify Génération 5 MB
Table 4. 1 les données que nous avons recollter

4.2.2 Distribution des données par source

Le graphique suivant montre la répartition des différentes sources de données utilisées pour ce
projet de fine-tuning. On peut observer que la majorité des données provient de sources
externes, telles que le NLLB (31.2%) et Data Augmentation (12.1%), suivies par RFI
Fulfulde (6.5%) et des sources spécifiques à la Mauritanie et au Pulaar.

51
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 1 distribution des donné par sources

4.3. Data Preprocessing


Le processus de data preprocessing est crucial pour garantir que les données sont prêtes à être
utilisées dans le fine-tuning des modèles. Ce nettoyage permet de rendre les données plus
représentatives du type de texte que nous souhaitons générer. Voici un aperçu du processus de
nettoyage effectué :

1. OCR et détection de caractères : Certains caractères en Fulfulde, comme le "ɓ",


étaient mal interprétés par les outils OCR, où le caractère "6" était souvent détecté à la
place. Nous avons créé un script Python pour remplacer ces erreurs. Par exemple :

 Si un "6" ou deux "6" sont encadrés par des caractères alphabétiques, ils sont remplacés
par "ɓ".

52
Chapitre 4 Résultats et expériences
__________________________________________________________________________
 Exemple : "to66e" devient "toɓɓe".
 Si un "6" est suivi ou précédé directement d'autres caractères sans espaces, il est
remplacé par "ɓ".
 Exemple : "6etirɗe" devient "ɓetirɗe".

2. Suppression des lignes répétées : Pour le dataset NLLB, nous avons téléchargé un
total de 1 511 027 lignes contenant des phrases longues et courtes. Après suppression
des doublons, il ne restait que 233 127 lignes, soit environ 15% du dataset original.
3. Nettoyage des données : Toutes les lignes contenant uniquement des chiffres ou des
mots isolés ont été supprimées. Ces lignes n'apportaient pas de valeur significative pour
le fine-tuning.
4. Prétraitement des données : Après ces étapes de nettoyage, nous avons rassemblé
toutes les données dans un seul fichier .txt pour simplifier le processus d'entraînement
du modèle. De plus, des techniques d'augmentation de données ont été utilisées grâce à
Markovify, qui nous ont permis de générer 5 Mo de données supplémentaires à partir
des 35 Mo collectés.

4.4 Tokenisation

La tokenisation est une étape cruciale dans le traitement du langage naturel, permettant de
découper un texte en unités plus petites appelées tokens. Dans ce projet, nous avons testé
plusieurs tokenizers pour observer leur comportement avec la langue Fulfulde et leurs
performances dans la génération de texte. Nous avons utilisé les modèles suivants pour effectuer
la tokenisation : Bloom, DeepSeek, NLLB-600, et Qwen.

Le tableau suivant presente les Tokenizer que nous avons tester et leur Vocab size, qui reprenste
le nombre de Tokens reconnu par chaque Tokenizer :

Tokenizer Taille du vocabulaire


NLLB 600M 2 256 206 tokens
DeepSeek R1 3 129 280 tokens

2
[Link]
3
configuration_deepseek.py · deepseek-ai/DeepSeek-R1 at main

53
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Bloom 560M 4 250 680 tokens
Qwen 2.5 0.5B 5 151 646 tokens
Table 4. 2 Taille du vocabulaire

Ces tokenizer varie selon l’architecture du modèle et les langues ciblées. Par exemple, NLLB-
200, conçu pour la traduction multilingue, utilise un vocabulaire plus large (256 206 tokens),
tandis que DeepSeek-R1 se situe à 129 280 tokens, optimisé pour la performance sur du texte
généraliste. Ces différences influencent la capacité du modèle à traiter des langues variées et à
comprendre des structures lexicales spécifiques.

4.4.1 Résultats de la tokenisation avec les modèles testés

Pour évaluer les résultats des Tokenizer des modèles mentionner précédemment, Nous avons
commencé par charger tous les Tokenizer des modèles

Figure 4. 2 Chargement des différents Tokenizer

Nous Allons utiliser cette phrase provenant du site RFI fulfulde pour tester les différents
Tokenizer :

“Ko hondum woni ñawu noppi, ko honno ngu ardata e neɗɗo e ko honno ngu rentortee ?”

Voici le résultats obtenue par le Tokenizer Bloom :

4
bigscience/bloom-560m · Hugging Face
5
2409.12186

54
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 3 Résultats de tokenisation avec le modèle Bloom

Voici le résultats obtenue par le Tokenizer Qwen 2.5 :

Figure 4. 4 Résultats de tokenisation avec le modèle Qwen

Voici le résultats obtenue par le Tokenizer NLLB de Facebook :

55
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 5 Résultats de tokenisation avec le modèle NLLB-600

Voici le résultats obtenue par le Tokenizer DeepSeek

56
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 6 Résultats de tokenisation avec le modèle DeepSeek

Nous avons constaté que résultats obtenus avec ces modèles étaient assez similaires. En effet,
la tokenisation a été mal formulée, et de nombreux mots ont été découpés en caractères
individuels, ce qui rendait leur reconstruction difficile. Cependant, un modèle s’est démarqué :
le NLLB-600, qui a montré de meilleures performances, notamment en reconnaissant certains
mots complets car il est entrainé avec des données fulfulde pour la traduction multilingue.

Exemple de résultats avec NLLB-600 :

Le modèle a correctement tokenisé certains mots comme "noppi", "honno", et


"neɗɗo", qui sont des termes importants en Fulfulde. Cela montre que le modèle a
réussi à capturer des structures lexicales pertinentes dans cette langue, bien que la
performance générale restait encore insuffisante car certains mots ont était mal
formulée, comme ‘ardata’. Ce qui nous à mener à chercher d’autres solutions à ces
insuffisances.

57
Chapitre 4 Résultats et expériences
__________________________________________________________________________
4.4.2 Nécessité de développer un tokenizer spécifique pour le Fulfulde

Face aux limitations que nous avons observées avec les tokenizers préexistants, nous avons
décidé de développer notre propre tokenizer pour le Fulfulde, que nous avons appelé le
Tokenizer Fulfulde BPE. Cette décision a été motivée par les résultats insatisfaisants des
tokenizers existants, qui découpaient les mots de manière incohérente.

4.4.3 Formation du Tokenizer Fulfulde BPE

Pour créer ce tokenizer spécifique, nous avons utilisé les données collectées précédemment,
avec un vocabulary size de 30 000. L’entraînement du modèle a été réalisé sur les données
textuelles du Fulfulde, avec des techniques d’apprentissage comme le Byte Pair Encoding
(BPE), qui permet de mieux capturer les structures morphologiques des mots.

Le choix d'un vocabulary size de 30 000 pour notre Tokenizer Fulfulde BPE repose sur
l'optimisation entre performance et complexité. Un vocabulaire plus petit aurait conduit à une
découpe excessive des mots, tandis qu'un vocabulaire trop grand aurait augmenté les ressources
computationnelles nécessaires. Cette taille permet une couverture suffisante des mots fréquents
et des variations morphologiques en Fulfulde, tout en étant adaptée à notre corpus de données
de 35 Mo. Ce choix est également soutenu par des études sur des langues à faibles ressources,
qui montrent qu'un vocabulary size de 30 000 à 50 000 tokens est efficace pour la génération
de texte et d'autres tâches NLP dans des contextes similaires. Ce compromis entre richesse
lexicale et efficacité est crucial pour optimiser les performances du modèle dans notre cas
spécifique.6

Voici l'illustration des résultats obtenus avec notre nouveau tokenizer :

Comme le montre l'image ci-dessous, la tokenisation avec le Tokenizer Fulfulde BPE produit
des tokens plus structurés et mieux adaptés aux particularités du Fulfulde. Les mots sont
maintenant mieux reconnus et préservés dans leur intégrité, ce qui améliore la qualité de la
génération de texte.

En utilisant notre Tokenizer Fulfulde BPE, nous avons pu obtenir des résultats nettement
meilleurs que ceux des modèles testés précédemment. Voici un exemple de la tokenisation

6
[1508.07909] Neural Machine Translation of Rare Words with Subword Units

58
Chapitre 4 Résultats et expériences
__________________________________________________________________________
pour le texte suivant :
“Ko hondum woni ñawu noppi, ko honno ngu ardata e neɗɗo e ko honno ngu rentortee ?”

Figure 4. 7 Résultats de tokenisation avec Tokenizer fulfulde BPE

En résumant ce qui précède, les tests ont montré que, bien que certains modèles comme NLLB-
600 aient donné de bons résultats pour certains mots, les tokenizers généraux ne sont pas
suffisants pour gérer efficacement les spécificités du Fulfulde. Cela justifie pleinement la
création d’un tokenizer sur mesure, comme le Tokenizer Fulfulde BPE, qui a permis
d’améliorer significativement la qualité de la tokenisation, rendant le processus plus adapté à
notre projet.

4.5. Choix du Modèle

Dans le cadre de notre projet, notre choix du modèle a été guidé principalement par les
contraintes matérielles, notamment l'absence de GPU performants. Pour cette raison, nous
avons opté pour des modèles de taille modeste, contenant moins de 1 milliard de paramètres,
afin de faciliter l’entraînement et de réduire la consommation de ressources tout en maintenant
une performance acceptable.

59
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Nous avons ainsi retenu deux modèles adaptés à ces critères : Qwen 2.5 (0.5B) et Bloom
(560M). Ces modèles ont été sélectionnés pour leur popularité, leur compatibilité avec le fine-
tuning, ainsi que la disponibilité de leurs versions open-source.

Pour évaluer leurs performances respectives, nous avons réalisé un fine-tuning complet (Full
Fine-Tuning) de ces deux modèles sur un même corpus, que nous appellerons data1 13MB.
Ce corpus est constitué des sources suivantes :

 Un recueil de livres en format PDF rédigés en Pulaar/Fulfulde,


 Le site Piidi Pulaar,
 Le site [Link],
 Un ensemble de textes issus de données mauritaniennes.

Nous avons appliqué les mêmes hyperparamètres pour les deux modèles afin de garantir une
comparaison équitable. Le tableau suivant résume les paramètres utilisés :

Bloom Qwen 2.5


Paramètre
(560M) (0.5B)
Learning rate 5e-1 5e-1
Batch size 4 4
Weight decay 0.01 0.01
Nombre
3 3
d'epochs
Seed 42 42

Table 4. 3 les hyper paramètres

60
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Cette image montre les hyperparametres utilisé durant fine tuning des modèles selectionné.

Figure 4. 8 les hyper paramètre de fine tuning

4.5.1 Résultats après fine-tuning

Après 3 epochs, nous avons comparé les performances des deux modèles en mesurant la
perplexité, qui est un indicateur standard dans l’évaluation des modèles de langage. Les
résultats sont les suivants :

Modèle Training Loss Perplexité


Qwen 0.9362 4765.444406166077
Bloom 1.3173 10632.785768771171
Table 4. 4 resultats de fine tuning

Pour une évaluation plus approfondie, nous avons également testé la perplexité des modèles en
les exposant à 100 phrases issues du corpus RFI Fulfulde, qui n’étaient pas incluses dans
l’ensemble d’entraînement. L’objectif était de vérifier la capacité de généralisation des modèles
à des données inédites, proches du domaine ciblé.

L’image suivante et un diagramme contenant la perplexité moyenne de modèles fine tuné :


Qwen (model 1) et Bloom (model 2) :

61
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 9 diagramme de perplexity

En plus des métriques quantitatives, nous avons effectué une analyse qualitative des
générations de texte, à partir de prompts extraits du corpus, afin d’observer la cohérence, la
fluidité, et la qualité de la langue générée. Un extrait du tableau comparatif des générations
(prompt, sortie du modèle, traduction humaine) est présenté ci-dessous :

62
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Prompt Generation/transaltion qwen Generation / translation Bloom


Afrik worgo ina Afrik worgo ina waɗi 11 Afrik worgo ina waɗi 11 ɗemngal
waɗi 11 ɗemngal ɗemngal ngenndiwal, e nder ngenndiwal, tee ina leefi no feewi.
ngenndiwal capanɗe jeegom ɗemɗe E hitaande 18 2ɓ, ɗemɗe
keewɗe ( 32 ) ɗe ɗemɗe /
keewɗe ƴellitoo, yeru to
Senegaal. /
L'Afrique du Sud compte 11
langues nationales, et sur
vingt langues multilingues
(32) se développent, par
exemple au Sénégal.
Yeewtere men Yeewtere men hannde faati Yeewtere men hannde ko " vo laa,
ko e alhaali VIH / Sida. kaawise : 22 22
/ /
Notre discussion Notre conversation d'aujourd'hui
d’aujourd’hui porte sur le est " vo laa, wonder :
VIH/SIDA.
ñannde 9 lewru ñannde 9 lewru 1 ɓuru 2025, ñannde 9 lewru ut e hitaande 18 42.
o ƴetti kuule ñiiɓɗe /
/ le 9 août 18 42.
le 9 janvier 2025, il a pris des
mesures strictes

Table 4. 5 des exemple du texte générer

4.5.2 Choix final

À la lumière de ces résultats, nous avons décidé d’adopter le modèle Qwen 2.5 (0.5B) comme
modèle de référence pour notre projet. En effet, il présente une meilleure perplexité et une
qualité de génération plus satisfaisante que Bloom dans notre contexte spécifique. Nous avons
donc poursuivi le fine-tuning de ce modèle avec d’autres corpus, notamment data3, pour les
tâches de génération de texte.

63
Chapitre 4 Résultats et expériences
__________________________________________________________________________

Figure 4. 10 le courbe de fine tuning de Qwen avec Data3

Après que nous avons analyser ces courbes nous avons interpréter ce qui suit :

 La perte d'entraînement (train/loss) diminue de manière régulière, avec une chute


nette vers 45k étapes, traduisant une bonne convergence du modèle.
 La perte de validation (eval/loss) suit une tendance similaire, atteignant un plateau
autour de 2.1, ce qui indique une capacité de généralisation satisfaisante malgré un
volume de données restreint.
 La norme des gradients (grad_norm) augmente vers la fin, reflétant une
intensification de l’apprentissage et des ajustements plus sensibles des poids du modèle.

64
Chapitre 4 Résultats et expériences
__________________________________________________________________________
 Enfin, le modèle a été entraîné sur 3 époques, ce qui montre une couverture suffisante
du corpus pour permettre une stabilisation des performances.

4.6 Resultat Final

Le Qwen 2.5 (0.5B), affiné avec data3 sur 3 Epochs ce modèle que nous appellerons Fulfulde
LLM, a atteint une perplexité finale de 84 dans les taches de « text génération » pour 100
phrases différente, ce qui confirme sa pertinence pour nos objectifs.

Modèle Perplexité
Qwen 2.5 first 4765.444406166077
Fulflde LLM 84
Bloom560 10632.785768771171

65
Chapitre 4 Résultats et expériences
__________________________________________________________________________

figure 3. 6 comparaison de perplexity

Qwen 2.5 first : c’est le modèle Qwen 2.5 0.5B fine tuné avec data1

Fulflde LLM : c’est le modèle Qwen 2.5 0.5B fine tuné avec data3

Bloom560 : c’est le modèle Bloom560 fine tuné avec data1

Pour effectuer une évaluation plus globale, nous avons comparé notre modèle de complétion de
texte en Fulfulde avec d'autres modèles capables de traiter cette langue, identifiés dans la partie
dédiée à l’étude de l’existant. Cette comparaison repose sur la métrique de perplexité,
couramment utilisée pour évaluer la qualité des modèles de langage.

Les données de teste utilise ici sont ceux provenant de RFI fulfulde contenant 10113 phrases
courtes et longues

66
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Les

La figure ci-dessus illustre cette comparaison.


On y observe que notre modèle spécialisé obtient une perplexité de 30.76, ce qui traduit une
très bonne capacité à prédire les séquences en Fulfulde. En revanche, les modèles
multilingues comme Goldfish (fuv_latn_full) et BloomZ affichent respectivement des
perplexités de 516.15 et 967.75, traduisant une performance nettement inférieure.

Malgré un volume d’entraînement relativement limité (environ 35 Mo de données), notre


modèle de complétion de texte en Fulfulde a démontré des performances nettement supérieures
à celles des modèles multilingues existants tels que BloomZ et Goldfish, comme en témoigne
sa perplexité très faible de 30.76. Cette performance souligne l'efficacité d'un fine-tuning ciblé
même sur un corpus restreint, lorsqu’il est adapté à la langue en question.

Prompt Texte généré Traduction Google translate


Ko haani wonnde darnde Ko haani wonnde darnde Les femmes devraient-elles
rewɓe ko yowitii e reenugol rewɓe ko yowitii e ree nugol avoir un rôle à jouer dans la
taariindi ndii? taariindi ndii ? no ɗum waawi protection de
naw toraade walla wa ɗugol l'environnement ? Comment
ren doo ji mum . Hannde cela peut-il conduire à la
toɓɓere men ndee ana fawii e torture ? Aujourd'hui, nous
dow nguurndam ɓee sukaaɓe abordons la vie de ces enfants

67
Chapitre 4 Résultats et expériences
__________________________________________________________________________
afriknaaɓe ɓe jam e kisal africains en paix et en
ngon e mum en , ko holno ɓe sécurité. Comment ont-ils
haa naa haɓi reede ngam hi lutté pour sauver leur vie ? Si
wude di p loo m ti maɓɓe ? la communauté était là,
No woodi renndo ngoo , aujourd'hui, le
hannde no woodi kadi e développement du pays est
ɓamtaare leydi ndii également en jeu.
Ko taskaramji Cellal ko Ko taskaram ji Cellal ko Le programme Santé,
Ngalu e Dinngiral rewɓe Ngalu e Din ngiral rewɓe Richesse et Religion des
cuɓiɗen artirde ndee yontere cuɓi ɗen artirde ndee yontere Femmes a choisi de revenir
to Gine Bisaawo . E nder cette semaine en Guinée
yewtere men en kaalan fii ɗii Bissau. Dans notre interview,
fitinaaji wa ɗuɗi e nder Mali nous parlerons des nombreux
, Burkina Faso , Niijeer e conflits au Mali, au Burkina
Niijeer kadi no hab bii yo ɓe Faso, au Niger et au Niger
waɗ anta fedde nde wonaa qui ont tenté de former une
laamuyankoore . Holko woni organisation non
sabu mum ? Holko ɗum gouvernementale. Quelle en
waawi battinde hannde e est la raison ? Comment cela
ngur ɗam maɓɓe ? Ngam peut-il affecter leur vie
jaabaade ɗee naamne , en aujourd'hui ? Pour répondre à
mbis moto Abdu laay ces questions, nous avons
JALLO jannginoowo ka demandé à Abdu laay
duɗal mawngal Bamako JALLO, enseignant à
ngam jokki taade sa galle l'Université de Bamako, de
walla jannde ɗemɗe poursuivre ses devoirs ou son
apprentissage de la langue
Table 4. 6 texte completion de Fulfulde LLM

Ces résultats encouragent la poursuite des travaux dans cette direction. Une amélioration future
consistera à affiner davantage le modèle à l’aide de données plus spécifiques (par exemple
dans les domaines mathématiques, éducatifs ou administratifs) afin d’étendre ses capacités
à des usages plus généraux et contextualisés. Cela permettrait de renforcer son utilité dans des

68
Chapitre 4 Résultats et expériences
__________________________________________________________________________
applications concrètes, notamment en traitement automatique du langage pour les langues
africaines à faible ressource comme le Fulfulde.

Le modèle a été déployé sur Hugging Face sous le nom AhmedBAH/DesertMind, afin d’être
accessible à tout chercheur souhaitant l’exploiter pour des travaux de recherche sur la langue
fulfulde parlée en Mauritanie.

DesertMind est notre Equipe composé de Rahma Dia, Mamadou Aw, Cheick Sidi et Ahmed BA

Figure 4. 11 model deployé hugging face

4.7 Conclusion

Ce chapitre a démontré la faisabilité d’adapter des modèles de langage de grande taille (LLM)
au fulfulde mauritanien, une langue africaine à faibles ressources, en combinant des stratégies
innovantes de collecte, de prétraitement et d’optimisation technique. Face à la rareté des
données (35 Mo de corpus final), des méthodes hybrides (OCR corrigé, augmentation par
chaînes de Markov) ont permis de pallier les lacunes initiales, tandis que le développement d’un
tokenizer BPE dédié (30k tokens) a résolu les problèmes de segmentation inhérents aux
spécificités morphologiques de la langue. L’évaluation comparative des modèles Qwen-0.5B
et Bloom-560M fine tuné avec data1 a révélé la supériorité de Qwen, avec une perplexité de
84 contre 4000 pour Bloom, validant son potentiel pour des tâches de génération contextualisée.

Le modèle Qwen2.5, fine-tuné avec le dataset Data 3 (environ 35 Mo de données en Fulfulde),


a surpassé les modèles multilingues existants tels que BloomZ et Goldfish, atteignant une

69
Chapitre 4 Résultats et expériences
__________________________________________________________________________
perplexité de 30.76. Ces résultats illustrent l’efficacité d’un fine-tuning ciblé sur une langue à
faible ressource. À terme, ce modèle sera enrichi par des données thématiques (mathématiques,
éducatives, administratives) afin d’élargir ses capacités à des usages plus généraux et
[Link] résultats, bien que limités par les contraintes matérielles et la taille réduite du
corpus, ouvrent des perspectives prometteuses pour l’inclusion des langues marginalisées dans
l’écosystème de l’IA, tout en soulignant l’impérative nécessité de concevoir des architectures
adaptées aux réalités linguistiques africaines.

70
Conclusion générale
__________________________________________________________________________

Conclusion générale
Ce travail s’inscrit dans une démarche innovante visant à adapter les technologies d’intelligence
artificielle au service des langues africaines, en particulier le Fulfulde, langue largement parlée
mais peu représentée dans le domaine numérique. À travers ce projet, nous avons exploré le
potentiel des modèles de langage à grande échelle (LLMs) et des architectures
Transformers pour répondre aux défis liés à la rareté des ressources linguistiques dans les
contextes locaux.

La démarche adoptée a permis de concevoir un pipeline complet, allant de la collecte de


données à la préparation linguistique (tokenisation spécifique), jusqu’au fine-tuning de
modèles existants. Ces étapes ont révélé la nécessité de développer des outils sur mesure,
adaptés aux spécificités morphologiques et syntaxiques du Fulfulde, et de valoriser les
ressources locales souvent dispersées ou non structurées.

Les résultats obtenus sont encourageants, démontrant qu’avec des approches méthodiques, il
est possible d'obtenir des performances significatives même dans des contextes à faible
ressource. Toutefois, plusieurs limites subsistent, notamment en termes de quantité et de qualité
des données disponibles, de complexité linguistique, et d’accessibilité technologique.

Ce projet ouvre ainsi de nombreuses perspectives. Il pourra être enrichi par l’intégration de
nouvelles sources de données, le développement d’interfaces pour un usage communautaire ou
éducatif, ainsi que l'exploration de modèles multilingues ou de techniques de transfert
interlinguistique. En cela, il contribue à la valorisation numérique des langues africaines et à
leur inclusion dans les avancées technologiques globales.

71
Bibliographie
__________________________________________________________________________

Bibliographie
[1] 25 mars 2025. [En ligne]. Available: [Link]

[2] «ultimate V2,» [En ligne]. Available: [2408.13296] The Ultimate Guide to Fine-Tuning
LLMs from Basics to Breakthroughs: An Exhaustive Review of Technologies, Research,
Best Practices, Applied Research Challenges and Opportunities. [Accès le 16 03 2025].

[3] [En ligne]. Available: [Link]


[Accès le 20 fevrier 2024].

[4] [Link] «2».

[5] «utlimatae,» [En ligne]. Available: [Link] [Accès le 24 02


2025].

[6] «Masakarad,» [En ligne]. Available: [Link] [Accès le 16 04


2025].

[7] «afroLab,» [En ligne]. Available: [Link] [Accès le 15 04


2025].

[8] [En ligne]. Available: [Link] [Accès le 15


mars 2025].

[9] p. [Link] 2017.

[10] «[1],» p. [Link]

72
Bibliographie
__________________________________________________________________________
Résumé
___________________________________________________________________________
Ce projet vise à adapter les technologies d’intelligence artificielle aux langues africaines peu
représentées, en particulier le Fulfulde. En s’appuyant sur les modèles de langage à grande
échelle (LLMs) et l’architecture Transformer, un pipeline complet a été développé : collecte
de données, création d’un tokenizer spécifique, et fine-tuning. Les résultats sont prometteurs
malgré la rareté des ressources, et ouvrent la voie à de futures améliorations, contribuant ainsi
à la valorisation numérique des langues africaines.
Mots-clés : Modèles de langage, Intelligence artificielle, Fulfulde, Langues africaines,
Traitement automatique du langage naturel, Tokenisation, Ressources faibles, Fine-tuning,
Transformers
‫الملخص‬
___________________________________________________________________________

‫ باالعتماد‬.‫ وخاصة لغة الفُلفُلدِه‬،‫يهدف هذا المشروع إلى تكييف تقنيات الذكاء االصطناعي مع اللغات اإلفريقية ذات التمثيل الضعيف‬
‫( على نماذج اللغة الضخمة‬LLMs) ‫ وهندسة‬Transformers ‫ وإنشاء‬،‫ تم تطوير سلسلة معالجة كاملة شملت جمع البيانات‬،
‫( محلل ترميز‬Tokenizer) ،‫ أظهرت النتائج فعالية مشجعة رغم ندرة الموارد‬.‫ وتكييف النماذج عبر التدريب اإلضافي‬،‫مخصص‬
‫مما يفتح آفاقًا لتطويرات مستقبلية ويسهم في تعزيز التمثيل الرقمي للغات اإلفريقية‬
‫الكلمات المفتاحية‬: ‫ اللغات‬،‫ تقسيم الكلمات‬،‫ المعالجة اآللية للغة الطبيعية‬،‫ اللغات اإلفريقية‬،‫ الفُلفُلدِه‬،‫ الذكاء االصطناعي‬،‫نماذج اللغة‬
‫ المحوال‬،‫ التدريب اإلضافي‬،‫منخفضة الموارد‬

Summary
___________________________________________________________________________
This project aims to adapt artificial intelligence technologies to underrepresented African
languages, particularly Fulfulde. Relying on large language models (LLMs) and the
Transformer architecture, a complete processing pipeline was developed, including data
collection, a custom tokenizer, and fine-tuning. The results are promising despite limited
resources, opening the door to future improvements and contributing to the digital inclusion of
African languages.
Keywords : Language models, Artificial intelligence, Fulfulde, African languages, Natural
language processing, Tokenization, Low-resource languages, Fine-tuning, Transformers
Samere
___________________________________________________________________________
Ndee eɓɓoore ina yiɗi huutoraade karallaagal kesal ngam huutoraade ɗemɗe Afrik ɗe ngalaa
ɗo kaaɗi, haa teeŋti noon e ɗemɗe Fulfulde. E tuugnaade e mbaydiiji ɗemɗe mawɗe (LLMs) e
arsitektuur Transformer, pipeline gollorde timmunde feewnaama, ina heen mooftugol dokke,
tokenizer keeriiɗo, e fine-tuning. Njeñtudi ndii ina fotnoo wonde hay so tawii ngalu nguu ina
famɗi, ina uddita damal ngam ɓamtaare yeeso, ina wallita e naatgol ɗemɗe Afrik e nder dijital.
Kelme : Modeluuji ɗemɗe, Hakkille artifisiyel, Fulfulde, ɗemɗe Afrik, Gollirde ɗemɗe tago,
Tokenization, Ɗemɗe ɗe ngalaa kaɓirɗe, Fine-tuning, Transformers.
Intitulé et adresse complète de l’entreprise :
___________________________________________________________________________
Entreprise & email : SMART MS SA & contact@[Link]
Adresse & Tél : 67 Ilot M Tevragh-Zeina, Nouakchott-Est Mauritanie & +222 46254508

73

Vous aimerez peut-être aussi