Exemple
Exemple
figure 3. 1 Masakhane 34
figure 3. 2 AfroLM paper 35
figure 3. 3 langue reconnu par AfroLM 35
figure 3. 4 Illustration de la chaîne de traitement 39
figure 3. 5 processus de fine tuning 45
figure 3. 6 comparaison de perplexity 66
Introduction générale
Dans un contexte de transformation numérique accélérée, les technologies d’intelligence
artificielle, et en particulier les modèles de langage à grande échelle (LLMs), jouent un rôle
de plus en plus central dans l’automatisation des tâches linguistiques, la traduction, le traitement
des textes, ou encore la génération de contenu. Toutefois, malgré leur performance
impressionnante dans les langues à forte ressource, leur application dans des contextes
linguistiques spécifiques, notamment les langues africaines à faible ressource comme le
Fulfulde, demeure encore très limitée.
Ce projet s’inscrit dans cette dynamique et ambitionne de combler le fossé technologique entre
les langues à fort soutien numérique et celles qui en sont dépourvues. Il a été mené au sein d'une
entreprise active dans le domaine des technologies et de la recherche des sciences des données,
avec pour objectif principal de concevoir et d’adapter un modèle de langage pour le
Fulfulde, en s’appuyant sur des techniques modernes de traitement automatique du langage
naturel (TALN), et en tenant compte des particularités linguistiques et culturelles de cette
langue.
Dans le premier chapitre, une étude détaillée du projet est présentée. Elle débute par une
présentation de l'entreprise d'accueil, de ses domaines d'activités et de l'origine du projet. Le
chapitre explore également la problématique posée, les objectifs poursuivis ainsi que le
L’objectif du projet.
Le deuxième chapitre propose un état de l’art approfondi, centré sur les modèles de langage
à grande échelle, leur évolution, leur architecture sous-jacente — en particulier les
Transformers —, leurs capacités et leurs limites. Cela permet de mieux comprendre les choix
technologiques effectués dans le cadre de ce travail.
Dans le Troisième Chapitre, une étude des projets existant et les ressources disponibles
actuellement comme ressources pour le fulfulde, la solution proposée, ainsi que le planning de
réalisation et les risques associés.
1
Introduction générale
__________________________________________________________________________
Le quatrième chapitre est consacré aux résultats expérimentaux. Il détaille les processus de
collecte de données, de prétraitement, de tokenisation, ainsi que le choix du modèle et les
résultats obtenus après fine-tuning. Une attention particulière est portée au développement d’un
tokenizer adapté au Fulfulde, une étape cruciale dans le traitement des langues peu dotées.
Enfin, ce rapport se conclut par une conclusion générale mettant en lumière les apports du
projet, ses limites, ainsi que les perspectives d’amélioration et de poursuite des travaux.
2
Chapitre 1 Etude du projet
__________________________________________________________________________
3
__________________________________________________________________________
1.1 Introduction
Dans le cadre de notre projet de fin d'étude, nous nous sommes intéressés à l'amélioration des
modèles de langage à grande échelle (LLM) pour les langues locales mauritaniennes, en
particulier le Pulaar/Fulfulde. Ces langues, bien que largement parlées en Mauritanie et dans
d'autres régions d'Afrique de l'Ouest, demeurent largement sous-représentées dans les corpus
numériques et les modèles de traitement automatique du langage naturel (TALN).
L'essor des LLM tels que Bloom, Qwen, GPT-3 et d'autres modèles basés sur l'architecture
Transformer a permis des avancées significatives en matière de génération de texte et de
compréhension du langage. Cependant, ces modèles sont principalement entraînés sur des
données provenant de langues à forte ressource comme l'anglais, le français ou l'espagnol etc.
Par conséquent, leur performance est souvent limitée lorsqu'il s'agit de traiter des langues
locales comme le Pulaar/Fulfulde.
Le projet que nous proposons vise à combler cette lacune en effectuant un fine-tuning de
modèles LLM préexistants en utilisant des corpus spécifiques en Pulaar/Fulfulde. Pour ce faire,
nous avons choisi d'utiliser des techniques avancées telles que LoRA (Low-Rank Adaptation)
et QLoRA (Quantized LoRA) afin d'optimiser les performances tout en limitant les besoins en
ressources matérielles.
Ce projet répond à un double enjeu : scientifique et social. D'un point de vue scientifique, il
permet de tester les limites de l'adaptabilité des LLM aux langues locales peu représentées. D'un
point de vue social, il contribue à la préservation et à la valorisation des langues locales, en
facilitant l'accès aux technologies numériques pour les communautés mauritaniennes et
africaines.
Ce chapitre vise à présenter le contexte dans lequel s'inscrit ce projet, en introduisant l'entreprise
d'accueil, la problématique rencontrée, les objectifs visés, la solution envisagée ainsi que le
planning de réalisation.
4
__________________________________________________________________________
1.2.1 Historique de l'Entreprise
Depuis sa création, elle est animée par un engagement inébranlable en faveur de l'excellence
technologique et de l'innovation. Ce dévouement l’a permis de devenir un partenaire de
confiance pour les entreprises locales et internationales, en fournissant des solutions de bout en
bout dans divers secteurs. Des centres de données de niveau 3 aux solutions de cloud privé en
passant par les implémentations e-Gov, elle fournit des services sur mesure qui répondent aux
besoins uniques de chaque client.
5
__________________________________________________________________________
1.2.2 Domaines d'Activité
Les domaines d’activité de Smart MS SA sont les suivants
a. IoT et automatisation
SMART permet à ces clients d’exploiter la puissance de l'IoT et de l'automatisation avec leurs
solutions connectées pour une entreprise plus intelligente.
Figure 1. 2 IOT
b. Énergies renouvelables :
Approche de Smart MS SA propose des solutions innovantes pour une énergie propre et fiable,
adaptées aux objectifs écologiques.
6
__________________________________________________________________________
d. Logiciels et plates-formes :
e. Cloud Computing :
7
__________________________________________________________________________
f. Intelligence artificielle :
SMART MS SA exploite l'IA avancée et l'analyse des données pour offrir des solutions
innovantes et des insights exploitables.
g. UI / UX :
SMART MS SA fourni des Solutions UI/UX intuitives et sur mesure, conçues pour optimiser
l'engagement et l'interaction des utilisateurs.
Figure 1. 8 UI / UX
Les modèles de langage à grande échelle (LLM), tels que GPT-3, GPT-4,DeepSeek ou
Qwen2.5-0.5B, ont révolutionné le traitement automatique du langage naturel (TALN) en
offrant des capacités avancées de génération et de compréhension de texte. Ces modèles sont
entraînés sur d'énormes volumes de données textuelles multilingues, mais leur efficacité reste
8
__________________________________________________________________________
principalement concentrée sur les langues à forte ressource comme l'anglais, le français ou
l'espagno.
En revanche, les langues locales africaines, notamment le Pulaar/Fulfulde, sont très peu
représentées dans ces corpus d'entraînement. Cela résulte en une faible précision des modèles
dans les tâches de génération et de compréhension lorsqu’ils sont appliqués à ces langues. Cette
absence de prise en charge constitue un frein majeur pour l'accès aux technologies modernes
pour les communautés locales, limitant l'utilisation d'applications telles que les assistants
vocaux, les traducteurs automatiques ou les systèmes de réponse automatisée.
En Mauritanie, le Pulaar/Fulfulde est l'une des langues nationales parlées par une part
significative de la population et en Afrique en générale. Pourtant, il n'existe actuellement aucun
modèle LLM spécifiquement optimisé pour cette langue, ce qui restreint considérablement les
possibilités d’intégration technologique au sein des communautés Pulaarophones.
L'idée de ce projet est née de la volonté d'intégrer les langues locales mauritaniennes dans les
technologies modernes. En travaillant avec des experts linguistiques et des chercheurs en
intelligence artificielle, nous avons identifié un besoin crucial : développer des modèles
capables de générer du texte et de comprendre des requêtes en Pulaar/Fulfulde de manière
cohérente et naturelle.
9
__________________________________________________________________________
Ce projet revêt une importance particulière, non seulement sur le plan technologique, mais aussi
en termes d'impact social et culturel.
Enjeux Technologiques :
Optimisation pour une langue à faible ressource : Le principal défi réside dans
l'adaptation des modèles LLM aux spécificités linguistiques du Pulaar/Fulfulde, alors
que les corpus disponibles sont limités et souvent hétérogènes en termes de qualité et
de format.
Évaluation de la performance : La performance des modèles fine-tunés devra être
évaluée avec des critères adaptés, tels que la perplexité pour la génération de texte.
Efficacité en ressources : La limitation des ressources matérielles (GPU, stockage)
nécessite l'utilisation de techniques légères comme LoRA pour réduire la charge
computationnelle tout en maintenant de bonnes performances.
10
__________________________________________________________________________
Enjeux Sociaux et Culturels :
Défis Techniques :
Impact attendu :
11
__________________________________________________________________________
1.4 Problématique
Malgré les progrès remarquables réalisés ces dernières années en traitement automatique du
langage naturel grâce aux modèles de langage à grande échelle (LLM), leur efficacité reste
fortement conditionnée par les langues sur lesquelles ils sont entraînés. Ces modèles sont
généralement optimisés pour des langues largement utilisées à l'échelle mondiale telles que
l'anglais, le français ou le chinois etc. Ainsi, les langues locales comme le Pulaar/Fulfulde,
largement parlées en Mauritanie et en Afrique de l'Ouest, restent faiblement représentées dans
les corpus d’entraînement disponibles. Cette absence ou faiblesse de données adaptées pose une
réelle difficulté dans l'utilisation des technologies modernes pour ces langues.
1.4.1 Conséquences
Faible performance des outils linguistiques : Les applications utilisant les modèles
généralistes existants ne parviennent pas à traiter efficacement le Pulaar/Fulfulde,
entraînant une qualité médiocre en génération automatique de texte, traduction et
reconnaissance vocale.
Exclusion numérique : Les locuteurs de langues locales se trouvent désavantagés dans
l'accès aux technologies avancées telles que les assistants virtuels, les outils éducatifs
numériques, et d’autres services numériques reposant sur des modèles de langage.
Risque de perte linguistique : À terme, l'insuffisance d'intégration technologique des
langues locales pourrait contribuer indirectement à leur marginalisation, voire à leur
disparition progressive au profit des langues dominantes.
12
__________________________________________________________________________
1.4.2 Hypothèses
Ces hypothèses seront validées par des expérimentations rigoureuses et par des évaluations
systématiques des résultats obtenus en génération de texte et compréhension linguistique.
Pour atteindre cet objectif global, plusieurs objectifs spécifiques ont été définis clairement :
13
__________________________________________________________________________
o Effectuer un prétraitement approfondi des données collectées en réalisant des
tâches telles que le nettoyage des textes (élimination des erreurs typographiques
et caractères spéciaux), la normalisation orthographique et la segmentation
adéquate du texte pour optimiser leur utilisation durant la phase de fine-tuning.
Objectif Spécifique 2 : Mise en œuvre des techniques avancées de fine-tuning
o Réaliser le fine-tuning des modèles de langage existants, spécifiquement
Qwen2.5-0.5B et Bloom560M, en utilisant des approches optimisées telles que
LoRA (Low-Rank Adaptation) et QLoRA (Quantized LoRA), qui permettent
une adaptation efficace tout en réduisant les ressources informatiques
nécessaires.
o Ajuster minutieusement les hyperparamètres d'entraînement (nombre d'époques,
taux d'apprentissage, taille des batchs etc) afin de maximiser les performances
tout en évitant les problèmes tels que le sur-apprentissage (overfitting) ou le
sous-apprentissage (underfitting).
Objectif Spécifique 3 : Évaluation rigoureuse des modèles fine-tunés
o Évaluer systématiquement les performances des modèles obtenus à travers des
mesures quantitatives telles que la perplexité, la précision, la cohérence
linguistique et l’adaptabilité contextuelle des générations automatiques en
Pulaar/Fulfulde.
o Comparer les résultats des différents modèles fine-tunés (par exemple Qwen2.5-
0.5B versus Bloom560M) afin d’identifier celui qui présente les meilleures
performances et la plus grande capacité d’adaptation linguistique.
Objectif Spécifique 4 : Mise à disposition et vulgarisation des résultats
o Produire une documentation claire et détaillée(Paper) destinée aux chercheurs,
développeurs et linguistes pour faciliter la reproductibilité des expériences et
encourager le développement ultérieur dans ce domaine.
o Vulgariser les résultats obtenus en proposant des applications pratiques comme
des outils de génération automatique de texte, de traduction assistée ou encore
d’aide à l’apprentissage et à la promotion de la langue Pulaar/Fulfulde.
14
__________________________________________________________________________
1.5.2 Indicateurs de Réussite
15
__________________________________________________________________________
1.6 Conclusion
Ce chapitre présente le contexte général du projet, qui vise à améliorer les performances des
modèles de langage (LLM) pour le Pulaar/Fulfulde, une langue largement parlée en Mauritanie
mais encore peu représentée dans les technologies actuelles. Il décrit l’environnement
professionnel favorable offert par l’entreprise d’accueil et identifie une problématique claire :
l’absence de ressources adaptées pour le traitement automatique du Fulfulde.
16
Chapitre 2 Etat de l’art
__________________________________________________________________________
17
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.1 Introduction
Le traitement automatique des langues naturelles (TALN) connaît depuis la dernière décennie
une évolution spectaculaire grâce à l’émergence des modèles de langage à grande échelle
(Large Language Models - LLMs). Ces modèles, tels que GPT-3, BLOOM, QWEN ou LLaMA,
sont capables de traiter, comprendre et générer du texte avec une qualité proche de celle des
humains. En s'appuyant sur des architectures neuronales complexes comme le Transformer, les
LLMs ont été entraînés sur des volumes massifs de données textuelles dans plusieurs langues,
leur conférant une capacité impressionnante à accomplir une grande variété de tâches sans
entraînement spécifique préalable.
Le fine-tuning des LLMs — qui consiste à réajuster un modèle préexistant sur des données
spécifiques à une langue, une tâche ou un domaine — apparaît comme une solution prometteuse
pour combler ce fossé. En adaptant un modèle existant à une langue africaine donnée, il devient
possible d'améliorer considérablement la qualité de ses prédictions, sa compréhension des
structures linguistiques locales et sa pertinence culturelle.
Dans ce contexte, ce chapitre vise à présenter un état de l’art riche et structuré autour :
L’avènement des modèles de langage à grande échelle (Large Language Models ou LLMs) a
marqué un tournant décisif dans le domaine du traitement automatique du langage naturel
(TALN). Ces modèles, basés principalement sur l’architecture Transformer introduite par le
l’article Attention Is All You Need. en 2017, ont démontré une capacité impressionnante à
comprendre, générer et traduire du texte, tout en s’adaptant à de nombreuses tâches
linguistiques sans entraînement spécifique.
Les grands modèles de langage (LLMs) représentent une avancée majeure dans la
compréhension et la génération du langage humain, surpassant les modèles traditionnels comme
18
Chapitre 2 Etat de l’art
__________________________________________________________________________
les N-grammes. Grâce à l'architecture Transformer et au mécanisme d'auto-attention, des
modèles tels que GPT-3 et GPT-4 capturent efficacement les dépendances à long terme. Les
techniques d'apprentissage en contexte et par renforcement avec retour humain (RLHF)
permettent d'améliorer la cohérence et la qualité des réponses générées, soutenues par des
approches comme le prompt engineering et les interactions conversationnelles.
2.2.3 Évolution des modèles de traitement du langage naturel traditionnels vers les
modèles de pointe (LLMs)
Comprendre les LLMs nécessite de retracer le développement des modèles de langage à travers
plusieurs étapes, telles que les modèles de langage statistiques (SLMs), les modèles de
langage neuronaux (NLMs), les modèles de langage pré-entraînés (PLMs), jusqu'aux
modèles de langage de grande taille (LLMs). [1]
Apparus dans les années 1990, les SLMs analysent le langage naturel en utilisant des méthodes
probabilistes pour déterminer la probabilité des phrases dans les textes. Par exemple, la probabilité
P(S) de la phrase « Je suis très heureux » est donnée par :
P(S) = P(ω1,ω2,ω3,ω4) = P(je,suis,trop,heureux)
1
1706.03762
19
Chapitre 2 Etat de l’art
__________________________________________________________________________
Figure 2. 1chronologie synthétique montrant l’évolution des grands modèles de langage (LLMs) de 1990 à 2023
Cette progression commence avec les premiers modèles statistiques tels que les N-grammes,
passe par les modèles de langage neuronaux comme Word2Vec et RNN/LSTM, et évolue
vers l’ère des modèles pré-entraînés avec l’introduction des transformers et des mécanismes
d’attention.
La figure met en évidence les étapes clés, notamment le développement de BERT, de la série
GPT, ainsi que des innovations récentes telles que GPT-4 et ChatGPT, illustrant les avancées
rapides de la technologie des LLMs au fil du temps.
20
Chapitre 2 Etat de l’art
__________________________________________________________________________
c. Modèles de langage pré-entraînés (PLMs)
Les PLMs sont d’abord entraînés sur de vastes volumes de textes non étiquetés afin de
comprendre les structures fondamentales du langage (pré-entraînement). Ils sont ensuite
ajustés (fine-tuned) sur un jeu de données plus petit et spécifique à une tâche.
Les LLMs tels que GPT-3, GPT-4, PaLM et LLaMA sont entraînés sur d’immenses corpus
textuels comprenant des dizaines de milliards de paramètres.
Cette approche permet aux LLMs de mieux comprendre les commandes et les valeurs
humaines. [2]
Voici une figure qui illustre l’apparitions des modèles depuis 2019 jusqu’au 2024 :
21
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.3. Architecture Transformer
L'architecture de base de la majorité des LLMs est le Transformer, qui repose sur le
mécanisme d'attention multi-têtes (Multi-head Attention). Ce mécanisme permet au modèle
de :
L’article fondateur « Attention is All You Need » a formulé son mécanisme d’attention en
utilisant la terminologie d’une base de données relationnelle : requêtes, clés et valeurs. Les
bases de données relationnelles sont conçues pour simplifier le stockage et la récupération des
22
Chapitre 2 Etat de l’art
__________________________________________________________________________
données pertinentes : elles attribuent un identifiant unique (une « clé ») à chaque élément de
donnée et chaque clé est associée à une valeur correspondante. En NLP, la « base de données »
d’un modèle est le vocabulaire des tokens qu’il a appris grâce à son jeu de données
d’entraînement.
L’objectif principal d’un mécanisme d’attention est de déterminer l’importance relative des
différentes parties de la séquence d’entrée, puis d’inciter le modèle à prêter attention
aux parties importantes et à ignorer les autres. [3]
Pour profiter de l’efficacité du calcul de la moyenne tout en tenant compte des relations
multiples entre les tokens, les modèles de transformeur calculent les opérations d’auto-attention
plusieurs fois en parallèle à chaque couche d’attention du réseau. Chaque plongement de token
d’entrée d’origine est divisé en h sous-ensembles de taille égale. Chaque élément du
plongement est introduit dans l’une des h matrices parallèles des poids Q, K et V , chacune étant
respectivement appelée tête de requête, tête de clé ou tête de valeur. Les vecteurs produits par
23
Chapitre 2 Etat de l’art
__________________________________________________________________________
chacun de ces triplets parallèles de têtes de requête, clé et valeur sont ensuite introduits dans
une tête d’attention correspondante.
a. Encodeur :
L'encodeur est composé d'une pile de N = 6 couches identiques. Chaque couche comporte deux
sous-couches.
Nous appliquons une connexion résiduelle autour de chacune des deux sous-couches, suivie
d'une normalisation de couche (Layer Normalization). Ainsi, la sortie de chaque sous-couche
est définie comme :
24
Chapitre 2 Etat de l’art
__________________________________________________________________________
Pour faciliter ces connexions résiduelles, toutes les sous-couches du modèle, ainsi que les
couches d'embedding, produisent des sorties de dimension dmodel = 512.
b. Décodeur :
Le décodeur est également composé d'une pile de N = 6 couches identiques. En plus des deux
sous-couches présentes dans chaque couche d'encodeur, le décodeur insère une troisième sous-
couche qui effectue une attention multi-tête sur la sortie de la pile d'encodeurs.
Tout comme pour l'encodeur, nous appliquons des connexions résiduelles autour de chaque
sous-couche, suivies d'une normalisation de couche.
Nous modifions également la sous-couche d'auto-attention dans la pile du décodeur pour
empêcher les positions d'attention vers les positions ultérieures.
Ce masquage, combiné au fait que les embeddings de sortie sont décalés d'une position,
garantit que les prédictions pour la position iii ne dépendent que des sorties déjà connues aux
positions inférieures à iii. [4]
Voici des exemples de modèles LLMs populaires basés sur les Transformers :
25
Chapitre 2 Etat de l’art
__________________________________________________________________________
Chaque modèle a été entraîné sur des jeux de données massifs, allant de Common Crawl à des
corpus spécialisés, avec différentes méthodes d’optimisation et de prétraitement.
Coût computationnel élevé : entraînement sur plusieurs GPU A100 pendant des
semaines
Biais et hallucinations : les modèles peuvent produire des affirmations incorrectes
26
Chapitre 2 Etat de l’art
__________________________________________________________________________
Accessibilité limitée : certains modèles sont fermés ou peu adaptés aux langues sous-
représentées
Empreinte écologique : la consommation énergétique est non négligeable
Le fine-tuning utilise un modèle pré-entraîné, tel que la série GPT d’OpenAI, comme base. Le
processus consiste à poursuivre l’entraînement sur un jeu de données plus petit et spécifique
à un domaine.
Cette approche s’appuie sur les connaissances déjà acquises par le modèle, ce qui permet
d’améliorer ses performances sur des tâches spécifiques tout en réduisant les besoins en
données et en ressources de calcul.
Il existe plusieurs approches de fine-tuning des modèles de langage (LLMs). Nous présenterons
ci-dessous les méthodes les plus couramment utilisées.
Cette méthode ne nécessite pas de données étiquetées. Le LLM est simplement exposé à un
large corpus de textes non étiquetés provenant du domaine ciblé, ce qui permet d’affiner sa
compréhension du langage. Cette approche est utile pour des domaines nouveaux comme le
juridique ou le médical, mais elle est moins précise pour des tâches spécifiques telles que la
classification ou la résumé.
Le SFT consiste à fournir au LLM des données étiquetées adaptées à la tâche cible. Par
exemple, un fine-tuning pour la classification de textes dans un contexte professionnel utilise
un jeu de données contenant des extraits de texte associés à des étiquettes de classe. Bien que
cette méthode soit efficace, elle nécessite une grande quantité de données étiquetées, ce qui
peut être coûteux et long à obtenir.
27
Chapitre 2 Etat de l’art
__________________________________________________________________________
2.7.3 Fine-tuning par instructions via l’ingénierie de prompts
Cette méthode repose sur la fourniture d’instructions en langage naturel au LLM, ce qui est
particulièrement utile pour créer des assistants spécialisés. Elle réduit le besoin de grandes
quantités de données étiquetées, mais dépend fortement de la qualité des prompts. [5]
Les méthodes basées sur les adaptateurs consistent à introduire des paramètres entraînables
supplémentaires après les couches d’attention et les couches entièrement connectées d’un
modèle pré-entraîné figé.
28
Chapitre 2 Etat de l’art
__________________________________________________________________________
Figure 2. 6 adapter
La Low-Rank Adaptation (LoRA) est une technique conçue pour le fine-tuning des grands
modèles de langage, qui modifie le processus en gardant figés les poids d’origine du modèle
tout en appliquant des modifications à un ensemble distinct de poids ajoutés aux paramètres
initiaux. [5]
29
Chapitre 2 Etat de l’art
__________________________________________________________________________
Figure 2. 7 LoRA
2.8.3 QLoRA
QLoRA est une version étendue de LoRA conçue pour offrir une efficacité mémoire accrue
lors du fine-tuning des grands modèles de langage (LLMs), en quantifiant les poids du
modèle à une précision de 4 bits.
En général, les paramètres des LLMs sont stockés en format 32 bits, mais QLoRA les
compresse en 4 bits, ce qui réduit considérablement l’empreinte mémoire. Cela permet de
réaliser du fine-tuning sur du matériel moins puissant, y compris des GPU grand public.
30
Chapitre 2 Etat de l’art
__________________________________________________________________________
Figure 2. 8 QLoRA
La perplexité est une mesure utilisée pour évaluer la qualité des modèles de langage,
notamment les modèles de type LLM (Large Language Model). Elle mesure dans quelle
mesure un modèle est "surpris" par une séquence de texte. Plus la perplexité est faible,
meilleur est le modèle, car cela signifie qu’il prédit bien les mots ou les phrases.
2.10 Conclusion
Les modèles de langage à grande échelle ont transformé les méthodes de traitement automatique
du langage naturel. Toutefois, leur adaptation à des contextes spécifiques – comme les langues
africaines à faible ressource – nécessite des ajustements, comme le fine-tuning ou la création
de jeux de données représentatifs. Le chapitre suivant explorera en détail des projets déjà réalisé
dans ce contexte ainsi que notre solution qu’on a proposée et le plan qu’on a suivi pour parvenir
aux meilleurs résultats.
31
__________________________________________________________________________
32
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.1. Introduction
Ce chapitre est consacré à l’analyse des projets similaires déjà réalisés, à l’examen des
ressources disponibles pour la langue Fulfulde, ainsi qu’à la présentation de la solution que
nous proposons. L’objectif principal est de développer un modèle de langage de grande taille
(LLM) dédié à la génération de texte en Fulfulde, spécifiquement adapté au contexte de la
Mauritanie.
3.2.1 Masakhane
Description : Masakhane est une organisation communautaire panafricaine dédiée à la
recherche en traitement automatique des langues (TAL) pour les langues africaines. Elle
se concentre sur la traduction automatique, la reconnaissance d'entités nommées (NER),
la classification de textes, et plus encore, en collaborant avec des chercheurs africains
pour développer des modèles adaptés aux langues locales. [6]
GitHub : GitHub
33
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
figure 3. 1 Masakhane
3.2.2 AfroLM
Description : AfroLM est un modèle de langage multilingue pré-entraîné sur 23 langues
34
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Source : [Link]
3.2.3 BLOOM
Description : BLOOM est un modèle de langage multilingue open-source développé
35
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Modèle sur Hugging Face : [Link]
3.2.4 fuv_latn_full
Parmi les travaux existants, on trouve Goldfish, une suite de modèles de langue monolingues
développée pour environ 350 langues. Ces modèles sont particulièrement orientés vers les
langues peu dotées, avec un objectif de comparaison entre langues plutôt que de performance
brute. Le modèle correspondant au Fulfulde nigérian (écriture latine) a été entraîné sur un
corpus de 21 Mo, représentant l’ensemble des données disponibles dans cette langue. Il est à
noter que ce volume prend en compte un facteur d’ajustement (ou "surcoût en octets") estimé à
1,11, ce qui signifie que le Fulfulde nigérian nécessite en moyenne 1,11 fois plus d’octets en
encodage UTF-8 que l’anglais pour un contenu équivalent. Ainsi, bien que Goldfish ne vise pas
à concurrencer les grands modèles de langue (LLM) dans les langues riches en ressources, il
constitue une référence pertinente pour l’étude et le traitement des langues faiblement dotées
comme le Fulfulde. [8]
L’Afrique est le continent avec la plus grande diversité linguistique au monde, comptant plus
de 2 000 langues vivantes réparties entre quatre grandes familles : afro-asiatique, nilo-
saharienne, nigéro-congolaise et khoïsan. Cette richesse culturelle et linguistique est toutefois
36
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
peu représentée dans les technologies modernes, notamment les systèmes d’intelligence
artificielle et les modèles de traitement du langage naturel (TALN).
Les langues africaines dites "à faibles ressources" sont celles pour lesquelles il existe peu ou
pas de :
Le Fulfulde, aussi appelé Pulaar, est une langue de la famille nigéro-congolaise, parlée par
plus de 36 millions de personnes à travers l’Afrique de l’Ouest (Mauritanie, Sénégal, Mali,
Guinée, Cameroun, Nigeria, etc.). Elle se distingue par :
Une forte variation dialectale selon les régions (Pulaar, Fulfulde Adamawa,
Maasinankoore...),
Une riche morphologie (flexions verbales, conjugaison complexe),
Un usage à l’écrit parfois limité, bien que croissant grâce aux radios, traductions
religieuses et initiatives éducatives.
Malgré son importance sociolinguistique, le Fulfulde reste largement ignoré dans les LLMs
multilingues, ce qui rend nécessaire son intégration via le fine-tuning.
Voici les principales certaines ressources disponibles qui peuvent servir de base pour le fine-
tuning d’un LLM en Fulfulde généralement :
37
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Wikipedia
Contenu encyclopédique limité [Link]
Fulfulde
Les ressources présentées dans ce tableau ne peuvent pas toutes être utilisées dans le cadre de
notre projet, qui se concentre exclusivement sur le Fulfulde tel qu’il est parlé en Mauritanie. En
raison de la diversité linguistique de cette langue à travers les régions, exploiter l’ensemble de
ces données risquerait de produire un modèle trop généraliste, ce qui irait à l’encontre de notre
objectif de spécialisation locale.
c. Tokenisation difficile
38
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
39
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.4 Solution Proposée
Pour répondre efficacement à la problématique définie précédemment, nous avons choisi une
solution technologique centrée autour de la technique dite de fine-tuning des modèles de
langage à grande échelle (LLM) existants, spécialement conçue pour la langue Pulaar/Fulfulde.
Concrètement, la solution proposée consiste à adapter finement des modèles de langage pré-
entraînés, tels que Qwen2.5-0.5B et Bloom560M, à partir de corpus spécifiquement construits
et préparés en Pulaar.
L’identification des défis et la mise en place de solutions appropriées n’ont pas été des tâches
aisées. Certains problèmes ont nécessité un temps considérable avant d’aboutir à des réponses
concrètes. Sans ces solutions, le projet aurait difficilement pu progresser, d’autant plus que
certains obstacles rencontrés étaient inédits dans le domaine de l’intelligence artificielle, ou du
moins, aucune référence pertinente n’a pu être trouvée sur le Web.
Pour obtenir un modèle LLM performant en Fulfulde, nous devons passer par plusieurs étapes
essentielles, notamment la collecte et le prétraitement des données textuelles. Cependant, ces
étapes comportent de nombreux défis, surtout pour une langue à faible ressource comme le
Fulfulde.
40
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
très réduits, généralement entre 2 et 10 MB. Atteindre un volume de 1 GB de données
nécessite donc de diversifier les sources.
Sites non scrappables directement :
Certains sites pertinents, comme RFI Fulfulde, ne permettent pas un scraping direct à
cause de leur structure ou de leurs restrictions d'accès.
Problèmes d'extraction de texte depuis les PDF :
Les livres disponibles sont souvent en format PDF, mais beaucoup ne sont pas
normalisés pour permettre une extraction de texte efficace via les bibliothèques OCR
classiques. De plus, une grande partie des documents sont en format physique, ce qui
implique de les photographier page par page pour ensuite appliquer un traitement OCR
et extraire leur contenue.
Manque de prise en charge par les outils OCR existants :
Les logiciels OCR gratuits ne prennent généralement pas en charge la langue Fulfulde.
Même les outils qui prennent en charge des langues africaines proches (comme le
Bambara ou l’Haoussa) rencontrent des difficultés avec les spécificités linguistiques du
Fulfulde.
Risques liés à l’augmentation de données (data augmentation) :
L'augmentation des données en utilisant un petit volume de texte initial peut conduire à
une génération répétitive ou incohérente, compromettant ainsi la diversité et la qualité
du corpus.
Solutions proposées :
41
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
OCR pour langues africaines similaires :
Pour traiter les livres en PDF(en image , ou numérique), nous avons testé des outils
OCR prenant en charge des langues africaines voisines (comme le Bambara ou le
Haoussa) qui utilisent des alphabets similaires au Fulfulde. Cette approche a permis
d'extraire du contenu textuel avec un taux de précision acceptable.
Génération logique de phrases :
Nous envisageons de développer un générateur de phrases plus sophistiqué que
Markovify, capable de produire des phrases plus cohérentes et plus pertinentes en
combinant des modèles de séquence et des approches statistiques. Ce générateur nous
comptons dans le futur le rendre comparable avec le LLM dans le domaine de génération
du texte.
Le choix du modèle à fine-tuner dépend en grande partie des ressources matérielles disponibles,
notamment des GPU. En effet, le fine-tuning d'un modèle LLM de grande taille nécessite des
capacités de calcul significatives, ce qui constitue un défi majeur.
Solutions proposées :
Faire un fine tuning complet en première phase pour adapter le modèle à fulfulde en
utilisant des données réduites
c. Tokenisation
Création d'un tokenizer spécifique basé sur l’approche BPE (Byte-Pair Encoding)
adaptée à la langue Pulaar. Ce tokenizer permet une meilleure segmentation des mots et
des expressions courantes spécifiques au Pulaar, facilitant ainsi l’apprentissage du
modèle.
Fixation optimale du vocabulaire de 30k de tokens: après analyse des corpus, un
vocabulaire adapté a été défini pour couvrir efficacement la richesse linguistique tout
en limitant la taille pour optimiser les performances.
d. Validation et Évaluation
Évaluation des résultats finaux selon plusieurs métriques précises telles que la
perplexité, la cohérence linguistique, la précision dans la génération, et la pertinence
contextuelle.
43
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Framework d’entraînement : Hugging Face Transformers avec PyTorch pour assurer
une implémentation efficace, robuste et facilement reproductible.
Plateforme de calcul : Google Colab avec utilisation de GPU pour permettre un
entraînement rapide et efficace des modèles.
Technologie de tokenisation : Hugging Face Tokenizers avec la méthode Byte-Pair
Encoding (BPE), spécialement configurée pour la langue Pulaar.
Nettoyage approfondi des données collectées : élimination des doublons, des erreurs
typographiques, des caractères spéciaux non compatibles avec l’encodage UTF-8.
Normalisation linguistique : harmonisation orthographique et vérification linguistique
par des experts en Pulaar pour garantir une qualité optimale des données d'entraînement.
En résumé, la solution proposée est une approche innovante et adaptée, combinant des
techniques modernes de TALN à des corpus spécifiquement conçus pour le Pulaar/Fulfulde.
Cette approche méthodologique structurée offre une réponse concrète et viable aux défis posés
par la sous-représentation de cette langue dans les technologies numériques modernes.
44
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Le fine-tuning constitue une méthode puissante pour adapter les LLMs à des langues africaines
sous-représentées. Grâce aux méthodes légères comme LoRA et QLoRA, il est désormais
possible de réaliser cette adaptation avec des ressources limitées, tout en obtenant des résultats
significatifs. Cela ouvre la voie à une intelligence artificielle plus inclusive, linguistiquement
équitable et culturellement respectueuse.
Le projet est structuré en cinq grandes phases distinctes, chacune ayant un rôle précis dans la
réalisation finale des objectifs visés
45
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
Phase 2 : Prétraitement et Préparation des Corpus (2 semaines)
Tests rigoureux des modèles entraînés à l’aide des métriques comme la perplexité, la
cohérence linguistique, et la précision dans les tâches de génération de texte.
Comparaison des résultats obtenus par les différents modèles afin de sélectionner le
modèle optimal.
Itérations supplémentaires si nécessaire, en fonction des résultats préliminaires obtenus.
46
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
3.5.2 Gestion des Risques
Pour anticiper les éventuels problèmes pouvant survenir durant la réalisation du projet, nous
avons identifié les risques principaux suivants, ainsi que les stratégies d’atténuation adaptées :
Impact
Risque identifié Stratégie d’atténation
potentiel
Cette planification détaillée permet d’assurer une conduite rigoureuse et efficace du projet tout
en minimisant les imprévus, favorisant ainsi la réalisation optimale des objectifs initialement
fixés.
3.6 Conclusion
Ce chapitre nous a permis de poser les bases nécessaires à la mise en œuvre de notre projet. À
travers l’étude des projets existants tels que Masakhane, AfroLM et BLOOM, nous avons pu
identifier les approches pertinentes ainsi que les limites rencontrées dans le traitement des
langues africaines. L’analyse du contexte linguistique du Fulfulde, de ses particularités et des
ressources actuellement disponibles, a mis en évidence les défis spécifiques liés à son
traitement automatique.
Sur cette base, nous avons formulé une solution adaptée au contexte mauritanien, en
proposant le développement d’un modèle de génération de texte en Fulfulde. Nous avons
47
Chapitre 3 Etudes de l’existant et la Solution proposée
__________________________________________________________________________
détaillé la méthodologie envisagée, les choix technologiques, ainsi que les innovations que
notre solution entend apporter.
Le chapitre suivant sera consacré à la phase de réalisation concrète de cette solution, à sa mise
en œuvre technique, ainsi qu’aux expérimentations menées et aux résultats obtenus.
48
Chapitre 4 Résultats et expériences
__________________________________________________________________________
49
Chapitre 4 Résultats et expériences
__________________________________________________________________________
4.1 Introduction
L’objectif principal de ce chapitre est de présenter nos expériences menées dans le cadre de
l’adaptation de modèles de langage de grande taille (LLM) au Fulfulde Mauritanien, ainsi
nous avons analyser les résultats obtenus. Après avoir décrit les sources des données et la
méthodologie de fine-tuning appliquée aux corpus multilingues, nous évaluons les
performances des modèles, à l’aide de métriques de perplexité.
Dans ce chapitre nous allons également mettre en lumière les limites rencontrées lors de ce
travail expérimental, telles que la rareté des données de qualité, les particularités linguistiques
non codifiées, ou encore les contraintes matérielles liées à l'entraînement de modèles à grande
échelle. Les résultats obtenus ouvrent néanmoins des perspectives intéressantes pour la
promotion et la préservation numérique des langues locales à travers les technologies
d’intelligence artificielle.
La collecte des données est une étape essentielle pour le fine-tuning des modèles de langage,
en particulier pour des langues peu représentées comme le Fulfulde. Nous avons collecté des
données provenant de plusieurs sources afin d'atteindre un total de 35 Mo de données brutes,
qu’on nommera ici data3 Cependant, cette tâche n’a pas été exempte de défis, notamment en
raison de la difficulté à extraire certaines données de livres en raison du manque d’outils OCR
adaptés pour la langue Fulfulde.
Les sources utilisées pour collecter les données sont variées et comprennent des sites web, des
livres au format PDF, des sources en ligne spécialisées dans le Fulfulde, ainsi que des données
publiques téléchargées. Nous avons utilisé plusieurs méthodes pour récupérer ces données,
telles que le scraping, l’extraction de texte et le téléchargement direct.
Voici un résumé des sources et des méthodes utilisées pour collecter les données :
50
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Le graphique suivant montre la répartition des différentes sources de données utilisées pour ce
projet de fine-tuning. On peut observer que la majorité des données provient de sources
externes, telles que le NLLB (31.2%) et Data Augmentation (12.1%), suivies par RFI
Fulfulde (6.5%) et des sources spécifiques à la Mauritanie et au Pulaar.
51
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Si un "6" ou deux "6" sont encadrés par des caractères alphabétiques, ils sont remplacés
par "ɓ".
52
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Exemple : "to66e" devient "toɓɓe".
Si un "6" est suivi ou précédé directement d'autres caractères sans espaces, il est
remplacé par "ɓ".
Exemple : "6etirɗe" devient "ɓetirɗe".
2. Suppression des lignes répétées : Pour le dataset NLLB, nous avons téléchargé un
total de 1 511 027 lignes contenant des phrases longues et courtes. Après suppression
des doublons, il ne restait que 233 127 lignes, soit environ 15% du dataset original.
3. Nettoyage des données : Toutes les lignes contenant uniquement des chiffres ou des
mots isolés ont été supprimées. Ces lignes n'apportaient pas de valeur significative pour
le fine-tuning.
4. Prétraitement des données : Après ces étapes de nettoyage, nous avons rassemblé
toutes les données dans un seul fichier .txt pour simplifier le processus d'entraînement
du modèle. De plus, des techniques d'augmentation de données ont été utilisées grâce à
Markovify, qui nous ont permis de générer 5 Mo de données supplémentaires à partir
des 35 Mo collectés.
4.4 Tokenisation
La tokenisation est une étape cruciale dans le traitement du langage naturel, permettant de
découper un texte en unités plus petites appelées tokens. Dans ce projet, nous avons testé
plusieurs tokenizers pour observer leur comportement avec la langue Fulfulde et leurs
performances dans la génération de texte. Nous avons utilisé les modèles suivants pour effectuer
la tokenisation : Bloom, DeepSeek, NLLB-600, et Qwen.
Le tableau suivant presente les Tokenizer que nous avons tester et leur Vocab size, qui reprenste
le nombre de Tokens reconnu par chaque Tokenizer :
2
[Link]
3
configuration_deepseek.py · deepseek-ai/DeepSeek-R1 at main
53
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Bloom 560M 4 250 680 tokens
Qwen 2.5 0.5B 5 151 646 tokens
Table 4. 2 Taille du vocabulaire
Ces tokenizer varie selon l’architecture du modèle et les langues ciblées. Par exemple, NLLB-
200, conçu pour la traduction multilingue, utilise un vocabulaire plus large (256 206 tokens),
tandis que DeepSeek-R1 se situe à 129 280 tokens, optimisé pour la performance sur du texte
généraliste. Ces différences influencent la capacité du modèle à traiter des langues variées et à
comprendre des structures lexicales spécifiques.
Pour évaluer les résultats des Tokenizer des modèles mentionner précédemment, Nous avons
commencé par charger tous les Tokenizer des modèles
Nous Allons utiliser cette phrase provenant du site RFI fulfulde pour tester les différents
Tokenizer :
“Ko hondum woni ñawu noppi, ko honno ngu ardata e neɗɗo e ko honno ngu rentortee ?”
4
bigscience/bloom-560m · Hugging Face
5
2409.12186
54
Chapitre 4 Résultats et expériences
__________________________________________________________________________
55
Chapitre 4 Résultats et expériences
__________________________________________________________________________
56
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Nous avons constaté que résultats obtenus avec ces modèles étaient assez similaires. En effet,
la tokenisation a été mal formulée, et de nombreux mots ont été découpés en caractères
individuels, ce qui rendait leur reconstruction difficile. Cependant, un modèle s’est démarqué :
le NLLB-600, qui a montré de meilleures performances, notamment en reconnaissant certains
mots complets car il est entrainé avec des données fulfulde pour la traduction multilingue.
57
Chapitre 4 Résultats et expériences
__________________________________________________________________________
4.4.2 Nécessité de développer un tokenizer spécifique pour le Fulfulde
Face aux limitations que nous avons observées avec les tokenizers préexistants, nous avons
décidé de développer notre propre tokenizer pour le Fulfulde, que nous avons appelé le
Tokenizer Fulfulde BPE. Cette décision a été motivée par les résultats insatisfaisants des
tokenizers existants, qui découpaient les mots de manière incohérente.
Pour créer ce tokenizer spécifique, nous avons utilisé les données collectées précédemment,
avec un vocabulary size de 30 000. L’entraînement du modèle a été réalisé sur les données
textuelles du Fulfulde, avec des techniques d’apprentissage comme le Byte Pair Encoding
(BPE), qui permet de mieux capturer les structures morphologiques des mots.
Le choix d'un vocabulary size de 30 000 pour notre Tokenizer Fulfulde BPE repose sur
l'optimisation entre performance et complexité. Un vocabulaire plus petit aurait conduit à une
découpe excessive des mots, tandis qu'un vocabulaire trop grand aurait augmenté les ressources
computationnelles nécessaires. Cette taille permet une couverture suffisante des mots fréquents
et des variations morphologiques en Fulfulde, tout en étant adaptée à notre corpus de données
de 35 Mo. Ce choix est également soutenu par des études sur des langues à faibles ressources,
qui montrent qu'un vocabulary size de 30 000 à 50 000 tokens est efficace pour la génération
de texte et d'autres tâches NLP dans des contextes similaires. Ce compromis entre richesse
lexicale et efficacité est crucial pour optimiser les performances du modèle dans notre cas
spécifique.6
Comme le montre l'image ci-dessous, la tokenisation avec le Tokenizer Fulfulde BPE produit
des tokens plus structurés et mieux adaptés aux particularités du Fulfulde. Les mots sont
maintenant mieux reconnus et préservés dans leur intégrité, ce qui améliore la qualité de la
génération de texte.
En utilisant notre Tokenizer Fulfulde BPE, nous avons pu obtenir des résultats nettement
meilleurs que ceux des modèles testés précédemment. Voici un exemple de la tokenisation
6
[1508.07909] Neural Machine Translation of Rare Words with Subword Units
58
Chapitre 4 Résultats et expériences
__________________________________________________________________________
pour le texte suivant :
“Ko hondum woni ñawu noppi, ko honno ngu ardata e neɗɗo e ko honno ngu rentortee ?”
En résumant ce qui précède, les tests ont montré que, bien que certains modèles comme NLLB-
600 aient donné de bons résultats pour certains mots, les tokenizers généraux ne sont pas
suffisants pour gérer efficacement les spécificités du Fulfulde. Cela justifie pleinement la
création d’un tokenizer sur mesure, comme le Tokenizer Fulfulde BPE, qui a permis
d’améliorer significativement la qualité de la tokenisation, rendant le processus plus adapté à
notre projet.
Dans le cadre de notre projet, notre choix du modèle a été guidé principalement par les
contraintes matérielles, notamment l'absence de GPU performants. Pour cette raison, nous
avons opté pour des modèles de taille modeste, contenant moins de 1 milliard de paramètres,
afin de faciliter l’entraînement et de réduire la consommation de ressources tout en maintenant
une performance acceptable.
59
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Nous avons ainsi retenu deux modèles adaptés à ces critères : Qwen 2.5 (0.5B) et Bloom
(560M). Ces modèles ont été sélectionnés pour leur popularité, leur compatibilité avec le fine-
tuning, ainsi que la disponibilité de leurs versions open-source.
Pour évaluer leurs performances respectives, nous avons réalisé un fine-tuning complet (Full
Fine-Tuning) de ces deux modèles sur un même corpus, que nous appellerons data1 13MB.
Ce corpus est constitué des sources suivantes :
Nous avons appliqué les mêmes hyperparamètres pour les deux modèles afin de garantir une
comparaison équitable. Le tableau suivant résume les paramètres utilisés :
60
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Cette image montre les hyperparametres utilisé durant fine tuning des modèles selectionné.
Après 3 epochs, nous avons comparé les performances des deux modèles en mesurant la
perplexité, qui est un indicateur standard dans l’évaluation des modèles de langage. Les
résultats sont les suivants :
Pour une évaluation plus approfondie, nous avons également testé la perplexité des modèles en
les exposant à 100 phrases issues du corpus RFI Fulfulde, qui n’étaient pas incluses dans
l’ensemble d’entraînement. L’objectif était de vérifier la capacité de généralisation des modèles
à des données inédites, proches du domaine ciblé.
61
Chapitre 4 Résultats et expériences
__________________________________________________________________________
En plus des métriques quantitatives, nous avons effectué une analyse qualitative des
générations de texte, à partir de prompts extraits du corpus, afin d’observer la cohérence, la
fluidité, et la qualité de la langue générée. Un extrait du tableau comparatif des générations
(prompt, sortie du modèle, traduction humaine) est présenté ci-dessous :
62
Chapitre 4 Résultats et expériences
__________________________________________________________________________
À la lumière de ces résultats, nous avons décidé d’adopter le modèle Qwen 2.5 (0.5B) comme
modèle de référence pour notre projet. En effet, il présente une meilleure perplexité et une
qualité de génération plus satisfaisante que Bloom dans notre contexte spécifique. Nous avons
donc poursuivi le fine-tuning de ce modèle avec d’autres corpus, notamment data3, pour les
tâches de génération de texte.
63
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Après que nous avons analyser ces courbes nous avons interpréter ce qui suit :
64
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Enfin, le modèle a été entraîné sur 3 époques, ce qui montre une couverture suffisante
du corpus pour permettre une stabilisation des performances.
Le Qwen 2.5 (0.5B), affiné avec data3 sur 3 Epochs ce modèle que nous appellerons Fulfulde
LLM, a atteint une perplexité finale de 84 dans les taches de « text génération » pour 100
phrases différente, ce qui confirme sa pertinence pour nos objectifs.
Modèle Perplexité
Qwen 2.5 first 4765.444406166077
Fulflde LLM 84
Bloom560 10632.785768771171
65
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Qwen 2.5 first : c’est le modèle Qwen 2.5 0.5B fine tuné avec data1
Fulflde LLM : c’est le modèle Qwen 2.5 0.5B fine tuné avec data3
Pour effectuer une évaluation plus globale, nous avons comparé notre modèle de complétion de
texte en Fulfulde avec d'autres modèles capables de traiter cette langue, identifiés dans la partie
dédiée à l’étude de l’existant. Cette comparaison repose sur la métrique de perplexité,
couramment utilisée pour évaluer la qualité des modèles de langage.
Les données de teste utilise ici sont ceux provenant de RFI fulfulde contenant 10113 phrases
courtes et longues
66
Chapitre 4 Résultats et expériences
__________________________________________________________________________
Les
67
Chapitre 4 Résultats et expériences
__________________________________________________________________________
afriknaaɓe ɓe jam e kisal africains en paix et en
ngon e mum en , ko holno ɓe sécurité. Comment ont-ils
haa naa haɓi reede ngam hi lutté pour sauver leur vie ? Si
wude di p loo m ti maɓɓe ? la communauté était là,
No woodi renndo ngoo , aujourd'hui, le
hannde no woodi kadi e développement du pays est
ɓamtaare leydi ndii également en jeu.
Ko taskaramji Cellal ko Ko taskaram ji Cellal ko Le programme Santé,
Ngalu e Dinngiral rewɓe Ngalu e Din ngiral rewɓe Richesse et Religion des
cuɓiɗen artirde ndee yontere cuɓi ɗen artirde ndee yontere Femmes a choisi de revenir
to Gine Bisaawo . E nder cette semaine en Guinée
yewtere men en kaalan fii ɗii Bissau. Dans notre interview,
fitinaaji wa ɗuɗi e nder Mali nous parlerons des nombreux
, Burkina Faso , Niijeer e conflits au Mali, au Burkina
Niijeer kadi no hab bii yo ɓe Faso, au Niger et au Niger
waɗ anta fedde nde wonaa qui ont tenté de former une
laamuyankoore . Holko woni organisation non
sabu mum ? Holko ɗum gouvernementale. Quelle en
waawi battinde hannde e est la raison ? Comment cela
ngur ɗam maɓɓe ? Ngam peut-il affecter leur vie
jaabaade ɗee naamne , en aujourd'hui ? Pour répondre à
mbis moto Abdu laay ces questions, nous avons
JALLO jannginoowo ka demandé à Abdu laay
duɗal mawngal Bamako JALLO, enseignant à
ngam jokki taade sa galle l'Université de Bamako, de
walla jannde ɗemɗe poursuivre ses devoirs ou son
apprentissage de la langue
Table 4. 6 texte completion de Fulfulde LLM
Ces résultats encouragent la poursuite des travaux dans cette direction. Une amélioration future
consistera à affiner davantage le modèle à l’aide de données plus spécifiques (par exemple
dans les domaines mathématiques, éducatifs ou administratifs) afin d’étendre ses capacités
à des usages plus généraux et contextualisés. Cela permettrait de renforcer son utilité dans des
68
Chapitre 4 Résultats et expériences
__________________________________________________________________________
applications concrètes, notamment en traitement automatique du langage pour les langues
africaines à faible ressource comme le Fulfulde.
Le modèle a été déployé sur Hugging Face sous le nom AhmedBAH/DesertMind, afin d’être
accessible à tout chercheur souhaitant l’exploiter pour des travaux de recherche sur la langue
fulfulde parlée en Mauritanie.
DesertMind est notre Equipe composé de Rahma Dia, Mamadou Aw, Cheick Sidi et Ahmed BA
4.7 Conclusion
Ce chapitre a démontré la faisabilité d’adapter des modèles de langage de grande taille (LLM)
au fulfulde mauritanien, une langue africaine à faibles ressources, en combinant des stratégies
innovantes de collecte, de prétraitement et d’optimisation technique. Face à la rareté des
données (35 Mo de corpus final), des méthodes hybrides (OCR corrigé, augmentation par
chaînes de Markov) ont permis de pallier les lacunes initiales, tandis que le développement d’un
tokenizer BPE dédié (30k tokens) a résolu les problèmes de segmentation inhérents aux
spécificités morphologiques de la langue. L’évaluation comparative des modèles Qwen-0.5B
et Bloom-560M fine tuné avec data1 a révélé la supériorité de Qwen, avec une perplexité de
84 contre 4000 pour Bloom, validant son potentiel pour des tâches de génération contextualisée.
69
Chapitre 4 Résultats et expériences
__________________________________________________________________________
perplexité de 30.76. Ces résultats illustrent l’efficacité d’un fine-tuning ciblé sur une langue à
faible ressource. À terme, ce modèle sera enrichi par des données thématiques (mathématiques,
éducatives, administratives) afin d’élargir ses capacités à des usages plus généraux et
[Link] résultats, bien que limités par les contraintes matérielles et la taille réduite du
corpus, ouvrent des perspectives prometteuses pour l’inclusion des langues marginalisées dans
l’écosystème de l’IA, tout en soulignant l’impérative nécessité de concevoir des architectures
adaptées aux réalités linguistiques africaines.
70
Conclusion générale
__________________________________________________________________________
Conclusion générale
Ce travail s’inscrit dans une démarche innovante visant à adapter les technologies d’intelligence
artificielle au service des langues africaines, en particulier le Fulfulde, langue largement parlée
mais peu représentée dans le domaine numérique. À travers ce projet, nous avons exploré le
potentiel des modèles de langage à grande échelle (LLMs) et des architectures
Transformers pour répondre aux défis liés à la rareté des ressources linguistiques dans les
contextes locaux.
Les résultats obtenus sont encourageants, démontrant qu’avec des approches méthodiques, il
est possible d'obtenir des performances significatives même dans des contextes à faible
ressource. Toutefois, plusieurs limites subsistent, notamment en termes de quantité et de qualité
des données disponibles, de complexité linguistique, et d’accessibilité technologique.
Ce projet ouvre ainsi de nombreuses perspectives. Il pourra être enrichi par l’intégration de
nouvelles sources de données, le développement d’interfaces pour un usage communautaire ou
éducatif, ainsi que l'exploration de modèles multilingues ou de techniques de transfert
interlinguistique. En cela, il contribue à la valorisation numérique des langues africaines et à
leur inclusion dans les avancées technologiques globales.
71
Bibliographie
__________________________________________________________________________
Bibliographie
[1] 25 mars 2025. [En ligne]. Available: [Link]
[2] «ultimate V2,» [En ligne]. Available: [2408.13296] The Ultimate Guide to Fine-Tuning
LLMs from Basics to Breakthroughs: An Exhaustive Review of Technologies, Research,
Best Practices, Applied Research Challenges and Opportunities. [Accès le 16 03 2025].
72
Bibliographie
__________________________________________________________________________
Résumé
___________________________________________________________________________
Ce projet vise à adapter les technologies d’intelligence artificielle aux langues africaines peu
représentées, en particulier le Fulfulde. En s’appuyant sur les modèles de langage à grande
échelle (LLMs) et l’architecture Transformer, un pipeline complet a été développé : collecte
de données, création d’un tokenizer spécifique, et fine-tuning. Les résultats sont prometteurs
malgré la rareté des ressources, et ouvrent la voie à de futures améliorations, contribuant ainsi
à la valorisation numérique des langues africaines.
Mots-clés : Modèles de langage, Intelligence artificielle, Fulfulde, Langues africaines,
Traitement automatique du langage naturel, Tokenisation, Ressources faibles, Fine-tuning,
Transformers
الملخص
___________________________________________________________________________
باالعتماد. وخاصة لغة الفُلفُلدِه،يهدف هذا المشروع إلى تكييف تقنيات الذكاء االصطناعي مع اللغات اإلفريقية ذات التمثيل الضعيف
( على نماذج اللغة الضخمةLLMs) وهندسةTransformers وإنشاء، تم تطوير سلسلة معالجة كاملة شملت جمع البيانات،
( محلل ترميزTokenizer) ، أظهرت النتائج فعالية مشجعة رغم ندرة الموارد. وتكييف النماذج عبر التدريب اإلضافي،مخصص
مما يفتح آفاقًا لتطويرات مستقبلية ويسهم في تعزيز التمثيل الرقمي للغات اإلفريقية
الكلمات المفتاحية: اللغات، تقسيم الكلمات، المعالجة اآللية للغة الطبيعية، اللغات اإلفريقية، الفُلفُلدِه، الذكاء االصطناعي،نماذج اللغة
المحوال، التدريب اإلضافي،منخفضة الموارد
Summary
___________________________________________________________________________
This project aims to adapt artificial intelligence technologies to underrepresented African
languages, particularly Fulfulde. Relying on large language models (LLMs) and the
Transformer architecture, a complete processing pipeline was developed, including data
collection, a custom tokenizer, and fine-tuning. The results are promising despite limited
resources, opening the door to future improvements and contributing to the digital inclusion of
African languages.
Keywords : Language models, Artificial intelligence, Fulfulde, African languages, Natural
language processing, Tokenization, Low-resource languages, Fine-tuning, Transformers
Samere
___________________________________________________________________________
Ndee eɓɓoore ina yiɗi huutoraade karallaagal kesal ngam huutoraade ɗemɗe Afrik ɗe ngalaa
ɗo kaaɗi, haa teeŋti noon e ɗemɗe Fulfulde. E tuugnaade e mbaydiiji ɗemɗe mawɗe (LLMs) e
arsitektuur Transformer, pipeline gollorde timmunde feewnaama, ina heen mooftugol dokke,
tokenizer keeriiɗo, e fine-tuning. Njeñtudi ndii ina fotnoo wonde hay so tawii ngalu nguu ina
famɗi, ina uddita damal ngam ɓamtaare yeeso, ina wallita e naatgol ɗemɗe Afrik e nder dijital.
Kelme : Modeluuji ɗemɗe, Hakkille artifisiyel, Fulfulde, ɗemɗe Afrik, Gollirde ɗemɗe tago,
Tokenization, Ɗemɗe ɗe ngalaa kaɓirɗe, Fine-tuning, Transformers.
Intitulé et adresse complète de l’entreprise :
___________________________________________________________________________
Entreprise & email : SMART MS SA & contact@[Link]
Adresse & Tél : 67 Ilot M Tevragh-Zeina, Nouakchott-Est Mauritanie & +222 46254508
73