Lien M
Nom du Space Framework Fonctionnalités clés Input Output
HF u
Analyse de
documents multi-
formats (PDF, DOCX,
TXT, HTML, Fichier
L
Markdown). Extrait la upload ou
Smart Document Texte structuré par D
structure URL (PDF,
Parser HF Docling sections + entités (m
hiérarchique du DOCX,
(docling_free) – Space (Unstructured) extraites (JSON ou O
document (sections) TXT,
hellorahulk texte formaté) in
et les métadonnées HTML,
~
(entités nommées, MD)
scores de confiance)
automatiquement
1 2 .
Conversion de
documents en texte
Markdown ou JSON
avec conservation de Texte converti
la structure et des Fichier (Markdown ou
DoclingConverter HF Docling métadonnées 4 . document JSON) + D
– yasserrmd Space (DocumentConverter) Fournit le texte (PDF, etc.) métadonnées (e.g. (p
converti ainsi qu’un upload attributs
extrait des disponibles)
métadonnées
disponibles du
document 5 .
Banc d’essai de
plusieurs parsers
open source de PDF.
Permet de téléverser
un PDF et de voir le
découpage du
Texte découpé
PDF Parsers contenu par P
HF Unstructured, PDF selon chaque
Playground – différentes librairies (1
Space PyMuPDF, etc. (upload) parser, affiché pour
chunking-ai (PyMuPDF, s
comparaison
Unstructured,
PDFPlumber…). Utile
pour comparer la
qualité du chunking
et de l’extraction
selon la méthode 6 .
1
Lien M
Nom du Space Framework Fonctionnalités clés Input Output
HF u
Conversion rapide de
PDF en Markdown
structuré avec
visualisation de la
mise en page. Extrait Markdown du
FastPDF Parser L
HF hiérarchiquement PDF document avec
Demo – chunking- Unstructured + viz (P
Space titres, paragraphes, (upload) structure (titres,
ai e
listes, etc., en sections, images…)
préservant le format
(markdown) pour un
rendu fidèle du
document.
Découpe un texte
brut en chunks de
taille gérable.
Paramètres
ajustables : taille max
–
(caractères ou Texte
Liste de chunks de m
Chunk Visualizer HF LangChain tokens), libre
texte (affichés et to
– m-ric Space TextSplitter chevauchement, (champ
téléchargeables) v
séparateurs texte)
H
personnalisés 7 .
Visualisation
immédiate des
chunks résultants,
utile pour le RAG.
Pipeline complet :
découpe
sémantique d’un
corpus puis calcul
d’embeddings
locaux. Charge un
dataset Hugging
M
Face, le segmente
Données Dataset de chunks d
selon stratégie
textuelles + vecteurs H
Chunk & Embed – HF LangChain + HF choisie (récursive, par
(dataset d’embedding pour B
sergeipetrov Space Embeddings séquence, taille fixe)
HF ou chaque chunk b
9 8 , pousse le
texte) (JSONL) v
dataset de chunks sur
le Hub, génère
ensuite les
embeddings pour
chaque chunk et les
stocke dans un
nouveau dataset 10
11 .
2
Lien M
Nom du Space Framework Fonctionnalités clés Input Output
HF u
Chaîne
audio→texte→chunks
sémantiques.
Transcrit un audio/
JSON/CSV des
vidéo (YouTube ou
chunks :
fichier) en segments
URL chunk_id , W
texte avec Whisper
Transcribe & YouTube semantic_chunk (O
HF (modèle local) puis
Semantic Chunks Whisper + NLTK ou fichier (texte), W
Space groupe les phrases
– vsrinivas audio/ start_time , b
en chunks ~15s
vidéo end_time , A
cohérents
chunk_length
sémantiquement 14
16
15 . Chaque chunk
est annoté avec son
horodatage début/
fin et durée.
Pipeline automatique
pour préparer des
données QA à partir
de documents.
Parsing du PDF en
texte brut, chunking
configurable du texte
(plusieurs méthodes/ M
AutoRAG Data tailles au choix) 17 , Chunks extraits + o
HF Unstructured + LLM PDF
Creation – puis génération de dataset QA généré Q
Space (optionnel) (upload)
AutoRAG paires question- (CSV/JSON) in
réponse locales pour O
évaluation. Permet
d’évaluer différents
paramètres de chunk
(taille,
chevauchement) et
d’obtenir un dataset
QA sur mesure.
Sources : 1 3 4 5 6 7 8 10 16 17
1 2 3 [Link] · hellorahulk/docling_free at main
[Link]
4 5 [Link] · yasserrmd/DoclingConverter at main
[Link]
6 PDFParsersPlayground - a Hugging Face Space by chunking-ai
[Link]
3
7 Chunk Visualizer - a Hugging Face Space by m-ric
[Link]
8 9 10 11 13 [Link] · sergeipetrov/chunk-embed at main
[Link]
12 [Link] · Warlord-K/AVA-Ollama at main
[Link]
14 15 16 [Link] · vsrinivas/Transcribe_the_audio_and_get_semantic_chunks at main
[Link]
17 AutoRAG Data Creation - a Hugging Face Space by AutoRAG
[Link]