0% ont trouvé ce document utile (0 vote)
14 vues4 pages

API Hugging Face pour l'analyse de documents

Le document présente une série d'outils disponibles sur Hugging Face pour l'analyse et la conversion de documents, ainsi que pour le traitement de données audio et textuelles. Chaque outil est décrit avec ses fonctionnalités clés, les formats d'entrée et de sortie, et inclut des options pour le chunking et l'extraction de métadonnées. L'ensemble des outils permet de manipuler divers types de documents et d'audio pour des applications variées telles que la création de datasets QA et la transcription sémantique.

Transféré par

vadrozerti
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
14 vues4 pages

API Hugging Face pour l'analyse de documents

Le document présente une série d'outils disponibles sur Hugging Face pour l'analyse et la conversion de documents, ainsi que pour le traitement de données audio et textuelles. Chaque outil est décrit avec ses fonctionnalités clés, les formats d'entrée et de sortie, et inclut des options pour le chunking et l'extraction de métadonnées. L'ensemble des outils permet de manipuler divers types de documents et d'audio pour des applications variées telles que la création de datasets QA et la transcription sémantique.

Transféré par

vadrozerti
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Lien M

Nom du Space Framework Fonctionnalités clés Input Output


HF u

Analyse de
documents multi-
formats (PDF, DOCX,
TXT, HTML, Fichier
L
Markdown). Extrait la upload ou
Smart Document Texte structuré par D
structure URL (PDF,
Parser HF Docling sections + entités (m
hiérarchique du DOCX,
(docling_free) – Space (Unstructured) extraites (JSON ou O
document (sections) TXT,
hellorahulk texte formaté) in
et les métadonnées HTML,
~
(entités nommées, MD)
scores de confiance)
automatiquement
1 2 .

Conversion de
documents en texte
Markdown ou JSON
avec conservation de Texte converti
la structure et des Fichier (Markdown ou
DoclingConverter HF Docling métadonnées 4 . document JSON) + D
– yasserrmd Space (DocumentConverter) Fournit le texte (PDF, etc.) métadonnées (e.g. (p
converti ainsi qu’un upload attributs
extrait des disponibles)
métadonnées
disponibles du
document 5 .

Banc d’essai de
plusieurs parsers
open source de PDF.
Permet de téléverser
un PDF et de voir le
découpage du
Texte découpé
PDF Parsers contenu par P
HF Unstructured, PDF selon chaque
Playground – différentes librairies (1
Space PyMuPDF, etc. (upload) parser, affiché pour
chunking-ai (PyMuPDF, s
comparaison
Unstructured,
PDFPlumber…). Utile
pour comparer la
qualité du chunking
et de l’extraction
selon la méthode 6 .

1
Lien M
Nom du Space Framework Fonctionnalités clés Input Output
HF u

Conversion rapide de
PDF en Markdown
structuré avec
visualisation de la
mise en page. Extrait Markdown du
FastPDF Parser L
HF hiérarchiquement PDF document avec
Demo – chunking- Unstructured + viz (P
Space titres, paragraphes, (upload) structure (titres,
ai e
listes, etc., en sections, images…)
préservant le format
(markdown) pour un
rendu fidèle du
document.

Découpe un texte
brut en chunks de
taille gérable.
Paramètres
ajustables : taille max

(caractères ou Texte
Liste de chunks de m
Chunk Visualizer HF LangChain tokens), libre
texte (affichés et to
– m-ric Space TextSplitter chevauchement, (champ
téléchargeables) v
séparateurs texte)
H
personnalisés 7 .
Visualisation
immédiate des
chunks résultants,
utile pour le RAG.

Pipeline complet :
découpe
sémantique d’un
corpus puis calcul
d’embeddings
locaux. Charge un
dataset Hugging
M
Face, le segmente
Données Dataset de chunks d
selon stratégie
textuelles + vecteurs H
Chunk & Embed – HF LangChain + HF choisie (récursive, par
(dataset d’embedding pour B
sergeipetrov Space Embeddings séquence, taille fixe)
HF ou chaque chunk b
9 8 , pousse le
texte) (JSONL) v
dataset de chunks sur
le Hub, génère
ensuite les
embeddings pour
chaque chunk et les
stocke dans un
nouveau dataset 10
11 .

2
Lien M
Nom du Space Framework Fonctionnalités clés Input Output
HF u

Chaîne
audio→texte→chunks
sémantiques.
Transcrit un audio/
JSON/CSV des
vidéo (YouTube ou
chunks :
fichier) en segments
URL chunk_id , W
texte avec Whisper
Transcribe & YouTube semantic_chunk (O
HF (modèle local) puis
Semantic Chunks Whisper + NLTK ou fichier (texte), W
Space groupe les phrases
– vsrinivas audio/ start_time , b
en chunks ~15s
vidéo end_time , A
cohérents
chunk_length
sémantiquement 14
16
15 . Chaque chunk

est annoté avec son


horodatage début/
fin et durée.

Pipeline automatique
pour préparer des
données QA à partir
de documents.
Parsing du PDF en
texte brut, chunking
configurable du texte
(plusieurs méthodes/ M
AutoRAG Data tailles au choix) 17 , Chunks extraits + o
HF Unstructured + LLM PDF
Creation – puis génération de dataset QA généré Q
Space (optionnel) (upload)
AutoRAG paires question- (CSV/JSON) in
réponse locales pour O
évaluation. Permet
d’évaluer différents
paramètres de chunk
(taille,
chevauchement) et
d’obtenir un dataset
QA sur mesure.

Sources : 1 3 4 5 6 7 8 10 16 17

1 2 3 [Link] · hellorahulk/docling_free at main


[Link]

4 5 [Link] · yasserrmd/DoclingConverter at main


[Link]

6 PDFParsersPlayground - a Hugging Face Space by chunking-ai


[Link]

3
7 Chunk Visualizer - a Hugging Face Space by m-ric
[Link]

8 9 10 11 13 [Link] · sergeipetrov/chunk-embed at main


[Link]

12 [Link] · Warlord-K/AVA-Ollama at main


[Link]

14 15 16 [Link] · vsrinivas/Transcribe_the_audio_and_get_semantic_chunks at main


[Link]

17 AutoRAG Data Creation - a Hugging Face Space by AutoRAG


[Link]

Vous aimerez peut-être aussi