Formats de fichiers
Texte et documentation
| Extension | Traitement |
|---|---|
.txt |
Lecture directe |
.md |
Lecture directe, structure conservée |
.csv |
Lecture directe, ligne par ligne |
.json |
Lecture directe |
.html |
Extraction du texte, balises retirées |
.org, .adoc, .rst |
Lecture directe |
Bureautique
| Extension | Traitement |
|---|---|
.pdf |
Extraction du texte ; reconnaissance de caractères si le PDF est une image |
.docx |
Extraction du texte et de la structure |
.pptx |
Extraction du texte des diapositives |
.xlsx |
Extraction des cellules, feuille par feuille |
.odt, .odp |
Formats OpenDocument, texte et présentation |
Le format
.doc(Word antérieur à 2007) n'est pas pris en charge. Convertissez en.docxau préalable.
Messagerie et livres
| Extension | Traitement |
|---|---|
.mbox |
Archive de messagerie ; chaque message devient un élément indexable |
.epub |
Livre numérique, texte extrait chapitre par chapitre |
Images
| Extensions | Traitement |
|---|---|
.png, .jpg, .webp |
Reconnaissance de caractères — le texte présent dans l'image est extrait |
L'image elle-même n'est pas indexée : seul le texte qu'elle contient l'est. La qualité dépend directement de la netteté et de la résolution.
Audio et vidéo
| Extensions | Traitement |
|---|---|
.mp3, .wav, .m4a, .ogg, .opus, .webm |
Transcription automatique |
.mp4, .mpeg |
Extraction de la piste audio puis transcription |
La transcription intégrée s'exécute localement, sans clé ni sortie réseau. La durée du traitement croît avec celle de l'enregistrement.
Sources distantes
| Source | Ce qui est importé |
|---|---|
| Page web | Contenu principal, menus et publicités écartés au mieux |
| Site complet | Exploration récursive, profondeur et nombre de pages paramétrables |
| Dépôts de code (GitHub, GitLab) | Fichiers d'un dépôt, filtrables par branche et par extension |
| Confluence | Pages d'un espace |
| Wikis d'entreprise | Pages et arborescence |
| Gestion documentaire (Paperless-ngx) | Documents et métadonnées |
| Coffres de notes (Obsidian) | Notes et liens |
| Vidéos YouTube | Transcription |
Ce qui donne de mauvais résultats
PDF scannés de faible qualité. La reconnaissance de caractères s'applique, mais un scan penché, taché ou en basse résolution produit un texte fautif — donc des réponses fautives.
Tableurs complexes. Cellules fusionnées, formules, tableaux croisés et feuilles très larges se linéarisent mal. Pour des données tabulaires importantes, la compétence SQL de l'agent donne de bien meilleurs résultats. → Compétences
Mises en page très riches. Le texte est extrait ; les informations portées uniquement par la disposition visuelle — un schéma, un tableau graphique — se perdent.
Enregistrements audio de mauvaise qualité. Voix lointaines, chevauchements de parole et bruit de fond dégradent fortement la transcription.
Documents très volumineux. Un document de plusieurs milliers de pages produit un grand nombre de fragments et dilue la recherche. Découpez-le en unités cohérentes lorsque c'est possible.
Vérifier ce qui a été extrait
La liste exacte des formats acceptés par votre instance est disponible dans l'interface d'import, et par l'API. → API développeur
Après l'import d'un document difficile, posez une question dont vous connaissez la réponse et regardez l'extrait cité : c'est le moyen le plus rapide de savoir si l'extraction a réussi.
