Formats de fichiers


Texte et documentation

Extension Traitement
.txt Lecture directe
.md Lecture directe, structure conservée
.csv Lecture directe, ligne par ligne
.json Lecture directe
.html Extraction du texte, balises retirées
.org, .adoc, .rst Lecture directe

Bureautique

Extension Traitement
.pdf Extraction du texte ; reconnaissance de caractères si le PDF est une image
.docx Extraction du texte et de la structure
.pptx Extraction du texte des diapositives
.xlsx Extraction des cellules, feuille par feuille
.odt, .odp Formats OpenDocument, texte et présentation

Le format .doc (Word antérieur à 2007) n'est pas pris en charge. Convertissez en .docx au préalable.


Messagerie et livres

Extension Traitement
.mbox Archive de messagerie ; chaque message devient un élément indexable
.epub Livre numérique, texte extrait chapitre par chapitre

Images

Extensions Traitement
.png, .jpg, .webp Reconnaissance de caractères — le texte présent dans l'image est extrait

L'image elle-même n'est pas indexée : seul le texte qu'elle contient l'est. La qualité dépend directement de la netteté et de la résolution.


Audio et vidéo

Extensions Traitement
.mp3, .wav, .m4a, .ogg, .opus, .webm Transcription automatique
.mp4, .mpeg Extraction de la piste audio puis transcription

La transcription intégrée s'exécute localement, sans clé ni sortie réseau. La durée du traitement croît avec celle de l'enregistrement.


Sources distantes

Source Ce qui est importé
Page web Contenu principal, menus et publicités écartés au mieux
Site complet Exploration récursive, profondeur et nombre de pages paramétrables
Dépôts de code (GitHub, GitLab) Fichiers d'un dépôt, filtrables par branche et par extension
Confluence Pages d'un espace
Wikis d'entreprise Pages et arborescence
Gestion documentaire (Paperless-ngx) Documents et métadonnées
Coffres de notes (Obsidian) Notes et liens
Vidéos YouTube Transcription

Ce qui donne de mauvais résultats

PDF scannés de faible qualité. La reconnaissance de caractères s'applique, mais un scan penché, taché ou en basse résolution produit un texte fautif — donc des réponses fautives.

Tableurs complexes. Cellules fusionnées, formules, tableaux croisés et feuilles très larges se linéarisent mal. Pour des données tabulaires importantes, la compétence SQL de l'agent donne de bien meilleurs résultats. → Compétences

Mises en page très riches. Le texte est extrait ; les informations portées uniquement par la disposition visuelle — un schéma, un tableau graphique — se perdent.

Enregistrements audio de mauvaise qualité. Voix lointaines, chevauchements de parole et bruit de fond dégradent fortement la transcription.

Documents très volumineux. Un document de plusieurs milliers de pages produit un grand nombre de fragments et dilue la recherche. Découpez-le en unités cohérentes lorsque c'est possible.


Vérifier ce qui a été extrait

La liste exacte des formats acceptés par votre instance est disponible dans l'interface d'import, et par l'API. → API développeur

Après l'import d'un document difficile, posez une question dont vous connaissez la réponse et regardez l'extrait cité : c'est le moyen le plus rapide de savoir si l'extraction a réussi.