Documents

WivenLLM répond à partir de vos documents. Cette page explique comment les faire entrer, ce qui leur arrive, et comment obtenir de bons résultats.


Les deux étapes de l'import

C'est le point qui prête le plus souvent à confusion.

Étape 1 — Extraction. Le fichier est converti en texte. Il rejoint la bibliothèque de documents, commune à l'instance. À ce stade, il n'est interrogeable dans aucun espace.

Étape 2 — Ajout à un espace. Vous sélectionnez le document dans la bibliothèque et l'ajoutez à un espace de travail. Il est alors découpé, vectorisé et indexé pour cet espace.

Un même document peut être ajouté à plusieurs espaces : il n'est extrait qu'une fois, et indexé séparément dans chacun.

Le glisser-déposer directement dans une conversation enchaîne les deux étapes automatiquement.


Comment importer

Fichiers. Glissez-déposez dans la conversation, ou téléversez depuis le gestionnaire de documents. Plusieurs fichiers à la fois sont acceptés.

Pages web. Collez une URL. Le contenu de la page est extrait ; publicités et menus de navigation sont écartés au mieux.

Site complet. Un import récursif suit les liens depuis une page de départ, sur une profondeur et un nombre de pages que vous fixez. À utiliser avec mesure : la profondeur fait croître le volume très vite.

Sources externes. Des connecteurs importent directement depuis :

Source Ce qui est importé
Dépôts de code (GitHub, GitLab) Fichiers d'un dépôt, filtrables par branche et par extension
Confluence Pages d'un espace
Wikis d'entreprise Pages et arborescence
Gestion documentaire (Paperless-ngx) Documents et métadonnées
Coffres de notes (Obsidian) Notes et liens entre notes
Vidéos YouTube Transcription

Depuis l'API. Téléversement de fichier, de texte brut ou d'URL, pour alimenter WivenLLM depuis vos propres applications. → API développeur


Formats acceptés

Texte et bureautique.txt, .md, .csv, .json, .html, formats de documentation technique, .pdf, .docx, .pptx, .xlsx, formats OpenDocument.

Messagerie et livres — archives .mbox, livres numériques .epub.

Images.png, .jpg, .webp, dont le texte est extrait par reconnaissance de caractères.

Audio et vidéo — principaux formats audio et .mp4, transcrits automatiquement. Une réunion peut aussi être enregistrée directement depuis l'application → Réunions.

Liste détaillée

Ce qui marche moins bien

  • PDF scannés sans couche texte — la reconnaissance de caractères s'applique, avec un résultat dépendant de la qualité du scan. Un scan penché ou de faible résolution donne un texte médiocre, donc des réponses médiocres.
  • Tableurs complexes — les formules, les cellules fusionnées et les feuilles très larges se linéarisent mal. Pour des données tabulaires importantes, exposer une base via la compétence SQL de l'agent donne de bien meilleurs résultats qu'un tableur indexé.
  • Documents à mise en page très riche — le texte est extrait ; les informations portées uniquement par la disposition visuelle se perdent.

Ce qui arrive au texte : le découpage

Un document entier ne tient pas dans le contexte d'un modèle. Il est donc découpé en fragments, et ce sont les fragments qui sont retrouvés à la question.

Deux paramètres, réglables par un administrateur dans Réglages → Découpage du texte :

  • Taille des fragments — le nombre de caractères par fragment. Des fragments courts donnent des résultats précis mais parfois privés de contexte ; des fragments longs conservent le contexte mais diluent la pertinence.
  • Recouvrement — le nombre de caractères repris d'un fragment au suivant, pour ne pas couper une idée en deux.

Les valeurs par défaut conviennent à la plupart des corpus. Les modifier n'affecte que les documents indexés ensuite : les index existants gardent leur découpage jusqu'à réindexation.


Organiser la bibliothèque

  • Dossiers. Rangez les documents par client, par projet ou par nature. Les dossiers organisent la bibliothèque ; ils ne changent rien à la recherche.
  • Déplacement. Un document peut être déplacé entre dossiers sans perdre son indexation.
  • Suppression. Supprimer un document de la bibliothèque le retire de tous les espaces et efface le texte extrait.

Synchronisation automatique — fonction bêta

Pour les documents importés depuis une URL ou un connecteur, une synchronisation périodique peut détecter les changements à la source et réindexer le contenu mis à jour.

Elle s'active dans Réglages → Fonctions bêta, puis se règle document par document. Utile pour une documentation vivante ; inutile pour un corpus figé.


Bonnes pratiques

Importez ce qui est pertinent, pas tout. Un corpus propre donne de meilleures réponses qu'un corpus exhaustif. Les documents obsolètes répondent aussi bien que les autres — ils remontent avec la même autorité apparente.

Vérifiez le texte extrait. Après l'import d'un PDF difficile, posez une question dont vous connaissez la réponse. Si l'extrait cité est illisible, le document est mal extrait ; le convertir en amont donnera un meilleur résultat.

Nommez explicitement vos fichiers. Le nom du document apparaît dans les citations. Contrat-Dupont-2026.pdf est utile ; scan_003.pdf ne l'est pas.

Retirez avant d'ajouter une nouvelle version. Deux versions d'un même contrat indexées simultanément produisent des réponses contradictoires, sans que le modèle sache laquelle fait foi.

Épinglez avec parcimonie. Un document épinglé est injecté en entier à chaque message. → Espaces de travail