Images, vidéos et voix

Au-delà du texte, WivenLLM sait produire des images et de courtes vidéos, lire les réponses à voix haute et transcrire la parole. Ces fonctions sont optionnelles : elles n'existent que si un administrateur les a configurées.


Génération d'images

Utilisation

Dans une conversation :

/image un plan de coupe schématique d'une pompe à chaleur, style technique

L'image apparaît dans la conversation et peut être téléchargée. Un agent peut également générer une image dans le cours d'une tâche, si la compétence correspondante est activée.

Configuration — administrateur

Réglages → Génération d'images. Deux familles de fournisseurs :

Locaux — les modèles s'exécutent sur votre machine, aucune donnée ne sort. Cela suppose du matériel adapté, en pratique une carte graphique. Les installations locales prises en charge couvrent aussi bien un moteur intégré géré par WivenLLM que des serveurs de génération d'images que vous exploitez déjà.

Externes — les principaux services de génération d'images commerciaux sont pris en charge. Vos descriptions sont alors transmises au fournisseur choisi.

Bon à savoir

  • Les images générées sont attachées à la conversation.
  • Décrivez le style autant que le sujet : « schéma technique en noir et blanc, fond blanc » donne un résultat très différent de « illustration ».
  • Un modèle de génération d'images ne sait pas écrire du texte lisible de manière fiable ; n'en attendez pas des visuels comportant des libellés exacts.

Génération de vidéos

Même principe, avec la commande /video.

/video une vue aérienne lente d'un chantier de construction, 5 secondes

Attentes réalistes : il s'agit de séquences courtes de quelques secondes. La génération est longue — de plusieurs minutes à beaucoup plus selon le fournisseur et le matériel — et bien plus exigeante que l'image.

La configuration se fait dans Réglages → Génération de vidéos, avec le même choix entre exécution locale et service externe.


Écouter les réponses (synthèse vocale)

Un bouton de lecture apparaît sous chaque réponse.

Options disponibles :

  • Voix du navigateur (par défaut) — utilise la synthèse vocale intégrée au système. Aucune configuration, aucune donnée envoyée nulle part, qualité variable selon le système d'exploitation.
  • Voix locale de haute qualité — un moteur téléchargé qui s'exécute dans le navigateur, plus naturel que la voix système, toujours sans sortie réseau.
  • Services externes — les principaux fournisseurs de synthèse vocale sont pris en charge pour une qualité supérieure ; le texte des réponses est alors transmis au fournisseur.

Configuration dans Réglages → Préférences audio.


Dicter ses messages (reconnaissance vocale)

Un bouton de microphone dans la zone de saisie transcrit votre parole en texte. Par défaut, la reconnaissance vocale du navigateur est utilisée.

Point de confidentialité à connaître : la reconnaissance vocale intégrée aux navigateurs transmet généralement l'audio aux serveurs de l'éditeur du navigateur. Sur une installation dont l'exigence est le tout-local, c'est une sortie de données à ne pas négliger — vérifiez le comportement du navigateur utilisé, ou désactivez la fonction.


Transcription des fichiers audio et vidéo

Distincte de la dictée : lorsqu'un fichier audio ou vidéo est importé comme document, il est transcrit puis indexé comme n'importe quel texte.

Le moteur de transcription intégré fonctionne localement, sans clé ni sortie réseau. Un service externe peut lui être substitué dans Réglages → Préférences de transcription.

Usages courants : enregistrements de réunions, entretiens, formations, messages vocaux. La transcription devient interrogeable comme un document ordinaire — « qu'avait-on décidé au sujet du budget lors de la réunion du 12 ? ».

Pour enregistrer une réunion directement depuis l'application et en obtenir un compte rendu structuré, voir Réunions.

Qualité : dépend de la netteté de l'enregistrement, du nombre de locuteurs et des chevauchements de parole. Un enregistrement de réunion capté par un micro d'ordinateur portable donne un résultat inégal.


Ce qui sort du réseau

Fonction En configuration locale En configuration externe
Génération d'images Rien La description part chez le fournisseur
Génération de vidéos Rien La description part chez le fournisseur
Synthèse vocale Rien Le texte de la réponse part chez le fournisseur
Reconnaissance vocale Dépend du navigateur — à vérifier L'audio part chez le fournisseur
Transcription de fichiers Rien Le fichier part chez le fournisseur