Images, vidéos et voix
Au-delà du texte, WivenLLM sait produire des images et de courtes vidéos, lire les réponses à voix haute et transcrire la parole. Ces fonctions sont optionnelles : elles n'existent que si un administrateur les a configurées.
Génération d'images
Utilisation
Dans une conversation :
/image un plan de coupe schématique d'une pompe à chaleur, style technique
L'image apparaît dans la conversation et peut être téléchargée. Un agent peut également générer une image dans le cours d'une tâche, si la compétence correspondante est activée.
Configuration — administrateur
Réglages → Génération d'images. Deux familles de fournisseurs :
Locaux — les modèles s'exécutent sur votre machine, aucune donnée ne sort. Cela suppose du matériel adapté, en pratique une carte graphique. Les installations locales prises en charge couvrent aussi bien un moteur intégré géré par WivenLLM que des serveurs de génération d'images que vous exploitez déjà.
Externes — les principaux services de génération d'images commerciaux sont pris en charge. Vos descriptions sont alors transmises au fournisseur choisi.
Bon à savoir
- Les images générées sont attachées à la conversation.
- Décrivez le style autant que le sujet : « schéma technique en noir et blanc, fond blanc » donne un résultat très différent de « illustration ».
- Un modèle de génération d'images ne sait pas écrire du texte lisible de manière fiable ; n'en attendez pas des visuels comportant des libellés exacts.
Génération de vidéos
Même principe, avec la commande /video.
/video une vue aérienne lente d'un chantier de construction, 5 secondes
Attentes réalistes : il s'agit de séquences courtes de quelques secondes. La génération est longue — de plusieurs minutes à beaucoup plus selon le fournisseur et le matériel — et bien plus exigeante que l'image.
La configuration se fait dans Réglages → Génération de vidéos, avec le même
choix entre exécution locale et service externe.
Écouter les réponses (synthèse vocale)
Un bouton de lecture apparaît sous chaque réponse.
Options disponibles :
- Voix du navigateur (par défaut) — utilise la synthèse vocale intégrée au système. Aucune configuration, aucune donnée envoyée nulle part, qualité variable selon le système d'exploitation.
- Voix locale de haute qualité — un moteur téléchargé qui s'exécute dans le navigateur, plus naturel que la voix système, toujours sans sortie réseau.
- Services externes — les principaux fournisseurs de synthèse vocale sont pris en charge pour une qualité supérieure ; le texte des réponses est alors transmis au fournisseur.
Configuration dans Réglages → Préférences audio.
Dicter ses messages (reconnaissance vocale)
Un bouton de microphone dans la zone de saisie transcrit votre parole en texte. Par défaut, la reconnaissance vocale du navigateur est utilisée.
Point de confidentialité à connaître : la reconnaissance vocale intégrée aux navigateurs transmet généralement l'audio aux serveurs de l'éditeur du navigateur. Sur une installation dont l'exigence est le tout-local, c'est une sortie de données à ne pas négliger — vérifiez le comportement du navigateur utilisé, ou désactivez la fonction.
Transcription des fichiers audio et vidéo
Distincte de la dictée : lorsqu'un fichier audio ou vidéo est importé comme document, il est transcrit puis indexé comme n'importe quel texte.
Le moteur de transcription intégré fonctionne localement, sans clé ni sortie
réseau. Un service externe peut lui être substitué dans
Réglages → Préférences de transcription.
Usages courants : enregistrements de réunions, entretiens, formations, messages vocaux. La transcription devient interrogeable comme un document ordinaire — « qu'avait-on décidé au sujet du budget lors de la réunion du 12 ? ».
Pour enregistrer une réunion directement depuis l'application et en obtenir un compte rendu structuré, voir Réunions.
Qualité : dépend de la netteté de l'enregistrement, du nombre de locuteurs et des chevauchements de parole. Un enregistrement de réunion capté par un micro d'ordinateur portable donne un résultat inégal.
Ce qui sort du réseau
| Fonction | En configuration locale | En configuration externe |
|---|---|---|
| Génération d'images | Rien | La description part chez le fournisseur |
| Génération de vidéos | Rien | La description part chez le fournisseur |
| Synthèse vocale | Rien | Le texte de la réponse part chez le fournisseur |
| Reconnaissance vocale | Dépend du navigateur — à vérifier | L'audio part chez le fournisseur |
| Transcription de fichiers | Rien | Le fichier part chez le fournisseur |
