Texte vers audio (podcast)
Escriba ne se contente pas de transformer des documents en texte pour un LLM — il peut aussi retransformer le résultat en son. À partir de n’importe quelle conversion, ouvrez l’option Audio / Podcast pour générer un MP3 et écouter votre document.
Deux modes
Section intitulée « Deux modes »- Narration — une seule voix lit le document de bout en bout.
- Podcast — une IA rédige un court dialogue à deux animateurs sur le document (animateur + expert), et Escriba le met en voix avec deux voix alternées avant de tout assembler. Le mode Podcast nécessite un fournisseur d’IA configuré (il rédige le script) ; la narration, non.
Deux moteurs
Section intitulée « Deux moteurs »- Local (Piper) — l’option par défaut. Les voix tournent sur votre serveur, entièrement hors ligne — le texte ne quitte jamais votre machine. Escriba est livré avec 14 voix en espagnol, anglais, portugais, français, italien, allemand et chinois.
- Cloud (OpenAI) — optionnel, de meilleure qualité. Utilise votre clé API OpenAI ; le texte n’est envoyé à OpenAI que lorsque vous choisissez une voix cloud. Idéal pour les langues sans voix locale (par ex. le japonais).
Réglages
Section intitulée « Réglages »Comme sur une console de studio, vous choisissez :
- Voix — langue + locuteur (local ou cloud).
- Hauteur — basse / moyenne / aiguë.
- Vitesse — lente / normale / rapide.
- Volume — bas / moyen / élevé.
Un lecteur intégré vous permet de prévisualiser l’audio avant de télécharger le MP3.
Qui peut l’utiliser et limites
Section intitulée « Qui peut l’utiliser et limites »La génération audio est accessible aux niveaux ANGEL et DIOS (comme l’audio/vidéo et l’OCR). Comme Piper effectue la synthèse sur le CPU, il existe une limite de caractères par requête pour protéger le serveur — configurable par rôle :
| Réglage | Par défaut | Signification |
|---|---|---|
GOD_TTS_CHARS | 0 | DIOS : aucune limite |
ANGEL_TTS_CHARS | 100000 | ANGEL : nombre maximal de caractères par MP3 |
HUMAN_TTS_CHARS | 20000 | HUMANO (uniquement si HUMAN_TTS=true) |
TTS_TIMEOUT | 600 | Durée maximale en secondes par synthèse |
TTS_OPENAI_MODEL | tts-1 | Modèle cloud (tts-1 ou tts-1-hd) |
Consultez la Configuration pour la liste complète. Un document très long avec une voix locale peut prendre un certain temps à synthétiser — c’est le CPU, pas un bug.