文本转音频(播客)
Escriba 不仅能把文档转成供 LLM 使用的文本 —— 它还能把 结果再变回声音。从任何一次转换中,打开 Audio / Podcast 选项 即可生成一份 MP3,聆听你的文档。
- 旁白 —— 单一嗓音从头到尾朗读整篇文档。
- 播客 —— 由 AI 围绕文档撰写一段简短的双主持人对话(主持人 + 专家),Escriba 用两个交替的嗓音为其配音并拼接成一体。 播客模式需要配置好 AI 提供方(它负责撰写脚本);旁白则不需要。
- 本地(Piper) —— 默认选项。嗓音完全离线地运行在你的服务器上 —— 文本永远不会离开你的机器。Escriba 内置了横跨西班牙语、英语、 葡萄牙语、法语、意大利语、德语和中文的 14 种嗓音。
- 云端(OpenAI) —— 可选,质量更高。使用你自己的 OpenAI API 密钥;只有当 你选择云端嗓音时,文本才会被发送给 OpenAI。非常适合没有 本地嗓音的语言(例如日语)。
就像一块录音棚控制面板,你可以选择:
- 嗓音 —— 语言 + 说话人(本地或云端)。
- 音调 —— 低 / 中 / 高。
- 语速 —— 慢 / 正常 / 快。
- 音量 —— 低 / 中 / 高。
内置的播放器让你在下载 MP3 之前先预览音频。
谁能用它,以及限制
Section titled “谁能用它,以及限制”音频生成对 ANGEL 和 DIOS 级别开放(与音频/视频 及 OCR 一样)。由于 Piper 在 CPU 上进行合成,每次请求都有一个字符 上限来保护服务器 —— 可按角色配置:
| 设置 | 默认值 | 含义 |
|---|---|---|
GOD_TTS_CHARS | 0 | DIOS:无限制 |
ANGEL_TTS_CHARS | 100000 | ANGEL:每份 MP3 的最大字符数 |
HUMAN_TTS_CHARS | 20000 | HUMANO(仅当 HUMAN_TTS=true 时) |
TTS_TIMEOUT | 600 | 每次合成的最大秒数 |
TTS_OPENAI_MODEL | tts-1 | 云端模型(tts-1 或 tts-1-hd) |
完整列表请参见配置。一份非常长的文档配上 本地嗓音可能需要一段时间来合成 —— 这是 CPU 的缘故,并不是 bug。