第22篇:语音合成——AI 开口说话
Hermes 功能详解第22篇:语音与 TTS。把文字变成语音,还能自定义音色和语速。
这篇教程将带你了解 Hermes Agent 的语音合成功能,教你怎么让 AI 在聊天里“开口说话”。
为什么需要语音?
想象一下,你在做饭时收到一条长消息,盯着屏幕读很麻烦。如果 AI 能直接把回复“说”出来,你一边炒菜一边听,是不是方便多了?Hermes Agent 内置了 11 种语音引擎,从免费到付费,任你挑选。
第1步:选一个“嗓子”
打开配置文件 ~/.hermes/config.yaml,找到 tts 部分。默认用的是 Edge TTS,完全免费、无需注册,效果也不错,适合新手体验。
想换更高级的声音?把 provider 改一下就行:
tts:
provider: "elevenlabs" # 换成 ElevenLabs,音质“天花板”
小提示:如果你有 Nous Portal 付费订阅,可以免费用 OpenAI TTS,不用单独申请 API Key。
第2步:配置你的“嗓子”
每种引擎都有自己的设置项。比如用 Edge TTS,可以选声音和语速:
tts:
provider: "edge"
edge:
voice: "zh-CN-XiaoxiaoNeural" # 中文女声,温柔好听
speed: 1.0 # 1.0 是正常语速,调大更快
用 Gemini TTS 的话,还能写“人设提示词”,让 AI 用特定语气说话。比如创建一个 butler-voice.md 文件,里面写“你是一位英国老管家,说话沉稳、礼貌”,然后:
tts:
provider: "gemini"
gemini:
voice: "Kore"
persona_prompt_file: "~/.hermes/tts/butler-voice.md"
AI 就会用管家的腔调回复你,很有趣。
第3步:测试一下
在 CLI 里直接发消息,AI 回复后,音频会保存到 ~/.hermes/audio_cache/ 文件夹。在 Telegram 或 Discord 里,AI 会直接发语音气泡,点一下就能听。
第4步:处理长文本
如果 AI 回复特别长,超过引擎的单次限制(比如 Edge 是 5000 字符),Hermes 会自动把文本切成几段,按顺序合成,不会丢内容。你不需要做任何事,它自己会搞定。
第5步:高级玩法(可选)
- 加音效标签:Gemini 3.1 和 xAI 支持在文本里加
[whispers]、[laughs]这样的标签,AI 会真的用气声说话或笑出来。开启方式:
tts:
gemini:
audio_tags: true
- 调语速:全局语速在
tts.speed设置,每个引擎可以单独覆盖。比如 OpenAI 想快一点,就写tts.openai.speed: 1.5。
总结
让 AI 开口说话,只需三步:选引擎 → 配声音 → 发消息。免费方案足够日常使用,付费方案音质更惊艳。语音功能让 AI 从“屏幕里的文字”变成了“耳边的小伙伴”,互动感直接拉满。
下篇预告:AI 会说话了,那它能“听懂”我们说话吗?下一篇我们聊聊语音转文字——让 AI 听懂你的语音消息。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/subagent-delegation