实战:用语音模式和 AI 对话
Hermes 实战教程第6篇:使用语音模式。动嘴指挥 AI。
这篇教程教你如何让 Hermes Agent 不只是“打字聊天”,而是变成能听会说的语音助手——在电脑前、手机上,甚至 Discord 语音频道里跟它说话。
第 1 步:先确保文字对话正常
语音功能是“锦上添花”,基础没打好,语音也跑不起来。先启动 Hermes:
hermes
然后随便问一句:“你有什么工具?”如果它能正常回答,再继续下一步。
第 2 步:安装语音相关“零件”
Hermes 的语音功能像乐高积木,需要什么装什么。打开终端,依次执行:
# 麦克风 + 播放声音(CLI 语音模式必需)
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# 让 Telegram / Discord 支持语音回复
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# 想用 ElevenLabs 高级音色(可选)
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
偷懒方案:直接装全部功能:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
第 3 步:安装系统依赖(相当于装“声卡驱动”)
macOS:
brew install portaudio ffmpeg opus espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0 espeak-ng
别被名字吓到,你只需要知道:
portaudio→ 让电脑能“听”你说话ffmpeg→ 负责音频格式转换opus→ Discord 语音频道专用espeak-ng→ 本地语音合成器的“翻译官”
第 4 步:选择“耳朵”和“嘴巴”
Hermes 支持本地和云端两套方案。新手推荐:本地识别(免费)+ Edge 语音(免费),效果够用且不花一分钱。
在 ~/.hermes/.env 文件里添加(可选):
GROQ_API_KEY=*** # 云端快速识别(可选)
ELEVENLABS_API_KEY=*** # 高级音色(可选)
简单理解:
- 语音识别(STT):
local(免费隐私好)、groq(快)、openai(付费稳) - 语音合成(TTS):
edge(免费够用)、elevenlabs(音质天花板)、neutts(本地免费)
第 5 步:推荐配置(直接抄)
编辑 Hermes 的配置文件,加入:
voice:
record_key: "ctrl+b" # 按住说话快捷键
max_recording_seconds: 120
auto_tts: false
beep_enabled: true # 开始录音时“滴”一声
silence_threshold: 200 # 安静多久算说完
silence_duration: 3.0
stt:
provider: "local" # 本地识别,免费
local:
model: "base"
tts:
provider: "edge" # 免费语音合成
edge:
voice: "en-US-AriaNeural"
实战场景 1:在电脑前“动口不动手”
启动 Hermes 后,输入:
/voice on
然后按住 Ctrl+B 说话,说完停顿 3 秒,它自动识别并回答。适合:
- 边写代码边问问题:“这个报错什么意思?”
- 边踱步边头脑风暴:“帮我把刚才的想法整理成大纲”
- 手不方便打字时,全程语音操控
实战场景 2:Telegram / Discord 里发语音消息
启动网关:
hermes gateway
然后在聊天窗口输入 /voice on,之后你发语音,它就回语音。适合手机不在电脑前时,当随身助理用。
实战场景 3:Discord 语音频道实时对话(进阶)
这是最酷的模式:Hermes 直接“进频道”跟你说话。在文本频道输入:
/voice join # 进频道
/voice leave # 离开
需要给机器人开启“连接”“说话”权限,并在开发者后台打开三个“特权意图”。建议先在普通文字聊天里试通语音,再进频道。
常见问题速查
| 问题 | 检查项 |
|---|---|
| 没声音设备 | 装 portaudio |
| 能识别但不出声 | 检查 TTS 配置、API Key、ffmpeg |
| 识别乱码 | 环境安静点、调高 silence_threshold |
| 频道里听不到 | 确认 DISCORD_ALLOWED_USERS 包含你的 ID |
总结
语音模式的核心思路是:先文字,后语音,再频道。从免费方案起步,按需升级。最推荐的组合是:本地 STT + Edge TTS,零成本体验完整语音交互。
下篇预告:实战:用 Hermes 自动处理日常文件任务——让 AI 帮你整理下载文件夹、批量重命名、生成日报。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/use-voice-mode-with-hermes