🤖HermesBlog
Hermes 实战教程 · 第6篇2026/8/9· Easy Understand Hermes Agent

实战:用语音模式和 AI 对话

Hermes 实战教程第6篇:使用语音模式。动嘴指挥 AI。

这篇教程教你如何让 Hermes Agent 不只是“打字聊天”,而是变成能听会说的语音助手——在电脑前、手机上,甚至 Discord 语音频道里跟它说话。


第 1 步:先确保文字对话正常

语音功能是“锦上添花”,基础没打好,语音也跑不起来。先启动 Hermes:

hermes

然后随便问一句:“你有什么工具?”如果它能正常回答,再继续下一步。


第 2 步:安装语音相关“零件”

Hermes 的语音功能像乐高积木,需要什么装什么。打开终端,依次执行:

# 麦克风 + 播放声音(CLI 语音模式必需)
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# 让 Telegram / Discord 支持语音回复
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# 想用 ElevenLabs 高级音色(可选)
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

偷懒方案:直接装全部功能:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

第 3 步:安装系统依赖(相当于装“声卡驱动”)

macOS

brew install portaudio ffmpeg opus espeak-ng

Ubuntu / Debian

sudo apt install portaudio19-dev ffmpeg libopus0 espeak-ng

别被名字吓到,你只需要知道:

  • portaudio → 让电脑能“听”你说话
  • ffmpeg → 负责音频格式转换
  • opus → Discord 语音频道专用
  • espeak-ng → 本地语音合成器的“翻译官”

第 4 步:选择“耳朵”和“嘴巴”

Hermes 支持本地和云端两套方案。新手推荐:本地识别(免费)+ Edge 语音(免费),效果够用且不花一分钱。

~/.hermes/.env 文件里添加(可选):

GROQ_API_KEY=***        # 云端快速识别(可选)
ELEVENLABS_API_KEY=***  # 高级音色(可选)

简单理解:

  • 语音识别(STT)local(免费隐私好)、groq(快)、openai(付费稳)
  • 语音合成(TTS)edge(免费够用)、elevenlabs(音质天花板)、neutts(本地免费)

第 5 步:推荐配置(直接抄)

编辑 Hermes 的配置文件,加入:

voice:
  record_key: "ctrl+b"        # 按住说话快捷键
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true          # 开始录音时“滴”一声
  silence_threshold: 200      # 安静多久算说完
  silence_duration: 3.0

stt:
  provider: "local"           # 本地识别,免费
  local:
    model: "base"

tts:
  provider: "edge"            # 免费语音合成
  edge:
    voice: "en-US-AriaNeural"

实战场景 1:在电脑前“动口不动手”

启动 Hermes 后,输入:

/voice on

然后按住 Ctrl+B 说话,说完停顿 3 秒,它自动识别并回答。适合:

  • 边写代码边问问题:“这个报错什么意思?”
  • 边踱步边头脑风暴:“帮我把刚才的想法整理成大纲”
  • 手不方便打字时,全程语音操控

实战场景 2:Telegram / Discord 里发语音消息

启动网关:

hermes gateway

然后在聊天窗口输入 /voice on,之后你发语音,它就回语音。适合手机不在电脑前时,当随身助理用。


实战场景 3:Discord 语音频道实时对话(进阶)

这是最酷的模式:Hermes 直接“进频道”跟你说话。在文本频道输入:

/voice join   # 进频道
/voice leave  # 离开

需要给机器人开启“连接”“说话”权限,并在开发者后台打开三个“特权意图”。建议先在普通文字聊天里试通语音,再进频道。


常见问题速查

问题 检查项
没声音设备 portaudio
能识别但不出声 检查 TTS 配置、API Key、ffmpeg
识别乱码 环境安静点、调高 silence_threshold
频道里听不到 确认 DISCORD_ALLOWED_USERS 包含你的 ID

总结

语音模式的核心思路是:先文字,后语音,再频道。从免费方案起步,按需升级。最推荐的组合是:本地 STT + Edge TTS,零成本体验完整语音交互。

下篇预告:实战:用 Hermes 自动处理日常文件任务——让 AI 帮你整理下载文件夹、批量重命名、生成日报。

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/use-voice-mode-with-hermes