🤖HermesBlog
Hermes 版本更新历史 · 第2篇2026/8/9· Easy Understand Hermes Agent

嘿,你终于可以开口跟 Hermes 说话了!

Hermes v2026.8.3 更新解读:实时语音对话、多智能体通信与可验证引用

v2026.8.3 · 传信神 Hermes

嘿,你终于可以开口跟 Hermes 说话了!

朋友们,v2026.8.3 这次更新,最大的亮点就是实时语音对话。以前咱们跟 Hermes 聊天全靠打字,现在你可以直接开口说,它还能开口回答你。是不是有点科幻片那味儿了?

别急,这篇文章就是手把手教你把这个功能跑起来。放心,一点都不难,跟着走就行。

先搞清楚:语音模式到底能干啥?

简单说,有三种玩法:

  • 命令行(CLI)语音循环:适合你一边写代码一边跟它聊天,解放双手。
  • 聊天软件里的语音回复:在 Telegram 或 Discord 里,它不光回你文字,还能回你一段语音。
  • Discord 语音频道机器人:让 Hermes 直接“住”进你的语音频道,大家伙儿可以跟它实时对话。

给新手的建议路线:先把文字聊天调通,再开语音回复,最后再折腾 Discord 语音频道。一步一步来,稳得很。

第一步:确保基础版 Hermes 能跑

别一上来就搞语音,先确认你的 Hermes 能正常启动、能回答文字问题。

hermes

然后随便问一句:

What tools do you have available?

如果这一步都卡壳,先回去把基础配置弄好再说。

第二步:安装语音功能需要的“零件”

打开终端,敲下面这几行命令(根据你的需求选一个):

# 只要命令行麦克风+播放功能
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# 要 Telegram/Discord 语音回复
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# 想要 ElevenLabs 顶级音质(付费)
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# 或者干脆全装上,省心
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

第三步:装系统依赖(Mac 和 Linux 不一样)

Mac 用户:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian 用户:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

这些是干嘛的?简单说:portaudio 管麦克风,ffmpeg 管音频转换,opus 是 Discord 语音的“翻译官”,espeak-ng 是本地语音合成的小助手。

第四步:选语音识别(STT)和语音合成(TTS)的“引擎”

最省钱省事的组合:本地识别 + 免费 Edge 语音。

~/.hermes/.env 文件里加上这些(如果要用云服务的话):

# 云识别(本地识别不用填 key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# 高级语音合成(可选)
ELEVENLABS_API_KEY=***

怎么选?

  • 语音识别local(免费、保护隐私)> groq(快)> openai(付费兜底)
  • 语音合成edge(免费够用)> neutts(本地免费)> elevenlabs(音质天花板)> openai(中规中矩)

第五步:推荐配置(直接抄作业)

打开配置文件,把这段粘进去:

voice:
  record_key: "ctrl+b"   # 录音快捷键
  submit_mode: "direct"  # direct=说完直接提交,draft=先给你看草稿
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

小提示:如果你想把语音转文字的结果先确认一下再发送,把 submit_mode 改成 draft 就行。

实战:命令行里怎么用?

启动 Hermes 后,输入:

/voice on

然后按住 Ctrl+B 开始说话,说完停一下,它自动识别并回复。就这么简单!

几个常用命令:

/voice          # 查看状态
/voice on       # 开启
/voice off      # 关闭
/voice tts      # 切换语音回复
/voice status   # 查看详情

一个超好用的场景:你在调试代码时遇到报错,直接说“我老遇到 docker 权限错误,帮我看看”,然后一边忙别的,一边听它给你讲解决方案,这体验,绝了。

最后唠叨两句

语音模式是个新玩具,刚开始可能会有点不习惯。建议先从本地识别 + Edge 语音开始,成本最低、最容易上手。等玩明白了,再考虑升级到 ElevenLabs 或者 Discord 语音频道。

行了,快去试试吧!有问题随时回来翻文档。

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:GitHub ›/releases/tag/v2026.8.3