🤖HermesBlog
Hermes 实战教程 · 第6篇2026/8/9· Easy Understand Hermes Agent

实战:用语音模式和 AI 对话

Hermes 实战教程第6篇:使用语音模式。动嘴指挥 AI。

实战:用语音模式和 AI 对话

实战:用语音模式和 AI 对话

上一篇文章我们聊了聊语音模式能干啥,今天直接上手上强度——教你怎么把 Hermes 变成能听会说的 AI 助手。全程不用打字,动嘴就行。

先搞清楚你要哪种语音玩法

Hermes 其实有三种语音体验,别搞混了:

模式 适合谁 在哪用
麦克风交互循环 写代码/查资料时想解放双手 CLI 终端
聊天里语音回复 想听 AI 用嘴回答你 Telegram / Discord
语音频道机器人 想跟 AI 实时语音对话 Discord 语音频道

新手建议按这个顺序来:先搞定文字对话 → 再开语音回复 → 最后上 Discord 语音频道。别跳步,不然出问题你都不知道是哪儿坏了。

第一步:确保文字对话正常

先跑一下 hermes,问它一句:

What tools do you have available?

能正常回答再往下走。文字都不稳,语音肯定更拉胯。

第二步:装依赖

~/.hermes/hermes-agent 目录下执行:

# 只要 CLI 麦克风 + 播放
uv pip install -e ".[voice]"

# 要 Telegram/Discord 语音回复
uv pip install -e ".[messaging]"

# 想要 ElevenLabs 高级音色
uv pip install -e ".[tts-premium]"

# 全都要
uv pip install -e ".[all]"

系统层面还得装点东西。macOS:

brew install portaudio ffmpeg opus espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0 espeak-ng

这几个家伙各司其职:portaudio 管麦克风,ffmpeg 管音频转换,opus 是 Discord 语音编解码器,espeak-ng 给本地 TTS 用的。

第三步:选语音服务商

新手最省事的组合:本地语音识别 + 免费 Edge TTS。不用注册任何账号,零成本起步。

~/.hermes/.env 里按需填:

# 云 STT(本地的不需要 key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# 高级 TTS(可选)
ELEVENLABS_API_KEY=***

语音识别选哪个?

  • local:默认首选,隐私好还免费
  • groq:云转写,速度快
  • openai:付费兜底

语音合成选哪个?

  • edge:免费够用,多数人首选
  • neutts:本地跑,完全离线
  • elevenlabs:音质天花板
  • openai:中规中矩
  • mistral:多语言,原生 Opus

第四步:推荐配置

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # direct=直接提交 | draft=先编辑再提交
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

注意 submit_mode 这个参数:direct 是录完直接提交,draft 会先把文字放到输入框里让你改。想改就设成 draft

实战:CLI 语音模式

启动 Hermes 后输入:

/voice on

然后按 Ctrl+B 开始说话,说完停一下,它会自动检测静音并结束录音。接着 Hermes 转写、回答,如果开了 TTS 还会直接念出来。

常用命令:

/voice          # 查看状态
/voice on       # 开启
/voice off      # 关闭
/voice tts      # 切换 TTS
/voice status   # 查看详情

好用的场景:边溜达边让 Hermes 帮你理思路、调试报错时不用腾出手打字、打字不方便时保持完整对话流。

小贴士

如果觉得录音开始/结束太灵敏或太迟钝,调 silence_thresholdsilence_duration 这两个参数就行。数值越大,越不容易触发。

语音模式最爽的地方就是:想到啥说啥,Hermes 帮你整理成结构化的内容。快去试试吧!

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/use-voice-mode-with-hermes