第18篇:语音模式——动嘴就能指挥 AI
Hermes 功能详解第18篇:语音模式。不用打字,说话就能和 Hermes 对话。
这篇带你解锁 Hermes Agent 的“声控”玩法:装上麦克风,动动嘴就能和 AI 对话,连打字都省了。
准备工作:先让 AI“听得见”
在玩语音之前,你得先确保 Hermes 能正常跑起来(文字对话没问题)。然后按下面三步装好“耳朵”和“嘴巴”:
第1步:安装语音依赖包
打开终端,依次执行:
cd ~/.hermes/hermes-agent
uv pip install -e ".[voice]" # 麦克风录音 + 播放声音
uv pip install -e ".[messaging]" # 如果你还想在 Discord/Telegram 里用
第2步:装系统级“声卡驱动”
- Mac 用户:
brew install portaudio ffmpeg opus - Ubuntu/Debian 用户:
sudo apt install portaudio19-dev ffmpeg libopus0
简单说:PortAudio 负责录音放音,ffmpeg 负责把音频格式换来换去,Opus 是 Discord 语音频道专用的“翻译官”。
第3步:配 API 密钥(可跳过)
在 ~/.hermes/.env 文件里加上:
GROQ_API_KEY=你的密钥 # 云端语音转文字(免费额度)
# 如果你装了 faster-whisper,本地就能转文字,一个密钥都不用!
核心玩法:按一下,说一句
启动对话:
hermes
然后在聊天窗口输入 /voice on 开启语音模式。接下来就是见证奇迹的时刻:
- 按下 Ctrl+B,听到“嘀”一声(880Hz),开始说话
- 屏幕上会跳出一个音量条,像卡拉OK一样跳动
- 说完停 3 秒,自动结束录音,再“嘀嘀”两声确认
- AI 把你说的话转成文字、生成回答,然后用语音读出来
- 录音自动重新开始——你只管继续说,不用再按键
整个过程就像和对讲机聊天,按住说话、松开听回复。想结束?说一句“stop”,对话就干净利落地结束了。
进阶技巧:让对话更自然
- 边听边插嘴:AI 还在思考或朗读时,你直接开口就能打断它,你的话会变成下一条指令。就像和朋友聊天,随时可以抢话。
- 逐句朗读:AI 不是等全部想好才开口,而是生成一句、读一句,你听到第一句话时它还在想后半段,响应特别快。
- 不想听声音? 输入
/voice tts关掉朗读,只看文字回复。
桌面端新玩法:GPT-Live 全双工语音模式
如果你用的是桌面 App,除了上面那套“STT → 对话 → TTS”的链式流程,还有第二种语音聊天模式:GPT-Live 全双工模式。它用一个全双工语音模型(OpenAI 的 gpt-live-1)替掉整条链路——边说边听,自己处理打断、附和声和背景噪音,而且它本身没有任何工具。当你让它干正事时,它会转交给 Hermes 处理:Hermes 照常用当前会话选定的模型和供应商、完整工具集、记忆和审批来回答,语音再把答案念出来。
voice:
voice_chat_mode: gpt-live # chained(默认)| gpt-live
gpt_live:
voice: marin # marin, cedar, quartz, ripple, vesper, willow, stone, gleam, meridian, …
instructions: "" # 可选,额外的人设句子(语气、语速、语言)
要求:需要一个 OpenAI API 密钥(OPENAI_API_KEY、VOICE_TOOLS_OPENAI_KEY 或 voice.gpt_live.api_key)。语音层由 OpenAI 按每分钟会话时间 $0.05 计费(空闲时间也算);Hermes 那一轮照常按它自己的供应商计费。这个模式在 设置 → 语音 → Voice Chat Mode 里也能切换。
这个模式不支持:Nous 托管的音频代理(只能用直连密钥)、CLI/TUI(/voice 仍走链式流程),以及 tts 工具(它继续用 tts.provider)。
小总结
语音模式把“打字聊天”变成了“对讲机通话”,装好依赖、按 Ctrl+B 说话,就这么简单。想玩得更花?还能在 Discord 语音频道里和 AI 实时对话,或者用“Hey Hermes”唤醒词免提启动——这些我们下回分解。
下篇预告:第19篇——唤醒词:喊一声“Hey Hermes”就能召唤 AI,连按键都省了。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/features/tools