实战:用语音模式和 AI 对话
Hermes 实战教程第6篇:使用语音模式。动嘴指挥 AI。
實戰:用語音模式和 AI 對話
上一篇文章我們聊了聊語音模式能幹啥,今天直接上手上強度——教你怎么把 Hermes 變成能聽會說的 AI 助手。全程不用打字,動嘴就行。
先搞清楚你要哪種語音玩法
Hermes 其實有三種語音體驗,別搞混了:
| 模式 | 適合誰 | 在哪用 |
|---|---|---|
| 麥克風互動循環 | 寫程式/查資料時想解放雙手 | CLI 終端機 |
| 聊天裡語音回覆 | 想聽 AI 用嘴回答你 | Telegram / Discord |
| 語音頻道機器人 | 想跟 AI 即時語音對話 | Discord 語音頻道 |
新手建議按這個順序來:先搞定文字對話 → 再開語音回覆 → 最後上 Discord 語音頻道。別跳步,不然出問題你都不知道是哪兒壞了。
第一步:確保文字對話正常
先跑一下 hermes,問它一句:
What tools do you have available?
能正常回答再往下走。文字都不穩,語音肯定更拉胯。
第二步:裝依賴
在 ~/.hermes/hermes-agent 目錄下執行:
# 只要 CLI 麥克風 + 播放
uv pip install -e ".[voice]"
# 要 Telegram/Discord 語音回覆
uv pip install -e ".[messaging]"
# 想要 ElevenLabs 高級音色
uv pip install -e ".[tts-premium]"
# 全都要
uv pip install -e ".[all]"
系統層面還得裝點東西。macOS:
brew install portaudio ffmpeg opus espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0 espeak-ng
這幾個傢伙各司其職:portaudio 管麥克風,ffmpeg 管音訊轉換,opus 是 Discord 語音編解碼器,espeak-ng 給本地 TTS 用的。
第三步:選語音服務商
新手最省事的組合:本地語音辨識 + 免費 Edge TTS。不用註冊任何帳號,零成本起步。
在 ~/.hermes/.env 裡按需填:
# 雲 STT(本地的不需要 key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# 進階 TTS(可選)
ELEVENLABS_API_KEY=***
語音辨識選哪個?
local:預設首選,隱私好還免費groq:雲轉寫,速度快openai:付費兜底
語音合成選哪個?
edge:免費夠用,多數人首選neutts:本地跑,完全離線elevenlabs:音質天花板openai:中規中矩mistral:多語言,原生 Opus
第四步:推薦設定
voice:
record_key: "ctrl+b"
submit_mode: "direct" # direct=直接提交 | draft=先編輯再提交
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
注意 submit_mode 這個參數:direct 是錄完直接提交,draft 會先把文字放到輸入框裡讓你改。想改就設成 draft。
實戰:CLI 語音模式
啟動 Hermes 後輸入:
/voice on
然後按 Ctrl+B 開始說話,說完停一下,它會自動偵測靜音並結束錄音。接著 Hermes 轉寫、回答,如果開了 TTS 還會直接唸出來。
常用指令:
/voice # 查看狀態
/voice on # 開啟
/voice off # 關閉
/voice tts # 切換 TTS
/voice status # 查看詳情
好用的場景:邊溜達邊讓 Hermes 幫你理思路、除錯報錯時不用騰出手打字、打字不方便時保持完整對話流。
小貼士
如果覺得錄音開始/結束太靈敏或太遲鈍,調 silence_threshold 和 silence_duration 這兩個參數就行。數值越大,越不容易觸發。
語音模式最爽的地方就是:想到啥說啥,Hermes 幫你整理成結構化的內容。快去試試吧!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/use-voice-mode-with-hermes