第22篇:語音合成——AI 開口說話
Hermes 功能詳解第22篇:語音與 TTS。把文字變成語音,還能自訂音色和語速。
這篇教學將帶你了解 Hermes Agent 的語音合成功能,教你怎麼讓 AI 在聊天裡「開口說話」。
為什麼需要語音?
想像一下,你在做飯時收到一條長訊息,盯著螢幕讀很麻煩。如果 AI 能直接把回覆「說」出來,你一邊炒菜一邊聽,是不是方便多了?Hermes Agent 內建了 11 種語音引擎,從免費到付費,任你挑選。
第1步:選一個「嗓子」
打開設定檔 ~/.hermes/config.yaml,找到 tts 部分。預設用的是 Edge TTS,完全免費、無需註冊,效果也不錯,適合新手體驗。
想換更高級的聲音?把 provider 改一下就行:
tts:
provider: "elevenlabs" # 換成 ElevenLabs,音質「天花板」
小提示:如果你有 Nous Portal 付費訂閱,可以免費用 OpenAI TTS,不用單獨申請 API Key。
第2步:設定你的「嗓子」
每種引擎都有自己的設定項。比如用 Edge TTS,可以選聲音和語速:
tts:
provider: "edge"
edge:
voice: "zh-CN-XiaoxiaoNeural" # 中文女聲,溫柔好聽
speed: 1.0 # 1.0 是正常語速,調大更快
用 Gemini TTS 的話,還能寫「人設提示詞」,讓 AI 用特定語氣說話。比如建立一個 butler-voice.md 檔案,裡面寫「你是一位英國老管家,說話沉穩、禮貌」,然後:
tts:
provider: "gemini"
gemini:
voice: "Kore"
persona_prompt_file: "~/.hermes/tts/butler-voice.md"
AI 就會用管家的腔調回覆你,很有趣。
第3步:測試一下
在 CLI 裡直接發訊息,AI 回覆後,音訊會儲存到 ~/.hermes/audio_cache/ 資料夾。在 Telegram 或 Discord 裡,AI 會直接發語音氣泡,點一下就能聽。
第4步:處理長文字
如果 AI 回覆特別長,超過引擎的單次限制(比如 Edge 是 5000 字元),Hermes 會自動把文字切成幾段,按順序合成,不會丟內容。你不需要做任何事,它自己會搞定。
第5步:進階玩法(可選)
- 加音效標籤:Gemini 3.1 和 xAI 支援在文字裡加
[whispers]、[laughs]這樣的標籤,AI 會真的用氣聲說話或笑出來。開啟方式:
tts:
gemini:
audio_tags: true
- 調語速:全域語速在
tts.speed設定,每個引擎可以單獨覆蓋。比如 OpenAI 想快一點,就寫tts.openai.speed: 1.5。
總結
讓 AI 開口說話,只需三步:選引擎 → 配聲音 → 發訊息。免費方案足夠日常使用,付費方案音質更驚豔。語音功能讓 AI 從「螢幕裡的字」變成了「耳邊的小夥伴」,互動感直接拉滿。
下篇預告:AI 會說話了,那它能「聽懂」我們說話嗎?下一篇我們聊聊語音轉文字——讓 AI 聽懂你的語音訊息。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/features/delegation