🤖HermesBlog
Hermes 功能詳解 · 第22篇2026/8/9· Easy Understand Hermes Agent

第22篇:語音合成——AI 開口說話

Hermes 功能詳解第22篇:語音與 TTS。把文字變成語音,還能自訂音色和語速。

這篇教學將帶你了解 Hermes Agent 的語音合成功能,教你怎麼讓 AI 在聊天裡「開口說話」。

hermes-feature-22-tts

為什麼需要語音?

想像一下,你在做飯時收到一條長訊息,盯著螢幕讀很麻煩。如果 AI 能直接把回覆「說」出來,你一邊炒菜一邊聽,是不是方便多了?Hermes Agent 內建了 11 種語音引擎,從免費到付費,任你挑選。

第1步:選一個「嗓子」

打開設定檔 ~/.hermes/config.yaml,找到 tts 部分。預設用的是 Edge TTS,完全免費、無需註冊,效果也不錯,適合新手體驗。

想換更高級的聲音?把 provider 改一下就行:

tts:
  provider: "elevenlabs"   # 換成 ElevenLabs,音質「天花板」

小提示:如果你有 Nous Portal 付費訂閱,可以免費用 OpenAI TTS,不用單獨申請 API Key。

第2步:設定你的「嗓子」

每種引擎都有自己的設定項。比如用 Edge TTS,可以選聲音和語速:

tts:
  provider: "edge"
  edge:
    voice: "zh-CN-XiaoxiaoNeural"   # 中文女聲,溫柔好聽
    speed: 1.0                      # 1.0 是正常語速,調大更快

用 Gemini TTS 的話,還能寫「人設提示詞」,讓 AI 用特定語氣說話。比如建立一個 butler-voice.md 檔案,裡面寫「你是一位英國老管家,說話沉穩、禮貌」,然後:

tts:
  provider: "gemini"
  gemini:
    voice: "Kore"
    persona_prompt_file: "~/.hermes/tts/butler-voice.md"

AI 就會用管家的腔調回覆你,很有趣。

第3步:測試一下

在 CLI 裡直接發訊息,AI 回覆後,音訊會儲存到 ~/.hermes/audio_cache/ 資料夾。在 Telegram 或 Discord 裡,AI 會直接發語音氣泡,點一下就能聽。

第4步:處理長文字

如果 AI 回覆特別長,超過引擎的單次限制(比如 Edge 是 5000 字元),Hermes 會自動把文字切成幾段,按順序合成,不會丟內容。你不需要做任何事,它自己會搞定。

第5步:進階玩法(可選)

  • 加音效標籤:Gemini 3.1 和 xAI 支援在文字裡加 [whispers][laughs] 這樣的標籤,AI 會真的用氣聲說話或笑出來。開啟方式:
tts:
  gemini:
    audio_tags: true
  • 調語速:全域語速在 tts.speed 設定,每個引擎可以單獨覆蓋。比如 OpenAI 想快一點,就寫 tts.openai.speed: 1.5

總結

讓 AI 開口說話,只需三步:選引擎 → 配聲音 → 發訊息。免費方案足夠日常使用,付費方案音質更驚豔。語音功能讓 AI 從「螢幕裡的字」變成了「耳邊的小夥伴」,互動感直接拉滿。

下篇預告:AI 會說話了,那它能「聽懂」我們說話嗎?下一篇我們聊聊語音轉文字——讓 AI 聽懂你的語音訊息。

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/features/delegation