🤖HermesBlog
Hermes Official Tutorials · パート 278/9/2026

Tutorial 27: Voice Mode

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

チュートリアル 27: ボイスモード

おかえりなさい、皆さん!今日はHermesを使う上で最もクールな方法のひとつ、ボイスモードについてお話しします。歩きながら、夕食を作りながら、あるいは単にキーボードを避けたいときにAIアシスタントとチャットしたいと思ったことがあるなら、このチュートリアルはまさにうってつけです。

ボイスモードとは?

ボイスモードを使うと、タイピングの代わりにHermesと話すことができます。以下のような場面に最適です:

  • ハンズフリーのCLIワークフロー – キーボードに触れずにコードを書いたり調べ物をしたり
  • TelegramやDiscordでの音声応答 – 通常のメッセージに加えて音声での返信も受け取れます
  • Discordのライブボイスチャンネル – ボイスチャットでHermesと実際に会話ができます
  • アイデアの素早い記録 – 歩きながらやブレインストーミング中に考えを口述できます

何より素晴らしいのは、Nous Portalを使えば、LLMとテキスト読み上げの両方を1回のOAuthログインで利用できることです。追加の認証情報は不要です!

ボイスを使う3つの方法

モード 最適な用途 プラットフォーム
対話型マイクループ 個人でのハンズフリー使用 CLI
チャットでの音声応答 メッセージングでの音声応答 Telegram、Discord
ライブボイスチャンネルボット グループでの会話 Discordボイスチャンネル

プロのコツ: まずはテキストモードが動作することを確認し、次に音声応答を追加し、最後にDiscordボイスチャンネルを試すのがおすすめです。フル体験をしたいならね。

ステップ 1: まずテキストを動作させる

ボイスに飛び込む前に、基本が動作することを確認しましょう:

hermes

次に、簡単な質問をしてみます:

What tools do you have available?

これが問題なく動作すれば、ボイスの準備は完了です!

ステップ 2: 追加パッケージをインストールする

必要なものに応じて、適切なパッケージをインストールします:

# CLIマイク + 再生
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# メッセージングプラットフォーム (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# プレミアムElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# すべて
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ステップ 3: システム依存関係

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

これらの重要性は以下の通りです:

  • portaudio → CLIボイス用のマイク入力
  • ffmpeg → 音声変換
  • opus → Discordボイスコーデック
  • espeak-ng → NeuTTS用の音素化ツール

ステップ 4: プロバイダーを選択する

最も簡単な設定: ローカルのSTTと無料のEdge TTSを使用します。~/.hermes/.envに以下を追加します:

# クラウドSTTオプション(ローカルはキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# プレミアムTTS(オプション)
ELEVENLABS_API_KEY=***

STTオプション:

  • local – プライバシーに最適、コストゼロ
  • groq – 超高速なクラウド文字起こし
  • openai – 有料ですが信頼性の高いフォールバック

TTSオプション:

  • edge – 無料でほとんどの用途に十分
  • neutts – 無料のローカル/オンデバイス
  • elevenlabs – 最高品質
  • openai – バランスの良い選択肢
  • mistral – 多言語対応、ネイティブOpus

ステップ 5: 推奨設定

ほとんどの人にとって堅実なデフォルト設定は以下の通りです:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

submit_modeについての注意:

  • direct(デフォルト) – 文字起こしをすぐに送信します
  • draft – 送信前に編集できるよう、文字起こしをコンポーザーに入れます

編集可能な下書きが必要な場合は、submit_mode: "draft"に設定してください。

CLIでのボイス使用

Hermesを起動してボイスをオンにします:

hermes

次に、以下のように入力します:

/voice on

録音の流れ:

  1. Ctrl+Bを押す
  2. 話す
  3. 無音検出が自動的に停止するのを待つ
  4. Hermesが文字起こしして応答する
  5. TTSがオンの場合、答えを音声で読み上げる
  6. 継続使用のためにループが再開する

便利なコマンド:

/voice
/voice on
/voice off
/voice tts
/voice status

優れたボイスワークフロー

その場でのデバッグ: 「dockerの権限エラーが繰り返し出るんだ。デバッグを手伝って」 と話しかけます。その後もハンズフリーで続けます:「最後のエラーをもう一度読んで」「根本原因をもっと簡単な言葉で説明して」「今度は正確な修正方法を教えて」

リサーチ/ブレインストーミング: 歩き回りながら、まとまっていないアイデアを口述し、Hermesにリアルタイムで思考を整理してもらうのに最適です。

アクセシビリティ: タイピングが難しい場合でも、ボイスモードならHermesの全機能を利用し続けられます。

動作の調整

Hermesの開始/停止が敏感すぎる、または鈍すぎる場合は、設定ファイルの無音検出設定を調整します:

voice:
  silence_threshold: 200
  silence_duration: 3.0

より敏感な検出にするにはしきい値を下げ、逆に途中で切れてしまう場合は上げてみてください。


以上です!ボイスモードは、一度動かしてみると魔法のように感じられる機能のひとつです。シンプルに始めて、徐々に慣れていけば、すぐに皿洗いをしながらHermesと会話を楽しめるようになるでしょう。それでは、楽しい会話を!🎤


📖 公式ドキュメント

この記事は Hermes Agent の公式ドキュメントに基づいています:公式ドキュメント › guides/use-voice-mode-with-hermes