🤖HermesBlog
Hermes Messaging Platforms · パート 158/9/2026

Buzz: AI音声チャットアプリでHermesを使う

How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.

messaging-buzz

Buzz: AI音声チャットアプリでHermesを使う

ボイスモードが登場しました。Hermesとの対話方法が大きく変わります。毎回コマンドを打ち込む代わりに、エージェントと自然に会話できるようになりました。コーディング中、リサーチ中、アイデアを頭の中で巡らせながら散歩しているときでも、そのまま話しかけるだけでOKです。

このガイドでは、最もシンプルなセットアップからDiscordのボイスチャンネルでの会話まで、ボイス機能を使いこなすために必要なすべてを解説します。さっそく始めましょう。

ボイスモードが得意なこと

ボイスモードは、次のような場面で真価を発揮します:

  • ターミナルで作業しながら手を自由に使いたいとき
  • TelegramやDiscordで音声による応答を受け取りたいとき
  • HermesをDiscordのボイスチャンネルに参加させて、リアルタイムで対話したいとき
  • 歩きながらタイピングせずにアイデアを素早く記録したいとき

まるでハンズフリーの副操縦士のような存在です。デバッグ、ブレインストーミング、ちょっとした質問など、ボイスモードがあれば作業の流れを途切れさせません。

ボイスを使う3つの方法

Hermesには、3つの異なるボイス体験があります:

モード 最適な用途 プラットフォーム
対話型マイクループ コーディング中のパーソナルなハンズフリー利用 CLI
チャットでの音声返信 メッセージングと併用した音声応答 Telegram、Discord
ライブボイスチャンネルボット VCでのグループ会話 Discordボイスチャンネル

おすすめの進め方:まずテキストを動作させ、次に音声返信を有効にし、最後にDiscordボイスチャンネルへ移行するのがスムーズです。フル体験を求めるなら、この順番で進めましょう。

ステップ1:まずテキストを動作させる

ボイスに触れる前に、基本を確認しましょう:

hermes

次に、簡単な質問をしてみます:

What tools do you have available?

これがまだ安定していない場合は、先にテキストモードを修正してください。ボイスは、動作する基盤の上に構築されます。

ステップ2:必要な拡張パッケージをインストールする

環境に応じて、必要なものをインストールします:

CLIマイク+再生:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

メッセージングプラットフォーム(Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

プレミアムElevenLabs TTS(オプション):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

ローカルNeuTTS(オプション):

python -m pip install -U neutts[all]

すべて一度に:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ステップ3:システム依存関係をインストールする

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

それぞれの役割は次のとおりです:

  • portaudio → マイク入力と再生
  • ffmpeg → TTSとメッセージング用の音声変換
  • opus → Discordボイスコーデックのサポート
  • espeak-ng → NeuTTS用の音素化ツール

ステップ4:音声プロバイダーを選択する

Hermesは、ローカルとクラウドの両方の音声スタックに対応しています。最も簡単に始めるには、ローカルSTTと無料のEdge TTSを使用しましょう。

~/.hermes/.envに次を追加します:

# クラウドSTTオプション(ローカルはキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# プレミアムTTS(オプション)
ELEVENLABS_API_KEY=***

音声認識(STT)のおすすめ:

  • local → プライバシーとコストゼロの最適なデフォルト
  • groq → 非常に高速なクラウド文字起こし
  • openai → 有料だが信頼性の高いフォールバック

音声合成(TTS)のおすすめ:

  • edge → 無料でほとんどの用途に十分
  • neutts → 無料のローカル/オンデバイスTTS
  • elevenlabs → 最高品質
  • openai → バランスの良い中間オプション
  • mistral → 多言語対応、ネイティブOpus

ステップ5:推奨設定

堅実で保守的なデフォルト設定は次のとおりです:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

TUIでは、submit_modeが文字起こし後の動作を制御します:

  • direct(デフォルト)は文字起こし結果を即座に送信
  • draftはコンポーザーに入力して、送信前に編集可能

編集可能な音声ドラフトが必要な場合は、submit_mode: "draft"に設定してください。

ローカルTTSを使いたい場合は、次のように切り替えます:

tts:
  provider: "neutts"
  neutts:
    ref_audio: ''
    ref_text: ''
    model: neuphonic/neutts-air-q4-gguf
    device: cpu

ユースケース:CLIボイスモード

Hermesを起動して、ボイスをオンにします:

hermes

次に、CLI内で次のように入力します:

/voice on

録音の流れ:

  1. Ctrl+Bを押す
  2. 話す
  3. 無音検出で自動停止するのを待つ
  4. Hermesが文字起こしして応答する
  5. TTSがオンの場合は、音声で回答を読み上げる
  6. 連続使用のためにループが自動再開される

便利なコマンド:

/voice
/voice on
/voice off
/voice tts
/voice status

おすすめのCLIワークフロー:

その場でのデバッグ: 「Dockerの権限エラーがずっと出るんだけど、デバッグ手伝って」と話しかけます。その後もハンズフリーで続けられます:「最後のエラーをもう一度読んで」「根本原因をもっと簡単な言葉で説明して」「正確な修正方法を教えて」。

リサーチとブレインストーミング: 考えながら歩き回るのに最適です。形になっていないアイデアを口述して、Hermesにリアルタイムで思考を整理してもらえます。

アクセシビリティ: タイピングが難しい場合でも、ボイスモードならキーボードなしでHermesの全機能を利用できます。

CLIの動作を調整する

録音の開始・停止が敏感すぎる、または鈍すぎる場合は、設定で次の値を調整します:

voice:
  silence_threshold: 200   # 低いほど敏感
  silence_duration: 3.0    # 停止するまでの無音時間(秒)

まずはデフォルト値から始めて、環境に合わせて微調整してください。騒がしい部屋ではしきい値を上げ、静かな部屋では下げる必要があるかもしれません。

ボイスモードは、Hermesで生産性を維持する最も速い方法のひとつです。シンプルに始めて、プロバイダーをいろいろ試してみてください。すぐに、エージェントと話すのが当たり前になるでしょう。

📖 公式ドキュメント

この記事は Hermes Agent の公式ドキュメントに基づいています:公式ドキュメント › guides/use-voice-mode-with-hermes