🤖HermesBlog
Hermes Version History · パート 28/9/2026

Hermes v2026.8.3 アップデート:リアルタイム音声、エージェント間通信、検証可能な引用

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 アップデート:リアルタイム音声、エージェント間通信、検証可能な引用

みなさん、こんにちは。Hermes ブログへようこそ!今日はこれまでで最もエキサイティングなアップデートのひとつ、リアルタイム音声モードについて詳しくご紹介します。毎回コマンドをタイピングする代わりに、エージェントと直接話したいと思ったことがあるなら、このアップデートはまさにうってつけです。そして何より嬉しいのは、セットアップが想像以上に簡単なこと。

それでは、今日から音声モードを始めるために必要なすべての手順を見ていきましょう。

音声モードが本当に役立つ場面

音声モードは単なる目新しい機能ではありません。実際にさまざまなシナリオで本当に役立ちます:

  • コーディングやリサーチ中のハンズフリーな CLI ワークフロー
  • Telegram や Discord 内での音声応答
  • Discord のボイスチャンネルに Hermes を参加させてのライブ会話
  • 歩きながらのアイデアの素早い記録。立ち止まってタイピングする必要はありません

エージェントが単なるテキストボックスではなく、会話のパートナーになるイメージです。

音声を使う3つの方法

Hermes には3つの異なる音声体験があり、自分のスタイルに合わせて選べます:

モード 最適な用途 プラットフォーム
インタラクティブマイクループ 個人でのハンズフリー利用 CLI
チャットでの音声返信 メッセージングと併用した音声応答 Telegram、Discord
ライブボイスチャンネルボット グループまたは個人でのライブ会話 Discord ボイスチャンネル

おすすめの進め方:まずテキストを動作させ、次に音声返信を有効にし、最後に Discord ボイスチャンネルを試すのがスムーズです。

ステップ1:まずテキストを動作させる

音声に触れる前に、基本がしっかり動作していることを確認しましょう:

hermes

次に、簡単な質問をしてみます:

What tools do you have available?

これが動作すれば、次のステップに進む準備は完了です。

ステップ2:必要な追加パッケージをインストールする

何をしたいかに応じて、適切なパッケージをインストールします:

CLI マイク + 再生:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

メッセージングプラットフォーム:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

プレミアム ElevenLabs TTS:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

ローカル NeuTTS(オプション):

python -m pip install -U neutts[all]

すべてまとめて:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ステップ3:システム依存パッケージ

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

これらの重要性は以下の通りです:

  • portaudio → マイク入力と再生
  • ffmpeg → 音声変換
  • opus → Discord ボイスコーデックのサポート
  • espeak-ng → NeuTTS 用のフォナマイザー

ステップ4:音声プロバイダーを選択する

Hermes はローカルとクラウドの両方の音声スタックをサポートしています。最も簡単で安価なセットアップは、ローカル STT と無料の Edge TTS の組み合わせです:

  • STT プロバイダー: local
  • TTS プロバイダー: edge

API キーは ~/.hermes/.env に追加します:

# クラウド STT オプション(local はキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# プレミアム TTS(オプション)
ELEVENLABS_API_KEY=***

簡単な推奨事項:

  • STT: プライバシー重視なら local、スピード重視なら groq、有料のフォールバックとして openai
  • TTS: 無料なら edge、ローカルなら neutts、最高品質なら elevenlabs

ステップ5:推奨設定

堅実で控えめなデフォルト設定は以下の通りです:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

重要な設定のひとつ:voice.submit_mode は文字起こし後の動作を制御します。direct は即座に送信し、draft は送信前に編集できます。編集可能な下書きが必要な場合は、次のように設定します:

voice:
  submit_mode: "draft"

CLI で音声を使う

Hermes を起動して音声をオンにします:

hermes

次に、CLI 内で:

/voice on

録音の流れ:

  1. Ctrl+B を押す
  2. 話す
  3. 無音検出による自動停止を待つ
  4. Hermes が文字起こしして応答する
  5. TTS がオンの場合、音声で回答する

便利なコマンド:

/voice
/voice on
/voice off
/voice tts
/voice status

優れた CLI ワークフロー

その場でのデバッグ: 「Docker の権限エラーが出続けるんだけど、デバッグを手伝って」と言うだけ。その後もハンズフリーで続けられます:「最後のエラーをもう一度読んで」「根本原因をもっと簡単な言葉で説明して」「正確な修正方法を教えて」。

リサーチとブレインストーミング: 考えながら歩き回り、まとまりのないアイデアを口述し、Hermes にリアルタイムで思考を整理してもらうのに最適です。

アクセシビリティ: タイピングが難しい場合、音声モードならキーボードなしで Hermes の全機能を利用できます。

動作の調整

Hermes の録音開始・停止がやりすぎだと感じる場合は、設定ファイルの silence_thresholdsilence_duration の値を調整してください。

以上です!音声モードは今すぐ使えます。まずはテキストから始めて、音声返信を追加し、準備ができたら Discord ボイスチャンネルを試してみてください。それでは、楽しい会話を!

📖 公式ドキュメント

この記事は Hermes Agent の公式ドキュメントに基づいています:GitHub ›/releases/tag/v2026.8.3