Hermes v2026.8.3 アップデート:リアルタイム音声、エージェント間通信、検証可能な引用
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Hermes v2026.8.3 アップデート:リアルタイム音声、エージェント間通信、検証可能な引用
みなさん、こんにちは。Hermes ブログへようこそ!今日はこれまでで最もエキサイティングなアップデートのひとつ、リアルタイム音声モードについて詳しくご紹介します。毎回コマンドをタイピングする代わりに、エージェントと直接話したいと思ったことがあるなら、このアップデートはまさにうってつけです。そして何より嬉しいのは、セットアップが想像以上に簡単なこと。
それでは、今日から音声モードを始めるために必要なすべての手順を見ていきましょう。
音声モードが本当に役立つ場面
音声モードは単なる目新しい機能ではありません。実際にさまざまなシナリオで本当に役立ちます:
- コーディングやリサーチ中のハンズフリーな CLI ワークフロー
- Telegram や Discord 内での音声応答
- Discord のボイスチャンネルに Hermes を参加させてのライブ会話
- 歩きながらのアイデアの素早い記録。立ち止まってタイピングする必要はありません
エージェントが単なるテキストボックスではなく、会話のパートナーになるイメージです。
音声を使う3つの方法
Hermes には3つの異なる音声体験があり、自分のスタイルに合わせて選べます:
| モード | 最適な用途 | プラットフォーム |
|---|---|---|
| インタラクティブマイクループ | 個人でのハンズフリー利用 | CLI |
| チャットでの音声返信 | メッセージングと併用した音声応答 | Telegram、Discord |
| ライブボイスチャンネルボット | グループまたは個人でのライブ会話 | Discord ボイスチャンネル |
おすすめの進め方:まずテキストを動作させ、次に音声返信を有効にし、最後に Discord ボイスチャンネルを試すのがスムーズです。
ステップ1:まずテキストを動作させる
音声に触れる前に、基本がしっかり動作していることを確認しましょう:
hermes
次に、簡単な質問をしてみます:
What tools do you have available?
これが動作すれば、次のステップに進む準備は完了です。
ステップ2:必要な追加パッケージをインストールする
何をしたいかに応じて、適切なパッケージをインストールします:
CLI マイク + 再生:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
メッセージングプラットフォーム:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
プレミアム ElevenLabs TTS:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
ローカル NeuTTS(オプション):
python -m pip install -U neutts[all]
すべてまとめて:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ステップ3:システム依存パッケージ
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
これらの重要性は以下の通りです:
portaudio→ マイク入力と再生ffmpeg→ 音声変換opus→ Discord ボイスコーデックのサポートespeak-ng→ NeuTTS 用のフォナマイザー
ステップ4:音声プロバイダーを選択する
Hermes はローカルとクラウドの両方の音声スタックをサポートしています。最も簡単で安価なセットアップは、ローカル STT と無料の Edge TTS の組み合わせです:
- STT プロバイダー:
local - TTS プロバイダー:
edge
API キーは ~/.hermes/.env に追加します:
# クラウド STT オプション(local はキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# プレミアム TTS(オプション)
ELEVENLABS_API_KEY=***
簡単な推奨事項:
- STT: プライバシー重視なら
local、スピード重視ならgroq、有料のフォールバックとしてopenai - TTS: 無料なら
edge、ローカルならneutts、最高品質ならelevenlabs
ステップ5:推奨設定
堅実で控えめなデフォルト設定は以下の通りです:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
重要な設定のひとつ:voice.submit_mode は文字起こし後の動作を制御します。direct は即座に送信し、draft は送信前に編集できます。編集可能な下書きが必要な場合は、次のように設定します:
voice:
submit_mode: "draft"
CLI で音声を使う
Hermes を起動して音声をオンにします:
hermes
次に、CLI 内で:
/voice on
録音の流れ:
Ctrl+Bを押す- 話す
- 無音検出による自動停止を待つ
- Hermes が文字起こしして応答する
- TTS がオンの場合、音声で回答する
便利なコマンド:
/voice
/voice on
/voice off
/voice tts
/voice status
優れた CLI ワークフロー
その場でのデバッグ: 「Docker の権限エラーが出続けるんだけど、デバッグを手伝って」と言うだけ。その後もハンズフリーで続けられます:「最後のエラーをもう一度読んで」「根本原因をもっと簡単な言葉で説明して」「正確な修正方法を教えて」。
リサーチとブレインストーミング: 考えながら歩き回り、まとまりのないアイデアを口述し、Hermes にリアルタイムで思考を整理してもらうのに最適です。
アクセシビリティ: タイピングが難しい場合、音声モードならキーボードなしで Hermes の全機能を利用できます。
動作の調整
Hermes の録音開始・停止がやりすぎだと感じる場合は、設定ファイルの silence_threshold と silence_duration の値を調整してください。
以上です!音声モードは今すぐ使えます。まずはテキストから始めて、音声返信を追加し、準備ができたら Discord ボイスチャンネルを試してみてください。それでは、楽しい会話を!
📖 公式ドキュメント
この記事は Hermes Agent の公式ドキュメントに基づいています:GitHub ›/releases/tag/v2026.8.3