Talk to AI with Voice Mode
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
音声モードでAIと話す
音声モードは、初めて使ったときに魔法のように感じる機能のひとつです。毎回コマンドを入力してレスポンスを読む代わりに、ただ…話しかけるだけでいいんです。Hermesは聞き取り、考え、そして話しかけ返してくれます。このガイドでは、シンプルなマイク設定から本格的なDiscordボイスチャンネルボットまで、音声モードを動かすために必要なすべてを順を追って説明します。
音声モードが得意なこと
音声モードは、手がふさがっているときや、AIともっと自然な方法でやり取りしたいときに真価を発揮します。よくあるユースケースは次のとおりです。
- ハンズフリーのCLIワークフロー — Hermesと話しながらコーディングやリサーチを続ける
- TelegramやDiscordでの音声応答 — 通常のテキストメッセージに加えて音声返信を受け取る
- ライブDiscordボイスチャンネル — Hermesをボイスチャンネルに参加させてリアルタイムで会話する
- アイデアの素早い記録 — 歩き回りながら考えを口述する(タイピング不要)
音声モードの3つの使い方
Hermesは3つの異なる音声体験を提供します。ニーズに合ったものを選んでください。
| モード | 最適な用途 | プラットフォーム |
|---|---|---|
| 対話型マイクループ | コーディング中の個人用ハンズフリー利用 | CLI |
| チャットでの音声返信 | 通常のメッセージングに音声応答を追加 | Telegram、Discord |
| ライブボイスチャンネルボット | グループまたは個人でのライブ会話 | Discordボイスチャンネル |
おすすめの進め方は、まずシンプルに始めることです。先にテキストを動かし、次に音声返信を有効にし、最後に完全な体験を求めるならDiscordボイスチャンネルに移行しましょう。
ステップ1: まずテキストモードが動くことを確認する
音声モードに触れる前に、Hermesが起動し、プロバイダーが設定されていることを確認してください。hermes を実行して、次のような簡単な質問をしてみましょう。
What tools do you have available?
これがまだ安定していない場合は、先にテキストモードを修正してください。音声モードはその上に構築されます。
ステップ2: 必要なエクストラをインストールする
どの音声体験を希望するかに応じて、対応するエクストラをインストールしてください。
CLIマイク + 再生:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
メッセージングプラットフォーム (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
プレミアムElevenLabs TTS (オプション):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
ローカルNeuTTS (オプション):
python -m pip install -U neutts[all]
すべて:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ステップ3: システム依存関係をインストールする
音声モードでは、音声入力、変換、再生を処理するためにいくつかのシステムパッケージが必要です。
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
それぞれの重要性は次のとおりです。
portaudio→ CLI音声モード用のマイク入力と再生ffmpeg→ TTSおよびメッセージング配信のための音声変換opus→ Discord音声コーデックのサポートespeak-ng→ NeuTTS用の音素化バックエンド
ステップ4: 音声プロバイダーを選択する
Hermesはローカルとクラウドの両方の音声スタックをサポートしています。最も簡単で安価なセットアップは、ローカルSTTと無料のEdge TTSを使用することです。
- STTプロバイダー:
local - TTSプロバイダー:
edge
クラウドキーを ~/.hermes/.env に追加します。
# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium TTS (optional)
ELEVENLABS_API_KEY=***
音声認識(STT)のおすすめ:
local→ プライバシーとゼロコストに最適なデフォルトgroq→ 非常に高速なクラウド文字起こしopenai→ 有料だが信頼性の高いフォールバック
音声合成(TTS)のおすすめ:
edge→ 無料で、ほとんどのユーザーに十分な品質neutts→ 無料のローカル/オンデバイスTTSelevenlabs→ 最高品質openai→ バランスの取れた中間的な選択肢mistral→ 多言語対応、ネイティブOpus
ステップ5: 推奨設定
ほとんどの人にとって堅実で保守的なデフォルト設定は次のとおりです。
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
submit_mode 設定は、文字起こし後の動作を制御します。
direct(デフォルト)は、文字起こしを即座に送信しますdraftは、文字起こしをコンポーザーに配置し、送信前に編集できるようにします
編集可能な音声ドラフトが必要な場合は、submit_mode: "draft" を設定してください。
CLIで音声モードを使う
Hermesを起動し、音声モードをオンにします。
hermes
次にCLI内で:
/voice on
録音フロー:
Ctrl+Bを押す- 話す
- 無音検出が自動的に録音を停止するのを待つ
- Hermesが文字起こしと応答を行う
- TTSがオンの場合、回答を音声で読み上げる
- 継続使用のためにループが自動的に再開される場合があります
便利なコマンド:
/voice
/voice on
/voice off
/voice tts
/voice status
優れたCLIワークフロー
その場でのデバッグ: 「dockerの権限エラーがずっと出るんだけど、デバッグを手伝って」と話しかけます。その後、「最後のエラーをもう一度読んで」や「正確な修正方法を教えて」など、ハンズフリーでフォローアップを続けられます。
リサーチとブレインストーミング: 考えながら歩き回ったり、形になっていないアイデアを口述したり、Hermesにリアルタイムで思考を整理してもらうのに最適です。
アクセシビリティ: タイピングが難しい場合、音声モードはHermesのフルループを使い続けるための最速の方法のひとつです。
CLIの動作を調整する
Hermesの録音開始・停止が過剰に反応する場合は、設定の無音検出設定を調整してください。
voice:
silence_threshold: 200
silence_duration: 3.0
早く停止しすぎる場合はしきい値を下げ、背景ノイズで録音が続く場合は上げてください。durationは、停止をトリガーする無音の長さを制御します。
音声モードは、一度セットアップしてしまえばゲームチェンジャーです。基本的なCLIループから始めて、慣れてきたらメッセージングプラットフォームやDiscordボイスチャンネルに拡張していきましょう。それでは、楽しい会話を!
📖 公式ドキュメント
この記事は Hermes Agent の公式ドキュメントに基づいています:公式ドキュメント › guides/use-voice-mode-with-hermes