Tutorial 27: Voice Mode
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
チュートリアル 27: ボイスモード
おかえりなさい、皆さん!今日はHermesを使う上で最もクールな方法のひとつ、ボイスモードについてお話しします。歩きながら、夕食を作りながら、あるいは単にキーボードを避けたいときにAIアシスタントとチャットしたいと思ったことがあるなら、このチュートリアルはまさにうってつけです。
ボイスモードとは?
ボイスモードを使うと、タイピングの代わりにHermesと話すことができます。以下のような場面に最適です:
- ハンズフリーのCLIワークフロー – キーボードに触れずにコードを書いたり調べ物をしたり
- TelegramやDiscordでの音声応答 – 通常のメッセージに加えて音声での返信も受け取れます
- Discordのライブボイスチャンネル – ボイスチャットでHermesと実際に会話ができます
- アイデアの素早い記録 – 歩きながらやブレインストーミング中に考えを口述できます
何より素晴らしいのは、Nous Portalを使えば、LLMとテキスト読み上げの両方を1回のOAuthログインで利用できることです。追加の認証情報は不要です!
ボイスを使う3つの方法
| モード | 最適な用途 | プラットフォーム |
|---|---|---|
| 対話型マイクループ | 個人でのハンズフリー使用 | CLI |
| チャットでの音声応答 | メッセージングでの音声応答 | Telegram、Discord |
| ライブボイスチャンネルボット | グループでの会話 | Discordボイスチャンネル |
プロのコツ: まずはテキストモードが動作することを確認し、次に音声応答を追加し、最後にDiscordボイスチャンネルを試すのがおすすめです。フル体験をしたいならね。
ステップ 1: まずテキストを動作させる
ボイスに飛び込む前に、基本が動作することを確認しましょう:
hermes
次に、簡単な質問をしてみます:
What tools do you have available?
これが問題なく動作すれば、ボイスの準備は完了です!
ステップ 2: 追加パッケージをインストールする
必要なものに応じて、適切なパッケージをインストールします:
# CLIマイク + 再生
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# メッセージングプラットフォーム (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# プレミアムElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# すべて
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ステップ 3: システム依存関係
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
これらの重要性は以下の通りです:
portaudio→ CLIボイス用のマイク入力ffmpeg→ 音声変換opus→ Discordボイスコーデックespeak-ng→ NeuTTS用の音素化ツール
ステップ 4: プロバイダーを選択する
最も簡単な設定: ローカルのSTTと無料のEdge TTSを使用します。~/.hermes/.envに以下を追加します:
# クラウドSTTオプション(ローカルはキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# プレミアムTTS(オプション)
ELEVENLABS_API_KEY=***
STTオプション:
local– プライバシーに最適、コストゼロgroq– 超高速なクラウド文字起こしopenai– 有料ですが信頼性の高いフォールバック
TTSオプション:
edge– 無料でほとんどの用途に十分neutts– 無料のローカル/オンデバイスelevenlabs– 最高品質openai– バランスの良い選択肢mistral– 多言語対応、ネイティブOpus
ステップ 5: 推奨設定
ほとんどの人にとって堅実なデフォルト設定は以下の通りです:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
submit_modeについての注意:
direct(デフォルト) – 文字起こしをすぐに送信しますdraft– 送信前に編集できるよう、文字起こしをコンポーザーに入れます
編集可能な下書きが必要な場合は、submit_mode: "draft"に設定してください。
CLIでのボイス使用
Hermesを起動してボイスをオンにします:
hermes
次に、以下のように入力します:
/voice on
録音の流れ:
Ctrl+Bを押す- 話す
- 無音検出が自動的に停止するのを待つ
- Hermesが文字起こしして応答する
- TTSがオンの場合、答えを音声で読み上げる
- 継続使用のためにループが再開する
便利なコマンド:
/voice
/voice on
/voice off
/voice tts
/voice status
優れたボイスワークフロー
その場でのデバッグ: 「dockerの権限エラーが繰り返し出るんだ。デバッグを手伝って」 と話しかけます。その後もハンズフリーで続けます:「最後のエラーをもう一度読んで」、「根本原因をもっと簡単な言葉で説明して」、「今度は正確な修正方法を教えて」。
リサーチ/ブレインストーミング: 歩き回りながら、まとまっていないアイデアを口述し、Hermesにリアルタイムで思考を整理してもらうのに最適です。
アクセシビリティ: タイピングが難しい場合でも、ボイスモードならHermesの全機能を利用し続けられます。
動作の調整
Hermesの開始/停止が敏感すぎる、または鈍すぎる場合は、設定ファイルの無音検出設定を調整します:
voice:
silence_threshold: 200
silence_duration: 3.0
より敏感な検出にするにはしきい値を下げ、逆に途中で切れてしまう場合は上げてみてください。
以上です!ボイスモードは、一度動かしてみると魔法のように感じられる機能のひとつです。シンプルに始めて、徐々に慣れていけば、すぐに皿洗いをしながらHermesと会話を楽しめるようになるでしょう。それでは、楽しい会話を!🎤
📖 公式ドキュメント
この記事は Hermes Agent の公式ドキュメントに基づいています:公式ドキュメント › guides/use-voice-mode-with-hermes