Buzz: AI音声チャットアプリでHermesを使う
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: AI音声チャットアプリでHermesを使う
ボイスモードが登場しました。Hermesとの対話方法が大きく変わります。毎回コマンドを打ち込む代わりに、エージェントと自然に会話できるようになりました。コーディング中、リサーチ中、アイデアを頭の中で巡らせながら散歩しているときでも、そのまま話しかけるだけでOKです。
このガイドでは、最もシンプルなセットアップからDiscordのボイスチャンネルでの会話まで、ボイス機能を使いこなすために必要なすべてを解説します。さっそく始めましょう。
ボイスモードが得意なこと
ボイスモードは、次のような場面で真価を発揮します:
- ターミナルで作業しながら手を自由に使いたいとき
- TelegramやDiscordで音声による応答を受け取りたいとき
- HermesをDiscordのボイスチャンネルに参加させて、リアルタイムで対話したいとき
- 歩きながらタイピングせずにアイデアを素早く記録したいとき
まるでハンズフリーの副操縦士のような存在です。デバッグ、ブレインストーミング、ちょっとした質問など、ボイスモードがあれば作業の流れを途切れさせません。
ボイスを使う3つの方法
Hermesには、3つの異なるボイス体験があります:
| モード | 最適な用途 | プラットフォーム |
|---|---|---|
| 対話型マイクループ | コーディング中のパーソナルなハンズフリー利用 | CLI |
| チャットでの音声返信 | メッセージングと併用した音声応答 | Telegram、Discord |
| ライブボイスチャンネルボット | VCでのグループ会話 | Discordボイスチャンネル |
おすすめの進め方:まずテキストを動作させ、次に音声返信を有効にし、最後にDiscordボイスチャンネルへ移行するのがスムーズです。フル体験を求めるなら、この順番で進めましょう。
ステップ1:まずテキストを動作させる
ボイスに触れる前に、基本を確認しましょう:
hermes
次に、簡単な質問をしてみます:
What tools do you have available?
これがまだ安定していない場合は、先にテキストモードを修正してください。ボイスは、動作する基盤の上に構築されます。
ステップ2:必要な拡張パッケージをインストールする
環境に応じて、必要なものをインストールします:
CLIマイク+再生:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
メッセージングプラットフォーム(Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
プレミアムElevenLabs TTS(オプション):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
ローカルNeuTTS(オプション):
python -m pip install -U neutts[all]
すべて一度に:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ステップ3:システム依存関係をインストールする
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
それぞれの役割は次のとおりです:
portaudio→ マイク入力と再生ffmpeg→ TTSとメッセージング用の音声変換opus→ Discordボイスコーデックのサポートespeak-ng→ NeuTTS用の音素化ツール
ステップ4:音声プロバイダーを選択する
Hermesは、ローカルとクラウドの両方の音声スタックに対応しています。最も簡単に始めるには、ローカルSTTと無料のEdge TTSを使用しましょう。
~/.hermes/.envに次を追加します:
# クラウドSTTオプション(ローカルはキー不要)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# プレミアムTTS(オプション)
ELEVENLABS_API_KEY=***
音声認識(STT)のおすすめ:
local→ プライバシーとコストゼロの最適なデフォルトgroq→ 非常に高速なクラウド文字起こしopenai→ 有料だが信頼性の高いフォールバック
音声合成(TTS)のおすすめ:
edge→ 無料でほとんどの用途に十分neutts→ 無料のローカル/オンデバイスTTSelevenlabs→ 最高品質openai→ バランスの良い中間オプションmistral→ 多言語対応、ネイティブOpus
ステップ5:推奨設定
堅実で保守的なデフォルト設定は次のとおりです:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
TUIでは、submit_modeが文字起こし後の動作を制御します:
direct(デフォルト)は文字起こし結果を即座に送信draftはコンポーザーに入力して、送信前に編集可能
編集可能な音声ドラフトが必要な場合は、submit_mode: "draft"に設定してください。
ローカルTTSを使いたい場合は、次のように切り替えます:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
ユースケース:CLIボイスモード
Hermesを起動して、ボイスをオンにします:
hermes
次に、CLI内で次のように入力します:
/voice on
録音の流れ:
Ctrl+Bを押す- 話す
- 無音検出で自動停止するのを待つ
- Hermesが文字起こしして応答する
- TTSがオンの場合は、音声で回答を読み上げる
- 連続使用のためにループが自動再開される
便利なコマンド:
/voice
/voice on
/voice off
/voice tts
/voice status
おすすめのCLIワークフロー:
その場でのデバッグ: 「Dockerの権限エラーがずっと出るんだけど、デバッグ手伝って」と話しかけます。その後もハンズフリーで続けられます:「最後のエラーをもう一度読んで」「根本原因をもっと簡単な言葉で説明して」「正確な修正方法を教えて」。
リサーチとブレインストーミング: 考えながら歩き回るのに最適です。形になっていないアイデアを口述して、Hermesにリアルタイムで思考を整理してもらえます。
アクセシビリティ: タイピングが難しい場合でも、ボイスモードならキーボードなしでHermesの全機能を利用できます。
CLIの動作を調整する
録音の開始・停止が敏感すぎる、または鈍すぎる場合は、設定で次の値を調整します:
voice:
silence_threshold: 200 # 低いほど敏感
silence_duration: 3.0 # 停止するまでの無音時間(秒)
まずはデフォルト値から始めて、環境に合わせて微調整してください。騒がしい部屋ではしきい値を上げ、静かな部屋では下げる必要があるかもしれません。
ボイスモードは、Hermesで生産性を維持する最も速い方法のひとつです。シンプルに始めて、プロバイダーをいろいろ試してみてください。すぐに、エージェントと話すのが当たり前になるでしょう。
📖 公式ドキュメント
この記事は Hermes Agent の公式ドキュメントに基づいています:公式ドキュメント › guides/use-voice-mode-with-hermes