Buzz: Hermes mit der KI-Sprachchat-App nutzen
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: Hermes mit der KI-Sprachchat-App nutzen
Der Sprachmodus ist da – und er verändert die Art, wie du mit Hermes interagierst, grundlegend. Statt jeden Befehl zu tippen, kannst du jetzt ganz natürlich mit deinem Agenten sprechen – ob beim Programmieren, Recherchieren oder einfach beim Spazierengehen mit lauter Ideen im Kopf.
Dieser Leitfaden führt dich durch alles, was du für die Sprachfunktion brauchst – vom einfachsten Setup bis hin zu kompletten Discord-Sprachkanal-Gesprächen. Los geht’s.
Wofür der Sprachmodus gut ist
Der Sprachmodus glänzt, wenn du:
- Deine Hände frei haben willst, während du im Terminal arbeitest
- Gesprochene Antworten in Telegram oder Discord erhalten möchtest
- Hermes in einem Discord-Sprachkanal für Live-Hin-und-her-Gespräche haben willst
- Ideen schnell festhalten möchtest, während du unterwegs bist, statt zu tippen
Stell ihn dir als deinen Freisprech-Copiloten vor. Debugging, Brainstorming oder einfach schnelle Fragen – der Sprachmodus hält dich im Flow.
Drei Möglichkeiten, Sprache zu nutzen
Hermes bietet drei verschiedene Sprach-Erlebnisse:
| Modus | Am besten geeignet für | Plattform |
|---|---|---|
| Interaktive Mikrofon-Schleife | Persönliche Freisprech-Nutzung beim Programmieren | CLI |
| Sprachantworten im Chat | Gesprochene Antworten neben dem Messaging | Telegram, Discord |
| Live-Sprachkanal-Bot | Gruppengespräche im Voice Channel | Discord-Sprachkanäle |
Ein smarter Weg nach vorne: Erst Text zum Laufen bringen, dann Sprachantworten aktivieren und schließlich zu Discord-Sprachkanälen wechseln, wenn du das volle Erlebnis willst.
Schritt 1: Stelle sicher, dass Text zuerst funktioniert
Bevor du dich an Sprache wagst, überprüfe die Grundlagen:
hermes
Dann stelle eine einfache Frage:
What tools do you have available?
Wenn das noch nicht solide läuft, behebe zuerst den Textmodus. Sprache baut auf einem funktionierenden Fundament auf.
Schritt 2: Die richtigen Extras installieren
Je nach Setup installierst du, was du brauchst:
CLI-Mikrofon + Wiedergabe:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Messaging-Plattformen (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
Premium-ElevenLabs-TTS (optional):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
Lokales NeuTTS (optional):
python -m pip install -U neutts[all]
Alles auf einmal:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Schritt 3: Systemabhängigkeiten installieren
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Hier ist, warum jede Abhängigkeit wichtig ist:
portaudio→ Mikrofon-Eingabe und Wiedergabeffmpeg→ Audio-Konvertierung für TTS und Messagingopus→ Discord-Sprachcodec-Unterstützungespeak-ng→ Phonemisierer für NeuTTS
Schritt 4: Deine Sprach-Anbieter wählen
Hermes unterstützt sowohl lokale als auch Cloud-Sprach-Stacks. Für den einfachsten Einstieg nutze lokales STT mit kostenlosem Edge-TTS.
Füge das zu ~/.hermes/.env hinzu:
# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium-TTS (optional)
ELEVENLABS_API_KEY=***
Empfehlungen für Speech-to-Text:
local→ beste Standardeinstellung für Privatsphäre und null Kostengroq→ sehr schnelle Cloud-Transkriptionopenai→ gute kostenpflichtige Alternative
Empfehlungen für Text-to-Speech:
edge→ kostenlos und für die meisten Fälle gut genugneutts→ kostenloses lokales/On-Device-TTSelevenlabs→ beste Qualitätopenai→ guter Mittelwegmistral→ mehrsprachig, nativ Opus
Schritt 5: Empfohlene Konfiguration
Hier ist eine solide, konservative Standardeinstellung:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
In der TUI steuert submit_mode, was nach der Transkription passiert:
direct(Standard) sendet das Transkript sofort abdraftlegt es in den Editor, damit du es vor dem Senden bearbeiten kannst
Für bearbeitbare Sprach-Entwürfe setze submit_mode: "draft".
Du willst lokales TTS stattdessen? Wechsle zu:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
Anwendungsfall: CLI-Sprachmodus
Starte Hermes und aktiviere Sprache:
hermes
Dann in der CLI:
/voice on
Aufnahme-Ablauf:
- Drücke
Ctrl+B - Sprich
- Warte, bis die Stille-Erkennung automatisch stoppt
- Hermes transkribiert und antwortet
- Wenn TTS aktiviert ist, spricht es die Antwort
- Die Schleife kann für kontinuierliche Nutzung automatisch neu starten
Nützliche Befehle:
/voice
/voice on
/voice off
/voice tts
/voice status
Tolle CLI-Workflows:
Schnelles Debugging: Sage „Ich bekomme ständig einen Docker-Permissions-Fehler. Hilf mir beim Debuggen.“ Dann weiter freihändig: „Lies den letzten Fehler nochmal vor,“ „Erkläre die Ursache in einfacheren Worten,“ „Jetzt gib mir die genaue Lösung.“
Recherche und Brainstorming: Perfekt zum Herumlaufen beim Nachdenken, zum Diktieren halbfertiger Ideen und um Hermes zu bitten, deine Gedanken in Echtzeit zu strukturieren.
Barrierefreiheit: Wenn Tippen unpraktisch ist, hält dich der Sprachmodus ohne Tastatur voll im Hermes-Loop.
CLI-Verhalten optimieren
Wenn Hermes zu aggressiv oder zu zögerlich mit der Aufnahme beginnt oder stoppt, passe diese Werte in deiner Konfiguration an:
voice:
silence_threshold: 200 # niedriger = empfindlicher
silence_duration: 3.0 # Sekunden Stille vor dem Stoppen
Starte mit den Standardwerten und justiere dann je nach Umgebung. Ein lauter Raum könnte einen höheren Schwellenwert brauchen; ein ruhiger vielleicht einen niedrigeren.
Der Sprachmodus ist einer der schnellsten Wege, mit Hermes produktiv zu bleiben. Starte einfach, experimentiere mit Anbietern, und bald wirst du mit deinem Agenten sprechen, als wäre es völlig selbstverständlich.
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › guides/use-voice-mode-with-hermes