Tutorial 27: Sprachmodus
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Tutorial 27: Sprachmodus
Willkommen zurück, Freunde! Heute sprechen wir über eine der coolsten Möglichkeiten, Hermes zu nutzen: den Sprachmodus. Wenn du schon immer mal mit deinem KI-Assistenten chatten wolltest, während du herumläufst, kochst oder einfach die Tastatur vermeiden willst, ist dieses Tutorial genau das Richtige für dich.
Was ist der Sprachmodus?
Der Sprachmodus ermöglicht es dir, mit Hermes zu sprechen, anstatt zu tippen. Er ist perfekt für:
- Freihändige CLI-Workflows – Code und Recherche, ohne die Tastatur zu berühren
- Sprachantworten in Telegram oder Discord – erhalte Sprachantworten neben normalen Nachrichten
- Live-Discord-Sprachkanäle – führe echte Gespräche mit Hermes in einem Voice-Chat
- Schnelles Festhalten von Ideen – diktierte Gedanken beim Spazierengehen oder Brainstorming
Das Beste daran? Wenn du Nous Portal nutzt, erhältst du sowohl das LLM als auch die Text-to-Speech-Funktion über einen einzigen OAuth-Login. Keine zusätzlichen Zugangsdaten nötig!
Drei Möglichkeiten, den Sprachmodus zu nutzen
| Modus | Am besten geeignet für | Plattform |
|---|---|---|
| Interaktive Mikrofon-Schleife | Persönliche freihändige Nutzung | CLI |
| Sprachantworten im Chat | Sprachantworten mit Messaging | Telegram, Discord |
| Live-Sprachkanal-Bot | Gruppenunterhaltungen | Discord-Sprachkanäle |
Profi-Tipp: Stelle zuerst sicher, dass der Textmodus funktioniert, füge dann Sprachantworten hinzu und probiere schließlich Discord-Sprachkanäle aus, wenn du das volle Erlebnis möchtest.
Schritt 1: Text zuerst zum Laufen bringen
Bevor du in den Sprachmodus eintauchst, stelle sicher, dass die Grundlagen funktionieren:
hermes
Stelle dann eine einfache Frage:
Welche Tools hast du zur Verfügung?
Wenn das solide läuft, bist du bereit für den Sprachmodus!
Schritt 2: Die Extras installieren
Je nachdem, was du brauchst, installiere die passenden Pakete:
# CLI-Mikrofon + Wiedergabe
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Messaging-Plattformen (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# Premium ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Alles
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Schritt 3: Systemabhängigkeiten
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Hier ist, warum diese wichtig sind:
portaudio→ Mikrofoneingabe für CLI-Spracheffmpeg→ Audiokonvertierungopus→ Discord-Sprachcodecespeak-ng→ Phonemisierer für NeuTTS
Schritt 4: Anbieter auswählen
Einfachste Einrichtung: Lokales STT und kostenloses Edge TTS verwenden. Füge dies zu ~/.hermes/.env hinzu:
# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium-TTS (optional)
ELEVENLABS_API_KEY=***
STT-Optionen:
local– am besten für Datenschutz, keine Kostengroq– superschnelle Cloud-Transkriptionopenai– gute kostenpflichtige Alternative
TTS-Optionen:
edge– kostenlos und für die meisten Fälle gut genugneutts– kostenlos lokal/auf dem Gerätelevenlabs– beste Qualitätopenai– guter Mittelwegmistral– mehrsprachig, natives Opus
Schritt 5: Empfohlene Konfiguration
Hier ist eine solide Standardkonfiguration für die meisten:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Hinweis zu submit_mode:
direct(Standard) – übermittelt die Transkription sofortdraft– legt die Transkription im Editor ab, damit du sie vor dem Senden bearbeiten kannst
Für bearbeitbare Entwürfe setze submit_mode: "draft".
Sprachmodus in der CLI verwenden
Starte Hermes und aktiviere den Sprachmodus:
hermes
Tippe dann:
/voice on
Aufnahmefluss:
- Drücke
Ctrl+B - Sprich
- Warte, bis die Stille-Erkennung automatisch stoppt
- Hermes transkribiert und antwortet
- Wenn TTS aktiviert ist, spricht es die Antwort
- Die Schleife startet für die kontinuierliche Nutzung neu
Nützliche Befehle:
/voice
/voice on
/voice off
/voice tts
/voice status
Tolle Sprach-Workflows
Debugging im Vorbeigehen: Sage “Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir, ihn zu beheben.” Fahre dann freihändig fort: “Lies den letzten Fehler noch einmal vor”, “Erkläre die Ursache in einfacheren Worten”, “Gib mir jetzt die genaue Lösung”.
Recherche/Brainstorming: Perfekt zum Herumlaufen, halbfertige Ideen diktieren und Hermes bitten, deine Gedanken in Echtzeit zu strukturieren.
Barrierefreiheit: Wenn Tippen unpraktisch ist, hält dich der Sprachmodus voll im Hermes-Kreislauf.
Verhalten anpassen
Wenn Hermes zu aggressiv startet/stoppt, passe die Stille-Einstellungen in deiner Konfiguration an:
voice:
silence_threshold: 200
silence_duration: 3.0
Senke den Schwellenwert für eine empfindlichere Erkennung oder erhöhe ihn, wenn er dich abschneidet.
Das war’s! Der Sprachmodus ist eines dieser Features, die sich wie Magie anfühlen, sobald sie laufen. Fang einfach an, werde vertraut, und bald wirst du volle Gespräche mit Hermes führen, während du abwäschst. Viel Spaß beim Sprechen! 🎤
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › guides/use-voice-mode-with-hermes