🤖HermesBlog
Hermes Official Tutorials · Teil 278/9/2026

Tutorial 27: Sprachmodus

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutorial 27: Sprachmodus

Willkommen zurück, Freunde! Heute sprechen wir über eine der coolsten Möglichkeiten, Hermes zu nutzen: den Sprachmodus. Wenn du schon immer mal mit deinem KI-Assistenten chatten wolltest, während du herumläufst, kochst oder einfach die Tastatur vermeiden willst, ist dieses Tutorial genau das Richtige für dich.

Was ist der Sprachmodus?

Der Sprachmodus ermöglicht es dir, mit Hermes zu sprechen, anstatt zu tippen. Er ist perfekt für:

  • Freihändige CLI-Workflows – Code und Recherche, ohne die Tastatur zu berühren
  • Sprachantworten in Telegram oder Discord – erhalte Sprachantworten neben normalen Nachrichten
  • Live-Discord-Sprachkanäle – führe echte Gespräche mit Hermes in einem Voice-Chat
  • Schnelles Festhalten von Ideen – diktierte Gedanken beim Spazierengehen oder Brainstorming

Das Beste daran? Wenn du Nous Portal nutzt, erhältst du sowohl das LLM als auch die Text-to-Speech-Funktion über einen einzigen OAuth-Login. Keine zusätzlichen Zugangsdaten nötig!

Drei Möglichkeiten, den Sprachmodus zu nutzen

Modus Am besten geeignet für Plattform
Interaktive Mikrofon-Schleife Persönliche freihändige Nutzung CLI
Sprachantworten im Chat Sprachantworten mit Messaging Telegram, Discord
Live-Sprachkanal-Bot Gruppenunterhaltungen Discord-Sprachkanäle

Profi-Tipp: Stelle zuerst sicher, dass der Textmodus funktioniert, füge dann Sprachantworten hinzu und probiere schließlich Discord-Sprachkanäle aus, wenn du das volle Erlebnis möchtest.

Schritt 1: Text zuerst zum Laufen bringen

Bevor du in den Sprachmodus eintauchst, stelle sicher, dass die Grundlagen funktionieren:

hermes

Stelle dann eine einfache Frage:

Welche Tools hast du zur Verfügung?

Wenn das solide läuft, bist du bereit für den Sprachmodus!

Schritt 2: Die Extras installieren

Je nachdem, was du brauchst, installiere die passenden Pakete:

# CLI-Mikrofon + Wiedergabe
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Messaging-Plattformen (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# Premium ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Alles
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Schritt 3: Systemabhängigkeiten

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Hier ist, warum diese wichtig sind:

  • portaudio → Mikrofoneingabe für CLI-Sprache
  • ffmpeg → Audiokonvertierung
  • opus → Discord-Sprachcodec
  • espeak-ng → Phonemisierer für NeuTTS

Schritt 4: Anbieter auswählen

Einfachste Einrichtung: Lokales STT und kostenloses Edge TTS verwenden. Füge dies zu ~/.hermes/.env hinzu:

# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Premium-TTS (optional)
ELEVENLABS_API_KEY=***

STT-Optionen:

  • local – am besten für Datenschutz, keine Kosten
  • groq – superschnelle Cloud-Transkription
  • openai – gute kostenpflichtige Alternative

TTS-Optionen:

  • edge – kostenlos und für die meisten Fälle gut genug
  • neutts – kostenlos lokal/auf dem Gerät
  • elevenlabs – beste Qualität
  • openai – guter Mittelweg
  • mistral – mehrsprachig, natives Opus

Schritt 5: Empfohlene Konfiguration

Hier ist eine solide Standardkonfiguration für die meisten:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Hinweis zu submit_mode:

  • direct (Standard) – übermittelt die Transkription sofort
  • draft – legt die Transkription im Editor ab, damit du sie vor dem Senden bearbeiten kannst

Für bearbeitbare Entwürfe setze submit_mode: "draft".

Sprachmodus in der CLI verwenden

Starte Hermes und aktiviere den Sprachmodus:

hermes

Tippe dann:

/voice on

Aufnahmefluss:

  1. Drücke Ctrl+B
  2. Sprich
  3. Warte, bis die Stille-Erkennung automatisch stoppt
  4. Hermes transkribiert und antwortet
  5. Wenn TTS aktiviert ist, spricht es die Antwort
  6. Die Schleife startet für die kontinuierliche Nutzung neu

Nützliche Befehle:

/voice
/voice on
/voice off
/voice tts
/voice status

Tolle Sprach-Workflows

Debugging im Vorbeigehen: Sage “Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir, ihn zu beheben.” Fahre dann freihändig fort: “Lies den letzten Fehler noch einmal vor”, “Erkläre die Ursache in einfacheren Worten”, “Gib mir jetzt die genaue Lösung”.

Recherche/Brainstorming: Perfekt zum Herumlaufen, halbfertige Ideen diktieren und Hermes bitten, deine Gedanken in Echtzeit zu strukturieren.

Barrierefreiheit: Wenn Tippen unpraktisch ist, hält dich der Sprachmodus voll im Hermes-Kreislauf.

Verhalten anpassen

Wenn Hermes zu aggressiv startet/stoppt, passe die Stille-Einstellungen in deiner Konfiguration an:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Senke den Schwellenwert für eine empfindlichere Erkennung oder erhöhe ihn, wenn er dich abschneidet.


Das war’s! Der Sprachmodus ist eines dieser Features, die sich wie Magie anfühlen, sobald sie laufen. Fang einfach an, werde vertraut, und bald wirst du volle Gespräche mit Hermes führen, während du abwäschst. Viel Spaß beim Sprechen! 🎤

📖 Offizielle Dokumentation

この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › guides/use-voice-mode-with-hermes