🤖HermesBlog
Hermes Feature Guides · Teil 68/9/2026

Mit dem Sprachmodus mit KI sprechen

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

Mit dem Sprachmodus mit KI sprechen

Der Sprachmodus gehört zu diesen Funktionen, die sich beim ersten Ausprobieren wie Magie anfühlen. Statt jeden Befehl zu tippen und jede Antwort zu lesen, kannst du einfach … sprechen. Hermes hört zu, denkt nach und antwortet. Dieser Leitfaden führt dich durch alles, was du brauchst, um den Sprachmodus zum Laufen zu bringen – von einem einfachen Mikrofon-Setup bis hin zu einem vollwertigen Discord-Sprachkanal-Bot.

Wofür der Sprachmodus gut ist

Der Sprachmodus glänzt, wenn deine Hände beschäftigt sind oder du einfach eine natürlichere Art der Interaktion mit KI möchtest. Hier sind die häufigsten Anwendungsfälle:

  • Freihändiger CLI-Workflow – Weiterprogrammieren oder Recherchieren, während du mit Hermes sprichst
  • Sprachantworten in Telegram oder Discord – Erhalte Sprachantworten neben normalen Textnachrichten
  • Live-Discord-Sprachkanal – Lass Hermes einem Sprachkanal beitreten für Echtzeit-Konversationen
  • Schnelles Festhalten von Ideen – Diktiere Gedanken beim Spazierengehen, statt zu tippen

Drei Möglichkeiten, den Sprachmodus zu nutzen

Hermes bietet drei verschiedene Sprach-Erlebnisse. Wähle das, was zu deinen Bedürfnissen passt:

Modus Am besten geeignet für Plattform
Interaktive Mikrofon-Schleife Persönliche freihändige Nutzung beim Programmieren CLI
Sprachantworten im Chat Sprachantworten mit normalem Messaging Telegram, Discord
Live-Sprachkanal-Bot Gruppen- oder persönliche Live-Konversation Discord-Sprachkanäle

Ein guter Weg ist, einfach anzufangen: Zuerst Text zum Laufen bringen, dann Sprachantworten aktivieren und schließlich zu Discord-Sprachkanälen wechseln, wenn du das volle Erlebnis möchtest.

Schritt 1: Stelle sicher, dass der Textmodus zuerst funktioniert

Bevor du dich an den Sprachmodus wagst, überprüfe, ob Hermes startet und dein Provider konfiguriert ist. Führe hermes aus und stelle etwas Einfaches wie:

What tools do you have available?

Wenn das noch nicht stabil läuft, behebe zuerst den Textmodus. Der Sprachmodus baut darauf auf.

Schritt 2: Die richtigen Extras installieren

Je nachdem, welches Sprach-Erlebnis du möchtest, installiere die entsprechenden Extras:

CLI-Mikrofon + Wiedergabe:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Messaging-Plattformen (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

Premium-ElevenLabs-TTS (optional):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

Lokales NeuTTS (optional):

python -m pip install -U neutts[all]

Alles:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Schritt 3: Systemabhängigkeiten installieren

Der Sprachmodus benötigt ein paar Systempakete für Audio-Eingabe, Konvertierung und Wiedergabe.

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Hier ist, warum jedes davon wichtig ist:

  • portaudio → Mikrofon-Eingabe und Wiedergabe für den CLI-Sprachmodus
  • ffmpeg → Audio-Konvertierung für TTS und Messaging-Zustellung
  • opus → Discord-Sprachcodec-Unterstützung
  • espeak-ng → Phonemisierer-Backend für NeuTTS

Schritt 4: Wähle deine Sprach-Provider

Hermes unterstützt sowohl lokale als auch Cloud-Sprach-Stacks. Das einfachste und günstigste Setup verwendet lokales STT und kostenloses Edge-TTS:

  • STT-Provider: local
  • TTS-Provider: edge

Füge alle Cloud-Schlüssel zu ~/.hermes/.env hinzu:

# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Premium-TTS (optional)
ELEVENLABS_API_KEY=***

Sprach-zu-Text-Empfehlungen:

  • local → beste Standardoption für Privatsphäre und null Kosten
  • groq → sehr schnelle Cloud-Transkription
  • openai → gute kostenpflichtige Alternative

Text-zu-Sprache-Empfehlungen:

  • edge → kostenlos und für die meisten Nutzer gut genug
  • neutts → kostenloses lokales/On-Device-TTS
  • elevenlabs → beste Qualität
  • openai → guter Mittelweg
  • mistral → mehrsprachig, natives Opus

Schritt 5: Empfohlene Konfiguration

Hier ist ein solides, konservatives Standard-Setup für die meisten Menschen:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Die Einstellung submit_mode steuert, was nach der Transkription passiert:

  • direct (Standard) übermittelt das Transkript sofort
  • draft legt das Transkript in den Editor, damit du es vor dem Senden bearbeiten kannst

Für bearbeitbare Sprach-Entwürfe setze submit_mode: "draft".

Sprachmodus in der CLI verwenden

Starte Hermes und aktiviere den Sprachmodus:

hermes

Dann innerhalb der CLI:

/voice on

Aufnahme-Ablauf:

  1. Drücke Ctrl+B
  2. Sprich
  3. Warte, bis die Stille-Erkennung die Aufnahme automatisch stoppt
  4. Hermes transkribiert und antwortet
  5. Wenn TTS aktiviert ist, spricht es die Antwort
  6. Die Schleife kann für kontinuierliche Nutzung automatisch neu starten

Nützliche Befehle:

/voice
/voice on
/voice off
/voice tts
/voice status

Tolle CLI-Workflows

Schnelles Debugging: Sage „Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir beim Debuggen.“ Fahre dann freihändig mit Nachfragen fort wie „Lies den letzten Fehler nochmal“ oder „Gib mir jetzt die genaue Lösung.“

Recherche und Brainstorming: Perfekt zum Herumlaufen beim Nachdenken, zum Diktieren halbfertiger Ideen und um Hermes zu bitten, deine Gedanken in Echtzeit zu strukturieren.

Barrierefreiheit: Wenn Tippen unbequem ist, ist der Sprachmodus einer der schnellsten Wege, in der vollen Hermes-Schleife zu bleiben.

CLI-Verhalten feinjustieren

Wenn Hermes zu aggressiv mit der Aufnahme beginnt oder stoppt, passe die Stille-Einstellungen in deiner Konfiguration an:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Senke den Schwellenwert, wenn es zu früh stoppt, oder erhöhe ihn, wenn Hintergrundgeräusche die Aufnahme am Laufen halten. Die Dauer steuert, wie lange eine Pause sein muss, um den Stopp auszulösen.

Der Sprachmodus ist ein Game-Changer, sobald du ihn eingerichtet hast. Beginne mit der grundlegenden CLI-Schleife und erweitere dann auf Messaging-Plattformen und Discord-Sprachkanäle, wenn du dich wohlfühlst. Viel Spaß beim Sprechen!

📖 Offizielle Dokumentation

この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › guides/use-voice-mode-with-hermes