🤖HermesBlog
Hermes Version History · Teil 28/9/2026

Hermes v2026.8.3 Update: Echtzeit-Sprache, Agenten-Kommunikation & überprüfbare Quellenangaben

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 Update: Echtzeit-Sprache, Agenten-Kommunikation & überprüfbare Quellenangaben

Hallo zusammen, willkommen zurück zum Hermes-Blog! Heute tauchen wir in eines der aufregendsten Updates ein: den Echtzeit-Sprachmodus. Wenn du schon immer mit deinem Agenten sprechen wolltest, anstatt jeden Befehl zu tippen, ist dieses Update genau das Richtige für dich. Und das Beste daran? Die Einrichtung ist viel einfacher, als du denkst.

Lass uns alles durchgehen, was du wissen musst, um den Sprachmodus noch heute zum Laufen zu bringen.

Wofür der Sprachmodus wirklich gut ist

Der Sprachmodus ist kein bloßer Gimmick – er ist in vielen Szenarien wirklich nützlich:

  • Freihändige CLI-Workflows, während du programmierst oder recherchierst
  • Gesprochene Antworten direkt in Telegram oder Discord
  • Live-Gespräche mit Hermes in einem Discord-Sprachkanal
  • Schnelles Festhalten von Ideen beim Spazierengehen, statt anzuhalten und zu tippen

Stell dir vor, dein Agent wird zum Gesprächspartner, nicht nur zu einem Textfeld.

Drei Möglichkeiten, Sprache zu nutzen

Es gibt drei verschiedene Sprach-Erlebnisse in Hermes, und du kannst wählen, was zu deinem Stil passt:

Modus Am besten geeignet für Plattform
Interaktive Mikrofon-Schleife Persönliche freihändige Nutzung CLI
Sprachantworten im Chat Gesprochene Antworten neben Nachrichten Telegram, Discord
Live-Sprachkanal-Bot Gruppen- oder persönliche Live-Gespräche Discord-Sprachkanäle

Ein smarter Weg: Lass zuerst Text funktionieren, aktiviere dann Sprachantworten und probiere schließlich Discord-Sprachkanäle aus, wenn du das volle Erlebnis möchtest.

Schritt 1: Lass zuerst Text funktionieren

Bevor du dich an Sprache wagst, stelle sicher, dass die Grundlagen solide sind:

hermes

Frag dann etwas Einfaches:

Welche Tools hast du zur Verfügung?

Wenn das funktioniert, bist du bereit für den nächsten Schritt.

Schritt 2: Installiere die richtigen Extras

Je nachdem, was du möchtest, installiere das passende Paket:

CLI-Mikrofon + Wiedergabe:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Messaging-Plattformen:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

Premium-ElevenLabs-TTS:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

Lokales NeuTTS (optional):

python -m pip install -U neutts[all]

Alles auf einmal:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Schritt 3: Systemabhängigkeiten

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Hier ist, warum diese wichtig sind:

  • portaudio → Mikrofon-Eingang und Wiedergabe
  • ffmpeg → Audiokonvertierung
  • opus → Discord-Sprachcodec-Unterstützung
  • espeak-ng → Phonemisierer für NeuTTS

Schritt 4: Wähle deine Sprach-Anbieter

Hermes unterstützt sowohl lokale als auch Cloud-basierte Sprach-Stacks. Die einfachste und günstigste Einrichtung ist lokales STT mit kostenlosem Edge-TTS:

  • STT-Anbieter: local
  • TTS-Anbieter: edge

Füge alle API-Schlüssel zu ~/.hermes/.env hinzu:

# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Premium-TTS (optional)
ELEVENLABS_API_KEY=***

Schnelle Empfehlungen:

  • STT: local für Datenschutz, groq für Geschwindigkeit, openai als kostenpflichtige Alternative
  • TTS: edge für kostenlos, neutts für lokal, elevenlabs für beste Qualität

Schritt 5: Empfohlene Konfiguration

Hier ist ein solides, konservatives Standard-Setup:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Eine wichtige Einstellung: voice.submit_mode steuert, was nach der Transkription passiert. direct sendet sofort ab, während draft dir erlaubt, vor dem Senden zu bearbeiten. Für bearbeitbare Entwürfe setze:

voice:
  submit_mode: "draft"

Sprache in der CLI verwenden

Starte Hermes und aktiviere Sprache:

hermes

Dann in der CLI:

/voice on

Aufnahme-Ablauf:

  1. Drücke Ctrl+B
  2. Sprich
  3. Warte, bis die Stille-Erkennung automatisch stoppt
  4. Hermes transkribiert und antwortet
  5. Wenn TTS aktiviert ist, spricht es die Antwort

Nützliche Befehle:

/voice
/voice on
/voice off
/voice tts
/voice status

Tolle CLI-Workflows

Schnelles Debugging: Sag einfach „Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir beim Debuggen.“ Dann mach freihändig weiter: „Lies den letzten Fehler nochmal vor“, „Erkläre die Ursache in einfacheren Worten“, „Jetzt gib mir die genaue Lösung.“

Recherche und Brainstorming: Perfekt zum Herumlaufen beim Nachdenken, zum Diktieren halbfertiger Ideen und um Hermes zu bitten, deine Gedanken in Echtzeit zu strukturieren.

Barrierefreiheit: Wenn Tippen unpraktisch ist, hält dich der Sprachmodus voll im Hermes-Kreislauf – ganz ohne Tastatur.

Verhalten anpassen

Wenn Hermes zu aggressiv oder zu zögerlich mit der Aufnahme beginnt oder stoppt, passe die Werte für silence_threshold und silence_duration in deiner Konfiguration an.

Das war’s! Der Sprachmodus ist jetzt live und einsatzbereit. Starte mit Text, füge Sprachantworten hinzu und erkunde Discord-Sprachkanäle, wenn du bereit bist. Viel Spaß beim Reden!

📖 Offizielle Dokumentation

この記事は Hermes Agent のOffizielle Dokumentationに基づいています:GitHub ›/releases/tag/v2026.8.3