Hermes v2026.8.3 Update: Echtzeit-Sprache, Agenten-Kommunikation & überprüfbare Quellenangaben
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Hermes v2026.8.3 Update: Echtzeit-Sprache, Agenten-Kommunikation & überprüfbare Quellenangaben
Hallo zusammen, willkommen zurück zum Hermes-Blog! Heute tauchen wir in eines der aufregendsten Updates ein: den Echtzeit-Sprachmodus. Wenn du schon immer mit deinem Agenten sprechen wolltest, anstatt jeden Befehl zu tippen, ist dieses Update genau das Richtige für dich. Und das Beste daran? Die Einrichtung ist viel einfacher, als du denkst.
Lass uns alles durchgehen, was du wissen musst, um den Sprachmodus noch heute zum Laufen zu bringen.
Wofür der Sprachmodus wirklich gut ist
Der Sprachmodus ist kein bloßer Gimmick – er ist in vielen Szenarien wirklich nützlich:
- Freihändige CLI-Workflows, während du programmierst oder recherchierst
- Gesprochene Antworten direkt in Telegram oder Discord
- Live-Gespräche mit Hermes in einem Discord-Sprachkanal
- Schnelles Festhalten von Ideen beim Spazierengehen, statt anzuhalten und zu tippen
Stell dir vor, dein Agent wird zum Gesprächspartner, nicht nur zu einem Textfeld.
Drei Möglichkeiten, Sprache zu nutzen
Es gibt drei verschiedene Sprach-Erlebnisse in Hermes, und du kannst wählen, was zu deinem Stil passt:
| Modus | Am besten geeignet für | Plattform |
|---|---|---|
| Interaktive Mikrofon-Schleife | Persönliche freihändige Nutzung | CLI |
| Sprachantworten im Chat | Gesprochene Antworten neben Nachrichten | Telegram, Discord |
| Live-Sprachkanal-Bot | Gruppen- oder persönliche Live-Gespräche | Discord-Sprachkanäle |
Ein smarter Weg: Lass zuerst Text funktionieren, aktiviere dann Sprachantworten und probiere schließlich Discord-Sprachkanäle aus, wenn du das volle Erlebnis möchtest.
Schritt 1: Lass zuerst Text funktionieren
Bevor du dich an Sprache wagst, stelle sicher, dass die Grundlagen solide sind:
hermes
Frag dann etwas Einfaches:
Welche Tools hast du zur Verfügung?
Wenn das funktioniert, bist du bereit für den nächsten Schritt.
Schritt 2: Installiere die richtigen Extras
Je nachdem, was du möchtest, installiere das passende Paket:
CLI-Mikrofon + Wiedergabe:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Messaging-Plattformen:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
Premium-ElevenLabs-TTS:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
Lokales NeuTTS (optional):
python -m pip install -U neutts[all]
Alles auf einmal:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Schritt 3: Systemabhängigkeiten
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Hier ist, warum diese wichtig sind:
portaudio→ Mikrofon-Eingang und Wiedergabeffmpeg→ Audiokonvertierungopus→ Discord-Sprachcodec-Unterstützungespeak-ng→ Phonemisierer für NeuTTS
Schritt 4: Wähle deine Sprach-Anbieter
Hermes unterstützt sowohl lokale als auch Cloud-basierte Sprach-Stacks. Die einfachste und günstigste Einrichtung ist lokales STT mit kostenlosem Edge-TTS:
- STT-Anbieter:
local - TTS-Anbieter:
edge
Füge alle API-Schlüssel zu ~/.hermes/.env hinzu:
# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium-TTS (optional)
ELEVENLABS_API_KEY=***
Schnelle Empfehlungen:
- STT:
localfür Datenschutz,groqfür Geschwindigkeit,openaials kostenpflichtige Alternative - TTS:
edgefür kostenlos,neuttsfür lokal,elevenlabsfür beste Qualität
Schritt 5: Empfohlene Konfiguration
Hier ist ein solides, konservatives Standard-Setup:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Eine wichtige Einstellung: voice.submit_mode steuert, was nach der Transkription passiert. direct sendet sofort ab, während draft dir erlaubt, vor dem Senden zu bearbeiten. Für bearbeitbare Entwürfe setze:
voice:
submit_mode: "draft"
Sprache in der CLI verwenden
Starte Hermes und aktiviere Sprache:
hermes
Dann in der CLI:
/voice on
Aufnahme-Ablauf:
- Drücke
Ctrl+B - Sprich
- Warte, bis die Stille-Erkennung automatisch stoppt
- Hermes transkribiert und antwortet
- Wenn TTS aktiviert ist, spricht es die Antwort
Nützliche Befehle:
/voice
/voice on
/voice off
/voice tts
/voice status
Tolle CLI-Workflows
Schnelles Debugging: Sag einfach „Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir beim Debuggen.“ Dann mach freihändig weiter: „Lies den letzten Fehler nochmal vor“, „Erkläre die Ursache in einfacheren Worten“, „Jetzt gib mir die genaue Lösung.“
Recherche und Brainstorming: Perfekt zum Herumlaufen beim Nachdenken, zum Diktieren halbfertiger Ideen und um Hermes zu bitten, deine Gedanken in Echtzeit zu strukturieren.
Barrierefreiheit: Wenn Tippen unpraktisch ist, hält dich der Sprachmodus voll im Hermes-Kreislauf – ganz ohne Tastatur.
Verhalten anpassen
Wenn Hermes zu aggressiv oder zu zögerlich mit der Aufnahme beginnt oder stoppt, passe die Werte für silence_threshold und silence_duration in deiner Konfiguration an.
Das war’s! Der Sprachmodus ist jetzt live und einsatzbereit. Starte mit Text, füge Sprachantworten hinzu und erkunde Discord-Sprachkanäle, wenn du bereit bist. Viel Spaß beim Reden!
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:GitHub ›/releases/tag/v2026.8.3