Mit dem Sprachmodus mit KI sprechen
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
Mit dem Sprachmodus mit KI sprechen
Der Sprachmodus gehört zu diesen Funktionen, die sich beim ersten Ausprobieren wie Magie anfühlen. Statt jeden Befehl zu tippen und jede Antwort zu lesen, kannst du einfach … sprechen. Hermes hört zu, denkt nach und antwortet. Dieser Leitfaden führt dich durch alles, was du brauchst, um den Sprachmodus zum Laufen zu bringen – von einem einfachen Mikrofon-Setup bis hin zu einem vollwertigen Discord-Sprachkanal-Bot.
Wofür der Sprachmodus gut ist
Der Sprachmodus glänzt, wenn deine Hände beschäftigt sind oder du einfach eine natürlichere Art der Interaktion mit KI möchtest. Hier sind die häufigsten Anwendungsfälle:
- Freihändiger CLI-Workflow – Weiterprogrammieren oder Recherchieren, während du mit Hermes sprichst
- Sprachantworten in Telegram oder Discord – Erhalte Sprachantworten neben normalen Textnachrichten
- Live-Discord-Sprachkanal – Lass Hermes einem Sprachkanal beitreten für Echtzeit-Konversationen
- Schnelles Festhalten von Ideen – Diktiere Gedanken beim Spazierengehen, statt zu tippen
Drei Möglichkeiten, den Sprachmodus zu nutzen
Hermes bietet drei verschiedene Sprach-Erlebnisse. Wähle das, was zu deinen Bedürfnissen passt:
| Modus | Am besten geeignet für | Plattform |
|---|---|---|
| Interaktive Mikrofon-Schleife | Persönliche freihändige Nutzung beim Programmieren | CLI |
| Sprachantworten im Chat | Sprachantworten mit normalem Messaging | Telegram, Discord |
| Live-Sprachkanal-Bot | Gruppen- oder persönliche Live-Konversation | Discord-Sprachkanäle |
Ein guter Weg ist, einfach anzufangen: Zuerst Text zum Laufen bringen, dann Sprachantworten aktivieren und schließlich zu Discord-Sprachkanälen wechseln, wenn du das volle Erlebnis möchtest.
Schritt 1: Stelle sicher, dass der Textmodus zuerst funktioniert
Bevor du dich an den Sprachmodus wagst, überprüfe, ob Hermes startet und dein Provider konfiguriert ist. Führe hermes aus und stelle etwas Einfaches wie:
What tools do you have available?
Wenn das noch nicht stabil läuft, behebe zuerst den Textmodus. Der Sprachmodus baut darauf auf.
Schritt 2: Die richtigen Extras installieren
Je nachdem, welches Sprach-Erlebnis du möchtest, installiere die entsprechenden Extras:
CLI-Mikrofon + Wiedergabe:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Messaging-Plattformen (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
Premium-ElevenLabs-TTS (optional):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
Lokales NeuTTS (optional):
python -m pip install -U neutts[all]
Alles:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Schritt 3: Systemabhängigkeiten installieren
Der Sprachmodus benötigt ein paar Systempakete für Audio-Eingabe, Konvertierung und Wiedergabe.
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Hier ist, warum jedes davon wichtig ist:
portaudio→ Mikrofon-Eingabe und Wiedergabe für den CLI-Sprachmodusffmpeg→ Audio-Konvertierung für TTS und Messaging-Zustellungopus→ Discord-Sprachcodec-Unterstützungespeak-ng→ Phonemisierer-Backend für NeuTTS
Schritt 4: Wähle deine Sprach-Provider
Hermes unterstützt sowohl lokale als auch Cloud-Sprach-Stacks. Das einfachste und günstigste Setup verwendet lokales STT und kostenloses Edge-TTS:
- STT-Provider:
local - TTS-Provider:
edge
Füge alle Cloud-Schlüssel zu ~/.hermes/.env hinzu:
# Cloud-STT-Optionen (lokal benötigt keinen Schlüssel)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium-TTS (optional)
ELEVENLABS_API_KEY=***
Sprach-zu-Text-Empfehlungen:
local→ beste Standardoption für Privatsphäre und null Kostengroq→ sehr schnelle Cloud-Transkriptionopenai→ gute kostenpflichtige Alternative
Text-zu-Sprache-Empfehlungen:
edge→ kostenlos und für die meisten Nutzer gut genugneutts→ kostenloses lokales/On-Device-TTSelevenlabs→ beste Qualitätopenai→ guter Mittelwegmistral→ mehrsprachig, natives Opus
Schritt 5: Empfohlene Konfiguration
Hier ist ein solides, konservatives Standard-Setup für die meisten Menschen:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Die Einstellung submit_mode steuert, was nach der Transkription passiert:
direct(Standard) übermittelt das Transkript sofortdraftlegt das Transkript in den Editor, damit du es vor dem Senden bearbeiten kannst
Für bearbeitbare Sprach-Entwürfe setze submit_mode: "draft".
Sprachmodus in der CLI verwenden
Starte Hermes und aktiviere den Sprachmodus:
hermes
Dann innerhalb der CLI:
/voice on
Aufnahme-Ablauf:
- Drücke
Ctrl+B - Sprich
- Warte, bis die Stille-Erkennung die Aufnahme automatisch stoppt
- Hermes transkribiert und antwortet
- Wenn TTS aktiviert ist, spricht es die Antwort
- Die Schleife kann für kontinuierliche Nutzung automatisch neu starten
Nützliche Befehle:
/voice
/voice on
/voice off
/voice tts
/voice status
Tolle CLI-Workflows
Schnelles Debugging: Sage „Ich bekomme ständig einen Docker-Berechtigungsfehler. Hilf mir beim Debuggen.“ Fahre dann freihändig mit Nachfragen fort wie „Lies den letzten Fehler nochmal“ oder „Gib mir jetzt die genaue Lösung.“
Recherche und Brainstorming: Perfekt zum Herumlaufen beim Nachdenken, zum Diktieren halbfertiger Ideen und um Hermes zu bitten, deine Gedanken in Echtzeit zu strukturieren.
Barrierefreiheit: Wenn Tippen unbequem ist, ist der Sprachmodus einer der schnellsten Wege, in der vollen Hermes-Schleife zu bleiben.
CLI-Verhalten feinjustieren
Wenn Hermes zu aggressiv mit der Aufnahme beginnt oder stoppt, passe die Stille-Einstellungen in deiner Konfiguration an:
voice:
silence_threshold: 200
silence_duration: 3.0
Senke den Schwellenwert, wenn es zu früh stoppt, oder erhöhe ihn, wenn Hintergrundgeräusche die Aufnahme am Laufen halten. Die Dauer steuert, wie lange eine Pause sein muss, um den Stopp auszulösen.
Der Sprachmodus ist ein Game-Changer, sobald du ihn eingerichtet hast. Beginne mit der grundlegenden CLI-Schleife und erweitere dann auf Messaging-Plattformen und Discord-Sprachkanäle, wenn du dich wohlfühlst. Viel Spaß beim Sprechen!
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › guides/use-voice-mode-with-hermes