Mise à jour Hermes v2026.8.3 : Voix en temps réel, communication entre agents et citations vérifiables
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Mise à jour Hermes v2026.8.3 : Voix en temps réel, communication entre agents et citations vérifiables
Salut à tous, bienvenue sur le blog Hermes ! Aujourd’hui, on plonge dans l’une des mises à jour les plus excitantes à ce jour : le mode vocal en temps réel. Si vous avez déjà rêvé de parler à votre agent au lieu de taper chaque commande, cette mise à jour est faite pour vous. Et le meilleur dans tout ça ? C’est bien plus simple à configurer que vous ne le pensez.
Passons en revue tout ce que vous devez savoir pour faire fonctionner le mode vocal dès aujourd’hui.
À quoi sert vraiment le mode vocal
Le mode vocal n’est pas qu’un gadget — il est réellement utile dans de nombreuses situations :
- Flux de travail CLI mains libres pendant que vous codez ou faites des recherches
- Réponses vocales directement dans Telegram ou Discord
- Conversation en direct avec Hermes dans un salon vocal Discord
- Capture rapide d’idées en marchant, sans avoir à vous arrêter pour taper
Considérez-le comme votre agent qui devient un interlocuteur, pas juste une boîte de texte.
Trois façons d’utiliser la voix
Il existe trois expériences vocales distinctes dans Hermes, et vous pouvez choisir celle qui correspond à votre style :
| Mode | Idéal pour | Plateforme |
|---|---|---|
| Boucle microphone interactive | Usage personnel mains libres | CLI |
| Réponses vocales dans le chat | Réponses parlées en complément des messages | Telegram, Discord |
| Bot de salon vocal en direct | Conversation en direct en groupe ou en solo | Salons vocaux Discord |
Une approche intelligente : faites fonctionner le texte d’abord, puis activez les réponses vocales, et enfin essayez les salons vocaux Discord si vous voulez l’expérience complète.
Étape 1 : Faites fonctionner le texte d’abord
Avant de toucher à la voix, assurez-vous que les bases sont solides :
hermes
Puis posez une question simple :
Quels outils avez-vous à disposition ?
Si ça fonctionne, vous êtes prêt à passer à la suite.
Étape 2 : Installez les bons extras
Selon ce que vous voulez, installez le paquet approprié :
Microphone CLI + lecture :
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Plateformes de messagerie :
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS premium ElevenLabs :
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS local (optionnel) :
python -m pip install -U neutts[all]
Tout d’un coup :
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Étape 3 : Dépendances système
macOS :
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian :
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Voici pourquoi ces dépendances sont importantes :
portaudio→ entrée microphone et lectureffmpeg→ conversion audioopus→ prise en charge du codec vocal Discordespeak-ng→ phonémiseur pour NeuTTS
Étape 4 : Choisissez vos fournisseurs vocaux
Hermes prend en charge les piles vocales locales et cloud. La configuration la plus simple et la moins chère est la STT locale avec Edge TTS gratuit :
- Fournisseur STT :
local - Fournisseur TTS :
edge
Ajoutez les éventuelles clés API dans ~/.hermes/.env :
# Options STT cloud (local ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (optionnel)
ELEVENLABS_API_KEY=***
Recommandations rapides :
- STT :
localpour la confidentialité,groqpour la vitesse,openaicomme solution payante de secours - TTS :
edgepour le gratuit,neuttspour le local,elevenlabspour la meilleure qualité
Étape 5 : Configuration recommandée
Voici une configuration par défaut solide et prudente :
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Un paramètre important : voice.submit_mode contrôle ce qui se passe après la transcription. direct soumet immédiatement, tandis que draft vous permet de modifier avant l’envoi. Pour des brouillons modifiables, définissez :
voice:
submit_mode: "draft"
Utiliser la voix dans la CLI
Démarrez Hermes et activez la voix :
hermes
Puis dans la CLI :
/voice on
Flux d’enregistrement :
- Appuyez sur
Ctrl+B - Parlez
- Attendez que la détection de silence s’arrête automatiquement
- Hermes transcrit et répond
- Si le TTS est activé, il prononce la réponse
Commandes utiles :
/voice
/voice on
/voice off
/voice tts
/voice status
Excellents flux de travail CLI
Débogage en marchant : Dites simplement « J’ai toujours une erreur de permission Docker. Aide-moi à la corriger. » Puis continuez mains libres : « Relis la dernière erreur », « Explique la cause racine plus simplement », « Maintenant donne-moi la correction exacte. »
Recherche et brainstorming : Parfait pour réfléchir en marchant, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.
Accessibilité : Si la saisie est difficile, le mode vocal vous maintient dans la boucle Hermes complète sans le clavier.
Ajuster le comportement
Si Hermes commence ou arrête d’enregistrer de manière trop agressive, ajustez les valeurs silence_threshold et silence_duration dans votre configuration.
C’est tout ! Le mode vocal est maintenant opérationnel et prêt à l’emploi. Commencez avec le texte, ajoutez les réponses vocales, et explorez les salons vocaux Discord quand vous serez prêt. Bonne conversation !
📖 Documentation officielle
Cet article est basé sur la documentation officielle de Hermes Agent :GitHub ›/releases/tag/v2026.8.3