🤖HermesBlog
Hermes Version History · Partie 28/9/2026

Mise à jour Hermes v2026.8.3 : Voix en temps réel, communication entre agents et citations vérifiables

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Mise à jour Hermes v2026.8.3 : Voix en temps réel, communication entre agents et citations vérifiables

Salut à tous, bienvenue sur le blog Hermes ! Aujourd’hui, on plonge dans l’une des mises à jour les plus excitantes à ce jour : le mode vocal en temps réel. Si vous avez déjà rêvé de parler à votre agent au lieu de taper chaque commande, cette mise à jour est faite pour vous. Et le meilleur dans tout ça ? C’est bien plus simple à configurer que vous ne le pensez.

Passons en revue tout ce que vous devez savoir pour faire fonctionner le mode vocal dès aujourd’hui.

À quoi sert vraiment le mode vocal

Le mode vocal n’est pas qu’un gadget — il est réellement utile dans de nombreuses situations :

  • Flux de travail CLI mains libres pendant que vous codez ou faites des recherches
  • Réponses vocales directement dans Telegram ou Discord
  • Conversation en direct avec Hermes dans un salon vocal Discord
  • Capture rapide d’idées en marchant, sans avoir à vous arrêter pour taper

Considérez-le comme votre agent qui devient un interlocuteur, pas juste une boîte de texte.

Trois façons d’utiliser la voix

Il existe trois expériences vocales distinctes dans Hermes, et vous pouvez choisir celle qui correspond à votre style :

Mode Idéal pour Plateforme
Boucle microphone interactive Usage personnel mains libres CLI
Réponses vocales dans le chat Réponses parlées en complément des messages Telegram, Discord
Bot de salon vocal en direct Conversation en direct en groupe ou en solo Salons vocaux Discord

Une approche intelligente : faites fonctionner le texte d’abord, puis activez les réponses vocales, et enfin essayez les salons vocaux Discord si vous voulez l’expérience complète.

Étape 1 : Faites fonctionner le texte d’abord

Avant de toucher à la voix, assurez-vous que les bases sont solides :

hermes

Puis posez une question simple :

Quels outils avez-vous à disposition ?

Si ça fonctionne, vous êtes prêt à passer à la suite.

Étape 2 : Installez les bons extras

Selon ce que vous voulez, installez le paquet approprié :

Microphone CLI + lecture :

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plateformes de messagerie :

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs :

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (optionnel) :

python -m pip install -U neutts[all]

Tout d’un coup :

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Étape 3 : Dépendances système

macOS :

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian :

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Voici pourquoi ces dépendances sont importantes :

  • portaudio → entrée microphone et lecture
  • ffmpeg → conversion audio
  • opus → prise en charge du codec vocal Discord
  • espeak-ng → phonémiseur pour NeuTTS

Étape 4 : Choisissez vos fournisseurs vocaux

Hermes prend en charge les piles vocales locales et cloud. La configuration la plus simple et la moins chère est la STT locale avec Edge TTS gratuit :

  • Fournisseur STT : local
  • Fournisseur TTS : edge

Ajoutez les éventuelles clés API dans ~/.hermes/.env :

# Options STT cloud (local ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (optionnel)
ELEVENLABS_API_KEY=***

Recommandations rapides :

  • STT : local pour la confidentialité, groq pour la vitesse, openai comme solution payante de secours
  • TTS : edge pour le gratuit, neutts pour le local, elevenlabs pour la meilleure qualité

Étape 5 : Configuration recommandée

Voici une configuration par défaut solide et prudente :

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Un paramètre important : voice.submit_mode contrôle ce qui se passe après la transcription. direct soumet immédiatement, tandis que draft vous permet de modifier avant l’envoi. Pour des brouillons modifiables, définissez :

voice:
  submit_mode: "draft"

Utiliser la voix dans la CLI

Démarrez Hermes et activez la voix :

hermes

Puis dans la CLI :

/voice on

Flux d’enregistrement :

  1. Appuyez sur Ctrl+B
  2. Parlez
  3. Attendez que la détection de silence s’arrête automatiquement
  4. Hermes transcrit et répond
  5. Si le TTS est activé, il prononce la réponse

Commandes utiles :

/voice
/voice on
/voice off
/voice tts
/voice status

Excellents flux de travail CLI

Débogage en marchant : Dites simplement « J’ai toujours une erreur de permission Docker. Aide-moi à la corriger. » Puis continuez mains libres : « Relis la dernière erreur », « Explique la cause racine plus simplement », « Maintenant donne-moi la correction exacte. »

Recherche et brainstorming : Parfait pour réfléchir en marchant, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.

Accessibilité : Si la saisie est difficile, le mode vocal vous maintient dans la boucle Hermes complète sans le clavier.

Ajuster le comportement

Si Hermes commence ou arrête d’enregistrer de manière trop agressive, ajustez les valeurs silence_threshold et silence_duration dans votre configuration.

C’est tout ! Le mode vocal est maintenant opérationnel et prêt à l’emploi. Commencez avec le texte, ajoutez les réponses vocales, et explorez les salons vocaux Discord quand vous serez prêt. Bonne conversation !

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :GitHub ›/releases/tag/v2026.8.3