🤖HermesBlog
Hermes Messaging Platforms · Partie 158/9/2026

Buzz : utilisez Hermes avec l'application de chat vocal IA

How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.

messaging-buzz

Buzz : utilisez Hermes avec l’application de chat vocal IA

Le mode vocal est arrivé, et il change complètement la façon d’interagir avec Hermes. Fini de taper chaque commande : vous pouvez désormais parler naturellement à votre agent — que vous codiez, fassiez des recherches ou que vous vous promeniez avec des idées qui fusent dans votre tête.

Ce guide vous accompagne pas à pas pour activer la voix, de la configuration la plus simple aux conversations complètes dans les salons vocaux Discord. C’est parti.

À quoi sert le mode vocal

Le mode vocal est idéal pour :

  • Garder les mains libres pendant que vous travaillez dans le terminal
  • Obtenir des réponses vocales dans Telegram ou Discord
  • Laisser Hermes rejoindre un salon vocal Discord pour des échanges en direct
  • Capturer rapidement des idées en marchant, sans avoir à taper

Considérez-le comme votre copilote mains libres. Débogage, brainstorming ou simples questions rapides — le mode vocal vous garde dans le flux.

Trois façons d’utiliser la voix

Hermes propose trois expériences vocales distinctes :

Mode Idéal pour Plateforme
Boucle micro interactive Usage personnel mains libres pendant le code CLI
Réponses vocales dans le chat Réponses parlées en complément des messages Telegram, Discord
Bot vocal en direct Conversations de groupe dans un salon vocal Salons vocaux Discord

Une stratégie intelligente : faites d’abord fonctionner le texte, puis activez les réponses vocales, et enfin passez aux salons vocaux Discord si vous voulez l’expérience complète.

Étape 1 : vérifiez d’abord que le texte fonctionne

Avant de toucher à la voix, vérifiez les bases :

hermes

Puis posez une question simple :

What tools do you have available?

Si ce n’est pas encore stable, corrigez d’abord le mode texte. La voix repose sur des fondations solides.

Étape 2 : installez les extras nécessaires

Selon votre configuration, installez ce dont vous avez besoin :

Micro + lecture audio CLI :

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plateformes de messagerie (Telegram/Discord) :

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs (optionnel) :

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (optionnel) :

python -m pip install -U neutts[all]

Tout d’un coup :

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Étape 3 : installez les dépendances système

macOS :

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian :

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Voici pourquoi chacun est important :

  • portaudio → entrée micro et lecture audio
  • ffmpeg → conversion audio pour TTS et messagerie
  • opus → prise en charge du codec vocal Discord
  • espeak-ng → phonémiseur pour NeuTTS

Étape 4 : choisissez vos fournisseurs vocaux

Hermes prend en charge les piles vocales locales et cloud. Pour démarrer facilement, utilisez la STT locale avec le TTS Edge gratuit.

Ajoutez ceci à ~/.hermes/.env :

# Options STT cloud (la locale ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (optionnel)
ELEVENLABS_API_KEY=***

Recommandations pour la reconnaissance vocale :

  • local → meilleur choix par défaut pour la confidentialité et le coût zéro
  • groq → transcription cloud très rapide
  • openai → bonne alternative payante

Recommandations pour la synthèse vocale :

  • edge → gratuit et suffisant pour la plupart des usages
  • neutts → TTS local gratuit sur l’appareil
  • elevenlabs → meilleure qualité
  • openai → bon compromis
  • mistral → multilingue, Opus natif

Étape 5 : configuration recommandée

Voici une configuration par défaut solide et prudente :

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI : direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Dans la TUI, submit_mode contrôle ce qui se passe après la transcription :

  • direct (par défaut) soumet la transcription immédiatement
  • draft la place dans l’éditeur pour que vous puissiez la modifier avant l’envoi

Pour des brouillons vocaux modifiables, définissez submit_mode: "draft".

Vous préférez un TTS local ? Passez à :

tts:
  provider: "neutts"
  neutts:
    ref_audio: ''
    ref_text: ''
    model: neuphonic/neutts-air-q4-gguf
    device: cpu

Cas d’usage : mode vocal CLI

Démarrez Hermes et activez la voix :

hermes

Puis dans la CLI :

/voice on

Déroulement de l’enregistrement :

  1. Appuyez sur Ctrl+B
  2. Parlez
  3. Attendez que la détection de silence s’arrête automatiquement
  4. Hermes transcrit et répond
  5. Si le TTS est activé, il prononce la réponse
  6. La boucle peut se relancer automatiquement pour une utilisation continue

Commandes utiles :

/voice
/voice on
/voice off
/voice tts
/voice status

Excellents flux de travail en CLI :

Débogage rapide : Dites « J’ai toujours une erreur de permission Docker. Aide-moi à la résoudre. » Puis continuez en mains libres : « Relis la dernière erreur », « Explique la cause racine plus simplement », « Donne-moi maintenant la correction exacte. »

Recherche et brainstorming : Parfait pour marcher tout en réfléchissant, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.

Accessibilité : Si la frappe est difficile, le mode vocal vous garde dans la boucle Hermes complète sans le clavier.

Réglage du comportement CLI

Si Hermes commence ou arrête l’enregistrement de manière trop agressive, ajustez ces paramètres dans votre configuration :

voice:
  silence_threshold: 200   # plus bas = plus sensible
  silence_duration: 3.0    # secondes de silence avant l'arrêt

Commencez avec les valeurs par défaut, puis ajustez selon votre environnement. Une pièce bruyante peut nécessiter un seuil plus élevé ; une pièce calme, un seuil plus bas.

Le mode vocal est l’un des moyens les plus rapides de rester productif avec Hermes. Commencez simplement, expérimentez avec les fournisseurs, et bientôt vous parlerez à votre agent comme si c’était naturel.

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › guides/use-voice-mode-with-hermes