🤖HermesBlog
Hermes Feature Guides · Partie 68/9/2026

Parler à l'IA avec le mode vocal

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

Parler à l’IA avec le mode vocal

Le mode vocal fait partie de ces fonctionnalités qui semblent magiques la première fois qu’on les essaie. Au lieu de taper chaque commande et de lire chaque réponse, vous pouvez simplement… parler. Hermes écoute, réfléchit et vous répond. Ce guide vous accompagne pas à pas pour configurer le mode vocal, d’une simple installation de microphone à un bot complet de canal vocal Discord.

À quoi sert le mode vocal

Le mode vocal est idéal quand vos mains sont occupées ou que vous voulez simplement une façon plus naturelle d’interagir avec l’IA. Voici les cas d’usage les plus courants :

  • Flux de travail CLI mains libres — continuez à coder ou à faire des recherches tout en parlant à Hermes
  • Réponses vocales dans Telegram ou Discord — recevez des réponses vocales en plus des messages texte normaux
  • Canal vocal Discord en direct — faites rejoindre un canal vocal à Hermes pour une conversation en temps réel
  • Capture rapide d’idées — dictez vos pensées en vous promenant au lieu de taper

Trois façons d’utiliser le mode vocal

Hermes propose trois expériences vocales distinctes. Choisissez celle qui correspond à vos besoins :

Mode Idéal pour Plateforme
Boucle microphone interactive Usage personnel mains libres pendant le codage CLI
Réponses vocales dans le chat Réponses vocales avec messagerie classique Telegram, Discord
Bot de canal vocal en direct Conversation en direct en groupe ou en solo Canaux vocaux Discord

Une bonne approche consiste à commencer simplement : faites fonctionner le texte d’abord, puis activez les réponses vocales, et enfin passez aux canaux vocaux Discord si vous voulez l’expérience complète.

Étape 1 : Vérifiez d’abord que le mode texte fonctionne

Avant de toucher au mode vocal, vérifiez que Hermes démarre et que votre fournisseur est configuré. Lancez hermes et posez une question simple comme :

What tools do you have available?

Si ce n’est pas encore stable, corrigez d’abord le mode texte. Le mode vocal s’appuie dessus.

Étape 2 : Installez les extras appropriés

Selon l’expérience vocale souhaitée, installez les extras correspondants :

Microphone CLI + lecture :

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plateformes de messagerie (Telegram/Discord) :

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs (optionnel) :

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (optionnel) :

python -m pip install -U neutts[all]

Tout :

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Étape 3 : Installez les dépendances système

Le mode vocal nécessite quelques paquets système pour gérer la capture audio, la conversion et la lecture.

macOS :

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian :

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Voici pourquoi chacun est important :

  • portaudio → capture microphone et lecture pour le mode vocal CLI
  • ffmpeg → conversion audio pour la TTS et la livraison par messagerie
  • opus → prise en charge du codec vocal Discord
  • espeak-ng → backend de phonémisation pour NeuTTS

Étape 4 : Choisissez vos fournisseurs vocaux

Hermes prend en charge les piles vocales locales et cloud. La configuration la plus simple et la moins chère utilise la STT locale et la TTS Edge gratuite :

  • Fournisseur STT : local
  • Fournisseur TTS : edge

Ajoutez d’éventuelles clés cloud dans ~/.hermes/.env :

# Options STT cloud (local ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (optionnel)
ELEVENLABS_API_KEY=***

Recommandations pour la reconnaissance vocale (STT) :

  • local → meilleur choix par défaut pour la confidentialité et le coût zéro
  • groq → transcription cloud très rapide
  • openai → bonne alternative payante

Recommandations pour la synthèse vocale (TTS) :

  • edge → gratuite et suffisante pour la plupart des utilisateurs
  • neutts → TTS locale/sur appareil gratuite
  • elevenlabs → meilleure qualité
  • openai → bon compromis
  • mistral → multilingue, Opus natif

Étape 5 : Configuration recommandée

Voici une configuration par défaut solide et prudente pour la plupart des gens :

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Le paramètre submit_mode contrôle ce qui se passe après la transcription :

  • direct (par défaut) soumet la transcription immédiatement
  • draft place la transcription dans l’éditeur pour que vous puissiez la modifier avant l’envoi

Pour des brouillons vocaux modifiables, définissez submit_mode: "draft".

Utiliser le mode vocal dans la CLI

Démarrez Hermes et activez le mode vocal :

hermes

Puis dans la CLI :

/voice on

Déroulement de l’enregistrement :

  1. Appuyez sur Ctrl+B
  2. Parlez
  3. Attendez que la détection de silence arrête l’enregistrement automatiquement
  4. Hermes transcrit et répond
  5. Si la TTS est activée, il prononce la réponse
  6. La boucle peut redémarrer automatiquement pour une utilisation continue

Commandes utiles :

/voice
/voice on
/voice off
/voice tts
/voice status

Excellents flux de travail CLI

Débogage à la volée : Dites « J’ai toujours une erreur de permission docker. Aide-moi à la déboguer. » Puis continuez en mains libres avec des questions de suivi comme « Relis la dernière erreur » ou « Donne-moi maintenant la correction exacte. »

Recherche et brainstorming : Parfait pour réfléchir en marchant, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.

Accessibilité : Si taper est difficile, le mode vocal est l’un des moyens les plus rapides de rester dans la boucle complète de Hermes.

Réglage du comportement CLI

Si Hermes démarre ou arrête l’enregistrement de manière trop agressive, ajustez les paramètres de silence dans votre configuration :

voice:
  silence_threshold: 200
  silence_duration: 3.0

Baissez le seuil s’il s’arrête trop tôt, ou augmentez-le si le bruit de fond maintient l’enregistrement. La durée contrôle la longueur de pause qui déclenche l’arrêt.

Le mode vocal change la donne une fois que vous l’avez configuré. Commencez avec la boucle CLI de base, puis étendez-vous aux plateformes de messagerie et aux canaux vocaux Discord à mesure que vous vous sentez à l’aise. Bonne conversation !

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › guides/use-voice-mode-with-hermes