🤖HermesBlog
Hermes Official Tutorials · Partie 278/9/2026

Tutoriel 27 : Mode Vocal

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutoriel 27 : Mode Vocal

Rebonjour les amis ! Aujourd’hui, on va parler de l’une des façons les plus cool d’utiliser Hermes : le Mode Vocal. Si vous avez déjà rêvé de discuter avec votre assistant IA en vous promenant, en cuisinant, ou juste pour éviter le clavier, ce tutoriel est fait pour vous.

C’est quoi le Mode Vocal ?

Le Mode Vocal vous permet de parler à Hermes au lieu de taper. C’est parfait pour :

  • Les workflows CLI mains libres – coder et faire des recherches sans toucher au clavier
  • Les réponses vocales dans Telegram ou Discord – recevez des réponses audio en plus des messages normaux
  • Les salons vocaux Discord en direct – discutez vraiment avec Hermes dans un chat vocal
  • Capturer rapidement des idées – dictez vos pensées en marchant ou en brainstormant

Le meilleur dans tout ça ? Si vous utilisez Nous Portal, vous obtenez à la fois le LLM et la synthèse vocale avec un seul login OAuth. Pas besoin de credentials supplémentaires !

Trois façons d’utiliser la voix

Mode Idéal pour Plateforme
Boucle micro interactive Usage personnel mains libres CLI
Réponses vocales dans le chat Réponses audio avec messagerie Telegram, Discord
Bot de salon vocal en direct Conversations de groupe Salons vocaux Discord

Astuce de pro : Commencez par faire fonctionner le mode texte, puis ajoutez les réponses vocales, et enfin essayez les salons vocaux Discord si vous voulez l’expérience complète.

Étape 1 : Faites fonctionner le texte d’abord

Avant de plonger dans la voix, assurez-vous que les bases fonctionnent :

hermes

Puis posez une question simple :

Quels outils avez-vous à disposition ?

Si ça répond bien, vous êtes prêt pour la voix !

Étape 2 : Installez les extras

Selon vos besoins, installez les bons paquets :

# Micro CLI + lecture audio
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Plateformes de messagerie (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Tout
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Étape 3 : Dépendances système

macOS :

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian :

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Voici pourquoi ces dépendances sont importantes :

  • portaudio → entrée micro pour la voix CLI
  • ffmpeg → conversion audio
  • opus → codec vocal Discord
  • espeak-ng → phonémiseur pour NeuTTS

Étape 4 : Choisissez vos fournisseurs

Configuration la plus simple : Utilisez la STT locale et le TTS Edge gratuit. Ajoutez ceci à ~/.hermes/.env :

# Options STT cloud (la locale ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (optionnel)
ELEVENLABS_API_KEY=***

Options STT :

  • local – idéal pour la confidentialité, zéro coût
  • groq – transcription cloud ultra rapide
  • openai – bon repli payant

Options TTS :

  • edge – gratuit et suffisant pour la plupart des usages
  • neutts – gratuit, local/sur appareil
  • elevenlabs – meilleure qualité
  • openai – bon compromis
  • mistral – multilingue, Opus natif

Étape 5 : Configuration recommandée

Voici une bonne configuration par défaut pour la plupart des gens :

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI : direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Note sur submit_mode :

  • direct (par défaut) – soumet la transcription immédiatement
  • draft – place la transcription dans l’éditeur pour que vous puissiez la modifier avant l’envoi

Pour des brouillons modifiables, définissez submit_mode: "draft".

Utiliser la voix dans la CLI

Lancez Hermes et activez la voix :

hermes

Puis tapez :

/voice on

Déroulement de l’enregistrement :

  1. Appuyez sur Ctrl+B
  2. Parlez
  3. Attendez que la détection de silence s’arrête automatiquement
  4. Hermes transcrit et répond
  5. Si le TTS est activé, il prononce la réponse
  6. La boucle redémarre pour une utilisation continue

Commandes utiles :

/voice
/voice on
/voice off
/voice tts
/voice status

Superbes workflows vocaux

Débogage en marchant : Dites “J’ai toujours une erreur de permission docker. Aide-moi à la déboguer.” Puis continuez mains libres : “Relis la dernière erreur”, “Explique la cause racine plus simplement”, “Maintenant donne-moi la correction exacte”.

Recherche/brainstorming : Parfait pour marcher, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.

Accessibilité : Si taper est contraignant, le mode vocal vous garde dans la boucle complète d’Hermes.

Ajuster le comportement

Si Hermes démarre/arrête trop agressivement, ajustez les paramètres de silence dans votre configuration :

voice:
  silence_threshold: 200
  silence_duration: 3.0

Baissez le seuil pour une détection plus sensible, ou augmentez-le s’il vous coupe la parole.


Voilà ! Le Mode Vocal est une de ces fonctionnalités qui semblent magiques une fois qu’elles fonctionnent. Commencez simplement, familiarisez-vous, et bientôt vous aurez de vraies conversations avec Hermes en faisant la vaisselle. Bonne discussion ! 🎤

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › guides/use-voice-mode-with-hermes