Parler à l'IA avec le mode vocal
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
Parler à l’IA avec le mode vocal
Le mode vocal fait partie de ces fonctionnalités qui semblent magiques la première fois qu’on les essaie. Au lieu de taper chaque commande et de lire chaque réponse, vous pouvez simplement… parler. Hermes écoute, réfléchit et vous répond. Ce guide vous accompagne pas à pas pour configurer le mode vocal, d’une simple installation de microphone à un bot complet de canal vocal Discord.
À quoi sert le mode vocal
Le mode vocal est idéal quand vos mains sont occupées ou que vous voulez simplement une façon plus naturelle d’interagir avec l’IA. Voici les cas d’usage les plus courants :
- Flux de travail CLI mains libres — continuez à coder ou à faire des recherches tout en parlant à Hermes
- Réponses vocales dans Telegram ou Discord — recevez des réponses vocales en plus des messages texte normaux
- Canal vocal Discord en direct — faites rejoindre un canal vocal à Hermes pour une conversation en temps réel
- Capture rapide d’idées — dictez vos pensées en vous promenant au lieu de taper
Trois façons d’utiliser le mode vocal
Hermes propose trois expériences vocales distinctes. Choisissez celle qui correspond à vos besoins :
| Mode | Idéal pour | Plateforme |
|---|---|---|
| Boucle microphone interactive | Usage personnel mains libres pendant le codage | CLI |
| Réponses vocales dans le chat | Réponses vocales avec messagerie classique | Telegram, Discord |
| Bot de canal vocal en direct | Conversation en direct en groupe ou en solo | Canaux vocaux Discord |
Une bonne approche consiste à commencer simplement : faites fonctionner le texte d’abord, puis activez les réponses vocales, et enfin passez aux canaux vocaux Discord si vous voulez l’expérience complète.
Étape 1 : Vérifiez d’abord que le mode texte fonctionne
Avant de toucher au mode vocal, vérifiez que Hermes démarre et que votre fournisseur est configuré. Lancez hermes et posez une question simple comme :
What tools do you have available?
Si ce n’est pas encore stable, corrigez d’abord le mode texte. Le mode vocal s’appuie dessus.
Étape 2 : Installez les extras appropriés
Selon l’expérience vocale souhaitée, installez les extras correspondants :
Microphone CLI + lecture :
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Plateformes de messagerie (Telegram/Discord) :
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS premium ElevenLabs (optionnel) :
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS local (optionnel) :
python -m pip install -U neutts[all]
Tout :
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Étape 3 : Installez les dépendances système
Le mode vocal nécessite quelques paquets système pour gérer la capture audio, la conversion et la lecture.
macOS :
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian :
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Voici pourquoi chacun est important :
portaudio→ capture microphone et lecture pour le mode vocal CLIffmpeg→ conversion audio pour la TTS et la livraison par messagerieopus→ prise en charge du codec vocal Discordespeak-ng→ backend de phonémisation pour NeuTTS
Étape 4 : Choisissez vos fournisseurs vocaux
Hermes prend en charge les piles vocales locales et cloud. La configuration la plus simple et la moins chère utilise la STT locale et la TTS Edge gratuite :
- Fournisseur STT :
local - Fournisseur TTS :
edge
Ajoutez d’éventuelles clés cloud dans ~/.hermes/.env :
# Options STT cloud (local ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (optionnel)
ELEVENLABS_API_KEY=***
Recommandations pour la reconnaissance vocale (STT) :
local→ meilleur choix par défaut pour la confidentialité et le coût zérogroq→ transcription cloud très rapideopenai→ bonne alternative payante
Recommandations pour la synthèse vocale (TTS) :
edge→ gratuite et suffisante pour la plupart des utilisateursneutts→ TTS locale/sur appareil gratuiteelevenlabs→ meilleure qualitéopenai→ bon compromismistral→ multilingue, Opus natif
Étape 5 : Configuration recommandée
Voici une configuration par défaut solide et prudente pour la plupart des gens :
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Le paramètre submit_mode contrôle ce qui se passe après la transcription :
direct(par défaut) soumet la transcription immédiatementdraftplace la transcription dans l’éditeur pour que vous puissiez la modifier avant l’envoi
Pour des brouillons vocaux modifiables, définissez submit_mode: "draft".
Utiliser le mode vocal dans la CLI
Démarrez Hermes et activez le mode vocal :
hermes
Puis dans la CLI :
/voice on
Déroulement de l’enregistrement :
- Appuyez sur
Ctrl+B - Parlez
- Attendez que la détection de silence arrête l’enregistrement automatiquement
- Hermes transcrit et répond
- Si la TTS est activée, il prononce la réponse
- La boucle peut redémarrer automatiquement pour une utilisation continue
Commandes utiles :
/voice
/voice on
/voice off
/voice tts
/voice status
Excellents flux de travail CLI
Débogage à la volée : Dites « J’ai toujours une erreur de permission docker. Aide-moi à la déboguer. » Puis continuez en mains libres avec des questions de suivi comme « Relis la dernière erreur » ou « Donne-moi maintenant la correction exacte. »
Recherche et brainstorming : Parfait pour réfléchir en marchant, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.
Accessibilité : Si taper est difficile, le mode vocal est l’un des moyens les plus rapides de rester dans la boucle complète de Hermes.
Réglage du comportement CLI
Si Hermes démarre ou arrête l’enregistrement de manière trop agressive, ajustez les paramètres de silence dans votre configuration :
voice:
silence_threshold: 200
silence_duration: 3.0
Baissez le seuil s’il s’arrête trop tôt, ou augmentez-le si le bruit de fond maintient l’enregistrement. La durée contrôle la longueur de pause qui déclenche l’arrêt.
Le mode vocal change la donne une fois que vous l’avez configuré. Commencez avec la boucle CLI de base, puis étendez-vous aux plateformes de messagerie et aux canaux vocaux Discord à mesure que vous vous sentez à l’aise. Bonne conversation !
📖 Documentation officielle
Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › guides/use-voice-mode-with-hermes