Tutoriel 27 : Mode Vocal
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Tutoriel 27 : Mode Vocal
Rebonjour les amis ! Aujourd’hui, on va parler de l’une des façons les plus cool d’utiliser Hermes : le Mode Vocal. Si vous avez déjà rêvé de discuter avec votre assistant IA en vous promenant, en cuisinant, ou juste pour éviter le clavier, ce tutoriel est fait pour vous.
C’est quoi le Mode Vocal ?
Le Mode Vocal vous permet de parler à Hermes au lieu de taper. C’est parfait pour :
- Les workflows CLI mains libres – coder et faire des recherches sans toucher au clavier
- Les réponses vocales dans Telegram ou Discord – recevez des réponses audio en plus des messages normaux
- Les salons vocaux Discord en direct – discutez vraiment avec Hermes dans un chat vocal
- Capturer rapidement des idées – dictez vos pensées en marchant ou en brainstormant
Le meilleur dans tout ça ? Si vous utilisez Nous Portal, vous obtenez à la fois le LLM et la synthèse vocale avec un seul login OAuth. Pas besoin de credentials supplémentaires !
Trois façons d’utiliser la voix
| Mode | Idéal pour | Plateforme |
|---|---|---|
| Boucle micro interactive | Usage personnel mains libres | CLI |
| Réponses vocales dans le chat | Réponses audio avec messagerie | Telegram, Discord |
| Bot de salon vocal en direct | Conversations de groupe | Salons vocaux Discord |
Astuce de pro : Commencez par faire fonctionner le mode texte, puis ajoutez les réponses vocales, et enfin essayez les salons vocaux Discord si vous voulez l’expérience complète.
Étape 1 : Faites fonctionner le texte d’abord
Avant de plonger dans la voix, assurez-vous que les bases fonctionnent :
hermes
Puis posez une question simple :
Quels outils avez-vous à disposition ?
Si ça répond bien, vous êtes prêt pour la voix !
Étape 2 : Installez les extras
Selon vos besoins, installez les bons paquets :
# Micro CLI + lecture audio
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Plateformes de messagerie (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Tout
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Étape 3 : Dépendances système
macOS :
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian :
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Voici pourquoi ces dépendances sont importantes :
portaudio→ entrée micro pour la voix CLIffmpeg→ conversion audioopus→ codec vocal Discordespeak-ng→ phonémiseur pour NeuTTS
Étape 4 : Choisissez vos fournisseurs
Configuration la plus simple : Utilisez la STT locale et le TTS Edge gratuit. Ajoutez ceci à ~/.hermes/.env :
# Options STT cloud (la locale ne nécessite pas de clé)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (optionnel)
ELEVENLABS_API_KEY=***
Options STT :
local– idéal pour la confidentialité, zéro coûtgroq– transcription cloud ultra rapideopenai– bon repli payant
Options TTS :
edge– gratuit et suffisant pour la plupart des usagesneutts– gratuit, local/sur appareilelevenlabs– meilleure qualitéopenai– bon compromismistral– multilingue, Opus natif
Étape 5 : Configuration recommandée
Voici une bonne configuration par défaut pour la plupart des gens :
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI : direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Note sur submit_mode :
direct(par défaut) – soumet la transcription immédiatementdraft– place la transcription dans l’éditeur pour que vous puissiez la modifier avant l’envoi
Pour des brouillons modifiables, définissez submit_mode: "draft".
Utiliser la voix dans la CLI
Lancez Hermes et activez la voix :
hermes
Puis tapez :
/voice on
Déroulement de l’enregistrement :
- Appuyez sur
Ctrl+B - Parlez
- Attendez que la détection de silence s’arrête automatiquement
- Hermes transcrit et répond
- Si le TTS est activé, il prononce la réponse
- La boucle redémarre pour une utilisation continue
Commandes utiles :
/voice
/voice on
/voice off
/voice tts
/voice status
Superbes workflows vocaux
Débogage en marchant : Dites “J’ai toujours une erreur de permission docker. Aide-moi à la déboguer.” Puis continuez mains libres : “Relis la dernière erreur”, “Explique la cause racine plus simplement”, “Maintenant donne-moi la correction exacte”.
Recherche/brainstorming : Parfait pour marcher, dicter des idées à moitié formées et demander à Hermes de structurer vos pensées en temps réel.
Accessibilité : Si taper est contraignant, le mode vocal vous garde dans la boucle complète d’Hermes.
Ajuster le comportement
Si Hermes démarre/arrête trop agressivement, ajustez les paramètres de silence dans votre configuration :
voice:
silence_threshold: 200
silence_duration: 3.0
Baissez le seuil pour une détection plus sensible, ou augmentez-le s’il vous coupe la parole.
Voilà ! Le Mode Vocal est une de ces fonctionnalités qui semblent magiques une fois qu’elles fonctionnent. Commencez simplement, familiarisez-vous, et bientôt vous aurez de vraies conversations avec Hermes en faisant la vaisselle. Bonne discussion ! 🎤
📖 Documentation officielle
Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › guides/use-voice-mode-with-hermes