Tutorial 27: Modo de Voz
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Tutorial 27: Modo de Voz
Bem-vindos de volta, amigos! Hoje vamos falar sobre uma das formas mais legais de usar o Hermes: o Modo de Voz. Se você já quis conversar com seu assistente de IA enquanto caminha, cozinha o jantar ou simplesmente evita o teclado, este tutorial é para você.
O que é o Modo de Voz?
O Modo de Voz permite que você fale com o Hermes em vez de digitar. É perfeito para:
- Fluxos de trabalho CLI mãos-livres – codar e pesquisar sem tocar no teclado
- Respostas faladas no Telegram ou Discord – receba respostas por voz junto com as mensagens normais
- Canais de voz ao vivo no Discord – tenha uma conversa real com o Hermes em um chat de voz
- Captura rápida de ideias – dite pensamentos enquanto caminha ou faz brainstorming
A melhor parte? Se você usa o Nous Portal, você obtém tanto o LLM quanto a conversão de texto em fala através de um único login OAuth. Sem credenciais extras necessárias!
Três Formas de Usar o Voz
| Modo | Melhor Para | Plataforma |
|---|---|---|
| Loop de microfone interativo | Uso pessoal mãos-livres | CLI |
| Respostas por voz no chat | Respostas faladas com mensagens | Telegram, Discord |
| Bot de canal de voz ao vivo | Conversas em grupo | Canais de voz do Discord |
Dica de profissional: Comece com o modo de texto funcionando primeiro, depois adicione respostas por voz e, finalmente, experimente os canais de voz do Discord se quiser a experiência completa.
Passo 1: Faça o Texto Funcionar Primeiro
Antes de mergulhar no voz, certifique-se de que o básico funciona:
hermes
Depois pergunte algo simples:
Quais ferramentas você tem disponíveis?
Se isso estiver funcionando bem, você está pronto para o voz!
Passo 2: Instale os Extras
Dependendo do que você precisa, instale os pacotes certos:
# Microfone + reprodução CLI
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Plataformas de mensagens (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Tudo
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Dependências do Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Veja por que eles são importantes:
portaudio→ entrada de microfone para voz no CLIffmpeg→ conversão de áudioopus→ codec de voz do Discordespeak-ng→ fonemizador para NeuTTS
Passo 4: Escolha Seus Provedores
Configuração mais fácil: Use STT local e Edge TTS gratuito. Adicione isso ao ~/.hermes/.env:
# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (opcional)
ELEVENLABS_API_KEY=***
Opções de STT:
local– melhor para privacidade, custo zerogroq– transcrição em nuvem super rápidaopenai– boa alternativa paga
Opções de TTS:
edge– gratuito e bom o suficiente para a maiorianeutts– gratuito local/no dispositivoelevenlabs– melhor qualidadeopenai– bom meio-termomistral– multilíngue, Opus nativo
Passo 5: Configuração Recomendada
Aqui está um padrão sólido para a maioria das pessoas:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Nota sobre submit_mode:
direct(padrão) – envia a transcrição imediatamentedraft– coloca a transcrição no editor para você editar antes de enviar
Para rascunhos editáveis, defina submit_mode: "draft".
Usando Voz no CLI
Inicie o Hermes e ative o voz:
hermes
Depois digite:
/voice on
Fluxo de gravação:
- Pressione
Ctrl+B - Fale
- Aguarde a detecção de silêncio parar automaticamente
- O Hermes transcreve e responde
- Se o TTS estiver ativo, ele fala a resposta
- O loop recomeça para uso contínuo
Comandos úteis:
/voice
/voice on
/voice off
/voice tts
/voice status
Ótimos Fluxos de Trabalho com Voz
Depuração em movimento: Diga “Eu continuo recebendo um erro de permissão do docker. Ajude-me a depurar isso.” Depois continue mãos-livres: “Leia o último erro novamente”, “Explique a causa raiz em termos mais simples”, “Agora me dê a correção exata”.
Pesquisa/brainstorming: Perfeito para caminhar, ditar ideias meio formadas e pedir ao Hermes para estruturar seus pensamentos em tempo real.
Acessibilidade: Se digitar é inconveniente, o modo de voz mantém você no ciclo completo do Hermes.
Ajustando o Comportamento
Se o Hermes começar/parar de forma muito agressiva, ajuste as configurações de silêncio no seu config:
voice:
silence_threshold: 200
silence_duration: 3.0
Diminua o limite para uma detecção mais sensível, ou aumente se estiver cortando você.
É isso! O Modo de Voz é um daqueles recursos que parecem mágica quando você o coloca para funcionar. Comece simples, fique confortável e logo você estará tendo conversas completas com o Hermes enquanto lava a louça. Boa conversa! 🎤
📖 Documentação oficial
この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › guides/use-voice-mode-with-hermes