🤖HermesBlog
Hermes Official Tutorials · Parte 278/9/2026

Tutorial 27: Modo de Voz

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutorial 27: Modo de Voz

Bem-vindos de volta, amigos! Hoje vamos falar sobre uma das formas mais legais de usar o Hermes: o Modo de Voz. Se você já quis conversar com seu assistente de IA enquanto caminha, cozinha o jantar ou simplesmente evita o teclado, este tutorial é para você.

O que é o Modo de Voz?

O Modo de Voz permite que você fale com o Hermes em vez de digitar. É perfeito para:

  • Fluxos de trabalho CLI mãos-livres – codar e pesquisar sem tocar no teclado
  • Respostas faladas no Telegram ou Discord – receba respostas por voz junto com as mensagens normais
  • Canais de voz ao vivo no Discord – tenha uma conversa real com o Hermes em um chat de voz
  • Captura rápida de ideias – dite pensamentos enquanto caminha ou faz brainstorming

A melhor parte? Se você usa o Nous Portal, você obtém tanto o LLM quanto a conversão de texto em fala através de um único login OAuth. Sem credenciais extras necessárias!

Três Formas de Usar o Voz

Modo Melhor Para Plataforma
Loop de microfone interativo Uso pessoal mãos-livres CLI
Respostas por voz no chat Respostas faladas com mensagens Telegram, Discord
Bot de canal de voz ao vivo Conversas em grupo Canais de voz do Discord

Dica de profissional: Comece com o modo de texto funcionando primeiro, depois adicione respostas por voz e, finalmente, experimente os canais de voz do Discord se quiser a experiência completa.

Passo 1: Faça o Texto Funcionar Primeiro

Antes de mergulhar no voz, certifique-se de que o básico funciona:

hermes

Depois pergunte algo simples:

Quais ferramentas você tem disponíveis?

Se isso estiver funcionando bem, você está pronto para o voz!

Passo 2: Instale os Extras

Dependendo do que você precisa, instale os pacotes certos:

# Microfone + reprodução CLI
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Plataformas de mensagens (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Tudo
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Dependências do Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Veja por que eles são importantes:

  • portaudio → entrada de microfone para voz no CLI
  • ffmpeg → conversão de áudio
  • opus → codec de voz do Discord
  • espeak-ng → fonemizador para NeuTTS

Passo 4: Escolha Seus Provedores

Configuração mais fácil: Use STT local e Edge TTS gratuito. Adicione isso ao ~/.hermes/.env:

# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opcional)
ELEVENLABS_API_KEY=***

Opções de STT:

  • local – melhor para privacidade, custo zero
  • groq – transcrição em nuvem super rápida
  • openai – boa alternativa paga

Opções de TTS:

  • edge – gratuito e bom o suficiente para a maioria
  • neutts – gratuito local/no dispositivo
  • elevenlabs – melhor qualidade
  • openai – bom meio-termo
  • mistral – multilíngue, Opus nativo

Passo 5: Configuração Recomendada

Aqui está um padrão sólido para a maioria das pessoas:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Nota sobre submit_mode:

  • direct (padrão) – envia a transcrição imediatamente
  • draft – coloca a transcrição no editor para você editar antes de enviar

Para rascunhos editáveis, defina submit_mode: "draft".

Usando Voz no CLI

Inicie o Hermes e ative o voz:

hermes

Depois digite:

/voice on

Fluxo de gravação:

  1. Pressione Ctrl+B
  2. Fale
  3. Aguarde a detecção de silêncio parar automaticamente
  4. O Hermes transcreve e responde
  5. Se o TTS estiver ativo, ele fala a resposta
  6. O loop recomeça para uso contínuo

Comandos úteis:

/voice
/voice on
/voice off
/voice tts
/voice status

Ótimos Fluxos de Trabalho com Voz

Depuração em movimento: Diga “Eu continuo recebendo um erro de permissão do docker. Ajude-me a depurar isso.” Depois continue mãos-livres: “Leia o último erro novamente”, “Explique a causa raiz em termos mais simples”, “Agora me dê a correção exata”.

Pesquisa/brainstorming: Perfeito para caminhar, ditar ideias meio formadas e pedir ao Hermes para estruturar seus pensamentos em tempo real.

Acessibilidade: Se digitar é inconveniente, o modo de voz mantém você no ciclo completo do Hermes.

Ajustando o Comportamento

Se o Hermes começar/parar de forma muito agressiva, ajuste as configurações de silêncio no seu config:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Diminua o limite para uma detecção mais sensível, ou aumente se estiver cortando você.


É isso! O Modo de Voz é um daqueles recursos que parecem mágica quando você o coloca para funcionar. Comece simples, fique confortável e logo você estará tendo conversas completas com o Hermes enquanto lava a louça. Boa conversa! 🎤

📖 Documentação oficial

この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › guides/use-voice-mode-with-hermes