🤖HermesBlog
Hermes Feature Guides · Parte 68/9/2026

Talk to AI with Voice Mode

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

Fale com a IA usando o Modo de Voz

O modo de voz é um daqueles recursos que parecem mágica na primeira vez que você experimenta. Em vez de digitar cada comando e ler cada resposta, você pode simplesmente… falar. O Hermes ouve, pensa e responde. Este guia mostra tudo o que você precisa para colocar o modo de voz em funcionamento, desde uma configuração simples de microfone até um bot completo de canal de voz no Discord.

Para que o modo de voz é bom

O modo de voz brilha quando suas mãos estão ocupadas ou você quer uma forma mais natural de interagir com a IA. Aqui estão os casos de uso mais comuns:

  • Fluxo de trabalho CLI mãos-livres — continue codando ou pesquisando enquanto fala com o Hermes
  • Respostas por voz no Telegram ou Discord — receba respostas em áudio junto com as mensagens de texto normais
  • Canal de voz ao vivo no Discord — faça o Hermes entrar em um canal de voz para conversas em tempo real
  • Captura rápida de ideias — dite pensamentos enquanto caminha, em vez de digitar

Três maneiras de usar o modo de voz

O Hermes oferece três experiências de voz distintas. Escolha a que melhor se adapta às suas necessidades:

Modo Melhor para Plataforma
Loop interativo de microfone Uso pessoal mãos-livres enquanto codifica CLI
Respostas por voz no chat Respostas faladas com mensagens normais Telegram, Discord
Bot de canal de voz ao vivo Conversa ao vivo em grupo ou pessoal Canais de voz do Discord

Um bom caminho é começar simples: faça o texto funcionar primeiro, depois habilite as respostas por voz e, por fim, avance para os canais de voz do Discord se quiser a experiência completa.

Passo 1: Garanta que o modo de texto funcione primeiro

Antes de mexer no modo de voz, verifique se o Hermes inicia e se seu provedor está configurado. Execute hermes e faça uma pergunta simples como:

Quais ferramentas você tem disponíveis?

Se isso ainda não estiver sólido, corrija o modo de texto primeiro. O modo de voz é construído sobre ele.

Passo 2: Instale os extras corretos

Dependendo da experiência de voz que você deseja, instale os extras correspondentes:

Microfone + reprodução no CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plataformas de mensagens (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs (opcional):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (opcional):

python -m pip install -U neutts[all]

Tudo:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Instale as dependências do sistema

O modo de voz precisa de alguns pacotes do sistema para lidar com entrada de áudio, conversão e reprodução.

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Veja por que cada um é importante:

  • portaudio → entrada de microfone e reprodução para o modo de voz no CLI
  • ffmpeg → conversão de áudio para TTS e entrega em mensagens
  • opus → suporte ao codec de voz do Discord
  • espeak-ng → backend de fonemização para o NeuTTS

Passo 4: Escolha seus provedores de fala

O Hermes suporta stacks de fala locais e em nuvem. A configuração mais fácil e barata usa STT local e Edge TTS gratuito:

  • Provedor de STT: local
  • Provedor de TTS: edge

Adicione quaisquer chaves de nuvem em ~/.hermes/.env:

# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opcional)
ELEVENLABS_API_KEY=***

Recomendações de fala para texto (STT):

  • local → melhor padrão para privacidade e custo zero
  • groq → transcrição em nuvem muito rápida
  • openai → boa alternativa paga

Recomendações de texto para fala (TTS):

  • edge → gratuito e bom o suficiente para a maioria dos usuários
  • neutts → TTS local/gratuito no dispositivo
  • elevenlabs → melhor qualidade
  • openai → bom meio-termo
  • mistral → multilíngue, Opus nativo

Passo 5: Configuração recomendada

Aqui está um padrão conservador e sólido para a maioria das pessoas:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

A configuração submit_mode controla o que acontece após a transcrição:

  • direct (padrão) envia a transcrição imediatamente
  • draft coloca a transcrição no editor para você editar antes de enviar

Para rascunhos de voz editáveis, defina submit_mode: "draft".

Usando o modo de voz no CLI

Inicie o Hermes e ative o modo de voz:

hermes

Depois, dentro do CLI:

/voice on

Fluxo de gravação:

  1. Pressione Ctrl+B
  2. Fale
  3. Aguarde a detecção de silêncio parar a gravação automaticamente
  4. O Hermes transcreve e responde
  5. Se o TTS estiver ativo, ele fala a resposta
  6. O loop pode reiniciar automaticamente para uso contínuo

Comandos úteis:

/voice
/voice on
/voice off
/voice tts
/voice status

Ótimos fluxos de trabalho no CLI

Depuração rápida: Diga “Estou tendo um erro de permissão do docker. Ajude-me a depurá-lo.” Depois continue mãos-livres com perguntas de acompanhamento como “Leia o último erro novamente” ou “Agora me dê a correção exata.”

Pesquisa e brainstorming: Perfeito para caminhar enquanto pensa, ditar ideias meio formadas e pedir ao Hermes para estruturar seus pensamentos em tempo real.

Acessibilidade: Se digitar for inconveniente, o modo de voz é uma das maneiras mais rápidas de permanecer no ciclo completo do Hermes.

Ajustando o comportamento do CLI

Se o Hermes começar ou parar de gravar de forma muito agressiva, ajuste as configurações de silêncio no seu config:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Diminua o limite se ele parar cedo demais, ou aumente se o ruído de fundo mantiver a gravação ativa. A duração controla quanto tempo de pausa aciona a parada.

O modo de voz é um divisor de águas quando você o configura. Comece com o loop básico do CLI e depois expanda para plataformas de mensagens e canais de voz do Discord conforme se sentir confortável. Boas conversas!

📖 Documentação oficial

この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › guides/use-voice-mode-with-hermes