🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Atualização Hermes v2026.8.3: Voz em Tempo Real, Comunicação entre Agentes e Citações Verificáveis

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Atualização Hermes v2026.8.3: Voz em Tempo Real, Comunicação entre Agentes e Citações Verificáveis

Olá a todos, bem-vindos de volta ao blog da Hermes! Hoje vamos mergulhar em uma das atualizações mais empolgantes até agora: o modo de voz em tempo real. Se você sempre quis conversar com seu agente em vez de digitar cada comando, esta é a atualização para você. E a melhor parte? É muito mais fácil de configurar do que você imagina.

Vamos passar por tudo o que você precisa saber para ativar o modo de voz hoje mesmo.

Para Que o Modo de Voz Realmente Serve

O modo de voz não é apenas um truque — ele é genuinamente útil em várias situações:

  • Fluxos de trabalho CLI mãos-livres enquanto você programa ou pesquisa
  • Respostas faladas diretamente no Telegram ou Discord
  • Conversa ao vivo com a Hermes em um canal de voz do Discord
  • Captura rápida de ideias enquanto caminha, em vez de parar para digitar

Pense nisso como seu agente se tornando um parceiro de conversa, não apenas uma caixa de texto.

Três Maneiras de Usar a Voz

Existem três experiências de voz distintas na Hermes, e você pode escolher a que se adapta ao seu estilo:

Modo Melhor Para Plataforma
Loop interativo de microfone Uso pessoal mãos-livres CLI
Respostas de voz no chat Respostas faladas junto com mensagens Telegram, Discord
Bot em canal de voz Conversa ao vivo em grupo ou pessoal Canais de voz do Discord

Um caminho inteligente: primeiro faça o texto funcionar, depois ative as respostas de voz e, por fim, experimente os canais de voz do Discord se quiser a experiência completa.

Passo 1: Faça o Texto Funcionar Primeiro

Antes de mexer na voz, certifique-se de que o básico está funcionando:

hermes

Depois faça uma pergunta simples:

Quais ferramentas você tem disponíveis?

Se isso funcionar, você está pronto para avançar.

Passo 2: Instale os Extras Corretos

Dependendo do que você quer, instale o pacote apropriado:

Microfone + reprodução no CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plataformas de mensagens:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (opcional):

python -m pip install -U neutts[all]

Tudo de uma vez:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Dependências do Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Veja por que elas são importantes:

  • portaudio → entrada de microfone e reprodução
  • ffmpeg → conversão de áudio
  • opus → suporte ao codec de voz do Discord
  • espeak-ng → fonemizador para NeuTTS

Passo 4: Escolha Seus Provedores de Fala

A Hermes suporta tanto stacks de fala locais quanto em nuvem. A configuração mais fácil e barata é STT local com Edge TTS gratuito:

  • Provedor STT: local
  • Provedor TTS: edge

Adicione quaisquer chaves de API em ~/.hermes/.env:

# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opcional)
ELEVENLABS_API_KEY=***

Recomendações rápidas:

  • STT: local para privacidade, groq para velocidade, openai como alternativa paga
  • TTS: edge para grátis, neutts para local, elevenlabs para melhor qualidade

Passo 5: Configuração Recomendada

Aqui está um padrão conservador e sólido:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Uma configuração importante: voice.submit_mode controla o que acontece após a transcrição. direct envia imediatamente, enquanto draft permite editar antes de enviar. Para rascunhos editáveis, defina:

voice:
  submit_mode: "draft"

Usando Voz no CLI

Inicie a Hermes e ative a voz:

hermes

Depois, dentro do CLI:

/voice on

Fluxo de gravação:

  1. Pressione Ctrl+B
  2. Fale
  3. Aguarde a detecção de silêncio parar automaticamente
  4. A Hermes transcreve e responde
  5. Se o TTS estiver ativo, ela fala a resposta

Comandos úteis:

/voice
/voice on
/voice off
/voice tts
/voice status

Ótimos Fluxos de Trabalho no CLI

Depuração rápida: Basta dizer “Estou recebendo um erro de permissão do docker. Ajude-me a depurá-lo.” Depois continue mãos-livres: “Leia o último erro novamente,” “Explique a causa raiz em termos mais simples,” “Agora me dê a correção exata.”

Pesquisa e brainstorming: Perfeito para caminhar enquanto pensa, ditar ideias meio formadas e pedir à Hermes para estruturar seus pensamentos em tempo real.

Acessibilidade: Se digitar é inconveniente, o modo de voz mantém você no ciclo completo da Hermes sem o teclado.

Ajustando o Comportamento

Se a Hermes começar ou parar de gravar de forma muito agressiva, ajuste os valores de silence_threshold e silence_duration na sua configuração.

É isso! O modo de voz já está ativo e pronto para uso. Comece com texto, adicione respostas de voz e explore os canais de voz do Discord quando estiver pronto. Boa conversa!

📖 Documentação oficial

この記事は Hermes Agent のDocumentação oficialに基づいています:GitHub ›/releases/tag/v2026.8.3