Atualização Hermes v2026.8.3: Voz em Tempo Real, Comunicação entre Agentes e Citações Verificáveis
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Atualização Hermes v2026.8.3: Voz em Tempo Real, Comunicação entre Agentes e Citações Verificáveis
Olá a todos, bem-vindos de volta ao blog da Hermes! Hoje vamos mergulhar em uma das atualizações mais empolgantes até agora: o modo de voz em tempo real. Se você sempre quis conversar com seu agente em vez de digitar cada comando, esta é a atualização para você. E a melhor parte? É muito mais fácil de configurar do que você imagina.
Vamos passar por tudo o que você precisa saber para ativar o modo de voz hoje mesmo.
Para Que o Modo de Voz Realmente Serve
O modo de voz não é apenas um truque — ele é genuinamente útil em várias situações:
- Fluxos de trabalho CLI mãos-livres enquanto você programa ou pesquisa
- Respostas faladas diretamente no Telegram ou Discord
- Conversa ao vivo com a Hermes em um canal de voz do Discord
- Captura rápida de ideias enquanto caminha, em vez de parar para digitar
Pense nisso como seu agente se tornando um parceiro de conversa, não apenas uma caixa de texto.
Três Maneiras de Usar a Voz
Existem três experiências de voz distintas na Hermes, e você pode escolher a que se adapta ao seu estilo:
| Modo | Melhor Para | Plataforma |
|---|---|---|
| Loop interativo de microfone | Uso pessoal mãos-livres | CLI |
| Respostas de voz no chat | Respostas faladas junto com mensagens | Telegram, Discord |
| Bot em canal de voz | Conversa ao vivo em grupo ou pessoal | Canais de voz do Discord |
Um caminho inteligente: primeiro faça o texto funcionar, depois ative as respostas de voz e, por fim, experimente os canais de voz do Discord se quiser a experiência completa.
Passo 1: Faça o Texto Funcionar Primeiro
Antes de mexer na voz, certifique-se de que o básico está funcionando:
hermes
Depois faça uma pergunta simples:
Quais ferramentas você tem disponíveis?
Se isso funcionar, você está pronto para avançar.
Passo 2: Instale os Extras Corretos
Dependendo do que você quer, instale o pacote apropriado:
Microfone + reprodução no CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Plataformas de mensagens:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS premium ElevenLabs:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS local (opcional):
python -m pip install -U neutts[all]
Tudo de uma vez:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Dependências do Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Veja por que elas são importantes:
portaudio→ entrada de microfone e reproduçãoffmpeg→ conversão de áudioopus→ suporte ao codec de voz do Discordespeak-ng→ fonemizador para NeuTTS
Passo 4: Escolha Seus Provedores de Fala
A Hermes suporta tanto stacks de fala locais quanto em nuvem. A configuração mais fácil e barata é STT local com Edge TTS gratuito:
- Provedor STT:
local - Provedor TTS:
edge
Adicione quaisquer chaves de API em ~/.hermes/.env:
# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (opcional)
ELEVENLABS_API_KEY=***
Recomendações rápidas:
- STT:
localpara privacidade,groqpara velocidade,openaicomo alternativa paga - TTS:
edgepara grátis,neuttspara local,elevenlabspara melhor qualidade
Passo 5: Configuração Recomendada
Aqui está um padrão conservador e sólido:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Uma configuração importante: voice.submit_mode controla o que acontece após a transcrição. direct envia imediatamente, enquanto draft permite editar antes de enviar. Para rascunhos editáveis, defina:
voice:
submit_mode: "draft"
Usando Voz no CLI
Inicie a Hermes e ative a voz:
hermes
Depois, dentro do CLI:
/voice on
Fluxo de gravação:
- Pressione
Ctrl+B - Fale
- Aguarde a detecção de silêncio parar automaticamente
- A Hermes transcreve e responde
- Se o TTS estiver ativo, ela fala a resposta
Comandos úteis:
/voice
/voice on
/voice off
/voice tts
/voice status
Ótimos Fluxos de Trabalho no CLI
Depuração rápida: Basta dizer “Estou recebendo um erro de permissão do docker. Ajude-me a depurá-lo.” Depois continue mãos-livres: “Leia o último erro novamente,” “Explique a causa raiz em termos mais simples,” “Agora me dê a correção exata.”
Pesquisa e brainstorming: Perfeito para caminhar enquanto pensa, ditar ideias meio formadas e pedir à Hermes para estruturar seus pensamentos em tempo real.
Acessibilidade: Se digitar é inconveniente, o modo de voz mantém você no ciclo completo da Hermes sem o teclado.
Ajustando o Comportamento
Se a Hermes começar ou parar de gravar de forma muito agressiva, ajuste os valores de silence_threshold e silence_duration na sua configuração.
É isso! O modo de voz já está ativo e pronto para uso. Comece com texto, adicione respostas de voz e explore os canais de voz do Discord quando estiver pronto. Boa conversa!
📖 Documentação oficial
この記事は Hermes Agent のDocumentação oficialに基づいています:GitHub ›/releases/tag/v2026.8.3