Buzz: Use Hermes com o Aplicativo de Chat por Voz com IA
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: Use Hermes com o Aplicativo de Chat por Voz com IA
O modo de voz chegou, e ele muda completamente a forma como você interage com o Hermes. Em vez de digitar cada comando, agora você pode conversar com seu agente naturalmente — seja programando, pesquisando ou apenas andando por aí com ideias na cabeça.
Este guia mostra tudo o que você precisa para ativar a voz, desde a configuração mais simples até conversas completas em canais de voz do Discord. Vamos mergulhar.
Para Que Serve o Modo de Voz
O modo de voz é ideal quando você quer:
- Manter as mãos livres enquanto trabalha no terminal
- Receber respostas faladas no Telegram ou Discord
- Deixar o Hermes em um canal de voz do Discord para conversas em tempo real
- Capturar ideias rapidamente enquanto caminha, em vez de digitar
Pense nele como seu copiloto mãos-livres. Depurando, fazendo brainstorming ou apenas fazendo perguntas rápidas — o modo de voz mantém você no fluxo.
Três Formas de Usar a Voz
O Hermes oferece três experiências de voz distintas:
| Modo | Melhor para | Plataforma |
|---|---|---|
| Loop interativo de microfone | Uso pessoal mãos-livres enquanto programa | CLI |
| Respostas por voz no chat | Respostas faladas junto com mensagens | Telegram, Discord |
| Bot ao vivo em canal de voz | Conversas em grupo em um canal de voz | Canais de voz do Discord |
Um caminho inteligente: primeiro faça o texto funcionar, depois ative as respostas por voz e, por fim, avance para os canais de voz do Discord se quiser a experiência completa.
Passo 1: Garanta que o Texto Funcione Primeiro
Antes de mexer na voz, verifique o básico:
hermes
Depois faça uma pergunta simples:
Quais ferramentas você tem disponíveis?
Se isso ainda não estiver sólido, corrija o modo de texto primeiro. A voz se constrói sobre uma base que funciona.
Passo 2: Instale os Extras Corretos
Dependendo da sua configuração, instale o que você precisa:
Microfone + reprodução no CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Plataformas de mensagens (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS Premium (opcional):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS local (opcional):
python -m pip install -U neutts[all]
Tudo de uma vez:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Instale as Dependências do Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Veja por que cada uma é importante:
portaudio→ entrada de microfone e reproduçãoffmpeg→ conversão de áudio para TTS e mensagensopus→ suporte ao codec de voz do Discordespeak-ng→ fonetizador para o NeuTTS
Passo 4: Escolha Seus Provedores de Fala
O Hermes suporta tanto stacks de fala locais quanto em nuvem. Para começar com mais facilidade, use STT local com Edge TTS gratuito.
Adicione isso ao ~/.hermes/.env:
# Opções de STT em nuvem (local não precisa de chave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS Premium (opcional)
ELEVENLABS_API_KEY=***
Recomendações de speech-to-text:
local→ melhor padrão para privacidade e custo zerogroq→ transcrição em nuvem muito rápidaopenai→ boa alternativa paga
Recomendações de text-to-speech:
edge→ gratuito e bom o suficiente para a maiorianeutts→ TTS local/on-device gratuitoelevenlabs→ melhor qualidadeopenai→ bom meio-termomistral→ multilíngue, Opus nativo
Passo 5: Configuração Recomendada
Aqui está um padrão conservador e sólido:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
No TUI, o submit_mode controla o que acontece após a transcrição:
direct(padrão) envia a transcrição imediatamentedraftcoloca no editor para você editar antes de enviar
Para rascunhos de voz editáveis, defina submit_mode: "draft".
Quer TTS local? Troque para:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
Caso de Uso: Modo de Voz no CLI
Inicie o Hermes e ative a voz:
hermes
Depois, dentro do CLI:
/voice on
Fluxo de gravação:
- Pressione
Ctrl+B - Fale
- Aguarde a detecção de silêncio parar automaticamente
- O Hermes transcreve e responde
- Se o TTS estiver ativo, ele fala a resposta
- O loop pode reiniciar automaticamente para uso contínuo
Comandos úteis:
/voice
/voice on
/voice off
/voice tts
/voice status
Ótimos fluxos de trabalho no CLI:
Depuração rápida: Diga “Estou recebendo um erro de permissão do docker. Ajude-me a depurar.” Depois continue mãos-livres: “Leia o último erro novamente”, “Explique a causa raiz em termos mais simples”, “Agora me dê a correção exata.”
Pesquisa e brainstorming: Perfeito para caminhar enquanto pensa, ditar ideias ainda incompletas e pedir ao Hermes para estruturar seus pensamentos em tempo real.
Acessibilidade: Se digitar é inconveniente, o modo de voz mantém você no ciclo completo do Hermes sem o teclado.
Ajustando o Comportamento do CLI
Se o Hermes começar ou parar de gravar de forma muito agressiva, ajuste estes parâmetros na sua configuração:
voice:
silence_threshold: 200 # menor = mais sensível
silence_duration: 3.0 # segundos de silêncio antes de parar
Comece com os padrões e depois ajuste conforme seu ambiente. Uma sala barulhenta pode precisar de um limite maior; uma sala silenciosa, de um menor.
O modo de voz é uma das formas mais rápidas de se manter produtivo com o Hermes. Comece simples, experimente provedores e logo você estará conversando com seu agente como se fosse natural.
📖 Documentação oficial
この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › guides/use-voice-mode-with-hermes