Buzz: Usa Hermes con l'app di Chat Vocale AI
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: Usa Hermes con l’app di Chat Vocale AI
La modalità vocale è arrivata, ed è un punto di svolta per il modo in cui interagisci con Hermes. Invece di digitare ogni comando, ora puoi parlare con il tuo agente in modo naturale — che tu stia programmando, facendo ricerche, o semplicemente camminando con idee che ti frullano in testa.
Questa guida ti accompagna attraverso tutto ciò che ti serve per far funzionare la voce, dalla configurazione più semplice alle conversazioni complete nei canali vocali di Discord. Immergiamoci.
A Cosa Serve la Modalità Vocale
La modalità vocale brilla quando vuoi:
- Tenere le mani libere mentre lavori nel terminale
- Ricevere risposte vocali in Telegram o Discord
- Far sedere Hermes in un canale vocale di Discord per un dialogo dal vivo
- Catturare idee rapidamente mentre cammini, invece di digitare
Pensala come il tuo copilota a mani libere. Debugging, brainstorming, o semplicemente fare domande veloci — la modalità vocale ti mantiene nel flusso.
Tre Modi per Usare la Voce
Hermes offre tre distinte esperienze vocali:
| Modalità | Ideale per | Piattaforma |
|---|---|---|
| Ciclo microfono interattivo | Uso personale a mani libere mentre programmi | CLI |
| Risposte vocali in chat | Risposte parlate accanto alla messaggistica | Telegram, Discord |
| Bot live in canale vocale | Conversazioni di gruppo in un canale vocale | Canali vocali Discord |
Un percorso intelligente: fai funzionare prima il testo, poi abilita le risposte vocali, e infine passa ai canali vocali di Discord se vuoi l’esperienza completa.
Passo 1: Assicurati che il Testo Funzioni Prima
Prima di toccare la voce, verifica le basi:
hermes
Poi fai una domanda semplice:
Quali strumenti hai a disposizione?
Se non è ancora solido, sistema prima la modalità testo. La voce si costruisce su fondamenta funzionanti.
Passo 2: Installa le Estensioni Giuste
A seconda della tua configurazione, installa ciò che ti serve:
Microfono CLI + riproduzione:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Piattaforme di messaggistica (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS Premium (opzionale):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS locale (opzionale):
python -m pip install -U neutts[all]
Tutto in una volta:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Installa le Dipendenze di Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Ecco perché ciascuna è importante:
portaudio→ ingresso microfono e riproduzioneffmpeg→ conversione audio per TTS e messaggisticaopus→ supporto codec vocale Discordespeak-ng→ fonemizzatore per NeuTTS
Passo 4: Scegli i Tuoi Provider Vocali
Hermes supporta sia stack vocali locali che cloud. Per l’avvio più semplice, usa STT locale con Edge TTS gratuito.
Aggiungi questo a ~/.hermes/.env:
# Opzioni STT cloud (locale non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS Premium (opzionale)
ELEVENLABS_API_KEY=***
Raccomandazioni speech-to-text:
local→ migliore default per privacy e costo zerogroq→ trascrizione cloud molto veloceopenai→ buona alternativa a pagamento
Raccomandazioni text-to-speech:
edge→ gratuito e sufficiente per la maggior parteneutts→ TTS locale/gratuito sul dispositivoelevenlabs→ qualità miglioreopenai→ buon compromessomistral→ multilingue, Opus nativo
Passo 5: Configurazione Consigliata
Ecco un default solido e conservativo:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Nella TUI, submit_mode controlla cosa succede dopo la trascrizione:
direct(default) invia la trascrizione immediatamentedraftla mette nel compositore così puoi modificarla prima di inviarla
Per bozze vocali modificabili, imposta submit_mode: "draft".
Vuoi TTS locale invece? Passa a:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
Caso d’Uso: Modalità Vocale CLI
Avvia Hermes e attiva la voce:
hermes
Poi dentro la CLI:
/voice on
Flusso di registrazione:
- Premi
Ctrl+B - Parla
- Aspetta che il rilevamento del silenzio si fermi automaticamente
- Hermes trascrive e risponde
- Se TTS è attivo, pronuncia la risposta
- Il ciclo può riavviarsi automaticamente per uso continuo
Comandi utili:
/voice
/voice on
/voice off
/voice tts
/voice status
Ottimi flussi di lavoro CLI:
Debugging al volo: Dì “Continuo a ricevere un errore di permessi docker. Aiutami a fare debug.” Poi continua a mani libere: “Leggi di nuovo l’ultimo errore,” “Spiega la causa principale in termini più semplici,” “Ora dammi la soluzione esatta.”
Ricerca e brainstorming: Perfetto per camminare pensando, dettando idee a metà, e chiedendo a Hermes di strutturare i tuoi pensieri in tempo reale.
Accessibilità: Se digitare è scomodo, la modalità vocale ti mantiene nel pieno ciclo di Hermes senza tastiera.
Ottimizzare il Comportamento della CLI
Se Hermes inizia o smette di registrare in modo troppo aggressivo, regola questi valori nella tua configurazione:
voice:
silence_threshold: 200 # più basso = più sensibile
silence_duration: 3.0 # secondi di silenzio prima di fermarsi
Inizia con i default, poi adatta in base al tuo ambiente. Una stanza rumorosa potrebbe richiedere una soglia più alta; una silenziosa potrebbe richiederne una più bassa.
La modalità vocale è uno dei modi più rapidi per rimanere produttivi con Hermes. Inizia semplice, sperimenta con i provider, e presto parlerai con il tuo agente come se fosse la cosa più naturale del mondo.
📖 Documentazione ufficiale
この記事は Hermes Agent のDocumentazione ufficialeに基づいています:Documentazione ufficiale › guides/use-voice-mode-with-hermes