Aggiornamento Hermes v2026.8.3: Voce in Tempo Reale, Comunicazione tra Agenti e Citazioni Verificabili
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Aggiornamento Hermes v2026.8.3: Voce in Tempo Reale, Comunicazione tra Agenti e Citazioni Verificabili
Ciao a tutti, bentornati sul blog di Hermes! Oggi ci immergiamo in uno degli aggiornamenti più entusiasmanti finora: la modalità vocale in tempo reale. Se hai mai desiderato parlare con il tuo agente invece di digitare ogni singolo comando, questo è l’aggiornamento che fa per te. E la parte migliore? La configurazione è molto più semplice di quanto pensi.
Vediamo insieme tutto quello che devi sapere per attivare la modalità vocale oggi stesso.
A Cosa Serve Davvero la Modalità Vocale
La modalità vocale non è solo un espediente accattivante: è davvero utile in molte situazioni:
- Flussi di lavoro CLI a mani libere mentre stai programmando o facendo ricerche
- Risposte vocali direttamente su Telegram o Discord
- Conversazione dal vivo con Hermes in un canale vocale di Discord
- Cattura rapida di idee mentre cammini, senza doverti fermare a digitare
Pensala così: il tuo agente diventa un interlocutore, non solo una casella di testo.
Tre Modi per Usare la Voce
Ci sono tre diverse esperienze vocali in Hermes, e puoi scegliere quella che si adatta al tuo stile:
| Modalità | Ideale Per | Piattaforma |
|---|---|---|
| Ciclo microfono interattivo | Uso personale a mani libere | CLI |
| Risposte vocali nella chat | Risposte parlate insieme ai messaggi | Telegram, Discord |
| Bot in canale vocale live | Conversazione dal vivo di gruppo o personale | Canali vocali Discord |
Un percorso intelligente da seguire: prima fai funzionare il testo, poi abilita le risposte vocali e infine prova i canali vocali di Discord se vuoi l’esperienza completa.
Passo 1: Fai Funzionare Prima il Testo
Prima di toccare la voce, assicurati che le basi siano solide:
hermes
Poi fai una domanda semplice:
Quali strumenti hai a disposizione?
Se funziona, sei pronto per passare al passo successivo.
Passo 2: Installa le Estensioni Giuste
A seconda di cosa ti serve, installa il pacchetto appropriato:
Microfono CLI + riproduzione:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Piattaforme di messaggistica:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS premium ElevenLabs:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS locale (opzionale):
python -m pip install -U neutts[all]
Tutto in una volta:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Dipendenze di Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Ecco perché sono importanti:
portaudio→ ingresso microfono e riproduzioneffmpeg→ conversione audioopus→ supporto codec vocale Discordespeak-ng→ fonemizzatore per NeuTTS
Passo 4: Scegli i Tuoi Provider Vocali
Hermes supporta sia stack vocali locali che cloud. La configurazione più semplice ed economica è STT locale con Edge TTS gratuito:
- Provider STT:
local - Provider TTS:
edge
Aggiungi eventuali chiavi API a ~/.hermes/.env:
# Opzioni STT cloud (local non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (opzionale)
ELEVENLABS_API_KEY=***
Raccomandazioni rapide:
- STT:
localper la privacy,groqper la velocità,openaicome alternativa a pagamento - TTS:
edgeper il gratuito,neuttsper il locale,elevenlabsper la massima qualità
Passo 5: Configurazione Consigliata
Ecco un default conservativo e affidabile:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Un’impostazione importante: voice.submit_mode controlla cosa succede dopo la trascrizione. direct invia immediatamente, mentre draft ti permette di modificare prima dell’invio. Per bozze modificabili, imposta:
voice:
submit_mode: "draft"
Usare la Voce nella CLI
Avvia Hermes e attiva la voce:
hermes
Poi, all’interno della CLI:
/voice on
Flusso di registrazione:
- Premi
Ctrl+B - Parla
- Aspetta che il rilevamento del silenzio si fermi automaticamente
- Hermes trascrive e risponde
- Se il TTS è attivo, pronuncia la risposta
Comandi utili:
/voice
/voice on
/voice off
/voice tts
/voice status
Ottimi Flussi di Lavoro con la CLI
Debug al volo: Basta dire “Continua a darmi un errore di permesso docker. Aiutami a fare debug.” Poi continua a mani libere: “Leggi di nuovo l’ultimo errore,” “Spiegami la causa principale in termini più semplici,” “Ora dammi la soluzione esatta.”
Ricerca e brainstorming: Perfetto per camminare mentre pensi, dettare idee a metà e chiedere a Hermes di strutturare i tuoi pensieri in tempo reale.
Accessibilità: Se digitare è scomodo, la modalità vocale ti mantiene nel pieno ciclo di Hermes senza tastiera.
Ottimizzare il Comportamento
Se Hermes inizia o smette di registrare in modo troppo aggressivo, regola i valori silence_threshold e silence_duration nella tua configurazione.
Questo è tutto! La modalità vocale è ora attiva e pronta all’uso. Inizia con il testo, aggiungi le risposte vocali ed esplora i canali vocali di Discord quando sei pronto. Buone conversazioni!
📖 Documentazione ufficiale
この記事は Hermes Agent のDocumentazione ufficialeに基づいています:GitHub ›/releases/tag/v2026.8.3