🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Aggiornamento Hermes v2026.8.3: Voce in Tempo Reale, Comunicazione tra Agenti e Citazioni Verificabili

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Aggiornamento Hermes v2026.8.3: Voce in Tempo Reale, Comunicazione tra Agenti e Citazioni Verificabili

Ciao a tutti, bentornati sul blog di Hermes! Oggi ci immergiamo in uno degli aggiornamenti più entusiasmanti finora: la modalità vocale in tempo reale. Se hai mai desiderato parlare con il tuo agente invece di digitare ogni singolo comando, questo è l’aggiornamento che fa per te. E la parte migliore? La configurazione è molto più semplice di quanto pensi.

Vediamo insieme tutto quello che devi sapere per attivare la modalità vocale oggi stesso.

A Cosa Serve Davvero la Modalità Vocale

La modalità vocale non è solo un espediente accattivante: è davvero utile in molte situazioni:

  • Flussi di lavoro CLI a mani libere mentre stai programmando o facendo ricerche
  • Risposte vocali direttamente su Telegram o Discord
  • Conversazione dal vivo con Hermes in un canale vocale di Discord
  • Cattura rapida di idee mentre cammini, senza doverti fermare a digitare

Pensala così: il tuo agente diventa un interlocutore, non solo una casella di testo.

Tre Modi per Usare la Voce

Ci sono tre diverse esperienze vocali in Hermes, e puoi scegliere quella che si adatta al tuo stile:

Modalità Ideale Per Piattaforma
Ciclo microfono interattivo Uso personale a mani libere CLI
Risposte vocali nella chat Risposte parlate insieme ai messaggi Telegram, Discord
Bot in canale vocale live Conversazione dal vivo di gruppo o personale Canali vocali Discord

Un percorso intelligente da seguire: prima fai funzionare il testo, poi abilita le risposte vocali e infine prova i canali vocali di Discord se vuoi l’esperienza completa.

Passo 1: Fai Funzionare Prima il Testo

Prima di toccare la voce, assicurati che le basi siano solide:

hermes

Poi fai una domanda semplice:

Quali strumenti hai a disposizione?

Se funziona, sei pronto per passare al passo successivo.

Passo 2: Installa le Estensioni Giuste

A seconda di cosa ti serve, installa il pacchetto appropriato:

Microfono CLI + riproduzione:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Piattaforme di messaggistica:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS locale (opzionale):

python -m pip install -U neutts[all]

Tutto in una volta:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Dipendenze di Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Ecco perché sono importanti:

  • portaudio → ingresso microfono e riproduzione
  • ffmpeg → conversione audio
  • opus → supporto codec vocale Discord
  • espeak-ng → fonemizzatore per NeuTTS

Passo 4: Scegli i Tuoi Provider Vocali

Hermes supporta sia stack vocali locali che cloud. La configurazione più semplice ed economica è STT locale con Edge TTS gratuito:

  • Provider STT: local
  • Provider TTS: edge

Aggiungi eventuali chiavi API a ~/.hermes/.env:

# Opzioni STT cloud (local non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opzionale)
ELEVENLABS_API_KEY=***

Raccomandazioni rapide:

  • STT: local per la privacy, groq per la velocità, openai come alternativa a pagamento
  • TTS: edge per il gratuito, neutts per il locale, elevenlabs per la massima qualità

Passo 5: Configurazione Consigliata

Ecco un default conservativo e affidabile:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Un’impostazione importante: voice.submit_mode controlla cosa succede dopo la trascrizione. direct invia immediatamente, mentre draft ti permette di modificare prima dell’invio. Per bozze modificabili, imposta:

voice:
  submit_mode: "draft"

Usare la Voce nella CLI

Avvia Hermes e attiva la voce:

hermes

Poi, all’interno della CLI:

/voice on

Flusso di registrazione:

  1. Premi Ctrl+B
  2. Parla
  3. Aspetta che il rilevamento del silenzio si fermi automaticamente
  4. Hermes trascrive e risponde
  5. Se il TTS è attivo, pronuncia la risposta

Comandi utili:

/voice
/voice on
/voice off
/voice tts
/voice status

Ottimi Flussi di Lavoro con la CLI

Debug al volo: Basta dire “Continua a darmi un errore di permesso docker. Aiutami a fare debug.” Poi continua a mani libere: “Leggi di nuovo l’ultimo errore,” “Spiegami la causa principale in termini più semplici,” “Ora dammi la soluzione esatta.”

Ricerca e brainstorming: Perfetto per camminare mentre pensi, dettare idee a metà e chiedere a Hermes di strutturare i tuoi pensieri in tempo reale.

Accessibilità: Se digitare è scomodo, la modalità vocale ti mantiene nel pieno ciclo di Hermes senza tastiera.

Ottimizzare il Comportamento

Se Hermes inizia o smette di registrare in modo troppo aggressivo, regola i valori silence_threshold e silence_duration nella tua configurazione.

Questo è tutto! La modalità vocale è ora attiva e pronta all’uso. Inizia con il testo, aggiungi le risposte vocali ed esplora i canali vocali di Discord quando sei pronto. Buone conversazioni!

📖 Documentazione ufficiale

この記事は Hermes Agent のDocumentazione ufficialeに基づいています:GitHub ›/releases/tag/v2026.8.3