🤖HermesBlog
Hermes Feature Guides · Parte 68/9/2026

Parlare con l'AI tramite Voice Mode

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

Parlare con l’AI tramite Voice Mode

La modalità vocale è una di quelle funzionalità che sembrano magia la prima volta che le provi. Invece di digitare ogni comando e leggere ogni risposta, puoi semplicemente… parlare. Hermes ascolta, pensa e risponde. Questa guida ti accompagna attraverso tutto ciò che ti serve per far funzionare la modalità vocale, da una semplice configurazione del microfono a un bot completo per canali vocali Discord.

A cosa serve la modalità vocale

La modalità vocale brilla quando hai le mani occupate o vuoi semplicemente un modo più naturale di interagire con l’AI. Ecco i casi d’uso più comuni:

  • Flusso di lavoro CLI a mani libere — continua a programmare o fare ricerche mentre parli con Hermes
  • Risposte vocali in Telegram o Discord — ricevi risposte vocali insieme ai normali messaggi di testo
  • Canale vocale Discord live — fai entrare Hermes in un canale vocale per conversazioni in tempo reale
  • Cattura rapida di idee — detti i tuoi pensieri mentre cammini invece di digitarli

Tre modi per usare la modalità vocale

Hermes offre tre diverse esperienze vocali. Scegli quella che si adatta alle tue esigenze:

Modalità Ideale per Piattaforma
Ciclo microfono interattivo Uso personale a mani libere mentre programmi CLI
Risposte vocali in chat Risposte parlate con messaggistica normale Telegram, Discord
Bot canale vocale live Conversazione live di gruppo o personale Canali vocali Discord

Un buon percorso è iniziare in modo semplice: fai funzionare prima il testo, poi abilita le risposte vocali e infine passa ai canali vocali Discord se vuoi l’esperienza completa.

Passo 1: Assicurati che la modalità testo funzioni prima

Prima di toccare la modalità vocale, verifica che Hermes si avvii e che il tuo provider sia configurato. Esegui hermes e chiedi qualcosa di semplice come:

What tools do you have available?

Se non è ancora stabile, sistema prima la modalità testo. La modalità vocale si basa su quella.

Passo 2: Installa gli extra giusti

A seconda dell’esperienza vocale che desideri, installa gli extra corrispondenti:

Microfono CLI + riproduzione:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Piattaforme di messaggistica (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium ElevenLabs (opzionale):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS locale (opzionale):

python -m pip install -U neutts[all]

Tutto:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Installa le dipendenze di sistema

La modalità vocale richiede alcuni pacchetti di sistema per gestire l’input audio, la conversione e la riproduzione.

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Ecco perché ciascuno è importante:

  • portaudio → input microfono e riproduzione per la modalità vocale CLI
  • ffmpeg → conversione audio per TTS e consegna messaggi
  • opus → supporto codec vocale Discord
  • espeak-ng → backend fonemizzatore per NeuTTS

Passo 4: Scegli i tuoi provider vocali

Hermes supporta sia stack vocali locali che cloud. La configurazione più semplice ed economica usa STT locale e Edge TTS gratuito:

  • Provider STT: local
  • Provider TTS: edge

Aggiungi eventuali chiavi cloud a ~/.hermes/.env:

# Opzioni STT cloud (locale non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opzionale)
ELEVENLABS_API_KEY=***

Raccomandazioni speech-to-text:

  • local → migliore impostazione predefinita per privacy e costo zero
  • groq → trascrizione cloud molto veloce
  • openai → buona alternativa a pagamento

Raccomandazioni text-to-speech:

  • edge → gratuito e sufficiente per la maggior parte degli utenti
  • neutts → TTS locale/sul dispositivo gratuito
  • elevenlabs → qualità migliore
  • openai → buon compromesso
  • mistral → multilingue, Opus nativo

Passo 5: Configurazione consigliata

Ecco un’impostazione predefinita solida e conservativa per la maggior parte delle persone:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

L’impostazione submit_mode controlla cosa succede dopo la trascrizione:

  • direct (predefinito) invia la trascrizione immediatamente
  • draft inserisce la trascrizione nel compositore così puoi modificarla prima di inviarla

Per bozze vocali modificabili, imposta submit_mode: "draft".

Usare la modalità vocale nella CLI

Avvia Hermes e attiva la modalità vocale:

hermes

Poi all’interno della CLI:

/voice on

Flusso di registrazione:

  1. Premi Ctrl+B
  2. Parla
  3. Attendi che il rilevamento del silenzio interrompa automaticamente la registrazione
  4. Hermes trascrive e risponde
  5. Se TTS è attivo, pronuncia la risposta
  6. Il ciclo può riavviarsi automaticamente per un uso continuo

Comandi utili:

/voice
/voice on
/voice off
/voice tts
/voice status

Ottimi flussi di lavoro CLI

Debug al volo: Dì “Continuo a ricevere un errore di permessi docker. Aiutami a fare debug.” Poi continua a mani libere con domande di follow-up come “Leggi di nuovo l’ultimo errore” o “Ora dammi la soluzione esatta.”

Ricerca e brainstorming: Perfetto per camminare mentre pensi, dettare idee a metà e chiedere a Hermes di strutturare i tuoi pensieri in tempo reale.

Accessibilità: Se digitare è scomodo, la modalità vocale è uno dei modi più veloci per rimanere nel ciclo completo di Hermes.

Ottimizzare il comportamento della CLI

Se Hermes inizia o interrompe la registrazione in modo troppo aggressivo, regola le impostazioni del silenzio nella tua configurazione:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Abbassa la soglia se si interrompe troppo presto, o alzala se il rumore di fondo mantiene la registrazione attiva. La durata controlla quanto deve durare la pausa per attivare l’interruzione.

La modalità vocale è un punto di svolta una volta che la configuri. Inizia con il ciclo CLI di base, poi espandi alle piattaforme di messaggistica e ai canali vocali Discord man mano che prendi confidenza. Buone conversazioni!

📖 Documentazione ufficiale

この記事は Hermes Agent のDocumentazione ufficialeに基づいています:Documentazione ufficiale › guides/use-voice-mode-with-hermes