🤖HermesBlog
Hermes Official Tutorials · Parte 278/9/2026

Tutorial 27: Modalità Vocale

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutorial 27: Modalità Vocale

Bentornati, amici! Oggi parliamo di uno dei modi più interessanti per usare Hermes: la Modalità Vocale. Se avete mai desiderato chiacchierare con il vostro assistente AI mentre camminate, cucinate la cena o semplicemente volete evitare la tastiera, questo tutorial fa per voi.

Cos’è la Modalità Vocale?

La Modalità Vocale vi permette di parlare con Hermes invece di digitare. È perfetta per:

  • Flussi di lavoro CLI a mani libere – programmare e fare ricerche senza toccare la tastiera
  • Risposte vocali in Telegram o Discord – ricevere risposte audio insieme ai normali messaggi
  • Canali vocali live di Discord – fare una vera conversazione con Hermes in una chat vocale
  • Cattura rapida di idee – dettare pensieri mentre camminate o fate brainstorming

La parte migliore? Se usate Nous Portal, ottenete sia il LLM che la sintesi vocale con un unico login OAuth. Nessuna credenziale extra necessaria!

Tre Modi per Usare la Voce

Modalità Ideale Per Piattaforma
Ciclo microfono interattivo Uso personale a mani libere CLI
Risposte vocali in chat Risposte parlate con messaggistica Telegram, Discord
Bot canale vocale live Conversazioni di gruppo Canali vocali Discord

Consiglio da pro: Iniziate facendo funzionare prima la modalità testo, poi aggiungete le risposte vocali e infine provate i canali vocali di Discord se volete l’esperienza completa.

Passo 1: Fate Funzionare Prima il Testo

Prima di tuffarvi nella voce, assicuratevi che le basi funzionino:

hermes

Poi fate una domanda semplice:

Quali strumenti hai a disposizione?

Se funziona, siete pronti per la voce!

Passo 2: Installate i Componenti Extra

A seconda di ciò che vi serve, installate i pacchetti giusti:

# Microfono CLI + riproduzione
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Piattaforme di messaggistica (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Tutto
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Passo 3: Dipendenze di Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Ecco perché sono importanti:

  • portaudio → ingresso microfono per la voce CLI
  • ffmpeg → conversione audio
  • opus → codec vocale Discord
  • espeak-ng → fonemizzatore per NeuTTS

Passo 4: Scegliete i Vostri Provider

Configurazione più semplice: Usate STT locale e Edge TTS gratuito. Aggiungete questo a ~/.hermes/.env:

# Opzioni STT cloud (il locale non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opzionale)
ELEVENLABS_API_KEY=***

Opzioni STT:

  • local – ideale per la privacy, costo zero
  • groq – trascrizione cloud super veloce
  • openai – buona alternativa a pagamento

Opzioni TTS:

  • edge – gratuito e sufficiente per la maggior parte degli usi
  • neutts – gratuito locale/sul dispositivo
  • elevenlabs – qualità migliore
  • openai – buon compromesso
  • mistral – multilingue, Opus nativo

Passo 5: Configurazione Consigliata

Ecco un buon default per la maggior parte delle persone:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Nota su submit_mode:

  • direct (default) – invia la trascrizione immediatamente
  • draft – mette la trascrizione nell’editor così potete modificarla prima di inviarla

Per bozze modificabili, impostate submit_mode: "draft".

Usare la Voce nella CLI

Avviate Hermes e attivate la voce:

hermes

Poi digitate:

/voice on

Flusso di registrazione:

  1. Premete Ctrl+B
  2. Parlate
  3. Aspettate che il rilevamento del silenzio si fermi automaticamente
  4. Hermes trascrive e risponde
  5. Se il TTS è attivo, pronuncia la risposta
  6. Il ciclo si ripete per un uso continuo

Comandi utili:

/voice
/voice on
/voice off
/voice tts
/voice status

Ottimi Flussi di Lavoro Vocali

Debug al volo: Dite “Continuo a ricevere un errore di permesso docker. Aiutami a fare debug.” Poi continuate a mani libere: “Leggi di nuovo l’ultimo errore”, “Spiegami la causa principale in termini più semplici”, “Ora dammi la soluzione esatta”.

Ricerca/brainstorming: Perfetto per camminare, dettare idee a metà e chiedere a Hermes di strutturare i vostri pensieri in tempo reale.

Accessibilità: Se digitare è scomodo, la modalità vocale vi mantiene nel pieno ciclo di Hermes.

Regolare il Comportamento

Se Hermes inizia/si ferma in modo troppo aggressivo, regolate le impostazioni di silenzio nella vostra configurazione:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Abbassate la soglia per un rilevamento più sensibile, o aumentatela se vi interrompe.


Questo è tutto! La Modalità Vocale è una di quelle funzionalità che sembrano magia una volta che la fate funzionare. Iniziate in modo semplice, prendete confidenza e presto farete conversazioni complete con Hermes mentre lavate i piatti. Buone chiacchiere! 🎤

📖 Documentazione ufficiale

この記事は Hermes Agent のDocumentazione ufficialeに基づいています:Documentazione ufficiale › guides/use-voice-mode-with-hermes