Tutorial 27: Modalità Vocale
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Tutorial 27: Modalità Vocale
Bentornati, amici! Oggi parliamo di uno dei modi più interessanti per usare Hermes: la Modalità Vocale. Se avete mai desiderato chiacchierare con il vostro assistente AI mentre camminate, cucinate la cena o semplicemente volete evitare la tastiera, questo tutorial fa per voi.
Cos’è la Modalità Vocale?
La Modalità Vocale vi permette di parlare con Hermes invece di digitare. È perfetta per:
- Flussi di lavoro CLI a mani libere – programmare e fare ricerche senza toccare la tastiera
- Risposte vocali in Telegram o Discord – ricevere risposte audio insieme ai normali messaggi
- Canali vocali live di Discord – fare una vera conversazione con Hermes in una chat vocale
- Cattura rapida di idee – dettare pensieri mentre camminate o fate brainstorming
La parte migliore? Se usate Nous Portal, ottenete sia il LLM che la sintesi vocale con un unico login OAuth. Nessuna credenziale extra necessaria!
Tre Modi per Usare la Voce
| Modalità | Ideale Per | Piattaforma |
|---|---|---|
| Ciclo microfono interattivo | Uso personale a mani libere | CLI |
| Risposte vocali in chat | Risposte parlate con messaggistica | Telegram, Discord |
| Bot canale vocale live | Conversazioni di gruppo | Canali vocali Discord |
Consiglio da pro: Iniziate facendo funzionare prima la modalità testo, poi aggiungete le risposte vocali e infine provate i canali vocali di Discord se volete l’esperienza completa.
Passo 1: Fate Funzionare Prima il Testo
Prima di tuffarvi nella voce, assicuratevi che le basi funzionino:
hermes
Poi fate una domanda semplice:
Quali strumenti hai a disposizione?
Se funziona, siete pronti per la voce!
Passo 2: Installate i Componenti Extra
A seconda di ciò che vi serve, installate i pacchetti giusti:
# Microfono CLI + riproduzione
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Piattaforme di messaggistica (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# TTS premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Tutto
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Passo 3: Dipendenze di Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Ecco perché sono importanti:
portaudio→ ingresso microfono per la voce CLIffmpeg→ conversione audioopus→ codec vocale Discordespeak-ng→ fonemizzatore per NeuTTS
Passo 4: Scegliete i Vostri Provider
Configurazione più semplice: Usate STT locale e Edge TTS gratuito. Aggiungete questo a ~/.hermes/.env:
# Opzioni STT cloud (il locale non richiede chiave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (opzionale)
ELEVENLABS_API_KEY=***
Opzioni STT:
local– ideale per la privacy, costo zerogroq– trascrizione cloud super veloceopenai– buona alternativa a pagamento
Opzioni TTS:
edge– gratuito e sufficiente per la maggior parte degli usineutts– gratuito locale/sul dispositivoelevenlabs– qualità miglioreopenai– buon compromessomistral– multilingue, Opus nativo
Passo 5: Configurazione Consigliata
Ecco un buon default per la maggior parte delle persone:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Nota su submit_mode:
direct(default) – invia la trascrizione immediatamentedraft– mette la trascrizione nell’editor così potete modificarla prima di inviarla
Per bozze modificabili, impostate submit_mode: "draft".
Usare la Voce nella CLI
Avviate Hermes e attivate la voce:
hermes
Poi digitate:
/voice on
Flusso di registrazione:
- Premete
Ctrl+B - Parlate
- Aspettate che il rilevamento del silenzio si fermi automaticamente
- Hermes trascrive e risponde
- Se il TTS è attivo, pronuncia la risposta
- Il ciclo si ripete per un uso continuo
Comandi utili:
/voice
/voice on
/voice off
/voice tts
/voice status
Ottimi Flussi di Lavoro Vocali
Debug al volo: Dite “Continuo a ricevere un errore di permesso docker. Aiutami a fare debug.” Poi continuate a mani libere: “Leggi di nuovo l’ultimo errore”, “Spiegami la causa principale in termini più semplici”, “Ora dammi la soluzione esatta”.
Ricerca/brainstorming: Perfetto per camminare, dettare idee a metà e chiedere a Hermes di strutturare i vostri pensieri in tempo reale.
Accessibilità: Se digitare è scomodo, la modalità vocale vi mantiene nel pieno ciclo di Hermes.
Regolare il Comportamento
Se Hermes inizia/si ferma in modo troppo aggressivo, regolate le impostazioni di silenzio nella vostra configurazione:
voice:
silence_threshold: 200
silence_duration: 3.0
Abbassate la soglia per un rilevamento più sensibile, o aumentatela se vi interrompe.
Questo è tutto! La Modalità Vocale è una di quelle funzionalità che sembrano magia una volta che la fate funzionare. Iniziate in modo semplice, prendete confidenza e presto farete conversazioni complete con Hermes mentre lavate i piatti. Buone chiacchiere! 🎤
📖 Documentazione ufficiale
この記事は Hermes Agent のDocumentazione ufficialeに基づいています:Documentazione ufficiale › guides/use-voice-mode-with-hermes