🤖HermesBlog
Hermes Official Tutorials · Parte 278/9/2026

Tutorial 27: Modo de Voz

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutorial 27: Modo de Voz

¡Bienvenidos de nuevo, amigos! Hoy vamos a hablar de una de las formas más interesantes de usar Hermes: el Modo de Voz. Si alguna vez has querido chatear con tu asistente de IA mientras caminas, cocinas la cena o simplemente evitas el teclado, este tutorial es para ti.

¿Qué es el Modo de Voz?

El Modo de Voz te permite hablar con Hermes en lugar de escribir. Es perfecto para:

  • Flujos de trabajo CLI sin usar las manos – programar e investigar sin tocar el teclado
  • Respuestas habladas en Telegram o Discord – recibe respuestas de voz junto a los mensajes normales
  • Canales de voz en vivo de Discord – mantén una conversación real con Hermes en un chat de voz
  • Captura rápida de ideas – dicta tus pensamientos mientras caminas o haces una lluvia de ideas

¿La mejor parte? Si usas Nous Portal, obtienes tanto el LLM como la conversión de texto a voz con un solo inicio de sesión OAuth. ¡No necesitas credenciales adicionales!

Tres Formas de Usar la Voz

Modo Ideal para Plataforma
Bucle de micrófono interactivo Uso personal sin manos CLI
Respuestas de voz en el chat Respuestas habladas con mensajería Telegram, Discord
Bot de canal de voz en vivo Conversaciones grupales Canales de voz de Discord

Consejo profesional: Primero haz que funcione el modo de texto, luego añade las respuestas de voz y, finalmente, prueba los canales de voz de Discord si quieres la experiencia completa.

Paso 1: Haz Funcionar el Texto Primero

Antes de sumergirte en la voz, asegúrate de que lo básico funcione:

hermes

Luego haz una pregunta sencilla:

¿Qué herramientas tienes disponibles?

Si eso funciona bien, ¡estás listo para la voz!

Paso 2: Instala los Extras

Dependiendo de lo que necesites, instala los paquetes adecuados:

# Micrófono CLI + reproducción
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Plataformas de mensajería (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# TTS premium de ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Todo
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Paso 3: Dependencias del Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Esto es por qué son importantes:

  • portaudio → entrada de micrófono para la voz en CLI
  • ffmpeg → conversión de audio
  • opus → códec de voz de Discord
  • espeak-ng → fonetizador para NeuTTS

Paso 4: Elige Tus Proveedores

Configuración más fácil: Usa STT local y Edge TTS gratuito. Añade esto a ~/.hermes/.env:

# Opciones de STT en la nube (el local no necesita clave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opcional)
ELEVENLABS_API_KEY=***

Opciones de STT:

  • local – mejor para privacidad, costo cero
  • groq – transcripción en la nube súper rápida
  • openai – buena alternativa de pago

Opciones de TTS:

  • edge – gratuito y suficientemente bueno para la mayoría
  • neutts – local/en el dispositivo gratuito
  • elevenlabs – la mejor calidad
  • openai – buen punto intermedio
  • mistral – multilingüe, Opus nativo

Paso 5: Configuración Recomendada

Aquí tienes un buen valor predeterminado para la mayoría de las personas:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Nota sobre submit_mode:

  • direct (predeterminado) – envía la transcripción inmediatamente
  • draft – coloca la transcripción en el editor para que puedas modificarla antes de enviarla

Para borradores editables, configura submit_mode: "draft".

Usando la Voz en el CLI

Inicia Hermes y activa la voz:

hermes

Luego escribe:

/voice on

Flujo de grabación:

  1. Pulsa Ctrl+B
  2. Habla
  3. Espera a que la detección de silencio se detenga automáticamente
  4. Hermes transcribe y responde
  5. Si el TTS está activado, dice la respuesta en voz alta
  6. El bucle se reinicia para uso continuo

Comandos útiles:

/voice
/voice on
/voice off
/voice tts
/voice status

Grandes Flujos de Trabajo con Voz

Depuración sin manos: Di “Sigo recibiendo un error de permisos de docker. Ayúdame a depurarlo”. Luego continúa sin usar las manos: “Lee el último error otra vez”, “Explica la causa raíz en términos más simples”, “Ahora dame la solución exacta”.

Investigación/lluvia de ideas: Perfecto para caminar, dictar ideas a medio formar y pedirle a Hermes que estructure tus pensamientos en tiempo real.

Accesibilidad: Si escribir es incómodo, el modo de voz te mantiene en el bucle completo de Hermes.

Ajustando el Comportamiento

Si Hermes empieza o se detiene de forma demasiado agresiva, ajusta la configuración de silencio en tu configuración:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Baja el umbral para una detección más sensible, o súbelo si te corta mientras hablas.


¡Eso es todo! El Modo de Voz es una de esas funciones que parecen magia una vez que lo tienes funcionando. Empieza simple, familiarízate y pronto estarás teniendo conversaciones completas con Hermes mientras lavas los platos. ¡A hablar se ha dicho! 🎤

📖 Documentación oficial

Este artículo se basa en la documentación oficial de Hermes Agent :Docs oficiales › guides/use-voice-mode-with-hermes