🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Hermes v2026.8.3 Actualización: Voz en Tiempo Real, Comunicación entre Agentes y Citas Verificables

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 Actualización: Voz en Tiempo Real, Comunicación entre Agentes y Citas Verificables

¡Hola a todos, bienvenidos de nuevo al blog de Hermes! Hoy nos sumergimos en una de las actualizaciones más emocionantes hasta ahora: el modo de voz en tiempo real. Si alguna vez quisiste hablar con tu agente en lugar de escribir cada comando, esta es la actualización para ti. ¿Y lo mejor? Es mucho más fácil de configurar de lo que crees.

Repasemos todo lo que necesitas saber para poner en marcha el modo de voz hoy mismo.

Para Qué Sirve Realmente el Modo de Voz

El modo de voz no es solo un truco: es genuinamente útil en un montón de escenarios:

  • Flujos de trabajo CLI manos libres mientras programas o investigas
  • Respuestas habladas directamente en Telegram o Discord
  • Conversación en vivo con Hermes en un canal de voz de Discord
  • Captura rápida de ideas mientras caminas, sin tener que pararte a escribir

Piénsalo como si tu agente se convirtiera en un compañero de conversación, no solo en una caja de texto.

Tres Formas de Usar la Voz

Hay tres experiencias de voz distintas en Hermes, y puedes elegir la que se adapte a tu estilo:

Modo Ideal Para Plataforma
Bucle de micrófono interactivo Uso personal manos libres CLI
Respuestas de voz en el chat Respuestas habladas junto a la mensajería Telegram, Discord
Bot de canal de voz en vivo Conversación en vivo grupal o personal Canales de voz de Discord

Un camino inteligente: primero haz que funcione el texto, luego activa las respuestas de voz y, finalmente, prueba los canales de voz de Discord si quieres la experiencia completa.

Paso 1: Haz que el Texto Funcione Primero

Antes de tocar la voz, asegúrate de que lo básico esté sólido:

hermes

Luego haz una pregunta sencilla:

¿Qué herramientas tienes disponibles?

Si eso funciona, estás listo para continuar.

Paso 2: Instala los Extras Adecuados

Dependiendo de lo que quieras, instala el paquete correspondiente:

Micrófono + reproducción CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Plataformas de mensajería:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS premium de ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS local (opcional):

python -m pip install -U neutts[all]

Todo a la vez:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Paso 3: Dependencias del Sistema

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Esto es por qué importan:

  • portaudio → entrada de micrófono y reproducción
  • ffmpeg → conversión de audio
  • opus → soporte de códec de voz de Discord
  • espeak-ng → fonetizador para NeuTTS

Paso 4: Elige Tus Proveedores de Voz

Hermes admite tanto stacks de voz locales como en la nube. La configuración más fácil y económica es STT local con Edge TTS gratuito:

  • Proveedor de STT: local
  • Proveedor de TTS: edge

Añade cualquier clave de API a ~/.hermes/.env:

# Opciones de STT en la nube (local no necesita clave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS premium (opcional)
ELEVENLABS_API_KEY=***

Recomendaciones rápidas:

  • STT: local para privacidad, groq para velocidad, openai como respaldo de pago
  • TTS: edge para gratis, neutts para local, elevenlabs para la mejor calidad

Paso 5: Configuración Recomendada

Aquí tienes un valor predeterminado conservador y sólido:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Un ajuste importante: voice.submit_mode controla qué sucede después de la transcripción. direct envía inmediatamente, mientras que draft te permite editar antes de enviar. Para borradores editables, configura:

voice:
  submit_mode: "draft"

Usando la Voz en la CLI

Inicia Hermes y activa la voz:

hermes

Luego dentro de la CLI:

/voice on

Flujo de grabación:

  1. Pulsa Ctrl+B
  2. Habla
  3. Espera a que la detección de silencio se detenga automáticamente
  4. Hermes transcribe y responde
  5. Si el TTS está activado, habla la respuesta

Comandos útiles:

/voice
/voice on
/voice off
/voice tts
/voice status

Grandes Flujos de Trabajo en la CLI

Depuración sobre la marcha: Simplemente di “Sigo recibiendo un error de permisos de docker. Ayúdame a depurarlo”. Luego continúa manos libres: “Lee el último error de nuevo”, “Explica la causa raíz en términos más simples”, “Ahora dame la solución exacta”.

Investigación y lluvia de ideas: Perfecto para caminar mientras piensas, dictar ideas a medio formar y pedirle a Hermes que estructure tus pensamientos en tiempo real.

Accesibilidad: Si escribir es incómodo, el modo de voz te mantiene en el bucle completo de Hermes sin necesidad del teclado.

Ajustando el Comportamiento

Si Hermes comienza o detiene la grabación de forma demasiado agresiva, ajusta los valores de silence_threshold y silence_duration en tu configuración.

¡Eso es todo! El modo de voz ya está disponible y listo para usar. Empieza con texto, añade respuestas de voz y explora los canales de voz de Discord cuando estés listo. ¡Feliz conversación!

📖 Documentación oficial

Este artículo se basa en la documentación oficial de Hermes Agent :GitHub ›/releases/tag/v2026.8.3