Hermes v2026.8.3 Actualización: Voz en Tiempo Real, Comunicación entre Agentes y Citas Verificables
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Hermes v2026.8.3 Actualización: Voz en Tiempo Real, Comunicación entre Agentes y Citas Verificables
¡Hola a todos, bienvenidos de nuevo al blog de Hermes! Hoy nos sumergimos en una de las actualizaciones más emocionantes hasta ahora: el modo de voz en tiempo real. Si alguna vez quisiste hablar con tu agente en lugar de escribir cada comando, esta es la actualización para ti. ¿Y lo mejor? Es mucho más fácil de configurar de lo que crees.
Repasemos todo lo que necesitas saber para poner en marcha el modo de voz hoy mismo.
Para Qué Sirve Realmente el Modo de Voz
El modo de voz no es solo un truco: es genuinamente útil en un montón de escenarios:
- Flujos de trabajo CLI manos libres mientras programas o investigas
- Respuestas habladas directamente en Telegram o Discord
- Conversación en vivo con Hermes en un canal de voz de Discord
- Captura rápida de ideas mientras caminas, sin tener que pararte a escribir
Piénsalo como si tu agente se convirtiera en un compañero de conversación, no solo en una caja de texto.
Tres Formas de Usar la Voz
Hay tres experiencias de voz distintas en Hermes, y puedes elegir la que se adapte a tu estilo:
| Modo | Ideal Para | Plataforma |
|---|---|---|
| Bucle de micrófono interactivo | Uso personal manos libres | CLI |
| Respuestas de voz en el chat | Respuestas habladas junto a la mensajería | Telegram, Discord |
| Bot de canal de voz en vivo | Conversación en vivo grupal o personal | Canales de voz de Discord |
Un camino inteligente: primero haz que funcione el texto, luego activa las respuestas de voz y, finalmente, prueba los canales de voz de Discord si quieres la experiencia completa.
Paso 1: Haz que el Texto Funcione Primero
Antes de tocar la voz, asegúrate de que lo básico esté sólido:
hermes
Luego haz una pregunta sencilla:
¿Qué herramientas tienes disponibles?
Si eso funciona, estás listo para continuar.
Paso 2: Instala los Extras Adecuados
Dependiendo de lo que quieras, instala el paquete correspondiente:
Micrófono + reproducción CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Plataformas de mensajería:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS premium de ElevenLabs:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS local (opcional):
python -m pip install -U neutts[all]
Todo a la vez:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Paso 3: Dependencias del Sistema
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Esto es por qué importan:
portaudio→ entrada de micrófono y reproducciónffmpeg→ conversión de audioopus→ soporte de códec de voz de Discordespeak-ng→ fonetizador para NeuTTS
Paso 4: Elige Tus Proveedores de Voz
Hermes admite tanto stacks de voz locales como en la nube. La configuración más fácil y económica es STT local con Edge TTS gratuito:
- Proveedor de STT:
local - Proveedor de TTS:
edge
Añade cualquier clave de API a ~/.hermes/.env:
# Opciones de STT en la nube (local no necesita clave)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS premium (opcional)
ELEVENLABS_API_KEY=***
Recomendaciones rápidas:
- STT:
localpara privacidad,groqpara velocidad,openaicomo respaldo de pago - TTS:
edgepara gratis,neuttspara local,elevenlabspara la mejor calidad
Paso 5: Configuración Recomendada
Aquí tienes un valor predeterminado conservador y sólido:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Un ajuste importante: voice.submit_mode controla qué sucede después de la transcripción. direct envía inmediatamente, mientras que draft te permite editar antes de enviar. Para borradores editables, configura:
voice:
submit_mode: "draft"
Usando la Voz en la CLI
Inicia Hermes y activa la voz:
hermes
Luego dentro de la CLI:
/voice on
Flujo de grabación:
- Pulsa
Ctrl+B - Habla
- Espera a que la detección de silencio se detenga automáticamente
- Hermes transcribe y responde
- Si el TTS está activado, habla la respuesta
Comandos útiles:
/voice
/voice on
/voice off
/voice tts
/voice status
Grandes Flujos de Trabajo en la CLI
Depuración sobre la marcha: Simplemente di “Sigo recibiendo un error de permisos de docker. Ayúdame a depurarlo”. Luego continúa manos libres: “Lee el último error de nuevo”, “Explica la causa raíz en términos más simples”, “Ahora dame la solución exacta”.
Investigación y lluvia de ideas: Perfecto para caminar mientras piensas, dictar ideas a medio formar y pedirle a Hermes que estructure tus pensamientos en tiempo real.
Accesibilidad: Si escribir es incómodo, el modo de voz te mantiene en el bucle completo de Hermes sin necesidad del teclado.
Ajustando el Comportamiento
Si Hermes comienza o detiene la grabación de forma demasiado agresiva, ajusta los valores de silence_threshold y silence_duration en tu configuración.
¡Eso es todo! El modo de voz ya está disponible y listo para usar. Empieza con texto, añade respuestas de voz y explora los canales de voz de Discord cuando estés listo. ¡Feliz conversación!
📖 Documentación oficial
Este artículo se basa en la documentación oficial de Hermes Agent :GitHub ›/releases/tag/v2026.8.3