🤖HermesBlog
Hermes Version History · 파트 28/9/2026

Hermes v2026.8.3 업데이트: 실시간 음성, 에이전트 간 통신 및 검증 가능한 인용

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 업데이트: 실시간 음성, 에이전트 간 통신 및 검증 가능한 인용

안녕하세요, Hermes 블로그에 다시 오신 것을 환영합니다! 오늘은 지금까지 가장 흥미로운 업데이트 중 하나인 실시간 음성 모드에 대해 자세히 알아보겠습니다. 모든 명령을 타이핑하는 대신 에이전트와 직접 대화하고 싶었다면, 바로 이 업데이트가 여러분을 위한 것입니다. 그리고 가장 좋은 소식은? 생각보다 훨씬 쉽게 설정할 수 있다는 점입니다.

오늘 음성 모드를 바로 실행하는 데 필요한 모든 것을 함께 살펴보겠습니다.

음성 모드가 실제로 유용한 이유

음성 모드는 단순한 장식이 아닙니다. 다양한 상황에서 정말 유용하게 활용할 수 있습니다:

  • 코딩이나 리서치 중 핸즈프리 CLI 워크플로우
  • Telegram이나 Discord에서 바로 음성 응답 받기
  • Discord 음성 채널에서 Hermes와 실시간 대화하기
  • 걸어 다니면서 타이핑을 멈추지 않고 아이디어를 빠르게 메모하기

에이전트가 단순한 텍스트 상자가 아니라 대화 상대가 되는 것이라고 생각하면 됩니다.

음성 사용의 세 가지 방법

Hermes에는 세 가지 서로 다른 음성 경험이 있으며, 자신의 스타일에 맞는 것을 선택할 수 있습니다:

모드 용도 플랫폼
인터랙티브 마이크 루프 개인 핸즈프리 사용 CLI
채팅에서 음성 답변 메시징과 함께 음성 응답 Telegram, Discord
라이브 음성 채널 봇 그룹 또는 개인 실시간 대화 Discord 음성 채널

현명한 접근 방식은 다음과 같습니다: 먼저 텍스트를 작동시키고, 그 다음 음성 답변을 활성화한 뒤, 전체 경험을 원한다면 마지막으로 Discord 음성 채널을 시도해 보세요.

1단계: 먼저 텍스트 작동 확인하기

음성을 다루기 전에 기본 사항이 제대로 되어 있는지 확인하세요:

hermes

그런 다음 간단한 질문을 해보세요:

사용 가능한 도구가 무엇인가요?

이것이 작동한다면 다음 단계로 진행할 준비가 된 것입니다.

2단계: 필요한 추가 패키지 설치하기

원하는 기능에 따라 적절한 패키지를 설치하세요:

CLI 마이크 + 재생:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

메시징 플랫폼:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

프리미엄 ElevenLabs TTS:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

로컬 NeuTTS (선택 사항):

python -m pip install -U neutts[all]

한 번에 모두 설치:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

3단계: 시스템 종속성 설치하기

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

각각이 중요한 이유는 다음과 같습니다:

  • portaudio → 마이크 입력 및 재생
  • ffmpeg → 오디오 변환
  • opus → Discord 음성 코덱 지원
  • espeak-ng → NeuTTS용 포네마이저

4단계: 음성 공급자 선택하기

Hermes는 로컬 및 클라우드 음성 스택을 모두 지원합니다. 가장 쉽고 저렴한 설정은 무료 Edge TTS와 함께 로컬 STT를 사용하는 것입니다:

  • STT 공급자: local
  • TTS 공급자: edge

API 키가 있으면 ~/.hermes/.env에 추가하세요:

# 클라우드 STT 옵션 (로컬은 키가 필요 없음)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# 프리미엄 TTS (선택 사항)
ELEVENLABS_API_KEY=***

빠른 추천:

  • STT: 개인정보 보호를 원하면 local, 속도를 원하면 groq, 유료 대안으로 openai
  • TTS: 무료로 edge, 로컬로 neutts, 최고 품질로 elevenlabs

5단계: 권장 설정

다음은 안정적인 기본 설정입니다:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

중요한 설정 하나: voice.submit_mode는 전사 후 동작을 제어합니다. direct는 즉시 제출하고, draft는 전송 전에 편집할 수 있게 합니다. 편집 가능한 초안을 원한다면 다음과 같이 설정하세요:

voice:
  submit_mode: "draft"

CLI에서 음성 사용하기

Hermes를 시작하고 음성을 켜세요:

hermes

그런 다음 CLI 안에서:

/voice on

녹음 흐름:

  1. Ctrl+B 누르기
  2. 말하기
  3. 자동으로 멈출 때까지 침묵 감지 대기
  4. Hermes가 전사하고 응답
  5. TTS가 켜져 있으면 답변을 음성으로 출력

유용한 명령어:

/voice
/voice on
/voice off
/voice tts
/voice status

훌륭한 CLI 워크플로우

즉석 디버깅: “도커 권한 오류가 계속 발생해요. 디버깅을 도와주세요.“라고 말해보세요. 그런 다음 핸즈프리로 계속하세요: “마지막 오류 다시 읽어줘,” “근본 원인을 더 쉽게 설명해줘,” “이제 정확한 해결책을 알려줘.”

리서치 및 브레인스토밍: 생각하면서 돌아다니거나, 완성되지 않은 아이디어를 받아 적거나, Hermes가 실시간으로 생각을 정리해 주는 데 완벽합니다.

접근성: 타이핑이 불편한 경우 음성 모드를 사용하면 키보드 없이도 전체 Hermes 기능을 사용할 수 있습니다.

동작 조정하기

Hermes가 녹음을 너무 공격적으로 시작하거나 중지한다면, 설정 파일에서 silence_thresholdsilence_duration 값을 조정하세요.

이것으로 끝입니다! 음성 모드가 이제 활성화되어 사용할 준비가 되었습니다. 텍스트부터 시작하고, 음성 답변을 추가하고, 준비가 되면 Discord 음성 채널을 탐험해 보세요. 즐거운 대화 되세요!

📖 공식 문서

この記事は Hermes Agent の공식 문서に基づいています:GitHub ›/releases/tag/v2026.8.3