🤖HermesBlog
Hermes Official Tutorials · 파트 278/9/2026

튜토리얼 27: 음성 모드

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

튜토리얼 27: 음성 모드

돌아오신 것을 환영합니다, 여러분! 오늘은 Hermes를 사용하는 가장 멋진 방법 중 하나인 **음성 모드(Voice Mode)**에 대해 이야기해 보겠습니다. 돌아다니면서, 저녁을 요리하면서, 또는 그냥 키보드를 피하고 싶을 때 AI 어시스턴트와 대화하고 싶었던 적이 있다면, 이 튜토리얼이 바로 여러분을 위한 것입니다.

음성 모드란 무엇인가?

음성 모드는 타이핑 대신 Hermes와 대화할 수 있게 해줍니다. 다음과 같은 상황에 완벽합니다:

  • 핸즈프리 CLI 워크플로우 – 키보드를 건드리지 않고 코딩과 리서치
  • Telegram 또는 Discord에서 음성 응답 – 일반 메시지와 함께 음성 답변 받기
  • 라이브 Discord 음성 채널 – 음성 채팅에서 Hermes와 실제 대화 나누기
  • 빠른 아이디어 캡처 – 걷거나 브레인스토밍하면서 생각을 받아 적기

가장 좋은 점? Nous Portal을 사용하면 하나의 OAuth 로그인으로 LLM과 텍스트 음성 변환(TTS)을 모두 사용할 수 있습니다. 추가 자격 증명이 필요 없습니다!

음성을 사용하는 세 가지 방법

모드 가장 적합한 용도 플랫폼
인터랙티브 마이크 루프 개인 핸즈프리 사용 CLI
채팅에서 음성 응답 메시징과 함께 음성 응답 Telegram, Discord
라이브 음성 채널 봇 그룹 대화 Discord 음성 채널

프로 팁: 먼저 텍스트 모드가 작동하는지 확인한 다음, 음성 응답을 추가하고, 마지막으로 전체 경험을 원한다면 Discord 음성 채널을 시도해 보세요.

1단계: 먼저 텍스트 작동 확인하기

음성에 뛰어들기 전에 기본 기능이 작동하는지 확인하세요:

hermes

그런 다음 간단한 질문을 해보세요:

사용할 수 있는 도구가 무엇인가요?

그것이 잘 작동한다면, 음성 모드를 시작할 준비가 된 것입니다!

2단계: 추가 패키지 설치하기

필요에 따라 올바른 패키지를 설치하세요:

# CLI 마이크 + 재생
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# 메시징 플랫폼 (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# 프리미엄 ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# 전체 설치
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

3단계: 시스템 종속성

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

이것들이 왜 중요한지 설명드리면:

  • portaudio → CLI 음성을 위한 마이크 입력
  • ffmpeg → 오디오 변환
  • opus → Discord 음성 코덱
  • espeak-ng → NeuTTS용 음소 변환기

4단계: 공급자 선택하기

가장 쉬운 설정: 로컬 STT와 무료 Edge TTS를 사용하세요. ~/.hermes/.env에 다음을 추가하세요:

# 클라우드 STT 옵션 (로컬은 키가 필요 없음)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# 프리미엄 TTS (선택 사항)
ELEVENLABS_API_KEY=***

STT 옵션:

  • local – 개인정보 보호에 최적, 비용 없음
  • groq – 초고속 클라우드 전사
  • openai – 좋은 유료 대안

TTS 옵션:

  • edge – 무료이며 대부분의 경우 충분히 좋음
  • neutts – 무료 로컬/온디바이스
  • elevenlabs – 최고 품질
  • openai – 좋은 중간 지점
  • mistral – 다국어 지원, 네이티브 Opus

5단계: 권장 설정

대부분의 사용자에게 적합한 기본 설정입니다:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

submit_mode에 대한 참고 사항:

  • direct (기본값) – 전사 결과를 즉시 제출
  • draft – 전사 결과를 작성기에 넣어 보내기 전에 편집 가능

편집 가능한 초안을 원하면 submit_mode: "draft"로 설정하세요.

CLI에서 음성 모드 사용하기

Hermes를 시작하고 음성 모드를 켜세요:

hermes

그런 다음 입력하세요:

/voice on

녹음 흐름:

  1. Ctrl+B 누르기
  2. 말하기
  3. 무음 감지가 자동으로 멈출 때까지 기다리기
  4. Hermes가 전사하고 응답
  5. TTS가 켜져 있으면 답변을 음성으로 출력
  6. 연속 사용을 위해 루프가 다시 시작

유용한 명령어:

/voice
/voice on
/voice off
/voice tts
/voice status

훌륭한 음성 워크플로우

걸어 다니며 디버깅: *“도커 권한 오류가 계속 발생합니다. 디버깅을 도와주세요.”*라고 말해보세요. 그런 다음 핸즈프리로 계속하세요: “마지막 오류를 다시 읽어주세요”, “근본 원인을 더 쉽게 설명해주세요”, “이제 정확한 해결책을 알려주세요”.

리서치/브레인스토밍: 돌아다니면서 반쯤 떠오른 아이디어를 받아 적고, Hermes가 실시간으로 생각을 정리해 주도록 요청하기에 완벽합니다.

접근성: 타이핑이 불편한 경우, 음성 모드를 통해 Hermes의 모든 기능을 계속 사용할 수 있습니다.

동작 조정하기

Hermes가 너무 민감하게 시작/중지된다면, 설정 파일에서 무음 감지 설정을 조정하세요:

voice:
  silence_threshold: 200
  silence_duration: 3.0

더 민감한 감지를 원하면 임계값을 낮추고, 말을 자르는 경우에는 높이세요.


이것으로 끝입니다! 음성 모드는 한번 실행하면 마법처럼 느껴지는 기능 중 하나입니다. 간단하게 시작해서 익숙해지면, 곧 설거지를 하면서 Hermes와 대화를 나누게 될 것입니다. 즐거운 대화 되세요! 🎤

📖 공식 문서

この記事は Hermes Agent の공식 문서に基づいています:공식 문서 › guides/use-voice-mode-with-hermes