튜토리얼 27: 음성 모드
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
튜토리얼 27: 음성 모드
돌아오신 것을 환영합니다, 여러분! 오늘은 Hermes를 사용하는 가장 멋진 방법 중 하나인 **음성 모드(Voice Mode)**에 대해 이야기해 보겠습니다. 돌아다니면서, 저녁을 요리하면서, 또는 그냥 키보드를 피하고 싶을 때 AI 어시스턴트와 대화하고 싶었던 적이 있다면, 이 튜토리얼이 바로 여러분을 위한 것입니다.
음성 모드란 무엇인가?
음성 모드는 타이핑 대신 Hermes와 대화할 수 있게 해줍니다. 다음과 같은 상황에 완벽합니다:
- 핸즈프리 CLI 워크플로우 – 키보드를 건드리지 않고 코딩과 리서치
- Telegram 또는 Discord에서 음성 응답 – 일반 메시지와 함께 음성 답변 받기
- 라이브 Discord 음성 채널 – 음성 채팅에서 Hermes와 실제 대화 나누기
- 빠른 아이디어 캡처 – 걷거나 브레인스토밍하면서 생각을 받아 적기
가장 좋은 점? Nous Portal을 사용하면 하나의 OAuth 로그인으로 LLM과 텍스트 음성 변환(TTS)을 모두 사용할 수 있습니다. 추가 자격 증명이 필요 없습니다!
음성을 사용하는 세 가지 방법
| 모드 | 가장 적합한 용도 | 플랫폼 |
|---|---|---|
| 인터랙티브 마이크 루프 | 개인 핸즈프리 사용 | CLI |
| 채팅에서 음성 응답 | 메시징과 함께 음성 응답 | Telegram, Discord |
| 라이브 음성 채널 봇 | 그룹 대화 | Discord 음성 채널 |
프로 팁: 먼저 텍스트 모드가 작동하는지 확인한 다음, 음성 응답을 추가하고, 마지막으로 전체 경험을 원한다면 Discord 음성 채널을 시도해 보세요.
1단계: 먼저 텍스트 작동 확인하기
음성에 뛰어들기 전에 기본 기능이 작동하는지 확인하세요:
hermes
그런 다음 간단한 질문을 해보세요:
사용할 수 있는 도구가 무엇인가요?
그것이 잘 작동한다면, 음성 모드를 시작할 준비가 된 것입니다!
2단계: 추가 패키지 설치하기
필요에 따라 올바른 패키지를 설치하세요:
# CLI 마이크 + 재생
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# 메시징 플랫폼 (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# 프리미엄 ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# 전체 설치
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
3단계: 시스템 종속성
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
이것들이 왜 중요한지 설명드리면:
portaudio→ CLI 음성을 위한 마이크 입력ffmpeg→ 오디오 변환opus→ Discord 음성 코덱espeak-ng→ NeuTTS용 음소 변환기
4단계: 공급자 선택하기
가장 쉬운 설정: 로컬 STT와 무료 Edge TTS를 사용하세요. ~/.hermes/.env에 다음을 추가하세요:
# 클라우드 STT 옵션 (로컬은 키가 필요 없음)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# 프리미엄 TTS (선택 사항)
ELEVENLABS_API_KEY=***
STT 옵션:
local– 개인정보 보호에 최적, 비용 없음groq– 초고속 클라우드 전사openai– 좋은 유료 대안
TTS 옵션:
edge– 무료이며 대부분의 경우 충분히 좋음neutts– 무료 로컬/온디바이스elevenlabs– 최고 품질openai– 좋은 중간 지점mistral– 다국어 지원, 네이티브 Opus
5단계: 권장 설정
대부분의 사용자에게 적합한 기본 설정입니다:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
submit_mode에 대한 참고 사항:
direct(기본값) – 전사 결과를 즉시 제출draft– 전사 결과를 작성기에 넣어 보내기 전에 편집 가능
편집 가능한 초안을 원하면 submit_mode: "draft"로 설정하세요.
CLI에서 음성 모드 사용하기
Hermes를 시작하고 음성 모드를 켜세요:
hermes
그런 다음 입력하세요:
/voice on
녹음 흐름:
Ctrl+B누르기- 말하기
- 무음 감지가 자동으로 멈출 때까지 기다리기
- Hermes가 전사하고 응답
- TTS가 켜져 있으면 답변을 음성으로 출력
- 연속 사용을 위해 루프가 다시 시작
유용한 명령어:
/voice
/voice on
/voice off
/voice tts
/voice status
훌륭한 음성 워크플로우
걸어 다니며 디버깅: *“도커 권한 오류가 계속 발생합니다. 디버깅을 도와주세요.”*라고 말해보세요. 그런 다음 핸즈프리로 계속하세요: “마지막 오류를 다시 읽어주세요”, “근본 원인을 더 쉽게 설명해주세요”, “이제 정확한 해결책을 알려주세요”.
리서치/브레인스토밍: 돌아다니면서 반쯤 떠오른 아이디어를 받아 적고, Hermes가 실시간으로 생각을 정리해 주도록 요청하기에 완벽합니다.
접근성: 타이핑이 불편한 경우, 음성 모드를 통해 Hermes의 모든 기능을 계속 사용할 수 있습니다.
동작 조정하기
Hermes가 너무 민감하게 시작/중지된다면, 설정 파일에서 무음 감지 설정을 조정하세요:
voice:
silence_threshold: 200
silence_duration: 3.0
더 민감한 감지를 원하면 임계값을 낮추고, 말을 자르는 경우에는 높이세요.
이것으로 끝입니다! 음성 모드는 한번 실행하면 마법처럼 느껴지는 기능 중 하나입니다. 간단하게 시작해서 익숙해지면, 곧 설거지를 하면서 Hermes와 대화를 나누게 될 것입니다. 즐거운 대화 되세요! 🎤
📖 공식 문서
この記事は Hermes Agent の공식 문서に基づいています:공식 문서 › guides/use-voice-mode-with-hermes