Buzz AI 음성 채팅 — Hermes 에이전트 연동 가이드
Buzz AI 음성 채팅 앱에 Hermes 에이전트를 연결하는 방법 — 음성 모드 설치, STT/TTS 선택, 권장 설정까지 한 번에 정리했습니다.
Buzz: Hermes와 함께하는 AI 음성 채팅 앱 사용법
음성 모드가 드디어 출시됐습니다. Hermes와 상호작용하는 방식에 완전히 새로운 장을 여는 기능이죠. 이제 모든 명령을 타이핑하는 대신, 코딩을 하든 리서치를 하든 머릿속에 아이디어가 떠오르며 돌아다닐 때도 에이전트와 자연스럽게 대화할 수 있습니다.
이 가이드에서는 가장 간단한 설정부터 Discord 음성 채널에서의 전체 대화까지, 음성 기능을 사용하는 데 필요한 모든 것을 안내합니다. 시작해 볼까요?
음성 모드가 특히 유용한 상황
음성 모드는 다음과 같은 상황에서 빛을 발합니다:
- 터미널에서 작업하는 동안 손을 자유롭게 쓰고 싶을 때
- Telegram이나 Discord에서 음성 응답을 받고 싶을 때
- Hermes를 Discord 음성 채널에 배치해서 실시간 대화를 나누고 싶을 때
- 걸어 다니면서 타이핑 대신 아이디어를 빠르게 기록하고 싶을 때
손이 자유로운 코파일럿이라고 생각하면 됩니다. 디버깅, 브레인스토밍, 혹은 간단한 질문까지 — 음성 모드는 작업 흐름을 끊지 않게 해줍니다.
음성 사용의 세 가지 방법
Hermes는 세 가지 서로 다른 음성 경험을 제공합니다:
| 모드 | 가장 적합한 상황 | 플랫폼 |
|---|---|---|
| 인터랙티브 마이크 루프 | 코딩 중 개인적인 핸즈프리 사용 | CLI |
| 채팅에서 음성 답변 | 메시징과 함께 음성 응답 | Telegram, Discord |
| 라이브 음성 채널 봇 | 음성 채널에서 그룹 대화 | Discord 음성 채널 |
현명한 접근 방법은 다음과 같습니다: 먼저 텍스트를 작동시키고, 그다음 음성 답변을 활성화한 뒤, 전체 경험을 원한다면 마지막으로 Discord 음성 채널로 넘어가는 것입니다.
1단계: 먼저 텍스트가 작동하는지 확인하기
음성 기능을 건드리기 전에 기본 사항을 확인하세요:
hermes
그런 다음 간단한 질문을 해보세요:
사용할 수 있는 도구가 무엇인가요?
아직 제대로 작동하지 않는다면 먼저 텍스트 모드를 고치세요. 음성은 작동하는 기반 위에 구축되는 기능입니다.
2단계: 필요한 추가 패키지 설치하기
환경에 따라 필요한 패키지를 설치하세요:
CLI 마이크 + 재생:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
메시징 플랫폼 (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
프리미엄 ElevenLabs TTS (선택 사항):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
로컬 NeuTTS (선택 사항):
python -m pip install -U neutts[all]
한 번에 모두 설치:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
3단계: 시스템 종속성 설치하기
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
각각이 왜 필요한지 설명하면:
portaudio→ 마이크 입력 및 재생ffmpeg→ TTS 및 메시징용 오디오 변환opus→ Discord 음성 코덱 지원espeak-ng→ NeuTTS용 음소 변환기
4단계: 음성 공급자 선택하기
Hermes는 로컬 및 클라우드 음성 스택을 모두 지원합니다. 가장 쉽게 시작하려면 무료 Edge TTS와 함께 로컬 STT를 사용하세요.
~/.hermes/.env에 다음을 추가하세요:
# 클라우드 STT 옵션 (로컬은 키 불필요)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# 프리미엄 TTS (선택 사항)
ELEVENLABS_API_KEY=***
음성-텍스트(STT) 권장 사항:
local→ 개인정보 보호와 비용 측면에서 가장 좋은 기본값groq→ 매우 빠른 클라우드 전사openai→ 유료이지만 좋은 대안
텍스트-음성(TTS) 권장 사항:
edge→ 무료이며 대부분의 경우 충분히 좋음neutts→ 무료 로컬/온디바이스 TTSelevenlabs→ 최고 품질openai→ 좋은 중간 옵션mistral→ 다국어 지원, 네이티브 Opus
5단계: 권장 설정
다음은 안정적인 기본 설정입니다:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
TUI에서 submit_mode는 전사 후 동작을 제어합니다:
direct(기본값) 전사된 텍스트를 즉시 제출draft전송 전에 편집할 수 있도록 작성기에 넣음
편집 가능한 음성 초안을 원한다면 submit_mode: "draft"로 설정하세요.
로컬 TTS를 원한다면 다음으로 전환하세요:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
사용 사례: CLI 음성 모드
Hermes를 시작하고 음성을 켜세요:
hermes
그런 다음 CLI 내부에서:
/voice on
녹음 흐름:
Ctrl+B누르기- 말하기
- 무음 감지가 자동으로 멈출 때까지 기다리기
- Hermes가 전사하고 응답
- TTS가 켜져 있으면 답변을 음성으로 읽어줌
- 연속 사용을 위해 루프가 자동으로 재시작될 수 있음
유용한 명령어:
/voice
/voice on
/voice off
/voice tts
/voice status
훌륭한 CLI 워크플로우:
즉석 디버깅: “도커 권한 오류가 계속 뜨는데 디버깅을 도와줘”라고 말해보세요. 그런 다음 핸즈프리로 계속하세요: “마지막 오류 다시 읽어줘,” “근본 원인을 더 쉽게 설명해줘,” “이제 정확한 해결책을 알려줘.”
리서치 및 브레인스토밍: 생각하면서 돌아다니고, 완성되지 않은 아이디어를 받아쓰고, Hermes가 실시간으로 생각을 정리해 주는 데 완벽합니다.
접근성: 타이핑이 불편하다면 음성 모드를 통해 키보드 없이도 Hermes의 모든 기능을 사용할 수 있습니다.
CLI 동작 조정하기
Hermes가 녹음을 너무 공격적으로 시작하거나 멈춘다면 설정에서 다음 값을 조정하세요:
voice:
silence_threshold: 200 # 낮을수록 더 민감
silence_duration: 3.0 # 멈추기 전 무음 시간(초)
기본값으로 시작한 다음 환경에 맞게 조정하세요. 시끄러운 방에서는 임계값을 높여야 할 수 있고, 조용한 방에서는 낮추는 것이 좋을 수 있습니다.
음성 모드는 Hermes로 생산성을 유지하는 가장 빠른 방법 중 하나입니다. 간단하게 시작하고, 공급자를 실험해 보고, 곧 에이전트와 대화하는 것이 자연스러워질 것입니다.
📖 공식 문서
この記事は Hermes Agent の공식 문서に基づいています:공식 문서 › guides/use-voice-mode-with-hermes