음성 모드로 AI와 대화하기
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
음성 모드로 AI와 대화하기
음성 모드는 처음 사용해 보면 마치 마법처럼 느껴지는 기능 중 하나입니다. 모든 명령을 타이핑하고 모든 응답을 읽는 대신, 그냥… 말하면 됩니다. Hermes가 듣고, 생각하고, 다시 말로 응답합니다. 이 가이드는 간단한 마이크 설정부터 완전한 Discord 음성 채널 봇까지, 음성 모드를 실행하는 데 필요한 모든 것을 안내합니다.
음성 모드가 유용한 상황
음성 모드는 손이 바쁠 때나 AI와 더 자연스럽게 상호작용하고 싶을 때 빛을 발합니다. 가장 일반적인 사용 사례는 다음과 같습니다:
- 핸즈프리 CLI 워크플로우 — Hermes와 대화하면서 코딩이나 리서치를 계속하세요
- Telegram 또는 Discord에서 음성 응답 — 일반 텍스트 메시지와 함께 음성 답변을 받아보세요
- 라이브 Discord 음성 채널 — Hermes가 음성 채널에 참여해 실시간 대화를 나눠보세요
- 빠른 아이디어 캡처 — 타이핑 대신 걸어 다니면서 생각을 받아 적으세요
음성 모드를 사용하는 세 가지 방법
Hermes는 세 가지 서로 다른 음성 경험을 제공합니다. 필요에 맞는 것을 선택하세요:
| 모드 | 가장 적합한 상황 | 플랫폼 |
|---|---|---|
| 인터랙티브 마이크 루프 | 코딩 중 개인 핸즈프리 사용 | CLI |
| 채팅에서 음성 응답 | 일반 메시징과 함께 음성 응답 | Telegram, Discord |
| 라이브 음성 채널 봇 | 그룹 또는 개인 실시간 대화 | Discord 음성 채널 |
좋은 접근 방식은 간단하게 시작하는 것입니다: 먼저 텍스트를 작동시키고, 그다음 음성 응답을 활성화하고, 마지막으로 전체 경험을 원한다면 Discord 음성 채널로 넘어가는 것입니다.
1단계: 먼저 텍스트 모드가 작동하는지 확인하세요
음성 모드를 건드리기 전에 Hermes가 시작되고 공급자가 구성되어 있는지 확인하세요. hermes를 실행하고 다음과 같은 간단한 질문을 해보세요:
What tools do you have available?
아직 제대로 작동하지 않는다면 먼저 텍스트 모드를 고치세요. 음성 모드는 그 위에 구축됩니다.
2단계: 필요한 추가 기능 설치하기
원하는 음성 경험에 따라 해당 추가 기능을 설치하세요:
CLI 마이크 + 재생:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
메시징 플랫폼 (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
프리미엄 ElevenLabs TTS (선택 사항):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
로컬 NeuTTS (선택 사항):
python -m pip install -U neutts[all]
전체 설치:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
3단계: 시스템 종속성 설치하기
음성 모드는 오디오 입력, 변환, 재생을 처리하기 위해 몇 가지 시스템 패키지가 필요합니다.
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
각각이 왜 필요한지 설명하면:
portaudio→ CLI 음성 모드의 마이크 입력 및 재생ffmpeg→ TTS 및 메시징 전송을 위한 오디오 변환opus→ Discord 음성 코덱 지원espeak-ng→ NeuTTS용 음소화(phonemizer) 백엔드
4단계: 음성 공급자 선택하기
Hermes는 로컬 및 클라우드 음성 스택을 모두 지원합니다. 가장 쉽고 저렴한 설정은 로컬 STT와 무료 Edge TTS를 사용하는 것입니다:
- STT 공급자:
local - TTS 공급자:
edge
클라우드 키가 있으면 ~/.hermes/.env에 추가하세요:
# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium TTS (optional)
ELEVENLABS_API_KEY=***
음성-텍스트 변환(STT) 권장 사항:
local→ 프라이버시와 무료 사용에 가장 좋은 기본값groq→ 매우 빠른 클라우드 전사openai→ 좋은 유료 대안
텍스트-음성 변환(TTS) 권장 사항:
edge→ 무료이며 대부분의 사용자에게 충분히 좋은 품질neutts→ 무료 로컬/온디바이스 TTSelevenlabs→ 최고 품질openai→ 좋은 중간 옵션mistral→ 다국어 지원, 네이티브 Opus
5단계: 권장 설정
대부분의 사용자에게 적합한 안정적인 기본 설정입니다:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
submit_mode 설정은 전사 후 동작을 제어합니다:
direct(기본값)는 전사된 텍스트를 즉시 제출합니다draft는 전사된 텍스트를 작성기에 넣어 보내기 전에 편집할 수 있게 합니다
편집 가능한 음성 초안을 원한다면 submit_mode: "draft"로 설정하세요.
CLI에서 음성 모드 사용하기
Hermes를 시작하고 음성 모드를 켜세요:
hermes
그런 다음 CLI 내부에서:
/voice on
녹음 흐름:
Ctrl+B를 누르세요- 말하세요
- 무음 감지가 자동으로 녹음을 중지할 때까지 기다리세요
- Hermes가 전사하고 응답합니다
- TTS가 켜져 있으면 답변을 음성으로 읽어줍니다
- 연속 사용을 위해 루프가 자동으로 다시 시작될 수 있습니다
유용한 명령어:
/voice
/voice on
/voice off
/voice tts
/voice status
훌륭한 CLI 워크플로우
즉석 디버깅: “도커 권한 오류가 계속 나요. 디버깅을 도와주세요.“라고 말해보세요. 그런 다음 “마지막 오류 다시 읽어줘” 또는 “정확한 해결책을 알려줘” 같은 후속 질문으로 핸즈프리를 계속하세요.
리서치 및 브레인스토밍: 생각하면서 돌아다니고, 완성되지 않은 아이디어를 받아 적고, Hermes에게 실시간으로 생각을 정리해 달라고 요청하기에 완벽합니다.
접근성: 타이핑이 불편하다면 음성 모드는 전체 Hermes 루프를 유지하는 가장 빠른 방법 중 하나입니다.
CLI 동작 조정하기
Hermes가 녹음을 너무 공격적으로 시작하거나 중지한다면, 설정에서 무음 감지 값을 조정하세요:
voice:
silence_threshold: 200
silence_duration: 3.0
너무 일찍 중지된다면 임계값을 낮추고, 배경 소음 때문에 계속 녹음된다면 높이세요. duration은 중지를 트리거하는 일시정지 길이를 제어합니다.
음성 모드는 한번 설정해 두면 게임 체인저가 됩니다. 기본 CLI 루프로 시작하고, 익숙해지면 메시징 플랫폼과 Discord 음성 채널로 확장해 보세요. 즐거운 대화 되세요!
📖 공식 문서
この記事は Hermes Agent の공식 문서に基づいています:공식 문서 › guides/use-voice-mode-with-hermes