Buzz: используйте Hermes с AI-приложением для голосовых чатов
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: используйте Hermes с AI-приложением для голосовых чатов
Голосовой режим уже здесь, и он кардинально меняет то, как вы взаимодействуете с Hermes. Вместо того чтобы печатать каждую команду, вы можете просто разговаривать со своим агентом естественно — будь то написание кода, исследование или прогулка с роящимися в голове идеями.
Это руководство проведёт вас через всё, что нужно для запуска голосового режима: от простейшей настройки до полноценных разговоров в голосовых каналах Discord. Погнали.
Для чего хорош голосовой режим
Голосовой режим особенно полезен, когда вы хотите:
- Освободить руки во время работы в терминале
- Получать голосовые ответы в Telegram или Discord
- Держать Hermes в голосовом канале Discord для живого диалога
- Быстро фиксировать идеи на ходу, вместо того чтобы печатать
Считайте это вашим копилотом без рук. Отладка, мозговой штурм или просто быстрые вопросы — голосовой режим держит вас в потоке.
Три способа использовать голос
Hermes предлагает три различных голосовых режима:
| Режим | Для чего лучше всего | Платформа |
|---|---|---|
| Интерактивный цикл микрофона | Личное использование без рук во время кодинга | CLI |
| Голосовые ответы в чате | Разговорные ответы вместе с сообщениями | Telegram, Discord |
| Живой бот в голосовом канале | Групповые разговоры в голосовом канале | Голосовые каналы Discord |
Разумный путь: сначала настройте текстовый режим, затем включите голосовые ответы, и только потом переходите к голосовым каналам Discord, если хотите полный опыт.
Шаг 1: Сначала убедитесь, что текст работает
Прежде чем трогать голос, проверьте базу:
hermes
Затем задайте что-нибудь простое:
Какие инструменты у тебя есть?
Если это ещё не работает — сначала почините текстовый режим. Голос строится на рабочем фундаменте.
Шаг 2: Установите нужные дополнительные пакеты
В зависимости от вашей конфигурации установите то, что нужно:
Микрофон + воспроизведение в CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Мессенджеры (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
Премиальный ElevenLabs TTS (опционально):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
Локальный NeuTTS (опционально):
python -m pip install -U neutts[all]
Всё сразу:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Шаг 3: Установите системные зависимости
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Вот зачем нужен каждый компонент:
portaudio→ ввод с микрофона и воспроизведениеffmpeg→ конвертация аудио для TTS и мессенджеровopus→ поддержка голосового кодека Discordespeak-ng→ фонизатор для NeuTTS
Шаг 4: Выберите провайдеров речи
Hermes поддерживает как локальные, так и облачные речевые стеки. Для самого простого старта используйте локальный STT с бесплатным Edge TTS.
Добавьте это в ~/.hermes/.env:
# Облачные STT-опции (для локального ключ не нужен)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Премиальный TTS (опционально)
ELEVENLABS_API_KEY=***
Рекомендации по распознаванию речи:
local→ лучший выбор по умолчанию для приватности и нулевой стоимостиgroq→ очень быстрая облачная транскрипцияopenai→ хорошая платная запасная опция
Рекомендации по синтезу речи:
edge→ бесплатно и достаточно хорошо для большинства задачneutts→ бесплатный локальный/встроенный TTSelevenlabs→ лучшее качествоopenai→ хорошая золотая серединаmistral→ мультиязычный, нативный Opus
Шаг 5: Рекомендуемая конфигурация
Вот надёжный консервативный дефолт:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
В TUI параметр submit_mode управляет тем, что происходит после транскрипции:
direct(по умолчанию) отправляет транскрипт сразуdraftпомещает его в редактор, чтобы вы могли отредактировать перед отправкой
Для редактируемых голосовых черновиков установите submit_mode: "draft".
Хотите локальный TTS? Переключитесь на:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
Пример использования: голосовой режим в CLI
Запустите Hermes и включите голос:
hermes
Затем внутри CLI:
/voice on
Процесс записи:
- Нажмите
Ctrl+B - Говорите
- Дождитесь автоматической остановки по тишине
- Hermes распознаёт речь и отвечает
- Если TTS включён — озвучивает ответ
- Цикл может автоматически перезапускаться для непрерывного использования
Полезные команды:
/voice
/voice on
/voice off
/voice tts
/voice status
Отличные сценарии работы в CLI:
Отладка на ходу: Скажите: «У меня постоянно ошибка прав доступа к docker. Помоги отладить». Затем продолжайте без рук: «Прочитай последнюю ошибку ещё раз», «Объясни первопричину проще», «Теперь дай точное исправление».
Исследования и мозговой штурм: Идеально для прогулок с размышлениями, диктовки полуоформленных идей и просьб к Hermes структурировать мысли в реальном времени.
Доступность: Если печатать неудобно, голосовой режим держит вас в полном цикле Hermes без клавиатуры.
Настройка поведения CLI
Если Hermes начинает или заканчивает запись слишком агрессивно, отрегулируйте эти параметры в конфиге:
voice:
silence_threshold: 200 # ниже = чувствительнее
silence_duration: 3.0 # секунд тишины перед остановкой
Начните с дефолтов, затем подстраивайте под своё окружение. В шумной комнате может понадобиться более высокий порог, в тихой — более низкий.
Голосовой режим — один из самых быстрых способов оставаться продуктивным с Hermes. Начните с простого, экспериментируйте с провайдерами — и вскоре вы будете разговаривать со своим агентом как с сами собой разумеющимся.
📖 Официальная документация
Эта статья основана на официальной документации Hermes Agent :Официальные документы › guides/use-voice-mode-with-hermes