Урок 27: Голосовой режим
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Урок 27: Голосовой режим
С возвращением, друзья! Сегодня мы поговорим об одном из самых крутых способов использования Hermes: голосовом режиме. Если вы когда-нибудь хотели пообщаться со своим ИИ-ассистентом, прогуливаясь, готовя ужин или просто избегая клавиатуры, этот урок для вас.
Что такое голосовой режим?
Голосовой режим позволяет вам разговаривать с Hermes вместо того, чтобы печатать. Он идеально подходит для:
- Рабочих процессов CLI без использования рук — код и исследования без касания клавиатуры
- Голосовых ответов в Telegram или Discord — получайте голосовые ответы вместе с обычными сообщениями
- Живых голосовых каналов Discord — ведите настоящий разговор с Hermes в голосовом чате
- Быстрого захвата идей — диктуйте мысли на ходу или во время мозгового штурма
Самое лучшее? Если вы используете Nous Portal, вы получаете и LLM, и синтез речи через один OAuth-вход. Никаких дополнительных учетных данных не нужно!
Три способа использования голоса
| Режим | Для чего лучше всего | Платформа |
|---|---|---|
| Интерактивный цикл микрофона | Личное использование без рук | CLI |
| Голосовые ответы в чате | Голосовые ответы с обменом сообщениями | Telegram, Discord |
| Живой бот в голосовом канале | Групповые разговоры | Голосовые каналы Discord |
Совет профи: Сначала настройте текстовый режим, затем добавьте голосовые ответы, и, наконец, попробуйте голосовые каналы Discord, если хотите получить полный опыт.
Шаг 1: Сначала настройте текст
Прежде чем погружаться в голос, убедитесь, что основы работают:
hermes
Затем задайте что-нибудь простое:
Какие инструменты у тебя есть?
Если всё работает — вы готовы к голосу!
Шаг 2: Установите дополнительные пакеты
В зависимости от того, что вам нужно, установите соответствующие пакеты:
# Микрофон CLI + воспроизведение
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Платформы обмена сообщениями (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# Премиальный TTS от ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Всё сразу
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Шаг 3: Системные зависимости
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Вот зачем они нужны:
portaudio→ ввод с микрофона для голоса в CLIffmpeg→ преобразование аудиоopus→ кодек для голосовых каналов Discordespeak-ng→ фонемайзер для NeuTTS
Шаг 4: Выберите своих провайдеров
Самый простой вариант: Используйте локальный STT и бесплатный Edge TTS. Добавьте это в ~/.hermes/.env:
# Облачные STT-опции (для локального ключ не нужен)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Премиальный TTS (необязательно)
ELEVENLABS_API_KEY=***
Варианты STT:
local— лучше всего для конфиденциальности, нулевая стоимостьgroq— сверхбыстрая облачная транскрипцияopenai— хороший платный запасной вариант
Варианты TTS:
edge— бесплатно и достаточно хорошо для большинства случаевneutts— бесплатный локальный/на устройствеelevenlabs— лучшее качествоopenai— хорошая золотая серединаmistral— многоязычный, нативный Opus
Шаг 5: Рекомендуемая конфигурация
Вот хороший стандартный вариант для большинства людей:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Примечание о submit_mode:
direct(по умолчанию) — отправляет транскрипт немедленноdraft— помещает транскрипт в редактор, чтобы вы могли отредактировать его перед отправкой
Для редактируемых черновиков установите submit_mode: "draft".
Использование голоса в CLI
Запустите Hermes и включите голос:
hermes
Затем введите:
/voice on
Процесс записи:
- Нажмите
Ctrl+B - Говорите
- Дождитесь автоматической остановки по обнаружению тишины
- Hermes транскрибирует и отвечает
- Если TTS включен, он озвучивает ответ
- Цикл повторяется для непрерывного использования
Полезные команды:
/voice
/voice on
/voice off
/voice tts
/voice status
Отличные голосовые рабочие процессы
Отладка на ходу: Скажите «У меня постоянно ошибка прав доступа к docker. Помоги мне её отладить». Затем продолжайте без рук: «Прочитай последнюю ошибку ещё раз», «Объясни первопричину проще», «Теперь дай мне точное исправление».
Исследования/мозговой штурм: Идеально для прогулок, диктовки полуоформленных идей и просьб к Hermes структурировать ваши мысли в реальном времени.
Доступность: Если печатать неудобно, голосовой режим позволяет вам оставаться в полном цикле Hermes.
Настройка поведения
Если Hermes начинает/останавливается слишком агрессивно, отрегулируйте настройки тишины в вашей конфигурации:
voice:
silence_threshold: 200
silence_duration: 3.0
Уменьшите порог для более чувствительного обнаружения или увеличьте его, если запись обрывается.
Вот и всё! Голосовой режим — это одна из тех функций, которая ощущается как магия, когда вы её запускаете. Начните с простого, освоитесь, и вскоре вы будете вести полноценные разговоры с Hermes, пока моете посуду. Приятного общения! 🎤
📖 Официальная документация
Эта статья основана на официальной документации Hermes Agent :Официальные документы › guides/use-voice-mode-with-hermes