🤖HermesBlog
Hermes Feature Guides · Часть 68/9/2026

Общайтесь с ИИ с помощью голосового режима

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

Общайтесь с ИИ с помощью голосового режима

Голосовой режим — одна из тех функций, которые при первом использовании кажутся волшебством. Вместо того чтобы вводить каждую команду и читать каждый ответ, вы можете просто… говорить. Hermes слушает, думает и отвечает вслух. Это руководство проведёт вас через всё, что нужно для запуска голосового режима — от простой настройки микрофона до полноценного бота в голосовых каналах Discord.

Для чего хорош голосовой режим

Голосовой режим незаменим, когда ваши руки заняты или вы просто хотите более естественного взаимодействия с ИИ. Вот самые распространённые сценарии использования:

  • Работа в CLI без помощи рук — продолжайте писать код или исследовать, пока вы говорите с Hermes
  • Голосовые ответы в Telegram или Discord — получайте голосовые ответы вместе с обычными текстовыми сообщениями
  • Живой голосовой канал в Discord — пусть Hermes зайдёт в голосовой канал для разговора в реальном времени
  • Быстрый захват идей — диктуйте мысли на ходу вместо того, чтобы печатать

Три способа использования голосового режима

Hermes предлагает три различных голосовых опыта. Выберите тот, который подходит вашим задачам:

Режим Для чего лучше всего Платформа
Интерактивный цикл микрофона Личное использование без помощи рук во время кодинга CLI
Голосовые ответы в чате Голосовые ответы вместе с обычными сообщениями Telegram, Discord
Живой бот в голосовом канале Групповой или личный живой разговор Голосовые каналы Discord

Хороший путь — начать с простого: сначала настройте текст, затем включите голосовые ответы, и наконец переходите к голосовым каналам Discord, если хотите полный опыт.

Шаг 1: Убедитесь, что текстовый режим работает

Прежде чем трогать голосовой режим, проверьте, что Hermes запускается и ваш провайдер настроен. Запустите hermes и задайте что-нибудь простое, например:

What tools do you have available?

Если это ещё не работает — сначала исправьте текстовый режим. Голосовой режим строится на его основе.

Шаг 2: Установите нужные дополнительные пакеты

В зависимости от того, какой голосовой опыт вам нужен, установите соответствующие дополнительные пакеты:

Микрофон + воспроизведение в CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Мессенджеры (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

Премиальный ElevenLabs TTS (опционально):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

Локальный NeuTTS (опционально):

python -m pip install -U neutts[all]

Всё сразу:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Шаг 3: Установите системные зависимости

Для голосового режима нужны несколько системных пакетов для обработки аудиовхода, конвертации и воспроизведения.

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Вот зачем нужен каждый из них:

  • portaudio → ввод с микрофона и воспроизведение для голосового режима в CLI
  • ffmpeg → конвертация аудио для TTS и доставки сообщений
  • opus → поддержка голосового кодека Discord
  • espeak-ng → фонемизатор для NeuTTS

Шаг 4: Выберите речевых провайдеров

Hermes поддерживает как локальные, так и облачные речевые стеки. Самая простая и дешёвая настройка использует локальный STT и бесплатный Edge TTS:

  • Провайдер STT: local
  • Провайдер TTS: edge

Добавьте любые облачные ключи в ~/.hermes/.env:

# Облачные STT-варианты (для local ключ не нужен)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Премиальный TTS (опционально)
ELEVENLABS_API_KEY=***

Рекомендации по распознаванию речи:

  • local → лучший вариант по умолчанию для приватности и нулевой стоимости
  • groq → очень быстрая облачная транскрипция
  • openai → хороший платный запасной вариант

Рекомендации по синтезу речи:

  • edge → бесплатно и достаточно хорошо для большинства пользователей
  • neutts → бесплатный локальный TTS на устройстве
  • elevenlabs → лучшее качество
  • openai → хорошая золотая середина
  • mistral → мультиязычный, нативный Opus

Шаг 5: Рекомендуемая конфигурация

Вот надёжная консервативная настройка по умолчанию для большинства людей:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Настройка submit_mode управляет тем, что происходит после транскрипции:

  • direct (по умолчанию) отправляет транскрипт сразу
  • draft помещает транскрипт в редактор, чтобы вы могли отредактировать перед отправкой

Для редактируемых голосовых черновиков установите submit_mode: "draft".

Использование голосового режима в CLI

Запустите Hermes и включите голосовой режим:

hermes

Затем внутри CLI:

/voice on

Процесс записи:

  1. Нажмите Ctrl+B
  2. Говорите
  3. Дождитесь, пока детекция тишины автоматически остановит запись
  4. Hermes транскрибирует и отвечает
  5. Если TTS включён, он озвучит ответ
  6. Цикл может автоматически перезапускаться для непрерывного использования

Полезные команды:

/voice
/voice on
/voice off
/voice tts
/voice status

Отличные сценарии работы в CLI

Отладка на ходу: Скажите «У меня постоянно ошибка с правами docker. Помоги отладить». Затем продолжайте без помощи рук с уточнениями вроде «Прочитай последнюю ошибку ещё раз» или «Теперь дай точное исправление».

Исследования и мозговой штурм: Идеально для прогулок с размышлениями, диктовки полуоформленных идей и просьб к Hermes структурировать ваши мысли в реальном времени.

Доступность: Если печатать неудобно, голосовой режим — один из самых быстрых способов оставаться в полном цикле работы с Hermes.

Настройка поведения CLI

Если Hermes начинает или останавливает запись слишком агрессивно, отрегулируйте настройки тишины в конфиге:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Уменьшите порог, если запись останавливается слишком рано, или увеличьте, если фоновый шум не даёт ей остановиться. Длительность определяет, какая пауза запускает остановку.

Голосовой режим — это прорыв, когда вы его настроите. Начните с базового цикла в CLI, затем расширяйтесь до мессенджеров и голосовых каналов Discord по мере освоения. Приятного общения!

📖 Официальная документация

Эта статья основана на официальной документации Hermes Agent :Официальные документы › guides/use-voice-mode-with-hermes