🤖HermesBlog
Hermes Official Tutorials · Часть 278/9/2026

Урок 27: Голосовой режим

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Урок 27: Голосовой режим

С возвращением, друзья! Сегодня мы поговорим об одном из самых крутых способов использования Hermes: голосовом режиме. Если вы когда-нибудь хотели пообщаться со своим ИИ-ассистентом, прогуливаясь, готовя ужин или просто избегая клавиатуры, этот урок для вас.

Что такое голосовой режим?

Голосовой режим позволяет вам разговаривать с Hermes вместо того, чтобы печатать. Он идеально подходит для:

  • Рабочих процессов CLI без использования рук — код и исследования без касания клавиатуры
  • Голосовых ответов в Telegram или Discord — получайте голосовые ответы вместе с обычными сообщениями
  • Живых голосовых каналов Discord — ведите настоящий разговор с Hermes в голосовом чате
  • Быстрого захвата идей — диктуйте мысли на ходу или во время мозгового штурма

Самое лучшее? Если вы используете Nous Portal, вы получаете и LLM, и синтез речи через один OAuth-вход. Никаких дополнительных учетных данных не нужно!

Три способа использования голоса

Режим Для чего лучше всего Платформа
Интерактивный цикл микрофона Личное использование без рук CLI
Голосовые ответы в чате Голосовые ответы с обменом сообщениями Telegram, Discord
Живой бот в голосовом канале Групповые разговоры Голосовые каналы Discord

Совет профи: Сначала настройте текстовый режим, затем добавьте голосовые ответы, и, наконец, попробуйте голосовые каналы Discord, если хотите получить полный опыт.

Шаг 1: Сначала настройте текст

Прежде чем погружаться в голос, убедитесь, что основы работают:

hermes

Затем задайте что-нибудь простое:

Какие инструменты у тебя есть?

Если всё работает — вы готовы к голосу!

Шаг 2: Установите дополнительные пакеты

В зависимости от того, что вам нужно, установите соответствующие пакеты:

# Микрофон CLI + воспроизведение
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Платформы обмена сообщениями (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# Премиальный TTS от ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Всё сразу
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Шаг 3: Системные зависимости

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Вот зачем они нужны:

  • portaudio → ввод с микрофона для голоса в CLI
  • ffmpeg → преобразование аудио
  • opus → кодек для голосовых каналов Discord
  • espeak-ng → фонемайзер для NeuTTS

Шаг 4: Выберите своих провайдеров

Самый простой вариант: Используйте локальный STT и бесплатный Edge TTS. Добавьте это в ~/.hermes/.env:

# Облачные STT-опции (для локального ключ не нужен)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Премиальный TTS (необязательно)
ELEVENLABS_API_KEY=***

Варианты STT:

  • local — лучше всего для конфиденциальности, нулевая стоимость
  • groq — сверхбыстрая облачная транскрипция
  • openai — хороший платный запасной вариант

Варианты TTS:

  • edge — бесплатно и достаточно хорошо для большинства случаев
  • neutts — бесплатный локальный/на устройстве
  • elevenlabs — лучшее качество
  • openai — хорошая золотая середина
  • mistral — многоязычный, нативный Opus

Шаг 5: Рекомендуемая конфигурация

Вот хороший стандартный вариант для большинства людей:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Примечание о submit_mode:

  • direct (по умолчанию) — отправляет транскрипт немедленно
  • draft — помещает транскрипт в редактор, чтобы вы могли отредактировать его перед отправкой

Для редактируемых черновиков установите submit_mode: "draft".

Использование голоса в CLI

Запустите Hermes и включите голос:

hermes

Затем введите:

/voice on

Процесс записи:

  1. Нажмите Ctrl+B
  2. Говорите
  3. Дождитесь автоматической остановки по обнаружению тишины
  4. Hermes транскрибирует и отвечает
  5. Если TTS включен, он озвучивает ответ
  6. Цикл повторяется для непрерывного использования

Полезные команды:

/voice
/voice on
/voice off
/voice tts
/voice status

Отличные голосовые рабочие процессы

Отладка на ходу: Скажите «У меня постоянно ошибка прав доступа к docker. Помоги мне её отладить». Затем продолжайте без рук: «Прочитай последнюю ошибку ещё раз», «Объясни первопричину проще», «Теперь дай мне точное исправление».

Исследования/мозговой штурм: Идеально для прогулок, диктовки полуоформленных идей и просьб к Hermes структурировать ваши мысли в реальном времени.

Доступность: Если печатать неудобно, голосовой режим позволяет вам оставаться в полном цикле Hermes.

Настройка поведения

Если Hermes начинает/останавливается слишком агрессивно, отрегулируйте настройки тишины в вашей конфигурации:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Уменьшите порог для более чувствительного обнаружения или увеличьте его, если запись обрывается.


Вот и всё! Голосовой режим — это одна из тех функций, которая ощущается как магия, когда вы её запускаете. Начните с простого, освоитесь, и вскоре вы будете вести полноценные разговоры с Hermes, пока моете посуду. Приятного общения! 🎤

📖 Официальная документация

Эта статья основана на официальной документации Hermes Agent :Официальные документы › guides/use-voice-mode-with-hermes