🤖HermesBlog
Hermes Version History · Часть 28/9/2026

Hermes v2026.8.3 Обновление: Голос в реальном времени, Общение агентов и Проверяемые цитаты

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 Обновление: Голос в реальном времени, Общение агентов и Проверяемые цитаты

Всем привет, с возвращением в блог Hermes! Сегодня мы погружаемся в одно из самых захватывающих обновлений: режим голоса в реальном времени. Если вы когда-нибудь хотели разговаривать со своим агентом, а не вводить каждую команду вручную, это обновление для вас. И самое лучшее? Настроить его гораздо проще, чем вы думаете.

Давайте пройдёмся по всему, что нужно знать, чтобы запустить голосовой режим уже сегодня.

Чем голосовой режим на самом деле полезен

Голосовой режим — это не просто фишка, он действительно полезен в куче сценариев:

  • Работа с CLI без рук, пока вы кодите или исследуете
  • Голосовые ответы прямо в Telegram или Discord
  • Живой разговор с Hermes в голосовом канале Discord
  • Быстрый захват идей на ходу, вместо того чтобы останавливаться и печатать

Думайте об этом так: ваш агент становится собеседником, а не просто текстовым полем.

Три способа использования голоса

В Hermes есть три различных голосовых режима, и вы можете выбрать тот, который подходит вашему стилю:

Режим Для чего лучше Платформа
Интерактивный цикл микрофона Личное использование без рук CLI
Голосовые ответы в чате Голосовые ответы вместе с сообщениями Telegram, Discord
Бот в голосовом канале Групповой или личный живой разговор Голосовые каналы Discord

Разумный путь: сначала настройте текст, затем включите голосовые ответы и, наконец, попробуйте голосовые каналы Discord, если хотите полный опыт.

Шаг 1: Сначала настройте текст

Прежде чем трогать голос, убедитесь, что база работает:

hermes

Затем задайте простой вопрос:

Какие инструменты у тебя есть?

Если это работает, вы готовы двигаться дальше.

Шаг 2: Установите нужные дополнения

В зависимости от того, что вам нужно, установите соответствующий пакет:

Микрофон + воспроизведение в CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Платформы обмена сообщениями:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

Премиальный TTS ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

Локальный NeuTTS (опционально):

python -m pip install -U neutts[all]

Всё сразу:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Шаг 3: Системные зависимости

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Вот зачем это нужно:

  • portaudio → ввод с микрофона и воспроизведение
  • ffmpeg → преобразование аудио
  • opus → поддержка голосового кодека Discord
  • espeak-ng → фонизатор для NeuTTS

Шаг 4: Выберите поставщиков речи

Hermes поддерживает как локальные, так и облачные речевые стеки. Самая простая и дешёвая настройка — локальный STT с бесплатным Edge TTS:

  • Поставщик STT: local
  • Поставщик TTS: edge

Добавьте любые API-ключи в ~/.hermes/.env:

# Облачные варианты STT (для local ключ не нужен)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Премиальный TTS (опционально)
ELEVENLABS_API_KEY=***

Быстрые рекомендации:

  • STT: local для приватности, groq для скорости, openai как платный запасной вариант
  • TTS: edge бесплатно, neutts локально, elevenlabs для лучшего качества

Шаг 5: Рекомендуемая конфигурация

Вот хороший консервативный дефолт:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Одна важная настройка: voice.submit_mode управляет тем, что происходит после транскрибации. direct отправляет сразу, а draft позволяет редактировать перед отправкой. Для редактируемых черновиков установите:

voice:
  submit_mode: "draft"

Использование голоса в CLI

Запустите Hermes и включите голос:

hermes

Затем внутри CLI:

/voice on

Процесс записи:

  1. Нажмите Ctrl+B
  2. Говорите
  3. Дождитесь автоматической остановки по детекции тишины
  4. Hermes транскрибирует и отвечает
  5. Если TTS включён, он озвучивает ответ

Полезные команды:

/voice
/voice on
/voice off
/voice tts
/voice status

Отличные сценарии работы в CLI

Отладка на ходу: Просто скажите «У меня постоянно ошибка прав доступа к docker. Помоги отладить». Затем продолжайте без рук: «Прочитай последнюю ошибку ещё раз», «Объясни первопричину проще», «Теперь дай точное исправление».

Исследования и мозговой штурм: Идеально для прогулок с размышлениями, диктовки полуоформленных идей и просьб к Hermes структурировать ваши мысли в реальном времени.

Доступность: Если печатать неудобно, голосовой режим позволяет оставаться в полном цикле Hermes без клавиатуры.

Настройка поведения

Если Hermes начинает или заканчивает запись слишком агрессивно, отрегулируйте значения silence_threshold и silence_duration в вашей конфигурации.

Вот и всё! Голосовой режим запущен и готов к использованию. Начните с текста, добавьте голосовые ответы и исследуйте голосовые каналы Discord, когда будете готовы. Приятного общения!

📖 Официальная документация

Эта статья основана на официальной документации Hermes Agent :GitHub ›/releases/tag/v2026.8.3