🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Hermes v2026.8.3 Cập Nhật: Giọng Nói Thời Gian Thực, Giao Tiếp Giữa Agent & Trích Dẫn Kiểm Chứng

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 Cập Nhật: Giọng Nói Thời Gian Thực, Giao Tiếp Giữa Agent & Trích Dẫn Kiểm Chứng

Xin chào mọi người, chào mừng trở lại với blog Hermes! Hôm nay chúng ta sẽ khám phá một trong những bản cập nhật thú vị nhất từ trước đến nay: chế độ giọng nói thời gian thực. Nếu bạn từng muốn nói chuyện với agent của mình thay vì gõ từng lệnh, thì đây chính là bản cập nhật dành cho bạn. Và điều tuyệt nhất? Việc thiết lập dễ hơn bạn tưởng rất nhiều.

Hãy cùng đi qua mọi thứ bạn cần biết để kích hoạt chế độ giọng nói ngay hôm nay.

Chế Độ Giọng Nói Thực Sự Hữu Ích Cho Việc Gì

Chế độ giọng nói không chỉ là một tính năng cho vui — nó thực sự hữu ích trong nhiều tình huống:

  • Quy trình CLI rảnh tay trong lúc bạn đang code hoặc nghiên cứu
  • Phản hồi bằng giọng nói ngay trong Telegram hoặc Discord
  • Trò chuyện trực tiếp với Hermes trong kênh thoại Discord
  • Ghi lại ý tưởng nhanh khi đang đi dạo, thay vì dừng lại để gõ

Hãy nghĩ về điều này như agent của bạn trở thành một người bạn trò chuyện, không chỉ là một hộp văn bản.

Ba Cách Sử Dụng Giọng Nói

Có ba trải nghiệm giọng nói khác nhau trong Hermes, và bạn có thể chọn cách phù hợp với phong cách của mình:

Chế độ Phù hợp nhất cho Nền tảng
Vòng lặp microphone tương tác Sử dụng cá nhân rảnh tay CLI
Trả lời bằng giọng nói trong chat Phản hồi bằng giọng nói song song với nhắn tin Telegram, Discord
Bot kênh thoại trực tiếp Trò chuyện trực tiếp nhóm hoặc cá nhân Kênh thoại Discord

Một lộ trình thông minh: hãy làm cho văn bản hoạt động trước, sau đó bật trả lời bằng giọng nói, và cuối cùng thử kênh thoại Discord nếu bạn muốn trải nghiệm đầy đủ.

Bước 1: Làm Cho Văn Bản Hoạt Động Trước

Trước khi đụng đến giọng nói, hãy đảm bảo những thứ cơ bản hoạt động tốt:

hermes

Sau đó hỏi một câu đơn giản:

Bạn có những công cụ nào?

Nếu điều đó hoạt động, bạn đã sẵn sàng để tiếp tục.

Bước 2: Cài Đặt Các Gói Bổ Sung Phù Hợp

Tùy thuộc vào nhu cầu của bạn, hãy cài đặt gói phù hợp:

Microphone CLI + phát lại:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Nền tảng nhắn tin:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS ElevenLabs cao cấp:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS cục bộ (tùy chọn):

python -m pip install -U neutts[all]

Tất cả cùng lúc:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Bước 3: Các Phụ Thuộc Hệ Thống

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Đây là lý do chúng quan trọng:

  • portaudio → đầu vào microphone và phát lại
  • ffmpeg → chuyển đổi âm thanh
  • opus → hỗ trợ codec thoại Discord
  • espeak-ng → phonemizer cho NeuTTS

Bước 4: Chọn Nhà Cung Cấp Giọng Nói

Hermes hỗ trợ cả bộ xử lý giọng nói cục bộ và đám mây. Thiết lập dễ nhất và rẻ nhất là STT cục bộ với Edge TTS miễn phí:

  • Nhà cung cấp STT: local
  • Nhà cung cấp TTS: edge

Thêm bất kỳ API key nào vào ~/.hermes/.env:

# Tùy chọn STT đám mây (local không cần key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS cao cấp (tùy chọn)
ELEVENLABS_API_KEY=***

Gợi ý nhanh:

  • STT: local cho quyền riêng tư, groq cho tốc độ, openai làm phương án dự phòng trả phí
  • TTS: edge miễn phí, neutts cho cục bộ, elevenlabs cho chất lượng tốt nhất

Bước 5: Cấu Hình Được Đề Xuất

Đây là một cấu hình mặc định an toàn và hợp lý:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Một cài đặt quan trọng: voice.submit_mode kiểm soát những gì xảy ra sau khi phiên âm. direct gửi ngay lập tức, trong khi draft cho phép bạn chỉnh sửa trước khi gửi. Để có bản nháp có thể chỉnh sửa, hãy đặt:

voice:
  submit_mode: "draft"

Sử Dụng Giọng Nói Trong CLI

Khởi động Hermes và bật giọng nói:

hermes

Sau đó bên trong CLI:

/voice on

Quy trình ghi âm:

  1. Nhấn Ctrl+B
  2. Nói
  3. Chờ phát hiện im lặng tự động dừng
  4. Hermes phiên âm và phản hồi
  5. Nếu TTS được bật, nó sẽ đọc câu trả lời

Các lệnh hữu ích:

/voice
/voice on
/voice off
/voice tts
/voice status

Quy Trình CLI Tuyệt Vời

Gỡ lỗi nhanh: Chỉ cần nói “Tôi cứ bị lỗi quyền docker. Giúp tôi gỡ lỗi.” Sau đó tiếp tục rảnh tay: “Đọc lại lỗi cuối cùng,” “Giải thích nguyên nhân gốc rễ đơn giản hơn,” “Bây giờ đưa tôi cách sửa chính xác.”

Nghiên cứu và động não: Hoàn hảo để vừa đi dạo vừa suy nghĩ, đọc to những ý tưởng còn dang dở, và yêu cầu Hermes cấu trúc suy nghĩ của bạn theo thời gian thực.

Khả năng tiếp cận: Nếu việc gõ bất tiện, chế độ giọng nói giúp bạn duy trì toàn bộ vòng lặp Hermes mà không cần bàn phím.

Điều Chỉnh Hành Vi

Nếu Hermes bắt đầu hoặc dừng ghi âm quá mạnh tay, hãy điều chỉnh các giá trị silence_thresholdsilence_duration trong cấu hình của bạn.

Vậy là xong! Chế độ giọng nói đã hoạt động và sẵn sàng để sử dụng. Bắt đầu với văn bản, thêm trả lời bằng giọng nói, và khám phá kênh thoại Discord khi bạn đã sẵn sàng. Chúc bạn trò chuyện vui vẻ!

📖 Tài liệu chính thức

この記事は Hermes Agent のTài liệu chính thứcに基づいています:GitHub ›/releases/tag/v2026.8.3