Trò chuyện với AI bằng Chế độ Giọng nói
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
Trò chuyện với AI bằng Chế độ Giọng nói
Chế độ giọng nói là một trong những tính năng khiến bạn cảm thấy như có phép màu ngay lần đầu thử. Thay vì gõ từng lệnh và đọc từng phản hồi, bạn chỉ cần… nói. Hermes lắng nghe, suy nghĩ và đáp lại bằng giọng nói. Hướng dẫn này sẽ đưa bạn qua mọi thứ cần thiết để chạy chế độ giọng nói, từ thiết lập micro đơn giản đến một bot kênh thoại Discord đầy đủ.
Chế độ giọng nói hữu ích cho việc gì
Chế độ giọng nói tỏa sáng khi tay bạn đang bận hoặc bạn chỉ muốn một cách tương tác tự nhiên hơn với AI. Dưới đây là các trường hợp sử dụng phổ biến nhất:
- Quy trình CLI rảnh tay — tiếp tục code hoặc nghiên cứu trong khi bạn nói chuyện với Hermes
- Phản hồi bằng giọng nói trong Telegram hoặc Discord — nhận câu trả lời thoại cùng với tin nhắn văn bản thông thường
- Kênh thoại Discord trực tiếp — để Hermes tham gia kênh thoại để trò chuyện thời gian thực
- Ghi lại ý tưởng nhanh — đọc to suy nghĩ khi đi dạo thay vì gõ phím
Ba cách sử dụng chế độ giọng nói
Hermes cung cấp ba trải nghiệm giọng nói khác biệt. Chọn cái phù hợp với nhu cầu của bạn:
| Chế độ | Tốt nhất cho | Nền tảng |
|---|---|---|
| Vòng lặp micro tương tác | Sử dụng cá nhân rảnh tay khi code | CLI |
| Phản hồi thoại trong chat | Câu trả lời bằng giọng nói với nhắn tin thông thường | Telegram, Discord |
| Bot kênh thoại trực tiếp | Trò chuyện trực tiếp nhóm hoặc cá nhân | Kênh thoại Discord |
Một lộ trình tốt là bắt đầu đơn giản: làm cho văn bản hoạt động trước, sau đó bật phản hồi thoại, và cuối cùng chuyển sang kênh thoại Discord nếu bạn muốn trải nghiệm đầy đủ.
Bước 1: Đảm bảo chế độ văn bản hoạt động trước
Trước khi đụng đến chế độ giọng nói, hãy xác minh rằng Hermes khởi động được và nhà cung cấp của bạn đã được cấu hình. Chạy hermes và hỏi điều gì đó đơn giản như:
What tools do you have available?
Nếu điều đó chưa ổn định, hãy sửa chế độ văn bản trước. Chế độ giọng nói được xây dựng dựa trên nó.
Bước 2: Cài đặt các gói bổ sung phù hợp
Tùy thuộc vào trải nghiệm giọng nói bạn muốn, hãy cài đặt các gói bổ sung tương ứng:
Micro CLI + phát lại:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
Nền tảng nhắn tin (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS cao cấp (tùy chọn):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS cục bộ (tùy chọn):
python -m pip install -U neutts[all]
Tất cả:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Bước 3: Cài đặt các phụ thuộc hệ thống
Chế độ giọng nói cần một vài gói hệ thống để xử lý đầu vào âm thanh, chuyển đổi và phát lại.
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Đây là lý do tại sao mỗi gói đều quan trọng:
portaudio→ đầu vào micro và phát lại cho chế độ giọng nói CLIffmpeg→ chuyển đổi âm thanh cho TTS và gửi tin nhắnopus→ hỗ trợ codec thoại Discordespeak-ng→ backend phonemizer cho NeuTTS
Bước 4: Chọn nhà cung cấp giọng nói của bạn
Hermes hỗ trợ cả bộ xử lý giọng nói cục bộ và đám mây. Thiết lập dễ nhất và rẻ nhất sử dụng STT cục bộ và Edge TTS miễn phí:
- Nhà cung cấp STT:
local - Nhà cung cấp TTS:
edge
Thêm bất kỳ khóa đám mây nào vào ~/.hermes/.env:
# Tùy chọn STT đám mây (local không cần khóa)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS cao cấp (tùy chọn)
ELEVENLABS_API_KEY=***
Khuyến nghị chuyển giọng nói thành văn bản:
local→ mặc định tốt nhất cho quyền riêng tư và chi phí bằng khônggroq→ phiên âm đám mây rất nhanhopenai→ lựa chọn trả phí tốt
Khuyến nghị chuyển văn bản thành giọng nói:
edge→ miễn phí và đủ tốt cho hầu hết người dùngneutts→ TTS cục bộ/trên thiết bị miễn phíelevenlabs→ chất lượng tốt nhấtopenai→ lựa chọn trung gian tốtmistral→ đa ngôn ngữ, Opus gốc
Bước 5: Cấu hình khuyến nghị
Đây là cấu hình mặc định an toàn và hợp lý cho hầu hết mọi người:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Cài đặt submit_mode kiểm soát điều gì xảy ra sau khi phiên âm:
direct(mặc định) gửi bản phiên âm ngay lập tứcdraftđặt bản phiên âm vào trình soạn thảo để bạn có thể chỉnh sửa trước khi gửi
Để có bản nháp thoại có thể chỉnh sửa, hãy đặt submit_mode: "draft".
Sử dụng chế độ giọng nói trong CLI
Khởi động Hermes và bật chế độ giọng nói:
hermes
Sau đó bên trong CLI:
/voice on
Quy trình ghi âm:
- Nhấn
Ctrl+B - Nói
- Chờ phát hiện im lặng để tự động dừng ghi âm
- Hermes phiên âm và phản hồi
- Nếu TTS được bật, nó sẽ đọc to câu trả lời
- Vòng lặp có thể tự động khởi động lại để sử dụng liên tục
Các lệnh hữu ích:
/voice
/voice on
/voice off
/voice tts
/voice status
Quy trình CLI tuyệt vời
Gỡ lỗi nhanh: Nói “Tôi cứ gặp lỗi docker permission. Giúp tôi gỡ lỗi.” Sau đó tiếp tục rảnh tay với các câu hỏi tiếp theo như “Đọc lại lỗi cuối cùng” hoặc “Bây giờ cho tôi cách sửa chính xác.”
Nghiên cứu và động não: Hoàn hảo để đi dạo trong khi suy nghĩ, đọc to những ý tưởng còn dang dở, và yêu cầu Hermes cấu trúc suy nghĩ của bạn theo thời gian thực.
Khả năng tiếp cận: Nếu việc gõ phím bất tiện, chế độ giọng nói là một trong những cách nhanh nhất để duy trì vòng lặp Hermes đầy đủ.
Điều chỉnh hành vi CLI
Nếu Hermes bắt đầu hoặc dừng ghi âm quá mạnh tay, hãy điều chỉnh cài đặt im lặng trong cấu hình của bạn:
voice:
silence_threshold: 200
silence_duration: 3.0
Giảm ngưỡng nếu nó dừng quá sớm, hoặc tăng lên nếu tiếng ồn nền khiến nó cứ ghi âm. Thời lượng kiểm soát khoảng dừng bao lâu để kích hoạt việc dừng.
Chế độ giọng nói thay đổi cuộc chơi một khi bạn thiết lập xong. Bắt đầu với vòng lặp CLI cơ bản, sau đó mở rộng sang các nền tảng nhắn tin và kênh thoại Discord khi bạn đã quen. Chúc bạn trò chuyện vui vẻ!
📖 Tài liệu chính thức
この記事は Hermes Agent のTài liệu chính thứcに基づいています:Tài liệu chính thức › guides/use-voice-mode-with-hermes