Tutorial 27: Mode Suara
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
Tutorial 27: Mode Suara
Selamat datang kembali, teman-teman! Hari ini kita akan membahas salah satu cara paling keren untuk menggunakan Hermes: Mode Suara. Jika kamu pernah ingin mengobrol dengan asisten AI sambil berjalan-jalan, memasak, atau sekadar menghindari keyboard, tutorial ini cocok untukmu.
Apa itu Mode Suara?
Mode Suara memungkinkanmu berbicara dengan Hermes alih-alih mengetik. Ini sangat cocok untuk:
- Alur kerja CLI tanpa sentuhan – coding dan riset tanpa menyentuh keyboard
- Respons lisan di Telegram atau Discord – dapatkan balasan suara di samping pesan normal
- Kanal suara Discord langsung – lakukan percakapan nyata dengan Hermes di obrolan suara
- Menangkap ide dengan cepat – ucapkan pikiranmu sambil berjalan atau berdiskusi
Bagian terbaiknya? Jika kamu menggunakan Nous Portal, kamu mendapatkan LLM dan text-to-speech sekaligus melalui satu login OAuth. Tidak perlu kredensial tambahan!
Tiga Cara Menggunakan Suara
| Mode | Paling Cocok Untuk | Platform |
|---|---|---|
| Loop mikrofon interaktif | Penggunaan pribadi tanpa sentuhan | CLI |
| Balasan suara di chat | Respons lisan dengan pesan | Telegram, Discord |
| Bot kanal suara langsung | Percakapan kelompok | Kanal suara Discord |
Tips pro: Mulailah dengan mode teks yang berfungsi terlebih dahulu, lalu tambahkan balasan suara, dan terakhir coba kanal suara Discord jika kamu ingin pengalaman lengkap.
Langkah 1: Pastikan Teks Berfungsi Dulu
Sebelum masuk ke suara, pastikan dasar-dasarnya berfungsi:
hermes
Lalu tanyakan sesuatu yang sederhana:
Alat apa saja yang kamu miliki?
Jika sudah berjalan lancar, kamu siap untuk suara!
Langkah 2: Instal Paket Tambahan
Tergantung kebutuhanmu, instal paket yang tepat:
# Mikrofon + pemutaran CLI
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Platform pesan (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# TTS Premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Semuanya
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
Langkah 3: Dependensi Sistem
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
Inilah alasan mengapa paket-paket ini penting:
portaudio→ input mikrofon untuk suara CLIffmpeg→ konversi audioopus→ codec suara Discordespeak-ng→ phonemizer untuk NeuTTS
Langkah 4: Pilih Penyedia Layanan
Pengaturan termudah: Gunakan STT lokal dan Edge TTS gratis. Tambahkan ini ke ~/.hermes/.env:
# Opsi STT cloud (lokal tidak perlu kunci)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS Premium (opsional)
ELEVENLABS_API_KEY=***
Opsi STT:
local– terbaik untuk privasi, tanpa biayagroq– transkripsi cloud super cepatopenai– cadangan berbayar yang bagus
Opsi TTS:
edge– gratis dan cukup bagus untuk kebanyakan orangneutts– gratis lokal/di perangkatelevenlabs– kualitas terbaikopenai– pilihan tengah yang bagusmistral– multibahasa, Opus asli
Langkah 5: Konfigurasi yang Direkomendasikan
Ini adalah default yang solid untuk kebanyakan orang:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
Catatan tentang submit_mode:
direct(default) – langsung mengirim transkripdraft– menempatkan transkrip di komposer sehingga kamu bisa mengeditnya sebelum mengirim
Untuk draf yang bisa diedit, atur submit_mode: "draft".
Menggunakan Suara di CLI
Mulai Hermes dan aktifkan suara:
hermes
Lalu ketik:
/voice on
Alur perekaman:
- Tekan
Ctrl+B - Bicaralah
- Tunggu deteksi keheningan berhenti secara otomatis
- Hermes mentranskripsikan dan merespons
- Jika TTS aktif, ia akan membacakan jawabannya
- Loop dimulai lagi untuk penggunaan berkelanjutan
Perintah yang berguna:
/voice
/voice on
/voice off
/voice tts
/voice status
Alur Kerja Suara yang Hebat
Debugging sambil berjalan: Ucapkan “Saya terus mendapatkan error izin docker. Bantu saya debug.” Lalu lanjutkan tanpa sentuhan: “Baca lagi error terakhir”, “Jelaskan akar masalahnya dengan bahasa yang lebih sederhana”, “Sekarang berikan saya perbaikan yang tepat”.
Riset/curhat ide: Sangat cocok untuk berjalan-jalan, mendiktekan ide yang masih setengah matang, dan meminta Hermes untuk menyusun pemikiranmu secara real-time.
Aksesibilitas: Jika mengetik terasa merepotkan, mode suara membuatmu tetap berada dalam lingkaran penuh Hermes.
Menyesuaikan Perilaku
Jika Hermes mulai/berhenti terlalu agresif, sesuaikan pengaturan keheningan di konfigurasimu:
voice:
silence_threshold: 200
silence_duration: 3.0
Turunkan ambang batas untuk deteksi yang lebih sensitif, atau naikkan jika ia sering memotong ucapanmu.
Itu saja! Mode Suara adalah salah satu fitur yang terasa seperti sihir begitu kamu berhasil menjalankannya. Mulailah dari yang sederhana, biasakan diri, dan segera kamu akan mengobrol penuh dengan Hermes sambil mencuci piring. Selamat berbicara! 🎤
📖 Dokumentasi resmi
この記事は Hermes Agent のDokumentasi resmiに基づいています:Dokumentasi resmi › guides/use-voice-mode-with-hermes