🤖HermesBlog
Hermes Official Tutorials · Parte 278/9/2026

Tutorial 27: Mode Suara

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

Tutorial 27: Mode Suara

Selamat datang kembali, teman-teman! Hari ini kita akan membahas salah satu cara paling keren untuk menggunakan Hermes: Mode Suara. Jika kamu pernah ingin mengobrol dengan asisten AI sambil berjalan-jalan, memasak, atau sekadar menghindari keyboard, tutorial ini cocok untukmu.

Apa itu Mode Suara?

Mode Suara memungkinkanmu berbicara dengan Hermes alih-alih mengetik. Ini sangat cocok untuk:

  • Alur kerja CLI tanpa sentuhan – coding dan riset tanpa menyentuh keyboard
  • Respons lisan di Telegram atau Discord – dapatkan balasan suara di samping pesan normal
  • Kanal suara Discord langsung – lakukan percakapan nyata dengan Hermes di obrolan suara
  • Menangkap ide dengan cepat – ucapkan pikiranmu sambil berjalan atau berdiskusi

Bagian terbaiknya? Jika kamu menggunakan Nous Portal, kamu mendapatkan LLM dan text-to-speech sekaligus melalui satu login OAuth. Tidak perlu kredensial tambahan!

Tiga Cara Menggunakan Suara

Mode Paling Cocok Untuk Platform
Loop mikrofon interaktif Penggunaan pribadi tanpa sentuhan CLI
Balasan suara di chat Respons lisan dengan pesan Telegram, Discord
Bot kanal suara langsung Percakapan kelompok Kanal suara Discord

Tips pro: Mulailah dengan mode teks yang berfungsi terlebih dahulu, lalu tambahkan balasan suara, dan terakhir coba kanal suara Discord jika kamu ingin pengalaman lengkap.

Langkah 1: Pastikan Teks Berfungsi Dulu

Sebelum masuk ke suara, pastikan dasar-dasarnya berfungsi:

hermes

Lalu tanyakan sesuatu yang sederhana:

Alat apa saja yang kamu miliki?

Jika sudah berjalan lancar, kamu siap untuk suara!

Langkah 2: Instal Paket Tambahan

Tergantung kebutuhanmu, instal paket yang tepat:

# Mikrofon + pemutaran CLI
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Platform pesan (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# TTS Premium ElevenLabs
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Semuanya
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Langkah 3: Dependensi Sistem

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Inilah alasan mengapa paket-paket ini penting:

  • portaudio → input mikrofon untuk suara CLI
  • ffmpeg → konversi audio
  • opus → codec suara Discord
  • espeak-ng → phonemizer untuk NeuTTS

Langkah 4: Pilih Penyedia Layanan

Pengaturan termudah: Gunakan STT lokal dan Edge TTS gratis. Tambahkan ini ke ~/.hermes/.env:

# Opsi STT cloud (lokal tidak perlu kunci)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS Premium (opsional)
ELEVENLABS_API_KEY=***

Opsi STT:

  • local – terbaik untuk privasi, tanpa biaya
  • groq – transkripsi cloud super cepat
  • openai – cadangan berbayar yang bagus

Opsi TTS:

  • edge – gratis dan cukup bagus untuk kebanyakan orang
  • neutts – gratis lokal/di perangkat
  • elevenlabs – kualitas terbaik
  • openai – pilihan tengah yang bagus
  • mistral – multibahasa, Opus asli

Langkah 5: Konfigurasi yang Direkomendasikan

Ini adalah default yang solid untuk kebanyakan orang:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Catatan tentang submit_mode:

  • direct (default) – langsung mengirim transkrip
  • draft – menempatkan transkrip di komposer sehingga kamu bisa mengeditnya sebelum mengirim

Untuk draf yang bisa diedit, atur submit_mode: "draft".

Menggunakan Suara di CLI

Mulai Hermes dan aktifkan suara:

hermes

Lalu ketik:

/voice on

Alur perekaman:

  1. Tekan Ctrl+B
  2. Bicaralah
  3. Tunggu deteksi keheningan berhenti secara otomatis
  4. Hermes mentranskripsikan dan merespons
  5. Jika TTS aktif, ia akan membacakan jawabannya
  6. Loop dimulai lagi untuk penggunaan berkelanjutan

Perintah yang berguna:

/voice
/voice on
/voice off
/voice tts
/voice status

Alur Kerja Suara yang Hebat

Debugging sambil berjalan: Ucapkan “Saya terus mendapatkan error izin docker. Bantu saya debug.” Lalu lanjutkan tanpa sentuhan: “Baca lagi error terakhir”, “Jelaskan akar masalahnya dengan bahasa yang lebih sederhana”, “Sekarang berikan saya perbaikan yang tepat”.

Riset/curhat ide: Sangat cocok untuk berjalan-jalan, mendiktekan ide yang masih setengah matang, dan meminta Hermes untuk menyusun pemikiranmu secara real-time.

Aksesibilitas: Jika mengetik terasa merepotkan, mode suara membuatmu tetap berada dalam lingkaran penuh Hermes.

Menyesuaikan Perilaku

Jika Hermes mulai/berhenti terlalu agresif, sesuaikan pengaturan keheningan di konfigurasimu:

voice:
  silence_threshold: 200
  silence_duration: 3.0

Turunkan ambang batas untuk deteksi yang lebih sensitif, atau naikkan jika ia sering memotong ucapanmu.


Itu saja! Mode Suara adalah salah satu fitur yang terasa seperti sihir begitu kamu berhasil menjalankannya. Mulailah dari yang sederhana, biasakan diri, dan segera kamu akan mengobrol penuh dengan Hermes sambil mencuci piring. Selamat berbicara! 🎤

📖 Dokumentasi resmi

この記事は Hermes Agent のDokumentasi resmiに基づいています:Dokumentasi resmi › guides/use-voice-mode-with-hermes