🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Hermes v2026.8.3 Pembaruan: Suara Real-Time, Komunikasi Agen & Sitasi yang Dapat Diverifikasi

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 Pembaruan: Suara Real-Time, Komunikasi Agen & Sitasi yang Dapat Diverifikasi

Hai semuanya, selamat datang kembali di blog Hermes! Hari ini kita akan membahas salah satu pembaruan paling menarik sejauh ini: mode suara real-time. Jika kamu pernah ingin berbicara dengan agenmu alih-alih mengetik setiap perintah, ini adalah pembaruan untukmu. Dan kabar terbaiknya? Cara pengaturannya jauh lebih mudah dari yang kamu bayangkan.

Mari kita bahas semua yang perlu kamu ketahui untuk menjalankan mode suara hari ini.

Apa Sebenarnya Kegunaan Mode Suara

Mode suara bukan sekadar gimmick—ini benar-benar berguna dalam berbagai skenario:

  • Alur kerja CLI hands-free saat kamu coding atau riset
  • Respons lisan langsung di Telegram atau Discord
  • Percakapan langsung dengan Hermes yang berada di voice channel Discord
  • Menangkap ide cepat sambil berjalan-jalan, tanpa harus berhenti untuk mengetik

Anggap saja agenmu menjadi teman ngobrol, bukan sekadar kotak teks.

Tiga Cara Menggunakan Suara

Ada tiga pengalaman suara berbeda di Hermes, dan kamu bisa pilih yang sesuai dengan gayamu:

Mode Paling Cocok Untuk Platform
Loop mikrofon interaktif Penggunaan pribadi hands-free CLI
Balasan suara di chat Respons lisan di samping pesan teks Telegram, Discord
Bot voice channel langsung Percakapan langsung grup atau pribadi Voice channel Discord

Jalur yang cerdas: buat teks berfungsi dulu, lalu aktifkan balasan suara, dan terakhir coba voice channel Discord jika kamu ingin pengalaman lengkap.

Langkah 1: Pastikan Teks Berfungsi Dulu

Sebelum menyentuh suara, pastikan dasar-dasarnya sudah solid:

hermes

Lalu tanyakan sesuatu yang sederhana:

Tools apa saja yang kamu punya?

Jika itu berhasil, kamu siap melanjutkan.

Langkah 2: Instal Ekstra yang Tepat

Tergantung kebutuhanmu, instal paket yang sesuai:

Mikrofon CLI + pemutaran:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

Platform pesan:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS Premium ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS Lokal (opsional):

python -m pip install -U neutts[all]

Semuanya sekaligus:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

Langkah 3: Dependensi Sistem

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

Inilah alasan mengapa dependensi ini penting:

  • portaudio → input mikrofon dan pemutaran
  • ffmpeg → konversi audio
  • opus → dukungan codec suara Discord
  • espeak-ng → phonemizer untuk NeuTTS

Langkah 4: Pilih Penyedia Layanan Suara

Hermes mendukung stack suara lokal dan cloud. Pengaturan termudah dan termurah adalah STT lokal dengan Edge TTS gratis:

  • Penyedia STT: local
  • Penyedia TTS: edge

Tambahkan API key apa pun ke ~/.hermes/.env:

# Opsi STT cloud (lokal tidak perlu key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS Premium (opsional)
ELEVENLABS_API_KEY=***

Rekomendasi singkat:

  • STT: local untuk privasi, groq untuk kecepatan, openai sebagai fallback berbayar
  • TTS: edge untuk gratis, neutts untuk lokal, elevenlabs untuk kualitas terbaik

Langkah 5: Konfigurasi yang Direkomendasikan

Ini default konservatif yang solid:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

Satu pengaturan penting: voice.submit_mode mengontrol apa yang terjadi setelah transkripsi. direct langsung mengirim, sedangkan draft memungkinkanmu mengedit sebelum mengirim. Untuk draf yang bisa diedit, atur:

voice:
  submit_mode: "draft"

Menggunakan Suara di CLI

Mulai Hermes dan aktifkan suara:

hermes

Lalu di dalam CLI:

/voice on

Alur perekaman:

  1. Tekan Ctrl+B
  2. Bicaralah
  3. Tunggu deteksi hening berhenti secara otomatis
  4. Hermes mentranskripsi dan merespons
  5. Jika TTS aktif, ia akan membacakan jawabannya

Perintah yang berguna:

/voice
/voice on
/voice off
/voice tts
/voice status

Alur Kerja CLI yang Hebat

Debugging sambil jalan: Cukup katakan “Aku terus dapat error izin docker. Bantu aku debug.” Lalu lanjutkan hands-free: “Baca error terakhir lagi,” “Jelaskan akar masalahnya dengan bahasa yang lebih sederhana,” “Sekarang beri aku solusi yang tepat.”

Riset dan brainstorming: Sempurna untuk berjalan-jalan sambil berpikir, mendiktekan ide yang masih setengah matang, dan meminta Hermes menyusun pemikiranmu secara real-time.

Aksesibilitas: Jika mengetik terasa merepotkan, mode suara membuatmu tetap berada dalam lingkaran penuh Hermes tanpa keyboard.

Menyesuaikan Perilaku

Jika Hermes mulai atau berhenti merekam terlalu agresif, sesuaikan nilai silence_threshold dan silence_duration di konfigurasimu.

Itu saja! Mode suara sekarang aktif dan siap digunakan. Mulai dengan teks, tambahkan balasan suara, dan jelajahi voice channel Discord saat kamu siap. Selamat berbicara!

📖 Dokumentasi resmi

この記事は Hermes Agent のDokumentasi resmiに基づいています:GitHub ›/releases/tag/v2026.8.3