🤖HermesBlog
Hermes Messaging Platforms · Parte 158/9/2026

Buzz: Use Hermes with the AI Voice Chat App

How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.

messaging-buzz

Buzz: ใช้ Hermes กับแอปแชทเสียง AI

โหมดเสียงมาแล้ว และมันเปลี่ยนเกมการโต้ตอบกับ Hermes ไปอย่างสิ้นเชิง แทนที่จะพิมพ์ทุกคำสั่ง ตอนนี้คุณสามารถพูดคุยกับเอเจนต์ของคุณได้อย่างเป็นธรรมชาติ — ไม่ว่าจะกำลังเขียนโค้ด ค้นคว้าข้อมูล หรือแค่เดินไปเดินมาพร้อมไอเดียเต็มหัว

คู่มือนี้จะพาคุณผ่านทุกสิ่งที่ต้องใช้เพื่อให้โหมดเสียงทำงาน ตั้งแต่การตั้งค่าที่ง่ายที่สุด ไปจนถึงการสนทนาในช่องเสียง Discord แบบเต็มรูปแบบ เริ่มเลย

โหมดเสียงเหมาะกับอะไร

โหมดเสียงจะโดดเด่นเมื่อคุณต้องการ:

  • ปล่อยมือให้อิสระขณะทำงานในเทอร์มินัล
  • รับคำตอบเป็นเสียงพูดใน Telegram หรือ Discord
  • ให้ Hermes นั่งอยู่ในช่องเสียง Discord เพื่อการโต้ตอบสดไปมา
  • จับไอเดียอย่างรวดเร็วขณะเดินไปมาแทนการพิมพ์

คิดว่ามันเป็นโคไพลอตแบบแฮนด์ฟรี การดีบั๊ก การระดมสมอง หรือแค่ถามคำถามสั้นๆ — โหมดเสียงช่วยให้คุณไม่หลุดโฟลว์

สามวิธีในการใช้เสียง

Hermes มีประสบการณ์เสียงที่แตกต่างกันสามแบบ:

โหมด เหมาะกับ แพลตฟอร์ม
ไมโครโฟนแบบวนซ้ำโต้ตอบ การใช้งานแบบแฮนด์ฟรีส่วนตัวขณะเขียนโค้ด CLI
ตอบกลับด้วยเสียงในแชท คำตอบเป็นเสียงพูดควบคู่กับการส่งข้อความ Telegram, Discord
บอทในช่องเสียงสด การสนทนากลุ่มในช่องเสียง ช่องเสียง Discord

เส้นทางที่ชาญฉลาด: ทำให้ข้อความทำงานก่อน จากนั้นเปิดการตอบกลับด้วยเสียง และสุดท้ายขยับไปที่ช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ

ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน

ก่อนจะแตะเสียง ให้ตรวจสอบพื้นฐานก่อน:

hermes

จากนั้นถามอะไรง่ายๆ:

คุณมีเครื่องมืออะไรบ้าง?

หากยังไม่เสถียร ให้แก้โหมดข้อความก่อน โหมดเสียงสร้างบนพื้นฐานที่ทำงานได้ดีอยู่แล้ว

ขั้นตอนที่ 2: ติดตั้งส่วนเสริมที่ถูกต้อง

ขึ้นอยู่กับการตั้งค่าของคุณ ติดตั้งสิ่งที่คุณต้องการ:

CLI ไมโครโฟน + การเล่นเสียง:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

แพลตฟอร์ม messaging (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

ElevenLabs TTS พรีเมียม (ไม่บังคับ):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS ในเครื่อง (ไม่บังคับ):

python -m pip install -U neutts[all]

ทั้งหมดในครั้งเดียว:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ขั้นตอนที่ 3: ติดตั้ง dependencies ของระบบ

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

นี่คือเหตุผลว่าแต่ละตัวสำคัญอย่างไร:

  • portaudio → รับเสียงจากไมโครโฟนและการเล่นเสียง
  • ffmpeg → แปลงเสียงสำหรับ TTS และ messaging
  • opus → รองรับตัวแปลงสัญญาณเสียง Discord
  • espeak-ng → ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS

ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด

Hermes รองรับทั้งสแต็กเสียงในเครื่องและคลาวด์ สำหรับการเริ่มต้นที่ง่ายที่สุด ใช้ STT ในเครื่องกับ Edge TTS ฟรี

เพิ่มสิ่งนี้ใน ~/.hermes/.env:

# ตัวเลือก STT คลาวด์ (ในเครื่องไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS พรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***

คำแนะนำสำหรับ speech-to-text:

  • local → ค่าเริ่มต้นที่ดีที่สุดสำหรับความเป็นส่วนตัวและค่าใช้จ่ายเป็นศูนย์
  • groq → การถอดเสียงบนคลาวด์ที่เร็วมาก
  • openai → ตัวสำรองแบบเสียเงินที่ดี

คำแนะนำสำหรับ text-to-speech:

  • edge → ฟรีและดีพอสำหรับคนส่วนใหญ่
  • neutts → TTS ในเครื่อง/บนอุปกรณ์ฟรี
  • elevenlabs → คุณภาพดีที่สุด
  • openai → ตัวกลางที่ดี
  • mistral → หลายภาษา, รองรับ Opus ดั้งเดิม

ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ

นี่คือค่าเริ่มต้นที่อนุรักษ์นิยมและมั่นคง:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

ใน TUI, submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังการถอดเสียง:

  • direct (ค่าเริ่มต้น) ส่งบทถอดเสียงทันที
  • draft วางไว้ในตัวแก้ไขเพื่อให้คุณแก้ไขก่อนส่ง

สำหรับร่างเสียงที่แก้ไขได้ ให้ตั้งค่า submit_mode: "draft"

ต้องการ TTS ในเครื่องแทน? สลับไปที่:

tts:
  provider: "neutts"
  neutts:
    ref_audio: ''
    ref_text: ''
    model: neuphonic/neutts-air-q4-gguf
    device: cpu

กรณีการใช้งาน: โหมดเสียง CLI

เริ่ม Hermes และเปิดโหมดเสียง:

hermes

จากนั้นภายใน CLI:

/voice on

ขั้นตอนการบันทึก:

  1. กด Ctrl+B
  2. พูด
  3. รอให้การตรวจจับความเงียบหยุดโดยอัตโนมัติ
  4. Hermes ถอดเสียงและตอบกลับ
  5. หากเปิด TTS ไว้ มันจะพูดคำตอบ
  6. วนซ้ำสามารถเริ่มใหม่ได้อัตโนมัติเพื่อการใช้งานต่อเนื่อง

คำสั่งที่มีประโยชน์:

/voice
/voice on
/voice off
/voice tts
/voice status

เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม:

การดีบั๊กแบบเดินไปมา: พูดว่า “ฉันเจอ error เรื่องสิทธิ์ docker ตลอดเลย ช่วยดีบั๊กให้หน่อย” จากนั้นดำเนินการต่อแบบแฮนด์ฟรี: “อ่าน error ล่าสุดอีกครั้ง” “อธิบายสาเหตุที่แท้จริงในแบบที่เข้าใจง่ายกว่านี้” “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”

การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปเดินมาขณะคิด พูดความคิดครึ่งๆ กลางๆ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์

การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes เต็มรูปแบบโดยไม่ต้องใช้คีย์บอร์ด

ปรับแต่งพฤติกรรม CLI

หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับค่าเหล่านี้ใน config ของคุณ:

voice:
  silence_threshold: 200   # ต่ำกว่า = ไวขึ้น
  silence_duration: 3.0    # วินาทีของความเงียบก่อนหยุด

เริ่มจากค่าเริ่มต้น จากนั้นปรับตามสภาพแวดล้อมของคุณ ห้องที่มีเสียงดังอาจต้องใช้ค่า threshold สูงขึ้น ห้องเงียบอาจต้องใช้ค่าต่ำลง

โหมดเสียงเป็นหนึ่งในวิธีที่เร็วที่สุดในการเพิ่มประสิทธิภาพการทำงานกับ Hermes เริ่มจากง่ายๆ ทดลองกับผู้ให้บริการต่างๆ แล้วไม่นานคุณจะพูดคุยกับเอเจนต์ของคุณเหมือนเป็นเรื่องธรรมชาติ

📖 เอกสารทางการ

この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes