Buzz: Use Hermes with the AI Voice Chat App
How to connect Hermes Agent to Buzz, the AI voice chat app — setup, messaging, and voice features explained in plain language.
Buzz: ใช้ Hermes กับแอปแชทเสียง AI
โหมดเสียงมาแล้ว และมันเปลี่ยนเกมการโต้ตอบกับ Hermes ไปอย่างสิ้นเชิง แทนที่จะพิมพ์ทุกคำสั่ง ตอนนี้คุณสามารถพูดคุยกับเอเจนต์ของคุณได้อย่างเป็นธรรมชาติ — ไม่ว่าจะกำลังเขียนโค้ด ค้นคว้าข้อมูล หรือแค่เดินไปเดินมาพร้อมไอเดียเต็มหัว
คู่มือนี้จะพาคุณผ่านทุกสิ่งที่ต้องใช้เพื่อให้โหมดเสียงทำงาน ตั้งแต่การตั้งค่าที่ง่ายที่สุด ไปจนถึงการสนทนาในช่องเสียง Discord แบบเต็มรูปแบบ เริ่มเลย
โหมดเสียงเหมาะกับอะไร
โหมดเสียงจะโดดเด่นเมื่อคุณต้องการ:
- ปล่อยมือให้อิสระขณะทำงานในเทอร์มินัล
- รับคำตอบเป็นเสียงพูดใน Telegram หรือ Discord
- ให้ Hermes นั่งอยู่ในช่องเสียง Discord เพื่อการโต้ตอบสดไปมา
- จับไอเดียอย่างรวดเร็วขณะเดินไปมาแทนการพิมพ์
คิดว่ามันเป็นโคไพลอตแบบแฮนด์ฟรี การดีบั๊ก การระดมสมอง หรือแค่ถามคำถามสั้นๆ — โหมดเสียงช่วยให้คุณไม่หลุดโฟลว์
สามวิธีในการใช้เสียง
Hermes มีประสบการณ์เสียงที่แตกต่างกันสามแบบ:
| โหมด | เหมาะกับ | แพลตฟอร์ม |
|---|---|---|
| ไมโครโฟนแบบวนซ้ำโต้ตอบ | การใช้งานแบบแฮนด์ฟรีส่วนตัวขณะเขียนโค้ด | CLI |
| ตอบกลับด้วยเสียงในแชท | คำตอบเป็นเสียงพูดควบคู่กับการส่งข้อความ | Telegram, Discord |
| บอทในช่องเสียงสด | การสนทนากลุ่มในช่องเสียง | ช่องเสียง Discord |
เส้นทางที่ชาญฉลาด: ทำให้ข้อความทำงานก่อน จากนั้นเปิดการตอบกลับด้วยเสียง และสุดท้ายขยับไปที่ช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ
ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน
ก่อนจะแตะเสียง ให้ตรวจสอบพื้นฐานก่อน:
hermes
จากนั้นถามอะไรง่ายๆ:
คุณมีเครื่องมืออะไรบ้าง?
หากยังไม่เสถียร ให้แก้โหมดข้อความก่อน โหมดเสียงสร้างบนพื้นฐานที่ทำงานได้ดีอยู่แล้ว
ขั้นตอนที่ 2: ติดตั้งส่วนเสริมที่ถูกต้อง
ขึ้นอยู่กับการตั้งค่าของคุณ ติดตั้งสิ่งที่คุณต้องการ:
CLI ไมโครโฟน + การเล่นเสียง:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
แพลตฟอร์ม messaging (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS พรีเมียม (ไม่บังคับ):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS ในเครื่อง (ไม่บังคับ):
python -m pip install -U neutts[all]
ทั้งหมดในครั้งเดียว:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ขั้นตอนที่ 3: ติดตั้ง dependencies ของระบบ
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
นี่คือเหตุผลว่าแต่ละตัวสำคัญอย่างไร:
portaudio→ รับเสียงจากไมโครโฟนและการเล่นเสียงffmpeg→ แปลงเสียงสำหรับ TTS และ messagingopus→ รองรับตัวแปลงสัญญาณเสียง Discordespeak-ng→ ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS
ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด
Hermes รองรับทั้งสแต็กเสียงในเครื่องและคลาวด์ สำหรับการเริ่มต้นที่ง่ายที่สุด ใช้ STT ในเครื่องกับ Edge TTS ฟรี
เพิ่มสิ่งนี้ใน ~/.hermes/.env:
# ตัวเลือก STT คลาวด์ (ในเครื่องไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS พรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***
คำแนะนำสำหรับ speech-to-text:
local→ ค่าเริ่มต้นที่ดีที่สุดสำหรับความเป็นส่วนตัวและค่าใช้จ่ายเป็นศูนย์groq→ การถอดเสียงบนคลาวด์ที่เร็วมากopenai→ ตัวสำรองแบบเสียเงินที่ดี
คำแนะนำสำหรับ text-to-speech:
edge→ ฟรีและดีพอสำหรับคนส่วนใหญ่neutts→ TTS ในเครื่อง/บนอุปกรณ์ฟรีelevenlabs→ คุณภาพดีที่สุดopenai→ ตัวกลางที่ดีmistral→ หลายภาษา, รองรับ Opus ดั้งเดิม
ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ
นี่คือค่าเริ่มต้นที่อนุรักษ์นิยมและมั่นคง:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
ใน TUI, submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังการถอดเสียง:
direct(ค่าเริ่มต้น) ส่งบทถอดเสียงทันทีdraftวางไว้ในตัวแก้ไขเพื่อให้คุณแก้ไขก่อนส่ง
สำหรับร่างเสียงที่แก้ไขได้ ให้ตั้งค่า submit_mode: "draft"
ต้องการ TTS ในเครื่องแทน? สลับไปที่:
tts:
provider: "neutts"
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
กรณีการใช้งาน: โหมดเสียง CLI
เริ่ม Hermes และเปิดโหมดเสียง:
hermes
จากนั้นภายใน CLI:
/voice on
ขั้นตอนการบันทึก:
- กด
Ctrl+B - พูด
- รอให้การตรวจจับความเงียบหยุดโดยอัตโนมัติ
- Hermes ถอดเสียงและตอบกลับ
- หากเปิด TTS ไว้ มันจะพูดคำตอบ
- วนซ้ำสามารถเริ่มใหม่ได้อัตโนมัติเพื่อการใช้งานต่อเนื่อง
คำสั่งที่มีประโยชน์:
/voice
/voice on
/voice off
/voice tts
/voice status
เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม:
การดีบั๊กแบบเดินไปมา: พูดว่า “ฉันเจอ error เรื่องสิทธิ์ docker ตลอดเลย ช่วยดีบั๊กให้หน่อย” จากนั้นดำเนินการต่อแบบแฮนด์ฟรี: “อ่าน error ล่าสุดอีกครั้ง” “อธิบายสาเหตุที่แท้จริงในแบบที่เข้าใจง่ายกว่านี้” “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”
การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปเดินมาขณะคิด พูดความคิดครึ่งๆ กลางๆ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์
การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes เต็มรูปแบบโดยไม่ต้องใช้คีย์บอร์ด
ปรับแต่งพฤติกรรม CLI
หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับค่าเหล่านี้ใน config ของคุณ:
voice:
silence_threshold: 200 # ต่ำกว่า = ไวขึ้น
silence_duration: 3.0 # วินาทีของความเงียบก่อนหยุด
เริ่มจากค่าเริ่มต้น จากนั้นปรับตามสภาพแวดล้อมของคุณ ห้องที่มีเสียงดังอาจต้องใช้ค่า threshold สูงขึ้น ห้องเงียบอาจต้องใช้ค่าต่ำลง
โหมดเสียงเป็นหนึ่งในวิธีที่เร็วที่สุดในการเพิ่มประสิทธิภาพการทำงานกับ Hermes เริ่มจากง่ายๆ ทดลองกับผู้ให้บริการต่างๆ แล้วไม่นานคุณจะพูดคุยกับเอเจนต์ของคุณเหมือนเป็นเรื่องธรรมชาติ
📖 เอกสารทางการ
この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes