Talk to AI with Voice Mode
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
พูดคุยกับ AI ด้วยโหมดเสียง
โหมดเสียงเป็นหนึ่งในฟีเจอร์ที่ให้ความรู้สึกเหมือนเวทมนตร์ในครั้งแรกที่ได้ลองใช้ แทนที่จะพิมพ์คำสั่งทุกอย่างและอ่านทุกคำตอบ คุณก็แค่… พูดคุย Hermes จะฟัง คิด และตอบกลับด้วยเสียง คู่มือนี้จะพาคุณผ่านทุกสิ่งที่จำเป็นเพื่อให้โหมดเสียงทำงาน ตั้งแต่การตั้งค่าไมโครโฟนง่ายๆ ไปจนถึงบอทในช่องเสียง Discord เต็มรูปแบบ
โหมดเสียงเหมาะกับอะไร
โหมดเสียงจะโดดเด่นเมื่อมือของคุณไม่ว่าง หรือคุณแค่อยากได้วิธีโต้ตอบกับ AI ที่เป็นธรรมชาติมากขึ้น นี่คือกรณีการใช้งานที่พบบ่อยที่สุด:
- เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ — คงสถานะการเขียนโค้ดหรือค้นคว้าต่อไปพร้อมกับพูดคุยกับ Hermes
- คำตอบด้วยเสียงใน Telegram หรือ Discord — รับคำตอบเป็นเสียงควบคู่ไปกับข้อความปกติ
- ช่องเสียง Discord แบบสด — ให้ Hermes เข้าร่วมช่องเสียงเพื่อการสนทนาแบบเรียลไทม์
- จับไอเดียอย่างรวดเร็ว — พูดระบายความคิดขณะเดินไปมาแทนการพิมพ์
สามวิธีในการใช้โหมดเสียง
Hermes มีประสบการณ์เสียงที่แตกต่างกันสามแบบ เลือกแบบที่เหมาะกับความต้องการของคุณ:
| โหมด | เหมาะสำหรับ | แพลตฟอร์ม |
|---|---|---|
| วงจรไมโครโฟนแบบโต้ตอบ | การใช้งานส่วนตัวแบบไม่ต้องใช้มือขณะเขียนโค้ด | CLI |
| คำตอบด้วยเสียงในแชท | คำตอบเป็นเสียงพร้อมกับการส่งข้อความปกติ | Telegram, Discord |
| บอทช่องเสียงสด | การสนทนาสดแบบกลุ่มหรือส่วนตัว | ช่องเสียง Discord |
เส้นทางที่ดีคือเริ่มจากง่ายๆ: ทำให้ข้อความทำงานก่อน จากนั้นเปิดใช้งานคำตอบด้วยเสียง และสุดท้ายขยับไปยังช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ
ขั้นตอนที่ 1: ตรวจสอบให้แน่ใจว่าโหมดข้อความทำงานก่อน
ก่อนจะแตะโหมดเสียง ให้ตรวจสอบว่า Hermes เริ่มทำงานและผู้ให้บริการของคุณได้รับการตั้งค่าแล้ว รัน hermes แล้วถามอะไรง่ายๆ เช่น:
What tools do you have available?
หากยังไม่เสถียร ให้แก้ไขโหมดข้อความก่อน โหมดเสียงสร้างต่อยอดจากส่วนนี้
ขั้นตอนที่ 2: ติดตั้งส่วนเสริมที่เหมาะสม
ขึ้นอยู่กับประสบการณ์เสียงที่คุณต้องการ ให้ติดตั้งส่วนเสริมที่เกี่ยวข้อง:
ไมโครโฟน + การเล่นเสียง CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
แพลตฟอร์มการส่งข้อความ (Telegram/Discord):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS ระดับพรีเมียม (ไม่บังคับ):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS ในเครื่อง (ไม่บังคับ):
python -m pip install -U neutts[all]
ทุกอย่าง:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ขั้นตอนที่ 3: ติดตั้ง dependencies ของระบบ
โหมดเสียงต้องใช้แพ็กเกจระบบสองสามตัวเพื่อจัดการกับอินพุตเสียง การแปลง และการเล่นเสียง
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
นี่คือเหตุผลว่าแต่ละตัวสำคัญอย่างไร:
portaudio→ อินพุตไมโครโฟนและการเล่นเสียงสำหรับโหมดเสียง CLIffmpeg→ การแปลงเสียงสำหรับ TTS และการส่งข้อความopus→ รองรับตัวแปลงสัญญาณเสียง Discordespeak-ng→ ฟอนีไมเซอร์แบ็กเอนด์สำหรับ NeuTTS
ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด
Hermes รองรับทั้งสแตกเสียงในเครื่องและบนคลาวด์ การตั้งค่าที่ง่ายที่สุดและถูกที่สุดใช้ STT ในเครื่องและ Edge TTS ฟรี:
- ผู้ให้บริการ STT:
local - ผู้ให้บริการ TTS:
edge
เพิ่มคีย์คลาวด์ใดๆ ลงใน ~/.hermes/.env:
# ตัวเลือก STT บนคลาวด์ (local ไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS ระดับพรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***
คำแนะนำสำหรับการแปลงเสียงพูดเป็นข้อความ:
local→ ค่าเริ่มต้นที่ดีที่สุดสำหรับความเป็นส่วนตัวและค่าใช้จ่ายเป็นศูนย์groq→ การถอดเสียงบนคลาวด์ที่รวดเร็วมากopenai→ ตัวเลือกแบบเสียเงินที่ดี
คำแนะนำสำหรับการแปลงข้อความเป็นเสียงพูด:
edge→ ฟรีและดีพอสำหรับผู้ใช้ส่วนใหญ่neutts→ TTS ในเครื่อง/บนอุปกรณ์ฟรีelevenlabs→ คุณภาพดีที่สุดopenai→ ตัวกลางที่ดีmistral→ หลายภาษา, Opus ดั้งเดิม
ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ
นี่คือค่าเริ่มต้นที่ปลอดภัยและเหมาะสมสำหรับคนส่วนใหญ่:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
การตั้งค่า submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังจากการถอดเสียง:
direct(ค่าเริ่มต้น) ส่งข้อความที่ถอดเสียงทันทีdraftวางข้อความที่ถอดเสียงไว้ในคอมโพเซอร์เพื่อให้คุณแก้ไขก่อนส่ง
สำหรับร่างเสียงที่แก้ไขได้ ให้ตั้งค่า submit_mode: "draft"
การใช้โหมดเสียงใน CLI
เริ่ม Hermes และเปิดโหมดเสียง:
hermes
จากนั้นภายใน CLI:
/voice on
ขั้นตอนการบันทึก:
- กด
Ctrl+B - พูด
- รอให้การตรวจจับความเงียบหยุดการบันทึกโดยอัตโนมัติ
- Hermes ถอดเสียงและตอบกลับ
- หากเปิด TTS ไว้ มันจะพูดคำตอบ
- วงจรสามารถเริ่มใหม่โดยอัตโนมัติเพื่อการใช้งานต่อเนื่อง
คำสั่งที่มีประโยชน์:
/voice
/voice on
/voice off
/voice tts
/voice status
เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม
การดีบักแบบเดินไปเดินมา: พูดว่า “ฉันเจอข้อผิดพลาดสิทธิ์ docker ตลอด ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ต้องใช้มือด้วยคำถามต่อเนื่องเช่น “อ่านข้อผิดพลาดล่าสุดอีกครั้ง” หรือ “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”
การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปมาในขณะที่คิด พูดความคิดที่ยังไม่เป็นรูปเป็นร่าง และขอให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์
การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงเป็นหนึ่งในวิธีที่เร็วที่สุดในการอยู่ในวงจร Hermes เต็มรูปแบบ
การปรับแต่งพฤติกรรม CLI
หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับการตั้งค่าความเงียบในคอนฟิกของคุณ:
voice:
silence_threshold: 200
silence_duration: 3.0
ลดค่า threshold หากมันหยุดเร็วเกินไป หรือเพิ่มค่าหากเสียงรบกวนพื้นหลังทำให้มันบันทึกต่อเนื่อง ค่า duration ควบคุมระยะเวลาของการหยุดพักที่ทำให้เกิดการหยุดบันทึก
โหมดเสียงเป็นตัวเปลี่ยนเกมเมื่อคุณตั้งค่าได้สำเร็จ เริ่มจากวงจร CLI พื้นฐาน จากนั้นขยายไปยังแพลตฟอร์มการส่งข้อความและช่องเสียง Discord เมื่อคุณเริ่มคุ้นเคย ขอให้สนุกกับการพูดคุย!
📖 เอกสารทางการ
この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes