บทช่วยสอน 27: โหมดเสียง (Voice Mode)
Tutorial 27: Voice Mode — easy-to-understand guide based on official docs
บทช่วยสอน 27: โหมดเสียง (Voice Mode)
ยินดีต้อนรับกลับมาเพื่อน ๆ! วันนี้เราจะมาพูดถึงหนึ่งในวิธีที่เจ๋งที่สุดในการใช้งาน Hermes: โหมดเสียง (Voice Mode) ถ้าคุณเคยอยากคุยกับผู้ช่วย AI ขณะเดินเล่น ทำอาหารเย็น หรือแค่อยากหนีจากคีย์บอร์ด บทช่วยสอนนี้เหมาะสำหรับคุณ
โหมดเสียงคืออะไร?
โหมดเสียงให้คุณพูดคุยกับ Hermes แทนการพิมพ์ เหมาะสำหรับ:
- เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ – เขียนโค้ดและค้นคว้าโดยไม่ต้องแตะคีย์บอร์ด
- การตอบกลับด้วยเสียงใน Telegram หรือ Discord – รับคำตอบเป็นเสียงควบคู่กับข้อความปกติ
- ช่องเสียงสดใน Discord – สนทนาจริงกับ Hermes ในแชทเสียง
- จับไอเดียอย่างรวดเร็ว – พูดความคิดขณะเดินหรือระดมสมอง
จุดเด่นที่สุด? ถ้าคุณใช้ Nous Portal คุณจะได้ทั้ง LLM และ text-to-speech ผ่านการเข้าสู่ระบบ OAuth เดียว ไม่ต้องใช้ข้อมูลรับรองเพิ่มเติม!
สามวิธีในการใช้โหมดเสียง
| โหมด | เหมาะสำหรับ | แพลตฟอร์ม |
|---|---|---|
| วงจรไมโครโฟนแบบโต้ตอบ | การใช้งานส่วนตัวแบบไม่ต้องใช้มือ | CLI |
| การตอบกลับด้วยเสียงในแชท | การตอบกลับด้วยเสียงพร้อมข้อความ | Telegram, Discord |
| บอทช่องเสียงสด | การสนทนากลุ่ม | ช่องเสียง Discord |
เคล็ดลับมือโปร: เริ่มจากให้โหมดข้อความทำงานก่อน แล้วค่อยเพิ่มการตอบกลับด้วยเสียง และสุดท้ายลองช่องเสียง Discord ถ้าต้องการประสบการณ์เต็มรูปแบบ
ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน
ก่อนจะดำดิ่งสู่โหมดเสียง ตรวจสอบให้พื้นฐานทำงานก่อน:
hermes
จากนั้นถามอะไรง่าย ๆ:
What tools do you have available?
ถ้าทำงานได้เรียบร้อย คุณก็พร้อมสำหรับโหมดเสียงแล้ว!
ขั้นตอนที่ 2: ติดตั้งแพ็กเกจเพิ่มเติม
ขึ้นอยู่กับสิ่งที่คุณต้องการ ติดตั้งแพ็กเกจที่เหมาะสม:
# CLI microphone + playback
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
# Messaging platforms (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
# Premium ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
# Everything
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ขั้นตอนที่ 3: ระบบ dependencies
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu/Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
นี่คือเหตุผลว่าทำไมสิ่งเหล่านี้ถึงสำคัญ:
portaudio→ รับเสียงจากไมโครโฟนสำหรับ CLI voiceffmpeg→ แปลงไฟล์เสียงopus→ ตัวแปลงสัญญาณเสียงสำหรับ Discordespeak-ng→ ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS
ขั้นตอนที่ 4: เลือกผู้ให้บริการของคุณ
การตั้งค่าที่ง่ายที่สุด: ใช้ STT ในเครื่องและ Edge TTS ฟรี เพิ่มสิ่งนี้ใน ~/.hermes/.env:
# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium TTS (optional)
ELEVENLABS_API_KEY=***
ตัวเลือก STT:
local– ดีที่สุดสำหรับความเป็นส่วนตัว ไม่มีค่าใช้จ่ายgroq– ถอดเสียงบนคลาวด์ที่เร็วสุด ๆopenai– ตัวสำรองแบบเสียเงินที่ดี
ตัวเลือก TTS:
edge– ฟรีและดีพอสำหรับคนส่วนใหญ่neutts– ฟรี ทำงานบนเครื่อง/อุปกรณ์elevenlabs– คุณภาพดีที่สุดopenai– กลาง ๆ ที่ดีmistral– หลายภาษา รองรับ Opus ดั้งเดิม
ขั้นตอนที่ 5: คอนฟิกที่แนะนำ
นี่คือค่าเริ่มต้นที่ดีสำหรับคนส่วนใหญ่:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
หมายเหตุเกี่ยวกับ submit_mode:
direct(ค่าเริ่มต้น) – ส่งบทถอดเสียงทันทีdraft– ใส่บทถอดเสียงในช่องแก้ไขเพื่อให้คุณแก้ไขก่อนส่ง
สำหรับฉบับร่างที่แก้ไขได้ ตั้งค่า submit_mode: "draft"
การใช้โหมดเสียงใน CLI
เริ่ม Hermes และเปิดโหมดเสียง:
hermes
จากนั้นพิมพ์:
/voice on
ขั้นตอนการบันทึก:
- กด
Ctrl+B - พูด
- รอให้ระบบตรวจจับความเงียบหยุดโดยอัตโนมัติ
- Hermes ถอดเสียงและตอบกลับ
- ถ้าเปิด TTS ไว้ มันจะพูดคำตอบ
- วงจรเริ่มใหม่เพื่อใช้งานต่อเนื่อง
คำสั่งที่มีประโยชน์:
/voice
/voice on
/voice off
/voice tts
/voice status
เวิร์กโฟลว์เสียงที่ยอดเยี่ยม
การดีบักแบบเดินไปมา: พูดว่า “ฉันเจอ docker permission error ตลอดเลย ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ต้องใช้มือ: “อ่าน error ล่าสุดอีกครั้ง”, “อธิบายสาเหตุหลักแบบง่ายกว่านี้”, “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”
การค้นคว้า/ระดมสมอง: เหมาะสำหรับการเดินไปมา พูดไอเดียครึ่ง ๆ กลาง ๆ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์
การเข้าถึง: ถ้าการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes ได้อย่างเต็มรูปแบบ
การปรับแต่งพฤติกรรม
ถ้า Hermes เริ่ม/หยุดแรงเกินไป ให้ปรับการตั้งค่าความเงียบในคอนฟิกของคุณ:
voice:
silence_threshold: 200
silence_duration: 3.0
ลดค่า threshold เพื่อการตรวจจับที่ไวขึ้น หรือเพิ่มขึ้นถ้ามันตัดคุณกลางคัน
จบแล้ว! โหมดเสียงเป็นหนึ่งในฟีเจอร์ที่ให้ความรู้สึกเหมือนเวทมนตร์เมื่อคุณทำให้มันทำงานได้ เริ่มจากง่าย ๆ ทำความคุ้นเคย แล้วเร็ว ๆ นี้คุณจะได้สนทนาเต็มรูปแบบกับ Hermes ระหว่างล้างจาน ขอให้สนุกกับการพูดคุย! 🎤
📖 เอกสารทางการ
この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes