🤖HermesBlog
Hermes Official Tutorials · Parte 278/9/2026

บทช่วยสอน 27: โหมดเสียง (Voice Mode)

Tutorial 27: Voice Mode — easy-to-understand guide based on official docs

Hermes tutorial

บทช่วยสอน 27: โหมดเสียง (Voice Mode)

ยินดีต้อนรับกลับมาเพื่อน ๆ! วันนี้เราจะมาพูดถึงหนึ่งในวิธีที่เจ๋งที่สุดในการใช้งาน Hermes: โหมดเสียง (Voice Mode) ถ้าคุณเคยอยากคุยกับผู้ช่วย AI ขณะเดินเล่น ทำอาหารเย็น หรือแค่อยากหนีจากคีย์บอร์ด บทช่วยสอนนี้เหมาะสำหรับคุณ

โหมดเสียงคืออะไร?

โหมดเสียงให้คุณพูดคุยกับ Hermes แทนการพิมพ์ เหมาะสำหรับ:

  • เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ – เขียนโค้ดและค้นคว้าโดยไม่ต้องแตะคีย์บอร์ด
  • การตอบกลับด้วยเสียงใน Telegram หรือ Discord – รับคำตอบเป็นเสียงควบคู่กับข้อความปกติ
  • ช่องเสียงสดใน Discord – สนทนาจริงกับ Hermes ในแชทเสียง
  • จับไอเดียอย่างรวดเร็ว – พูดความคิดขณะเดินหรือระดมสมอง

จุดเด่นที่สุด? ถ้าคุณใช้ Nous Portal คุณจะได้ทั้ง LLM และ text-to-speech ผ่านการเข้าสู่ระบบ OAuth เดียว ไม่ต้องใช้ข้อมูลรับรองเพิ่มเติม!

สามวิธีในการใช้โหมดเสียง

โหมด เหมาะสำหรับ แพลตฟอร์ม
วงจรไมโครโฟนแบบโต้ตอบ การใช้งานส่วนตัวแบบไม่ต้องใช้มือ CLI
การตอบกลับด้วยเสียงในแชท การตอบกลับด้วยเสียงพร้อมข้อความ Telegram, Discord
บอทช่องเสียงสด การสนทนากลุ่ม ช่องเสียง Discord

เคล็ดลับมือโปร: เริ่มจากให้โหมดข้อความทำงานก่อน แล้วค่อยเพิ่มการตอบกลับด้วยเสียง และสุดท้ายลองช่องเสียง Discord ถ้าต้องการประสบการณ์เต็มรูปแบบ

ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน

ก่อนจะดำดิ่งสู่โหมดเสียง ตรวจสอบให้พื้นฐานทำงานก่อน:

hermes

จากนั้นถามอะไรง่าย ๆ:

What tools do you have available?

ถ้าทำงานได้เรียบร้อย คุณก็พร้อมสำหรับโหมดเสียงแล้ว!

ขั้นตอนที่ 2: ติดตั้งแพ็กเกจเพิ่มเติม

ขึ้นอยู่กับสิ่งที่คุณต้องการ ติดตั้งแพ็กเกจที่เหมาะสม:

# CLI microphone + playback
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

# Messaging platforms (Telegram/Discord)
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

# Premium ElevenLabs TTS
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

# Everything
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ขั้นตอนที่ 3: ระบบ dependencies

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu/Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

นี่คือเหตุผลว่าทำไมสิ่งเหล่านี้ถึงสำคัญ:

  • portaudio → รับเสียงจากไมโครโฟนสำหรับ CLI voice
  • ffmpeg → แปลงไฟล์เสียง
  • opus → ตัวแปลงสัญญาณเสียงสำหรับ Discord
  • espeak-ng → ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS

ขั้นตอนที่ 4: เลือกผู้ให้บริการของคุณ

การตั้งค่าที่ง่ายที่สุด: ใช้ STT ในเครื่องและ Edge TTS ฟรี เพิ่มสิ่งนี้ใน ~/.hermes/.env:

# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Premium TTS (optional)
ELEVENLABS_API_KEY=***

ตัวเลือก STT:

  • local – ดีที่สุดสำหรับความเป็นส่วนตัว ไม่มีค่าใช้จ่าย
  • groq – ถอดเสียงบนคลาวด์ที่เร็วสุด ๆ
  • openai – ตัวสำรองแบบเสียเงินที่ดี

ตัวเลือก TTS:

  • edge – ฟรีและดีพอสำหรับคนส่วนใหญ่
  • neutts – ฟรี ทำงานบนเครื่อง/อุปกรณ์
  • elevenlabs – คุณภาพดีที่สุด
  • openai – กลาง ๆ ที่ดี
  • mistral – หลายภาษา รองรับ Opus ดั้งเดิม

ขั้นตอนที่ 5: คอนฟิกที่แนะนำ

นี่คือค่าเริ่มต้นที่ดีสำหรับคนส่วนใหญ่:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

หมายเหตุเกี่ยวกับ submit_mode:

  • direct (ค่าเริ่มต้น) – ส่งบทถอดเสียงทันที
  • draft – ใส่บทถอดเสียงในช่องแก้ไขเพื่อให้คุณแก้ไขก่อนส่ง

สำหรับฉบับร่างที่แก้ไขได้ ตั้งค่า submit_mode: "draft"

การใช้โหมดเสียงใน CLI

เริ่ม Hermes และเปิดโหมดเสียง:

hermes

จากนั้นพิมพ์:

/voice on

ขั้นตอนการบันทึก:

  1. กด Ctrl+B
  2. พูด
  3. รอให้ระบบตรวจจับความเงียบหยุดโดยอัตโนมัติ
  4. Hermes ถอดเสียงและตอบกลับ
  5. ถ้าเปิด TTS ไว้ มันจะพูดคำตอบ
  6. วงจรเริ่มใหม่เพื่อใช้งานต่อเนื่อง

คำสั่งที่มีประโยชน์:

/voice
/voice on
/voice off
/voice tts
/voice status

เวิร์กโฟลว์เสียงที่ยอดเยี่ยม

การดีบักแบบเดินไปมา: พูดว่า “ฉันเจอ docker permission error ตลอดเลย ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ต้องใช้มือ: “อ่าน error ล่าสุดอีกครั้ง”, “อธิบายสาเหตุหลักแบบง่ายกว่านี้”, “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”

การค้นคว้า/ระดมสมอง: เหมาะสำหรับการเดินไปมา พูดไอเดียครึ่ง ๆ กลาง ๆ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์

การเข้าถึง: ถ้าการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes ได้อย่างเต็มรูปแบบ

การปรับแต่งพฤติกรรม

ถ้า Hermes เริ่ม/หยุดแรงเกินไป ให้ปรับการตั้งค่าความเงียบในคอนฟิกของคุณ:

voice:
  silence_threshold: 200
  silence_duration: 3.0

ลดค่า threshold เพื่อการตรวจจับที่ไวขึ้น หรือเพิ่มขึ้นถ้ามันตัดคุณกลางคัน


จบแล้ว! โหมดเสียงเป็นหนึ่งในฟีเจอร์ที่ให้ความรู้สึกเหมือนเวทมนตร์เมื่อคุณทำให้มันทำงานได้ เริ่มจากง่าย ๆ ทำความคุ้นเคย แล้วเร็ว ๆ นี้คุณจะได้สนทนาเต็มรูปแบบกับ Hermes ระหว่างล้างจาน ขอให้สนุกกับการพูดคุย! 🎤

📖 เอกสารทางการ

この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes