🤖HermesBlog
Hermes Feature Guides · Parte 68/9/2026

Talk to AI with Voice Mode

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

พูดคุยกับ AI ด้วยโหมดเสียง

โหมดเสียงเป็นหนึ่งในฟีเจอร์ที่ให้ความรู้สึกเหมือนเวทมนตร์ในครั้งแรกที่ได้ลองใช้ แทนที่จะพิมพ์คำสั่งทุกอย่างและอ่านทุกคำตอบ คุณก็แค่… พูดคุย Hermes จะฟัง คิด และตอบกลับด้วยเสียง คู่มือนี้จะพาคุณผ่านทุกสิ่งที่จำเป็นเพื่อให้โหมดเสียงทำงาน ตั้งแต่การตั้งค่าไมโครโฟนง่ายๆ ไปจนถึงบอทในช่องเสียง Discord เต็มรูปแบบ

โหมดเสียงเหมาะกับอะไร

โหมดเสียงจะโดดเด่นเมื่อมือของคุณไม่ว่าง หรือคุณแค่อยากได้วิธีโต้ตอบกับ AI ที่เป็นธรรมชาติมากขึ้น นี่คือกรณีการใช้งานที่พบบ่อยที่สุด:

  • เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ — คงสถานะการเขียนโค้ดหรือค้นคว้าต่อไปพร้อมกับพูดคุยกับ Hermes
  • คำตอบด้วยเสียงใน Telegram หรือ Discord — รับคำตอบเป็นเสียงควบคู่ไปกับข้อความปกติ
  • ช่องเสียง Discord แบบสด — ให้ Hermes เข้าร่วมช่องเสียงเพื่อการสนทนาแบบเรียลไทม์
  • จับไอเดียอย่างรวดเร็ว — พูดระบายความคิดขณะเดินไปมาแทนการพิมพ์

สามวิธีในการใช้โหมดเสียง

Hermes มีประสบการณ์เสียงที่แตกต่างกันสามแบบ เลือกแบบที่เหมาะกับความต้องการของคุณ:

โหมด เหมาะสำหรับ แพลตฟอร์ม
วงจรไมโครโฟนแบบโต้ตอบ การใช้งานส่วนตัวแบบไม่ต้องใช้มือขณะเขียนโค้ด CLI
คำตอบด้วยเสียงในแชท คำตอบเป็นเสียงพร้อมกับการส่งข้อความปกติ Telegram, Discord
บอทช่องเสียงสด การสนทนาสดแบบกลุ่มหรือส่วนตัว ช่องเสียง Discord

เส้นทางที่ดีคือเริ่มจากง่ายๆ: ทำให้ข้อความทำงานก่อน จากนั้นเปิดใช้งานคำตอบด้วยเสียง และสุดท้ายขยับไปยังช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ

ขั้นตอนที่ 1: ตรวจสอบให้แน่ใจว่าโหมดข้อความทำงานก่อน

ก่อนจะแตะโหมดเสียง ให้ตรวจสอบว่า Hermes เริ่มทำงานและผู้ให้บริการของคุณได้รับการตั้งค่าแล้ว รัน hermes แล้วถามอะไรง่ายๆ เช่น:

What tools do you have available?

หากยังไม่เสถียร ให้แก้ไขโหมดข้อความก่อน โหมดเสียงสร้างต่อยอดจากส่วนนี้

ขั้นตอนที่ 2: ติดตั้งส่วนเสริมที่เหมาะสม

ขึ้นอยู่กับประสบการณ์เสียงที่คุณต้องการ ให้ติดตั้งส่วนเสริมที่เกี่ยวข้อง:

ไมโครโฟน + การเล่นเสียง CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

แพลตฟอร์มการส่งข้อความ (Telegram/Discord):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

ElevenLabs TTS ระดับพรีเมียม (ไม่บังคับ):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS ในเครื่อง (ไม่บังคับ):

python -m pip install -U neutts[all]

ทุกอย่าง:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ขั้นตอนที่ 3: ติดตั้ง dependencies ของระบบ

โหมดเสียงต้องใช้แพ็กเกจระบบสองสามตัวเพื่อจัดการกับอินพุตเสียง การแปลง และการเล่นเสียง

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

นี่คือเหตุผลว่าแต่ละตัวสำคัญอย่างไร:

  • portaudio → อินพุตไมโครโฟนและการเล่นเสียงสำหรับโหมดเสียง CLI
  • ffmpeg → การแปลงเสียงสำหรับ TTS และการส่งข้อความ
  • opus → รองรับตัวแปลงสัญญาณเสียง Discord
  • espeak-ng → ฟอนีไมเซอร์แบ็กเอนด์สำหรับ NeuTTS

ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด

Hermes รองรับทั้งสแตกเสียงในเครื่องและบนคลาวด์ การตั้งค่าที่ง่ายที่สุดและถูกที่สุดใช้ STT ในเครื่องและ Edge TTS ฟรี:

  • ผู้ให้บริการ STT: local
  • ผู้ให้บริการ TTS: edge

เพิ่มคีย์คลาวด์ใดๆ ลงใน ~/.hermes/.env:

# ตัวเลือก STT บนคลาวด์ (local ไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS ระดับพรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***

คำแนะนำสำหรับการแปลงเสียงพูดเป็นข้อความ:

  • local → ค่าเริ่มต้นที่ดีที่สุดสำหรับความเป็นส่วนตัวและค่าใช้จ่ายเป็นศูนย์
  • groq → การถอดเสียงบนคลาวด์ที่รวดเร็วมาก
  • openai → ตัวเลือกแบบเสียเงินที่ดี

คำแนะนำสำหรับการแปลงข้อความเป็นเสียงพูด:

  • edge → ฟรีและดีพอสำหรับผู้ใช้ส่วนใหญ่
  • neutts → TTS ในเครื่อง/บนอุปกรณ์ฟรี
  • elevenlabs → คุณภาพดีที่สุด
  • openai → ตัวกลางที่ดี
  • mistral → หลายภาษา, Opus ดั้งเดิม

ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ

นี่คือค่าเริ่มต้นที่ปลอดภัยและเหมาะสมสำหรับคนส่วนใหญ่:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

การตั้งค่า submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังจากการถอดเสียง:

  • direct (ค่าเริ่มต้น) ส่งข้อความที่ถอดเสียงทันที
  • draft วางข้อความที่ถอดเสียงไว้ในคอมโพเซอร์เพื่อให้คุณแก้ไขก่อนส่ง

สำหรับร่างเสียงที่แก้ไขได้ ให้ตั้งค่า submit_mode: "draft"

การใช้โหมดเสียงใน CLI

เริ่ม Hermes และเปิดโหมดเสียง:

hermes

จากนั้นภายใน CLI:

/voice on

ขั้นตอนการบันทึก:

  1. กด Ctrl+B
  2. พูด
  3. รอให้การตรวจจับความเงียบหยุดการบันทึกโดยอัตโนมัติ
  4. Hermes ถอดเสียงและตอบกลับ
  5. หากเปิด TTS ไว้ มันจะพูดคำตอบ
  6. วงจรสามารถเริ่มใหม่โดยอัตโนมัติเพื่อการใช้งานต่อเนื่อง

คำสั่งที่มีประโยชน์:

/voice
/voice on
/voice off
/voice tts
/voice status

เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม

การดีบักแบบเดินไปเดินมา: พูดว่า “ฉันเจอข้อผิดพลาดสิทธิ์ docker ตลอด ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ต้องใช้มือด้วยคำถามต่อเนื่องเช่น “อ่านข้อผิดพลาดล่าสุดอีกครั้ง” หรือ “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”

การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปมาในขณะที่คิด พูดความคิดที่ยังไม่เป็นรูปเป็นร่าง และขอให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์

การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงเป็นหนึ่งในวิธีที่เร็วที่สุดในการอยู่ในวงจร Hermes เต็มรูปแบบ

การปรับแต่งพฤติกรรม CLI

หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับการตั้งค่าความเงียบในคอนฟิกของคุณ:

voice:
  silence_threshold: 200
  silence_duration: 3.0

ลดค่า threshold หากมันหยุดเร็วเกินไป หรือเพิ่มค่าหากเสียงรบกวนพื้นหลังทำให้มันบันทึกต่อเนื่อง ค่า duration ควบคุมระยะเวลาของการหยุดพักที่ทำให้เกิดการหยุดบันทึก

โหมดเสียงเป็นตัวเปลี่ยนเกมเมื่อคุณตั้งค่าได้สำเร็จ เริ่มจากวงจร CLI พื้นฐาน จากนั้นขยายไปยังแพลตฟอร์มการส่งข้อความและช่องเสียง Discord เมื่อคุณเริ่มคุ้นเคย ขอให้สนุกกับการพูดคุย!

📖 เอกสารทางการ

この記事は Hermes Agent のเอกสารทางการに基づいています:เอกสารทางการ › guides/use-voice-mode-with-hermes