🤖HermesBlog
Hermes Version History · Parte 28/9/2026

Hermes v2026.8.3 อัปเดต: เสียงแบบเรียลไทม์, การสื่อสารระหว่างเอเจนต์ และการอ้างอิงที่ตรวจสอบได้

Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)

hermes-version-2026-8-3

Hermes v2026.8.3 อัปเดต: เสียงแบบเรียลไทม์, การสื่อสารระหว่างเอเจนต์ และการอ้างอิงที่ตรวจสอบได้

สวัสดีทุกคน ยินดีต้อนรับกลับสู่บล็อก Hermes! วันนี้เราจะมาพูดถึงหนึ่งในอัปเดตที่น่าตื่นเต้นที่สุดเท่าที่เคยมีมา: โหมดเสียงแบบเรียลไทม์ ถ้าคุณเคยอยากคุยกับเอเจนต์แทนที่จะพิมพ์คำสั่งทุกครั้ง อัปเดตนี้คือสิ่งที่คุณรอคอย และที่สำคัญที่สุด? การตั้งค่าง่ายกว่าที่คุณคิดมาก

มาดูทุกสิ่งที่คุณต้องรู้เพื่อให้โหมดเสียงทำงานได้ตั้งแต่วันนี้กันเลย

โหมดเสียงเหมาะกับอะไรจริงๆ

โหมดเสียงไม่ใช่แค่ของเล่น—มันมีประโยชน์จริงๆ ในหลายสถานการณ์:

  • เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ ขณะที่คุณเขียนโค้ดหรือค้นคว้าข้อมูล
  • การตอบกลับด้วยเสียง ภายใน Telegram หรือ Discord โดยตรง
  • การสนทนาสด กับ Hermes ที่อยู่ในช่องเสียง Discord
  • การจับไอเดียอย่างรวดเร็ว ขณะเดินไปมา แทนที่จะหยุดพิมพ์

ลองคิดว่าเอเจนต์ของคุณกลายเป็นคู่สนทนา ไม่ใช่แค่กล่องข้อความ

สามวิธีในการใช้เสียง

มีประสบการณ์เสียงสามแบบที่แตกต่างกันใน Hermes และคุณสามารถเลือกแบบที่เหมาะกับสไตล์ของคุณ:

โหมด เหมาะสำหรับ แพลตฟอร์ม
ไมโครโฟนแบบวนซ้ำแบบโต้ตอบ การใช้งานส่วนตัวแบบไม่ใช้มือ CLI
การตอบกลับด้วยเสียงในแชท การตอบด้วยเสียงควบคู่กับการส่งข้อความ Telegram, Discord
บอทช่องเสียงสด การสนทนาสดแบบกลุ่มหรือส่วนตัว ช่องเสียง Discord

เส้นทางที่แนะนำ: ทำให้ข้อความทำงานก่อน จากนั้นเปิดการตอบกลับด้วยเสียง และสุดท้ายลองช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ

ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน

ก่อนจะแตะเสียง ตรวจสอบให้แน่ใจว่าพื้นฐานทำงานได้ดี:

hermes

จากนั้นถามอะไรง่ายๆ:

คุณมีเครื่องมืออะไรบ้าง?

ถ้าใช้งานได้ คุณก็พร้อมไปต่อ

ขั้นตอนที่ 2: ติดตั้งแพ็กเกจเพิ่มเติมที่เหมาะสม

ขึ้นอยู่กับสิ่งที่คุณต้องการ ให้ติดตั้งแพ็กเกจที่เหมาะสม:

ไมโครโฟน + การเล่นเสียงสำหรับ CLI:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

แพลตฟอร์มการส่งข้อความ:

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

TTS ระดับพรีเมียมจาก ElevenLabs:

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS ในเครื่อง (ไม่บังคับ):

python -m pip install -U neutts[all]

ติดตั้งทั้งหมดในครั้งเดียว:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

ขั้นตอนที่ 3: ระบบดีเพนเดนซี

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

Ubuntu / Debian:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

นี่คือเหตุผลว่าทำไมแต่ละตัวถึงสำคัญ:

  • portaudio → รับเสียงจากไมโครโฟนและการเล่นเสียง
  • ffmpeg → การแปลงเสียง
  • opus → รองรับตัวแปลงสัญญาณเสียง Discord
  • espeak-ng → ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS

ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด

Hermes รองรับทั้งสแต็กเสียงในเครื่องและบนคลาวด์ การตั้งค่าที่ง่ายและถูกที่สุดคือ STT ในเครื่องกับ Edge TTS ฟรี:

  • ผู้ให้บริการ STT: local
  • ผู้ให้บริการ TTS: edge

เพิ่มคีย์ API ใดๆ ลงใน ~/.hermes/.env:

# ตัวเลือก STT บนคลาวด์ (local ไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# TTS ระดับพรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***

คำแนะนำด่วน:

  • STT: local เพื่อความเป็นส่วนตัว, groq เพื่อความเร็ว, openai เป็นตัวเลือกสำรองแบบเสียเงิน
  • TTS: edge ฟรี, neutts สำหรับในเครื่อง, elevenlabs เพื่อคุณภาพดีที่สุด

ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ

นี่คือค่าเริ่มต้นที่ปลอดภัยและรอบคอบ:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

การตั้งค่าที่สำคัญอย่างหนึ่ง: voice.submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังการถอดเสียง direct จะส่งทันที ในขณะที่ draft ให้คุณแก้ไขก่อนส่ง สำหรับแบบร่างที่แก้ไขได้ ให้ตั้งค่า:

voice:
  submit_mode: "draft"

การใช้เสียงใน CLI

เริ่ม Hermes และเปิดโหมดเสียง:

hermes

จากนั้นภายใน CLI:

/voice on

ขั้นตอนการบันทึก:

  1. กด Ctrl+B
  2. พูด
  3. รอให้ระบบตรวจจับความเงียบหยุดโดยอัตโนมัติ
  4. Hermes ถอดเสียงและตอบกลับ
  5. ถ้าเปิด TTS ไว้ มันจะพูดคำตอบออกมา

คำสั่งที่มีประโยชน์:

/voice
/voice on
/voice off
/voice tts
/voice status

เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม

การดีบักแบบเดินไปมา: แค่พูดว่า “ฉันเจอ error permission ของ docker ซ้ำๆ ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ใช้มือ: “อ่าน error ล่าสุดอีกครั้ง” “อธิบายสาเหตุที่แท้จริงให้เข้าใจง่ายขึ้น” “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”

การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปมาในขณะที่คิด พูดไอเดียที่ยังไม่สมบูรณ์ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์

การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes เต็มรูปแบบได้โดยไม่ต้องใช้คีย์บอร์ด

การปรับแต่งพฤติกรรม

หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับค่า silence_threshold และ silence_duration ในคอนฟิกของคุณ

แค่นี้เอง! โหมดเสียงพร้อมใช้งานแล้ว เริ่มจากข้อความ เพิ่มการตอบกลับด้วยเสียง และสำรวจช่องเสียง Discord เมื่อคุณพร้อม สนุกกับการพูดคุย!

📖 เอกสารทางการ

この記事は Hermes Agent のเอกสารทางการに基づいています:GitHub ›/releases/tag/v2026.8.3