Hermes v2026.8.3 อัปเดต: เสียงแบบเรียลไทม์, การสื่อสารระหว่างเอเจนต์ และการอ้างอิงที่ตรวจสอบได้
Hermes v2026.8.3 (2026-08-03) update: Hermes Agent v0.20.0 (2026.8.3)
Hermes v2026.8.3 อัปเดต: เสียงแบบเรียลไทม์, การสื่อสารระหว่างเอเจนต์ และการอ้างอิงที่ตรวจสอบได้
สวัสดีทุกคน ยินดีต้อนรับกลับสู่บล็อก Hermes! วันนี้เราจะมาพูดถึงหนึ่งในอัปเดตที่น่าตื่นเต้นที่สุดเท่าที่เคยมีมา: โหมดเสียงแบบเรียลไทม์ ถ้าคุณเคยอยากคุยกับเอเจนต์แทนที่จะพิมพ์คำสั่งทุกครั้ง อัปเดตนี้คือสิ่งที่คุณรอคอย และที่สำคัญที่สุด? การตั้งค่าง่ายกว่าที่คุณคิดมาก
มาดูทุกสิ่งที่คุณต้องรู้เพื่อให้โหมดเสียงทำงานได้ตั้งแต่วันนี้กันเลย
โหมดเสียงเหมาะกับอะไรจริงๆ
โหมดเสียงไม่ใช่แค่ของเล่น—มันมีประโยชน์จริงๆ ในหลายสถานการณ์:
- เวิร์กโฟลว์ CLI แบบไม่ต้องใช้มือ ขณะที่คุณเขียนโค้ดหรือค้นคว้าข้อมูล
- การตอบกลับด้วยเสียง ภายใน Telegram หรือ Discord โดยตรง
- การสนทนาสด กับ Hermes ที่อยู่ในช่องเสียง Discord
- การจับไอเดียอย่างรวดเร็ว ขณะเดินไปมา แทนที่จะหยุดพิมพ์
ลองคิดว่าเอเจนต์ของคุณกลายเป็นคู่สนทนา ไม่ใช่แค่กล่องข้อความ
สามวิธีในการใช้เสียง
มีประสบการณ์เสียงสามแบบที่แตกต่างกันใน Hermes และคุณสามารถเลือกแบบที่เหมาะกับสไตล์ของคุณ:
| โหมด | เหมาะสำหรับ | แพลตฟอร์ม |
|---|---|---|
| ไมโครโฟนแบบวนซ้ำแบบโต้ตอบ | การใช้งานส่วนตัวแบบไม่ใช้มือ | CLI |
| การตอบกลับด้วยเสียงในแชท | การตอบด้วยเสียงควบคู่กับการส่งข้อความ | Telegram, Discord |
| บอทช่องเสียงสด | การสนทนาสดแบบกลุ่มหรือส่วนตัว | ช่องเสียง Discord |
เส้นทางที่แนะนำ: ทำให้ข้อความทำงานก่อน จากนั้นเปิดการตอบกลับด้วยเสียง และสุดท้ายลองช่องเสียง Discord หากคุณต้องการประสบการณ์เต็มรูปแบบ
ขั้นตอนที่ 1: ทำให้ข้อความทำงานก่อน
ก่อนจะแตะเสียง ตรวจสอบให้แน่ใจว่าพื้นฐานทำงานได้ดี:
hermes
จากนั้นถามอะไรง่ายๆ:
คุณมีเครื่องมืออะไรบ้าง?
ถ้าใช้งานได้ คุณก็พร้อมไปต่อ
ขั้นตอนที่ 2: ติดตั้งแพ็กเกจเพิ่มเติมที่เหมาะสม
ขึ้นอยู่กับสิ่งที่คุณต้องการ ให้ติดตั้งแพ็กเกจที่เหมาะสม:
ไมโครโฟน + การเล่นเสียงสำหรับ CLI:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
แพลตฟอร์มการส่งข้อความ:
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
TTS ระดับพรีเมียมจาก ElevenLabs:
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS ในเครื่อง (ไม่บังคับ):
python -m pip install -U neutts[all]
ติดตั้งทั้งหมดในครั้งเดียว:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
ขั้นตอนที่ 3: ระบบดีเพนเดนซี
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
Ubuntu / Debian:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
นี่คือเหตุผลว่าทำไมแต่ละตัวถึงสำคัญ:
portaudio→ รับเสียงจากไมโครโฟนและการเล่นเสียงffmpeg→ การแปลงเสียงopus→ รองรับตัวแปลงสัญญาณเสียง Discordespeak-ng→ ตัวแปลงเสียงเป็นหน่วยเสียงสำหรับ NeuTTS
ขั้นตอนที่ 4: เลือกผู้ให้บริการเสียงพูด
Hermes รองรับทั้งสแต็กเสียงในเครื่องและบนคลาวด์ การตั้งค่าที่ง่ายและถูกที่สุดคือ STT ในเครื่องกับ Edge TTS ฟรี:
- ผู้ให้บริการ STT:
local - ผู้ให้บริการ TTS:
edge
เพิ่มคีย์ API ใดๆ ลงใน ~/.hermes/.env:
# ตัวเลือก STT บนคลาวด์ (local ไม่ต้องใช้คีย์)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# TTS ระดับพรีเมียม (ไม่บังคับ)
ELEVENLABS_API_KEY=***
คำแนะนำด่วน:
- STT:
localเพื่อความเป็นส่วนตัว,groqเพื่อความเร็ว,openaiเป็นตัวเลือกสำรองแบบเสียเงิน - TTS:
edgeฟรี,neuttsสำหรับในเครื่อง,elevenlabsเพื่อคุณภาพดีที่สุด
ขั้นตอนที่ 5: การตั้งค่าที่แนะนำ
นี่คือค่าเริ่มต้นที่ปลอดภัยและรอบคอบ:
voice:
record_key: "ctrl+b"
submit_mode: "direct"
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
การตั้งค่าที่สำคัญอย่างหนึ่ง: voice.submit_mode ควบคุมสิ่งที่เกิดขึ้นหลังการถอดเสียง direct จะส่งทันที ในขณะที่ draft ให้คุณแก้ไขก่อนส่ง สำหรับแบบร่างที่แก้ไขได้ ให้ตั้งค่า:
voice:
submit_mode: "draft"
การใช้เสียงใน CLI
เริ่ม Hermes และเปิดโหมดเสียง:
hermes
จากนั้นภายใน CLI:
/voice on
ขั้นตอนการบันทึก:
- กด
Ctrl+B - พูด
- รอให้ระบบตรวจจับความเงียบหยุดโดยอัตโนมัติ
- Hermes ถอดเสียงและตอบกลับ
- ถ้าเปิด TTS ไว้ มันจะพูดคำตอบออกมา
คำสั่งที่มีประโยชน์:
/voice
/voice on
/voice off
/voice tts
/voice status
เวิร์กโฟลว์ CLI ที่ยอดเยี่ยม
การดีบักแบบเดินไปมา: แค่พูดว่า “ฉันเจอ error permission ของ docker ซ้ำๆ ช่วยดีบักให้หน่อย” จากนั้นดำเนินการต่อแบบไม่ใช้มือ: “อ่าน error ล่าสุดอีกครั้ง” “อธิบายสาเหตุที่แท้จริงให้เข้าใจง่ายขึ้น” “ตอนนี้บอกวิธีแก้ที่แน่นอนให้ฉัน”
การค้นคว้าและระดมสมอง: เหมาะสำหรับการเดินไปมาในขณะที่คิด พูดไอเดียที่ยังไม่สมบูรณ์ และให้ Hermes จัดโครงสร้างความคิดของคุณแบบเรียลไทม์
การเข้าถึง: หากการพิมพ์ไม่สะดวก โหมดเสียงช่วยให้คุณอยู่ในวงจร Hermes เต็มรูปแบบได้โดยไม่ต้องใช้คีย์บอร์ด
การปรับแต่งพฤติกรรม
หาก Hermes เริ่มหรือหยุดบันทึกเสียงเร็วหรือช้าเกินไป ให้ปรับค่า silence_threshold และ silence_duration ในคอนฟิกของคุณ
แค่นี้เอง! โหมดเสียงพร้อมใช้งานแล้ว เริ่มจากข้อความ เพิ่มการตอบกลับด้วยเสียง และสำรวจช่องเสียง Discord เมื่อคุณพร้อม สนุกกับการพูดคุย!
📖 เอกสารทางการ
この記事は Hermes Agent のเอกสารทางการに基づいています:GitHub ›/releases/tag/v2026.8.3