تحدث مع الذكاء الاصطناعي عبر الوضع الصوتي
Talk to AI with Voice Mode — easy-to-understand guide based on official docs
تحدث مع الذكاء الاصطناعي عبر الوضع الصوتي
الوضع الصوتي هو أحد تلك الميزات التي تشعر وكأنها سحر في أول استخدام. بدلاً من كتابة كل أمر وقراءة كل رد، يمكنك فقط… التحدث. هيرميس يستمع ويفكر ويرد عليك بالكلام. هذا الدليل يرشدك خلال كل ما تحتاجه لتشغيل الوضع الصوتي، من إعداد ميكروفون بسيط إلى بوت قناة صوتية كامل على ديسكورد.
ما فائدة الوضع الصوتي
الوضع الصوتي يتألق عندما تكون يديك مشغولتين أو تريد طريقة أكثر طبيعية للتفاعل مع الذكاء الاصطناعي. إليك حالات الاستخدام الأكثر شيوعاً:
- سير عمل CLI بدون استخدام اليدين — واصل البرمجة أو البحث بينما تتحدث مع هيرميس
- ردود صوتية في تيليجرام أو ديسكورد — احصل على ردود صوتية بجانب الرسائل النصية العادية
- قناة صوتية مباشرة على ديسكورد — اجعل هيرميس ينضم إلى قناة صوتية لمحادثة في الوقت الفعلي
- التقاط أفكار سريعة — أمِل أفكارك بصوتك أثناء التجول بدلاً من الكتابة
ثلاث طرق لاستخدام الوضع الصوتي
يقدم هيرميس ثلاث تجارب صوتية مميزة. اختر ما يناسب احتياجاتك:
| الوضع | الأفضل لـ | المنصة |
|---|---|---|
| حلقة الميكروفون التفاعلية | الاستخدام الشخصي بدون استخدام اليدين أثناء البرمجة | CLI |
| الردود الصوتية في الدردشة | ردود منطوقة مع الرسائل العادية | تيليجرام، ديسكورد |
| بوت قناة صوتية مباشرة | محادثة مباشرة جماعية أو شخصية | القنوات الصوتية في ديسكورد |
مسار جيد هو البدء ببساطة: اجعل النص يعمل أولاً، ثم فعّل الردود الصوتية، وأخيراً انتقل إلى القنوات الصوتية في ديسكورد إذا أردت التجربة الكاملة.
الخطوة 1: تأكد من أن الوضع النصي يعمل أولاً
قبل لمس الوضع الصوتي، تحقق من أن هيرميس يعمل وأن مزود الخدمة مُعد بشكل صحيح. شغّل hermes واسأل شيئاً بسيطاً مثل:
What tools do you have available?
إذا لم يكن ذلك مستقراً بعد، أصلح الوضع النصي أولاً. الوضع الصوتي يُبنى فوقه.
الخطوة 2: ثبّت الإضافات المناسبة
اعتماداً على تجربة الصوت التي تريدها، ثبّت الإضافات المقابلة:
ميكروفون CLI + تشغيل الصوت:
cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"
منصات المراسلة (تيليجرام/ديسكورد):
cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"
ElevenLabs TTS المميز (اختياري):
cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"
NeuTTS المحلي (اختياري):
python -m pip install -U neutts[all]
كل شيء:
cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"
الخطوة 3: ثبّت اعتماديات النظام
الوضع الصوتي يحتاج إلى بعض حزم النظام للتعامل مع إدخال الصوت وتحويله وتشغيله.
macOS:
brew install portaudio ffmpeg opus
brew install espeak-ng
أوبونتو / دبيان:
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng
إليك سبب أهمية كل منها:
portaudio→ إدخال الميكروفون والتشغيل للوضع الصوتي في CLIffmpeg→ تحويل الصوت لـ TTS وتسليم الرسائلopus→ دعم ترميز الصوت في ديسكوردespeak-ng→ محرك الصوتيات الخلفي لـ NeuTTS
الخطوة 4: اختر مزودي الكلام
يدعم هيرميس حزم الكلام المحلية والسحابية. الإعداد الأسهل والأرخص يستخدم STT محلي و Edge TTS مجاني:
- مزود STT:
local - مزود TTS:
edge
أضف أي مفاتيح سحابية إلى ~/.hermes/.env:
# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***
# Premium TTS (optional)
ELEVENLABS_API_KEY=***
توصيات تحويل الكلام إلى نص:
local→ أفضل خيار افتراضي للخصوصية وبتكلفة صفريةgroq→ نسخ سحابي سريع جداًopenai→ بديل مدفوع جيد
توصيات تحويل النص إلى كلام:
edge→ مجاني وجيد بما يكفي لمعظم المستخدمينneutts→ TTS محلي/على الجهاز مجانيelevenlabs→ أفضل جودةopenai→ حل وسط جيدmistral→ متعدد اللغات، Opus أصلي
الخطوة 5: الإعداد الموصى به
إليك إعداد افتراضي متين ومحافظ لمعظم الأشخاص:
voice:
record_key: "ctrl+b"
submit_mode: "direct" # TUI: direct | draft
max_recording_seconds: 120
auto_tts: false
beep_enabled: true
silence_threshold: 200
silence_duration: 3.0
stt:
provider: "local"
local:
model: "base"
tts:
provider: "edge"
edge:
voice: "en-US-AriaNeural"
إعداد submit_mode يتحكم في ما يحدث بعد النسخ:
direct(الافتراضي) يرسل النص المنسوخ فوراًdraftيضع النص المنسوخ في المحرر حتى تتمكن من التعديل قبل الإرسال
للحصول على مسودات صوتية قابلة للتعديل، اضبط submit_mode: "draft".
استخدام الوضع الصوتي في CLI
شغّل هيرميس وفعّل الوضع الصوتي:
hermes
ثم داخل CLI:
/voice on
خطوات التسجيل:
- اضغط
Ctrl+B - تحدث
- انتظر حتى يكتشف الصمت ويتوقف التسجيل تلقائياً
- هيرميس ينسخ ويرد
- إذا كان TTS مفعلاً، سيتحدث بالإجابة
- يمكن إعادة تشغيل الحلقة تلقائياً للاستخدام المستمر
أوامر مفيدة:
/voice
/voice on
/voice off
/voice tts
/voice status
سير عمل رائع في CLI
تصحيح الأخطاء بالمرور: قل “أستمر في الحصول على خطأ صلاحيات docker. ساعدني في تصحيحه.” ثم واصل بدون استخدام اليدين بأسئلة متابعة مثل “اقرأ الخطأ الأخير مرة أخرى” أو “الآن أعطني الإصلاح الدقيق.”
البحث والعصف الذهني: مثالي للتجول أثناء التفكير، وإملاء أفكار نصف مكتملة، وطلب هيرميس لتنظيم أفكارك في الوقت الفعلي.
إمكانية الوصول: إذا كانت الكتابة غير مريحة، فإن الوضع الصوتي هو أحد أسرع الطرق للبقاء في حلقة هيرميس الكاملة.
ضبط سلوك CLI
إذا بدأ هيرميس أو أوقف التسجيل بشكل مفرط، اضبط إعدادات الصمت في الإعدادات الخاصة بك:
voice:
silence_threshold: 200
silence_duration: 3.0
اخفض العتبة إذا كان يتوقف مبكراً جداً، أو ارفعها إذا كانت الضوضاء الخلفية تجعله يستمر في التسجيل. المدة تتحكم في طول التوقف الذي يؤدي إلى الإيقاف.
الوضع الصوتي يغير قواعد اللعبة بمجرد إعداده. ابدأ بحلقة CLI الأساسية، ثم توسع إلى منصات المراسلة والقنوات الصوتية في ديسكورد كلما أصبحت مرتاحاً. حديثاً سعيداً!
📖 التوثيق الرسمي
この記事は Hermes Agent のالتوثيق الرسميに基づいています:التوثيق الرسمي › guides/use-voice-mode-with-hermes