🤖HermesBlog
Hermes Feature Guides · جزء 68/9/2026

تحدث مع الذكاء الاصطناعي عبر الوضع الصوتي

Talk to AI with Voice Mode — easy-to-understand guide based on official docs

guide-use-voice-mode

تحدث مع الذكاء الاصطناعي عبر الوضع الصوتي

الوضع الصوتي هو أحد تلك الميزات التي تشعر وكأنها سحر في أول استخدام. بدلاً من كتابة كل أمر وقراءة كل رد، يمكنك فقط… التحدث. هيرميس يستمع ويفكر ويرد عليك بالكلام. هذا الدليل يرشدك خلال كل ما تحتاجه لتشغيل الوضع الصوتي، من إعداد ميكروفون بسيط إلى بوت قناة صوتية كامل على ديسكورد.

ما فائدة الوضع الصوتي

الوضع الصوتي يتألق عندما تكون يديك مشغولتين أو تريد طريقة أكثر طبيعية للتفاعل مع الذكاء الاصطناعي. إليك حالات الاستخدام الأكثر شيوعاً:

  • سير عمل CLI بدون استخدام اليدين — واصل البرمجة أو البحث بينما تتحدث مع هيرميس
  • ردود صوتية في تيليجرام أو ديسكورد — احصل على ردود صوتية بجانب الرسائل النصية العادية
  • قناة صوتية مباشرة على ديسكورد — اجعل هيرميس ينضم إلى قناة صوتية لمحادثة في الوقت الفعلي
  • التقاط أفكار سريعة — أمِل أفكارك بصوتك أثناء التجول بدلاً من الكتابة

ثلاث طرق لاستخدام الوضع الصوتي

يقدم هيرميس ثلاث تجارب صوتية مميزة. اختر ما يناسب احتياجاتك:

الوضع الأفضل لـ المنصة
حلقة الميكروفون التفاعلية الاستخدام الشخصي بدون استخدام اليدين أثناء البرمجة CLI
الردود الصوتية في الدردشة ردود منطوقة مع الرسائل العادية تيليجرام، ديسكورد
بوت قناة صوتية مباشرة محادثة مباشرة جماعية أو شخصية القنوات الصوتية في ديسكورد

مسار جيد هو البدء ببساطة: اجعل النص يعمل أولاً، ثم فعّل الردود الصوتية، وأخيراً انتقل إلى القنوات الصوتية في ديسكورد إذا أردت التجربة الكاملة.

الخطوة 1: تأكد من أن الوضع النصي يعمل أولاً

قبل لمس الوضع الصوتي، تحقق من أن هيرميس يعمل وأن مزود الخدمة مُعد بشكل صحيح. شغّل hermes واسأل شيئاً بسيطاً مثل:

What tools do you have available?

إذا لم يكن ذلك مستقراً بعد، أصلح الوضع النصي أولاً. الوضع الصوتي يُبنى فوقه.

الخطوة 2: ثبّت الإضافات المناسبة

اعتماداً على تجربة الصوت التي تريدها، ثبّت الإضافات المقابلة:

ميكروفون CLI + تشغيل الصوت:

cd ~/.hermes/hermes-agent && uv pip install -e ".[voice]"

منصات المراسلة (تيليجرام/ديسكورد):

cd ~/.hermes/hermes-agent && uv pip install -e ".[messaging]"

ElevenLabs TTS المميز (اختياري):

cd ~/.hermes/hermes-agent && uv pip install -e ".[tts-premium]"

NeuTTS المحلي (اختياري):

python -m pip install -U neutts[all]

كل شيء:

cd ~/.hermes/hermes-agent && uv pip install -e ".[all]"

الخطوة 3: ثبّت اعتماديات النظام

الوضع الصوتي يحتاج إلى بعض حزم النظام للتعامل مع إدخال الصوت وتحويله وتشغيله.

macOS:

brew install portaudio ffmpeg opus
brew install espeak-ng

أوبونتو / دبيان:

sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

إليك سبب أهمية كل منها:

  • portaudio → إدخال الميكروفون والتشغيل للوضع الصوتي في CLI
  • ffmpeg → تحويل الصوت لـ TTS وتسليم الرسائل
  • opus → دعم ترميز الصوت في ديسكورد
  • espeak-ng → محرك الصوتيات الخلفي لـ NeuTTS

الخطوة 4: اختر مزودي الكلام

يدعم هيرميس حزم الكلام المحلية والسحابية. الإعداد الأسهل والأرخص يستخدم STT محلي و Edge TTS مجاني:

  • مزود STT: local
  • مزود TTS: edge

أضف أي مفاتيح سحابية إلى ~/.hermes/.env:

# Cloud STT options (local needs no key)
GROQ_API_KEY=***
VOICE_TOOLS_OPENAI_KEY=***

# Premium TTS (optional)
ELEVENLABS_API_KEY=***

توصيات تحويل الكلام إلى نص:

  • local → أفضل خيار افتراضي للخصوصية وبتكلفة صفرية
  • groq → نسخ سحابي سريع جداً
  • openai → بديل مدفوع جيد

توصيات تحويل النص إلى كلام:

  • edge → مجاني وجيد بما يكفي لمعظم المستخدمين
  • neutts → TTS محلي/على الجهاز مجاني
  • elevenlabs → أفضل جودة
  • openai → حل وسط جيد
  • mistral → متعدد اللغات، Opus أصلي

الخطوة 5: الإعداد الموصى به

إليك إعداد افتراضي متين ومحافظ لمعظم الأشخاص:

voice:
  record_key: "ctrl+b"
  submit_mode: "direct"  # TUI: direct | draft
  max_recording_seconds: 120
  auto_tts: false
  beep_enabled: true
  silence_threshold: 200
  silence_duration: 3.0

stt:
  provider: "local"
  local:
    model: "base"

tts:
  provider: "edge"
  edge:
    voice: "en-US-AriaNeural"

إعداد submit_mode يتحكم في ما يحدث بعد النسخ:

  • direct (الافتراضي) يرسل النص المنسوخ فوراً
  • draft يضع النص المنسوخ في المحرر حتى تتمكن من التعديل قبل الإرسال

للحصول على مسودات صوتية قابلة للتعديل، اضبط submit_mode: "draft".

استخدام الوضع الصوتي في CLI

شغّل هيرميس وفعّل الوضع الصوتي:

hermes

ثم داخل CLI:

/voice on

خطوات التسجيل:

  1. اضغط Ctrl+B
  2. تحدث
  3. انتظر حتى يكتشف الصمت ويتوقف التسجيل تلقائياً
  4. هيرميس ينسخ ويرد
  5. إذا كان TTS مفعلاً، سيتحدث بالإجابة
  6. يمكن إعادة تشغيل الحلقة تلقائياً للاستخدام المستمر

أوامر مفيدة:

/voice
/voice on
/voice off
/voice tts
/voice status

سير عمل رائع في CLI

تصحيح الأخطاء بالمرور: قل “أستمر في الحصول على خطأ صلاحيات docker. ساعدني في تصحيحه.” ثم واصل بدون استخدام اليدين بأسئلة متابعة مثل “اقرأ الخطأ الأخير مرة أخرى” أو “الآن أعطني الإصلاح الدقيق.”

البحث والعصف الذهني: مثالي للتجول أثناء التفكير، وإملاء أفكار نصف مكتملة، وطلب هيرميس لتنظيم أفكارك في الوقت الفعلي.

إمكانية الوصول: إذا كانت الكتابة غير مريحة، فإن الوضع الصوتي هو أحد أسرع الطرق للبقاء في حلقة هيرميس الكاملة.

ضبط سلوك CLI

إذا بدأ هيرميس أو أوقف التسجيل بشكل مفرط، اضبط إعدادات الصمت في الإعدادات الخاصة بك:

voice:
  silence_threshold: 200
  silence_duration: 3.0

اخفض العتبة إذا كان يتوقف مبكراً جداً، أو ارفعها إذا كانت الضوضاء الخلفية تجعله يستمر في التسجيل. المدة تتحكم في طول التوقف الذي يؤدي إلى الإيقاف.

الوضع الصوتي يغير قواعد اللعبة بمجرد إعداده. ابدأ بحلقة CLI الأساسية، ثم توسع إلى منصات المراسلة والقنوات الصوتية في ديسكورد كلما أصبحت مرتاحاً. حديثاً سعيداً!

📖 التوثيق الرسمي

この記事は Hermes Agent のالتوثيق الرسميに基づいています:التوثيق الرسمي › guides/use-voice-mode-with-hermes