كيف تبني وكيلًا صوتيًا يتكلم باللهجة الخليجية على منصة Vapi
أغلب منصات الوكلاء الصوتيين تتعثر حين يتكلم المتصل باللهجة الخليجية. كتلتان من إعدادات Vapi تصلحان طرفي المكالمة: سماع المتصل والرد عليه.
فريق نُطقنُشر 3 دقائق قراءة

على أي وكيل صوتي عربي أن يفعل أمرين تعجز عنهما أغلب المنصات: أن يفهم متصلًا من دبي أو الرياض يتكلم باللهجة على خط هاتفي، وأن يرد بصوت يبدو خليجيًا فعلًا. يشرح هذا الدليل ربط طرفي مساعد Vapi بنُطق، وما يجب مراقبته حين يبدأ باستقبال مكالمات حقيقية.
لماذا تفشل الوكلاء الصوتية العربية عادةً؟
الحلقة الأضعف عادةً هي السمع، لا النموذج اللغوي. Deepgram، المفرّغ الافتراضي في أغلب المنصات الصوتية، ليس لديه نموذج عربي مخصص: nova-2 وnova-3 يرفضان ar صراحة، ووضعه متعدد اللغات وحده يقبلها، فيحسب الخليجية لغات أخرى. والوكيل الذي لا يسمع المتصل لا يستطيع مساعدته، مهما كانت تعليماته جيدة.
والطرف الآخر يفشل بهدوء أكبر: صوت بفصحى إذاعية يرد على متصل خليجي يبدو كتسجيل حكومي، لا كمحادثة.
كيف تربط طرف الاستماع؟
تفتح Vapi اتصال WebSocket وتبثّ المكالمة عبره، ويعيد نُطق كل دور نصًا حين يتوقف المتصل. أضف هذا إلى المساعد:
"transcriber": {
"provider": "custom-transcriber",
"server": {
"url": "wss://worker.nutq.dev/v1/transcribe/stream?key=$NUTQ_STREAM_KEY&language=auto",
"timeoutSeconds": 30
}
}
مصافحة WebSocket لا تحمل ترويسات تتحكم فيها، لذا يوضع المفتاح في الرابط. استخدم هنا مفتاحًا منفصلًا ليمكن إلغاؤه وحده إن التقطه سجلّ ما. وتأكد أن حسابك في Vapi يقبل custom-transcriber قبل أن تبني عليه، فبعض الحسابات ترفضه عند النشر.
ومع language=auto يحدد أول دور طويل بما يكفي لغةَ المكالمة، وترثها الردود القصيرة — فالمتصل الذي يقول «نعم» فقط لا يُعاد تخمين لغته من كلمة واحدة.
كيف تربط طرف النطق؟
ترسل Vapi كل سطر يريد نموذجها قوله، وتشغّل الصوت الذي تعيده:
"voice": {
"provider": "custom-voice",
"server": {
"url": "https://nutq.dev/v1/vapi/voice?voice=rashid",
"headers": { "Authorization": "Bearer $NUTQ_API_KEY" },
"timeoutSeconds": 45
}
}
| إعداد الرابط | وظيفته |
|---|---|
voice | صوت خليجي من GET /v1/voices، أو صوت محفوظ في حسابك |
language | استخدام محرك اللغات الأخرى بدل العربية |
nfe_step | الجودة مقابل السرعة؛ القيمة الافتراضية هنا 16، أقل من 32 في الاستوديو |
الإعدادات في الرابط لأن Vapi تملك جسم الطلب. وأي تردد تطلبه Vapi — 8000 أو 16000 أو 22050 أو 24000 هرتز — يعود كما هو، صوتًا أحادي القناة بدقة 16 بت.
كيف تبقى المحادثة طبيعية؟
ثلاث قواعد تفرّق بين محادثة وطابور انتظار:
- ردود قصيرة. كل رد يُولَّد كاملًا قبل أن يسمع المتصل منه شيئًا. اطلب من النموذج في تعليماته أن يجيب في جملة أو جملتين.
- دع الأدوار تنتهي طبيعيًا. ينتهي الدور بعد نحو 700 ملّي ثانية من الهدوء. والتوقف وسط الجملة طبيعي ولا يقسم الدور، وما يتجاوز 15 ثانية يُفرَّغ على أي حال بدل انتظار توقف قد لا يأتي.
- اكتب التعليمات باللهجة التي تريدها في الرد. إن أردت أن يبدو الوكيل خليجيًا فأعطه أمثلة خليجية. الصوت يقرأ النص الذي يُعطى له؛ وراجع تحويل النص العربي إلى كلام واستنساخ الصوت لضبط النطق.
كم تكلّف المكالمة؟
| الطرف | يُحتسب | السعر |
|---|---|---|
| الاستماع | تفريغ | 0.15 دولار لكل ساعة صوت |
| النطق | تحويل نص إلى كلام | 0.05 دولار لكل ألف حرف |
كلاهما على المفتاح الموجود في الإعدادات، والطلبات الفاشلة لا تُحتسب. والحسابات الجديدة تبدأ برصيد مجاني بقيمة 5 دولارات عند التسجيل.
ما الذي تختبره قبل الإطلاق؟
- متصلون حقيقيون على خطوط هاتف حقيقية — صوت النطاق الضيق يتصرف بشكل مختلف؛ راجع تفريغ المكالمات الهاتفية العربية.
- متصلون يتنقلون بين العربية والإنجليزية وسط المكالمة.
- إجابات قصيرة جدًا («إي»، «لا»، «تمام») وشكاوى طويلة.
- الأرقام والتواريخ وأسماء المنتجات حين تُقرأ على المتصل.
ويمكنك استخدام أي طرف وحده: نُطق للسمع مع صوت آخر، أو العكس. والإعدادات كاملة، بكل الملاحظات أعلاه، في التوثيق.
أسئلة شائعة
هل تدعم منصة Vapi اللغة العربية؟
تتيح Vapi ربط مفرّغ مخصص وصوت مخصص. وباستخدام نُطق في الطرفين، يسمع مساعد Vapi المتصلين باللهجة الخليجية ويرد عليهم بصوت خليجي.
لماذا لا أستخدم المفرّغ الافتراضي للعربية؟
Deepgram، المفرّغ الافتراضي في أغلب المنصات الصوتية، ليس لديه نموذج عربي مخصص: nova-2 وnova-3 يرفضان ar، ووضعه متعدد اللغات وحده يقبلها، فيخلط بين الخليجية ولغات أخرى.
ما سرعة استجابة الوكيل؟
ينتهي دور المتصل بعد نحو 700 ملّي ثانية من الصمت، ثم يُولَّد الرد كاملًا قبل تشغيله، لذا فالردود القصيرة هي ما يُبقي المحادثة طبيعية.
أي صوت أستخدم؟
أي صوت خليجي من GET /v1/voices، يُمرَّر في الرابط باسم voice مثل rashid. والصوت المحفوظ في حسابك يعمل بالطريقة نفسها.
كم تكلّف المكالمة؟
الاستماع يُحتسب تفريغًا بسعر 0.15 دولار لكل ساعة صوت، والنطق يُحتسب تحويل نص إلى كلام بسعر 0.05 دولار لكل ألف حرف، وكلاهما على المفتاح الموجود في إعداداتك.
بقلم فريق نُطق. نُطق واجهة برمجية للكلام العربي بُنيت في الإمارات: تحويل الكلام إلى نص يحافظ على اللهجة الخليجية، وتحويل النص إلى كلام عربي مع استنساخ الصوت.
Read in Englishاسمعه على تسجيلاتك أنت.
رصيد مجاني بقيمة 5 دولارات للبداية — نحو 33 ساعة من التفريغ. بلا بطاقة.
تابع القراءة
كل المقالات
تحويل الكلام إلى نص3 دقائق قراءة
كيف تفرّغ الرسائل الصوتية العربية إلى نص (واتساب وتيليغرام وتسجيلات المكالمات)
في الخليج، يجري كثير من العمل عبر الرسائل الصوتية — طلبات وشكاوى وتعليمات. هكذا تحوّلها إلى نص تبحث فيه وتعيد إرساله وتتصرف بناءً عليه، باللهجة التي قيلت بها.

التشغيل الداخلي4 دقائق قراءة
التعرّف على الكلام العربي داخل شبكتك: كل تسجيل يبقى عندك
عند البنك أو الوزارة، السؤال الأول عن التعرّف على الكلام العربي ليس الدقة، بل وجهة التسجيلات. هذا ما يتطلبه تشغيل النماذج داخل شبكتك.

تحويل الكلام إلى نص3 دقائق قراءة
التفريغ الصوتي العربي المباشر عبر WebSocket (بديل جاهز لعملاء Deepgram)
إن كنت قد كتبت عميلًا لـDeepgram، فقد كتبت معظم مفرّغ عربي مباشر. غيّر الرابط، وهذا بالضبط ما يعود إليك — وما لا يعود.