كيف تفرّغ المكالمات الهاتفية العربية بدقة (ولماذا تفشل فيها أغلب النماذج)

خط الهاتف يرمي معظم الصوت الذي يصغي إليه نموذج الكلام. هذا ما يفعله ذلك بالتفريغ العربي، وما قسناه، وكيف تبني تفريغًا للمكالمات يصمد.

فريق نُطقنُشر حُدّث 4 دقائق قراءة

سماعة رأس على مكتب في مركز اتصال هادئ عند الغروب، وخلفها صفوف مكاتب فارغة وأضواء المدينة.

إن كنت تفرّغ مكالمات عملاء عربية فأنت تعرف النمط: عرض المزوّد على صوت نظيف يبدو ممتازًا، والنصوص الخارجة من مركز اتصالك ليست كذلك. هذه الفجوة ليست سوء حظ. تفريغ المكالمات الهاتفية العربية مشكلة مختلفة عن تفريغ البودكاست، ويجب اختباره على هذا الأساس.

لماذا يصعب تفريغ صوت الهاتف العربي؟

يحدث أمران في وقت واحد خلال المكالمة.

الخط يرمي جزءًا من الصوت. صوت الهاتف التقليدي يُسجَّل بتردد 8 كيلوهرتز ويمرّر تقريبًا النطاق بين 300 و3400 هرتز، وكثير مما يميّز الحروف المتقاربة يقع فوق هذا النطاق. أضف إلى ذلك ترميزًا يضغط الصوت، واتصالًا جوّالًا يُسقط بعض الحزم، ومتصلًا على مكبّر الصوت في سيارته، فيصل إلى النموذج جزء يسير من الإشارة التي تدرّب عليها.

المتصل يتكلم باللهجة. مكالمات العملاء في الخليج باللهجة الخليجية، وكثيرًا ما تتخللها أسماء منتجات إنجليزية. والنموذج الذي يميل إلى الفصحى حين يتردد — راجع اللهجة الخليجية أم الفصحى — يميل إليها أكثر ما يكون حين يكون الصوت في أسوأ حالاته.

والأمران يتضاعفان: إشارة أقل تعني تخمينًا أكثر، والنموذج الذي يخمّن بالفصحى يعيد صياغة جزء أكبر مما قيل.

كم تتراجع النماذج على المكالمات الهاتفية؟

اختبرنا على الصوت الذي يهم فعلًا: مكالمة هاتفية حقيقية ضيّقة النطاق، لا صوت هاتف محاكى من تسجيلات استوديو. وعليها ارتكب نُطق أخطاء حروف أقل بنسبة 40% من المزوّد العربي الرائد.

هذا الاختبار جزء من تقييم أوسع شمل 986 مقطعًا — بثّ ومقابلات عفوية ومكالمات — قورن كل منها بنص كتبه إنسان. ونعتمد معدل خطأ الحروف لا الكلمات لأن العربية تلصق السوابق واللواحق بالكلمة، فقد يُحسب حرف واحد خاطئ كلمةً كاملة خاطئة؛ والحروف تعطي صورة أعدل عن قرب النص من الصواب.

كيف تفرّغ المكالمات العربية المسجّلة؟

أرسل كل تسجيل إلى نقطة التفريغ، طلبًا لكل ملف:

curl -X POST https://nutq.dev/v1/transcribe \
  -H "Authorization: Bearer $NUTQ_API_KEY" \
  -F "file=@call-2026-09-24-1043.wav" \
  -F "language=ar"

ملاحظات عملية لمراكز الاتصال:

  • احتفظ بالتسجيل الأصلي. لا ترفع تردد صوت 8 كيلوهرتز ولا "تحسّنه" قبل إرساله؛ فذلك لا يضيف شيئًا ينتفع به النموذج وقد يضيف تشوهات.
  • افصل التسجيلات المجسّمة. إن وضع جهاز التسجيل الموظف في قناة والعميل في أخرى، فأرسلهما منفصلين تحصل على نص نظيف لكل متحدث.
  • المعالجة الجماعية سريعة. بنحو 22 ضعف الزمن الحقيقي، تعود ساعة من المكالمات في أقل من ثلاث دقائق. والملفات حتى ساعة و100 ميغابايت تُرسل في طلب واحد.
  • سجّل حقل usage. كل استجابة تذكر تكلفة الطلب بالضبط، والطلبات الفاشلة لا تُحتسب.

الطلب والاستجابة كاملين في دليل تحويل الكلام العربي إلى نص.

كيف تفرّغ المكالمات العربية المباشرة؟

للمكالمات المباشرة نقطة WebSocket: ترسل إليها صوت PCM خامًا بدقة 16 بت، ويعود إليك النص كلما توقف المتحدث:

wss://worker.nutq.dev/v1/listen?encoding=linear16&sample_rate=8000&channels=2&channel=1
المعاملوظيفته
sample_rateمن 8000 إلى 48000 — أرسل صوت الهاتف بتردده الحقيقي 8 كيلوهرتز
channelsعدد القنوات المتداخلة التي ترسلها
channelالقناة التي تُفرَّغ، العميل وحده مثلًا
language‏auto افتراضيًا؛ أول دور طويل يحدد لغة المكالمة

وهي تتبع بروتوكول Deepgram المباشر، فيعمل أي عميل Deepgram موجود بتغيير الرابط. واعرف حدًّا واحدًا قبل أن تبني عليها: النتائج تصل بعد انتهاء العبارة — بنحو 700 ملّي ثانية من توقف المتحدث — لا كلمةً بكلمة أثناء الكلام. التوثيق يسرد كل الرسائل.

هل يمكن تشغيل التفريغ داخل شبكتنا؟

عند البنوك وشركات التأمين والجهات الحكومية، السؤال غالبًا ليس الدقة بل وجهة الصوت. يشغّل نُطق النماذج نفسها داخل شبكتك وعلى أجهزتك:

الواجهة المستضافةداخل شبكتك
مكان معالجة الصوتخوادم نُطقشبكتك
خروج الصوت من شبكتكنعم، عبر TLSلا شيء
التسعير0.15 دولار للساعةبلا رسوم على الدقيقة
الأجهزةلا شيءبطاقة رسومية واحدة بذاكرة 24 غيغابايت

وفي العمل الخاضع للتنظيم في الإمارات، هذا عادةً هو القرار كله. تحدّث معنا عن التشغيل الداخلي.

ما الذي تتحقق منه قبل اختيار مزوّد لتفريغ المكالمات؟

  1. اختبر على مكالماتك أنت — الخط الحقيقي واللهجات الحقيقية — لا على ملفات العرض.
  2. قيّم مقابل تفريغ يكتبه متحدث أصلي كما قيل، باللهجة.
  3. احسب أخطاء الحروف، واقرأ النصوص بحثًا عن كلمات لهجية أعيدت صياغتها فصحى.
  4. تحقق من الثواني الأخيرة من كل مكالمة ومن أسماء المنتجات التي تهمك.
  5. اسأل أين يُعالج الصوت ويُخزَّن، وهل يمكن أن يتغير ذلك.

رصيدك المجاني البالغ 5 دولارات عند التسجيل يغطي نحو 33 ساعة صوت — ما يكفي لاختبار حقيقي على مكالمات حقيقية.

أسئلة شائعة

لماذا يصعب تفريغ صوت الهاتف أكثر من غيره؟

صوت الهاتف التقليدي يُسجَّل بتردد 8 كيلوهرتز ويحتفظ تقريبًا بالنطاق بين 300 و3400 هرتز، فتضيع تفاصيل عالية التردد تميّز بين الحروف المتقاربة، وتُضاف تشوهات الضغط وضجيج الخط. والنماذج المدرّبة على صوت نظيف واسع النطاق تجد ما تعتمد عليه أقل.

هل يمكن تفريغ تسجيلات المكالمات المجسّمة حيث لكل طرف قناة؟

نعم. في البث المباشر يحدد المعامل channel القناة التي تُفرَّغ، فتفرّغ العميل والموظف كلًّا على حدة. وفي الملفات المسجّلة افصل القناتين وأرسل كل واحدة.

هل يمكن تفريغ المكالمات العربية دون إرسال الصوت إلى السحابة؟

نعم. يشغّل نُطق النماذج نفسها داخل شبكتك على بطاقة رسومية واحدة بذاكرة 24 غيغابايت. لا يغادر الشبكةَ أي صوت، ولا رسوم على الدقيقة.

ما سرعة تفريغ تسجيلات المكالمات دفعةً واحدة؟

نحو 22 ضعف الزمن الحقيقي: ساعة من المكالمات المسجّلة تُفرَّغ في أقل من ثلاث دقائق.

هل يمكن استخدام نُطق لوكيل صوتي على الهاتف؟

نعم. جانب الاستماع يبثّ المكالمة ويعيد كل دور حين يتوقف المتصل، وجانب النطق يرد بصوت خليجي. وفي التوثيق إعداد جاهز لمنصة Vapi.

شاركXLinkedInWhatsApp

بقلم فريق نُطق. نُطق واجهة برمجية للكلام العربي بُنيت في الإمارات: تحويل الكلام إلى نص يحافظ على اللهجة الخليجية، وتحويل النص إلى كلام عربي مع استنساخ الصوت.

Read in English

اسمعه على تسجيلاتك أنت.

رصيد مجاني بقيمة 5 دولارات للبداية — نحو 33 ساعة من التفريغ. بلا بطاقة.

كل المقالات