# تحويل النص العربي إلى كلام مع استنساخ الصوت: دليل النطق الآلي باللهجة الخليجية

> ست إلى ثماني ثوانٍ من كلام شخص ما، والكلمات التي قالها، والنص الذي تريد قراءته — هذا كل ما يحتاجه استنساخ صوت خليجي. كيف تحصل على نتيجة طبيعية، والحيلة الواحدة التي تصلح أغلب أخطاء النطق.

- المصدر: https://nutq.dev/ar/blog/arabic-text-to-speech-voice-cloning
- نُشر: 2026-09-24
- حُدّث: 2026-09-25
- الكاتب: nutq team (https://nutq.dev)

## الجواب المختصر

لتوليد كلام عربي بصوت محدد، أرسل النص وتسجيلًا مرجعيًا مدته 6 إلى 8 ثوانٍ ونصّ ذلك التسجيل إلى واجهة تحويل نص إلى كلام تدعم استنساخ الصوت. نقطة ‎/v1/speech في نُطق تعيد ملف WAV بلكنة خليجية (النموذج مدرَّب على كلام إماراتي وسعودي)، وتقبل حتى 5000 حرف في الطلب، وتكلّف 0.05 دولار لكل ألف حرف. ولإصلاح كلمة نُطقت خطأً، شكّل تلك الكلمة وحدها.

أغلب أنظمة تحويل النص العربي إلى كلام تبدو كنشرة المساء: صحيحة ورسمية ولا تشبه كلام أحد في الخليج. هذا مقبول في إعلان محطة قطار، لكنه خاطئ لوكيل خدمة عملاء أو لصوت علامة تجارية أو لتعليق صوتي على فيديو موجّه إلى جمهور في دبي أو الرياض. يشرح هذا الدليل **تحويل النص إلى كلام مع استنساخ الصوت** — توليد كلام خليجي بصوت محدد من بضع ثوانٍ من التسجيل.

## ما استنساخ الصوت العربي؟

استنساخ الصوت يجعل نموذج تحويل النص إلى كلام ينطق بصوت شخص معيّن اعتمادًا على عيّنة قصيرة من كلامه، بدل صوت جاهز ثابت. تعطيه ثلاثة أشياء:

1. **`reference`** — تسجيل للصوت، ويُفضَّل أن يكون بين ست وثماني ثوانٍ.
2. **`ref_text`** — ما يُقال في هذا التسجيل بالضبط، ويطابق النموذج الصوت معه.
3. **`text`** — ما تريد أن يقوله الصوت.

والنتيجة ملف WAV لنصك، بذلك الصوت، وبلكنة خليجية. فالنموذج `nutq-speak-1` مدرَّب على كلام إماراتي وسعودي، فيبدو خليجيًا لا فصحى إذاعية.

## كيف تولّد كلامًا عربيًا عبر الواجهة البرمجية؟

```bash
curl -X POST https://nutq.dev/v1/speech \
  -H "Authorization: Bearer $NUTQ_API_KEY" \
  -F "text=هلا وغلا فيك، شحالك اليوم؟" \
  -F "reference=@voice.wav" \
  -F "ref_text=نص التسجيل المرجعي" \
  --output speech.wav
```

جسم الاستجابة هو الصوت نفسه، لذا تعود بيانات الاستخدام في الترويسات:

```text
HTTP/1.1 200 OK
Content-Type: audio/wav
X-Nutq-Characters: 57
X-Nutq-Audio-Seconds: 5.672
X-Nutq-Cost-USD: 0.000285
X-Nutq-Model: nutq-speak-1
```

والطلب نفسه بلغة Python:

```python
import requests

res = requests.post(
    "https://nutq.dev/v1/speech",
    headers={"Authorization": f"Bearer {NUTQ_API_KEY}"},
    data={"text": "هلا وغلا فيك", "ref_text": "نص التسجيل المرجعي"},
    files={"reference": open("voice.wav", "rb")},
)
open("speech.wav", "wb").write(res.content)
```

## ما الذي يجعل التسجيل المرجعي جيدًا؟

المقطع المرجعي يحدد معظم الجودة. قواعد قليلة تصنع الفرق:

| افعل | تجنّب |
|---|---|
| من 6 إلى 8 ثوانٍ من كلام متصل | مقاطع تزيد على 20 ثانية، فهي تُرفض |
| متحدث واحد قريب من الميكروفون | موسيقى خلفية، أو صوت ثانٍ، أو صدى |
| النبرة التي تريدها — هادئة، دافئة، حيوية | قراءة رتيبة إن كنت تريد نتيجة حيوية |
| ‏`ref_text` يطابق الصوت كلمةً بكلمة | ملخّص أو صيغة منقّحة لما قيل |

المقاطع الأطول مقبولة، لكنها تُقصّ إلى نحو ثماني ثوانٍ ويُعاد تفريغها، وهذا يكلّف رحلة إضافية وقد يختار جزءًا أقل تمثيلًا للصوت. قصّها بنفسك.

ولا تستنسخ إلا صوتًا لديك إذن باستخدامه — صوتك، أو متحدث وافق على ذلك.

## كيف تصلح كلمة نُطقت خطأً؟

العربية تُكتب عادةً بلا حركات وتُقرأ من السياق، فالكلمة التي تحتمل قراءتين تُخمَّن. «تعد» قد تكون تَعُدّ أو تُعَدّ، و«درس» قد تكون دَرَسَ أو دَرَّسَ. والحل أن **تشكّل تلك الكلمة وحدها**:

> تُعَدُّ دولة الإمارات من أبرز الدول

شكّل ما يحتمل اللبس فقط، كما تُكتب العربية عادةً. تشكيل كل الكلمات يغيّر الإلقاء لا الحركات فحسب: يطول الكلام بنحو النصف ويبدو كالتلاوة. وقد جرّبنا أدوات التشكيل الآلي ولا نوصي بها، فهي تضيف أخطاءها الخاصة، خصوصًا في اللهجة.

## كيف توازن بين الجودة والسرعة؟

| المعامل | الافتراضي | وظيفته |
|---|---|---|
| `nfe_step` | 32 | الجودة مقابل السرعة، من 8 إلى 96. القيمة 64 أنظف بوضوح وأبطأ بنحو الضعف |
| `speed` | 1 | سرعة الكلام المولَّد |
| `text` | — | حتى 5000 حرف في الطلب |

في الوكيل الصوتي المباشر تستحق الخطوات الأقل: في المكالمة يُسمع الانتظار أكثر من فرق الجودة. أما التعليق الصوتي الذي ستنشره فاستخدم 64.

## كم يكلّف تحويل النص العربي إلى كلام؟

**0.05 دولار لكل ألف حرف.** نص من ألف حرف — نحو دقيقة ونصف من الكلام — يكلّف خمسة سنتات. والحسابات الجديدة تحصل على رصيد مجاني بقيمة 5 دولارات بلا بطاقة عند [التسجيل](/sign-up)، والطلبات الفاشلة لا تُحتسب.

## هل ينطق بلغات أخرى؟

نعم، بأصوات مدرَّبة بدل الاستنساخ. مرّر `language` بإحدى القيم `en` أو `en-gb` أو `es` أو `fr` أو `hi` أو `it` أو `ja` أو `pt` أو `zh`، واسم صوت في `voice` مثل `af_heart` أو `bm_george`. ويُتجاهل `reference` و`ref_text` في هذه اللغات. ويعرض الطلب `GET /v1/voices` ما هو متاح.

## أين تستخدمه؟

- **الوكلاء الصوتيون** الذين يردّون على العملاء باللهجة الخليجية — في [التوثيق](/docs) إعداد جاهز لمنصة Vapi للاستماع والنطق معًا.
- **التعليق الصوتي والدبلجة للفيديو** — راجع [الترجمة والدبلجة العربية التلقائية للفيديو](/ar/blog/auto-arabic-subtitles-for-video).
- **فرّغ ثم انطق**: اجمعه مع [تحويل الكلام العربي إلى نص](/ar/blog/arabic-speech-to-text-api) لتبني حلقة صوتية كاملة.

## أسئلة شائعة

### كم أحتاج من الصوت لاستنساخ صوت عربي؟

ست إلى ثماني ثوانٍ من كلام واضح هي المدة المثلى. المقاطع الأطول مقبولة لكنها تُقصّ إلى نحو ثماني ثوانٍ، وما زاد على عشرين ثانية يُرفض. وترسل معها ref_text، أي الكلمات المنطوقة في المقطع بالضبط.

### هل يبدو الصوت العربي خليجيًا أم كمذيع أخبار بالفصحى؟

خليجيًا. نموذج nutq-speak-1 مدرَّب على كلام إماراتي وسعودي، فاللكنة خليجية لا فصحى إذاعية، حتى لو كان النص الذي تعطيه مكتوبًا بالفصحى.

### كم تكلفة تحويل النص العربي إلى كلام؟

0.05 دولار لكل ألف حرف. ويحمل الطلب الواحد حتى 5000 حرف. وتعود التكلفة في ترويسات الاستجابة، والطلبات الفاشلة لا تُحتسب.

### كيف أصلح كلمة تُنطق خطأً؟

العربية تُكتب عادةً بلا حركات، فبعض الكلمات تحتمل قراءتين. شكّل تلك الكلمة وحدها فتُقرأ كما كتبتها. وتجنّب تشكيل كل الكلمات، فذلك يجعل الإلقاء بطيئًا ورسميًا.

### هل ينطق بلغات غير العربية؟

نعم، بأصوات مدرَّبة لا باستنساخ: الإنجليزية (الأمريكية والبريطانية) والإسبانية والفرنسية والهندية والإيطالية واليابانية والبرتغالية والصينية. تختار الصوت باسمه ولا تحتاج تسجيلًا مرجعيًا.
