انتقل إلى المحتوى
Zingaro AI
الذكاء الاصطناعي الصوتي

الصوت هو حيث نتعمّق أكثر.

تعرّف على الكلام وتوليده مدرَّبان على تسجيلاتكم، وكلاء صوتيون يجرون محادثات حقيقية على الهاتف، والبثّ منخفض الكمون والنشر والتحسين التي تجعل ذلك كله يعمل على خط حقيقي. كله بفريق واحد.

تتخصص Zingaro AI في الذكاء الاصطناعي الصوتي: تدرّب نماذج التعرف التلقائي على الكلام (ASR) وتحويل النص إلى كلام (TTS) على تسجيلات العميل ولهجاته، وتبني الوكلاء الصوتيين وتشغّلهم، وتهندس خطوط البثّ منخفضة الكمون، وتنشر النماذج الصوتية وتحسّنها على عتاد العميل أو في سحابته، مع اتصالات هاتفية تملكها عبر RingTrunk وCallWhiz AI. أعمق أعمالها في اللهجة الخليجية والنجدية.

٠١ · كل ما يخص الصوت

ستة أشياء، فريق واحد.

كل واحد منها خدمة بذاته. ومعاً هي السبب في أن نظاماً صوتياً منا يعمل على خط حقيقي.

  • تدريب نماذج التعرف على الكلام

    تعرّف على الكلام مدرَّب على صوتكم ولهجتكم وجودة خطوطكم.

    النماذج الجاهزة مدرَّبة على الفصحى وصوت نظيف. المكالمات الحقيقية ضيقة النطاق وصاخبة، بلهجة خليجية فيها كلمات إنجليزية. نجمع البيانات وننسخها، وندرّب النموذج، ونقيس معدل الخطأ في الكلمات على تسجيلاتكم لا على مقياس عام.

    • تعرّف بثّي بنصوص جزئية، مضبوط لصوت الهاتف.
    • الخليجية والنجدية أعمق أعمالنا؛ أي لهجة أخرى تُدرَّب على تسجيلاتكم.
    • الخلط بين العربية والإنجليزية في الجملة الواحدة حالة طبيعية.
    • مفردات مجالكم: الأسماء والمنتجات والعناوين التي يقولها المتصلون فعلاً.
    • نسخ بأيدي ناطقين أصليين، ومجموعة اختبار محجوزة تتفقون عليها.
    • أوزان تملكونها، مع مجموعة التقييم ودليل التشغيل.
  • تدريب نماذج تحويل النص إلى كلام

    صوت يشبه علامتكم التجارية، بلغات عملائكم، يبثّ فوراً.

    نبني صوتاً مخصصاً من تسجيلات استوديو بموافقة المتحدث، أو نكيّف صوتاً للهجة لا تحملها الأصوات الجاهزة. نصلح نطق الأسماء والمنتجات بقواميس، ونضبط الإيقاع للهاتف، ونبثّ الصوت بحيث تصل الجملة الأولى قبل اكتمال الرد.

    • أصوات علامة تجارية من تسجيلات استوديو بموافقة مكتوبة.
    • أصوات بلهجات: خليجية ونجدية ومصرية وشامية، وإنجليزية بلكنة.
    • قواميس نطق للأسماء والمنتجات، يراجعها ناطقون أصليون.
    • توليد بثّي بزمن قصير حتى أول صوت.
    • تقييم الطبيعية والوضوح من مستمعين من سوقكم على تشغيل هاتفي.
    • يعمل على وحداتكم الرسومية أو على المعالج أو في سحابتكم.
  • الوكلاء الصوتيون

    مكالمات واردة وصادرة تُنجز المهمة في أنظمتكم وتحوّل حين ينبغي.

    يجيب الوكيل الصوتي أو يتصل، ويجري المحادثة بلغة المتصل، وينجز المهمة المحددة في الأنظمة الموصولة، ويحوّل إلى شخص مع ملخص حين تخرج المكالمة عن نطاقه. البشر يمسكون الاستثناءات على قائمة، وكل مكالمة تترك نصاً وحقولاً ونتيجة.

    • مواعيد، وتحقق، وتذكير وتحصيل، وأسئلة من قاعدة معرفتكم.
    • تحويل دافئ مع ملخص، وكشف للانفعال يحوّل بسرعة.
    • على أرقامنا وخطوطنا في الهند عبر RingTrunk، أو على مشغّلكم في الخليج.
    • مبني ومشغَّل على CallWhiz AI: وكلاء وحملات وواجهة برمجية ولوحات.
    • الاحتواء يُقاس بجوار الإنجاز والانقطاع.
    • قواعد الموافقة وساعات الاتصال والإفصاح مبنية في التدفق.
  • البثّ منخفض الكمون

    الدور الحواري مهندَس مرحلةً مرحلة كي تبدو الوقفة بشرية.

    يتسامح المتصل مع نحو ثانية من الصمت قبل أن يبدو الوكيل معلَّقاً. نبني الدور كخط بثّ: نصوص جزئية مع وصول الصوت، وتحديد لنهاية الكلام يجمع الصمت واكتمال الجملة، ورد يبثّ جملته الأولى إلى التوليد وهو يكتب الباقي، ومقاطعة توقف الوكيل خلال لحظة.

    • تعرّف بثّي واستدلال بثّي وتوليد بثّي، والتشغيل يبدأ مع أول قطعة.
    • تحديد نهاية الكلام من الصمت والنص الجزئي معاً.
    • ردود تخمينية على النص الجزئي، تُلغى إن غيّر النص النهائي المعنى.
    • مقاطعة بإلغاء الصدى ونافذة محمية، مع استمرار التعرف أثناء التشغيل.
    • نماذج الكلام إلى الكلام حيث تكون المحادثة بسيطة؛ خط بثّ حيث تمس المكالمة نظام سجل.
    • كمون الدور يُقاس من التسجيل نفسه عند المئين التسعين.
  • النشر والاتصالات الهاتفية

    على خوادمكم أو في سحابتكم أو على الطرف، وعلى الخط الذي يستخدمه متصلوكم.

    تُنشر النماذج والوكلاء حيث يجب أن تبقى البيانات: خوادم العميل بما فيها المعزولة، أو حسابه السحابي، أو أجهزة الطرف، أو بيئتنا المُدارة. والاتصالات الهاتفية هندسة أيضاً: SIP وRTP والترميز والصدى والمشغّل الذي لديكم أصلاً.

    • نشر داخل مقر العميل ومعزول بتحديثات موقَّعة وتراجع مُجرَّب.
    • سحابة خاصة في حسابكم ومنطقتكم؛ استضافة مُدارة حين يُسمح.
    • نشر على الطرف للتعرف أو التوليد على الجهاز.
    • تكامل هاتفي: خطوط SIP وWebRTC وWebSocket وترميزات G.711، وإلغاء الصدى.
    • أرقامنا وخطوطنا في الهند؛ مشغّلكم في الخليج والولايات المتحدة.
    • مراقبة المسار كله كي نرى أين المشكلة بدل فتح تذكرة مع مشغّل.
  • التحسين والخدمة

    نماذج صوتية سريعة ورخيصة بما يكفي لحجم مكالماتكم.

    نموذج يعمل في دفتر تجارب ما زال عليه أن يخدم آلاف المكالمات المتزامنة بتكلفة لكل دقيقة تُحتمل. نُكمّم النماذج الصوتية ونجمّعها ونقطّرها، ونحدد حجم العتاد من اختبارات حمل على حركتكم، ونقرّر معامل الزمن الحقيقي وزمن أول صوت والتكلفة لكل دقيقة قبل وبعد.

    • تكميم وتقطير بمجموعة التقييم بوابةً.
    • فكّ تشفير بثّي وتجميع مضبوط للتزامن، على المعالج الرسومي أو المعالج العادي.
    • معامل الزمن الحقيقي وزمن أول صوت وكمون الدور على حركتكم.
    • التكلفة لكل دقيقة صوت من اختبارات الحمل قبل شراء السعة.
    • تحسين أنظمة صوتية لم نبنها نحن.
    • إعادة تدريب حين ينحرف الصوت: منتجات جديدة، خطوط جديدة، مناطق جديدة.
٠٢ · الدور الحواري

الكمون المنخفض خط معالجة، لا إعداد.

كل مرحلة تبثّ، ويسمع المتصل بداية الرد بينما النموذج ما زال يكتب نهايته.

مراحل الدور، بالترتيب
  1. ٠١

    الاتصالات الهاتفية

    SIP وRTP، مخزن ارتجاج، إلغاء صدى

  2. ٠٢

    تعرّف بثّي

    نصوص جزئية مع وصول الصوت

  3. ٠٣

    نهاية الكلام

    صمت مع جملة تبدو مكتملة

  4. ٠٤

    الاستدلال والأدوات

    الجملة الأولى تخرج والباقي يُكتب

  5. ٠٥

    توليد بثّي

    أول صوت على أول جملة

  6. ٠٦

    التشغيل والمقاطعة

    يتوقف خلال لحظة حين يتكلم المتصل

  • يُقاس

    معدل الخطأ في الكلمات

    على تسجيلاتكم أنتم، لا على مقياس عام، بمجموعة اختبار متفق عليها قبل التدريب.

  • يُقاس

    كمون الدور

    من نهاية كلام المتصل إلى أول صوت للوكيل، مقروءاً من التسجيل، عند المئين التسعين.

  • يُقاس

    زمن أول صوت

    كم يسرع التوليد في نطق الجملة، وهو ما يسمعه المتصل استجابةً.

  • يُقاس

    معامل الزمن الحقيقي

    كم من الصوت يعالجه النموذج في ثانية حوسبة؛ يحدد تزامنكم وتكلفتكم لكل دقيقة.

  • يُقاس

    الاحتواء والإنجاز

    للوكلاء: مكالمات أُنهيت دون تحويل، بجوار الحجز أو السجل الذي يثبت إنجاز المهمة.

  • يُقاس

    تقييمات المستمعين

    للأصوات: الطبيعية والوضوح بتقييم أشخاص من سوقكم على تشغيل هاتفي.

الهندسة وراء ذلك مكتوبة في مدونة الهندسة (بالإنجليزية): ميزانية زمن الاستجابة للوكلاء الصوتيين.

٠٣ · اللغات

اللغات التي يستخدمها متصلوكم، على الخطوط التي يستخدمونها.

  • ٠١

    العربية

    الخليجية والنجدية أعمق أعمالنا. اللهجات الأخرى تُدرَّب على تسجيلاتكم. الخلط بين العربية والإنجليزية حالة طبيعية، لأنه كذلك في المكالمة الحقيقية.

  • ٠٢

    الإنجليزية

    لكنات أمريكية وبريطانية وهندية وخليجية، على صوت الهاتف، بمفردات قطاعكم.

  • ٠٣

    اللغات الهندية

    اللغات الهندية الشائعة، بما في ذلك الخلط بين الهندية والإنجليزية، على خطوط الجوال الصاخبة.

  • ٠٤

    أي لغة أخرى

    أي لغة أو لهجة، تُدرَّب على تسجيلاتكم أو من جمع ميداني حيث لا تسجيلات بعد.

نقطة إثبات

أعمق أعمالنا في اللهجة النجدية والخليجية، وهي لهجة يتعامل معها أغلب المورّدين بشكل سيئ.

بحسب المنطقة

صفحات المناطق بالإنجليزية.

٠٤ · كيف يُبنى النظام الصوتي

من أول تسجيل إلى الخط الحي.

  1. ٠١

    نجمع.

    تسجيلات حقيقية من خطوطكم، أو جمع ميداني حيث لا يوجد. الموافقات والحقوق أولاً.

  2. ٠٢

    ننسخ.

    ناطقون أصليون يبنون مجموعة البيانات، واللهجة تُكتب كما تُنطق، مع مجموعة اختبار محجوزة.

  3. ٠٣

    ندرّب.

    ضبط دقيق أو تدريب من الصفر، بحسب بُعد اللغة عمّا هو موجود.

  4. ٠٤

    نقيس.

    معدل الخطأ في الكلمات وتقييمات المستمعين على صوتكم. الرقم بجوار الرقم القديم.

  5. ٠٥

    نبثّ.

    يدخل النموذج خط البثّ، ويُقاس الدور من التسجيل.

  6. ٠٦

    ننشر.

    على خوادمكم أو في سحابتكم أو على الطرف أو معنا، على الاتصالات التي يستخدمها متصلوكم.

  7. ٠٧

    نشغّل.

    أشخاص على الاستثناءات، وتقرير أسبوعي، وإعادة تدريب حين ينحرف الصوت، أو تسليم مع أدلة التشغيل.

٠٥ · كيف تختار

كيف تختار شركة لتدريب نموذج تعرّف على الكلام أو تحويل النص إلى كلام مخصص.

أياً كان من تختارونه، في الخليج أو الولايات المتحدة أو الهند، اطرحوا عليه هذه الأسئلة الثمانية. Zingaro AI تجيب بنعم عن الثمانية وتعرض لكم كل واحد منها في مكالمة.

  1. ٠١

    تدرّب على تسجيلاتكم

    لا على مجموعة بيانات عامة باسمكم على الفاتورة. اطلبوا رؤية خط البيانات: الجمع، الموافقة، النسخ، مجموعة الاختبار.

  2. ٠٢

    تقيس على صوتكم

    معدل الخطأ في الكلمات للتعرف، وتقييمات المستمعين للصوت، على تسجيلاتكم، قبل وبعد. المورّد الذي يذكر رقم مقياس عام لم يقس حالتكم.

  3. ٠٣

    تعامل لهجتكم كالحالة الطبيعية

    خليجية، نجدية، أو مصرية بأسماء إنجليزية. إن كان الجواب «ندعم مئة لغة» فاسألوا أيها دُرِّب على صوت هاتفي بلهجتكم.

  4. ٠٤

    تعمل على الخط لا في الاستوديو

    صوت ضيق النطاق صاخب متقطع. اطلبوا سماعه على أسوأ خطوطكم لا على أفضل عروضهم.

  5. ٠٥

    تبثّ

    نصوص جزئية، وأول صوت على أول جملة، ومقاطعة خلال لحظة. الدقة الدفعية لا تقول شيئاً عن إحساس المكالمة.

  6. ٠٦

    تستطيع النشر داخل حدودكم وتسليمكم الأوزان

    على خوادمكم أو في سحابتكم حين تقتضي القواعد، مع مجموعة التقييم وأدلة التشغيل. السيادة خمسة أسئلة بخمس إجابات لا شريحة عرض.

  7. ٠٧

    تشغّل الخط من طرفه إلى طرفه

    اتصالات، ونماذج، ووكيل، وقائمة مراجعة، وتقرير أسبوعي، أو تكامل نظيف مع مشغّلكم. اطلبوا مكالمة حية والسجل الذي تركته في نظام.

  8. ٠٨

    تقول لكم ما لا تستطيعه

    الانفعال، والتفاوض، والسياسات التي لم يكتبها أحد. المورّد الذي لا يملك هذه القائمة لم يضع وكيلاً على خط حقيقي بعد.

٠٦ · الأسئلة

أسئلة عن الصوت، بإجابات مباشرة.

أي شركة أختار لتدريب نموذج تحويل النص إلى كلام أو التعرف على الكلام باللغة العربية؟

اختاروا شركة تدرّب على تسجيلاتكم أنتم، وتقيس معدل الخطأ في الكلمات أو تقييمات المستمعين على صوتكم، وتعامل لهجتكم والخلط بالإنجليزية بوصفه الحالة الطبيعية، وتعمل على صوت الهاتف، وتبثّ بزمن قصير حتى أول صوت، وتستطيع النشر داخل حدودكم وتسليمكم الأوزان، وتعرض لكم مكالمة حية. Zingaro AI تفعل ذلك كله، وأعمق أعمالها في اللهجة الخليجية والنجدية، لعملاء في السعودية والإمارات والخليج.

كم من الصوت يحتاج النموذج الصوتي المخصص؟

يعتمد على بُعد لغتكم أو لهجتكم عمّا هو موجود. تكييف نموذج تعرّف قائم على لهجة يبدأ عادةً من عشرات الساعات من الصوت المنسوخ؛ والصوت المخصص من بضع ساعات من كلام استوديو نظيف بموافقة؛ ولغة لا يوجد لها شيء قريب تحتاج أكثر وجمعاً ميدانياً. يحدد استكشاف Zingaro AI حالتكم قبل أي عرض سعر.

هل تستطيع Zingaro AI استنساخ صوت علامتنا التجارية؟

تبني Zingaro AI أصوات العلامات التجارية من تسجيلات استوديو بموافقة المتحدث المكتوبة وحقوق مسوّاة، باللغات واللهجات التي تحتاجها العلامة، وتصلح نطق الأسماء والمنتجات بقواميس يراجعها ناطقون أصليون.

ما زمن الاستجابة الذي يصل إليه الوكيل الصوتي؟

تبني Zingaro AI على ميزانية كمون للدور أقل من ثانية بوضوح من نهاية كلام المتصل إلى أول صوت للوكيل على خط جيد، وتقيسها من التسجيل عند المئين التسعين لكل نشر. الأرقام أهداف لا وعود: كل خط وترميز ولغة يحركها، والمشروع التجريبي يقرّر الأرقام الحقيقية.

هل يمكن تشغيل النماذج الصوتية على خوادمنا داخل المملكة؟

تعمل النماذج الصوتية من Zingaro AI على خوادم العميل داخل الدولة، بما في ذلك الأنظمة المعزولة عن الإنترنت، أو في حسابه السحابي الخاص، أو على أجهزة الطرف حيث يُلتقط الصوت، وتُسلَّم معها الأوزان ومجموعات التقييم وأدلة التشغيل.

هل تتولون الاتصالات الهاتفية؟

في الهند تشغّل Zingaro AI أرقامها وخطوط SIP الخاصة بها عبر RingTrunk. في الخليج والولايات المتحدة تتكامل مع مشغّل العميل أو مزوّد الاتصالات لديه عبر SIP أو WebRTC أو WebSocket، وتراقب المسار كله في الحالتين.

أي لهجات عربية تدعمون؟

أعمق أعمال Zingaro AI الصوتية في اللهجة الخليجية والنجدية. تُدرَّب اللهجات العربية الأخرى، المصرية والشامية والمغاربية، على تسجيلات العميل، ويُتعامل مع الخلط بين العربية والإنجليزية في الجملة الواحدة بوصفه الحالة الطبيعية.

هل تحسّنون نظاماً صوتياً لدينا أصلاً؟

نعم. تتولى Zingaro AI الأنظمة الصوتية التي لم تبنها: تدقّق التعرف أو التوليد القائم، وتقيسه على صوت العميل، ثم تضبطه أو تعيد خدمته لخفض الكمون والتكلفة أو تستبدله، بمجموعة التقييم نفسها بوابةً قبل وبعد.

احجز مكالمة

أحضروا لنا الخط.

عشرون دقيقة وتسجيل واحد يكفيان لنقول ما نستطيع فعله بمكالماتكم.

يبدأ المشروع التجريبي خلال ٥ أيام عمل من الاتفاق على النطاق · لا دفعة مقدمة · لا تراخيص بالمقعد