تريد الجهات المشترية في المؤسسات والأشخاص الذين تخدمهم أمرين متعاكسين: يصف 67% من قادة الأعمال الآن الذكاء الاصطناعي الصوتي بأنه أساسي لاستراتيجيتهم، بينما يقول 79% من المستهلكين الأمريكيين إنهم يفضّلون بشدة إنسانًا على وكيل ذكاء اصطناعي. هذه الفجوة، لا معايير أداء النماذج، هي الإحصائية المحورية للذكاء الاصطناعي الصوتي في 2026. يموّل السوق جانب المشترين بقوة: جمعت ElevenLabs وحدها 500 مليون دولار بتقييم 11 مليار دولار في فبراير 2026، وتتوقع Grand View Research أن تنمو فئة وكلاء الصوت بالذكاء الاصطناعي من 2.54 مليار دولار في 2025 إلى 35.24 مليار دولار بحلول 2033. في الوقت نفسه، تفيد 91% من قادة خدمة العملاء بوجود ضغط تنفيذي لنشر الذكاء الاصطناعي هذا العام. الأرقام أدناه مستمدة من استطلاع Deepgram لحالة الذكاء الاصطناعي الصوتي بالتعاون مع Opus Research، وبيانات صحفية من Gartner، وأبحاث a16z حول وكلاء الصوت، واستطلاع SurveyMonkey للمستهلكين في ديسمبر 2025، وتقرير Voices.com “Amplified 2026”، وGrand View Research، وFortune Business Insights، وتسعير API المنشور من OpenAI.
TL;DR
- بلغ حجم سوق وكلاء الصوت بالذكاء الاصطناعي 2.54 مليار دولار في 2025، ومن المتوقع أن يصل إلى 35.24 مليار دولار بحلول 2033 بمعدل نمو سنوي مركب 39.0% (Grand View Research)
- يبلغ سوق الذكاء الاصطناعي الحواري الأوسع 17.97 مليار دولار في 2026، ومن المتوقع أن يصل إلى 82.46 مليار دولار بحلول 2034 (Fortune Business Insights)
- يصف 67% من قادة الأعمال الذكاء الاصطناعي الصوتي بأنه أساسي لاستراتيجية منتجهم وأعمالهم (Deepgram / Opus Research، State of Voice AI)
- 21% فقط راضون جدًا عن أنظمة وكلاء الصوت التقليدية التي يشغّلونها بالفعل (Deepgram / Opus Research)
- 91% من قادة خدمة ودعم العملاء يخضعون لضغط تنفيذي لتطبيق الذكاء الاصطناعي في 2026 (Gartner، فبراير 2026)
- تتوقع Gartner أن يحل الذكاء الاصطناعي الوكيل بشكل مستقل 80% من مشكلات خدمة العملاء الشائعة بحلول 2029، مع خفض التكاليف التشغيلية بنسبة 30%
- يفضّل 79% من البالغين الأمريكيين بشدة إنسانًا على وكيل ذكاء اصطناعي، ويريد 89% أن يكون خيار الوصول إلى إنسان متاحًا دائمًا (SurveyMonkey، ديسمبر 2025)
- جمعت ElevenLabs 500 مليون دولار بتقييم 11 مليار دولار في فبراير 2026، على إيرادات متكررة سنوية تجاوزت 330 مليون دولار (ElevenLabs)
- كان 22% من دفعة حديثة في Y Combinator يبني حلولًا قائمة على الصوت، من أصل 90 شركة وكلاء صوت منذ 2020 (a16z)
- تكلّف رموز صوت الإخراج (audio output) في gpt-realtime-2.1 مبلغ 64.00 دولارًا لكل مليون رمز، مع تسعير صوت الإدخال المخزَّن مؤقتًا عند 0.40 دولار لكل مليون (OpenAI)
- يستخدم 55% من المستهلكين الصوت للتفاعل مع الذكاء الاصطناعي، لكن 29% فقط من الشركات نشرت ذكاءً اصطناعيًا صوتيًا موجَّهًا للعملاء (Voices.com، Amplified 2026)
- استحوذت أتمتة دعم العملاء على 44.2% من إيرادات وكلاء الصوت بالذكاء الاصطناعي في 2025؛ والرعاية الصحية هي الاستخدام النهائي الأسرع نموًا بمعدل نمو سنوي مركب 42.0% (Grand View Research)
1. حجم السوق: توقعان يقيسان أمرين مختلفين
معدلات النمو الرئيسية للذكاء الاصطناعي الصوتي غير قابلة للمقارنة، والفرق بينها مهم لأي جهة تضع ميزانية بناءً عليها. تتتبّع Grand View Research وكلاء الصوت بالذكاء الاصطناعي بتعريف ضيق، أي الأنظمة المستقلة التي تجري محادثة منطوقة، فتحصل على قاعدة صغيرة بمنحنى نمو حاد: 2.54 مليار دولار في 2025 بمعدل نمو سنوي مركب 39.0%. أما Fortune Business Insights فتقيس الذكاء الاصطناعي الحواري بتعريف واسع، يشمل روبوتات الدردشة النصية، ما ينتج عنه قاعدة أكبر بنحو سبع مرات تنمو بنصف المعدل. من المتوقع أن تنمو الفئة الأضيق المقتصرة على الصوت بنحو 14 ضعفًا بحلول 2033، بينما ينمو سوق الذكاء الاصطناعي الحواري الأوسع بنحو 4.6 أضعاف بحلول 2034.
| المقياس | القيمة | المصدر |
|---|---|---|
| سوق وكلاء الصوت بالذكاء الاصطناعي، 2025 | $2.54 billion | Grand View Research |
| سوق وكلاء الصوت بالذكاء الاصطناعي، توقعات 2033 | $35.24 billion | Grand View Research |
| معدل النمو السنوي المركب لوكلاء الصوت بالذكاء الاصطناعي، 2026-2033 | 39.0% | Grand View Research |
| سوق الذكاء الاصطناعي الحواري، 2025 | $14.79 billion | Fortune Business Insights |
| سوق الذكاء الاصطناعي الحواري، 2026 | $17.97 billion | Fortune Business Insights |
| سوق الذكاء الاصطناعي الحواري، توقعات 2034 | $82.46 billion | Fortune Business Insights |
| معدل النمو السنوي المركب للذكاء الاصطناعي الحواري، 2026-2034 | 21.0% | Fortune Business Insights |
| حصة أمريكا الشمالية من سوق الذكاء الاصطناعي الحواري، 2025 | 35.10% ($5.19 billion) | Fortune Business Insights |
التركّز الإقليمي متسق بين الشركتين: تستحوذ أمريكا الشمالية على 38.1% من إيرادات وكلاء الصوت بالذكاء الاصطناعي و35.10% من سوق الذكاء الاصطناعي الحواري. لمعرفة كيفية تسعير وتقدير طبقة توليد الصوت الأساسية بشكل منفصل عن طبقة الوكلاء، راجع ملخصنا عن سوق مولّدات الصوت بالذكاء الاصطناعي. التقريران الكاملان: Grand View Research وFortune Business Insights.
2. تبني المؤسسات: أصبح التفريغ الصوتي شرطًا أساسيًا
يُظهر استطلاع Deepgram بالتعاون مع Opus Research، الذي شمل 400 من قادة الأعمال عبر أكثر من عشر صناعات، أن التحول لا يتعلق بتبني الذكاء الاصطناعي الصوتي بقدر ما يتعلق بتصعيد استخدامه. تلتقط 92% من المؤسسات بيانات كلامها بالفعل، وتُفرِّغ 56% منها الآن أكثر من نصف تفاعلاتها الصوتية، ارتفاعًا من حالة سابقة كانت فيها 84% تفرّغ أقل من النصف. مسألة الالتقاط والتفريغ باتت محسومة؛ والسؤال المفتوح هو ما الذي يعمل فوقها. وهنا ينهار الرضا: تُشغّل 80% أنظمة وكلاء صوت تقليدية، لكن 21% فقط راضية جدًا عنها، وهو ما يفسّر بوضوح سبب تخطيط 84% لرفع ميزانياتها خلال الاثني عشر شهرًا القادمة.
| المقياس | القيمة | المصدر |
|---|---|---|
| قادة الأعمال المستطلَعون | 400 | Deepgram / Opus Research |
| يلتقطون بيانات كلامهم | 92% | Deepgram / Opus Research |
| يفرّغون أكثر من نصف التفاعلات | 56% | Deepgram / Opus Research |
| يصفون الذكاء الاصطناعي الصوتي بأنه أساسي لاستراتيجية العمل | 67% | Deepgram / Opus Research |
| يشغّلون أنظمة وكلاء صوت تقليدية | 80% | Deepgram / Opus Research |
| راضون جدًا عن وكلاء الصوت التقليديين | 21% | Deepgram / Opus Research |
| يخططون لزيادة الميزانيات خلال 12 شهرًا القادمة | 84% | Deepgram / Opus Research |
| يذكرون ضبط النماذج الدقيق كعامل أساسي للتبني الأوسع | 46% | Deepgram / Opus Research |
الفجوة بين 80% و21% هي الشذوذ الجدير بالمراقبة: عدم الرضا عن الأنظمة القائمة من طراز الاستجابة الصوتية التفاعلية (IVR)، لا الطلب على مشاريع جديدة تمامًا، هو ما يموّل معظم مشاريع الاستبدال. المصدر: تقرير Deepgram لحالة الذكاء الاصطناعي الصوتي.
3. الضغط التنفيذي وهدف 2029
عنوان استطلاع Gartner لفبراير 2026 مباشر وصريح: 91% من قادة خدمة ودعم العملاء يخضعون لضغط تنفيذي لتطبيق الذكاء الاصطناعي هذا العام. ويرتكز هذا الضغط على توقع أطول نشرته الشركة في مارس 2025، يفيد بأن الذكاء الاصطناعي الوكيل سيحل بشكل مستقل 80% من مشكلات خدمة العملاء الشائعة دون تدخل بشري بحلول 2029، مع خفض التكاليف التشغيلية بنسبة 30%. الكلمة التي تؤدي العمل الأساسي في هذا التوقع هي “الشائعة”، إذ إن إعادة تعيين كلمات المرور الروتينية والاستعلام عن حالة الطلبات مشكلة مختلفة تمامًا عن نزاعات الفوترة أو ادعاءات الاحتيال. وعند قراءته في ضوء بيانات المستهلكين في القسم 5، فإن هدف 2029 يصف سقفًا للحجم القابل للأتمتة أكثر مما يمثّل توقعًا باختفاء الدعم الهاتفي.
| المقياس | القيمة | المصدر |
|---|---|---|
| قادة خدمة العملاء الخاضعون لضغط تطبيق الذكاء الاصطناعي في 2026 | 91% | Gartner, February 2026 |
| مشكلات خدمة العملاء الشائعة المحلولة بشكل مستقل بحلول 2029 | 80% (forecast) | Gartner, March 2025 |
| خفض التكاليف التشغيلية المتوقع بحلول 2029 | 30% | Gartner, March 2025 |
| المستهلكون الراغبون في إتاحة خيار الوصول إلى إنسان دائمًا | 89% | SurveyMonkey, December 2025 |
| المستهلكون الذين يعتقدون أن الوكلاء البشريين أكثر دقة | 84% | SurveyMonkey, December 2025 |
| الشركات التي نشرت ذكاءً اصطناعيًا صوتيًا موجَّهًا للعملاء | 29% | Voices.com, Amplified 2026 |
أعادت كل موجة أتمتة اقتصاديات مراكز الاتصال منذ ظهور أشجار الاستجابة الصوتية التفاعلية الأولى، ويغطي خط الأساس التاريخي ملخصنا عن إحصاءات صناعة مراكز الاتصال. المصادر: Gartner، فبراير 2026 وGartner، مارس 2025.
4. التمويل والتقييمات: أين حطّ رأس المال
تُعد ElevenLabs المؤشر العلني الأوضح لتقييمات الذكاء الاصطناعي الصوتي لأنها تكشف عن أرقامها الخاصة. جمعت الشركة 500 مليون دولار بقيادة Sequoia Capital بتقييم 11 مليار دولار في 4 فبراير 2026، أي ما يقارب مضاعفة تقييمها ثلاث مرات من نحو 3.7 مليار دولار قبل عام، على إيرادات متكررة سنوية تجاوزت 330 مليون دولار بنهاية 2025. بلغ إجمالي التمويل 781 مليون دولار عبر خمس جولات، ما يعني أن الشركة جمعت نحو ثلثي رأس مالها التراكمي في جولة واحدة. ومسار الشركات الناشئة خلفها متركز بالقدر نفسه: أحصت a16z 90 شركة وكلاء صوت عبر دفعات Y Combinator منذ 2020، مع 22% من دفعة حديثة تبني حلولًا قائمة على الصوت.
| المقياس | القيمة | المصدر |
|---|---|---|
| جولة تمويل ElevenLabs من الفئة D، فبراير 2026 | $500 million | ElevenLabs |
| تقييم ElevenLabs، فبراير 2026 | $11 billion | ElevenLabs |
| تقييم ElevenLabs، قبل اثني عشر شهرًا | approx. $3.7 billion | ElevenLabs |
| الإيرادات المتكررة السنوية لـ ElevenLabs بنهاية 2025 | $330+ million | ElevenLabs |
| إجمالي تمويل ElevenLabs عبر خمس جولات | $781 million | ElevenLabs |
| اللغات التي تدعمها ElevenLabs | 70+ | ElevenLabs |
| شركات وكلاء الصوت في Y Combinator منذ 2020 | 90 | a16z |
| حصة دفعة حديثة من Y Combinator تبني حلولًا قائمة على الصوت | 22% | a16z (per Cartesia) |
جودة توليد الصوت هي المدخل الذي يجعل عمليات نشر الوكلاء ممكنة أصلًا، وقدرة برمجيات استنساخ الصوت الأساسية هي ما يفصل بين صوت وكيل قابل للاستخدام وصوت آلي جامد. المصادر: إعلان جولة ElevenLabs من الفئة D وتحديث a16z حول وكلاء الصوت بالذكاء الاصطناعي.
5. اقتصاديات الوحدة: ما تكلفه دقيقة الصوت فعليًا
تسعير API المنشور هو الرقم الوحيد لكل وحدة في هذا الملخص غير المستمد من استطلاع رأي، وقد انخفض بسرعة. وثّقت a16z إعادة تسعير GPT-4o realtime في ديسمبر 2024 بخصم 60% على صوت الإدخال و87.5% على صوت الإخراج. ويُظهر التسعير المعلن الحالي استمرار النمط نفسه عبر مستويات النماذج: تكلّف النسخة المصغّرة من realtime نحو ثلث تكلفة النموذج الكامل، ويُسعَّر صوت الإدخال المخزَّن مؤقتًا عند 0.40 دولار لكل مليون رمز مقابل 32.00 دولارًا غير مخزَّن، وهو فارق 80 ضعفًا يكافئ إعادة استخدام الطلبات (prompt). أصبح التفريغ الصوتي الآن مجرد هامش خطأ بسيط عمليًا عند 0.0045 دولار لكل دقيقة لخدمة gpt-transcribe، وهو ما يفسّر ظهور الالتقاط والتفريغ كأمرين شائعين بالفعل في بيانات الاستطلاع بينما يتأخر نشر الوكلاء.
| المقياس | القيمة | المصدر |
|---|---|---|
| صوت الإدخال لـ gpt-realtime-2.1، لكل مليون رمز | $32.00 | OpenAI API pricing |
| صوت الإخراج لـ gpt-realtime-2.1، لكل مليون رمز | $64.00 | OpenAI API pricing |
| صوت الإدخال المخزَّن مؤقتًا لـ gpt-realtime-2.1، لكل مليون رمز | $0.40 | OpenAI API pricing |
| صوت الإدخال لـ gpt-realtime-2.1-mini، لكل مليون رمز | $10.00 | OpenAI API pricing |
| صوت الإخراج لـ gpt-realtime-2.1-mini، لكل مليون رمز | $20.00 | OpenAI API pricing |
| تفريغ gpt-transcribe، لكل دقيقة | $0.0045 | OpenAI API pricing |
| تفريغ Whisper، لكل دقيقة | $0.006 | OpenAI API pricing |
| تحويل النص إلى كلام tts-1، لكل مليون حرف | $15.00 | OpenAI API pricing |
| خفض سعر صوت الإخراج لـ GPT-4o realtime، ديسمبر 2024 | 87.5% | a16z |
السعر المعلن ليس تكلفة النشر الفعلية. فالاتصالات الهاتفية، والتنسيق، وإعادة محاولات المكالمات الفاشلة، والتصعيد إلى البشر، لكل منها بنود تكلفة خاصة به، ولا تفصّل أي من بيانات الاستطلاعات العامة التكلفة الإجمالية لكل مكالمة تُحل. أما بالنسبة لجانب توليد الصوت من هذه المنظومة، فتغطي صفحتنا عن مولّد الصوت المجاني بالذكاء الاصطناعي ما تقوم به طبقة الإخراج. المصدر: تسعير API من OpenAI.
6. ثقة المستهلكين: الفجوة التي لم يسدّها أحد
استطلاع SurveyMonkey لديسمبر 2025 الذي شمل 2,017 من البالغين الأمريكيين هو أكثر مجموعة بيانات استهلاكية شفافية من الناحية المنهجية هنا، بهامش خطأ معلن يبلغ زائد أو ناقص 2.5 نقطة وترجيح حسب العمر والعرق والجنس والتعليم والجغرافيا. ونتائجه تتعارض مباشرة مع خطط نشر المؤسسات. يفضّل 79% بشدة وكيلًا بشريًا، ويعتقد 81% أن الذكاء الاصطناعي يُنشر لتوفير المال لا لتحسين الخدمة، ويعبّر 56% عن مشاعر سلبية تجاه استخدام الشركات للذكاء الاصطناعي أصلًا. والأسباب المذكورة محددة لا مجرد عداء غامض: يقول 61% إن الوكلاء البشريين يفهمون احتياجاتهم بشكل أفضل، ويذكر 53% تفسيرات أكثر شمولًا، ويرى 52% ببساطة أن البشر أقل إثارة للإحباط.
| المقياس | القيمة | المصدر |
|---|---|---|
| البالغون الأمريكيون المستطلَعون (10-11 ديسمبر 2025) | 2,017 (±2.5 pts) | SurveyMonkey |
| يفضّلون بشدة إنسانًا على وكيل ذكاء اصطناعي | 79% | SurveyMonkey |
| يعتقدون أن الوكلاء البشريين أكثر دقة | 84% | SurveyMonkey |
| يرون أنه يجب على الشركات دائمًا إتاحة خيار الوصول إلى إنسان | 89% | SurveyMonkey |
| يعتقدون أن الذكاء الاصطناعي يُستخدم لتوفير المال لا لتحسين الخدمة | 81% | SurveyMonkey |
| لا يعتقدون أن الذكاء الاصطناعي يمكن أن يحل محل البشر أبدًا | 63% | SurveyMonkey |
| جيل Z الذي يفضّل الذكاء الاصطناعي | 14% | SurveyMonkey |
| جيل طفرة المواليد (Boomers) الذي يفضّل الذكاء الاصطناعي | 4% | SurveyMonkey |
| واثقون من قدرتهم على تمييز روبوت دردشة يعمل بالذكاء الاصطناعي | 54% | SurveyMonkey |
يضيف تقرير Voices.com “Amplified 2026”، الذي أجرته Censuswide على 700 من قادة الأعمال والمستهلكين ونُشر في 28 يناير 2026، الجانب المقابل من منظور العلامة التجارية: يقول 79% من قادة الأعمال إن أصوات الذكاء الاصطناعي ينبغي أن تصدر عن ممثلي صوت حقيقيين، ويقول 79% إن أصوات الذكاء الاصطناعي غير الأصيلة تضر بإدراك العلامة التجارية، ويجد 61% من المستهلكين أصوات الذكاء الاصطناعي أكثر رسوخًا في الذاكرة عندما ترتبط بعلامة تجارية واحدة. المصادر: SurveyMonkey وVoices.com.
7. أين يحطّ وكلاء الصوت أولًا
النشر لا ينتشر بالتساوي. تفيد Grand View Research بأن وكلاء المكالمات الواردة استحوذوا على 52.1% من إيرادات 2025 وأتمتة دعم العملاء على 44.2%، مع كون الرعاية الصحية الاستخدام النهائي الأسرع نموًا بمعدل نمو سنوي مركب 42.0% حتى 2033. ويتوافق تحليل a16z لمؤسسي وكلاء الصوت في Y Combinator مع ذلك: يستهدف نحو 69% منهم الشركات (B2B)، و18% الرعاية الصحية، و13% المستهلكين. وضمن الرعاية الصحية، التخصص أدق مما توحي به الفئة: 11.2% للطب البشري العام، و3.4% لطب الأسنان، و2.2% للطب البيطري، و1.1% للعلاج الطبيعي. ويفضّل هذا النمط القطاعات ذات حجم المكالمات المرتفع، والنصوص الموحدة، ونقص التوظيف المزمن، وسجل امتثال موثّق.
| المقياس | القيمة | المصدر |
|---|---|---|
| وكلاء الصوت للمكالمات الواردة، حصة من إيرادات 2025 | 52.1% | Grand View Research |
| أتمتة دعم العملاء، حصة من إيرادات 2025 | 44.2% | Grand View Research |
| معدل النمو السنوي المركب للاستخدام النهائي في الرعاية الصحية، 2026-2033 | 42.0% | Grand View Research |
| مؤسسو وكلاء الصوت في Y Combinator الذين يبنون حلولًا للشركات | approx. 69% | a16z |
| مؤسسو وكلاء الصوت في Y Combinator في الرعاية الصحية | approx. 18% | a16z |
| مؤسسو وكلاء الصوت في Y Combinator في قطاع المستهلكين | approx. 13% | a16z |
| مؤسسو وكلاء الصوت للشركات في Y Combinator العاملون في التكنولوجيا المالية | 16.9% | a16z |
| مؤسسو وكلاء الصوت للشركات في Y Combinator العاملون في العمليات والدعم | 12.4% | a16z |
| الإيرادات السنوية لصناعة التوظيف (سياق لوكلاء التوظيف) | $650 billion | a16z |
المقياس الوحيد الموثّق للنتائج في تقرير a16z هو وكالة توظيف حسّنت معدل تقدّم المرشحين في الفرز الأولي من 50% إلى 90%، وهي دراسة حالة فردية لا معيارًا عامًا. المصدر: تحديث a16z حول وكلاء الصوت بالذكاء الاصطناعي.
الملخص: وكلاء الصوت بالذكاء الاصطناعي بالأرقام
| المقياس | القيمة | المصدر |
|---|---|---|
| سوق وكلاء الصوت بالذكاء الاصطناعي، 2025 | $2.54 billion | Grand View Research |
| سوق وكلاء الصوت بالذكاء الاصطناعي، توقعات 2033 | $35.24 billion | Grand View Research |
| معدل النمو السنوي المركب لوكلاء الصوت بالذكاء الاصطناعي، 2026-2033 | 39.0% | Grand View Research |
| سوق الذكاء الاصطناعي الحواري، 2026 | $17.97 billion | Fortune Business Insights |
| سوق الذكاء الاصطناعي الحواري، توقعات 2034 | $82.46 billion | Fortune Business Insights |
| قادة الأعمال الذين يصفون الذكاء الاصطناعي الصوتي بأنه أساسي للاستراتيجية | 67% | Deepgram / Opus Research |
| راضون جدًا عن وكلاء الصوت التقليديين | 21% | Deepgram / Opus Research |
| يخططون لزيادة ميزانيات الذكاء الاصطناعي الصوتي خلال 12 شهرًا | 84% | Deepgram / Opus Research |
| المؤسسات التي تلتقط بيانات كلامها | 92% | Deepgram / Opus Research |
| قادة خدمة العملاء الخاضعون لضغط نشر الذكاء الاصطناعي في 2026 | 91% | Gartner |
| مشكلات الخدمة الشائعة المحلولة بشكل مستقل بحلول 2029 | 80% (forecast) | Gartner |
| خفض التكاليف التشغيلية المتوقع بحلول 2029 | 30% | Gartner |
| البالغون الأمريكيون الذين يفضّلون بشدة وكيلًا بشريًا | 79% | SurveyMonkey |
| البالغون الأمريكيون الراغبون في إتاحة خيار الوصول إلى إنسان دائمًا | 89% | SurveyMonkey |
| البالغون الأمريكيون الذين يعتقدون أن الذكاء الاصطناعي يُنشر لخفض التكاليف | 81% | SurveyMonkey |
| المستهلكون الذين يستخدمون الصوت للتفاعل مع الذكاء الاصطناعي | 55% | Voices.com |
| الشركات التي لديها ذكاء اصطناعي صوتي موجَّه للعملاء فعّال | 29% | Voices.com |
| تقييم ElevenLabs، فبراير 2026 | $11 billion | ElevenLabs |
| الإيرادات المتكررة السنوية لـ ElevenLabs بنهاية 2025 | $330+ million | ElevenLabs |
| شركات وكلاء الصوت في Y Combinator منذ 2020 | 90 | a16z |
| صوت الإخراج لـ gpt-realtime-2.1، لكل مليون رمز | $64.00 | OpenAI |
| تفريغ gpt-transcribe، لكل دقيقة | $0.0045 | OpenAI |
المنهجية والمصادر
- أرقام تبني المؤسسات والتفريغ الصوتي والرضا والميزانيات مستمدة من استطلاع Deepgram لحالة الذكاء الاصطناعي الصوتي، الذي أُجري بالتعاون مع Opus Research على 400 من قادة الأعمال في أكثر من عشر صناعات (Deepgram).
- أرقام الضغط التنفيذي وتوقع الحل المستقل لعام 2029 مستمدة من بيانين صحفيين لشركة Gartner: استطلاع قادة خدمة العملاء لفبراير 2026 (Gartner) وتوقع الذكاء الاصطناعي الوكيل لمارس 2025 (Gartner).
- بيانات تفضيلات المستهلكين مستمدة من استطلاع SurveyMonkey الذي شمل 2,017 من البالغين الأمريكيين وأُجري في 10-11 ديسمبر 2025، بهامش خطأ يبلغ زائد أو ناقص 2.5 نقطة مئوية، مرجَّح حسب العمر والعرق والجنس والتعليم والجغرافيا (SurveyMonkey).
- أرقام استخدام المستهلكين للصوت، وإدراك العلامة التجارية، وترخيص الصوت مستمدة من تقرير Voices.com “Amplified 2026 State of Voice”، الذي أجرته Censuswide على 700 من قادة الأعمال والمستهلكين ونُشر في 28 يناير 2026 (Voices.com).
- أرقام التمويل والتقييم والإيرادات المتكررة السنوية وتغطية اللغات هي إفصاحات مباشرة من إعلان ElevenLabs لجولة التمويل من الفئة D بتاريخ 4 فبراير 2026 (ElevenLabs).
- بيانات مسار الشركات الناشئة، والتوزيع القطاعي، وتخفيضات أسعار API الفورية (realtime) في ديسمبر 2024، مستمدة من بحث a16z حول وكلاء الصوت بالذكاء الاصطناعي، الذي ينسب نسبة دفعة YC إلى Cartesia (a16z).
- يعتمد قياس حجم السوق على شركتين بتعريفات فئات مختلفة: Grand View Research لوكلاء الصوت بالذكاء الاصطناعي تحديدًا (Grand View Research) وFortune Business Insights للذكاء الاصطناعي الحواري بما يشمل روبوتات الدردشة النصية (Fortune Business Insights).
- تسعير كل رمز وكل دقيقة مستمد من صفحة تسعير API المنشورة من OpenAI، محدَّثة حتى وقت هذا التحديث (OpenAI).
- ملاحظة على البيانات: التوقعان السوقيان هنا غير قابلين للتبادل، إذ تقيس Grand View Research وكلاء الصوت وحدهم بينما تُدرج Fortune Business Insights روبوتات الدردشة النصية ضمن فئة أكبر بنحو سبع مرات؛ وأي مقالة تعرض رقمًا واحدًا لـ”حجم سوق الذكاء الاصطناعي الصوتي” دون تحديد التعريف المستخدم ينبغي التعامل معها بحذر. ادعاءات العائد على الاستثمار المنشورة من الموردين والمتداولة في هذه الفئة (عوائد على مدى ثلاث سنوات تتجاوز 300%، وتكاليف لكل مكالمة أقل من دولار واحد) تعود أصولها إلى صفحات تسويقية لا إلى دراسات مدقَّقة، واستُبعدت من هذا الملخص.
- استطلاع Deepgram هو أحدث نسخة متاحة وقت كتابة هذا الملخص؛ ومن المتوقع أن تُحرّك موجة محدَّثة أرقام الرضا والميزانيات أكثر من غيرها.
- آخر تحديث: 29 يوليو 2026. نحدّث هذا الملخص فصليًا كلما صدرت إصدارات جديدة من Gartner وDeepgram وأبحاث السوق.