Статистика голосового ИИ (2026): 45+ фактов о финансировании, запусках и регулировании в первом полугодии

Статистика голосового ИИ 2026: итоги полугодия по раундам финансирования, запускам моделей, регулированию и данным о мошенничестве, по данным Bloomberg, FTC, Pindrop и Gartner.

ElevenLabs начала 2026 год с оценкой в $11 миллиардов, а через пять месяцев уже вела переговоры о tender offer, который оценил бы компанию в $22 миллиарда (Bloomberg, 2026). Это удвоение символизирует шестимесячный период, когда капитал, продукт и регулирование двигались одновременно. Deepgram привлекла $130 млн при оценке в $1.3 миллиарда в январе (Deepgram, 2026); OpenAI выпустила пять новых моделей голоса реального времени с мая по июль (OpenAI, 2026); а FTC США сообщила, что мошенничество с выдачей себя за другое лицо обошлось американцам в $3.5 миллиарда в 2025 году (FTC, 2026). Этот анализ объединяет данные TechCrunch, Bloomberg, FTC, Pindrop, OpenAI, Gartner, European Commission и еще 20 первичных источников в датированную летопись того, что реально происходило в сфере голосового ИИ в первой половине 2026 года.

Для базового контекста о технологии см. наш справочник статистики клонирования голоса 2026. Этот материал - хроника событий за первое полугодие.

TL;DR

  • ElevenLabs привлекла раунд Series D на $500 млн при оценке $11 млрд в феврале, а затем к 2 июля вступила в переговоры о tender offer на $22 млрд (Bloomberg, 2026).
  • Годовой периодический доход ElevenLabs вырос с $330 млн на конец 2025 года до $500 млн к апрелю 2026 года (TechCrunch / Sacra, 2026).
  • Deepgram привлекла $130 млн при оценке $1.3 млрд 13 января и уже расшифровала более 1 триллиона слов (Deepgram, 2026).
  • OpenAI запустила GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper 7 мая, а затем полнодуплексные модели GPT-Live-1 8 июля (OpenAI, 2026; TechCrunch, 2026).
  • Vapi привлекла $50 млн и превысила 1 миллиард звонков; Bland привлекла $50 млн после отказа от 180 инвесторов (Vapi, 2026; Fortune, 2026).
  • Правила прозрачности статьи 50 EU AI Act для синтетического аудио применяются с 2 августа 2026 года, со штрафами до EUR 15 млн или 3% глобального оборота (European Commission, 2026).
  • FTC зафиксировала $3.5 млрд убытков от мошенничества с выдачей себя за другое лицо за 2025 год из примерно $16 млрд общего заявленного мошенничества, рост примерно на 25% в годовом исчислении (FTC, 2026).
  • Pindrop зафиксировала рост дипфейк-мошенничества в контакт-центрах на 1,300% на выборке из 1.2 млрд проанализированных звонков (Pindrop, отчет 2025 года).
  • В бенчмарке восьми детекторов, проведенном в мае 2026 года, лучшая система набрала 98.1%, тогда как люди в параллельном исследовании достигли лишь 68.7% (Resemble AI / Podonos, 2026; arXiv, 2026).
  • Мировой рынок распознавания речи и голоса достиг примерно $23.70 млрд в 2026 году (Fortune Business Insights, 2026).

1. Всплеск финансирования в первом полугодии 2026 года

Деньги пришли быстрее, чем продукт. Определяющей особенностью полугодия стала переоценка: ElevenLabs привлекла средства при оценке в $11 миллиардов в феврале и уже получала интерес к tender offer при оценке $22 миллиарда к июлю - оценка удвоилась примерно за пять месяцев без нового первичного раунда (Bloomberg, 2026). ElevenLabs также превысила $500 млн годового периодического дохода к апрелю 2026 года, поднявшись с $330 млн на конец 2025 года (TechCrunch / Sacra, 2026) - рост, который дал более поздним инвесторам базу дохода для обоснования переоценки. Инфраструктурный слой рос в цене параллельно: Deepgram, продающая речевые API, а не голоса для потребителей, достигла оценки в $1.3 миллиарда в январе.

Эта тенденция не ограничивалась мегасделками. Vapi и Bland закрыли раунды по $50 млн каждая для корпоративных голосовых агентов, а стартап диктовки Wispr вступил в переговоры о примерно $260 млн при оценке около $2 миллиардов. Венчурное финансирование голосового ИИ уже выросло с примерно $315 млн в 2022 году до $2.1 миллиарда в 2024 году (AssemblyAI, 2026), и первое полугодие 2026 года сохранило эту крутую кривую роста.

ПоказательЗначениеИсточник
Series D ElevenLabs$500M at $11B valuation (Feb 4, 2026)TechCrunch, 2026
ARR ElevenLabs$330M (end 2025) to $500M (April 2026)TechCrunch / Sacra, 2026
Переговоры о tender offer ElevenLabs~$22B valuation (July 2, 2026)Bloomberg, 2026
Series C Deepgram$130M at $1.3B valuation (Jan 13, 2026)Deepgram, 2026
Series B Vapi$50M, led by Peak XV (May 12, 2026)Vapi / GlobeNewswire, 2026
Series C Bland$50M, after 180 investor rejections (June 16, 2026)Fortune, 2026
Переговоры о финансировании Wispr~$260M at ~$2B valuation (May 2026)Bloomberg, 2026
Венчурные инвестиции в голосовой ИИ (контекст)~$315M (2022) to $2.1B (2024)AssemblyAI, 2026

Контекст: PolyAI закрыла раунд Series D на $86 млн при оценке $750 млн в декабре 2025 года, а общий раскрытый объем финансирования Cartesia достиг $191 млн в октябре 2025 года - оба события произошли незадолго до этого периода, показывая конвейер сделок, который питал первое полугодие. См. материал TechCrunch о раунде ElevenLabs и пресс-релиз Deepgram о Series C.

2. Запуски моделей: что вышло с января по июнь 2026 года

Полугодие определил переход от пайплайнов к полнодуплексному аудио. Более старые голосовые ассистенты соединяли три модели последовательно - речь в текст, языковую модель, затем текст в речь - что добавляло задержку и обрывало естественные прерывания. OpenAI свернула этот стек, выпустив GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper 7 мая 2026 года, а затем полнодуплексные модели GPT-Live-1 8 июля, которые слушают и говорят одновременно (OpenAI, 2026; TechCrunch, 2026). Один только GPT-Realtime-Translate обрабатывает более 70 входных языков с переводом на 13 выходных языков, не отставая от темпа говорящего (OpenAI, 2026).

Ценовое давление стало второй темой полугодия. Gemini 3.1 Flash TTS от Google, выпущенный 15 апреля, подрезал цены премиальных конкурентов по стоимости символа, уступая им в бенчмарках качества. ElevenLabs по-прежнему возглавляла независимый рейтинг TTS Artificial Analysis, но разрыв сократился, поскольку Microsoft внедрила низколатентные модели Voice Live в Azure Speech на своей конференции Build 2026.

ПоказательЗначениеИсточник
Модели голоса реального времени OpenAIGPT-Realtime-2 / Translate / Whisper (May 7, 2026)OpenAI, 2026
Языки GPT-Realtime-Translate70+ input to 13 outputOpenAI, 2026
Полнодуплексные модели OpenAIGPT-Live-1 and GPT-Live-1 mini (July 8, 2026)TechCrunch, 2026
Google Gemini 3.1 Flash TTSLaunched April 15, 2026; 40+ languagesGoogle (via trade press), 2026
Цена Gemini 3.1 Flash TTS~$0.012 per 1K charactersTrade benchmark, 2026
Рейтинг TTSElevenLabs #1 (~1,280 Elo), Gemini #2 (1,211)Artificial Analysis, 2026
Microsoft Azure SpeechVoice Live + Azure-Realtime at Build 2026Microsoft, 2026
ElevenLabs v3Generally available, expressive multi-speakerElevenLabs, 2026

Заметка об исключении: GPT-Live-1 был запущен 8 июля, через несколько дней после отметки полугодия, но относится к тому же продуктовому циклу. Читайте пост OpenAI о запуске.

3. Регулирование ужесточилось в трех юрисдикциях

Нормотворчество догнало продуктовый цикл. Обязательства по прозрачности статьи 50 EU AI Act - которые требуют, чтобы аудио, созданное ИИ, было машиночитаемым и раскрывалось, - применяются с 2 августа 2026 года, подкрепленные штрафами до EUR 15 миллионов или 3 процентов глобального оборота (European Commission, 2026). Комиссия торопилась довести Code of Practice по контенту, созданному ИИ, до финальной версии к июню 2026 года, чтобы дать поставщикам план соответствия до наступления срока.

Соединенные Штаты действовали по двум направлениям. Законодатели повторно внесли пересмотренную версию NO FAKES Act в мае 2026 года, чтобы создать федеральное право против несанкционированных ИИ-копий голоса и внешности, а обязательства платформ по удалению контента в рамках TAKE IT DOWN Act достигли срока соответствия 19 мая 2026 года, требуя удаления помеченного контента в течение 48 часов. Дания пошла дальше всех, продвинув законопроект, который рассматривает лицо и голос человека как право, аналогичное авторскому, действующее в течение 50 лет после смерти.

В рамках этих правил, основанных на согласии, инструменты, построенные вокруг клонирования собственного голоса с разрешения - такие как программное обеспечение для клонирования голоса от VoxBooster - находятся на стороне соответствия требованиям этой границы. Для более широкой картины политики см. наш обзор статистики регулирования ИИ 2026.

ПоказательЗначениеИсточник
Маркировка аудио по статье 50 EU AI ActEffective August 2, 2026European Commission, 2026
Штрафы за прозрачность по EU AI ActUp to EUR 15M or 3% of global turnoverEuropean Commission, 2026
NO FAKES Act (пересмотренный)Reintroduced May 2026U.S. Senate, 2026
Опрос об обеспокоенности дипфейками92% of Americans concerned about deepfakesU.S. Senate (NO FAKES release), 2026
Удаления по TAKE IT DOWN Act48-hour removal; compliance deadline May 19, 2026TAKE IT DOWN Act, 2026
Законопроект Дании о правах на внешностьProtection 50 years after deathEuropean Parliament (EPRS), 2026
Штаты США без закона о предвыборных дипфейках~22 as of June 2026Recording Law tracker, 2026
Решение FCC по робозвонкам с ИИ (контекст)Up to $23K per illegal callFCC, 2024 (most recent available)

Tennessee ELVIS Act (2024) остается образцом, которому следует большинство законопроектов 2026 года. Первичный текст: EU AI Act, статья 50.

4. Голосовое мошенничество в цифрах

Сторона угроз масштабировалась вместе со стороной возможностей. FTC сообщила, что мошенничество с выдачей себя за другое лицо обошлось американцам в $3.5 миллиарда в 2025 году, что составило часть примерно $16 миллиардов общего заявленного мошенничества - наивысший показатель за всю историю наблюдений и рост примерно на 25 процентов в годовом исчислении (FTC, 2026). Мошенники, выдававшие себя за представителей бизнеса, составили $1 миллиард из этой суммы, а выдававшие себя за представителей государства - $920 миллионов. Эти цифры не относятся конкретно к дипфейкам, но задают базовый уровень, который синтетический голос теперь усиливает.

Контакт-центры ощутили это первыми. Pindrop зафиксировала рост попыток дипфейк-мошенничества на 1,300 процентов на выборке из 1.2 миллиарда проанализированных звонков, при этом атаки с синтетическим голосом выросли на 475 процентов у страховщиков и на 149 процентов у банков (Pindrop, отчет 2025 года). В более долгосрочной перспективе Deloitte прогнозирует рост убытков США от мошенничества с использованием генеративного ИИ с $12.3 миллиарда в 2023 году до $40 миллиардов к 2027 году (Deloitte, 2023 - most recent available).

ПоказательЗначениеИсточник
Убытки FTC от мошенничества с выдачей себя за другое лицо (2025)$3.5 billionFTC, 2026
Общее заявленное мошенничество по данным FTC (2025)~$16 billion, +25% YoYFTC, 2026
Убытки от мошенников, выдающих себя за бизнес + государство$1B + $920MFTC, 2026
Рост дипфейк-мошенничества в контакт-центрах+1,300% across 1.2B callsPindrop, 2025 report
Атаки с синтетическим голосом по секторамInsurance +475%, banking +149%, retail +107%Pindrop, 2025 report
Прогноз мошенничества с генеративным ИИ в США$12.3B (2023) to $40B (2027), 32% CAGRDeloitte, 2023
Организации, пострадавшие от дипфейк-атаки (за последние 12 мес.)62%Gartner, 2025

Эти суммарные показатели не относятся конкретно к дипфейкам, но задают базовый уровень, который синтетический голос теперь усиливает. Первоисточник: Pindrop 2025 Voice Intelligence and Security Report.

5. Детекция: можем ли мы еще отличить подделку?

Детекция улучшилась на бумаге и столкнулась с трудностями на практике. В бенчмарке восьми систем детекции аудио-дипфейков, проведенном в мае 2026 года, лучший детектор набрал 98.1 процента совокупной точности, но параллельное исследование 2026 года показало, что необученные люди распознавали синтетические голоса лишь в 68.7 процента случаев (Resemble AI / Podonos, 2026; arXiv, 2026). Разрыв между машиной и человеком составляет теперь около 26 пунктов и расширяется по мере улучшения синтетических голосов.

Загвоздка - в обобщающей способности. Исследователи обнаружили, что детекторы, обученные на распределении данных ASVspoof эпохи 2019 года, не улавливают надежно атаки 2026 года, а большинство инструментов по-прежнему охватывают только английский язык - оставляя клонирование голоса на других языках открытой поверхностью атаки (arXiv, 2026).

ПоказательЗначениеИсточник
Лучший детектор (бенчмарк Podonos)Resemble AI, 98.1% pooled accuracyResemble AI / Podonos, 2026
Детектор на втором местеAurigin, 96.8%Podonos, 2026
Resemble AI Detect (чистое аудио)94.2%Resemble AI, 2026
Точность машинной детекции94.5% across 138 attacksarXiv, 2026
Точность детекции людьми68.7% (1,768 users)arXiv, 2026
Охват языков в бенчмаркеEnglish only (noted gap)arXiv / Resemble AI, 2026
Устаревшие детекторы (обученные на ASVspoof 2019)Generalize poorly to 2026 attacksarXiv, 2026

Настоящая проблема - не сырая точность, а несоответствие распределения обучающих данных. См. бенчмарк детекции аудио-дипфейков и наш разбор статистики детекции дипфейков 2026.

6. Размер рынка и корпоративное внедрение

За заголовками рынок продолжал расти. Fortune Business Insights оценила мировой рынок распознавания речи и голоса в $23.70 миллиарда в 2026 году, прогнозируя рост до $104.05 миллиарда к 2034 году при CAGR 20.30 процента (Fortune Business Insights, 2026). Более узкий сегмент генераторов голоса на базе ИИ - текст в речь плюс клонирование - составил около $4.16 миллиарда в 2025 году (MarketsandMarkets, 2025), а подсегмент клонирования голоса - около $2.4 миллиарда (Mordor Intelligence, 2025).

Метрики внедрения перешли от прогнозов к реальному использованию. Gartner по-прежнему прогнозирует, что разговорный ИИ сократит затраты на персонал контакт-центров на $80 миллиардов в 2026 году, но более показательны цифры продакшена: Vapi обработала более 1 миллиарда звонков, а Deepgram расшифровала более 1 триллиона слов к началу 2026 года. Взгляд в будущее см. в нашем прогнозном материале статистики рынка голосового ИИ 2027.

ПоказательЗначениеИсточник
Рынок распознавания речи и голоса (2026)$23.70 billionFortune Business Insights, 2026
Тот же рынок (прогноз на 2034)$104.05 billion, 20.30% CAGRFortune Business Insights, 2026
Сегмент генераторов голоса на базе ИИ (2025)$4.16 billionMarketsandMarkets, 2025
Подсегмент клонирования голоса (2025)$2.4 billionMordor Intelligence, 2025
Экономия на персонале за счет разговорного ИИ (2026)$80 billionGartner, 2022 forecast for 2026
Организации клиентского сервиса, использующие разговорный ИИ80% (forecast)Gartner, 2026
Руководители CS под давлением необходимости внедрять ИИ91%Gartner, 2026
Индикаторы использования в продакшенеVapi 1B+ calls; Deepgram 1T+ wordsVapi / Deepgram, 2026

Оценки расходятся в зависимости от охвата: Coherent Market Insights оценила рынок распознавания голоса примерно в $22.66 млрд в 2026 году, что близко к данным Fortune Business Insights. Первичный источник: прогноз Gartner для контакт-центров.

Итоги: голосовой ИИ в первом полугодии 2026 года в цифрах

ПоказательЗначениеИсточник
Series D ElevenLabs$500M at $11B (Feb 4, 2026)TechCrunch, 2026
Переговоры о tender offer ElevenLabs~$22B (July 2, 2026)Bloomberg, 2026
ARR ElevenLabs$330M to $500M (end 2025 to April 2026)TechCrunch / Sacra, 2026
Series C Deepgram$130M at $1.3B (Jan 13, 2026)Deepgram, 2026
Series B Vapi$50M, 1B+ calls (May 12, 2026)Vapi, 2026
Series C Bland$50M (June 16, 2026)Fortune, 2026
Модели голоса реального времени OpenAI3 launched May 7, 2026OpenAI, 2026
Полнодуплексные модели OpenAIGPT-Live-1 (July 8, 2026)TechCrunch, 2026
Gemini 3.1 Flash TTSLaunched April 15, 2026Google, 2026
Статья 50 EU AI ActEffective August 2, 2026European Commission, 2026
NO FAKES Act (пересмотренный)Reintroduced May 2026U.S. Senate, 2026
Удаления по TAKE IT DOWN Act48-hour deadline May 19, 2026TAKE IT DOWN Act, 2026
Убытки FTC от мошенничества с выдачей себя за другое лицо (2025)$3.5 billionFTC, 2026
Общее заявленное мошенничество по данным FTC (2025)~$16 billion, +25% YoYFTC, 2026
Рост дипфейк-мошенничества по данным Pindrop+1,300% across 1.2B callsPindrop, 2025 report
Точность лучшего детектора дипфейков98.1%Resemble AI / Podonos, 2026
Точность детекции людьми68.7%arXiv, 2026
Рынок распознавания речи и голоса (2026)$23.70 billionFortune Business Insights, 2026
Экономия на персонале за счет разговорного ИИ (2026)$80 billionGartner, 2022 forecast

Методология и источники

Данные были собраны путем агрегирования датированных публикаций 2026 года, отчетов первичных исследований, регуляторных текстов и объявлений о финансировании, опубликованных в период с января по июль 2026 года, с перекрестной проверкой рыночных и мошеннических показателей по двум или более источникам и пометкой любых цифр старше 2024 года.

  • TechCrunch - материалы о ElevenLabs, Deepgram и OpenAI (2026): Series D ElevenLabs
  • Bloomberg - tender offer ElevenLabs на $22 млрд и переговоры о финансировании Wispr (2026)
  • Deepgram - пресс-релиз о Series C (2026): Series C Deepgram на $130 млн
  • Vapi / GlobeNewswire - Series B и метрики использования (2026)
  • Fortune - материал о Series C Bland (2026)
  • Sacra - профиль дохода и ARR ElevenLabs (2026)
  • AssemblyAI - трекер инвестиций в голосовой ИИ 2026 (2026)
  • OpenAI - Advancing Voice Intelligence with New Models in the API (2026): пост OpenAI о запуске
  • Google - запуск Gemini 3.1 Flash TTS (2026, через отраслевую прессу)
  • Microsoft - Azure Speech на Build 2026 (2026)
  • ElevenLabs - раскрытия о Eleven v3 и Series D (2026)
  • Artificial Analysis - рейтинг моделей TTS (2026)
  • European Commission - статья 50 EU AI Act и Code of Practice (2026): текст статьи 50
  • U.S. Senate - пресс-релиз о пересмотренном NO FAKES Act (2026)
  • European Parliament (EPRS) - анализ датского законопроекта об авторских правах на дипфейки (2026)
  • Recording Law - трекер законов штатов США о дипфейках (2026)
  • FCC - решение по робозвонкам с ИИ в рамках TCPA (2024)
  • U.S. Federal Trade Commission - данные о мошенничестве с выдачей себя за другое лицо и общем мошенничестве за 2025 год (2026): данные FTC о мошенничестве за 2025 год
  • Pindrop - 2025 Voice Intelligence and Security Report (2025): отчет Pindrop
  • Deloitte Center for Financial Services - прогноз мошенничества с генеративным ИИ (2023)
  • Gartner - разговорный ИИ, риск дипфейков и опросы клиентского сервиса (2022-2026)
  • Resemble AI / Podonos - бенчмарк детекции аудио-дипфейков (2026): бенчмарк детекции
  • arXiv - академические исследования человеческой и машинной детекции дипфейк-голоса (2026)
  • Fortune Business Insights - отчет о рынке распознавания речи и голоса (2026)
  • MarketsandMarkets - отчет о рынке генераторов голоса на базе ИИ (2025)
  • Mordor Intelligence - отчет о рынке клонирования голоса (2025)
  • Sifted - материал о посевном раунде Gradium / Nvidia (2026)

Data watch: FTC публикует итоговые данные о мошенничестве Consumer Sentinel ежегодно, следующее издание ожидается в начале 2027 года; Pindrop публикует свой Voice Intelligence and Security Report ежегодно, следующее издание ожидается позже в 2026 году; Gartner обновляет свои опросы о разговорном ИИ и клиентском сервисе в течение года; EU AI Act достигает вехи правоприменения статьи 50 2 августа 2026 года; а Deloitte периодически обновляет свой прогноз мошенничества с генеративным ИИ.

Последнее обновление: 11 июля 2026 года. Мы пересматриваем и обновляем эту страницу ежеквартально по мере публикации новых данных.

Попробуй VoxBooster — 3 дня бесплатно.

Клонирование голоса в реальном времени, саундборд и эффекты — везде, где ты говоришь.

  • Без карты
  • ~30 мс задержки
  • Discord · Teams · OBS
Попробовать 3 дня бесплатно