ElevenLabs начала 2026 год с оценкой в $11 миллиардов, а через пять месяцев уже вела переговоры о tender offer, который оценил бы компанию в $22 миллиарда (Bloomberg, 2026). Это удвоение символизирует шестимесячный период, когда капитал, продукт и регулирование двигались одновременно. Deepgram привлекла $130 млн при оценке в $1.3 миллиарда в январе (Deepgram, 2026); OpenAI выпустила пять новых моделей голоса реального времени с мая по июль (OpenAI, 2026); а FTC США сообщила, что мошенничество с выдачей себя за другое лицо обошлось американцам в $3.5 миллиарда в 2025 году (FTC, 2026). Этот анализ объединяет данные TechCrunch, Bloomberg, FTC, Pindrop, OpenAI, Gartner, European Commission и еще 20 первичных источников в датированную летопись того, что реально происходило в сфере голосового ИИ в первой половине 2026 года.
Для базового контекста о технологии см. наш справочник статистики клонирования голоса 2026. Этот материал - хроника событий за первое полугодие.
TL;DR
- ElevenLabs привлекла раунд Series D на $500 млн при оценке $11 млрд в феврале, а затем к 2 июля вступила в переговоры о tender offer на $22 млрд (Bloomberg, 2026).
- Годовой периодический доход ElevenLabs вырос с $330 млн на конец 2025 года до $500 млн к апрелю 2026 года (TechCrunch / Sacra, 2026).
- Deepgram привлекла $130 млн при оценке $1.3 млрд 13 января и уже расшифровала более 1 триллиона слов (Deepgram, 2026).
- OpenAI запустила GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper 7 мая, а затем полнодуплексные модели GPT-Live-1 8 июля (OpenAI, 2026; TechCrunch, 2026).
- Vapi привлекла $50 млн и превысила 1 миллиард звонков; Bland привлекла $50 млн после отказа от 180 инвесторов (Vapi, 2026; Fortune, 2026).
- Правила прозрачности статьи 50 EU AI Act для синтетического аудио применяются с 2 августа 2026 года, со штрафами до EUR 15 млн или 3% глобального оборота (European Commission, 2026).
- FTC зафиксировала $3.5 млрд убытков от мошенничества с выдачей себя за другое лицо за 2025 год из примерно $16 млрд общего заявленного мошенничества, рост примерно на 25% в годовом исчислении (FTC, 2026).
- Pindrop зафиксировала рост дипфейк-мошенничества в контакт-центрах на 1,300% на выборке из 1.2 млрд проанализированных звонков (Pindrop, отчет 2025 года).
- В бенчмарке восьми детекторов, проведенном в мае 2026 года, лучшая система набрала 98.1%, тогда как люди в параллельном исследовании достигли лишь 68.7% (Resemble AI / Podonos, 2026; arXiv, 2026).
- Мировой рынок распознавания речи и голоса достиг примерно $23.70 млрд в 2026 году (Fortune Business Insights, 2026).
1. Всплеск финансирования в первом полугодии 2026 года
Деньги пришли быстрее, чем продукт. Определяющей особенностью полугодия стала переоценка: ElevenLabs привлекла средства при оценке в $11 миллиардов в феврале и уже получала интерес к tender offer при оценке $22 миллиарда к июлю - оценка удвоилась примерно за пять месяцев без нового первичного раунда (Bloomberg, 2026). ElevenLabs также превысила $500 млн годового периодического дохода к апрелю 2026 года, поднявшись с $330 млн на конец 2025 года (TechCrunch / Sacra, 2026) - рост, который дал более поздним инвесторам базу дохода для обоснования переоценки. Инфраструктурный слой рос в цене параллельно: Deepgram, продающая речевые API, а не голоса для потребителей, достигла оценки в $1.3 миллиарда в январе.
Эта тенденция не ограничивалась мегасделками. Vapi и Bland закрыли раунды по $50 млн каждая для корпоративных голосовых агентов, а стартап диктовки Wispr вступил в переговоры о примерно $260 млн при оценке около $2 миллиардов. Венчурное финансирование голосового ИИ уже выросло с примерно $315 млн в 2022 году до $2.1 миллиарда в 2024 году (AssemblyAI, 2026), и первое полугодие 2026 года сохранило эту крутую кривую роста.
| Показатель | Значение | Источник |
|---|---|---|
| Series D ElevenLabs | $500M at $11B valuation (Feb 4, 2026) | TechCrunch, 2026 |
| ARR ElevenLabs | $330M (end 2025) to $500M (April 2026) | TechCrunch / Sacra, 2026 |
| Переговоры о tender offer ElevenLabs | ~$22B valuation (July 2, 2026) | Bloomberg, 2026 |
| Series C Deepgram | $130M at $1.3B valuation (Jan 13, 2026) | Deepgram, 2026 |
| Series B Vapi | $50M, led by Peak XV (May 12, 2026) | Vapi / GlobeNewswire, 2026 |
| Series C Bland | $50M, after 180 investor rejections (June 16, 2026) | Fortune, 2026 |
| Переговоры о финансировании Wispr | ~$260M at ~$2B valuation (May 2026) | Bloomberg, 2026 |
| Венчурные инвестиции в голосовой ИИ (контекст) | ~$315M (2022) to $2.1B (2024) | AssemblyAI, 2026 |
Контекст: PolyAI закрыла раунд Series D на $86 млн при оценке $750 млн в декабре 2025 года, а общий раскрытый объем финансирования Cartesia достиг $191 млн в октябре 2025 года - оба события произошли незадолго до этого периода, показывая конвейер сделок, который питал первое полугодие. См. материал TechCrunch о раунде ElevenLabs и пресс-релиз Deepgram о Series C.
2. Запуски моделей: что вышло с января по июнь 2026 года
Полугодие определил переход от пайплайнов к полнодуплексному аудио. Более старые голосовые ассистенты соединяли три модели последовательно - речь в текст, языковую модель, затем текст в речь - что добавляло задержку и обрывало естественные прерывания. OpenAI свернула этот стек, выпустив GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper 7 мая 2026 года, а затем полнодуплексные модели GPT-Live-1 8 июля, которые слушают и говорят одновременно (OpenAI, 2026; TechCrunch, 2026). Один только GPT-Realtime-Translate обрабатывает более 70 входных языков с переводом на 13 выходных языков, не отставая от темпа говорящего (OpenAI, 2026).
Ценовое давление стало второй темой полугодия. Gemini 3.1 Flash TTS от Google, выпущенный 15 апреля, подрезал цены премиальных конкурентов по стоимости символа, уступая им в бенчмарках качества. ElevenLabs по-прежнему возглавляла независимый рейтинг TTS Artificial Analysis, но разрыв сократился, поскольку Microsoft внедрила низколатентные модели Voice Live в Azure Speech на своей конференции Build 2026.
| Показатель | Значение | Источник |
|---|---|---|
| Модели голоса реального времени OpenAI | GPT-Realtime-2 / Translate / Whisper (May 7, 2026) | OpenAI, 2026 |
| Языки GPT-Realtime-Translate | 70+ input to 13 output | OpenAI, 2026 |
| Полнодуплексные модели OpenAI | GPT-Live-1 and GPT-Live-1 mini (July 8, 2026) | TechCrunch, 2026 |
| Google Gemini 3.1 Flash TTS | Launched April 15, 2026; 40+ languages | Google (via trade press), 2026 |
| Цена Gemini 3.1 Flash TTS | ~$0.012 per 1K characters | Trade benchmark, 2026 |
| Рейтинг TTS | ElevenLabs #1 (~1,280 Elo), Gemini #2 (1,211) | Artificial Analysis, 2026 |
| Microsoft Azure Speech | Voice Live + Azure-Realtime at Build 2026 | Microsoft, 2026 |
| ElevenLabs v3 | Generally available, expressive multi-speaker | ElevenLabs, 2026 |
Заметка об исключении: GPT-Live-1 был запущен 8 июля, через несколько дней после отметки полугодия, но относится к тому же продуктовому циклу. Читайте пост OpenAI о запуске.
3. Регулирование ужесточилось в трех юрисдикциях
Нормотворчество догнало продуктовый цикл. Обязательства по прозрачности статьи 50 EU AI Act - которые требуют, чтобы аудио, созданное ИИ, было машиночитаемым и раскрывалось, - применяются с 2 августа 2026 года, подкрепленные штрафами до EUR 15 миллионов или 3 процентов глобального оборота (European Commission, 2026). Комиссия торопилась довести Code of Practice по контенту, созданному ИИ, до финальной версии к июню 2026 года, чтобы дать поставщикам план соответствия до наступления срока.
Соединенные Штаты действовали по двум направлениям. Законодатели повторно внесли пересмотренную версию NO FAKES Act в мае 2026 года, чтобы создать федеральное право против несанкционированных ИИ-копий голоса и внешности, а обязательства платформ по удалению контента в рамках TAKE IT DOWN Act достигли срока соответствия 19 мая 2026 года, требуя удаления помеченного контента в течение 48 часов. Дания пошла дальше всех, продвинув законопроект, который рассматривает лицо и голос человека как право, аналогичное авторскому, действующее в течение 50 лет после смерти.
В рамках этих правил, основанных на согласии, инструменты, построенные вокруг клонирования собственного голоса с разрешения - такие как программное обеспечение для клонирования голоса от VoxBooster - находятся на стороне соответствия требованиям этой границы. Для более широкой картины политики см. наш обзор статистики регулирования ИИ 2026.
| Показатель | Значение | Источник |
|---|---|---|
| Маркировка аудио по статье 50 EU AI Act | Effective August 2, 2026 | European Commission, 2026 |
| Штрафы за прозрачность по EU AI Act | Up to EUR 15M or 3% of global turnover | European Commission, 2026 |
| NO FAKES Act (пересмотренный) | Reintroduced May 2026 | U.S. Senate, 2026 |
| Опрос об обеспокоенности дипфейками | 92% of Americans concerned about deepfakes | U.S. Senate (NO FAKES release), 2026 |
| Удаления по TAKE IT DOWN Act | 48-hour removal; compliance deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| Законопроект Дании о правах на внешность | Protection 50 years after death | European Parliament (EPRS), 2026 |
| Штаты США без закона о предвыборных дипфейках | ~22 as of June 2026 | Recording Law tracker, 2026 |
| Решение FCC по робозвонкам с ИИ (контекст) | Up to $23K per illegal call | FCC, 2024 (most recent available) |
Tennessee ELVIS Act (2024) остается образцом, которому следует большинство законопроектов 2026 года. Первичный текст: EU AI Act, статья 50.
4. Голосовое мошенничество в цифрах
Сторона угроз масштабировалась вместе со стороной возможностей. FTC сообщила, что мошенничество с выдачей себя за другое лицо обошлось американцам в $3.5 миллиарда в 2025 году, что составило часть примерно $16 миллиардов общего заявленного мошенничества - наивысший показатель за всю историю наблюдений и рост примерно на 25 процентов в годовом исчислении (FTC, 2026). Мошенники, выдававшие себя за представителей бизнеса, составили $1 миллиард из этой суммы, а выдававшие себя за представителей государства - $920 миллионов. Эти цифры не относятся конкретно к дипфейкам, но задают базовый уровень, который синтетический голос теперь усиливает.
Контакт-центры ощутили это первыми. Pindrop зафиксировала рост попыток дипфейк-мошенничества на 1,300 процентов на выборке из 1.2 миллиарда проанализированных звонков, при этом атаки с синтетическим голосом выросли на 475 процентов у страховщиков и на 149 процентов у банков (Pindrop, отчет 2025 года). В более долгосрочной перспективе Deloitte прогнозирует рост убытков США от мошенничества с использованием генеративного ИИ с $12.3 миллиарда в 2023 году до $40 миллиардов к 2027 году (Deloitte, 2023 - most recent available).
| Показатель | Значение | Источник |
|---|---|---|
| Убытки FTC от мошенничества с выдачей себя за другое лицо (2025) | $3.5 billion | FTC, 2026 |
| Общее заявленное мошенничество по данным FTC (2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| Убытки от мошенников, выдающих себя за бизнес + государство | $1B + $920M | FTC, 2026 |
| Рост дипфейк-мошенничества в контакт-центрах | +1,300% across 1.2B calls | Pindrop, 2025 report |
| Атаки с синтетическим голосом по секторам | Insurance +475%, banking +149%, retail +107% | Pindrop, 2025 report |
| Прогноз мошенничества с генеративным ИИ в США | $12.3B (2023) to $40B (2027), 32% CAGR | Deloitte, 2023 |
| Организации, пострадавшие от дипфейк-атаки (за последние 12 мес.) | 62% | Gartner, 2025 |
Эти суммарные показатели не относятся конкретно к дипфейкам, но задают базовый уровень, который синтетический голос теперь усиливает. Первоисточник: Pindrop 2025 Voice Intelligence and Security Report.
5. Детекция: можем ли мы еще отличить подделку?
Детекция улучшилась на бумаге и столкнулась с трудностями на практике. В бенчмарке восьми систем детекции аудио-дипфейков, проведенном в мае 2026 года, лучший детектор набрал 98.1 процента совокупной точности, но параллельное исследование 2026 года показало, что необученные люди распознавали синтетические голоса лишь в 68.7 процента случаев (Resemble AI / Podonos, 2026; arXiv, 2026). Разрыв между машиной и человеком составляет теперь около 26 пунктов и расширяется по мере улучшения синтетических голосов.
Загвоздка - в обобщающей способности. Исследователи обнаружили, что детекторы, обученные на распределении данных ASVspoof эпохи 2019 года, не улавливают надежно атаки 2026 года, а большинство инструментов по-прежнему охватывают только английский язык - оставляя клонирование голоса на других языках открытой поверхностью атаки (arXiv, 2026).
| Показатель | Значение | Источник |
|---|---|---|
| Лучший детектор (бенчмарк Podonos) | Resemble AI, 98.1% pooled accuracy | Resemble AI / Podonos, 2026 |
| Детектор на втором месте | Aurigin, 96.8% | Podonos, 2026 |
| Resemble AI Detect (чистое аудио) | 94.2% | Resemble AI, 2026 |
| Точность машинной детекции | 94.5% across 138 attacks | arXiv, 2026 |
| Точность детекции людьми | 68.7% (1,768 users) | arXiv, 2026 |
| Охват языков в бенчмарке | English only (noted gap) | arXiv / Resemble AI, 2026 |
| Устаревшие детекторы (обученные на ASVspoof 2019) | Generalize poorly to 2026 attacks | arXiv, 2026 |
Настоящая проблема - не сырая точность, а несоответствие распределения обучающих данных. См. бенчмарк детекции аудио-дипфейков и наш разбор статистики детекции дипфейков 2026.
6. Размер рынка и корпоративное внедрение
За заголовками рынок продолжал расти. Fortune Business Insights оценила мировой рынок распознавания речи и голоса в $23.70 миллиарда в 2026 году, прогнозируя рост до $104.05 миллиарда к 2034 году при CAGR 20.30 процента (Fortune Business Insights, 2026). Более узкий сегмент генераторов голоса на базе ИИ - текст в речь плюс клонирование - составил около $4.16 миллиарда в 2025 году (MarketsandMarkets, 2025), а подсегмент клонирования голоса - около $2.4 миллиарда (Mordor Intelligence, 2025).
Метрики внедрения перешли от прогнозов к реальному использованию. Gartner по-прежнему прогнозирует, что разговорный ИИ сократит затраты на персонал контакт-центров на $80 миллиардов в 2026 году, но более показательны цифры продакшена: Vapi обработала более 1 миллиарда звонков, а Deepgram расшифровала более 1 триллиона слов к началу 2026 года. Взгляд в будущее см. в нашем прогнозном материале статистики рынка голосового ИИ 2027.
| Показатель | Значение | Источник |
|---|---|---|
| Рынок распознавания речи и голоса (2026) | $23.70 billion | Fortune Business Insights, 2026 |
| Тот же рынок (прогноз на 2034) | $104.05 billion, 20.30% CAGR | Fortune Business Insights, 2026 |
| Сегмент генераторов голоса на базе ИИ (2025) | $4.16 billion | MarketsandMarkets, 2025 |
| Подсегмент клонирования голоса (2025) | $2.4 billion | Mordor Intelligence, 2025 |
| Экономия на персонале за счет разговорного ИИ (2026) | $80 billion | Gartner, 2022 forecast for 2026 |
| Организации клиентского сервиса, использующие разговорный ИИ | 80% (forecast) | Gartner, 2026 |
| Руководители CS под давлением необходимости внедрять ИИ | 91% | Gartner, 2026 |
| Индикаторы использования в продакшене | Vapi 1B+ calls; Deepgram 1T+ words | Vapi / Deepgram, 2026 |
Оценки расходятся в зависимости от охвата: Coherent Market Insights оценила рынок распознавания голоса примерно в $22.66 млрд в 2026 году, что близко к данным Fortune Business Insights. Первичный источник: прогноз Gartner для контакт-центров.
Итоги: голосовой ИИ в первом полугодии 2026 года в цифрах
| Показатель | Значение | Источник |
|---|---|---|
| Series D ElevenLabs | $500M at $11B (Feb 4, 2026) | TechCrunch, 2026 |
| Переговоры о tender offer ElevenLabs | ~$22B (July 2, 2026) | Bloomberg, 2026 |
| ARR ElevenLabs | $330M to $500M (end 2025 to April 2026) | TechCrunch / Sacra, 2026 |
| Series C Deepgram | $130M at $1.3B (Jan 13, 2026) | Deepgram, 2026 |
| Series B Vapi | $50M, 1B+ calls (May 12, 2026) | Vapi, 2026 |
| Series C Bland | $50M (June 16, 2026) | Fortune, 2026 |
| Модели голоса реального времени OpenAI | 3 launched May 7, 2026 | OpenAI, 2026 |
| Полнодуплексные модели OpenAI | GPT-Live-1 (July 8, 2026) | TechCrunch, 2026 |
| Gemini 3.1 Flash TTS | Launched April 15, 2026 | Google, 2026 |
| Статья 50 EU AI Act | Effective August 2, 2026 | European Commission, 2026 |
| NO FAKES Act (пересмотренный) | Reintroduced May 2026 | U.S. Senate, 2026 |
| Удаления по TAKE IT DOWN Act | 48-hour deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| Убытки FTC от мошенничества с выдачей себя за другое лицо (2025) | $3.5 billion | FTC, 2026 |
| Общее заявленное мошенничество по данным FTC (2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| Рост дипфейк-мошенничества по данным Pindrop | +1,300% across 1.2B calls | Pindrop, 2025 report |
| Точность лучшего детектора дипфейков | 98.1% | Resemble AI / Podonos, 2026 |
| Точность детекции людьми | 68.7% | arXiv, 2026 |
| Рынок распознавания речи и голоса (2026) | $23.70 billion | Fortune Business Insights, 2026 |
| Экономия на персонале за счет разговорного ИИ (2026) | $80 billion | Gartner, 2022 forecast |
Методология и источники
Данные были собраны путем агрегирования датированных публикаций 2026 года, отчетов первичных исследований, регуляторных текстов и объявлений о финансировании, опубликованных в период с января по июль 2026 года, с перекрестной проверкой рыночных и мошеннических показателей по двум или более источникам и пометкой любых цифр старше 2024 года.
- TechCrunch - материалы о ElevenLabs, Deepgram и OpenAI (2026): Series D ElevenLabs
- Bloomberg - tender offer ElevenLabs на $22 млрд и переговоры о финансировании Wispr (2026)
- Deepgram - пресс-релиз о Series C (2026): Series C Deepgram на $130 млн
- Vapi / GlobeNewswire - Series B и метрики использования (2026)
- Fortune - материал о Series C Bland (2026)
- Sacra - профиль дохода и ARR ElevenLabs (2026)
- AssemblyAI - трекер инвестиций в голосовой ИИ 2026 (2026)
- OpenAI - Advancing Voice Intelligence with New Models in the API (2026): пост OpenAI о запуске
- Google - запуск Gemini 3.1 Flash TTS (2026, через отраслевую прессу)
- Microsoft - Azure Speech на Build 2026 (2026)
- ElevenLabs - раскрытия о Eleven v3 и Series D (2026)
- Artificial Analysis - рейтинг моделей TTS (2026)
- European Commission - статья 50 EU AI Act и Code of Practice (2026): текст статьи 50
- U.S. Senate - пресс-релиз о пересмотренном NO FAKES Act (2026)
- European Parliament (EPRS) - анализ датского законопроекта об авторских правах на дипфейки (2026)
- Recording Law - трекер законов штатов США о дипфейках (2026)
- FCC - решение по робозвонкам с ИИ в рамках TCPA (2024)
- U.S. Federal Trade Commission - данные о мошенничестве с выдачей себя за другое лицо и общем мошенничестве за 2025 год (2026): данные FTC о мошенничестве за 2025 год
- Pindrop - 2025 Voice Intelligence and Security Report (2025): отчет Pindrop
- Deloitte Center for Financial Services - прогноз мошенничества с генеративным ИИ (2023)
- Gartner - разговорный ИИ, риск дипфейков и опросы клиентского сервиса (2022-2026)
- Resemble AI / Podonos - бенчмарк детекции аудио-дипфейков (2026): бенчмарк детекции
- arXiv - академические исследования человеческой и машинной детекции дипфейк-голоса (2026)
- Fortune Business Insights - отчет о рынке распознавания речи и голоса (2026)
- MarketsandMarkets - отчет о рынке генераторов голоса на базе ИИ (2025)
- Mordor Intelligence - отчет о рынке клонирования голоса (2025)
- Sifted - материал о посевном раунде Gradium / Nvidia (2026)
Data watch: FTC публикует итоговые данные о мошенничестве Consumer Sentinel ежегодно, следующее издание ожидается в начале 2027 года; Pindrop публикует свой Voice Intelligence and Security Report ежегодно, следующее издание ожидается позже в 2026 году; Gartner обновляет свои опросы о разговорном ИИ и клиентском сервисе в течение года; EU AI Act достигает вехи правоприменения статьи 50 2 августа 2026 года; а Deloitte периодически обновляет свой прогноз мошенничества с генеративным ИИ.
Последнее обновление: 11 июля 2026 года. Мы пересматриваем и обновляем эту страницу ежеквартально по мере публикации новых данных.