**ElevenLabsは2026年を110億ドルの企業評価額でスタートし、5か月後には220億ドルの評価額となるテンダーオファーについて協議していた(Bloomberg、2026年)。**この倍増は、資本、製品、規制が同時に動いた6か月間を象徴している。Deepgramは1月に13億ドルの評価額で1.3億ドルを調達し(Deepgram、2026年)、OpenAIは5月から7月の間に5つの新しいリアルタイム音声モデルを発表し(OpenAI、2026年)、米国FTCはなりすまし詐欺が2025年にアメリカ人に35億ドルの被害を与えたと報告した(FTC、2026年)。本分析は、TechCrunch、Bloomberg、FTC、Pindrop、OpenAI、Gartner、European Commission、その他20の一次情報源からデータを統合し、2026年上半期にVoice AI分野で実際に起きたことを日付入りで記録したものである。
このテクノロジーに関する不変の背景情報については、当社のボイスクローニング統計2026の資料を参照されたい。本稿は上半期のイベントログである。
TL;DR
- ElevenLabsは2月に110億ドルの評価額で5億ドルのシリーズDを調達し、7月2日までに220億ドルのテンダーオファーについて協議入りした(Bloomberg、2026年)。
- ElevenLabsの年間経常収益(ARR)は2025年末の3.3億ドルから2026年4月までに5億ドルに増加した(TechCrunch / Sacra、2026年)。
- Deepgramは1月13日に13億ドルの評価額で1.3億ドルを調達し、1兆語以上を文字起こししている(Deepgram、2026年)。
- OpenAIは5月7日にGPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisperを発表し、続いて7月8日にフルデュプレックスモデルのGPT-Live-1を発表した(OpenAI、2026年;TechCrunch、2026年)。
- Vapiは5,000万ドルを調達し10億件の通話を突破した。Blandは180人の投資家に断られた後に5,000万ドルを調達した(Vapi、2026年;Fortune、2026年)。
- 合成音声に関するEU AI法第50条の透明性規則は2026年8月2日から適用され、最大1,500万ユーロまたは世界売上高の3%の罰金が科される(European Commission、2026年)。
- FTCは2025年のなりすまし詐欺被害を35億ドルと記録し、総被害報告額約160億ドルのうち前年比約25%増となった(FTC、2026年)。
- Pindropはコンタクトセンターのディープフェイク詐欺が12億件の分析対象通話にわたり1,300%急増したことを確認した(Pindrop、2025年レポート)。
- 2026年5月の8種類の検出器のベンチマークでは、最上位のシステムが98.1%を記録した一方、並行研究における人間はわずか68.7%にとどまった(Resemble AI / Podonos、2026年;arXiv、2026年)。
- 世界の音声・スピーチ認識市場は2026年時点で推定237億ドルに達した(Fortune Business Insights、2026年)。
1. 2026年上半期の資金調達ラッシュ
資金は製品よりも速く動いた。この半年間を特徴づけたパターンは評価額の再設定だった。ElevenLabsは2月に110億ドルの評価額で資金を調達し、7月までに220億ドルの評価額でのテンダーオファーの関心を集めていた。新たなプライマリーラウンドなしに、約5か月間で評価額が倍増したことになる(Bloomberg、2026年)。ElevenLabsはまた、2026年4月までに年間経常収益が5億ドルを突破し、2025年末の3.3億ドルから増加した(TechCrunch / Sacra、2026年)。この成長により、後続の投資家は評価額の上昇を裏付ける収益基盤を得た。インフラ層も同時に評価額が上昇した。消費者向けの音声ではなくスピーチAPIを販売するDeepgramは、1月に13億ドルの評価額に達した。
このパターンはメガディールに限らなかった。VapiとBlandはそれぞれエンタープライズ向け音声エージェントのために5,000万ドルのラウンドを完了し、ディクテーションのスタートアップWisprは約20億ドルの評価額で約2.6億ドルの資金調達について協議に入った。Voice AIのベンチャー資金調達はすでに2022年の約3.15億ドルから2024年には21億ドルまで上昇しており(AssemblyAI、2026年)、2026年上半期もこの急な曲線を維持した。
| 指標 | 値 | 出典 |
|---|---|---|
| ElevenLabsのシリーズD | $500M at $11B valuation (Feb 4, 2026) | TechCrunch, 2026 |
| ElevenLabsのARR | $330M (end 2025) to $500M (April 2026) | TechCrunch / Sacra, 2026 |
| ElevenLabsのテンダーオファー協議 | ~$22B valuation (July 2, 2026) | Bloomberg, 2026 |
| Deepgramのシリーズc | $130M at $1.3B valuation (Jan 13, 2026) | Deepgram, 2026 |
| Vapiのシリーズb | $50M, led by Peak XV (May 12, 2026) | Vapi / GlobeNewswire, 2026 |
| Blandのシリーズc | $50M, after 180 investor rejections (June 16, 2026) | Fortune, 2026 |
| Wisprの資金調達協議 | ~$260M at ~$2B valuation (May 2026) | Bloomberg, 2026 |
| Voice AIのVC(背景) | ~$315M (2022) to $2.1B (2024) | AssemblyAI, 2026 |
背景:PolyAIは2025年12月に7.5億ドルの評価額で8,600万ドルのシリーズDを完了し、Cartesiaの開示済み累計資金調達額は2025年10月時点で1.91億ドルに達していた - いずれもこの期間の直前であり、H1を支えたパイプラインを示している。ElevenLabsの資金調達に関するTechCrunchの記事とDeepgramのシリーズcプレスリリースを参照。
2. モデル発表:2026年1月から6月にかけてリリースされたもの
この半年間は、パイプラインからフルデュプレックス音声への移行によって特徴づけられた。従来の音声アシスタントは、音声認識、言語モデル、音声合成という3つのモデルを連結しており、これがレイテンシを増やし、自然な割り込みを妨げていた。OpenAIはこのスタックを解体し、2026年5月7日にGPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisperを発表、続いて7月8日には同時に聞いて話すフルデュプレックスモデルのGPT-Live-1を発表した(OpenAI、2026年;TechCrunch、2026年)。GPT-Realtime-Translate単体で、話者のペースを維持しながら70以上の入力言語を13の出力言語に対応させる(OpenAI、2026年)。
価格競争がもう一つの物語だった。4月15日にリリースされたGoogleのGemini 3.1 Flash TTSは、文字あたりのコストで既存のプレミアム勢を下回ったが、品質ベンチマークでは劣っていた。ElevenLabsは独立系のArtificial Analysis TTSリーダーボードで首位を維持したが、MicrosoftがBuild 2026カンファレンスで低遅延のVoice LiveモデルをAzure Speechに組み込んだことで、その差は縮まった。
| 指標 | 値 | 出典 |
|---|---|---|
| OpenAIのリアルタイム音声モデル | GPT-Realtime-2 / Translate / Whisper (May 7, 2026) | OpenAI, 2026 |
| GPT-Realtime-Translateの対応言語 | 70+ input to 13 output | OpenAI, 2026 |
| OpenAIのフルデュプレックスモデル | GPT-Live-1 and GPT-Live-1 mini (July 8, 2026) | TechCrunch, 2026 |
| Google Gemini 3.1 Flash TTS | Launched April 15, 2026; 40+ languages | Google (via trade press), 2026 |
| Gemini 3.1 Flash TTSの価格 | ~$0.012 per 1K characters | Trade benchmark, 2026 |
| TTSリーダーボード | ElevenLabs #1 (~1,280 Elo), Gemini #2 (1,211) | Artificial Analysis, 2026 |
| Microsoft Azure Speech | Voice Live + Azure-Realtime at Build 2026 | Microsoft, 2026 |
| ElevenLabs v3 | Generally available, expressive multi-speaker | ElevenLabs, 2026 |
例外事項:GPT-Live-1は上半期の区切りから数日後の7月8日にリリースされたが、同じ製品サイクルに属する。OpenAIのリリース記事を参照。
3. 3つの法域で強化された規制
法整備が製品サイクルに追いついた。AI生成音声を機械可読な形で開示することを義務付けるEU AI法第50条の透明性義務は2026年8月2日から適用され、最大1,500万ユーロまたは世界売上高の3%の罰金が科される(European Commission、2026年)。欧州委員会は、期限前に事業者へコンプライアンスの指針を与えるため、AI生成コンテンツに関する行動規範(Code of Practice)の最終版を2026年6月までにまとめるべく急いだ。
米国は2つの路線で動いた。議員はAI生成の音声・肖像の無断複製に対する連邦法上の権利を創設するため、2026年5月に改訂版のNO FAKES Actを再提出し、TAKE IT DOWN Actに基づくプラットフォームの削除義務は2026年5月19日にコンプライアンス期限を迎え、通報されたコンテンツを48時間以内に削除することを求めている。デンマークは最も踏み込み、死後50年間続く著作権的な権利として人の顔と声を扱う法案を進めた。
こうした同意優先のルールの下では、許可を得て自分自身の声を複製するツール - VoxBoosterのボイスクローニングソフトウェアのような - は、規制順守の側に立つ。より広い政策の全体像については、当社のAI規制統計2026のまとめを参照されたい。
| 指標 | 値 | 出典 |
|---|---|---|
| EU AI法第50条の音声ラベル付け | Effective August 2, 2026 | European Commission, 2026 |
| EU AI法の透明性罰金 | Up to EUR 15M or 3% of global turnover | European Commission, 2026 |
| NO FAKES Act(改訂版) | Reintroduced May 2026 | U.S. Senate, 2026 |
| ディープフェイクへの懸念調査 | 92% of Americans concerned about deepfakes | U.S. Senate (NO FAKES release), 2026 |
| TAKE IT DOWN Actの削除規定 | 48-hour removal; compliance deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| デンマークの肖像権法案 | Protection 50 years after death | European Parliament (EPRS), 2026 |
| 選挙ディープフェイク法のない米国州 | ~22 as of June 2026 | Recording Law tracker, 2026 |
| FCCのAIロボコール裁定(背景) | Up to $23K per illegal call | FCC, 2024 (most recent available) |
テネシー州のELVIS Act(2024年)は、2026年の多くの法案が手本とするテンプレートであり続けている。一次資料:EU AI法第50条。
4. 音声詐欺の数字
脅威の側面も能力の側面と並行して拡大した。FTCは、なりすまし詐欺が2025年にアメリカ人に35億ドルの被害を与え、これは総被害報告額約160億ドルの一部であり、統計開始以来最高となり、前年比で約25%増加したと報告した(FTC、2026年)。企業へのなりすましがそのうち10億ドル、政府機関へのなりすましが9.2億ドルを占めた。これらの数字はディープフェイクに特化したものではないが、現在合成音声が増幅している基準線を示している。
コンタクトセンターが最初にその影響を受けた。Pindropは、12億件の分析対象通話にわたりディープフェイク詐欺の試みが1,300%急増したことを確認し、合成音声による攻撃は保険業界で475%、銀行業界で149%増加した(Pindrop、2025年レポート)。長期的には、Deloitteは米国における生成AI詐欺の被害額が2023年の123億ドルから2027年までに400億ドルに拡大すると予測している(Deloitte、2023年 - 入手可能な最新データ)。
| 指標 | 値 | 出典 |
|---|---|---|
| FTCのなりすまし詐欺被害額(2025年) | $3.5 billion | FTC, 2026 |
| FTCの総詐欺報告額(2025年) | ~$16 billion, +25% YoY | FTC, 2026 |
| 企業・政府なりすましによる被害額 | $1B + $920M | FTC, 2026 |
| コンタクトセンターのディープフェイク詐欺急増 | +1,300% across 1.2B calls | Pindrop, 2025 report |
| 業界別の合成音声攻撃 | Insurance +475%, banking +149%, retail +107% | Pindrop, 2025 report |
| 米国の生成AI詐欺予測 | $12.3B (2023) to $40B (2027), 32% CAGR | Deloitte, 2023 |
| 過去12か月にディープフェイク攻撃を受けた組織 | 62% | Gartner, 2025 |
これらの合計はディープフェイクに特化したものではないが、現在合成音声が増幅している基準線を示している。一次資料:Pindrop 2025年版Voice Intelligence and Security Report。
5. 検出:私たちはまだ見分けられるのか?
検出精度は理論上は向上したが、実践では苦戦した。2026年5月に実施された8種類の音声ディープフェイク検出システムのベンチマークでは、最上位の検出器が98.1%の総合精度を記録した一方、並行して行われた2026年の研究では、訓練を受けていない人間が合成音声を識別できたのはわずか68.7%だった(Resemble AI / Podonos、2026年;arXiv、2026年)。機械と人間のギャップは現在約26ポイントにまで開いており、合成音声の質が向上するにつれてさらに広がっている。
問題は汎化性能にある。研究者は、2019年時代のASVspoofデータ分布で訓練された検出器が2026年の攻撃を確実には捕捉できないことを発見し、大半のツールは依然として英語のみに対応しており、英語以外の言語での音声クローニングは未対応の攻撃対象領域として残されている(arXiv、2026年)。
| 指標 | 値 | 出典 |
|---|---|---|
| 最上位の検出器(Podonosベンチマーク) | Resemble AI, 98.1% pooled accuracy | Resemble AI / Podonos, 2026 |
| 2位の検出器 | Aurigin, 96.8% | Podonos, 2026 |
| Resemble AI Detect(クリーンな音声) | 94.2% | Resemble AI, 2026 |
| 機械検出の精度 | 94.5% across 138 attacks | arXiv, 2026 |
| 人間による検出の精度 | 68.7% (1,768 users) | arXiv, 2026 |
| ベンチマークの言語カバレッジ | English only (noted gap) | arXiv / Resemble AI, 2026 |
| 旧世代の検出器(ASVspoof 2019で訓練) | Generalize poorly to 2026 attacks | arXiv, 2026 |
生の精度そのものではなく、学習データ分布の問題こそが本当の論点である。音声ディープフェイク検出ベンチマークと、当社のディープフェイク検出統計2026の分析を参照。
6. 市場規模と企業導入
見出しの裏側で、市場は複利的な成長を続けていた。Fortune Business Insightsは、世界の音声・スピーチ認識市場を2026年時点で237億ドルと評価し、2034年までにCAGR 20.30%で1,040.5億ドルに達すると予測している(Fortune Business Insights、2026年)。より狭義のAI音声生成セグメント - テキスト読み上げとクローニングを合わせたもの - は2025年時点で41.6億ドル近くで(MarketsandMarkets、2025年)、音声クローニングのサブセグメントは24億ドル近くだった(Mordor Intelligence、2025年)。
導入の指標は予測から実際の利用へと移行した。Gartnerは依然として、対話型AIが2026年にコンタクトセンターの人件費を800億ドル削減すると予測しているが、より示唆に富むのは実際の本番稼働の数字である。Vapiは10億件以上の通話を処理し、Deepgramは2026年初頭までに1兆語以上を文字起こしした。将来の展望については、当社の予測記事Voice AI市場統計2027を参照されたい。
| 指標 | 値 | 出典 |
|---|---|---|
| 音声・スピーチ認識市場(2026年) | $23.70 billion | Fortune Business Insights, 2026 |
| 同市場(2034年予測) | $104.05 billion, 20.30% CAGR | Fortune Business Insights, 2026 |
| AI音声生成セグメント(2025年) | $4.16 billion | MarketsandMarkets, 2025 |
| 音声クローニングのサブセグメント(2025年) | $2.4 billion | Mordor Intelligence, 2025 |
| 対話型AIによる人件費削減(2026年) | $80 billion | Gartner, 2022 forecast for 2026 |
| 対話型AIを利用するカスタマーサービス組織 | 80% (forecast) | Gartner, 2026 |
| AI導入の圧力を受けているCSリーダー | 91% | Gartner, 2026 |
| 本番利用の代理指標 | Vapi 1B+ calls; Deepgram 1T+ words | Vapi / Deepgram, 2026 |
推計は対象範囲によって異なる:Coherent Market Insightsは音声認識市場を2026年時点で226.6億ドル近くとしており、Fortune Business Insightsの推計に近い。一次的な枠組み:Gartnerのコンタクトセンター予測。
まとめ:2026年上半期のVoice AIを数字で見る
| 指標 | 値 | 出典 |
|---|---|---|
| ElevenLabsのシリーズD | $500M at $11B (Feb 4, 2026) | TechCrunch, 2026 |
| ElevenLabsのテンダーオファー協議 | ~$22B (July 2, 2026) | Bloomberg, 2026 |
| ElevenLabsのARR | $330M to $500M (end 2025 to April 2026) | TechCrunch / Sacra, 2026 |
| Deepgramのシリーズc | $130M at $1.3B (Jan 13, 2026) | Deepgram, 2026 |
| Vapiのシリーズb | $50M, 1B+ calls (May 12, 2026) | Vapi, 2026 |
| Blandのシリーズc | $50M (June 16, 2026) | Fortune, 2026 |
| OpenAIのリアルタイム音声モデル | 3 launched May 7, 2026 | OpenAI, 2026 |
| OpenAIのフルデュプレックスモデル | GPT-Live-1 (July 8, 2026) | TechCrunch, 2026 |
| Gemini 3.1 Flash TTS | Launched April 15, 2026 | Google, 2026 |
| EU AI法第50条 | Effective August 2, 2026 | European Commission, 2026 |
| NO FAKES Act(改訂版) | Reintroduced May 2026 | U.S. Senate, 2026 |
| TAKE IT DOWN Actの削除規定 | 48-hour deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| FTCのなりすまし詐欺被害額(2025年) | $3.5 billion | FTC, 2026 |
| FTCの総詐欺報告額(2025年) | ~$16 billion, +25% YoY | FTC, 2026 |
| Pindropのディープフェイク詐欺急増 | +1,300% across 1.2B calls | Pindrop, 2025 report |
| 最上位のディープフェイク検出器の精度 | 98.1% | Resemble AI / Podonos, 2026 |
| 人間による検出精度 | 68.7% | arXiv, 2026 |
| 音声・スピーチ認識市場(2026年) | $23.70 billion | Fortune Business Insights, 2026 |
| 対話型AIによる人件費削減(2026年) | $80 billion | Gartner, 2022 forecast |
方法論と出典
データは、2026年1月から7月の間に公表された日付入りの2026年の開示情報、一次調査レポート、規制文書、資金調達発表を集約し、市場および詐欺に関する数値を2つ以上の情報源で相互参照し、2024年より古い数値には注記を付けることで収集した。
- TechCrunch - ElevenLabs、Deepgram、OpenAIに関する報道(2026年):ElevenLabsのシリーズD
- Bloomberg - ElevenLabsの220億ドルのテンダーオファーとWisprの資金調達協議(2026年)
- Deepgram - シリーズCのプレスリリース(2026年):Deepgramの1.3億ドルのシリーズC
- Vapi / GlobeNewswire - シリーズBおよび利用状況指標(2026年)
- Fortune - Blandのシリーズcに関する報道(2026年)
- Sacra - ElevenLabsの収益・ARRプロファイル(2026年)
- AssemblyAI - 2026年のVoice AI投資トラッカー(2026年)
- OpenAI - Advancing Voice Intelligence with New Models in the API(2026年):OpenAIのリリース記事
- Google - Gemini 3.1 Flash TTSのリリース(2026年、業界メディア経由)
- Microsoft - Build 2026におけるAzure Speech(2026年)
- ElevenLabs - Eleven v3およびシリーズDの開示情報(2026年)
- Artificial Analysis - TTSモデルリーダーボード(2026年)
- European Commission - EU AI法第50条および行動規範(2026年):第50条の条文
- U.S. Senate - 改訂版NO FAKES Actのプレスリリース(2026年)
- European Parliament(EPRS) - デンマークのディープフェイク著作権法案の分析(2026年)
- Recording Law - 米国州のディープフェイク法トラッカー(2026年)
- FCC - TCPAに基づくAIロボコール裁定(2024年)
- U.S. Federal Trade Commission - 2025年のなりすまし詐欺・詐欺データ(2026年):FTCの2025年詐欺データ
- Pindrop - 2025年版Voice Intelligence and Security Report(2025年):Pindropレポート
- Deloitte Center for Financial Services - 生成AI詐欺予測(2023年)
- Gartner - 対話型AI、ディープフェイクリスク、カスタマーサービス調査(2022年-2026年)
- Resemble AI / Podonos - 音声ディープフェイク検出ベンチマーク(2026年):検出ベンチマーク
- arXiv - 人間および機械によるディープフェイク音声検出に関する学術研究(2026年)
- Fortune Business Insights - 音声・スピーチ認識市場レポート(2026年)
- MarketsandMarkets - AI音声生成市場レポート(2025年)
- Mordor Intelligence - 音声クローニング市場レポート(2025年)
- Sifted - Gradium / Nvidiaのシード資金調達に関する報道(2026年)
Data watch:FTCはConsumer Sentinelの詐欺集計を毎年発表しており、次回版は2027年初頭に発表される見込みである。Pindropは年次サイクルでVoice Intelligence and Security Reportを発行しており、次回版は2026年後半に発表される見込みである。Gartnerは対話型AIおよびカスタマーサービス調査を年間を通じて更新している。EU AI法は2026年8月2日に第50条の施行という節目を迎える。Deloitteは生成AI詐欺予測を定期的に更新している。
最終更新日:2026年7月11日。
新しいデータが発表され次第、四半期ごとにこのページを見直し、更新している。