ElevenLabs는 2026년을 110억 달러의 기업가치로 시작했고, 5개월 후에는 220억 달러 가치의 텐더오퍼를 두고 협상 중이었다(Bloomberg, 2026). 이 가치의 두 배 증가는 자본, 제품, 규제가 동시에 움직인 6개월을 상징한다. Deepgram은 1월에 13억 달러의 기업가치로 1.3억 달러를 조달했고(Deepgram, 2026), OpenAI는 5월부터 7월 사이에 5개의 새로운 실시간 음성 모델을 출시했으며(OpenAI, 2026), 미국 FTC는 사칭 사기가 2025년 미국인들에게 35억 달러의 손실을 입혔다고 보고했다(FTC, 2026). 이 분석은 TechCrunch, Bloomberg, FTC, Pindrop, OpenAI, Gartner, European Commission 및 그 외 20개의 1차 자료에서 데이터를 종합하여 2026년 상반기 Voice AI 분야에서 실제로 일어난 일을 날짜별로 기록한 것이다.
이 기술에 대한 변함없는 배경 정보는 당사의 보이스 클로닝 통계 2026 자료를 참고하라. 이 글은 상반기 이벤트 로그다.
TL;DR
- ElevenLabs는 2월 110억 달러 기업가치로 5억 달러 규모의 시리즈 D를 조달했으며, 7월 2일까지 220억 달러 가치의 텐더오퍼 협상에 들어갔다(Bloomberg, 2026).
- ElevenLabs의 연간 반복 매출(ARR)은 2025년 말 3.3억 달러에서 2026년 4월까지 5억 달러로 증가했다(TechCrunch / Sacra, 2026).
- Deepgram은 1월 13일 13억 달러 기업가치로 1.3억 달러를 조달했으며, 1조 단어 이상을 전사(transcribe)했다(Deepgram, 2026).
- OpenAI는 5월 7일 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 출시했고, 이어 7월 8일에는 전이중 모델인 GPT-Live-1을 출시했다(OpenAI, 2026; TechCrunch, 2026).
- Vapi는 5,000만 달러를 조달하고 10억 건의 통화를 돌파했다. Bland는 180명의 투자자에게 거절당한 뒤 5,000만 달러를 조달했다(Vapi, 2026; Fortune, 2026).
- 합성 오디오에 대한 EU AI법 제50조 투명성 규칙은 2026년 8월 2일부터 적용되며, 최대 1,500만 유로 또는 전 세계 매출의 3%에 달하는 벌금이 부과된다(European Commission, 2026).
- FTC는 2025년 사칭 사기 손실을 35억 달러로 기록했으며, 이는 총 신고된 사기 약 160억 달러 중 전년 대비 약 25% 증가한 수치다(FTC, 2026).
- Pindrop은 컨택센터 딥페이크 사기가 분석된 12억 건의 통화에서 1,300% 급증했음을 확인했다(Pindrop, 2025년 보고서).
- 2026년 5월 8개 탐지기 벤치마크에서 최상위 시스템은 98.1%를 기록한 반면, 병행 연구에서 인간은 68.7%에 그쳤다(Resemble AI / Podonos, 2026; arXiv, 2026).
- 전 세계 음성·스피치 인식 시장은 2026년 기준 추정 237억 달러에 달했다(Fortune Business Insights, 2026).
1. 2026년 상반기 자금조달 급증
돈은 제품보다 빠르게 움직였다. 이 반기를 정의한 패턴은 재평가(repricing)였다. ElevenLabs는 2월에 110억 달러 기업가치로 자금을 조달했고, 7월까지 220억 달러 가치의 텐더오퍼 관심을 받고 있었다. 새로운 프라이머리 라운드 없이 약 5개월 만에 기업가치가 두 배가 된 것이다(Bloomberg, 2026). ElevenLabs는 또한 2026년 4월까지 연간 반복 매출이 5억 달러를 돌파했으며, 이는 2025년 말 3.3억 달러에서 증가한 것이다(TechCrunch / Sacra, 2026) - 이 성장은 후속 투자자들에게 가치 상승을 뒷받침할 매출 기반을 제공했다. 인프라 계층도 동시에 가치가 상승했다. 소비자용 음성이 아닌 스피치 API를 판매하는 Deepgram은 1월에 13억 달러의 기업가치에 도달했다.
이 패턴은 대형 거래에만 국한되지 않았다. Vapi와 Bland는 각각 기업용 음성 에이전트를 위해 5,000만 달러 규모의 라운드를 마감했고, 받아쓰기 스타트업 Wispr는 약 20억 달러 기업가치로 약 2.6억 달러 규모의 자금조달 협상에 들어갔다. Voice AI 벤처 자금조달은 이미 2022년 약 3.15억 달러에서 2024년 21억 달러로 상승했으며(AssemblyAI, 2026), 2026년 상반기에도 이 가파른 곡선이 유지됐다.
| 지표 | 값 | 출처 |
|---|---|---|
| ElevenLabs 시리즈 D | $500M at $11B valuation (Feb 4, 2026) | TechCrunch, 2026 |
| ElevenLabs ARR | $330M (end 2025) to $500M (April 2026) | TechCrunch / Sacra, 2026 |
| ElevenLabs 텐더오퍼 협상 | ~$22B valuation (July 2, 2026) | Bloomberg, 2026 |
| Deepgram 시리즈 C | $130M at $1.3B valuation (Jan 13, 2026) | Deepgram, 2026 |
| Vapi 시리즈 B | $50M, led by Peak XV (May 12, 2026) | Vapi / GlobeNewswire, 2026 |
| Bland 시리즈 C | $50M, after 180 investor rejections (June 16, 2026) | Fortune, 2026 |
| Wispr 자금조달 협상 | ~$260M at ~$2B valuation (May 2026) | Bloomberg, 2026 |
| Voice AI VC(배경) | ~$315M (2022) to $2.1B (2024) | AssemblyAI, 2026 |
배경: PolyAI는 2025년 12월 7.5억 달러 기업가치로 8,600만 달러 규모의 시리즈 D를 마감했고, Cartesia의 공개된 누적 자금조달액은 2025년 10월 기준 1.91억 달러에 달했다 - 둘 다 이 기간 직전으로, H1을 뒷받침한 파이프라인을 보여준다. ElevenLabs 자금조달에 관한 TechCrunch 기사와 Deepgram 시리즈 C 보도자료를 참고하라.
2. 모델 출시: 2026년 1월-6월 무엇이 나왔나
이 반기는 파이프라인에서 전이중 오디오로의 전환으로 정의됐다. 기존 음성 어시스턴트는 음성-텍스트 변환, 언어 모델, 텍스트-음성 변환이라는 세 가지 모델을 연결했는데, 이는 지연 시간을 늘리고 자연스러운 끼어들기를 차단했다. OpenAI는 이 스택을 무너뜨리고 2026년 5월 7일 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 출시했으며, 이어 7월 8일에는 동시에 듣고 말하는 전이중 모델 GPT-Live-1을 출시했다(OpenAI, 2026; TechCrunch, 2026). GPT-Realtime-Translate만으로도 화자의 속도를 따라가며 70개 이상의 입력 언어를 13개 출력 언어로 처리한다(OpenAI, 2026).
가격 압박이 또 다른 이야기였다. 4월 15일 출시된 Google의 Gemini 3.1 Flash TTS는 문자당 비용에서 기존 프리미엄 강자들을 앞질렀지만, 품질 벤치마크에서는 뒤처졌다. ElevenLabs는 독립적인 Artificial Analysis TTS 리더보드에서 여전히 1위를 지켰지만, Microsoft가 Build 2026 콘퍼런스에서 저지연 Voice Live 모델을 Azure Speech에 통합하면서 그 격차는 좁혀졌다.
| 지표 | 값 | 출처 |
|---|---|---|
| OpenAI 실시간 음성 모델 | GPT-Realtime-2 / Translate / Whisper (May 7, 2026) | OpenAI, 2026 |
| GPT-Realtime-Translate 언어 | 70+ input to 13 output | OpenAI, 2026 |
| OpenAI 전이중 모델 | GPT-Live-1 and GPT-Live-1 mini (July 8, 2026) | TechCrunch, 2026 |
| Google Gemini 3.1 Flash TTS | Launched April 15, 2026; 40+ languages | Google (via trade press), 2026 |
| Gemini 3.1 Flash TTS 가격 | ~$0.012 per 1K characters | Trade benchmark, 2026 |
| TTS 리더보드 | ElevenLabs #1 (~1,280 Elo), Gemini #2 (1,211) | Artificial Analysis, 2026 |
| Microsoft Azure Speech | Voice Live + Azure-Realtime at Build 2026 | Microsoft, 2026 |
| ElevenLabs v3 | Generally available, expressive multi-speaker | ElevenLabs, 2026 |
예외 사항: GPT-Live-1은 상반기 기준점에서 며칠 지난 7월 8일에 출시됐지만, 동일한 제품 사이클에 속한다. OpenAI의 출시 게시물을 참고하라.
3. 세 개 관할권에서 강화된 규제
입법이 제품 사이클을 따라잡았다. AI로 생성된 오디오가 기계 판독 가능한 형태로 표시되고 공개되도록 요구하는 EU AI법 제50조의 투명성 의무는 2026년 8월 2일부터 적용되며, 최대 1,500만 유로 또는 전 세계 매출의 3%에 달하는 벌금이 뒷받침한다(European Commission, 2026). 집행위원회는 마감 전에 사업자들에게 준수 청사진을 제공하기 위해 AI 생성 콘텐츠에 관한 행동강령(Code of Practice)을 2026년 6월까지 최종안으로 마무리하려 서둘렀다.
미국은 두 갈래로 움직였다. 의원들은 AI 생성 음성 및 초상의 무단 복제에 대한 연방 차원의 권리를 만들기 위해 2026년 5월 개정된 NO FAKES Act를 재발의했으며, TAKE IT DOWN Act에 따른 플랫폼의 삭제 의무는 2026년 5월 19일 준수 마감일에 도달해 신고된 콘텐츠를 48시간 이내에 삭제하도록 요구했다. 덴마크는 가장 멀리 나아가, 사후 50년간 지속되는 저작권과 유사한 권리로 개인의 얼굴과 목소리를 취급하는 법안을 추진했다.
이러한 동의 우선 규칙 아래에서, 허락을 받고 자신의 목소리를 복제하는 도구 - VoxBooster의 보이스 클로닝 소프트웨어 같은 - 는 규정을 준수하는 편에 선다. 더 넓은 정책 전반에 대해서는 당사의 AI 규제 통계 2026 모음을 참고하라.
| 지표 | 값 | 출처 |
|---|---|---|
| EU AI법 제50조 오디오 라벨링 | Effective August 2, 2026 | European Commission, 2026 |
| EU AI법 투명성 벌금 | Up to EUR 15M or 3% of global turnover | European Commission, 2026 |
| NO FAKES Act(개정) | Reintroduced May 2026 | U.S. Senate, 2026 |
| 딥페이크 우려 설문조사 | 92% of Americans concerned about deepfakes | U.S. Senate (NO FAKES release), 2026 |
| TAKE IT DOWN Act 삭제 규정 | 48-hour removal; compliance deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| 덴마크 초상권 법안 | Protection 50 years after death | European Parliament (EPRS), 2026 |
| 선거 딥페이크법이 없는 미국 주 | ~22 as of June 2026 | Recording Law tracker, 2026 |
| FCC AI 로보콜 판결(배경) | Up to $23K per illegal call | FCC, 2024 (most recent available) |
테네시주 ELVIS Act(2024)는 여전히 2026년 대부분의 법안이 따르는 모델로 남아 있다. 원문: EU AI법 제50조.
4. 숫자로 보는 음성 사기
위협 측면도 역량 측면과 함께 확대됐다. FTC는 사칭 사기가 2025년 미국인들에게 35억 달러의 손실을 입혔으며, 이는 총 신고된 사기 약 160억 달러의 일부로 역대 최고치이자 전년 대비 약 25% 증가했다고 보고했다(FTC, 2026). 그중 기업 사칭이 10억 달러, 정부기관 사칭이 9.2억 달러를 차지했다. 이 수치들은 딥페이크에 특화된 것은 아니지만, 합성음성이 현재 증폭시키고 있는 기준선을 보여준다.
컨택센터가 가장 먼저 이를 체감했다. Pindrop은 분석된 12억 건의 통화에서 딥페이크 사기 시도가 1,300% 급증했으며, 합성음성 공격이 보험업계에서 475%, 은행업계에서 149% 증가했음을 확인했다(Pindrop, 2025년 보고서). 장기적으로 Deloitte는 미국의 생성형 AI 사기 손실이 2023년 123억 달러에서 2027년까지 400억 달러로 늘어날 것으로 전망한다(Deloitte, 2023 - 입수 가능한 최신 자료).
| 지표 | 값 | 출처 |
|---|---|---|
| FTC 사칭 사기 손실(2025) | $3.5 billion | FTC, 2026 |
| FTC 총 신고된 사기(2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| 기업 + 정부기관 사칭 손실 | $1B + $920M | FTC, 2026 |
| 컨택센터 딥페이크 사기 급증 | +1,300% across 1.2B calls | Pindrop, 2025 report |
| 업종별 합성음성 공격 | Insurance +475%, banking +149%, retail +107% | Pindrop, 2025 report |
| 미국 GenAI 사기 전망 | $12.3B (2023) to $40B (2027), 32% CAGR | Deloitte, 2023 |
| 최근 12개월 내 딥페이크 공격을 받은 조직 | 62% | Gartner, 2025 |
이 총계는 딥페이크에 특화된 것은 아니지만, 합성음성이 현재 증폭시키고 있는 기준선을 보여준다. 원자료: Pindrop 2025 Voice Intelligence and Security Report.
5. 탐지: 우리는 여전히 구별할 수 있는가?
탐지는 이론상으로는 개선됐지만 실전에서는 고전했다. 2026년 5월 실시된 8개 오디오 딥페이크 탐지 시스템 벤치마크에서 최상위 탐지기는 98.1%의 통합 정확도를 기록했지만, 병행 진행된 2026년 연구에서는 훈련받지 않은 인간이 합성 음성을 식별한 비율이 68.7%에 그쳤다(Resemble AI / Podonos, 2026; arXiv, 2026). 기계와 인간의 격차는 현재 약 26포인트이며, 합성음성이 개선될수록 더 벌어지고 있다.
문제는 일반화다. 연구자들은 2019년 시대의 ASVspoof 데이터 분포로 훈련된 탐지기가 2026년의 공격을 신뢰성 있게 잡아내지 못한다는 사실을 발견했으며, 대부분의 도구는 여전히 영어만 다루고 있어 비영어권 음성 클로닝이 여전히 열린 공격 표면으로 남아 있다(arXiv, 2026).
| 지표 | 값 | 출처 |
|---|---|---|
| 최상위 탐지기(Podonos 벤치마크) | Resemble AI, 98.1% pooled accuracy | Resemble AI / Podonos, 2026 |
| 2위 탐지기 | Aurigin, 96.8% | Podonos, 2026 |
| Resemble AI Detect(클린 오디오) | 94.2% | Resemble AI, 2026 |
| 기계 탐지 정확도 | 94.5% across 138 attacks | arXiv, 2026 |
| 인간 탐지 정확도 | 68.7% (1,768 users) | arXiv, 2026 |
| 벤치마크 언어 범위 | English only (noted gap) | arXiv / Resemble AI, 2026 |
| 구형 탐지기(ASVspoof 2019 훈련) | Generalize poorly to 2026 attacks | arXiv, 2026 |
원시 정확도가 아니라 훈련 데이터 분포 문제야말로 진짜 이야기다. 오디오 딥페이크 탐지 벤치마크와 당사의 딥페이크 탐지 통계 2026 분석을 참고하라.
6. 시장 규모와 기업 도입
헤드라인 아래에서 시장은 계속 복리로 성장했다. Fortune Business Insights는 2026년 기준 전 세계 음성·스피치 인식 시장을 237억 달러로 평가했으며, 2034년까지 CAGR 20.30%로 1,040.5억 달러에 이를 것으로 전망했다(Fortune Business Insights, 2026). 텍스트-음성 변환과 클로닝을 합친 더 좁은 범위의 AI 음성 생성 세그먼트는 2025년 기준 41.6억 달러에 가까웠고(MarketsandMarkets, 2025), 음성 클로닝 하위 세그먼트는 24억 달러에 가까웠다(Mordor Intelligence, 2025).
도입 지표는 전망에서 실제 사용으로 전환됐다. Gartner는 여전히 대화형 AI가 2026년 컨택센터 인건비를 800억 달러 절감할 것으로 전망하지만, 더 시사적인 수치는 실제 프로덕션 수치다. Vapi는 10억 건 이상의 통화를 처리했고, Deepgram은 2026년 초까지 1조 단어 이상을 전사했다. 향후 전망은 당사의 예측 기사 Voice AI 시장 통계 2027을 참고하라.
| 지표 | 값 | 출처 |
|---|---|---|
| 음성·스피치 인식 시장(2026) | $23.70 billion | Fortune Business Insights, 2026 |
| 동일 시장(2034년 전망) | $104.05 billion, 20.30% CAGR | Fortune Business Insights, 2026 |
| AI 음성 생성 세그먼트(2025) | $4.16 billion | MarketsandMarkets, 2025 |
| 음성 클로닝 하위 세그먼트(2025) | $2.4 billion | Mordor Intelligence, 2025 |
| 대화형 AI 인건비 절감(2026) | $80 billion | Gartner, 2022 forecast for 2026 |
| 대화형 AI를 사용하는 고객서비스 조직 | 80% (forecast) | Gartner, 2026 |
| AI 도입 압박을 받는 CS 리더 | 91% | Gartner, 2026 |
| 프로덕션 사용 지표 | Vapi 1B+ calls; Deepgram 1T+ words | Vapi / Deepgram, 2026 |
추정치는 범위에 따라 다르다: Coherent Market Insights는 음성 인식 시장을 2026년 기준 약 226.6억 달러로 추정했으며, 이는 Fortune Business Insights의 추정치와 가깝다. 원자료 프레이밍: Gartner의 컨택센터 전망.
요약: 숫자로 보는 2026년 상반기 Voice AI
| 지표 | 값 | 출처 |
|---|---|---|
| ElevenLabs 시리즈 D | $500M at $11B (Feb 4, 2026) | TechCrunch, 2026 |
| ElevenLabs 텐더오퍼 협상 | ~$22B (July 2, 2026) | Bloomberg, 2026 |
| ElevenLabs ARR | $330M to $500M (end 2025 to April 2026) | TechCrunch / Sacra, 2026 |
| Deepgram 시리즈 C | $130M at $1.3B (Jan 13, 2026) | Deepgram, 2026 |
| Vapi 시리즈 B | $50M, 1B+ calls (May 12, 2026) | Vapi, 2026 |
| Bland 시리즈 C | $50M (June 16, 2026) | Fortune, 2026 |
| OpenAI 실시간 음성 모델 | 3 launched May 7, 2026 | OpenAI, 2026 |
| OpenAI 전이중 모델 | GPT-Live-1 (July 8, 2026) | TechCrunch, 2026 |
| Gemini 3.1 Flash TTS | Launched April 15, 2026 | Google, 2026 |
| EU AI법 제50조 | Effective August 2, 2026 | European Commission, 2026 |
| NO FAKES Act(개정) | Reintroduced May 2026 | U.S. Senate, 2026 |
| TAKE IT DOWN Act 삭제 규정 | 48-hour deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| FTC 사칭 사기 손실(2025) | $3.5 billion | FTC, 2026 |
| FTC 총 신고된 사기(2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| Pindrop 딥페이크 사기 급증 | +1,300% across 1.2B calls | Pindrop, 2025 report |
| 최상위 딥페이크 탐지기 정확도 | 98.1% | Resemble AI / Podonos, 2026 |
| 인간 탐지 정확도 | 68.7% | arXiv, 2026 |
| 음성·스피치 인식 시장(2026) | $23.70 billion | Fortune Business Insights, 2026 |
| 대화형 AI 인건비 절감(2026) | $80 billion | Gartner, 2022 forecast |
방법론 및 출처
데이터는 2026년 1월부터 7월 사이에 발표된 날짜가 명시된 2026년 공시, 1차 조사 보고서, 규제 텍스트, 자금조달 발표를 취합하고, 시장 및 사기 수치를 두 개 이상의 출처로 교차 검증하며, 2024년보다 오래된 수치는 별도로 표시하는 방식으로 수집했다.
- TechCrunch - ElevenLabs, Deepgram, OpenAI 관련 보도(2026): ElevenLabs 시리즈 D
- Bloomberg - ElevenLabs의 220억 달러 텐더오퍼와 Wispr 자금조달 협상(2026)
- Deepgram - 시리즈 C 보도자료(2026): Deepgram 1.3억 달러 시리즈 C
- Vapi / GlobeNewswire - 시리즈 B 및 사용 지표(2026)
- Fortune - Bland 시리즈 C 관련 보도(2026)
- Sacra - ElevenLabs 매출 및 ARR 프로필(2026)
- AssemblyAI - 2026년 Voice AI 투자 트래커(2026)
- OpenAI - Advancing Voice Intelligence with New Models in the API(2026): OpenAI 출시 게시물
- Google - Gemini 3.1 Flash TTS 출시(2026, 업계 매체 경유)
- Microsoft - Build 2026의 Azure Speech(2026)
- ElevenLabs - Eleven v3 및 시리즈 D 공시(2026)
- Artificial Analysis - TTS 모델 리더보드(2026)
- European Commission - EU AI법 제50조 및 행동강령(2026): 제50조 원문
- U.S. Senate - 개정된 NO FAKES Act 보도자료(2026)
- European Parliament(EPRS) - 덴마크 딥페이크 저작권 법안 분석(2026)
- Recording Law - 미국 주별 딥페이크법 트래커(2026)
- FCC - TCPA에 따른 AI 로보콜 판결(2024)
- U.S. Federal Trade Commission - 2025년 사칭 사기 및 사기 데이터(2026): FTC 2025 사기 데이터
- Pindrop - 2025 Voice Intelligence and Security Report(2025): Pindrop 보고서
- Deloitte Center for Financial Services - 생성형 AI 사기 전망(2023)
- Gartner - 대화형 AI, 딥페이크 위험, 고객서비스 설문조사(2022-2026)
- Resemble AI / Podonos - 오디오 딥페이크 탐지 벤치마크(2026): 탐지 벤치마크
- arXiv - 인간 및 기계의 딥페이크 음성 탐지에 관한 학술 연구(2026)
- Fortune Business Insights - 음성·스피치 인식 시장 보고서(2026)
- MarketsandMarkets - AI 음성 생성 시장 보고서(2025)
- Mordor Intelligence - 음성 클로닝 시장 보고서(2025)
- Sifted - Gradium / Nvidia 시드 라운드 관련 보도(2026)
Data watch: FTC는 Consumer Sentinel 사기 집계를 매년 발표하며, 다음 판은 2027년 초 발표될 예정이다. Pindrop은 Voice Intelligence and Security Report를 연간 주기로 발행하며, 다음 판은 2026년 하반기에 발표될 예정이다. Gartner는 대화형 AI 및 고객서비스 설문조사를 연중 갱신한다. EU AI법은 2026년 8월 2일 제50조 시행이라는 이정표에 도달한다. Deloitte는 생성형 AI 사기 전망을 주기적으로 갱신한다.
마지막 업데이트: 2026년 7월 11일.
새로운 데이터가 발표될 때마다 분기별로 이 페이지를 검토하고 업데이트한다.