ElevenLabs memulai 2026 dengan valuasi $11 miliar dan, lima bulan kemudian, tengah bernegosiasi untuk penawaran tender yang akan menilainya sebesar $22 miliar (Bloomberg, 2026). Penggandaan nilai itu menjadi lambang periode enam bulan di mana modal, produk, dan regulasi bergerak secara bersamaan. Deepgram mengumpulkan $130 juta dengan valuasi $1,3 miliar pada Januari (Deepgram, 2026); OpenAI merilis lima model suara real-time baru antara Mei dan Juli (OpenAI, 2026); dan FTC AS melaporkan bahwa penipuan peniruan identitas merugikan warga Amerika sebesar $3,5 miliar pada 2025 (FTC, 2026). Analisis ini menggabungkan data dari TechCrunch, Bloomberg, FTC, Pindrop, OpenAI, Gartner, European Commission, dan 20 sumber primer lainnya menjadi catatan bertanggal tentang apa yang sebenarnya terjadi di industri voice AI selama semester pertama 2026.
Untuk latar belakang teknologi yang tidak lekang oleh waktu, lihat referensi statistik kloning suara 2026 kami. Artikel ini adalah catatan peristiwa pertengahan tahun.
TL;DR
- ElevenLabs mengumpulkan $500 juta dalam putaran Series D dengan valuasi $11 miliar pada Februari, lalu memulai pembicaraan untuk penawaran tender senilai $22 miliar pada 2 Juli (Bloomberg, 2026).
- Pendapatan berulang tahunan (ARR) ElevenLabs naik dari $330 juta pada akhir 2025 menjadi $500 juta pada April 2026 (TechCrunch / Sacra, 2026).
- Deepgram mengumpulkan $130 juta dengan valuasi $1,3 miliar pada 13 Januari dan telah mentranskripsi lebih dari 1 triliun kata (Deepgram, 2026).
- OpenAI meluncurkan GPT-Realtime-2, GPT-Realtime-Translate, dan GPT-Realtime-Whisper pada 7 Mei, lalu model full-duplex GPT-Live-1 pada 8 Juli (OpenAI, 2026; TechCrunch, 2026).
- Vapi mengumpulkan $50 juta dan melewati 1 miliar panggilan; Bland mengumpulkan $50 juta setelah ditolak oleh 180 investor (Vapi, 2026; Fortune, 2026).
- Aturan transparansi Pasal 50 EU AI Act untuk audio sintetis berlaku mulai 2 Agustus 2026, dengan denda hingga EUR 15 juta atau 3% dari omzet global (European Commission, 2026).
- FTC mencatat kerugian penipuan peniruan identitas sebesar $3,5 miliar untuk 2025, dari total sekitar $16 miliar penipuan yang dilaporkan, naik sekitar 25% dibanding tahun sebelumnya (FTC, 2026).
- Pindrop mengukur lonjakan 1.300% pada penipuan deepfake pusat kontak di antara 1,2 miliar panggilan yang dianalisis (Pindrop, laporan 2025).
- Dalam benchmark Mei 2026 terhadap delapan detektor, sistem teratas mencetak skor 98,1% sementara manusia dalam studi paralel hanya mencapai 68,7% (Resemble AI / Podonos, 2026; arXiv, 2026).
- Pasar pengenalan ucapan dan suara global mencapai perkiraan $23,70 miliar pada 2026 (Fortune Business Insights, 2026).
1. Lonjakan Pendanaan H1 2026
Uang datang lebih cepat daripada produk. Pola khas semester ini adalah repricing: ElevenLabs mengumpulkan dana dengan valuasi $11 miliar pada Februari dan tengah menerima minat tender senilai $22 miliar pada Juli, sebuah valuasi yang akan berlipat ganda dalam sekitar lima bulan tanpa putaran primer baru (Bloomberg, 2026). ElevenLabs juga melewati $500 juta pendapatan berulang tahunan pada April 2026, naik dari $330 juta pada akhir 2025 (TechCrunch / Sacra, 2026) - pertumbuhan yang memberi investor belakangan basis pendapatan untuk membenarkan kenaikan valuasi tersebut. Lapisan infrastruktur ikut naik harga secara paralel: Deepgram, yang menjual API suara alih-alih suara konsumen, mencapai valuasi $1,3 miliar pada Januari.
Pola ini tidak terbatas pada megadeal. Vapi dan Bland masing-masing menutup putaran $50 juta untuk agen suara enterprise, dan startup dikte Wispr memulai pembicaraan untuk sekitar $260 juta dengan valuasi sekitar $2 miliar. Pendanaan modal ventura voice AI sebelumnya sudah naik dari sekitar $315 juta pada 2022 menjadi $2,1 miliar pada 2024 (AssemblyAI, 2026), dan H1 2026 mempertahankan kurva yang curam itu.
| Metrik | Nilai | Sumber |
|---|---|---|
| Putaran Series D ElevenLabs | $500M at $11B valuation (Feb 4, 2026) | TechCrunch, 2026 |
| ARR ElevenLabs | $330M (end 2025) to $500M (April 2026) | TechCrunch / Sacra, 2026 |
| Pembicaraan Penawaran Tender ElevenLabs | ~$22B valuation (July 2, 2026) | Bloomberg, 2026 |
| Putaran Series C Deepgram | $130M at $1.3B valuation (Jan 13, 2026) | Deepgram, 2026 |
| Putaran Series B Vapi | $50M, led by Peak XV (May 12, 2026) | Vapi / GlobeNewswire, 2026 |
| Putaran Series C Bland | $50M, after 180 investor rejections (June 16, 2026) | Fortune, 2026 |
| Pembicaraan Pendanaan Wispr | ~$260M at ~$2B valuation (May 2026) | Bloomberg, 2026 |
| Modal Ventura Voice AI (konteks) | ~$315M (2022) to $2.1B (2024) | AssemblyAI, 2026 |
Konteks: PolyAI menutup putaran Series D senilai $86 juta dengan valuasi $750 juta pada Desember 2025, dan total pendanaan Cartesia yang diumumkan mencapai $191 juta pada Oktober 2025 - keduanya tepat sebelum periode ini - menunjukkan pipeline yang memberi makan H1. Lihat liputan TechCrunch tentang pendanaan ElevenLabs dan rilis Series C Deepgram.
2. Peluncuran Model: Apa yang Dirilis Jan-Jun 2026
Semester ini ditandai oleh pergeseran dari pipeline ke audio full-duplex. Asisten suara lama merangkai tiga model - speech-to-text, model bahasa, lalu text-to-speech - yang menambah latensi dan memutus interupsi alami. OpenAI meruntuhkan tumpukan itu dengan meluncurkan GPT-Realtime-2, GPT-Realtime-Translate, dan GPT-Realtime-Whisper pada 7 Mei 2026, lalu model full-duplex GPT-Live-1 pada 8 Juli yang mendengar dan berbicara pada saat bersamaan (OpenAI, 2026; TechCrunch, 2026). GPT-Realtime-Translate saja menangani lebih dari 70 bahasa input ke 13 bahasa output sambil mengimbangi kecepatan pembicara (OpenAI, 2026).
Tekanan harga menjadi cerita lain. Gemini 3.1 Flash TTS milik Google, dirilis 15 April, memangkas harga pemain premium yang sudah mapan dari sisi biaya per karakter, sementara masih tertinggal dari sisi benchmark kualitas. ElevenLabs masih memuncaki papan peringkat TTS independen Artificial Analysis, tetapi kesenjangannya menyempit seiring Microsoft memasukkan model Voice Live berlatensi rendah ke Azure Speech pada konferensi Build 2026-nya.
| Metrik | Nilai | Sumber |
|---|---|---|
| Model Suara Real-Time OpenAI | GPT-Realtime-2 / Translate / Whisper (May 7, 2026) | OpenAI, 2026 |
| Bahasa GPT-Realtime-Translate | 70+ input to 13 output | OpenAI, 2026 |
| Model Full-Duplex OpenAI | GPT-Live-1 and GPT-Live-1 mini (July 8, 2026) | TechCrunch, 2026 |
| Google Gemini 3.1 Flash TTS | Launched April 15, 2026; 40+ languages | Google (via trade press), 2026 |
| Harga Gemini 3.1 Flash TTS | ~$0.012 per 1K characters | Trade benchmark, 2026 |
| Papan Peringkat TTS | ElevenLabs #1 (~1,280 Elo), Gemini #2 (1,211) | Artificial Analysis, 2026 |
| Microsoft Azure Speech | Voice Live + Azure-Realtime at Build 2026 | Microsoft, 2026 |
| ElevenLabs v3 | Generally available, expressive multi-speaker | ElevenLabs, 2026 |
Catatan outlier: GPT-Live-1 diluncurkan 8 Juli, beberapa hari setelah tanda pertengahan tahun, tetapi masih termasuk siklus produk yang sama. Baca postingan peluncuran OpenAI.
3. Regulasi Diperketat di Tiga Yurisdiksi
Pembuatan aturan mengejar siklus produk. Kewajiban transparansi Pasal 50 EU AI Act - yang mewajibkan audio hasil AI dapat dibaca mesin dan diungkapkan - berlaku mulai 2 Agustus 2026, didukung denda hingga EUR 15 juta atau 3 persen dari omzet global (European Commission, 2026). Komisi mempercepat Code of Practice tentang konten hasil AI menuju versi final pada Juni 2026 untuk memberi penyedia layanan cetak biru kepatuhan sebelum tenggat waktu.
Amerika Serikat bergerak di dua jalur. Para pembuat undang-undang mengajukan kembali versi revisi NO FAKES Act pada Mei 2026 untuk menciptakan hak federal terhadap replika suara dan citra AI tanpa izin, dan kewajiban penghapusan konten platform di bawah TAKE IT DOWN Act mencapai tenggat kepatuhannya pada 19 Mei 2026, mewajibkan penghapusan konten yang ditandai dalam 48 jam. Denmark melangkah paling jauh, memajukan RUU yang memperlakukan wajah dan suara seseorang sebagai hak bergaya hak cipta yang berlaku 50 tahun setelah kematian.
Di bawah aturan yang mengutamakan persetujuan ini, alat yang dibangun untuk mengkloning suara Anda sendiri dengan izin - seperti perangkat lunak kloning suara VoxBooster - berada di sisi yang patuh. Untuk gambaran kebijakan yang lebih luas, lihat rangkuman statistik regulasi AI 2026 kami.
| Metrik | Nilai | Sumber |
|---|---|---|
| Pelabelan Audio Pasal 50 EU AI Act | Effective August 2, 2026 | European Commission, 2026 |
| Denda Transparansi EU AI Act | Up to EUR 15M or 3% of global turnover | European Commission, 2026 |
| NO FAKES Act (Revisi) | Reintroduced May 2026 | U.S. Senate, 2026 |
| Survei Kekhawatiran Deepfake | 92% of Americans concerned about deepfakes | U.S. Senate (NO FAKES release), 2026 |
| Penghapusan Konten TAKE IT DOWN Act | 48-hour removal; compliance deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| RUU Hak Citra Denmark | Protection 50 years after death | European Parliament (EPRS), 2026 |
| Negara Bagian AS Tanpa UU Deepfake Pemilu | ~22 as of June 2026 | Recording Law tracker, 2026 |
| Putusan Robocall AI FCC (konteks) | Up to $23K per illegal call | FCC, 2024 (most recent available) |
Tennessee ELVIS Act (2024) tetap menjadi templat yang diikuti sebagian besar RUU 2026. Teks utama: Pasal 50 EU AI Act.
4. Penipuan Suara dalam Angka
Sisi ancaman berkembang seiring dengan sisi kemampuan. FTC melaporkan bahwa penipuan peniruan identitas merugikan warga Amerika sebesar $3,5 miliar pada 2025, bagian dari sekitar $16 miliar total penipuan yang dilaporkan - tertinggi yang pernah tercatat dan naik sekitar 25 persen dibanding tahun sebelumnya (FTC, 2026). Peniru bisnis menyumbang $1 miliar dari total itu dan peniru pemerintah $920 juta. Angka-angka ini tidak spesifik untuk deepfake, tetapi menetapkan garis dasar yang kini diperkuat oleh suara sintetis.
Pusat kontak yang pertama merasakannya. Pindrop mengukur lonjakan 1.300 persen pada upaya penipuan deepfake di antara 1,2 miliar panggilan yang dianalisis, dengan serangan suara sintetis naik 475 persen pada perusahaan asuransi dan 149 persen pada bank (Pindrop, laporan 2025). Dalam jangka lebih panjang, Deloitte memproyeksikan kerugian penipuan AI generatif di AS naik dari $12,3 miliar pada 2023 menjadi $40 miliar pada 2027 (Deloitte, 2023 - data terbaru yang tersedia).
| Metrik | Nilai | Sumber |
|---|---|---|
| Kerugian Penipuan Peniruan Identitas FTC (2025) | $3.5 billion | FTC, 2026 |
| Total Penipuan yang Dilaporkan ke FTC (2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| Kerugian Peniru Bisnis + Pemerintah | $1B + $920M | FTC, 2026 |
| Lonjakan Penipuan Deepfake Pusat Kontak | +1,300% across 1.2B calls | Pindrop, 2025 report |
| Serangan Suara Sintetis per Sektor | Insurance +475%, banking +149%, retail +107% | Pindrop, 2025 report |
| Perkiraan Penipuan GenAI AS | $12.3B (2023) to $40B (2027), 32% CAGR | Deloitte, 2023 |
| Organisasi yang Terkena Serangan Deepfake (12 Bulan Terakhir) | 62% | Gartner, 2025 |
Total-total ini tidak spesifik untuk deepfake, tetapi menetapkan garis dasar yang kini diperkuat oleh suara sintetis. Sumber utama: Pindrop 2025 Voice Intelligence and Security Report.
5. Deteksi: Masih Bisakah Kita Membedakannya?
Deteksi membaik di atas kertas dan kesulitan dalam praktik. Dalam benchmark Mei 2026 terhadap delapan sistem deteksi deepfake audio, detektor teratas mencetak akurasi gabungan 98,1 persen, tetapi studi paralel 2026 menemukan bahwa manusia yang tidak terlatih hanya mengidentifikasi suara sintetis 68,7 persen dari waktu (Resemble AI / Podonos, 2026; arXiv, 2026). Kesenjangan mesin-manusia kini sekitar 26 poin, dan melebar seiring suara sintetis makin membaik.
Masalahnya adalah generalisasi. Peneliti menemukan bahwa detektor yang dilatih pada distribusi ASVspoof era 2019 tidak dapat secara andal menangkap serangan 2026, dan sebagian besar tooling masih hanya mencakup bahasa Inggris - meninggalkan kloning suara non-Inggris sebagai permukaan serangan yang terbuka (arXiv, 2026).
| Metrik | Nilai | Sumber |
|---|---|---|
| Detektor Teratas (Benchmark Podonos) | Resemble AI, 98.1% pooled accuracy | Resemble AI / Podonos, 2026 |
| Detektor Peringkat Kedua | Aurigin, 96.8% | Podonos, 2026 |
| Resemble AI Detect (Audio Bersih) | 94.2% | Resemble AI, 2026 |
| Akurasi Deteksi Mesin | 94.5% across 138 attacks | arXiv, 2026 |
| Akurasi Deteksi Manusia | 68.7% (1,768 users) | arXiv, 2026 |
| Cakupan Bahasa Benchmark | English only (noted gap) | arXiv / Resemble AI, 2026 |
| Detektor Lama (Dilatih dengan ASVspoof 2019) | Generalize poorly to 2026 attacks | arXiv, 2026 |
Masalah distribusi data pelatihan, bukan akurasi mentah, adalah cerita sebenarnya. Lihat benchmark deteksi deepfake audio dan analisis statistik deteksi deepfake 2026 kami.
6. Ukuran Pasar dan Adopsi Enterprise
Di balik headline, pasar terus tumbuh secara majemuk. Fortune Business Insights menilai pasar pengenalan ucapan dan suara global sebesar $23,70 miliar pada 2026, memproyeksikan $104,05 miliar pada 2034 dengan CAGR 20,30 persen (Fortune Business Insights, 2026). Segmen generator suara AI yang lebih sempit - text-to-speech ditambah kloning - berada di sekitar $4,16 miliar pada 2025 (MarketsandMarkets, 2025), dan sub-segmen kloning suara sekitar $2,4 miliar (Mordor Intelligence, 2025).
Metrik adopsi berubah dari proyeksi menjadi penggunaan nyata. Gartner masih memperkirakan AI percakapan akan memangkas biaya tenaga kerja pusat kontak sebesar $80 miliar pada 2026, tetapi angka yang lebih meyakinkan adalah angka produksi: Vapi memproses lebih dari 1 miliar panggilan dan Deepgram mentranskripsi lebih dari 1 triliun kata pada awal 2026. Untuk pandangan ke depan, lihat artikel proyeksi statistik pasar voice AI 2027 kami.
| Metrik | Nilai | Sumber |
|---|---|---|
| Pasar Pengenalan Ucapan dan Suara (2026) | $23.70 billion | Fortune Business Insights, 2026 |
| Pasar yang Sama (Proyeksi 2034) | $104.05 billion, 20.30% CAGR | Fortune Business Insights, 2026 |
| Segmen Generator Suara AI (2025) | $4.16 billion | MarketsandMarkets, 2025 |
| Sub-Segmen Kloning Suara (2025) | $2.4 billion | Mordor Intelligence, 2025 |
| Penghematan Tenaga Kerja AI Percakapan (2026) | $80 billion | Gartner, 2022 forecast for 2026 |
| Organisasi Layanan Pelanggan yang Menggunakan AI Percakapan | 80% (forecast) | Gartner, 2026 |
| Pemimpin Layanan Pelanggan di Bawah Tekanan Mengadopsi AI | 91% | Gartner, 2026 |
| Indikator Penggunaan Produksi | Vapi 1B+ calls; Deepgram 1T+ words | Vapi / Deepgram, 2026 |
Estimasi berbeda tergantung cakupannya: Coherent Market Insights menempatkan pasar pengenalan suara di sekitar $22,66 miliar pada 2026, mendekati Fortune Business Insights. Kerangka utama: proyeksi pusat kontak Gartner.
Ringkasan: Voice AI di H1 2026 dalam Angka
| Metrik | Nilai | Sumber |
|---|---|---|
| Putaran Series D ElevenLabs | $500M at $11B (Feb 4, 2026) | TechCrunch, 2026 |
| Pembicaraan Penawaran Tender ElevenLabs | ~$22B (July 2, 2026) | Bloomberg, 2026 |
| ARR ElevenLabs | $330M to $500M (end 2025 to April 2026) | TechCrunch / Sacra, 2026 |
| Putaran Series C Deepgram | $130M at $1.3B (Jan 13, 2026) | Deepgram, 2026 |
| Putaran Series B Vapi | $50M, 1B+ calls (May 12, 2026) | Vapi, 2026 |
| Putaran Series C Bland | $50M (June 16, 2026) | Fortune, 2026 |
| Model Suara Real-Time OpenAI | 3 launched May 7, 2026 | OpenAI, 2026 |
| Model Full-Duplex OpenAI | GPT-Live-1 (July 8, 2026) | TechCrunch, 2026 |
| Gemini 3.1 Flash TTS | Launched April 15, 2026 | Google, 2026 |
| Pasal 50 EU AI Act | Effective August 2, 2026 | European Commission, 2026 |
| NO FAKES Act (Revisi) | Reintroduced May 2026 | U.S. Senate, 2026 |
| Penghapusan Konten TAKE IT DOWN Act | 48-hour deadline May 19, 2026 | TAKE IT DOWN Act, 2026 |
| Kerugian Penipuan Peniruan Identitas FTC (2025) | $3.5 billion | FTC, 2026 |
| Total Penipuan yang Dilaporkan ke FTC (2025) | ~$16 billion, +25% YoY | FTC, 2026 |
| Lonjakan Penipuan Deepfake Pindrop | +1,300% across 1.2B calls | Pindrop, 2025 report |
| Akurasi Detektor Deepfake Teratas | 98.1% | Resemble AI / Podonos, 2026 |
| Akurasi Deteksi Manusia | 68.7% | arXiv, 2026 |
| Pasar Pengenalan Ucapan dan Suara (2026) | $23.70 billion | Fortune Business Insights, 2026 |
| Penghematan Tenaga Kerja AI Percakapan (2026) | $80 billion | Gartner, 2022 forecast |
Metodologi dan Sumber
Data dikumpulkan dengan mengagregasi pengungkapan bertanggal 2026, laporan riset primer, teks regulasi, dan pengumuman pendanaan yang dipublikasikan antara Januari dan Juli 2026, menyilang-referensikan angka pasar dan penipuan di dua sumber atau lebih, dan menandai angka mana pun yang lebih lama dari 2024.
- TechCrunch - liputan tentang ElevenLabs, Deepgram, dan OpenAI (2026): Putaran Series D ElevenLabs
- Bloomberg - penawaran tender $22 miliar ElevenLabs dan pembicaraan pendanaan Wispr (2026)
- Deepgram - siaran pers Series C (2026): Putaran Series C $130 Juta Deepgram
- Vapi / GlobeNewswire - Series B dan metrik penggunaan (2026)
- Fortune - liputan Series C Bland (2026)
- Sacra - profil pendapatan dan ARR ElevenLabs (2026)
- AssemblyAI - pelacak investasi voice AI di 2026 (2026)
- OpenAI - Advancing Voice Intelligence with New Models in the API (2026): postingan peluncuran OpenAI
- Google - peluncuran Gemini 3.1 Flash TTS (2026, melalui benchmark industri)
- Microsoft - Azure Speech di Build 2026 (2026)
- ElevenLabs - pengungkapan Eleven v3 dan Series D (2026)
- Artificial Analysis - papan peringkat model TTS (2026)
- European Commission - Pasal 50 EU AI Act dan Code of Practice (2026): teks Pasal 50
- U.S. Senate - siaran pers NO FAKES Act revisi (2026)
- European Parliament (EPRS) - analisis RUU hak cipta deepfake Denmark (2026)
- Recording Law - pelacak UU deepfake negara bagian AS (2026)
- FCC - putusan robocall AI berdasarkan TCPA (2024)
- U.S. Federal Trade Commission - data penipuan peniruan identitas dan penipuan untuk 2025 (2026): data penipuan FTC 2025
- Pindrop - 2025 Voice Intelligence and Security Report (2025): laporan Pindrop
- Deloitte Center for Financial Services - proyeksi penipuan AI generatif (2023)
- Gartner - AI percakapan, risiko deepfake, dan survei layanan pelanggan (2022-2026)
- Resemble AI / Podonos - benchmark deteksi deepfake audio (2026): benchmark deteksi
- arXiv - studi akademis tentang deteksi deepfake suara oleh manusia dan mesin (2026)
- Fortune Business Insights - laporan pasar pengenalan ucapan dan suara (2026)
- MarketsandMarkets - laporan pasar generator suara AI (2025)
- Mordor Intelligence - laporan pasar kloning suara (2025)
- Sifted - liputan putaran seed Gradium / Nvidia (2026)
Data watch: FTC merilis total penipuan Consumer Sentinel-nya setiap tahun, dengan edisi berikutnya diperkirakan terbit awal 2027; Pindrop menerbitkan Voice Intelligence and Security Report-nya dengan siklus tahunan, dengan edisi berikutnya diperkirakan terbit lebih lambat pada 2026; Gartner memperbarui survei AI percakapan dan layanan pelanggannya sepanjang tahun; EU AI Act mencapai milestone penegakan Pasal 50-nya pada 2 Agustus 2026; dan Deloitte secara berkala memperbarui proyeksi penipuan AI generatifnya.
Terakhir diperbarui: 11 Juli 2026. Kami meninjau dan memperbarui halaman ini setiap triwulan seiring dipublikasikannya data baru.