Whisper Gerçek Zamanlı Konuşmadan Metne Windows: Tam Kurulum Kılavuzu

Windows'ta Whisper gerçek zamanlı konuşmadan metne dönüştürmeyi çalıştırın. Yerel Whisper-large-v3 çıkarımı, 300ms altında gecikme, canlı altyazılar, sesli komut iş akışları - buluta gerek yok.

Whisper gerçek zamanlı konuşmadan metne Windows’ta, modeli çevrimdışı bir toplu iş aracından canlı bir transkripsiyon motoruna dönüştürür. Yerel, özel ve canlı bir akışa altyazı eklemek, bir toplantıyı transkribe etmek veya buluta tek bir bayt göndermeden sesli komut iş akışını beslemek için yeterince hassastır.

Bu kılavuz şunları kapsamaktadır: gerçek zamanlı Whisper çıkarımı kapı altında nasıl çalışır, her model boyutu için donanım gereksinimleri, üç pratik dağıtım yolu, Windows’a özgü düşük gecikmeli ses yakalama ve ses yönlendirmesi ve VoxBooster’ın Whisper’ı ses işlem hattına doğrudan nasıl entegre ettiği.


Gerçek Zamanlı Whisper Çevrimdışı Whisper’dan Neden Farklı

Orijinal Whisper makalesi, 680.000 saatlik ses üzerinde eğitilen bir dizi-dizi modeli açıklamaktadır. Ona bir dosya verirsiniz; bir transkripsiyon döndürür. Bu, sonrası işleme için harikadır ancak konuşmadan bir saniye içinde altyazılar gösterilmesine ihtiyacınız varsa işe yaramaz.

Gerçek zamanlı Whisper, mikrofon akışını örtüşen pencerelerine (genellikle 1-3 saniye) böler. Her pencere modeli bağımsız olarak geçer ve sonuçlar gösterimden önce birleştirilir. Ödünleşme, modelin asla tam cümle bağlamını görmemesi ve pencere sınırlarında ara sıra “halüsinasyonlar” sunmasıdır. Whisper-large-v3, önceki versiyonlardan kısa ses segmentlerini daha sağlam bir şekilde işleyerek bunu önemli ölçüde azaltır.

Diğer kritik faktör ses etkinliği detektörü (VAD) dır. VAD olmadan, Whisper sessizlikte çalışır ve hayalet metin üretir. Silero VAD mevcut standarttır - yalnızca konuşma mevcut olduğunda çıkarımın çalıştığını sağlayarak, tipik kullanımda gecikme ve CPU/GPU yükünü %40-70 oranında azaltır.


Donanım Gereksinimleri

GPU Yolu (Önerilen)

ModelGerekli VRAMTipik RTX 3060 Gecikmesi
tiny1 GB~50ms
small2 GB~80ms
medium4 GB~150-250ms
large-v36 GB~200-350ms

Çoğu transkripsiyon kullanım durumları için (erişilebilirlik altyazıları, toplantı notları, yayıncı altyazıları) 4 GB kartında Whisper-medium, doğruluk ve gecikme arasında özür dileme noktasına çarpar.

CPU Yolu

Yalnızca CPU çıkarımı yalnızca küçük ve çok küçük modeller için uygulanabilir. 500ms-2 saniye gecikme beklenti yapın. Bu, daha sonra yeniden oynatılan toplantı transkripsiyon gibi etkileşimli olmayan kullanım için göze çarpan ancak toleranslı. Konuşma sırasında canlı altyazılar için, yalnızca CPU bozuk hissettirecek bir gecikme etkisi oluşturacak.

Ses Donanımı

Herhangi bir mikrofon işe yarar, ancak sinyal kalitesi transkripsiyon doğruluğunu doğrudan etkiler. Whisper çeşitli ses koşullarında eğitilmiştir, bu nedenle gürültüyü makul şekilde işler, ancak yakın konuşma mikrofonlu kulaklık, gerçek zamanlı kullanım için her zaman uzak alan masası mikrofonunu aşacaktır. Whisper girişinden önce uygulanan gürültü bastırma, zincire bir işleme aşaması eklemenin maliyetiyle yardımcı olur.


Düşük Gecikmeli Ses Yakalama ve Windows’ta Ses Yönlendirmesi

Windows, ses işlem hattını Windows Audio Session API aracılığıyla yönlendirir (düşük gecikmeli ses yakalama). Düşük gecikmeli ses yakalamayı anlamak, Whisper’ı doğru şekilde ayarlamak için gereklidir. Özellikle mikrofon girişi yerine sistem çıktısını (duyduğunuz şeyi) transkribe etmek veya işlenmiş sesi Whisper’a beslemek istediğinizde.

Özel Mod vs Paylaşılan Mod

Özel mod bir uygulamaya minimum gecikmeyle doğrudan donanım erişimi verir ancak diğer tüm olanları kilitler. Paylaşılan mod, birden çok uygulamanın aynı uç noktayı paylaşmasına izin verir ve Windows karışımı işler. Whisper giriş yakalaması için, paylaşılan mod neredeyse her zaman doğrudur. Whisper’ın diğer uygulamaların kullandığı aynı mikrofon akışından okumasını istiyorsunuz, hiçbir şeyi engellememek.

Mikrofon Girişini Yakala

sounddevice ve pyaudio gibi Python kütüphaneleri, cihaz dizini tarafından düşük gecikmeli ses yakalama uç noktalarına erişir. Tüm kullanılabilir ses cihazlarını listelemek için aşağıdakileri çalıştırın:

import sounddevice as sd
print(sd.query_devices())

Mikrofonunuz bir giriş cihazı olarak görüntülenecektir. Dizini not alın - ses akışını açarken onu device parametresi olarak aktaracaksınız.

Loopback (Sistem Sesi) Yakala

Hoparlörler aracılığıyla oynatılan şeyi transkribe etmek için (bir video araması, oyun, herhangi bir uygulama sesi), düşük gecikmeli ses yakalama geri döngüsünü kullanın. sounddevice’ta, low-latency audio capture_exclusive=False ayarlayın ve çıkış cihazını hedefleyin; kütüphane geri döngüyü Windows’ta dahili olarak işler. Video konferanslarına altyazı eklemek veya tüm PC sesinde altyazılar gerektiren herhangi bir erişilebilirlik iş akışı için kullanışlıdır.


Üç Dağıtım Yolu

Yol 1: faster-whisper + Özel Python Komut Dosyası

faster-whisper orijinalinden 4 kat daha hızlı çalışan ve daha az bellek kullanan CTranslate2 tabanlı bir Whisper yeniden uygulaması. Tüm model boyutlarını destekler ve gerçek zamanlı bir ses döngüsüyle temiz bir şekilde entegre olur.

Kurulum:

pip install faster-whisper sounddevice numpy silero-vad

Temel döngü:

  1. sounddevice ile 16 kHz mono’da bir ses akışı açın (Whisper’ın yerel örnek hızı).
  2. Gelen sesi yuvarlanma penceresine ara bellek.
  3. Silero VAD çalıştır; konuşma algılanmazsa çıkarımı atla.
  4. Konuşma segmentlerini faster-whisper’ın transcribe() yöntemine beam_size=1 (daha hızlı) veya beam_size=5 (daha doğru) ile gönder.
  5. Sonucu yazdır veya yönlendir.

Bu yol maksimum kontrol sağlar, ancak Python rahatlılığı gerektirir. Mikrofonunuz için ara bellek boyutlarını ve VAD eşiklerini ayarlamaya 30-60 dakika bütçe yapın.

Yol 2: whisper.cpp

whisper.cpp, CUDA desteğiyle yerel bir Windows ikilisine derleyen Whisper’ın bir C++ portu. Mikrofonu açan, yapılandırılabilir pencere boyutlarıyla çıkarım çalıştıran ve çıktıyı stdout’a yazdıran gerçek zamanlı bir demo (stream.exe) ile gelir.

Python’dan neden bunu kullanasınız? Başlangıç zamanı neredeyse anındadır (yüklenecek Python yorumlayıcısı yok), bellek kullanımı daha düşüktür ve Python olmayan araç zincirlerine kolayca entegre olur. Akış çıktısı, OBS’nin canlı altyazı kaynağı olarak okuduğu bir dosyaya yeniden yönlendirilebilir.

Derleme Adımları (PowerShell):

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
cmake -B build -DGGML_CUDA=1
cmake --build build --config Release
.\build\bin\Release\stream.exe -m models\ggml-large-v3.bin -t 8

Yol 3: VoxBooster Entegre Whisper

VoxBooster, uygulamaya doğrudan yerleştirilmiş Whisper çıkarımı ile gelir. Ayrı Python ortamı yok, manuel CUDA kurulumu yok. Model, optimize edilmiş bir arka uç aracılığıyla GPU’nuzda yerel olarak çalışır, düşük gecikmeli ses yakalama dahili olarak işlenir ve çıktı, bir yer paylaşımı, OBS için canlı altyazı dosyası veya sesli komut işleme için düşük gecikmeli giriş olarak kullanılabilir.

El ile Python konfigürasyonlarından temel fark, entegre gürültü bastırma aşaması. Ses, Whisper ara belleğine ulaşmadan önce VoxBooster’ın bastırma katmanından geçer. Bu, gürültülü ortamlarda (kulaklık fan gürültüsü, HVAC, tuş tıklaması) ölçülebilir bir şekilde doğruluğu artırır ve kullanıcıya görünür gecikme eklemez. Ses’den görüntülenen altyazıya kadar uçtan uca gecikme, son üç yıldaki donanımda 300ms’nin altındadır.

Çekirdek sürücü yüklenmediğinden, UAC yükselmesi yok, antivirüs yazılımıyla hiçbir çatışma yok ve Cihaz Yöneticisi’nde görünen cihaz yok. Düşük gecikmeli ses yakalama kancaları oturum düzeyindedir ve uygulama kapandığında temiz bir şekilde sökülür.


Yayın ve Erişilebilirlik için Canlı Altyazılar

OBS Entegrasyonu

faster-whisper, whisper.cpp veya VoxBooster kullanmanız fark etmeksizin, OBS ile entegrasyon noktası gerçek zamanlı olarak güncellenen bir metin dosyası.

  1. Whisper aracınızı transkripsiyon çıktısını bir dosyaya yazmak için yapılandırın (ör. C:\captions\live.txt).
  2. OBS’de bir Metin (GDI+) kaynağı ekleyin.
  3. Dosyadan oku seçeneğini işaretleyin ve aynı yola işaret edin.
  4. OBS dosyayı yoklar ve kaynağı her kare güncelleştir.

Metin kaynağını oyun görüntüleri veya web kamerası üzerine okunabilir tutmak için yarı saydam bir arka planla stilleyin.

Erişilebilirlik Kullanım Durumları

İşitme engeli olan kullanıcılar için Windows’ta Whisper altyazıları Windows 11 Live Captions’a göre çeşitli avantajlar sunar:

  • Teknik sözcabul, güçlü aksanlar ve İngilizce olmayan diller için daha yüksek doğruluk
  • Özelleştirilebilir ekran: yazı tipi boyutu, konum, renk ve kalıcılık
  • Çoklu giriş: hem mikrofonu hem de geri döngüyü aynı Whisper örneğine besleyin.
  • Tamamen çevrimdışı: Microsoft konuşma tanıma sunucularında hiçbir bağımlılık yok

Live Captions’a erişim yapamayan Windows 10 kullanıcıları için, yerel Whisper abonelik gerektirmeyen birincil gerçek zamanlı erişilebilirlik seçeneğidir.


Sesli Komut İş Akışları

Whisper konuşmadan metne, ortam sesli komut sistemlerini güçlendirmek için yeterince doğru. Tuşa basmadan veya düğme tıklamadan PC’nize komutlar söyleyin.

Mimari genellikle şu şekilde görünür:

Mikrofon → VAD Filtresi → Whisper → Metin Arabelleği → Niyet Ayrıştırıcı → Eylem Gönderici

Niyet ayrıştırıcı, subprocess.run() çağrılarıyla eşlenen tetikleyici ifadelerin bir Python sözlüğü kadar basit olabilir veya doğal dil komutlarını işleyen yerel bir dil modeli kadar karmaşık olabilir. Oyunlar ve içerik oluşturma için ortak komutlar:

  • Kaydı başlat/durdur
  • OBS sahneleri değiştir
  • Ses kurulu klipleri tetikle
  • Mikrofonu sessize al/sesini aç

Whisper yerel olduğundan, bulut gidiş-dönüş gecikmesi yoktur. Kısıtlama çıkarım zamanıdır: Whisper-medium parça başına 150-250ms’dir. Yayın için algılanamaz, gerçek zamanlı oyun kontrolü için sınırda. openwakeword gibi bir anahtar sözcük noktacı, ortak komutlar (50ms’nin altında) için hızlı bir yol olarak hareket edebilir ve Whisper başka her şeyi işler.


Doğruluk: Neler Beklenir?

Whisper-large-v3, temiz İngilizce ses üzerinde yaklaşık %3-5 sözcük hata oranı elde eder. Bu ticari bulut hizmetleriyle rekabetçidir. 1-3 saniyelik pencerelerle gerçek zamanlı modda, her çıkarım çağrısı başına sınırlı bağlam nedeniyle %5-8 WER beklenir.

Doğruluğu artıran faktörler:

  • Daha iyi mikrofon yerleşimi: yakın konuşma kulaklığı vs. uzak alan masası mikrofonu kolayca %2-3 WER farkı
  • Girişten önce gürültü bastırma: Ön filtreleme, arka plan sesi tarafından tetiklenen halüsinasyonları azaltır.
  • Kiriş boyutu: 1’den 5’e artırıldığında parça başına ~50ms ek gecikme bedeline karşılık doğruluk artar.
  • Sıcaklık: temperature=0 (açgözlü kod çözme) ayarlandığında, çıktıdaki varyans azalır ve model muğlak sesin “halüsinasyonlu” yaratıcı transkripsiyon yapmaktan kaçınır.

Doğruluğu azaltan faktörler:

  • Pencere sınırı bölmesi: çıkarım pencereleri arasındaki sınıra tam olarak düşen sözcükler hata eğilimindedir. Çakışan arabelleğe alma bunu hafifletir.
  • Sessizlik halüsinasyonları: VAD olmadan, Whisper sık sık sessizliği dolgu ifadeleri olarak yazıya çevirir. Her zaman VAD çalıştır.
  • İnce ayar boşluğu: Vanilla Whisper oyun yorumu veya ağır bölgesel aksanlar üzerinde eğitilmemiş. Orada daha fazla hataya beklenir.

Whisper Gerçek Zamanlı ile Windows 11 Live Captions Arasında Seçim Yapma

ÖlçütWindows 11 Live CaptionsYerel Whisper
Kurulum Süresi~90 saniye15-60 dakika
Doğruluk (Temiz EN)İyiMükemmel (large-v3)
Doğruluk (Aksanlar/Jargon)Adilİyi-Mükemmel
Dil Desteği30+ dil99 dil
Gecikme200-400ms150-800ms (GPU bağımlı)
OBS EntegrasyonuYokDosya Çıkışı
ÇevrimdışıEvetEvet
Windows 10 DesteğiHayırEvet
GizlilikYerel (Microsoft)Tamamen Yerel
Donanım MaliyetiYokGPU büyük ölçüde yardımcı olur

Windows 11’deyseniz ve minimum kurulumla erişilebilirlik için yalnızca İngilizce altyazılara ihtiyacınız varsa, Live Captions doğru cevaptır. Windows 10 desteği, belirli etki alanlarında daha yüksek doğruluk, OBS altyazıları, sesli komutlar veya transkripsiyon işlem hattı kontrolü gerekiyorsa, yerel Whisper daha iyi bir seçimdir.


Bugün Başlayın

Çalışan Whisper gerçek zamanlı konuşmadan metne dönüştürmeye en hızlı yol:

  1. VoxBooster ile: Uygulamayı açın, Ayarlar → Transkripsiyon’a gidin, Whisper’ı etkinleştirin, model boyutunu seçin. Ses yönlendirmesi, VAD ve OBS çıkış dosyası da dahil olmak üzere her şey otomatik olarak işlenir.

  2. Manuel faster-whisper: pip install faster-whisper sounddevice silero-vad’ı çalıştırın, sonra faster-whisper GitHub’dan akış örneklerinden birini uyarla. Çalışan bir prototip almak için 30 dakika bekle.

  3. whisper.cpp: Klon, CUDA ile derle, stream.exe çalıştır. CMake’te rahat olduğunuzda el ile yollar arasında en hızlı kurulum.

Windows’ta Whisper gerçek zamanlı konuşmadan metne dönüştürme artık deneysel değildir. Doğru modelle, orta seviye GPU’suyla ve temiz ses girdisiyle, ticari bulut hizmetleriyle eşleşen veya onları yenen transkripsiyon kalitesi ve gecikmesi elde edersiniz. Ve ses verileri makinenizi terk etmez.

VoxBooster'ı dene — 3 günlük ücretsiz deneme.

Gerçek zamanlı ses klonlama, ses tahtası ve efektler — zaten konuştuğun her yerde.

  • Kart gerekmez
  • ~30ms gecikme
  • Discord · Teams · OBS
3 gün ücretsiz dene