Her toplantı “Gerçekten ne karar verdik?” sorusuyla ilgili bir e-posta zincirine son buluyorsa, sorun toplantı değildir — güvenilir bir yazıya çeviri eksikliğidir. Bulut yazıya çevirme hizmetleri bunu kısmen çözer, ancak çağrı sesinizi üçüncü taraf sunucuya yüklemesi gerekir. Yasal, uyum veya basitçe gizlilik nedenleriyle bu her zaman kabul edilebilir değildir.
Bu kılavuz, Windows PC’niz üzerinde tamamen bir sesli toplantı notları iş akışı nasıl yapılandırılacağını gösterir: düşük gecikmeli ses yakalama geri döngüsü kullanarak toplantı sesini yakala, OpenAI’nin Whisper modelini yerel olarak çalıştır ve kararlar ve eylem maddeleriyle birlikte Markdown özeti otomatik olarak çıkar. Bulut yüklemesi yok. Abonelik yok. İşlem bilgisayarınızda gerçekleşir.
Özet
| Adım | Araç | Saat |
|---|---|---|
| Ses yakala | FFmpeg + düşük gecikmeli ses yakalama geri döngüsü | Canlı |
| Yazıya çevir | Whisper (medium.en) | ~4 dakika / 1 saatlik toplantı |
| Eylemleri çıkar | Python + yerel LLM veya yapay zekaya yapıştır | ~2 dakika |
| Çıktı | Markdown .md dosyası | Anında |
Toplantılar için Yerel Yazıya Çevirme Neden Bulutu Yeniyor
Çoğu bulut yazıya çevirme hizmeti — Otter.ai, Fireflies, Zoom AI Notes — sesi uzak sunuculara göndererek, işleme tabi tutularak ve genellikle model eğitimi için depolanarak çalışır. Kişisel tatil araması için sorun yok. İstemci adları, finansal tahminler, tıbbi bilgiler veya yasal tartışmalar içeren aramalar için değildir.
Whisper’ı yerel olarak çalıştırmak, ses dosyasının asla makineyi terk etmediği anlamına gelir. Şirket hesabınıza bağlı hiçbir API anahtarı yoktur, okuyacak saklama ilkesi yoktur ve üçüncü taraf ihlalinin çağrı içeriğinizi açığa çıkarması olasılığı yoktur. Yazıya çevirme ve özet, bunları kaydettiğiniz yerde bulunur.
Maliyet argümanı da vardır. Ölçekte bulut yazıya çevirme — bir takım genelinde aylık 100 saatlik toplantı — çoğu platformda kullanıcı başına aylık $40-$200 maliyeti. Halihazırda sahip olduğunuz GPU’da yerel çıkarım, kurulumdan sonra yazıya çevirme başına hiçbir maliyete sahip değildir.
Hukuk ve İzin — Önce Bunu Okuyun
Katılımcı izni olmadan bir toplantıyı kaydetmek veya yazıya çevirmek birçok yargı yetkisinde, ABD’nin birçok eyaletinde (iki taraf izin yasaları), AB’de (GDPR Madde 6) ve dünyanın başka yerlerinde yasa dışıdır.
Herhangi bir toplantıyı yazıya çevirmeden önce:
- Başında açıkça ilan edin: “Notlar için yerel yazıya çevirme için ses kaydediyorum.”
- Katılımcılara çıkma veya kayıt dışında konuşma seçeneği verin.
- Şirketin çağrı kaydı politikasını kontrol edin — çoğu IT veya hukuki onay gerektirir.
- Yazıya çevirmeleri güvenli bir şekilde saklayın ve diğer gizli belgelerle aynı veri işleme kurallarını uygulayın.
Bu makale teknik bir kılavuzdur. Yasal tavsiye değildir.
İhtiyacınız Olan Şey
- Windows 10 veya 11 — düşük gecikmeli ses yakalama geri döngüsü her ikisinde de mevcuttur
- Python 3.10+ — python.org veya winget’ten
- FFmpeg — geri döngü cihazından ses yakalama
- openai-whisper veya faster-whisper — yazıya çevirme motoru
- NVIDIA GPU (isteğe bağlı ancak önerilir) — hızlı çıkarım için RTX 2060 veya daha iyi; CPU da çalışır
- Bir toplantı uygulaması: Zoom, Microsoft Teams, Google Meet veya ses üreten herhangi bir uygulama
Adım 1 — Düşük Gecikmeli Ses Yakalama Geri Döngüsü Cihazınızı Belirleyin
Düşük gecikmeli ses yakalama geri döngüsü, Windows’un çıktı cihazı aracılığıyla çalıştırdığı her şeyi yakalar — kulaklıklarda duyduğunuz aynı ses. Sürücü yüklemesine gerek yoktur; Vista’dan beri Windows ses yığınının bir parçasıdır.
Bir terminal açın ve çalıştırın:
ffmpeg -list_devices true -f dshow -i dummy 2>&1 | findstr /i "audio"
Buna benzer bir çıktı göreceksiniz:
"Speakers (Realtek High Definition Audio)" (audio)
"Headphones (USB Audio Device)" (audio)
Etkin çıktı cihazınızın tam adını not edin. Geri döngü yakalama için, FFmpeg ile kullandığınızda cihaz adına (loopback) ekleyin.
Alternatif olarak, cihazları listelemek için Python kullanın:
import sounddevice as sd
print(sd.query_devices())
Adında (loopback) olan veya host API’si low-latency audio capture olan cihazları arayın.
Adım 2 — Toplantı Sesini Kaydedin
Bir Zoom, Teams veya Meet çağrısı başlatın. Ana içerik başlamadan önce, ayrı bir terminalde FFmpeg’i başlatın:
ffmpeg -f dshow -i audio="Speakers (Realtek High Definition Audio) (loopback)" \
-ar 16000 -ac 1 -c:a pcm_s16le \
meeting_2026-06-12.wav
Anahtar bayraklar:
-ar 16000— Whisper’ın yerli örnek alma oranı; yeniden örneklemeye gerek yok-ac 1— mono; dosya boyutunu azaltır ve Whisper’ın beklenen girişiyle eşleşir-c:a pcm_s16le— en iyi doğruluk için sıkıştırılmamış WAV
Toplantı bittiğinde Ctrl+C ile kaydı durdurun. Bu ayarlarla 1 saatlik bir toplantı yaklaşık 115 MB üretir.
İpucu: Arka plan gürültüsü nedeniyle ses kalitesi kötü ise, arama öncesinde mikrofon kanalınızda VoxBooster’ın gürültü bastırmasını çalıştırmak, ses yakalamanızda sesinizi temiz tutar. Düşük gecikmeli ses yakalama geri döngüsü karışık çıktıyı yakalar, bu nedenle diğer katılımcıların sesi kendi platformlarının gürültü işlemesinden yararlanır.
Adım 3 — Whisper’ı Yükleyin
Henüz Whisper yüklememiş iseniz:
pip install openai-whisper
# Daha hızlı CPU/GPU çıkarım için:
pip install faster-whisper
GPU ivmesi (NVIDIA) için ayrıca yükleyin:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
Önce nvidia-smi ile CUDA versiyonunuzu kontrol edin ve cu sürümünü buna göre eşleştirin.
Adım 4 — Kaydı Yazıya Çevirin
openai-whisper (CLI) Kullanarak
whisper meeting_2026-06-12.wav --model medium.en --output_format txt --output_dir ./transcripts
Bu bir .txt dosyası ve bir .srt altyazı dosyası kaydeder. medium.en modeli yalnızca İngilizce olup, İngilizce toplantılar için çok dilli medium uygulamasından daha hızlı ve doğru şekildedir.
faster-whisper (Python Betiği) Kullanarak
from faster_whisper import WhisperModel
model = WhisperModel("medium.en", device="cuda", compute_type="float16")
segments, info = model.transcribe("meeting_2026-06-12.wav", beam_size=5)
with open("transcript.txt", "w", encoding="utf-8") as f:
for segment in segments:
timestamp = f"[{segment.start:.1f}s]"
f.write(f"{timestamp} {segment.text.strip()}\n")
print("Transcription complete.")
faster-whisper, kaputu altında CTranslate2 kullanır ve aynı donanımda orijinal olandan 2-4 kat daha hızlıdır.
Adım 5 — Eylem Maddelerini Markdown’a Çıkarın
Ham yazıya çevirimler metin duvarlarıdır. Yararlı yapı, yapılandırılmış bir özettir: alınan kararlar, atanan görevler ve açık sorular. Ollama (yerel LLM) kullanarak bir tane üreten basit bir Python betiği:
import subprocess
import sys
transcript_path = sys.argv[1]
with open(transcript_path, "r", encoding="utf-8") as f:
transcript = f.read()
prompt = f"""You are a meeting notes assistant. Given the transcript below, produce a Markdown document with:
1. **Meeting Summary** (3-5 sentences)
2. **Decisions Made** (bulleted list)
3. **Action Items** (bulleted list with owner and deadline if mentioned)
4. **Open Questions** (bulleted list)
Transcript:
{transcript}
"""
result = subprocess.run(
["ollama", "run", "llama3"],
input=prompt,
capture_output=True,
text=True,
encoding="utf-8"
)
output_path = transcript_path.replace(".txt", "_summary.md")
with open(output_path, "w", encoding="utf-8") as f:
f.write(result.stdout)
print(f"Summary saved to {output_path}")
Bunu şöyle çalıştırın:
python extract_actions.py transcripts/meeting_2026-06-12.txt
Ollama yok mu? Yazıya çevirmeyi aynı komutla herhangi bir sohbet yapay zekasına yapıştırın. Çıktı aynıdır — yalnızca otomasyon adımı farklıdır.
Model Seçim Kılavuzu
| Model | VRAM | Hız (GPU) | Hız (CPU) | En İyi İçin |
|---|---|---|---|---|
| tiny.en | 1 GB | Çok hızlı | 5 dakika/saat | Hızlı taslaklar, test |
| small.en | 2 GB | Hızlı | 20 dakika/saat | Yalnızca CPU makineleri |
| medium.en | 5 GB | Dengeli | 60 dakika/saat | Varsayılan öneri |
| large-v3 | 10 GB | Yavaş | Pratik değil | Maksimum doğruluk, RTX 4070+ |
Tüm modeller ilk indirmeden sonra tamamen çevrimdışı çalışır.
Karşılaştırma: Yerel Whisper vs. Bulut Yazıya Çevirme Hizmetleri
| Özellik | Whisper (yerel) | Otter.ai | Fireflies | Zoom AI Notes |
|---|---|---|---|---|
| Veri cihazı terk eder | Hayır | Evet | Evet | Evet |
| Aylık maliyet | $0 | $10–$20/kullanıcı | $10–$19/kullanıcı | Zoom’a dahil |
| Doğruluk (İngilizce) | 88–94% WER | ~88% | ~87% | ~85% |
| Konuşmacı diyarizasyonu | pyannote ile | Evet | Evet | Evet |
| Özel kelime dağarcığı | Komut aracılığıyla | Ücretli | Ücretli | Hayır |
| Çevrimdışı yeteneği | Evet | Hayır | Hayır | Hayır |
| Kurulum süresi | 30 dakika | 5 dakika | 5 dakika | 0 dakika |
Bulut hizmetleri kolaylık ve kutu dışından konuşmacı diyarizasyonunda kazanırlar. Yerel Whisper, gizlilik, ölçekte maliyet ve internet olmadan çalışma yeteneğinde kazanır.
Konuşmacı Diyarizasyonu Ekleme
Whisper tek başına kim neyin söylediğini belirlemez. Atfın önemli olduğu toplantılar için bunu pyannote.audio ile birleştirin:
pip install pyannote.audio
from pyannote.audio import Pipeline
pipeline = Pipeline.from_pretrained(
"pyannote/speaker-diarization-3.1",
use_auth_token="YOUR_HF_TOKEN"
)
diarization = pipeline("meeting_2026-06-12.wav")
for turn, _, speaker in diarization.itertracks(yield_label=True):
print(f"{speaker}: {turn.start:.1f}s – {turn.end:.1f}s")
Daha sonra diyarizasyon zaman damgalarını Whisper segment zaman damgalarıyla hizalayarak konuşmacı etiketli yazıya çevirimler üretebilirsiniz. pyannote modelleri indirilmeden sonra yerel olarak çalışır — Hugging Face hesabı model lisansını kabul etmek için gereklidir, ancak çıkarım tamamen çevrimdışıdır.
Tam Ardışık Düzeni Otomatikleştirme
Üç adım bireysel olarak çalıştığında, herhangi bir toplantı bittikten sonra çalışan tek bir betikte zincirleyin:
# record.bat — toplantı sırasında çalıştır
ffmpeg -f dshow -i audio="Speakers (Realtek High Definition Audio) (loopback)" ^
-ar 16000 -ac 1 -c:a pcm_s16le ^
"meetings\%DATE:~10,4%-%DATE:~4,2%-%DATE:~7,2%.wav"
# process.bat — toplantıdan sonra çalıştır
set FILE=%1
python transcribe.py %FILE%
python extract_actions.py %FILE:.wav=.txt%
start "" "%FILE:.wav=_summary.md%"
process.bat meetings\2026-06-12.wav çalıştırın ve özet varsayılan Markdown editörünüzde otomatik olarak açılır.
Gizlilik ve Depolama Dikkatleri
Toplantı yazıya çevirmeleri saklarken aşağıdakileri göz önünde bulundurun:
- Hassas ticari bilgi içeriyorsa WAV ve yazıya çevirme dosyalarını şifreleyin. Windows BitLocker veya VeraCrypt bunu klasör düzeyinde işler.
- Bekletme ilkesi belirleyin — yazıya çevirmeden sonra ham WAV dosyalarını silin; tamamen alıntıya gerek yoksa yalnızca özeti saklayın.
- Paylaşılan sürücüler: Yazıya çevirmeleri OneDrive veya SharePoint ile senkronize ederseniz, bu sistemlerin yüklenen belgelere OCR veya yapay zeka indeksleme uygulayıp uygulamadığını kontrol edin.
- Erişim kontrolü: Yazıya çevirme dosyalarını yalnızca katılımcılarla kısıtlayın. Ağ sürücüsünde paylaşılan bir
\meetings\klasörü tüm şirkete açık olmamalıdır.
Yumuşak CTA
VoxBooster’ın gürültü bastırması, ses düşük gecikmeli ses yakalama geri döngüsüne ulaşmadan önce mikrofon kanalınızın temiz olmasını sağlayarak, sesiniz üzerinde Whisper’ın kelime hata oranını doğrudan iyileştirir. Windows 10/11’de yerel olarak çalışır, çekirdek sürücüleri gerektirmez ve herhangi bir toplantı uygulamasıyla entegre olur. 3 günlük ücretsiz deneme mevcuttur — kredi kartı gerekli değildir.
Denemeden sonra: planlar $6.99/aydan başlar.
Sık Sorulan Sorular
Whisper, normal bir Windows PC’de gerçek zamanlı olarak yazıya çeviriyor mu? Tam doğrulukla gerçek zamanlı değil — Whisper bir toplu modeldir. Orta seviye bir GPU’da (RTX 3060) küçük veya orta model, 1 saatlik bir toplantıyı arama sona erdikten sonra yaklaşık 3-5 dakikada yazıya çevirir. Canlı başlıklar için Whisper Live veya whisper-streaming fork’larını düşünün, ancak gecikmeli için bazı doğrulukları takas ederler.
Bir Zoom veya Teams toplantısını yazıya çevirmek yasal mı? Yasallık yargı yetkisine ve şirket politikasına bağlıdır. Çoğu yerde kaydedilmeden veya yazıya çevrilmeden önce tüm katılımcıları bilgilendirmeniz gerekir. Her zaman toplantı başında notlar için ses kaydedildiğini açıkça ilan edin ve açık onay alın. Bu makale teknik bir kılavuzdur, yasal tavsiye değildir.
Yüklemem gereken düşük gecikmeli ses yakalama geri döngüsü cihazı nedir? Sürücü yüklemesine gerek yok. Düşük gecikmeli ses yakalama geri döngüsü, Windows 10/11 yerli API’sidir ve herhangi bir aktif çıktı cihazını — hoparlörleri veya kulaklıkları — yakalama kaynağı olarak yansıtır. FFmpeg, Python sounddevice ve çoğu ses kütüphanesi bunu doğrudan ortaya çıkarırlar. Sanal kablo veya üçüncü taraf sürücüye gerek yoktur.
Toplantı yazıya çevirme için hangi Whisper modelini kullanmalıyım? medium.en modeli en iyi pratik dengeledir: 1,5 GB VRAM, tiny’e kıyasla yaklaşık %90 kelime hata oranı azalması ve GPU’da large’den 4-6 kat daha hızlı. Yalnızca CPU makineleri için small.en kullanın — modern bir CPU’da 1 saatlik bir toplantıyı yaklaşık 20 dakikada yazıya çevirir. Large-v3 yalnızca RTX 4070 veya daha iyisi varsa anlamlıdır.
GPU olmadan toplantıları yazıya çevirebilir miyim? Evet. Whisper, openai-whisper paketi veya daha hızlı faster-whisper CTranslate2 arka ucu aracılığıyla CPU’da çalışır ve CPU çıkarım süresini yaklaşık yarıya indirir. GPU’da 8 dakika süren bir toplantı, modern bir Intel veya AMD CPU’da small.en ile yaklaşık 20-25 dakika sürer — toplantı sonrası toplu işleme kabul edilebilir.
Yazıya çevirme işleminden eylem maddelerini otomatik olarak nasıl çıkarabilirim? En basit yöntem, Whisper yazısını yerel LLM komutuna (Ollama + llama3 veya Mistral) kanallandıran Python betiğidir ve kararların ve görevlerin maddelenmiş listesi isteyerek. Alternatif olarak ham yazıyı herhangi bir sohbet yapay zekasına yapıştırın. VoxBooster’ın gürültü bastırması, yakalanan ses temiz tutarak yazıya çevirme doğruluğunu doğrudan iyileştirir.
Bu iş akışı Microsoft Teams kaydedilmiş toplantılarıyla çalışıyor mu? Evet, iki şekilde: çağrı sırasında düşük gecikmeli ses yakalama geri döngüsü aracılığıyla canlı sesi yakala veya OneDrive’dan Teams toplantısı kaydını indir ve MP4 dosyasında Whisper’ı çalıştır. İkinci yol daha basittir ve toplantıda kalmadan herhangi bir zaman yazıya çevirebilirsiniz.
Daha Fazla Okuma
- OpenAI Whisper on GitHub — model ağırlıkları, karşılaştırmalar ve kurulum dokümanları
- Zoom Recording and Transcription — Official Help — Zoom’un bulut kayıtlarını nasıl işlediği
- Speech recognition — Wikipedia — ASR teknolojisi ve WER metrik arka planı
- Real-time voice meeting notes with VoxBooster — gerçek zamanlı ses işleme nasıl çalışır
- Best noise suppression for Windows meetings — yerel gürültü bastırma araçlarının karşılaştırması