ملاحظات الاجتماعات الصوتية باستخدام Whisper على Windows

نسخ اجتماعات Zoom و Teams و Meet محليًا على Windows باستخدام Whisper ولقطة صوت بزمن منخفض — بدون رفع سحابي، خصوصية كاملة، ملخصات عناصر العمل في Markdown.

إذا كان كل اجتماع ينتهي بسلسلة بريد إلكترونية تسأل “ماذا قررنا فعلاً؟”، فالمشكلة ليست الاجتماع — بل غياب نص موثوق. تحل خدمات النسخ السحابية هذا جزئيًا، لكنها تتطلب رفع صوت المكالمة إلى خادم تابع لجهة خارجية. لأسباب قانونية أو امتثال أو مجرد خصوصية، قد لا يكون هذا مقبولاً دائمًا.

يوضح هذا الدليل كيفية بناء سير عمل ملاحظات اجتماعات صوتية بالكامل على جهاز الكمبيوتر Windows الخاص بك: التقط صوت الاجتماع باستخدام لقطة صوت منخفضة الزمن، شغله عبر نموذج Whisper من OpenAI محليًا، واستخرج تلقائيًا ملخص Markdown مع القرارات وعناصر العمل. بدون رفع سحابي. بدون اشتراك. يحدث المعالجة على جهازك.


ملخص التنفيذي

الخطوةالأداةالوقت
التقاط الصوتFFmpeg + لقطة صوت منخفضة الزمنمباشر
النسخWhisper (medium.en)~4 دقائق / ساعة اجتماع واحدة
استخراج العناصرPython + LLM محلي أو الصق في ذكاء اصطناعي~2 دقيقة
الإخراجملف Markdown .mdفوري

لماذا النسخ المحلي أفضل من السحابة للاجتماعات

معظم خدمات النسخ السحابية — Otter.ai و Fireflies و Zoom AI Notes المدمجة — تعمل بإرسال صوتك إلى خوادم بعيدة حيث تتم معالجته وغالبًا تخزينه لتدريب النموذج. بالنسبة لمكالمات اللقاء الشخصية فهذا جيد. بالنسبة للمكالمات التي تحتوي على أسماء العملاء والتوقعات المالية والمعلومات الطبية أو النقاش القانوني، فهذا ليس كذلك.

تشغيل Whisper محليًا يعني أن ملف الصوت لا يترك الجهاز أبدًا. لا توجد مفتاحة API مرتبطة بحساب شركتك، لا توجد سياسة استبقاء لقراءتها، ولا احتمال لخرق جهة خارجية يعرض محتوى المكالمة. النص المنسوخ والملخص يعيشان حيثما تحفظهما.

هناك أيضًا حجة التكلفة. النسخ السحابي على نطاق واسع — 100 ساعة من الاجتماعات شهريًا عبر فريق — يكلف 40-200 دولار شهريًا لكل مستخدم على معظم الأنظمة. الاستدلال المحلي على GPU تمتلكه بالفعل لا يكلف شيئًا لكل نص بعد الإعداد.


الشرعية والموافقة — اقرأ هذا أولاً

تسجيل أو نسخ اجتماع بدون موافقة المشارك غير قانوني في العديد من الولايات القضائية، بما في ذلك العديد من الولايات الأمريكية (قوانين الحزب الثنائي)، والاتحاد الأوروبي (مادة GDPR 6)، والآخرين في جميع أنحاء العالم.

قبل أن تنسخ أي اجتماع:

  1. أعلن بوضوح في البداية: “أنا أتقاط صوتًا للنسخ المحلي لإنتاج ملاحظات الاجتماع.”
  2. أعط المشاركين خيار الانسحاب أو التحدث خارج السجل.
  3. تحقق من سياسة تسجيل المكالمات في شركتك — كثيرة تتطلب موافقة تكنولوجيا المعلومات أو القانونية.
  4. قم بتخزين النصوص المنسوخة بأمان وتطبيق نفس قواعد التعامل مع البيانات كمستندات سرية أخرى.

هذه المقالة دليل تقني. إنها ليست نصيحة قانونية.


ما تحتاجه

  • Windows 10 أو 11 — لقطة صوت منخفضة الزمن متاحة على كليهما
  • Python 3.10+ — من python.org أو winget
  • FFmpeg — للتقاط الصوت من جهاز اللقطة
  • openai-whisper أو faster-whisper — محرك النسخ
  • بطاقة رسومات NVIDIA (اختياري لكن موصى به) — RTX 2060 أو أفضل للاستدلال السريع؛ CPU يعمل أيضًا
  • تطبيق اجتماع: Zoom أو Microsoft Teams أو Google Meet أو أي تطبيق ينتج الصوت

الخطوة 1 — تحديد جهاز لقطتك الصوتية منخفضة الزمن

لقطة الصوت منخفضة الزمن تلتقط أي شيء يشغله Windows عبر جهاز الإخراج — نفس الصوت الذي تسمعه في سماعات الرأس. لا يلزم تثبيت برنامج التشغيل؛ فهو جزء من مكدس صوت Windows منذ Vista.

افتح جهاز الطرفية وشغل:

ffmpeg -list_devices true -f dshow -i dummy 2>&1 | findstr /i "audio"

سترى إخراجًا مثل:

"Speakers (Realtek High Definition Audio)" (audio)
"Headphones (USB Audio Device)" (audio)

لاحظ الاسم الدقيق لجهاز الإخراج النشط. لالتقاط اللقطة، أضف (loopback) إلى اسم الجهاز عند استخدامه مع FFmpeg.

بدلاً من ذلك، استخدم Python لسرد الأجهزة:

import sounddevice as sd
print(sd.query_devices())

ابحث عن الأجهزة التي تحتوي على (loopback) في الاسم أو host API low-latency audio capture.


الخطوة 2 — تسجيل صوت الاجتماع

ابدأ اجتماع Zoom أو Teams أو Meet. قبل أن يبدأ المحتوى الرئيسي، ابدأ FFmpeg في جهاز طرفية منفصل:

ffmpeg -f dshow -i audio="Speakers (Realtek High Definition Audio) (loopback)" \
  -ar 16000 -ac 1 -c:a pcm_s16le \
  meeting_2026-06-12.wav

العلامات الأساسية:

  • -ar 16000 — معدل العينة الأصلي لـ Whisper؛ لا يلزم إعادة أخذ العينات
  • -ac 1 — أحادي؛ يقلل حجم الملف ويطابق المدخل المتوقع من Whisper
  • -c:a pcm_s16le — WAV غير مضغوط لأفضل دقة

توقف عن التسجيل عندما ينتهي الاجتماع بـ Ctrl+C. اجتماع مدته ساعة واحدة بهذه الإعدادات ينتج حوالي 115 MB.

نصيحة: إذا كانت جودة الصوت لديك سيئة بسبب الضوضاء الخلفية، فإن تشغيل كبت الضوضاء من VoxBooster على قناة الميكروفون قبل المكالمة يحافظ على صوتك نظيفًا في اللقطة. تلتقط لقطة الصوت منخفضة الزمن المخرجات المختلطة، لذلك يستفيد صوت المشاركين الآخرين من معالجة الضوضاء الخاصة بأنظمتهم.


الخطوة 3 — تثبيت Whisper

إذا لم تقم بتثبيت Whisper بعد:

pip install openai-whisper
# للاستدلال الأسرع على CPU/GPU:
pip install faster-whisper

لتسريع GPU (NVIDIA)، قم أيضًا بتثبيت:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

تحقق من إصدار CUDA أولاً باستخدام nvidia-smi وطابق إصدار cu وفقًا لذلك.


الخطوة 4 — نسخ التسجيل

استخدام openai-whisper (CLI)

whisper meeting_2026-06-12.wav --model medium.en --output_format txt --output_dir ./transcripts

هذا يحفظ ملف .txt وملف .srt. نموذج medium.en خاص باللغة الإنجليزية فقط، وهو أسرع وأكثر دقة للاجتماعات الإنجليزية من النموذج متعدد اللغات medium.

استخدام faster-whisper (نص Python)

from faster_whisper import WhisperModel

model = WhisperModel("medium.en", device="cuda", compute_type="float16")

segments, info = model.transcribe("meeting_2026-06-12.wav", beam_size=5)

with open("transcript.txt", "w", encoding="utf-8") as f:
    for segment in segments:
        timestamp = f"[{segment.start:.1f}s]"
        f.write(f"{timestamp} {segment.text.strip()}\n")

print("Transcription complete.")

استخدم faster-whisper CTranslate2 تحت غطاء المحرك و 2-4 مرات أسرع من الأصلي على نفس الأجهزة.


الخطوة 5 — استخراج عناصر العمل إلى Markdown

النصوص الخام هي جدران من النص. الأثر المفيد هو ملخص منظم: القرارات التي تم اتخاذها والمهام المعينة والأسئلة المفتوحة. إليك نص Python بسيط يستخدم Ollama (LLM محلي) لإنتاج واحد:

import subprocess
import sys

transcript_path = sys.argv[1]

with open(transcript_path, "r", encoding="utf-8") as f:
    transcript = f.read()

prompt = f"""You are a meeting notes assistant. Given the transcript below, produce a Markdown document with:
1. **Meeting Summary** (3-5 sentences)
2. **Decisions Made** (bulleted list)
3. **Action Items** (bulleted list with owner and deadline if mentioned)
4. **Open Questions** (bulleted list)

Transcript:
{transcript}
"""

result = subprocess.run(
    ["ollama", "run", "llama3"],
    input=prompt,
    capture_output=True,
    text=True,
    encoding="utf-8"
)

output_path = transcript_path.replace(".txt", "_summary.md")
with open(output_path, "w", encoding="utf-8") as f:
    f.write(result.stdout)

print(f"Summary saved to {output_path}")

شغله على النحو التالي:

python extract_actions.py transcripts/meeting_2026-06-12.txt

لا توجد Ollama؟ ألصق النص المنسوخ مباشرة في أي ذكاء اصطناعي محادثة مع نفس الموجه. الإخراج متطابق — فقط خطوة الأتمتة تختلف.


دليل اختيار النموذج

النموذجVRAMالسرعة (GPU)السرعة (CPU)الأفضل لـ
tiny.en1 GBسريع جدًا5 دقيقة/ساعةمسودات سريعة، الاختبار
small.en2 GBسريع20 دقيقة/ساعةآلات CPU فقط
medium.en5 GBمتوازن60 دقيقة/ساعةالتوصية الافتراضية
large-v310 GBبطيءغير عمليأقصى دقة، RTX 4070+

جميع النماذج تعمل بالكامل غير متصلة بعد التحميل الأولي.


المقارنة: Whisper المحلي مقابل خدمات النسخ السحابية

الميزةWhisper (محلي)Otter.aiFirefliesZoom AI Notes
البيانات تغادر الجهازلانعمنعمنعم
التكلفة شهريًا$0$10–$20/المستخدم$10–$19/المستخدممدرج في Zoom
الدقة (الإنجليزية)88–94% WER~88%~87%~85%
تمييز الرابطمع pyannoteنعمنعمنعم
المفردات المخصصةعبر الموجهمدفوعمدفوعلا
قادر على العمل بدون اتصالنعملالالا
وقت الإعداد30 دقيقة5 دقائق5 دقائق0 دقيقة

تفوز خدمات السحابة بالراحة والتمييز خارج الصندوق. يفوز Whisper المحلي بالخصوصية والتكلفة بالمقياس والقدرة على العمل بدون إنترنت.


إضافة تمييز المتحدث

لا يحدد Whisper وحده من قال ماذا. للاجتماعات التي يهم فيها النسب، ادمجها مع pyannote.audio:

pip install pyannote.audio
from pyannote.audio import Pipeline

pipeline = Pipeline.from_pretrained(
    "pyannote/speaker-diarization-3.1",
    use_auth_token="YOUR_HF_TOKEN"
)

diarization = pipeline("meeting_2026-06-12.wav")

for turn, _, speaker in diarization.itertracks(yield_label=True):
    print(f"{speaker}: {turn.start:.1f}s – {turn.end:.1f}s")

يمكنك بعد ذلك محاذاة طوابع الوقت المميزة مع طوابع قطاعات Whisper لإنتاج نصوص منسوخة موسومة بالمتحدث. تعمل نماذج pyannote محليًا بعد التحميل — يلزم حساب Hugging Face لقبول ترخيص النموذج، لكن الاستدلال بالكامل غير متصل.


أتمتة خط الأنابيب الكامل

بمجرد أن تعمل الخطوات الثلاث بشكل فردي، قم بسلسلتها في نص واحد يعمل بعد أي اجتماع ينتهي:

# record.bat — شغل أثناء الاجتماع
ffmpeg -f dshow -i audio="Speakers (Realtek High Definition Audio) (loopback)" ^
  -ar 16000 -ac 1 -c:a pcm_s16le ^
  "meetings\%DATE:~10,4%-%DATE:~4,2%-%DATE:~7,2%.wav"
# process.bat — شغل بعد الاجتماع
set FILE=%1
python transcribe.py %FILE%
python extract_actions.py %FILE:.wav=.txt%
start "" "%FILE:.wav=_summary.md%"

شغل process.bat meetings\2026-06-12.wav والملخص ينفتح في محرر Markdown الافتراضي لديك تلقائيًا.


اعتبارات الخصوصية والتخزين

ضع في الاعتبار ما يلي عند تخزين نصوص الاجتماعات:

  • تشفير ملفات WAV والنصوص المنسوخة إذا كانت تحتوي على معلومات تجارية حساسة. يتعامل Windows BitLocker أو VeraCrypt مع هذا على مستوى المجلد.
  • عين سياسة الاحتفاظ — احذف ملفات WAV الخام بعد النسخ؛ احتفظ فقط بالملخص ما لم تحتج إلى اقتباسات حرفية.
  • الأقراص المشتركة: إذا قمت بمزامنة النصوص المنسوخة مع OneDrive أو SharePoint، فتحقق مما إذا كانت هذه الأنظمة تطبق OCR أو فهرسة الذكاء الاصطناعي على المستندات المرفوعة.
  • التحكم في الوصول: قصر ملفات النصوص المنسوخة على المشاركين فقط. يجب ألا يكون مجلد \meetings\ المشترك على محرك الشبكة مفتوحًا لكل الشركة.

CTA ناعم

يضمن كبت الضوضاء من VoxBooster أن قناة الميكروفون الخاصة بك نظيفة قبل أن يصل الصوت إلى لقطة الصوت منخفضة الزمن، مما يحسن معدل الخطأ في الكلمات لـ Whisper على صوتك مباشرة. يعمل محليًا على Windows 10/11، لا يتطلب برامج تشغيل kernel، ويتكامل مع أي تطبيق اجتماع. توجد نسخة تجريبية مجانية لمدة 3 أيام — بدون بطاقة ائتمان مطلوبة.

بعد النسخة التجريبية: تبدأ الخطط من $6.99/الشهر.


الأسئلة الشائعة

هل ينسخ Whisper الاجتماعات في الوقت الفعلي على حاسوب Windows عادي؟ ليس في الوقت الفعلي الحقيقي بدقة كاملة — Whisper هو نموذج دفعي. على بطاقة رسومات متوسطة المدى (RTX 3060) ينسخ نموذج صغير أو متوسط اجتماعًا لمدة ساعة واحدة في حوالي 3-5 دقائق بعد انتهاء المكالمة. للتسميات التوضيحية المباشرة، فكر في Whisper Live أو fork whisper-streaming، على الرغم من أنها تبادل بعض الدقة مقابل الزمن.

هل من القانوني نسخ اجتماع Zoom أو Teams؟ الشرعية تعتمد على الولاية القضائية وسياسة الشركة. في معظم الأماكن يجب إخطار جميع المشاركين قبل التسجيل أو النسخ. أعلن دائمًا في بداية الاجتماع أنك تلتقط صوتًا لملاحظات، واحصل على الموافقة الصريحة. هذه المقالة دليل تقني، وليست نصيحة قانونية.

ما جهاز لقطة الصوت منخفض الزمن الذي أحتاج إلى تثبيته؟ لا يلزم تثبيت برنامج تشغيل. لقطة الصوت منخفضة الزمن هي واجهة برمجية أصلية في Windows 10/11 تعكس أي جهاز إخراج نشط — السماعات أو السماعات الرأسية — كمصدر التقاط. يكشف FFmpeg و Python sounddevice ومعظم مكتبات الصوت عنها مباشرة. لا يلزم كابل افتراضي أو برنامج تشغيل جهة خارجية.

أي نموذج Whisper يجب أن أستخدمه لنسخ الاجتماعات؟ نموذج medium.en هو أفضل توازن عملي: 1.5 GB VRAM، تقليل معدل الخطأ في الكلمات بحوالي 90% مقابل tiny، و 4-6 مرات أسرع من large على GPU. للآلات التي تعمل على CPU فقط استخدم small.en — ينسخ اجتماعًا لمدة ساعة واحدة في حوالي 20 دقيقة على معالج حديث. Large-v3 يكون منطقيًا فقط إذا كان لديك RTX 4070 أو أفضل.

هل يمكنني نسخ الاجتماعات بدون GPU؟ نعم. يعمل Whisper على CPU عبر حزمة openai-whisper أو backend CTranslate2 الأسرع whisper-faster، الذي يقلل وقت استدلال CPU بحوالي النصف. اجتماع سيستغرق 8 دقائق على GPU يستغرق حوالي 20-25 دقيقة على معالج Intel أو AMD حديث مع small.en — مقبول لمعالجة الدفعة بعد الاجتماع.

كيف أستخرج عناصر العمل تلقائيًا من النص المنسوخ؟ الطريقة الأبسط هي نص Python يوجه النص المنسوخ من Whisper إلى موجه LLM محلي (Ollama + llama3 أو Mistral) يطلب قائمة من القرارات والمهام. بدلاً من ذلك، ألصق النص الخام المنسوخ في أي ذكاء اصطناعي محادثة. يحافظ VoxBooster على قناة الميكروفون الخاصة بك نظيفة من قمع الضوضاء، مما يحسن مباشرة دقة النص المنسوخ.

هل يعمل سير العمل هذا مع اجتماعات Microsoft Teams المسجلة؟ نعم، بطريقتين: التقط الصوت المباشر عبر لقطة الصوت منخفضة الزمن أثناء المكالمة، أو حمل تسجيل اجتماع Teams من OneDrive وشغل Whisper على ملف MP4. المسار الثاني أبسط ويسمح لك بإعادة نسخ في أي وقت بدون البقاء في الاجتماع.


قراءة إضافية

جرّب VoxBooster — 3 أيام مجاناً.

استنساخ الصوت الفوري، لوحة الأصوات والمؤثرات — أينما تتحدث.

  • بدون بطاقة
  • ~30ms تأخير
  • Discord · Teams · OBS
جرّب 3 أيام مجاناً