تحويل الكلام إلى نص الفوري عبر Whisper على Windows يحول النموذج من أداة دفعية غير متصلة إلى محرك نسخ حي - محلي وخاص وكافٍ من الدقة لكتابة دفق مباشر أو نسخ اجتماع أو تغذية سير عمل الأوامر الصوتية بدون إرسال بايت واحد إلى السحابة.
يغطي هذا الدليل: كيفية عمل استدلال Whisper الفوري تحت الغطاء، متطلبات الأجهزة لكل حجم نموذج، ثلاث مسارات نشر عملية، التقاط الصوت منخفض الكمون الخاص بـ Windows وتوجيه الصوت، وكيف يدمج VoxBooster Whisper مباشرة في خط الأنابيب الصوتي الخاص به.
لماذا Whisper الفوري مختلف عن Whisper غير المتصل
تصف ورقة Whisper الأصلية نموذج تسلسل إلى تسلسل تم تدريبه على 680,000 ساعة من الصوت. تعطيه ملفًا؛ يعيد إليك نصًا. هذا ممتاز للمعالجة اللاحقة ولكنه عديم الفائدة إذا كنت تحتاج إلى ظهور تسميات توضيحية في غضون ثانية من الكلام.
يقسم Whisper الفوري تدفق الميكروفون إلى نوافذ متداخلة - عادةً 1-3 ثواني. تمر كل نافذة عبر النموذج بشكل مستقل والنتائج مطبوعة قبل العرض. المقايضة هي أن النموذج لا يرى سياق الجملة الكاملة أبدًا، مما يقدم “هلوسات” عرضية في حدود النافذة. يقلل Whisper-large-v3 هذا بشكل كبير من خلال التعامل مع قطاعات الصوت القصيرة بقوة أكبر من الإصدارات السابقة.
العامل الحرج الآخر هو كاشف نشاط الصوت (VAD). بدون VAD، يعمل Whisper على الصمت وينتج نصًا وهميًا. Silero VAD هو المعيار الحالي - فهو يضمن أن الاستدلال يطلق فقط عند وجود كلام، مما يقلل الكمون وحمل المعالج / وحدة معالجة رسومات بنسبة 40-70% في الاستخدام النموذجي.
متطلبات الأجهزة
مسار وحدة معالجة الرسومات (موصى به)
| النموذج | ذاكرة الفيديو المطلوبة | كمون RTX 3060 النموذجي |
|---|---|---|
| tiny | 1 غيغابايت | ~50ms |
| small | 2 غيغابايت | ~80ms |
| medium | 4 غيغابايت | ~150-250ms |
| large-v3 | 6 غيغابايت | ~200-350ms |
بالنسبة لمعظم حالات استخدام النسخ - التسميات التوضيحية للإمكانية الوصول وملاحظات الاجتماع وتسميات الدفق - يحقق Whisper-medium على بطاقة 4 غيغابايت النقطة الحلوة بين الدقة والكمون.
مسار المعالج
الاستدلال على المعالج فقط قابل للعمل فقط للنماذج الصغيرة والصغيرة جدًا. توقع 500 ميلي ثانية-ثانيتين من الكمون، وهو ملحوظ لكن محتمل للاستخدام غير التفاعلي مثل نسخ الاجتماع المعاد تشغيله لاحقًا. بالنسبة للتسميات التوضيحية الحية أثناء محادثة، سينتج الاستخدام على المعالج فقط تأثير تأخير يشعر بأنه مكسور.
أجهزة صوتية
أي ميكروفون يعمل، لكن جودة الإشارة تؤثر بشكل مباشر على دقة النسخ. تم تدريب Whisper على ظروف صوتية متنوعة، لذا فهو يتعامل مع الضوضاء بشكل معقول، لكن سماعة الرأس ذات الميكروفون القريب من الكلام ستتفوق دائمًا على ميكروفون مكتب بعيد المدى للاستخدام الفوري. إن قمع الضوضاء المطبق قبل مدخل Whisper يساعد على حساب إضافة مرحلة معالجة إلى السلسلة الخاصة بك.
التقاط الصوت منخفض الكمون توجيه الصوت على Windows
يسير Windows بالصوت عبر Windows Audio Session API (التقاط الصوت منخفض الكمون). فهم التقاط الصوت منخفض الكمون ضروري لإعداد Whisper بشكل صحيح، خاصة إذا كنت تريد نسخ إخراج النظام (ما تسمعه) بدلاً من مدخل الميكروفون، أو إذا كنت تريد تغذية الصوت المعالج بعد المعالجة إلى Whisper.
الوضع الحصري مقابل الوضع المشترك
يمنح الوضع الحصري تطبيقًا واحدًا وصول أجهزة مباشر بحد أدنى من الكمون لكنه يقفل الآخرين جميعًا. الوضع المشترك يسمح لعدة تطبيقات بمشاركة نفس نقطة النهاية مع التعامل مع Windows. بالنسبة لالتقاط مدخل Whisper، الوضع المشترك صحيح دائمًا تقريبًا - تريد Whisper للقراءة من نفس تدفق الميكروفون الذي تستخدمه التطبيقات الأخرى، بدون حظر أي شيء.
التقاط مدخل الميكروفون
مكتبات Python مثل sounddevice و pyaudio تصل إلى نقاط النهاية من التقاط الصوت منخفض الكمون حسب فهرس الجهاز. قم بتشغيل ما يلي لسرد جميع أجهزة الصوت المتاحة:
import sounddevice as sd
print(sd.query_devices())
سيظهر الميكروفون الخاص بك كجهاز إدخال. لاحظ الفهرس - ستمرره كمعامل device عند فتح تدفق الصوت.
التقاط الحلقة (صوت النظام)
لنسخ ما يتم تشغيله من خلال السماعات - مكالمة فيديو أو لعبة أو أي صوت تطبيق - استخدم التقاط صوت منخفض الكمون الحلقة. في sounddevice, set low-latency audio capture_exclusive=False والهدف هو الجهاز الناتج؛ تتعامل المكتبة مع الحلقة داخليًا على Windows. مفيد لكتابة المؤتمرات بالفيديو أو أي سير عمل إمكانية الوصول يتطلب تسميات توضيحية على كل صوت الكمبيوتر الشخصي.
ثلاثة مسارات النشر
المسار 1: faster-whisper + البرنامج النصي Python المخصص
faster-whisper هو إعادة تنفيذ قائمة على CTranslate2 من Whisper التي تعمل 4 مرات أسرع من النسخة الأصلية بمعدل استخدام أقل للذاكرة. يدعم جميع أحجام النموذج والتكاملات بنظافة مع حلقة صوت فوري.
الإعداد:
pip install faster-whisper sounddevice numpy silero-vad
الحلقة الأساسية هي:
- افتح تدفق صوت مع
sounddeviceعند 16 كيلو هرتز mono (معدل العينة الأصلي لـ Whisper) - مخزن مؤقت الصوت الوارد إلى نافذة متدرجة
- تشغيل Silero VAD؛ تخطي الاستدلال إذا لم يتم اكتشاف الكلام
- مرر قطاعات الكلام إلى طريقة
transcribe()الخاصة بـfaster-whisperمعbeam_size=1(أسرع) أوbeam_size=5(أكثر دقة) - اطبع أو أنابيب النتيجة
يوفر هذا المسار الحد الأقصى من التحكم ولكنه يتطلب راحة Python. ميزانية 30-60 دقيقة ضبط أحجام المخزن المؤقت وعتبات VAD للميكروفون الخاص بك.
المسار 2: whisper.cpp
whisper.cpp هو ميناء C++ من Whisper الذي يتجميع إلى ثنائي Windows أصلي مع دعم CUDA. يأتي مع عرض توضيحي في الوقت الفعلي (stream.exe) الذي يفتح الميكروفون ويشغل الاستدلال بأحجام نوافذ قابلة للتكوين ويطبع الإخراج على stdout.
لماذا تستخدم هذا على Python؟ وقت البدء قريب من الفوري (لا يوجد مفسر Python للتحميل)، واستخدام الذاكرة أقل، وينضم بسهولة إلى سلاسل أدوات غير Python. يمكن إعادة توجيه إخراج البث إلى ملف تقرأه OBS كمصدر عنوان مباشر.
خطوات الإنشاء (PowerShell):
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
cmake -B build -DGGML_CUDA=1
cmake --build build --config Release
.\build\bin\Release\stream.exe -m models\ggml-large-v3.bin -t 8
المسار 3: Whisper المدمج VoxBooster
يأتي VoxBooster مع استدلال Whisper مدمج مباشرة في التطبيق - لا توجد بيئة Python منفصلة، لا إعداد CUDA يدوي. يعمل النموذج محليًا على وحدة معالجة الرسومات الخاصة بك عبر خلفية محسّنة، ويتم التعامل مع التقاط الصوت منخفض الكمون بشكل داخلي، والإخراج متاح كطبقة إضافية أو ملف عنوان مباشر لـ OBS أو إدخال منخفض الكمون لمعالجة الأوامر الصوتية.
الفرق الرئيسي عن إعدادات Python اليدوية هو مرحلة قمع الضوضاء المدمجة. يمر الصوت عبر طبقة قمع VoxBooster قبل الوصول إلى مخزن Whisper المؤقت، والذي يحسن دقة ملحوظة في البيئات الضوضائية - ضوضاء مراوح سماعة الرأس، التكييف والتبريد، نقرات لوحة المفاتيح - بدون إضافة كمون مرئي للمستخدم. الكمون الشامل من الكلام إلى العنوان المعروض أقل من 300 ميلي ثانية على الأجهزة من السنوات الثلاث الماضية.
لا يتم تثبيت برنامج تشغيل kernel، مما يعني عدم وجود رفع UAC وعدم وجود تضارب مع برنامج anti-cheat وعدم ظهور جهاز في Device Manager. تتصل خطافات التقاط الصوت منخفض الكمون على مستوى الجلسة وتفكك بنظافة عند إغلاق التطبيق.
التسميات التوضيحية المباشرة للبث والإمكانية الوصول
تكامل OBS
سواء كنت تستخدم faster-whisper أو whisper.cpp أو VoxBooster، فإن نقطة التكامل مع OBS هي ملف نصي يتحدث في الوقت الفعلي.
- قم بتكوين أداة Whisper الخاصة بك لكتابة إخراج النسخ إلى ملف (على سبيل المثال،
C:\captions\live.txt) - في OBS، أضف مصدر نص (GDI+)
- تحقق من قراءة من ملف وأشر إليه بنفس المسار
- يستطلع OBS الملف ويحدث المصدر كل إطار
قم بتصميم مصدر النص برفع خلفية شفافة نسبيًا لإبقاؤه مقروءًا فوق لعبة أو لقطات ويب كام.
حالات استخدام إمكانية الوصول
بالنسبة للمستخدمين الذين يعانون من ضعف السمع، توفر تسميات Whisper على Windows عدة مزايا على Windows 11 Live Captions:
- دقة أعلى للمفردات التقنية والنبرات القوية واللغات غير الإنجليزية
- عرض قابل للتخصيص: حجم الخط والموضع واللون والثبات
- إدخالات متعددة: إطعام كل من الميكروفون والحلقة إلى نفس مثيل Whisper
- غير متصل تماما: لا يوجد اعتماد على خوادم التعرف على الكلام من Microsoft
بالنسبة لمستخدمي Windows 10 بدون إمكانية الوصول إلى Live Captions، فإن Whisper المحلي هو خيار إمكانية الوصول الفوري الأساسي الذي لا يتطلب اشتراكًا.
سير عمل أوامر صوتية
Whisper تحويل الكلام إلى نص دقيق بما فيه الكفاية لتشغيل أنظمة أوامر صوتية محيطة - أسلاليب عمل حيث تتحدث الأوامر إلى جهاز الكمبيوتر الخاص بك بدون الضغط على مفتاح أو الضغط على زر.
عادةً ما تبدو العمارة مثل هذا:
الميكروفون → فلتر VAD → Whisper → مخزن مؤقت نصي → محلل نية → مرسل إجراء
يمكن أن يكون محلل النية بسيطًا مثل قاموس Python للعبارات المحفزة المعينة لاستدعاءات subprocess.run()، أو متطورًا مثل نموذج لغة محلي يتعامل مع الأوامر بلغة طبيعية. بالنسبة للألعاب وإنشاء المحتوى، الأوامر الشائعة هي:
- بدء/إيقاف التسجيل
- مشاهد OBS التبديل
- تشغيل مقاطع لوحة الصوت
- كتم / إلغاء كتم الميكروفون
لأن Whisper محلي، لا توجد كمون رحلة الذهاب والإياب بالسحابة. القيد هو وقت الاستدلال: Whisper-medium يستغرق 150-250 ميلي ثانية لكل قطعة - غير محسوس للبث، على الحدود للتحكم في الألعاب في الوقت الفعلي. يمكن لكاشف الكلمات الرئيسية مثل openwakeword العمل كمسار سريع للأوامر الشائعة (أقل من 50 ميلي ثانية)، مع التعامل مع كل شيء آخر في Whisper.
الدقة: ما يمكن توقعه
يحقق Whisper-large-v3 حول 3-5% معدل خطأ الكلمة على صوت إنجليزي نظيف - قابل للمنافسة مع الخدمات السحابية التجارية. في الوضع الفوري مع نوافذ 1-3 ثانية، توقع 5-8% WER بسبب السياق المخفض لكل استدلال استدعاء.
عوامل تحسن الدقة:
- وضع الميكروفون الأفضل: قريب من الكلام سماعة الرأس مقابل ميكروفون مكتب بعيد المدى هي بسهولة فرق 2-3% WER
- قمع الضوضاء قبل الإدخال: المرشحات المسبقة تقلل من الهلوسات التي تسببها الضوضاء الخلفية
- حجم الشعاع: الزيادة من 1 إلى 5 تحسن الدقة على حساب ~50ms كمون إضافي لكل قطعة
- درجة الحرارة: إعداد
temperature=0(فك التشفير الجشع) يقلل التباين في الإخراج ويمنع النموذج من “الهلوسة” المبدعة النسخ الغامضة للصوت
عوامل تؤثر على الدقة:
- تقسيم حد النافذة: الكلمات التي تقع بالضبط على الحد بين نوافذ الاستدلال معرضة للأخطاء - يقلل المخزن المؤقت للتداخل هذا
- هلوسات الصمت: بدون VAD، غالبًا ما ينسخ Whisper الصمت كعبارات فيلر - تشغيل VAD دائمًا
- فجوة الضبط الدقيق: لم يتم تدريب Whisper الفانيليا على تعليقات الألعاب أو النبرات الإقليمية الثقيلة - توقع المزيد من الأخطاء هناك
الاختيار بين Whisper الفوري و Windows 11 Live Captions
| معيار | Windows 11 Live Captions | Whisper المحلي |
|---|---|---|
| وقت الإعداد | ~90 ثانية | 15-60 دقيقة |
| الدقة (تنظيف EN) | جيد | ممتاز (large-v3) |
| الدقة (النبرات / المصطلحات) | عادل | جيد-ممتاز |
| دعم اللغات | 30+ لغة | 99 لغة |
| كمون | 200-400ms | 150-800ms (GPU-dependent) |
| تكامل OBS | لا أحد | إخراج الملف |
| غير متصل | نعم | نعم |
| دعم Windows 10 | لا | نعم |
| الخصوصية | المحلية (Microsoft) | محلي تماما |
| تكلفة الأجهزة | لا أحد | وحدة معالجة الرسومات تساعد بشكل كبير |
إذا كنت على Windows 11 وتحتاج فقط إلى تسميات توضيحية باللغة الإنجليزية للإمكانية الوصول بحد أدنى من الإعداد، فإن Live Captions هي الإجابة الصحيحة. إذا كنت بحاجة إلى دعم Windows 10، أو دقة أعلى في مجالات محددة، أو كتابة OBS، أو أوامر صوتية، أو التحكم في خط أنابيب النسخ، فإن Whisper المحلي هو الخيار الأفضل.
البدء اليوم
المسار الأسرع لتحويل الكلام إلى نص الفوري عبر Whisper:
-
مع VoxBooster: فتح التطبيق، انتقل إلى الإعدادات → النسخ، تمكين Whisper، تحديد حجم النموذج. كل شيء آخر يتم التعامل معه تلقائيًا بما في ذلك توجيه الصوت و VAD وملف إخراج OBS.
-
faster-whisper اليدوي:
pip install faster-whisper sounddevice silero-vad، ثم قم بتكييف أحد أمثلة البث من faster-whisper GitHub. توقع 30 دقيقة للحصول على نموذج أولي عامل. -
whisper.cpp: استنساخ وتجميع مع CUDA وتشغيل
stream.exe. إعداد أسرع بين المسارات اليدوية إذا كنت مرتاحًا مع CMake.
Whisper الفوري على Windows لم يعد تجريبي. مع النموذج الصحيح ووحدة معالجة رسومات متوسطة المدى وإدخال صوت نظيف، تحصل على جودة نسخ وكمون يتطابق أو يتفوق على الخدمات السحابية التجارية - بدون أي من الكلام الخاص بك يترك الجهاز.