AI-translated from English; not yet reviewed by a fluent editor.
# تُطلق NVIDIA نموذج Nemotron 3 Diarization لتمييز ما يصل إلى ثمانية متحدثين في الصوت
> يضع نموذج NVIDIA المفتوح الأوزان لتمييز المتحدثين، الصادر في 23 سبتمبر، تسميات لما يصل إلى ثمانية متحدثين في الصوت المسجل أو المتدفق. ويقيس أقصر إعداد توصي به الشركة، ومدته 0.32 ثانية، صوتًا مُخزّنًا مؤقتًا؛ أما أرقام الدقة فمستمدة من اختبارات NVIDIA نفسها.
By BIG CHANGE Editorial
Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

AI-generated conceptual illustration by BIG CHANGE.
أصدرت NVIDIA نموذج [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) في 23 سبتمبر. ويحدّد هذا النموذج المفتوح الأوزان، الذي يضم نحو 100 مليون معلمة، أوقات حديث كل واحد من ثمانية متحدثين كحد أقصى، سواء في الصوت المسجل أو المتدفق. ويوفر للمطورين نشاط المتحدثين والطوابع الزمنية للمحادثة؛ أما إنتاج نص يتضمن الكلمات فيتطلب أيضًا نظامًا للتعرف على الكلام.
## التغيير الأبرز
- **ما الذي تغيّر:** يدعم إصدار Sortformer السابق من NVIDIA، المخصص للبث، أربعة متحدثين. أما هذا الإصدار فيوفر قنوات لثمانية متحدثين، مرتبة بحسب ظهورهم، انطلاقًا من نقطة تحقق واحدة تعمل مع الصوت المسجل والكتل الصوتية الواردة.
- **لماذا يهم ذلك:** يستطيع المطور الذي يبني نظامًا لتفريغ الاجتماعات أو المكالمات استخدام النموذج لإسناد تسميات عامة للمتحدثين إلى فترات زمنية، بما في ذلك الكلام المتداخل، ثم دمج تلك الفترات مع الكلمات الناتجة من نظام تعرّف مستقل. ويزيد الإصدار الحد الموثق لعدد المتحدثين في هذه المهمة.
- **ما الذي ينبغي متابعته:** يتعلق القرار العملي بمقدار الصوت الذي ينبغي تخزينه مؤقتًا قبل كل نتيجة للبث. فأقصر إعداد توصي به NVIDIA ينتظر 0.32 ثانية من الصوت قبل بدء الحساب، وتُظهر جداول الدقة الخاصة بها أن استخدام هذا الإعداد له كلفة. ولا تزال الفرق بحاجة إلى قياس أداء المسار الكامل على تسجيلاتها.
## ما الذي يعيده النموذج
تحدد [بطاقة النموذج](https://huggingface.co/nvidia/Nemotron-3-Diarization) صوتًا أحادي القناة بتردد 16 كيلوهرتز. وتذكر ملفات WAV وFLAC وOpus وMP3، كما تقبل واجهة NeMo مسارات الملفات أو مصفوفات الصوت أو ملف بيان JSON مفصولًا بأسطر. ويجب تمرير معدل أخذ العينات الصحيح مع مصفوفات الصوت إلى الدالة `diarize()`. ولا تضع البطاقة حدًا أقصى ثابتًا لمدة التسجيل للاستدلال على كتل صوتية.
يحوّل النموذج الصوت إلى `[T, 8]` من احتمالات نشاط المتحدثين، بخطوة إخراج افتراضية مقدارها 10 مللي ثوانٍ. ويمكن تنشيط قنوات متعددة في الوقت نفسه عند تداخل المتحدثين. وتحول المعالجة اللاحقة هذه الاحتمالات إلى فترات ذات أوقات بداية ونهاية وتسميات عامة للمتحدثين. وتتبع التسميات ترتيب ظهور الأصوات أول مرة؛ ولا تحدد هوية الأشخاص بأسمائهم. وتستخدم NVIDIA ذاكرة مؤقتة للمتحدثين في الكتل السابقة، وقائمة انتظار «الأول دخولًا، الأول خروجًا» للإطارات الحديثة، كي يحتفظ نموذج البث بالسياق.
وهذا التمييز مهم للمطور الذي يحتاج إلى نص مفرغ يحمل علامات للمتحدثين. [يوائم دليل التكامل من NVIDIA](https://huggingface.co/blog/nvidia/nemotron-diarization) الطوابع الزمنية لتمييز المتحدثين مع مخرجات مستقلة للتعرف الآلي على الكلام. وتترك قاعدة نقطة المنتصف في المثال كلمةً بلا إسناد عند غياب متحدث نشط، وتضع علامة على النشاط المتزامن بوصفه ملتبسًا. ولا يقرر نموذج تمييز المتحدثين وحده أي صوت متداخل نطق كلمة تم التعرف عليها.

## زمن التخزين المؤقت ليس زمن الاستجابة
تسرد NVIDIA إعدادات موصى بها لمخزن الإدخال المؤقت: 30.4 و1.04 و0.64 و0.32 ثانية. ويتكون إعداد 0.32 ثانية من ثلاثة إطارات معالجة مدة كل منها 80 مللي ثانية، وإطار واحد مدته 80 مللي ثانية للسياق اللاحق. وتعرّف [البطاقة زمن الانتقال صراحةً](https://huggingface.co/nvidia/Nemotron-3-Diarization) بأنه الصوت المحتجز قبل الاستدلال، مع استبعاد وقت الحساب. وسيضيف نظام التفريغ النصي أيضًا زمن التعرف والنقل والتطبيق.
يتطلب المسار الموثق عبر NeMo إصدار Python 3.12 أو أحدث، وCython، وإصدارًا حديثًا من PyTorch، وحزمة NeMo Speech. وتوفر NVIDIA `SortformerEncLabelModel.from_pretrained()` مثالًا، واستدعاءً `diarize()` يعيد مقاطع المتحدثين، وخيارًا لتضمين موترات الاحتمالات. وتذكر البطاقة أن تحميل نقطة التحقق المستضافة عبر استدعاء NeMo يتطلب رمز Hugging Face. كما تعرض واجهة Transformers للاستدلال دون اتصال وبالبث، مع التثبيت من مستودع مصدر Transformers، إضافة إلى مسار سطر أوامر [NeMo-Speech.cpp](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md). وهذه واجهات موثقة، ولم تشغّلها BIG CHANGE. وتسرد بطاقة النموذج أنظمة Linux وعائلات وحدات معالجة الرسوميات NVIDIA Ampere وHopper وBlackwell لتكامل NeMo. وتتوقف متطلبات الأجهزة وتكلفة المعالجة لحمل عمل معين على المسار والجهاز المختارين؛ ولا تحدد NVIDIA في البطاقة سعر تشغيل لكل ساعة.
تُتاح الأوزان بموجب ترخيص [OpenMDW 1.1](https://openmdw.ai/license/1-1/). ويمنح الترخيص حق الاستخدام والتعديل والتوزيع من دون رسوم ترخيص، مع مراعاة شروطه. ويجب عند التوزيع الاحتفاظ بالترخيص وإشعارات المصدر المنطبقة. ولا يقيّد الترخيص استخدام المخرجات أو مشاركتها، كما يحمل المستخدمين مسؤولية تأمين الحقوق والموافقات اللازمة لصوتهم. وتقول NVIDIA إن النموذج متاح للاستخدام التجاري وغير التجاري.
## ما الذي قاستْه NVIDIA
تقارن [تقييمات بطاقة النموذج](https://huggingface.co/nvidia/Nemotron-3-Diarization) بين Nemotron 3 وإصدار Sortformer v2.1 السابق من NVIDIA، الذي يدعم البث وأربعة متحدثين. وعلى مجموعة التقييم الكاملة DIHARD III، تسجل NVIDIA معدل خطأ في تمييز المتحدثين قدره 13.18% لنموذج Nemotron 3 عند إعداد مخزن الإدخال المؤقت البالغ 1.04 ثانية، مقابل 19.60% للنموذج السابق عند الإعداد نفسه. وعند 0.32 ثانية، تبلغ نتيجة Nemotron 3 نحو 13.55%. ويجمع معدل الخطأ الكلام الفائت والإنذارات الكاذبة والالتباس بين المتحدثين، مقسومًا على زمن المتحدثين في المرجع. والأقل أفضل.
ترتبط هذه الأرقام ببروتوكول محدد. وتقول NVIDIA إن جميع تقييماتها تحتسب الكلام المتداخل. وتستخدم DIHARD III هامشًا صفريًا عند حدود المقاطع، بينما تستخدم CALLHOME-Part2 هامشًا قدره 0.25 ثانية. وبالنسبة إلى AMI وAliMeeting وNOTSOFAR1، تستخدم NVIDIA تعليقات مرجعية مرتبطة ومُحاذاة قسرية بدلًا من تسميات المقاطع الأصلية؛ فتغيير تلك التسميات يغيّر الدرجات. وتحدد [تعليمات التقييم](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) نص NeMo البرمجي، وتشترط ملف RTTM مرجعيًا وإعدادات التداخل والهامش والبث والمعالجة اللاحقة لإجراء مقارنة قابلة للتكرار. واستخدمت نتائج NVIDIA لسرعة الاستدلال تنسيق BF16 على وحدة RTX PRO 5000، مع وبدون `torch.compile()`. وهذه اختبارات أبلغت عنها الشركة، وليست إعادة إنتاج أجرتها BIG CHANGE.
ولا يزال الحد الأقصى البالغ ثمانية متحدثين مهمًا. فبعض تسجيلات DIHARD III موسوم بما يصل إلى تسعة متحدثين، وتذكر البطاقة أن الكلام الذي يتجاوز القنوات الثماني للنموذج قد يفوت أو يُسند إلى قناة أخرى. وفي تسجيلات اختبار AMI، تسجل NVIDIA معدل خطأ أقل لتمييز المتحدثين في Nemotron 3 مقارنة بخط الأساس السابق، لكن دقته في تحديد العدد الدقيق للمتحدثين أقل. لذلك تعتمد الدقة على المهمة والمقياس، وكذلك على الصوت. ويمكن للفريق الذي يدرس دمج النموذج أن يبدأ من الواجهات المنشورة لدى NVIDIA، ثم يختبر المسار الكامل للمتحدثين والكلمات على تسجيلات تشبه الاستخدام المقصود.
## Sources
- [NVIDIA: بطاقة نموذج Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) — المواصفات الأساسية لتاريخ الإصدار والحجم من فئة 100 مليون معلمة والمدخلات والمخرجات وإعدادات البث وجداول تقييم NVIDIA. وقد أبلغت الشركة عن قياسات الدقة والسرعة؛ ويشير إعداد 0.32 ثانية المذكور إلى زمن تخزين الإدخال مؤقتًا ويستبعد الحساب.
- [NVIDIA: مقال الإطلاق «اعرف من تحدث ومتى»](https://huggingface.co/blog/nvidia/nemotron-diarization) — يشرح تقرير الإطلاق المؤرخ قنوات المتحدثين المرتبة بحسب وقت ظهورهم، ويبين كيف يمكن دمج فترات المتحدثين العامة مع مخرجات مستقلة للتعرف الآلي على الكلام. ويضع مثال المطابقة عند نقطة المنتصف علامة على التداخل بوصفه ملتبسًا؛ وهي قاعدة إرشادية بسيطة وليست نتيجة تفريغ نصي تم التحقق منها.
- [NVIDIA: بطاقة التقييم لتمييز المتحدثين](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — تحدد نص NeMo المستخدم للتقييم، ومتطلب ملف RTTM المرجعي، ودلالات التداخل والهامش، والحقول اللازمة للإبلاغ عن معدل خطأ قابل للمقارنة في تمييز المتحدثين. وهي وثيقة بروتوكول، لا إعادة تقييم مستقلة.
- [اتفاقية ترخيص OpenMDW، الإصدار 1.1](https://openmdw.ai/license/1-1/) — الإذن والالتزامات النافذة: استخدام مواد النموذج وإعادة توزيعها مجانًا بموجب الشروط، والاحتفاظ بالترخيص وإشعارات المصدر عند التوزيع، وعدم فرض قيود على المخرجات المولدة، ومسؤولية المستخدم عن الحقوق والموافقات اللازمة.
- [دليل سطر الأوامر NeMo-Speech.cpp من NVIDIA](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — يوثق الدليل تشغيل تمييز المتحدثين محليًا عبر واجهة سطر الأوامر، والفرق بين حد الإصدار السابق V2 البالغ أربعة متحدثين وحد V3 البالغ ثمانية. ولا يثبت دعم الواجهة أن غرفة الأخبار شغّلت النموذج، ولا يثبت سرعة معيار NeMo الواردة في البطاقة.
نشرة BIG CHANGE البريدية
الصورة الأوسع. على وتيرتك.
قصص حديثة عن الذكاء الاصطناعي والروبوتات، وتحولات تستحق المتابعة، وأفكار عملية للتطبيق. اختر موجزًا يوميًا أو خلاصة أسبوعية أو رؤية شهرية.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
خصوصيتك، خيارك.
يساعد التخزين الضروري على حماية الموقع وتذكّر خياراتك. تظل Google Analytics الاختيارية متوقفة حتى تسمح بها. يمكنك قراءة كل قصة باستخدام التخزين الضروري فقط. تفاصيل الخصوصية