دنیا ٹھہری نہیں ہے۔RSS
BIG CHANGE.

Markdown ایڈیشن

AI-translated from English; not yet reviewed by a fluent editor.

# NVIDIA نے آٹھ افراد کی گفتگو والی آڈیو کے لیے Nemotron 3 Diarization جاری کیا

> NVIDIA کا 23 ستمبر کو جاری کردہ اوپن ویٹ ڈائریائزیشن ماڈل ریکارڈ شدہ یا رواں آڈیو میں آٹھ تک بولنے والوں کے لیبل لگاتا ہے۔ اس کی تجویز کردہ سب سے مختصر 0.32 سیکنڈ کی ترتیب بفر میں رکھی گئی آڈیو کا وقت ناپتی ہے، جبکہ درستگی کے اعداد NVIDIA کے اپنے ٹیسٹوں سے آئے ہیں۔

By BIG CHANGE Editorial

Published: 2026-09-27T15:28:31.966Z
Updated: 2026-09-27T15:28:31.966Z
Canonical: https://bigchange.ai/blog/nvidia-nemotron-3-speaker-diarization-model

![Conceptual charcoal illustration of three people around a meeting table, with two speaking and a small unbranded audio recorder between them.](https://bigchange.ai/api/media/file/nemotron-conversation-hero-v2.png)
AI-generated conceptual illustration by BIG CHANGE.

NVIDIA نے [Nemotron 3 Diarization](https://huggingface.co/nvidia/Nemotron-3-Diarization) 23 ستمبر کو جاری کیا۔ تقریباً 100 ملین پیرامیٹرز والا یہ اوپن ویٹ ماڈل ریکارڈ شدہ یا رواں آڈیو میں آٹھ تک بولنے والوں کی گفتگو کے وقت کی نشان دہی کرتا ہے۔ یہ ڈویلپرز کو گفتگو کے لیے بولنے والے کی سرگرمی اور ٹائم اسٹیمپس دیتا ہے؛ الفاظ سمیت ٹرانسکرپٹ بنانے کے لیے الگ سے تقریر کی شناخت درکار ہے۔

## بڑی تبدیلی

- **کیا بدلا ہے:** NVIDIA کا پچھلا رواں Sortformer چیک پوائنٹ چار بولنے والوں کی معاونت کرتا تھا۔ اس ریلیز میں ایک ہی چیک پوائنٹ سے آمد کی ترتیب کے مطابق آٹھ بولنے والوں کے چینل ملتے ہیں، جو ریکارڈ شدہ آڈیو اور آنے والے حصوں دونوں کے ساتھ کام کرتا ہے۔
- **یہ کیوں اہم ہے:** میٹنگ یا کال کے ٹرانسکرپٹ بنانے والا ڈویلپر ماڈل سے وقت کے وقفوں کو عمومی بولنے والے لیبل دے سکتا ہے، بشمول ایک دوسرے پر چڑھی گفتگو کے؛ پھر ان وقفوں کو الگ اسپیچ ریکگنیشن ماڈل کے پہچانے ہوئے الفاظ کے ساتھ جوڑا جا سکتا ہے۔ اس ریلیز نے اس کام کے لیے درج کردہ بولنے والوں کی حد بڑھا دی ہے۔
- **کس بات پر نظر رکھیں:** رواں نتیجہ دینے سے پہلے کتنی آڈیو بفر میں جمع کی جائے، عملی طور پر یہی فیصلہ اہم ہے۔ NVIDIA کی مختصر ترین تجویز کردہ ترتیب میں حساب شروع ہونے سے پہلے 0.32 سیکنڈ کی آڈیو کا انتظار کیا جاتا ہے، اور اس کی اپنی درستگی کی جدولیں اس ترتیب کی قیمت بھی دکھاتی ہیں۔ ٹیموں کو پھر بھی اپنی ریکارڈنگز پر مکمل نظام کی پیمائش کرنی ہوگی۔

## ماڈل کیا نتیجہ دیتا ہے

اس کا [ماڈل کارڈ](https://huggingface.co/nvidia/Nemotron-3-Diarization) 16 kHz اور ایک چینل والی آڈیو مقرر کرتا ہے۔ اس میں WAV، FLAC، Opus اور MP3 فائلیں درج ہیں، جبکہ اس کا NeMo انٹرفیس فائل کے راستے، آڈیو arrays یا سطر بہ سطر JSON manifest قبول کرتا ہے۔ آڈیو arrays کے ساتھ درست sample rate بھی `diarize()` کال کو دینا ضروری ہے۔ کارڈ کے مطابق، حصوں میں کی جانے والی inference کے لیے ریکارڈنگ کی کوئی مقررہ زیادہ سے زیادہ مدت نہیں۔

ماڈل آڈیو کو `[T, 8]` ٹینسر میں بدلتا ہے جو بولنے والوں کی سرگرمی کے امکانات بتاتا ہے؛ ڈیفالٹ آؤٹ پٹ قدم 10 ملی سیکنڈ ہے۔ جب لوگ ایک دوسرے پر بولیں تو کئی چینل بیک وقت فعال ہو سکتے ہیں۔ بعد کی پراسیسنگ ان امکانات کو آغاز اور اختتام کے وقت والے وقفوں اور عمومی بولنے والے لیبلز میں بدلتی ہے۔ یہ لیبل آوازوں کے پہلی بار آنے کی ترتیب کے مطابق ہیں؛ ان سے لوگوں کے نام معلوم نہیں ہوتے۔ رواں ماڈل سیاق برقرار رکھنے کے لیے پہلے حصوں کا speaker cache اور حالیہ فریموں کے لیے پہلے آنے والا، پہلے نکلنے والا قطار نظام استعمال کرتا ہے۔

جس ڈویلپر کو بولنے والوں کے لیبل والا ٹرانسکرپٹ چاہیے، اس کے لیے یہ فرق اہم ہے۔ [NVIDIA کی انٹیگریشن گائیڈ](https://huggingface.co/blog/nvidia/nemotron-diarization) ڈائریائزیشن کے ٹائم اسٹیمپس کو الگ خودکار اسپیچ ریکگنیشن کے نتیجے کے ساتھ جوڑتی ہے۔ اس کی مثال میں درمیانی وقت کا اصول اس لفظ کو بے لیبل چھوڑ دیتا ہے جس وقت کوئی بولنے والا فعال نہ ہو، اور بیک وقت سرگرمی کو مبہم قرار دیتا ہے۔ صرف ڈائریائزیشن ماڈل یہ طے نہیں کرتا کہ پہچانا گیا لفظ ایک دوسرے پر چڑھی آوازوں میں سے کس نے کہا۔

![Illustrative three-row speaker activity timeline. Orange sections align where Speaker 2 and Speaker 3 speak at the same time; no words or measured durations are shown.](/api/media/file/speaker-timeline-inline-v1.png)

## بفر کا وقت، جواب دینے کا وقت نہیں

NVIDIA تجویز کردہ ان پٹ بفر کے لیے 30.4، 1.04، 0.64 اور 0.32 سیکنڈ کی ترتیبات دیتا ہے۔ 0.32 سیکنڈ کی ترتیب میں پراسیسنگ کے تین 80 ملی سیکنڈ فریم اور دائیں جانب سیاق کا ایک 80 ملی سیکنڈ فریم شامل ہے۔ [کارڈ واضح طور پر لیٹنسی کی تعریف کرتا ہے](https://huggingface.co/nvidia/Nemotron-3-Diarization) بطور inference سے پہلے روکی گئی آڈیو؛ اس میں حساب کا وقت شامل نہیں۔ ٹرانسکرپٹ نظام میں شناخت، ڈیٹا کی ترسیل اور ایپلیکیشن کا وقت بھی بڑھ جائے گا۔

دستاویزی NeMo طریقے کے لیے Python 3.12 یا اس کے بعد کا ورژن، Cython، PyTorch کا نیا ورژن اور NeMo Speech درکار ہیں۔ NVIDIA ایک `SortformerEncLabelModel.from_pretrained()` کی مثال، ایک `diarize()` کال بولنے والوں کے حصے واپس کرتی ہے، اور ایک اختیار احتمالی ٹینسر شامل کرتا ہے۔ کارڈ کے مطابق، اس NeMo کال کے ذریعے میزبانی شدہ چیک پوائنٹ لوڈ کرنے کے لیے Hugging Face ٹوکن چاہیے۔ اس میں Transformers کا آف لائن اور رواں انٹرفیس بھی دکھایا گیا ہے، جسے Transformers کے سورس ریپوزٹری سے انسٹال کیا جاتا ہے، نیز [NeMo-Speech.cpp کا کمانڈ لائن طریقہ](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md)۔ یہ دستاویزی انٹرفیس ہیں؛ BIG CHANGE نے انہیں چلایا نہیں۔ کارڈ NeMo انٹیگریشن کے لیے Linux اور NVIDIA Ampere، Hopper اور Blackwell GPU خاندان درج کرتا ہے۔ کسی خاص کام کے لیے ہارڈویئر کی ضرورت اور پراسیسنگ کی لاگت منتخب طریقے اور مشین پر منحصر ہے؛ کارڈ میں NVIDIA نے فی گھنٹہ چلانے کی قیمت نہیں دی۔

ماڈل کے وزن [OpenMDW 1.1](https://openmdw.ai/license/1-1/) لائسنس کے تحت دستیاب ہیں۔ لائسنس اپنی شرطوں کے تابع، لائسنس فیس کے بغیر استعمال، ترمیم اور تقسیم کی اجازت دیتا ہے۔ تقسیم کرتے وقت لائسنس اور قابلِ اطلاق ماخذ کے نوٹس برقرار رکھنا ضروری ہے۔ لائسنس نتائج کے استعمال یا بانٹنے پر پابندی نہیں لگاتا، اور آڈیو کے لیے درکار حقوق اور رضامندیاں حاصل کرنے کی ذمہ داری صارف پر رکھتا ہے۔ NVIDIA ماڈل کو تجارتی اور غیر تجارتی استعمال کے لیے دستیاب قرار دیتا ہے۔

## NVIDIA نے کیا ناپا

NVIDIA کا [ماڈل کارڈ کا جائزہ](https://huggingface.co/nvidia/Nemotron-3-Diarization) Nemotron 3 کا اپنے پہلے چار بولنے والوں والے رواں Sortformer v2.1 سے موازنہ کرتا ہے۔ DIHARD III کے مکمل جائزہ سیٹ پر NVIDIA، 1.04 سیکنڈ کے ان پٹ بفر کی ترتیب میں Nemotron 3 کے لیے 13.18% ڈائریائزیشن ایرر ریٹ بتاتا ہے، جبکہ اسی درج شدہ بفر ترتیب پر پچھلے ماڈل کی شرح 19.60% تھی۔ 0.32 سیکنڈ پر Nemotron 3 کا نتیجہ 13.55% ہے۔ ڈائریائزیشن ایرر ریٹ میں چھوٹی ہوئی گفتگو، غلط الارم اور بولنے والوں میں الجھن کو جمع کرکے حوالہ جاتی بولنے کے وقت سے تقسیم کیا جاتا ہے۔ کم شرح بہتر ہے۔

یہ اعداد ایک متعین پروٹوکول کے تحت حاصل ہوئے۔ NVIDIA کا کہنا ہے کہ اس کے تمام جائزوں میں ایک دوسرے پر چڑھی گفتگو بھی اسکور ہوتی ہے۔ DIHARD III میں حد کے گرد زیرو سیکنڈ کا کالر استعمال ہوتا ہے، جبکہ CALLHOME-Part2 میں 0.25 سیکنڈ کا۔ AMI، AliMeeting اور NOTSOFAR1 کے لیے NVIDIA اصل حصوں کے لیبل کے بجائے باہم منسلک، زبردستی وقت کے مطابق لگائی گئی حوالہ جاتی تشریحات استعمال کرتا ہے؛ یہ لیبل بدلیں تو اسکور بھی بدل جاتے ہیں۔ [جائزے کی ہدایات](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) NeMo اسکرپٹ کی نشان دہی کرتی اور قابلِ موازنہ آزمائش کے لیے حوالہ RTTM فائل، اوورلیپ ترتیب، کالر، اسٹریمنگ ترتیبات اور بعد از پراسیسنگ کی تفصیل مانگتی ہیں۔ NVIDIA نے inference کی رفتار کے نتائج BF16 کے ساتھ RTX PRO 5000 پر، `torch.compile()` کو فعال اور غیر فعال رکھ کر ناپے۔ یہ فروخت کنندہ کی رپورٹ کردہ آزمائشیں ہیں، BIG CHANGE کی جانب سے دہرائی گئی نہیں۔

آٹھ بولنے والوں کی حد پھر بھی اہم ہے۔ DIHARD III میں کچھ ریکارڈنگز پر زیادہ سے زیادہ نو بولنے والوں کی تشریح کی گئی ہے؛ کارڈ کے مطابق ماڈل کے آٹھ چینلز سے زیادہ بولنے کی صورت میں گفتگو چھوٹ سکتی ہے یا دوسرے چینل کو دی جا سکتی ہے۔ AMI کی ٹیسٹ ریکارڈنگز میں NVIDIA Nemotron 3 کے لیے اپنے پچھلے بنیادی ماڈل سے کم ڈائریائزیشن ایرر بتاتا ہے، جبکہ بولنے والوں کی صحیح تعداد بتانے کی درستگی کم ہے۔ اس لیے درستگی کا دارومدار آڈیو کے ساتھ کام اور پیمائش کے طریقے پر بھی ہے۔ ماڈل شامل کرنے کا فیصلہ کرنے والی ٹیم NVIDIA کے شائع شدہ انٹرفیس سے آغاز کر کے اپنے مطلوبہ استعمال سے ملتی ریکارڈنگز پر بولنے والے اور الفاظ کے مکمل نظام کی جانچ کر سکتی ہے۔

## Sources

- [NVIDIA: Nemotron 3 Diarization ماڈل کارڈ](https://huggingface.co/nvidia/Nemotron-3-Diarization) — ریلیز کی تاریخ، تقریباً 100 ملین پیرامیٹرز، ان پٹ، آؤٹ پٹ، اسٹریمنگ کی ترتیبات اور NVIDIA کی جانچ کی جدولوں کا بنیادی ماخذ۔ درستگی اور رفتار کی پیمائشیں کمپنی کی اپنی رپورٹ ہیں؛ درج کردہ 0.32 سیکنڈ صرف ان پٹ بفر کا وقت ہے، اس میں حساب شامل نہیں۔
- [NVIDIA: جانیں کس نے کب بات کی — ریلیز مضمون](https://huggingface.co/blog/nvidia/nemotron-diarization) — تاریخ والا ریلیز بیان آمد کی ترتیب کے مطابق بولنے والوں کے چینلز کی وضاحت کرتا اور دکھاتا ہے کہ عمومی بولنے والے وقفوں کو الگ ASR نتیجے کے ساتھ کیسے ملایا جا سکتا ہے۔ درمیانی وقت سے ملانے کی مثال اوورلیپ کو مبہم قرار دیتی ہے؛ یہ ایک سادہ اصول ہے، ٹرانسکرپٹ کا توثیق شدہ نتیجہ نہیں۔
- [NVIDIA: ڈائریائزیشن جانچ کا ذیلی کارڈ](https://huggingface.co/nvidia/Nemotron-3-Diarization/blob/main/diarization_evaluation.md) — NeMo جانچ اسکرپٹ، حوالہ RTTM کی شرط، اوورلیپ اور کالر کے مفہوم، اور قابلِ موازنہ ڈائریائزیشن ایرر ریٹ رپورٹ کرنے کے لیے درکار خانے درج کرتا ہے۔ یہ پروٹوکول کی دستاویز ہے، آزادانہ طور پر دہرائی گئی جانچ نہیں۔
- [OpenMDW لائسنس معاہدہ، نسخہ 1.1](https://openmdw.ai/license/1-1/) — اجازت اور ذمہ داریوں کی دستاویز: شرطوں کے تابع ماڈل کے مواد کا مفت استعمال اور دوبارہ تقسیم، تقسیم پر لائسنس اور ماخذ کے نوٹس برقرار رکھنا، تیار کردہ نتائج پر کوئی پابندی نہیں، اور ضروری حقوق و رضامندیاں حاصل کرنے کی ذمہ داری صارف پر۔
- [NVIDIA NeMo-Speech.cpp کمانڈ لائن گائیڈ](https://github.com/NVIDIA/NeMo-Speech.cpp/blob/main/docs/cli.md) — مقامی CLI کے ذریعے ڈائریائزیشن اور پہلے V2 کے چار بولنے والوں بمقابلہ V3 کی آٹھ بولنے والوں کی حد کی دستاویز۔ CLI کی معاونت سے یہ ثابت نہیں ہوتا کہ اس نیوز روم نے ماڈل چلایا، یا کارڈ میں دی گئی NeMo بینچ مارک رفتار درست ہے۔