İçeriğe geç
English

Nvidia · Modeller

Nvidia, gerçek zamanlı olarak 8 konuşmacıyı ayırt eden açık bir model yayınladı

Yayın: 3 kaynakEnglish

Nemotron 3 Diarization, bir ses kaydında kimin ne zaman konuştuğunu belirleyen 100 milyon parametrelik bir model. Hem canlı akışta hem kayıt üzerinde çalışıyor, üst üste binen konuşmalar dahil sekiz konuşmacıya kadar ayırt edebiliyor. VoiceArena’nın Diarization-Bench tablosunda %14,72 hata oranıyla ilk sırada; Nvidia’nın önceki dört konuşmacılı modeline göre hata oranı ortalama %41 düşüyor. Ağırlıklar Hugging Face’te ticari kullanıma izin veren OpenMDW lisansıyla yayımlandı. Toplantı dökümü, çağrı merkezi ve sesli asistan gibi alanlarda kullanılabilir.

Kaynaklar

  1. Nvidia (Hugging Face blogu), “Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization”, (huggingface.co)
  2. Nvidia (Hugging Face), “nvidia/Nemotron-3-Diarization”, Model kartı, (huggingface.co)
  3. Voice Arena, “Diarization Bench: speaker diarization leaderboard, early results”, Sıralama tablosu (voicearena.com)

Bu haber hakkında

Bu haber Instagram’da @jarrus.ai hesabında 30 Eylül 2026 tarihinde paylaşıldı.

Bu haberde bir hata mı var? [email protected] · Instagram

Bu haberin İngilizcesi: Nvidia released an open model that tells 8 speakers apart in real time

Aynı konuda