Nvidia, gerçek zamanlı olarak 8 konuşmacıyı ayırt eden açık bir model yayınladı
Nemotron 3 Diarization, bir ses kaydında kimin ne zaman konuştuğunu belirleyen 100 milyon parametrelik bir model. Hem canlı akışta hem kayıt üzerinde çalışıyor, üst üste binen konuşmalar dahil sekiz konuşmacıya kadar ayırt edebiliyor. VoiceArena’nın Diarization-Bench tablosunda %14,72 hata oranıyla ilk sırada; Nvidia’nın önceki dört konuşmacılı modeline göre hata oranı ortalama %41 düşüyor. Ağırlıklar Hugging Face’te ticari kullanıma izin veren OpenMDW lisansıyla yayımlandı. Toplantı dökümü, çağrı merkezi ve sesli asistan gibi alanlarda kullanılabilir.
Kaynaklar
- Nvidia (Hugging Face blogu), “Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization”, (huggingface.co)
- Nvidia (Hugging Face), “nvidia/Nemotron-3-Diarization”, Model kartı, (huggingface.co)
- Voice Arena, “Diarization Bench: speaker diarization leaderboard, early results”, Sıralama tablosu (voicearena.com)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 30 Eylül 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/nemotron-diarization
Bu haberin İngilizcesi: Nvidia released an open model that tells 8 speakers apart in real time
Aynı konuda
AWS, Çin’in GLM 5.3 modelini kendi platformuna ekledi
AWS, Pekin merkezli Z.ai’nin (eski adıyla Zhipu AI) 753 milyar parametreli GLM 5.3 modelini 5 Ekim’de uygun kurumsal müşteriler için Amazon Bedrock’a ekledi.
Nvidia, 100 milyar parametreye kadar modelleri yerel çalıştıran DGX Spark’ın 64 GB’lık sürümünü tanıttı
Nvidia, masaüstü yapay zeka bilgisayarı DGX Spark’ın 23 Ekim’den itibaren 4.999 dolardan satılacak 64 GB’lık yapılandırmasını 2 Ekim’de duyurdu.
Microsoft, biri 60 dilde gerçek zamanlı yazıya döken üç yeni ses modeli çıkardı
Microsoft AI 1 Ekim’de üç ses modeli duyurdu: 60 dilde gerçek zamanlı yazıya döken MAI-Transcribe-2-Streaming ve 23 dilli MAI-Voice-2.1 ile Flash sürümü.