SOTAVerified

Speaker Diarization

Speaker Diarization is the task of segmenting and co-indexing audio recordings by speaker. The way the task is commonly defined, the goal is not to identify known speakers, but to co-index segments that are attributed to the same speaker; in other words, diarization implies finding speaker boundaries and grouping segments that belong to the same speaker, and, as a by-product, determining the number of distinct speakers. In combination with speech recognition, diarization enables speaker-attributed speech-to-text transcription.

Source: Improving Diarization Robustness using Diversification, Randomization and the DOVER Algorithm

Papers

Showing 1–50 of 328 papers

TitleStatusHype
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised ModelsCode3
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset—0
Exploring Speaker Diarization with Mixture of Experts—0
Seewo's Submission to MLC-SLM: Lessons learned from Speech Reasoning Language Models—0
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition—0
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models—0
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling—0
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation AlgorithmCode1
Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization—0
Pretraining Multi-Speaker Identification for Neural Speaker Diarization—0
VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering—0
HPP-Voice: A Large-Scale Evaluation of Speech Embeddings for Multi-Phenotypic Classification—0
Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge—0
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition—0
Multi-Stage Speaker Diarization for Noisy ClassroomsCode0
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning—0
SeniorTalk: A Chinese Conversation Dataset with Rich Annotations for Super-Aged Seniors—0
Microphone Array Geometry Independent Multi-Talker Distant ASR: NTT System for the DASR Task of the CHiME-8 Challenge—0
Afrispeech-Dialog: A Benchmark Dataset for Spontaneous English Conversations in Healthcare and Beyond—0
Language Modelling for Speaker Diarization in Telephonic Interviews—0
SCDiar: a streaming diarization system based on speaker change detection and speech recognition—0
SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models—0
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection—0
Unsupervised Speech Segmentation: A General Approach Using Speech Language ModelsCode1
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech RecognitionCode2
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch—0
Comprehensive Audio Query Handling System with Integrated Expert Models and Contextual Understanding—0
Automating Feedback Analysis in Surgical Training: Detection, Categorization, and AssessmentCode0
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation—0
Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation—0
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions—0
Guided Speaker Embedding—0
Incorporating Spatial Cues in Modular Speaker Diarization for Multi-channel Multi-party Meetings—0
On the calibration of powerset speaker diarization modelsCode0
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR—0
Self-Tuning Spectral Clustering for Speaker DiarizationCode0
TCG CREST System Description for the Second DISPLACE Challenge—0
Leveraging Self-Supervised Learning for Speaker DiarizationCode3
Unified Audio Event Detection—0
Data Efficient Child-Adult Speaker Diarization with Simulated ConversationsCode1
Sortformer: Seamless Integration of Speaker Diarization and ASR by Bridging Timestamps and Tokens—0
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR—0
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization—0
Speaker Tagging Correction With Non-Autoregressive Language Models—0
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings—0
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization—0
An approach to optimize inference of the DIART speaker diarization pipeline—0
Long-Term Conversation Analysis: Privacy-Utility Trade-off under Noise and Reverberation—0
Multi-Stage Face-Voice Association Learning with Keynote Speaker DiarizationCode1
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning—0
Show:102550
← PrevPage 1 of 7Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1COS+NJW-SC (Oracle SAD)DER(%)24.05—Unverified
2EENDDER(%)23.07—Unverified
3COS+AHC (Oracle SAD)DER(%)21.13—Unverified
4SA-EEND (2-spk, no-adapt)DER(%)12.66—Unverified
5EEND-OLADER(%)12.57—Unverified
6SA-EEND (2-spk, adapted)DER(%)10.76—Unverified
7TOLDDER(%)10.14—Unverified
8COS+B-SC (Oracle SAD)DER(ig olp)8.78—Unverified
9PLDA+AHC (Oracle SAD)DER(ig olp)8.39—Unverified
10COS+NME-SC (Oracle SAD)DER(ig olp)7.29—Unverified
#ModelMetricClaimedVerifiedStatus
1x-vector (PLDA + AHC)DER(%)8.39—Unverified
2TitaNet-L (NME-SC)DER(%)6.73—Unverified
3TitaNet-M (NME-SC)DER(%)6.47—Unverified
4TitaNet-S (NME-SC)DER(%)6.37—Unverified
5x-vector (MCGAN)DER(%)5.73—Unverified
#ModelMetricClaimedVerifiedStatus
1ECAPA (SC)DER(%)2.36—Unverified
2TitaNet-L (NME-SC)DER(%)2.03—Unverified
3TitaNet-S (NME-SC)DER(%)2—Unverified
4TitaNet-M (NME-SC)DER(%)1.99—Unverified
#ModelMetricClaimedVerifiedStatus
1TitaNet-S (NME-SC)DER(%)2.22—Unverified
2TitaNet-M (NME-SC)DER(%)1.79—Unverified
3ECAPA (SC)DER(%)1.78—Unverified
4TitaNet-L (NME-SC)DER(%)1.73—Unverified
#ModelMetricClaimedVerifiedStatus
1x-vector (PLDA + AHC)DER(%)9.72—Unverified
2TitaNet-L (NME-SC)DER(%)1.19—Unverified
3TitaNet-M (NME-SC)DER(%)1.13—Unverified
4TitaNet-S (NME-SC)DER(%)1.11—Unverified
#ModelMetricClaimedVerifiedStatus
1Baseline (the best result in the literature as of Oct.2019)DER(%)11.2—Unverified
2pyannote (MFCC)DER(%)10.5—Unverified
3pyannote (waveform)DER(%)9.9—Unverified
#ModelMetricClaimedVerifiedStatus
1BaselineDER(%)7.7—Unverified
2pyannote (MFCC)DER(%)5.6—Unverified
3pyannote (waveform)DER(%)4.9—Unverified
#ModelMetricClaimedVerifiedStatus
1pyannote (MFCC)DER(%)6.3—Unverified
2pyannote (waveform)DER(%)6—Unverified
#ModelMetricClaimedVerifiedStatus
1d-vector + spectralDER(%)12.54—Unverified
2titanet-sDER(%)1.11—Unverified
#ModelMetricClaimedVerifiedStatus
1SONDDER(%)4.46—Unverified
#ModelMetricClaimedVerifiedStatus
1UIS-RNN-SMLDER(%)27.3—Unverified
#ModelMetricClaimedVerifiedStatus
1UIS-RNNV10.6—Unverified