Speaker Diarization

Speaker Diarization is the task of segmenting and co-indexing audio recordings by speaker. The way the task is commonly defined, the goal is not to identify known speakers, but to co-index segments that are attributed to the same speaker; in other words, diarization implies finding speaker boundaries and grouping segments that belong to the same speaker, and, as a by-product, determining the number of distinct speakers. In combination with speech recognition, diarization enables speaker-attributed speech-to-text transcription.

Source: Improving Diarization Robustness using Diversification, Randomization and the DOVER Algorithm

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 101–150 of 328 papers

Title	Date	Tasks	Status	Hype
Property-Aware Multi-Speaker Data Simulation: A Probabilistic Modelling Technique for Synthetic Data Generation	Oct 18, 2023	Action DetectionActivity Detection	—Unverified	0
End-to-end Online Speaker Diarization with Target Speaker Tracking	Oct 12, 2023	Action DetectionActivity Detection	—Unverified	0
One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition	Oct 2, 2023	AllAutomatic Speech Recognition	—Unverified	0
Frame-wise streaming end-to-end speaker diarization with non-autoregressive self-attention-based attractors	Sep 25, 2023	Decoderspeaker-diarization	CodeCode Available	1
NTT speaker diarization system for CHiME-7: multi-domain, multi-microphone End-to-end and vector clustering diarization	Sep 22, 2023	Automatic Speech Recognitionspeaker-diarization	—Unverified	0
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation	Sep 19, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Neural Speaker Diarization Using Memory-Aware Multi-Speaker Embedding with Sequence-to-Sequence Architecture	Sep 17, 2023	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Towards Word-Level End-to-End Neural Speaker Diarization with Auxiliary Network	Sep 15, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
DiaCorrect: Error Correction Back-end For Speaker Diarization	Sep 15, 2023	Automatic Speech RecognitionDecoder	CodeCode Available	1
Aligning Speakers: Evaluating and Visualizing Text-based Diarization Using Efficient Multiple Sequence Alignment (Extended Version)	Sep 14, 2023	Multiple Sequence Alignmentspeaker-diarization	—Unverified	0
DiariST: Streaming Speech Translation with Speaker Diarization	Sep 14, 2023	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis	Sep 13, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach	Sep 11, 2023	speaker-diarizationSpeaker Diarization	CodeCode Available	1
The USTC-NERCSLIP Systems for the CHiME-7 DASR Challenge	Aug 28, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Implicit Self-supervised Language Representation for Spoken Language Diarization	Aug 21, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Home monitoring for frailty detection through sound and speaker diarization analysis	Aug 17, 2023	Privacy Preservingspeaker-diarization	—Unverified	0
GIST-AiTeR Speaker Diarization System for VoxCeleb Speaker Recognition Challenge (VoxSRC) 2023	Aug 15, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Speaker Diarization of Scripted Audiovisual Content	Aug 4, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Joint speech and overlap detection: a benchmark over multiple audio setup and speech domains	Jul 24, 2023	Multi-class Classificationspeaker-diarization	—Unverified	0
Semi-supervised multi-channel speaker diarization with cross-channel attention	Jul 17, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Long-term Conversation Analysis: Exploring Utility and Privacy	Jun 28, 2023	Action DetectionActivity Detection	CodeCode Available	0
Community Detection Graph Convolutional Network for Overlap-Aware Speaker Diarization	Jun 26, 2023	ClusteringCommunity Detection	—Unverified	0
Implicit spoken language diarization	Jun 22, 2023	Language ModelingLanguage Modelling	—Unverified	0
Speech Emotion Diarization: Which Emotion Appears When?	Jun 22, 2023	Emotion Recognitionspeaker-diarization	CodeCode Available	1
Lexical Speaker Error Correction: Leveraging Language Models for Speaker Diarization Error Correction	Jun 15, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Multi-microphone Automatic Speech Segmentation in Meetings Based on Circular Harmonics Features	Jun 7, 2023	Action DetectionActivity Detection	—Unverified	0
Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks	Jun 7, 2023	Audio ClassificationAudio Tagging	CodeCode Available	1
An Experimental Review of Speaker Diarization methods with application to Two-Speaker Conversational Telephone Speech recordings	May 29, 2023	Clusteringspeaker-diarization	—Unverified	0
Multi-Stream Extension of Variational Bayesian HMM Clustering (MS-VBx) for Combined End-to-End and Vector Clustering-based Diarization	May 23, 2023	Clusteringspeaker-diarization	—Unverified	0
Exploring Speaker-Related Information in Spoken Language Understanding for Better Speaker Diarization	May 22, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Towards Robust Family-Infant Audio Analysis Based on Unsupervised Pretraining of Wav2vec 2.0 on Large-Scale Unlabeled Family Audio	May 21, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Neural Diarization with Non-autoregressive Intermediate Attractors	Mar 13, 2023	Decoderspeaker-diarization	CodeCode Available	0
TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization	Mar 8, 2023	speaker-diarizationSpeaker Diarization	CodeCode Available	0
A Light Weight Model for Active Speaker Detection	Mar 8, 2023	Active Speaker DetectionAudio-Visual Active Speaker Detection	CodeCode Available	1
Improving Transformer-based End-to-End Speaker Diarization by Assigning Auxiliary Losses to Attention Heads	Mar 2, 2023	Action DetectionActivity Detection	—Unverified	0
DISPLACE Challenge: DIarization of SPeaker and LAnguage in Conversational Environments	Mar 1, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Supervised Hierarchical Clustering using Graph Neural Networks for Speaker Diarization	Feb 24, 2023	ClusteringGraph Clustering	CodeCode Available	0
A Reinforcement Learning Framework for Online Speaker Diarization	Feb 21, 2023	Decision MakingDomain Adaptation	—Unverified	0
VoxSRC 2022: The Fourth VoxCeleb Speaker Recognition Challenge	Feb 20, 2023	Speaker DiarizationSpeaker Recognition	CodeCode Available	1
Towards Measuring and Scoring Speaker Diarization Fairness	Feb 20, 2023	FairnessSentence	—Unverified	0
The Newsbridge -Telecom SudParis VoxCeleb Speaker Recognition Challenge 2022 System Description	Jan 17, 2023	Action DetectionActivity Detection	—Unverified	0
BER: Balanced Error Rate For Speaker Diarization	Nov 8, 2022	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Late Audio-Visual Fusion for In-The-Wild Speaker Diarization	Nov 2, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
A Comparative Study on Multichannel Speaker-Attributed Automatic Speech Recognition in Multi-party Meetings	Nov 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
DiaCorrect: End-to-end error correction for speaker diarization	Oct 31, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Target-Speaker Voice Activity Detection via Sequence-to-Sequence Prediction	Oct 28, 2022	Action DetectionActivity Detection	—Unverified	0
On Out-of-Distribution Detection for Audio with Deep Nearest Neighbors	Oct 27, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Privacy-preserving Automatic Speaker Diarization	Oct 26, 2022	Privacy Preservingspeaker-diarization	—Unverified	0
TSUP Speaker Diarization System for Conversational Short-phrase Speaker Diarization Challenge	Oct 26, 2022	Action DetectionActivity Detection	—Unverified	0
Highly Efficient Real-Time Streaming and Fully On-Device Speaker Diarization with Multi-Stage Clustering	Oct 25, 2022	ClusteringCPU	CodeCode Available	2

Show:10 25 50

← PrevPage 3 of 7Next →

All datasets CALLHOME NIST-SRE 2000 AMI Lapel AMI MixHeadset CH109 DIHARD ETAPE AMI CALLHOME-109 AliMeeting DIHARD II Hub5'00 CallHome

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	COS+NJW-SC (Oracle SAD)	DER(%)	24.05	—	Unverified
2	EEND	DER(%)	23.07	—	Unverified
3	COS+AHC (Oracle SAD)	DER(%)	21.13	—	Unverified
4	SA-EEND (2-spk, no-adapt)	DER(%)	12.66	—	Unverified
5	EEND-OLA	DER(%)	12.57	—	Unverified
6	SA-EEND (2-spk, adapted)	DER(%)	10.76	—	Unverified
7	TOLD	DER(%)	10.14	—	Unverified
8	COS+B-SC (Oracle SAD)	DER(ig olp)	8.78	—	Unverified
9	PLDA+AHC (Oracle SAD)	DER(ig olp)	8.39	—	Unverified
10	COS+NME-SC (Oracle SAD)	DER(ig olp)	7.29	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	8.39	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	6.73	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	6.47	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	6.37	—	Unverified
5	x-vector (MCGAN)	DER(%)	5.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ECAPA (SC)	DER(%)	2.36	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	2.03	—	Unverified
3	TitaNet-S (NME-SC)	DER(%)	2	—	Unverified
4	TitaNet-M (NME-SC)	DER(%)	1.99	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TitaNet-S (NME-SC)	DER(%)	2.22	—	Unverified
2	TitaNet-M (NME-SC)	DER(%)	1.79	—	Unverified
3	ECAPA (SC)	DER(%)	1.78	—	Unverified
4	TitaNet-L (NME-SC)	DER(%)	1.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	9.72	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	1.19	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	1.13	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline (the best result in the literature as of Oct.2019)	DER(%)	11.2	—	Unverified
2	pyannote (MFCC)	DER(%)	10.5	—	Unverified
3	pyannote (waveform)	DER(%)	9.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline	DER(%)	7.7	—	Unverified
2	pyannote (MFCC)	DER(%)	5.6	—	Unverified
3	pyannote (waveform)	DER(%)	4.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	pyannote (MFCC)	DER(%)	6.3	—	Unverified
2	pyannote (waveform)	DER(%)	6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	d-vector + spectral	DER(%)	12.54	—	Unverified
2	titanet-s	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SOND	DER(%)	4.46	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN-SML	DER(%)	27.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN	V	10.6	—	Unverified