Speaker Diarization

Speaker Diarization is the task of segmenting and co-indexing audio recordings by speaker. The way the task is commonly defined, the goal is not to identify known speakers, but to co-index segments that are attributed to the same speaker; in other words, diarization implies finding speaker boundaries and grouping segments that belong to the same speaker, and, as a by-product, determining the number of distinct speakers. In combination with speech recognition, diarization enables speaker-attributed speech-to-text transcription.

Source: Improving Diarization Robustness using Diversification, Randomization and the DOVER Algorithm

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 151–200 of 328 papers

Title	Date	Tasks	Status	Hype
Brouhaha: multi-task training for voice activity detection, speech-to-noise ratio, and C50 room acoustics estimation	Oct 24, 2022	Action DetectionActivity Detection	CodeCode Available	1
Mutual Learning of Single- and Multi-Channel End-to-End Neural Diarization	Oct 7, 2022	Knowledge Distillationspeaker-diarization	—Unverified	0
Spatial-aware Speaker Diarization for Multi-channel Multi-party Meeting	Sep 24, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Target Speaker Voice Activity Detection with Transformers and Its Integration with End-to-End Neural Diarization	Aug 27, 2022	Action DetectionActivity Detection	—Unverified	0
The Conversational Short-phrase Speaker Diarization (CSSD) Task: Dataset, Evaluation Metric and Baselines	Aug 17, 2022	Machine Translationspeaker-diarization	CodeCode Available	1
Chronological Self-Training for Real-Time Speaker Diarization	Aug 5, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Utterance-by-utterance overlap-aware neural diarization with Graph-PIT	Jul 28, 2022	ClusteringSegmentation	CodeCode Available	1
Unsupervised Speaker Diarization that is Agnostic to Language, Overlap-Aware, and Tuning Free	Jul 25, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Online Target Speaker Voice Activity Detection for Speaker Diarization	Jul 13, 2022	Action DetectionActivity Detection	—Unverified	0
Speaker Diarization and Identification from Single-Channel Classroom Audio Recording Using Virtual Microphones	Jul 1, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Interrelate Training and Searching: A Unified Online Clustering Framework for Speaker Diarization	Jun 28, 2022	ClusteringOnline Clustering	—Unverified	0
Simultaneous Speech Extraction for Multiple Target Speakers under the Meeting Scenarios	Jun 17, 2022	Action DetectionActivity Detection	—Unverified	0
Audio-video fusion strategies for active speaker detection in meetings	Jun 9, 2022	Active Speaker DetectionManagement	—Unverified	0
Online Neural Diarization of Unlimited Numbers of Speakers Using Global and Local Attractors	Jun 6, 2022	Multi-Label ClassificationMUlTI-LABEL-ClASSIFICATION	—Unverified	0
A Semi-Automatic Approach to Create Large Gender- and Age-Balanced Speaker Corpora: Usefulness of Speaker Diarization & Identification.	Jun 1, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Bazinga! A Dataset for Multi-Party Dialogues Structuring	Jun 1, 2022	Entity LinkingPunctuation Restoration	—Unverified	0
PaddleSpeech: An Easy-to-Use All-in-One Speech Toolkit	May 20, 2022	AllAutomatic Speech Recognition (ASR)	CodeCode Available	6
Bi-LSTM Scoring Based Similarity Measurement with Agglomerative Hierarchical Clustering (AHC) for Speaker Diarization	May 19, 2022	Clusteringspeaker-diarization	—Unverified	0
Reformulating Speaker Diarization as Community Detection With Emphasis On Topological Structure	Apr 26, 2022	ClusteringCommunity Detection	—Unverified	0
Improving the Naturalness of Simulated Conversations for End-to-End Neural Diarization	Apr 24, 2022	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Self-supervised Speaker Diarization	Apr 8, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Low-Latency Speech Separation Guided Diarization for Telephone Conversations	Apr 5, 2022	Action DetectionActivity Detection	CodeCode Available	1
From Simulated Mixtures to Simulated Conversations as Training Data for End-to-End Neural Diarization	Apr 2, 2022	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Multimodal Clustering with Role Induced Constraints for Speaker Diarization	Apr 1, 2022	Clusteringspeaker-diarization	—Unverified	0
EEND-SS: Joint End-to-End Neural Speaker Diarization and Speech Separation for Flexible Number of Speakers	Mar 31, 2022	Decoderspeaker-diarization	CodeCode Available	0
Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset	Mar 31, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Generation of Speaker Representations Using Heterogeneous Training Batch Assembly	Mar 30, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings	Mar 30, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	1
Multi-scale Speaker Diarization with Dynamic Scale Weighting	Mar 30, 2022	Decoderspeaker-diarization	—Unverified	0
Using Active Speaker Faces for Diarization in TV shows	Mar 30, 2022	Face ClusteringFace Detection	—Unverified	0
Training Speaker Embedding Extractors Using Multi-Speaker Audio with Unknown Speaker Boundaries	Mar 29, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
Visualizations of Complex Sequences of Family-Infant Vocalizations Using Bag-of-Audio-Words Approach Based on Wav2vec 2.0 Features	Mar 29, 2022	speaker-diarizationSpeaker Diarization	CodeCode Available	0
Speaker Embedding-aware Neural Diarization: an Efficient Framework for Overlapping Speech Diarization in Meeting Scenarios	Mar 18, 2022	Action DetectionActivity Detection	CodeCode Available	0
Tight integration of neural- and clustering-based diarization through deep unfolding of infinite Gaussian mixture model	Feb 14, 2022	Clusteringspeaker-diarization	—Unverified	0
The xmuspeech system for multi-channel multi-party meeting transcription challenge	Feb 11, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
The USTC-Ximalaya system for the ICASSP 2022 multi-channel multi-party meeting transcription (M2MeT) challenge	Feb 10, 2022	Action DetectionActivity Detection	—Unverified	0
Royalflush Speaker Diarization System for ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge	Feb 10, 2022	speaker-diarizationSpeaker Diarization	—Unverified	0
The Volcspeech system for the ICASSP 2022 multi-channel multi-party meeting transcription challenge	Feb 9, 2022	Data AugmentationLanguage Modelling	—Unverified	0
Cross-Channel Attention-Based Target Speaker Voice Activity Detection: Experimental Results for M2MeT Challenge	Feb 6, 2022	Action DetectionActivity Detection	—Unverified	0
The CUHK-TENCENT speaker diarization system for the ICASSP 2022 multi-channel multi-party meeting transcription challenge	Feb 4, 2022	Action DetectionActivity Detection	—Unverified	0
AVA-AVD: Audio-Visual Speaker Diarization in the Wild	Nov 29, 2021	Relation Networkspeaker-diarization	CodeCode Available	1
Speaker Embedding-aware Neural Diarization for Flexible Number of Speakers with Textual Information	Nov 28, 2021	Action DetectionActivity Detection	CodeCode Available	0
Low-Latency Online Speaker Diarization with Graph-Based Label Generation	Nov 27, 2021	Clusteringspeaker-diarization	—Unverified	0
Auxiliary Loss of Transformer with Residual Connection for End-to-End Speaker Diarization	Oct 14, 2021	speaker-diarizationSpeaker Diarization	—Unverified	0
BERTraffic: BERT-based Joint Speaker Role and Speaker Change Detection for Air Traffic Control Communications	Oct 12, 2021	Action DetectionActivity Detection	CodeCode Available	1
Multi-Channel End-to-End Neural Diarization with Distributed Microphones	Oct 10, 2021	speaker-diarizationSpeaker Diarization	—Unverified	0
TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context	Oct 8, 2021	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR	Oct 7, 2021	Action DetectionActivity Detection	—Unverified	0
North America Bixby Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2021	Sep 28, 2021	Clusteringspeaker-diarization	—Unverified	0
Turn-to-Diarize: Online Speaker Diarization Constrained by Transformer Transducer Speaker Turn Detection	Sep 23, 2021	Clusteringspeaker-diarization	CodeCode Available	1

Show:10 25 50

← PrevPage 4 of 7Next →

All datasets CALLHOME NIST-SRE 2000 AMI Lapel AMI MixHeadset CH109 DIHARD ETAPE AMI CALLHOME-109 AliMeeting DIHARD II Hub5'00 CallHome

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	COS+NJW-SC (Oracle SAD)	DER(%)	24.05	—	Unverified
2	EEND	DER(%)	23.07	—	Unverified
3	COS+AHC (Oracle SAD)	DER(%)	21.13	—	Unverified
4	SA-EEND (2-spk, no-adapt)	DER(%)	12.66	—	Unverified
5	EEND-OLA	DER(%)	12.57	—	Unverified
6	SA-EEND (2-spk, adapted)	DER(%)	10.76	—	Unverified
7	TOLD	DER(%)	10.14	—	Unverified
8	COS+B-SC (Oracle SAD)	DER(ig olp)	8.78	—	Unverified
9	PLDA+AHC (Oracle SAD)	DER(ig olp)	8.39	—	Unverified
10	COS+NME-SC (Oracle SAD)	DER(ig olp)	7.29	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	8.39	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	6.73	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	6.47	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	6.37	—	Unverified
5	x-vector (MCGAN)	DER(%)	5.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ECAPA (SC)	DER(%)	2.36	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	2.03	—	Unverified
3	TitaNet-S (NME-SC)	DER(%)	2	—	Unverified
4	TitaNet-M (NME-SC)	DER(%)	1.99	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TitaNet-S (NME-SC)	DER(%)	2.22	—	Unverified
2	TitaNet-M (NME-SC)	DER(%)	1.79	—	Unverified
3	ECAPA (SC)	DER(%)	1.78	—	Unverified
4	TitaNet-L (NME-SC)	DER(%)	1.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	9.72	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	1.19	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	1.13	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline (the best result in the literature as of Oct.2019)	DER(%)	11.2	—	Unverified
2	pyannote (MFCC)	DER(%)	10.5	—	Unverified
3	pyannote (waveform)	DER(%)	9.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline	DER(%)	7.7	—	Unverified
2	pyannote (MFCC)	DER(%)	5.6	—	Unverified
3	pyannote (waveform)	DER(%)	4.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	pyannote (MFCC)	DER(%)	6.3	—	Unverified
2	pyannote (waveform)	DER(%)	6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	d-vector + spectral	DER(%)	12.54	—	Unverified
2	titanet-s	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SOND	DER(%)	4.46	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN-SML	DER(%)	27.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN	V	10.6	—	Unverified