Speaker Diarization

Speaker Diarization is the task of segmenting and co-indexing audio recordings by speaker. The way the task is commonly defined, the goal is not to identify known speakers, but to co-index segments that are attributed to the same speaker; in other words, diarization implies finding speaker boundaries and grouping segments that belong to the same speaker, and, as a by-product, determining the number of distinct speakers. In combination with speech recognition, diarization enables speaker-attributed speech-to-text transcription.

Source: Improving Diarization Robustness using Diversification, Randomization and the DOVER Algorithm

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 101–150 of 328 papers

Title	Date	Tasks	Status
psifx -- Psychological and Social Interactions Feature Extraction Package	Jul 14, 2024	Pose Estimationspeaker-diarization	—Unverified
A Benchmark for Multi-speaker Anonymization	Jul 8, 2024	BenchmarkingDisentanglement	—Unverified
Systematic Evaluation of Online Speaker Diarization Systems Regarding their Latency	Jul 5, 2024	Online ClusteringSegmentation	—Unverified
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge	Jul 2, 2024	Automatic Speech RecognitionPseudo Label	—Unverified
Towards Unsupervised Speaker Diarization System for Multilingual Telephone Calls Using Pre-trained Whisper Model and Mixture of Sparse Autoencoders	Jul 2, 2024	Clusteringspeaker-diarization	—Unverified
Audio-Visual Approach For Multimodal Concurrent Speaker Detection	Jul 1, 2024	Multimodal Deep Learningspeaker-diarization	—Unverified
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios	Jul 1, 2024	speaker-diarizationSpeaker Diarization	—Unverified
From Modular to End-to-End Speaker Diarization	Jun 27, 2024	speaker-diarizationSpeaker Diarization	—Unverified
Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization	Jun 26, 2024	ClusteringForm	—Unverified
AG-LSEC: Audio Grounded Lexical Speaker Error Correction	Jun 25, 2024	Language ModelingLanguage Modelling	—Unverified
Investigating Confidence Estimation Measures for Speaker Diarization	Jun 24, 2024	speaker-diarizationSpeaker Diarization	—Unverified
A Review of Common Online Speaker Diarization Methods	Jun 20, 2024	speaker-diarizationSpeaker Diarization	—Unverified
System Description for the Displace Speaker Diarization Challenge 2023	Jun 20, 2024	Clusteringspeaker-diarization	—Unverified
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control	Jun 19, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The BabyView dataset: High-resolution egocentric videos of infants' and young children's everyday experiences	Jun 14, 2024	Depth EstimationImage Segmentation	—Unverified
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech	Jun 13, 2024	Language Identificationspeaker-diarization	—Unverified
The Second DISPLACE Challenge : DIarization of SPeaker and LAnguage in Conversational Environments	Jun 13, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Neural Blind Source Separation and Diarization for Distant Speech Recognition	Jun 12, 2024	blind source separationDistant Speech Recognition	—Unverified
Target Speech Diarization with Multimodal Prompts	Jun 11, 2024	speaker-diarizationSpeaker Diarization	—Unverified
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings	Jun 5, 2024	speaker-diarizationSpeaker Diarization	—Unverified
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization	May 15, 2024	Action DetectionActivity Detection	—Unverified
A Semi-Automatic Approach to Create Large Gender- and Age-Balanced Speaker Corpora: Usefulness of Speaker Diarization & Identification	Apr 26, 2024	speaker-diarizationSpeaker Diarization	—Unverified
Unsupervised Speaker Diarization in Distributed IoT Networks Using Federated Learning	Apr 16, 2024	Change DetectionFederated Learning	—Unverified
3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization	Mar 29, 2024	Self-Supervised Learningspeaker-diarization	—Unverified
Assessing the Robustness of Spectral Clustering for Deep Speaker Diarization	Mar 21, 2024	Clusteringspeaker-diarization	—Unverified
Improving Speaker Assignment in Speaker-Attributed ASR for Real Meeting Applications	Mar 11, 2024	Action DetectionActivity Detection	—Unverified
Listening to Multi-talker Conversations: Modular and End-to-end Perspectives	Feb 14, 2024	GPUspeaker-diarization	—Unverified
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection	Feb 13, 2024	Action DetectionActivity Detection	—Unverified
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models	Feb 12, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Spatial-Temporal Activity-Informed Diarization and Separation	Jan 30, 2024	speaker-diarizationSpeaker Diarization	—Unverified
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization	Jan 23, 2024	ClusteringGraph Clustering	CodeCode Available
NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription	Jan 16, 2024	Automatic Speech RecognitionBenchmarking	—Unverified
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization	Jan 16, 2024	Action DetectionActivity Detection	—Unverified
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation	Jan 7, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	CodeCode Available
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification	Dec 28, 2023	speaker-diarizationSpeaker Diarization	—Unverified
Speaker Mask Transformer for Multi-talker Overlapped Speech Recognition	Dec 18, 2023	speaker-diarizationSpeaker Diarization	—Unverified
EEND-DEMUX: End-to-End Neural Speaker Diarization via Demultiplexed Speaker Embeddings	Dec 11, 2023	speaker-diarizationSpeaker Diarization	—Unverified
Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization	Dec 7, 2023	Decoderspeaker-diarization	—Unverified
Summary of the DISPLACE Challenge 2023 -- DIarization of SPeaker and LAnguage in Conversational Environments	Nov 21, 2023	speaker-diarizationSpeaker Diarization	—Unverified
UniX-Encoder: A Universal X-Channel Speech Encoder for Ad-Hoc Microphone Array Speech Processing	Oct 25, 2023	speaker-diarizationSpeaker Diarization	—Unverified
EmoDiarize: Speaker Diarization and Emotion Identification from Speech Signals using Convolutional Neural Networks	Oct 19, 2023	Data AugmentationEmotion Recognition	—Unverified
Powerset multi-class cross entropy loss for neural speaker diarization	Oct 19, 2023	Multi-class ClassificationMulti-Label Classification	—Unverified
The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System	Oct 18, 2023	Automatic Speech Recognitionspeaker-diarization	—Unverified
Property-Aware Multi-Speaker Data Simulation: A Probabilistic Modelling Technique for Synthetic Data Generation	Oct 18, 2023	Action DetectionActivity Detection	—Unverified
End-to-end Online Speaker Diarization with Target Speaker Tracking	Oct 12, 2023	Action DetectionActivity Detection	—Unverified
One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition	Oct 2, 2023	AllAutomatic Speech Recognition	—Unverified
NTT speaker diarization system for CHiME-7: multi-domain, multi-microphone End-to-end and vector clustering diarization	Sep 22, 2023	Automatic Speech Recognitionspeaker-diarization	—Unverified
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation	Sep 19, 2023	speaker-diarizationSpeaker Diarization	—Unverified
Towards Word-Level End-to-End Neural Speaker Diarization with Auxiliary Network	Sep 15, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Aligning Speakers: Evaluating and Visualizing Text-based Diarization Using Efficient Multiple Sequence Alignment (Extended Version)	Sep 14, 2023	Multiple Sequence Alignmentspeaker-diarization	—Unverified

Show:10 25 50

← PrevPage 3 of 7Next →

All datasets CALLHOME NIST-SRE 2000 AMI Lapel AMI MixHeadset CH109 DIHARD ETAPE AMI CALLHOME-109 AliMeeting DIHARD II Hub5'00 CallHome

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	COS+NJW-SC (Oracle SAD)	DER(%)	24.05	—	Unverified
2	EEND	DER(%)	23.07	—	Unverified
3	COS+AHC (Oracle SAD)	DER(%)	21.13	—	Unverified
4	SA-EEND (2-spk, no-adapt)	DER(%)	12.66	—	Unverified
5	EEND-OLA	DER(%)	12.57	—	Unverified
6	SA-EEND (2-spk, adapted)	DER(%)	10.76	—	Unverified
7	TOLD	DER(%)	10.14	—	Unverified
8	COS+B-SC (Oracle SAD)	DER(ig olp)	8.78	—	Unverified
9	PLDA+AHC (Oracle SAD)	DER(ig olp)	8.39	—	Unverified
10	COS+NME-SC (Oracle SAD)	DER(ig olp)	7.29	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	8.39	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	6.73	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	6.47	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	6.37	—	Unverified
5	x-vector (MCGAN)	DER(%)	5.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ECAPA (SC)	DER(%)	2.36	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	2.03	—	Unverified
3	TitaNet-S (NME-SC)	DER(%)	2	—	Unverified
4	TitaNet-M (NME-SC)	DER(%)	1.99	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TitaNet-S (NME-SC)	DER(%)	2.22	—	Unverified
2	TitaNet-M (NME-SC)	DER(%)	1.79	—	Unverified
3	ECAPA (SC)	DER(%)	1.78	—	Unverified
4	TitaNet-L (NME-SC)	DER(%)	1.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	9.72	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	1.19	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	1.13	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline (the best result in the literature as of Oct.2019)	DER(%)	11.2	—	Unverified
2	pyannote (MFCC)	DER(%)	10.5	—	Unverified
3	pyannote (waveform)	DER(%)	9.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline	DER(%)	7.7	—	Unverified
2	pyannote (MFCC)	DER(%)	5.6	—	Unverified
3	pyannote (waveform)	DER(%)	4.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	pyannote (MFCC)	DER(%)	6.3	—	Unverified
2	pyannote (waveform)	DER(%)	6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	d-vector + spectral	DER(%)	12.54	—	Unverified
2	titanet-s	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SOND	DER(%)	4.46	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN-SML	DER(%)	27.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN	V	10.6	—	Unverified