Speaker Diarization

Speaker Diarization is the task of segmenting and co-indexing audio recordings by speaker. The way the task is commonly defined, the goal is not to identify known speakers, but to co-index segments that are attributed to the same speaker; in other words, diarization implies finding speaker boundaries and grouping segments that belong to the same speaker, and, as a by-product, determining the number of distinct speakers. In combination with speech recognition, diarization enables speaker-attributed speech-to-text transcription.

Source: Improving Diarization Robustness using Diversification, Randomization and the DOVER Algorithm

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 51–100 of 328 papers

Title	Date	Tasks	Status	Hype
TalTech-IRIT-LIS Speaker and Language Diarization Systems for DISPLACE 2024	Jul 17, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
psifx -- Psychological and Social Interactions Feature Extraction Package	Jul 14, 2024	Pose Estimationspeaker-diarization	—Unverified	0
A Benchmark for Multi-speaker Anonymization	Jul 8, 2024	BenchmarkingDisentanglement	—Unverified	0
Systematic Evaluation of Online Speaker Diarization Systems Regarding their Latency	Jul 5, 2024	Online ClusteringSegmentation	—Unverified	0
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge	Jul 2, 2024	Automatic Speech RecognitionPseudo Label	—Unverified	0
Towards Unsupervised Speaker Diarization System for Multilingual Telephone Calls Using Pre-trained Whisper Model and Mixture of Sparse Autoencoders	Jul 2, 2024	Clusteringspeaker-diarization	—Unverified	0
Audio-Visual Approach For Multimodal Concurrent Speaker Detection	Jul 1, 2024	Multimodal Deep Learningspeaker-diarization	—Unverified	0
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios	Jul 1, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
From Modular to End-to-End Speaker Diarization	Jun 27, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization	Jun 26, 2024	ClusteringForm	—Unverified	0
AG-LSEC: Audio Grounded Lexical Speaker Error Correction	Jun 25, 2024	Language ModelingLanguage Modelling	—Unverified	0
Investigating Confidence Estimation Measures for Speaker Diarization	Jun 24, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
System Description for the Displace Speaker Diarization Challenge 2023	Jun 20, 2024	Clusteringspeaker-diarization	—Unverified	0
A Review of Common Online Speaker Diarization Methods	Jun 20, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control	Jun 19, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
The BabyView dataset: High-resolution egocentric videos of infants' and young children's everyday experiences	Jun 14, 2024	Depth EstimationImage Segmentation	—Unverified	0
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech	Jun 13, 2024	Language Identificationspeaker-diarization	—Unverified	0
The Second DISPLACE Challenge : DIarization of SPeaker and LAnguage in Conversational Environments	Jun 13, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions	Jun 12, 2024	speaker-diarizationSpeaker Diarization	CodeCode Available	1
Neural Blind Source Separation and Diarization for Distant Speech Recognition	Jun 12, 2024	blind source separationDistant Speech Recognition	—Unverified	0
Target Speech Diarization with Multimodal Prompts	Jun 11, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
LLM-based speaker diarization correction: A generalizable approach	Jun 7, 2024	speaker-diarizationSpeaker Diarization	CodeCode Available	1
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings	Jun 5, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization	May 15, 2024	Action DetectionActivity Detection	—Unverified	0
A Semi-Automatic Approach to Create Large Gender- and Age-Balanced Speaker Corpora: Usefulness of Speaker Diarization & Identification	Apr 26, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
Unsupervised Speaker Diarization in Distributed IoT Networks Using Federated Learning	Apr 16, 2024	Change DetectionFederated Learning	—Unverified	0
3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization	Mar 29, 2024	Self-Supervised Learningspeaker-diarization	CodeCode Available	0
Assessing the Robustness of Spectral Clustering for Deep Speaker Diarization	Mar 21, 2024	Clusteringspeaker-diarization	—Unverified	0
Improving Speaker Assignment in Speaker-Attributed ASR for Real Meeting Applications	Mar 11, 2024	Action DetectionActivity Detection	—Unverified	0
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings	Mar 4, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	2
Listening to Multi-talker Conversations: Modular and End-to-end Perspectives	Feb 14, 2024	GPUspeaker-diarization	—Unverified	0
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection	Feb 13, 2024	Action DetectionActivity Detection	—Unverified	0
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models	Feb 12, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Online speaker diarization of meetings guided by speech separation	Jan 30, 2024	Action DetectionActivity Detection	CodeCode Available	1
Spatial-Temporal Activity-Informed Diarization and Separation	Jan 30, 2024	speaker-diarizationSpeaker Diarization	—Unverified	0
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization	Jan 23, 2024	ClusteringGraph Clustering	CodeCode Available	0
NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription	Jan 16, 2024	Automatic Speech RecognitionBenchmarking	—Unverified	0
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization	Jan 16, 2024	Action DetectionActivity Detection	—Unverified	0
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation	Jan 7, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	CodeCode Available	0
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models	Jan 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	3
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification	Dec 28, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Speaker Mask Transformer for Multi-talker Overlapped Speech Recognition	Dec 18, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
EEND-DEMUX: End-to-End Neural Speaker Diarization via Demultiplexed Speaker Embeddings	Dec 11, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization	Dec 7, 2023	Decoderspeaker-diarization	—Unverified	0
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors	Dec 7, 2023	Decoderspeaker-diarization	CodeCode Available	1
Summary of the DISPLACE Challenge 2023 -- DIarization of SPeaker and LAnguage in Conversational Environments	Nov 21, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
UniX-Encoder: A Universal X-Channel Speech Encoder for Ad-Hoc Microphone Array Speech Processing	Oct 25, 2023	speaker-diarizationSpeaker Diarization	—Unverified	0
Powerset multi-class cross entropy loss for neural speaker diarization	Oct 19, 2023	Multi-class ClassificationMulti-Label Classification	CodeCode Available	0
EmoDiarize: Speaker Diarization and Emotion Identification from Speech Signals using Convolutional Neural Networks	Oct 19, 2023	Data AugmentationEmotion Recognition	—Unverified	0
Property-Aware Multi-Speaker Data Simulation: A Probabilistic Modelling Technique for Synthetic Data Generation	Oct 18, 2023	Action DetectionActivity Detection	—Unverified	0

Show:10 25 50

← PrevPage 2 of 7Next →

All datasets CALLHOME NIST-SRE 2000 AMI Lapel AMI MixHeadset CH109 DIHARD ETAPE AMI CALLHOME-109 AliMeeting DIHARD II Hub5'00 CallHome

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	COS+NJW-SC (Oracle SAD)	DER(%)	24.05	—	Unverified
2	EEND	DER(%)	23.07	—	Unverified
3	COS+AHC (Oracle SAD)	DER(%)	21.13	—	Unverified
4	SA-EEND (2-spk, no-adapt)	DER(%)	12.66	—	Unverified
5	EEND-OLA	DER(%)	12.57	—	Unverified
6	SA-EEND (2-spk, adapted)	DER(%)	10.76	—	Unverified
7	TOLD	DER(%)	10.14	—	Unverified
8	COS+B-SC (Oracle SAD)	DER(ig olp)	8.78	—	Unverified
9	PLDA+AHC (Oracle SAD)	DER(ig olp)	8.39	—	Unverified
10	COS+NME-SC (Oracle SAD)	DER(ig olp)	7.29	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	8.39	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	6.73	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	6.47	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	6.37	—	Unverified
5	x-vector (MCGAN)	DER(%)	5.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ECAPA (SC)	DER(%)	2.36	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	2.03	—	Unverified
3	TitaNet-S (NME-SC)	DER(%)	2	—	Unverified
4	TitaNet-M (NME-SC)	DER(%)	1.99	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TitaNet-S (NME-SC)	DER(%)	2.22	—	Unverified
2	TitaNet-M (NME-SC)	DER(%)	1.79	—	Unverified
3	ECAPA (SC)	DER(%)	1.78	—	Unverified
4	TitaNet-L (NME-SC)	DER(%)	1.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	x-vector (PLDA + AHC)	DER(%)	9.72	—	Unverified
2	TitaNet-L (NME-SC)	DER(%)	1.19	—	Unverified
3	TitaNet-M (NME-SC)	DER(%)	1.13	—	Unverified
4	TitaNet-S (NME-SC)	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline (the best result in the literature as of Oct.2019)	DER(%)	11.2	—	Unverified
2	pyannote (MFCC)	DER(%)	10.5	—	Unverified
3	pyannote (waveform)	DER(%)	9.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Baseline	DER(%)	7.7	—	Unverified
2	pyannote (MFCC)	DER(%)	5.6	—	Unverified
3	pyannote (waveform)	DER(%)	4.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	pyannote (MFCC)	DER(%)	6.3	—	Unverified
2	pyannote (waveform)	DER(%)	6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	d-vector + spectral	DER(%)	12.54	—	Unverified
2	titanet-s	DER(%)	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SOND	DER(%)	4.46	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN-SML	DER(%)	27.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UIS-RNN	V	10.6	—	Unverified