Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 101–150 of 359 papers

Title	Date	Tasks	Status	Hype
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations	Mar 21, 2023	Action DetectionActivity Detection	—Unverified	0
Towards Real-Time Single-Channel Speech Separation in Noisy and Reverberant Environments	Mar 14, 2023	DecoderSpeech Separation	—Unverified	0
Online Binaural Speech Separation of Moving Speakers With a Wavesplit Network	Mar 13, 2023	Online ClusteringSpeaker Separation	—Unverified	0
Learning-based Robust Speaker Counting and Separation with the Aid of Spatial Coherence	Mar 13, 2023	Speaker SeparationSpeech Separation	—Unverified	0
A Multi-Stage Triple-Path Method for Speech Separation in Noisy and Reverberant Environments	Mar 7, 2023	DenoisingSpeech Denoising	—Unverified	0
Multi-Dimensional and Multi-Scale Modeling for Speech Separation Optimized by Discriminative Learning	Mar 7, 2023	Speech Separation	—Unverified	0
Scaling strategies for on-device low-complexity source separation with Conv-Tasnet	Mar 6, 2023	Speech Separation	—Unverified	0
MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions	Feb 23, 2023	Speech Separation	CodeCode Available	1
Unifying Speech Enhancement and Separation with Gradient Modulation for End-to-End Noise-Robust Speech Separation	Feb 22, 2023	Multi-Task LearningSpeech Enhancement	CodeCode Available	1
Deep AHS: A Deep Learning Approach to Acoustic Howling Suppression	Feb 18, 2023	Deep LearningSpeech Separation	—Unverified	0
Short-Term Memory Convolutions	Feb 8, 2023	Acoustic Scene ClassificationScene Classification	—Unverified	0
Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation	Jan 25, 2023	Audio Source SeparationGeneralization Bounds	—Unverified	0
Improving Target Speaker Extraction with Sparse LDA-transformed Speaker Embeddings	Jan 16, 2023	Speaker VerificationSpeech Separation	—Unverified	0
Multi-resolution location-based training for multi-channel continuous speech separation	Jan 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits	Dec 21, 2022	Speech Separation	CodeCode Available	1
MIMO-DBnet: Multi-channel Input and Multiple Outputs DOA-aware Beamforming Network for Speech Separation	Dec 7, 2022	Speech Separation	—Unverified	0
Deep neural network techniques for monaural speech enhancement: state of the art analysis	Dec 1, 2022	Art AnalysisImage Generation	—Unverified	0
Deep Neural Mel-Subband Beamformer for In-car Speech Separation	Nov 22, 2022	Speech Separation	—Unverified	0
Self-Remixing: Unsupervised Speech Separation via Separation and Remixing	Nov 18, 2022	Domain AdaptationSemi-supervised Domain Adaptation	—Unverified	0
Reverberation as Supervision for Speech Separation	Nov 15, 2022	Speech Separation	—Unverified	0
Handling Trade-Offs in Speech Separation with Sparsely-Gated Mixture of Experts	Nov 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
An Adapter based Multi-label Pre-training for Speech Separation and Enhancement	Nov 11, 2022	DenoisingPseudo Label	—Unverified	0
Speech separation with large-scale self-supervised learning	Nov 9, 2022	Self-Supervised LearningSpeech Separation	—Unverified	0
Spatially Selective Deep Non-linear Filters for Speaker Extraction	Nov 4, 2022	Speech Separation	—Unverified	0
SCA: Streaming Cross-attention Alignment for Echo Cancellation	Nov 1, 2022	Speech EnhancementSpeech Separation	—Unverified	0
Audio-Visual Speech Enhancement and Separation by Utilizing Multi-Modal Self-Supervised Embeddings	Oct 31, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
CasNet: Investigating Channel Robustness for Speech Separation	Oct 27, 2022	Speech Separation	CodeCode Available	0
Deformable Temporal Convolutional Networks for Monaural Noisy Reverberant Speech Separation	Oct 27, 2022	Speech DereverberationSpeech Separation	CodeCode Available	1
Provable Subspace Identification Under Post-Nonlinear Mixtures	Oct 14, 2022	Causal DiscoverySpeech Separation	—Unverified	0
OCD: Learning to Overfit with Conditional Diffusion Models	Oct 2, 2022	3D ReconstructionDenoising	CodeCode Available	1
An efficient encoder-decoder architecture with top-down attention for speech separation	Sep 30, 2022	CPU	CodeCode Available	2
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement	Sep 22, 2022	Audio Super-ResolutionAutomatic Speech Recognition	CodeCode Available	2
VarArray Meets t-SOT: Advancing the State of the Art of Streaming Distant Conversational Speech Recognition	Sep 12, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Streaming Target-Speaker ASR with Neural Transducer	Sep 9, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Analysis of impact of emotions on target speech extraction and speech separation	Aug 15, 2022	Speaker VerificationSpeech Extraction	CodeCode Available	0
Recycling an anechoic pre-trained speech separation deep neural network for binaural dereverberation of a single source	Aug 9, 2022	Speech Separation	—Unverified	0
Conv-NILM-Net, a causal and multi-appliance model for energy source separation	Aug 3, 2022	Non-Intrusive Load MonitoringSpeech Separation	—Unverified	0
ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding	Jul 19, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
SATTS: Speaker Attractor Text to Speech, Learning to Speak by Learning to Separate	Jul 13, 2022	Speech Separationtext-to-speech	—Unverified	0
Dual-Path Cross-Modal Attention for better Audio-Visual Speech Extraction	Jul 9, 2022	Speech ExtractionSpeech Separation	—Unverified	0
Multi-Modal Multi-Correlation Learning for Audio-Visual Speech Separation	Jul 4, 2022	Contrastive LearningSpeech Separation	—Unverified	0
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes	Jun 23, 2022	Speech EnhancementSpeech Separation	—Unverified	0
Resource-Efficient Separation Transformer	Jun 19, 2022	Speech Separation	—Unverified	0
Simultaneous Speech Extraction for Multiple Target Speakers under the Meeting Scenarios	Jun 17, 2022	Action DetectionActivity Detection	—Unverified	0
AmbiSep: Ambisonic-to-Ambisonic Reverberant Speech Separation Using Transformer Networks	Jun 13, 2022	Speech Separation	—Unverified	0
Conversational Speech Separation: an Evaluation Study for Streaming Applications	May 31, 2022	Speech Separation	—Unverified	0
An enhanced Conv-TasNet model for speech separation using a speaker distance-based loss function	May 26, 2022	Speech Separation	CodeCode Available	0
SepIt: Approaching a Single Channel Speech Separation Bound	May 24, 2022	Audio Source SeparationGeneralization Bounds	—Unverified	0
MESH2IR: Neural Acoustic Impulse Response Generator for Complex 3D Scenes	May 18, 2022	2kCPU	CodeCode Available	1
Separator-Transducer-Segmenter: Streaming Recognition and Segmentation of Multi-party Speech	May 10, 2022	Segmentationspeech-recognition	—Unverified	0

Show:10 25 50

← PrevPage 3 of 8Next →

All datasets WSJ0-2mix WHAMR!Libri2Mix WSJ0-3mix LRS2 WHAM!WSJ0-5mix LRS3 VoxCeleb2 WSJ0-4mix Libri5Mix Libri10Mix

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	TF-Locoformer (L) + DM	SI-SDRi	25.1	—	Unverified
2	SepReformer-L	SI-SDRi	25.1	—	Unverified
3	TF-Locoformer (M) + DM	SI-SDRi	24.6	—	Unverified
4	TF-Locoformer (L)	SI-SDRi	24.2	—	Unverified
5	MossFormer2 (L)	SI-SDRi	24.1	—	Unverified
6	SepTDA (L=12)	SI-SDRi	24	—	Unverified
7	Separate And Diffuse	SI-SDRi	23.9	—	Unverified
8	TF-Locoformer (M)	SI-SDRi	23.6	—	Unverified
9	MossFormer (L) + DM	SI-SDRi	22.8	—	Unverified
10	TF-Locoformer (S) + DM	SI-SDRi	22.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TF-Locoformer (M)	SI-SDRi	18.5	—	Unverified
2	TF-Locoformer (S)	SI-SDRi	17.4	—	Unverified
3	SepReformer-L + DM	SI-SDRi	17.1	—	Unverified
4	MossFormer2	SI-SDRi	17	—	Unverified
5	MossFormer (L) + DM	SI-SDRi	16.3	—	Unverified
6	TD-Conformer (XL) + DM	SI-SDRi	14.6	—	Unverified
7	Improved Sudo rm -rf (U=36)	SI-SDRi	13.5	—	Unverified
8	TD-Conformer (L) + DM	SI-SDRi	13.4	—	Unverified
9	Wavesplit	SI-SDRi	13.2	—	Unverified
10	DPTNET - SRSSN	SI-SDRi	12.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MossFormer2 (w speed perturb)	SI-SDRi	22.2	—	Unverified
2	TF-Locoformer (M)	SI-SDRi	22.1	—	Unverified
3	MossFormer2 (w/o DM)	SI-SDRi	21.7	—	Unverified
4	Separate And Diffuse	SI-SDRi	21.5	—	Unverified
5	WHYV	SI-SDRi	17.5	—	Unverified
6	TDANet Large	SI-SDRi	17.4	—	Unverified
7	TDANet	SI-SDRi	16.9	—	Unverified
8	Conv-Tasnet (Libri1Mix speech enhancement pre-trained)	SI-SDRi	14.1	—	Unverified
9	Conv-Tasnet (Libri1Mix speech enhancement multi-task)	SI-SDRi	13.7	—	Unverified
10	Conv-Tasnet	SI-SDRi	13.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepTDA	SI-SDRi	23.7	—	Unverified
2	MossFormer2	SI-SDRi	22.2	—	Unverified
3	MossFormer (L) + DM	SI-SDRi	21.2	—	Unverified
4	Separate And Diffuse	SI-SDRi	20.9	—	Unverified
5	MossFormer (M) + DM	SI-SDRi	20.8	—	Unverified
6	SepIt	SI-SDRi	20.1	—	Unverified
7	SepFormer	SI-SDRi	19.5	—	Unverified
8	Sandglasset	SI-SDRi	17.1	—	Unverified
9	Gated DualPathRNN	SI-SDRi	16.85	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	IIANet	SI-SNRi	16.4	—	Unverified
2	TDFNet-large	SI-SNRi	15.8	—	Unverified
3	TDFNet (MHSA + Shared)	SI-SNRi	15	—	Unverified
4	RTFS-Net-12	SI-SNRi	14.9	—	Unverified
5	RTFS-Net-6	SI-SNRi	14.6	—	Unverified
6	CTCNet	SI-SNRi	14.3	—	Unverified
7	RTFS-Net-4	SI-SNRi	14.1	—	Unverified
8	TDFNet-small	SI-SNRi	13.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepReformer-L + DM	SI-SDRi	18.4	—	Unverified
2	MossFormer2	SI-SDRi	18.1	—	Unverified
3	MossFormer (L) + DM	SI-SDRi	17.3	—	Unverified
4	TDANet Large	SI-SDRi	15.2	—	Unverified
5	TDANet	SI-SDRi	14.8	—	Unverified
6	WHYV	SI-SDRi	12.96	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepTDA	SI-SDRi	21	—	Unverified
2	Hungarian PIT	SI-SDRi	13.22	—	Unverified
3	Conditional TasNet	SI-SDRi	11.7	—	Unverified
4	TasTas	SI-SDRi	11.14	—	Unverified
5	Gated DualPathRNN	SI-SDRi	10.56	—	Unverified
6	Multi-Decoder DPRNN	SI-SDRi	5.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	IIANet	SI-SNRi	18.3	—	Unverified
2	RTFS-Net-12	SI-SNRi	17.5	—	Unverified
3	CTCNet	SI-SNRi	17.4	—	Unverified
4	RTFS-Net-6	SI-SNRi	16.9	—	Unverified
5	RTFS-Net-4	SI-SNRi	15.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	IIANet	SI-SNRi	14	—	Unverified
2	RTFS-Net-12	SI-SNRi	12.4	—	Unverified
3	CTCNet	SI-SNRi	11.9	—	Unverified
4	RTFS-Net-6	SI-SNRi	11.8	—	Unverified
5	RTFS-Net-4	SI-SNRi	11.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepTDA	SI-SDRi	22	—	Unverified
2	Gated DualPathRNN	SI-SDRi	12.88	—	Unverified
3	Conditional TasNet	SI-SDRi	12.5	—	Unverified
4	OR-PIT	SI-SDRi	10.2	—	Unverified
5	Multi-Decoder DPRNN	SI-SDRi	9.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Separate And Diffuse	SI-SDRi	14.2	—	Unverified
2	SepIt	SI-SDRi	13.7	—	Unverified
3	OCD	SI-SDRi	13.4	—	Unverified
4	Hungarian PIT	SI-SDRi	12.72	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Separate And Diffuse	SI-SDRi	9	—	Unverified
2	SepIt	SI-SDRi	8.2	—	Unverified
3	Hungarian PIT	SI-SDRi	7.78	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		SDR	9.6	—	Unverified
2	Audio-Visual concat-ref	SDR	8.05	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Separate And Diffuse	SI-SDRi	5.2	—	Unverified
2	Hungarian PIT	SI-SDRi	4.26	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer (base)	0S	5.6	—	Unverified
2	Conformer (large)	0S	5.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Hungarian PIT	SI-SDRi	5.66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	SDR	10.55	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MossFormer2	SI-SDRi	20.5	—	Unverified