SOTAVerified

Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Showing 301–350 of 359 papers

TitleStatusHype
Short-Term Memory Convolutions—0
Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition—0
Simultaneous Denoising and Dereverberation Using Deep Embedding Features—0
Simultaneous Speech Extraction for Multiple Target Speakers under the Meeting Scenarios—0
Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training—0
Single-channel speech separation using Soft-minimum Permutation Invariant Training—0
Single-Channel Speech Separation with Auxiliary Speaker Embeddings—0
Single-Channel Target Speech Extraction Utilizing Distance and Room Clues—0
Single-Microphone Speaker Separation and Voice Activity Detection in Noisy and Reverberant Environments—0
SkiM: Skipping Memory LSTM for Low-Latency Real-Time Continuous Speech Separation—0
Sound Signal Processing with Seq2Tree Network—0
Sparsely Overlapped Speech Training in the Time Domain: Joint Learning of Target Speech Separation and Personal VAD Benefits—0
Spatial and spectral deep attention fusion for multi-channel speech separation using deep embedding features—0
Spatially Selective Deep Non-linear Filters for Speaker Extraction—0
Speakerfilter-Pro: an improved target speaker extractor combines the time domain and frequency domain—0
Speaker-independent Speech Separation with Deep Attractor Network—0
Speech enhancement aided end-to-end multi-task learning for voice activity detection—0
Speech Separation based on Contrastive Learning and Deep Modularization—0
Speech Separation using Neural Audio Codecs with Embedding Loss—0
REAL-M: Towards Speech Separation on Real MixturesCode0
Two-Step Sound Source Separation: Training on Learned Latent TargetsCode0
WHAM!: Extending Speech Separation to Noisy EnvironmentsCode0
Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech SeparationCode0
Disentangling the Impacts of Language and Channel Variability on Speech Separation NetworksCode0
Interrupted and cascaded permutation invariant training for speech separationCode0
Deep Recurrent NMF for Speech Separation by Unfolding Iterative ThresholdingCode0
Onssen: an open-source speech separation and enhancement libraryCode0
Semi-Supervised Monaural Singing Voice Separation With a Masking Network Trained on Synthetic MixturesCode0
Deep learning for monaural speech separationCode0
Speech Separation with Pretrained Frontend to Minimize Domain MismatchCode0
Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural NetworksCode0
Improving Voice Separation by Incorporating End-to-end Speech RecognitionCode0
SPGM: Prioritizing Local Features for enhanced speech separation performanceCode0
Improved Speech Separation with Time-and-Frequency Cross-domain Joint Embedding and ClusteringCode0
An enhanced Conv-TasNet model for speech separation using a speaker distance-based loss functionCode0
Multi-Decoder DPRNN: High Accuracy Source Counting and SeparationCode0
Many-Speakers Single Channel Speech Separation with Optimal Permutation TrainingCode0
ADL-MVDR: All deep learning MVDR beamformer for target speech separationCode0
Deep attractor network for single-microphone speaker separationCode0
WPD++: An Improved Neural Beamformer for Simultaneous Speech Separation and DereverberationCode0
Complementing Handcrafted Features with Raw Waveform Using a Light-weight Auxiliary ModelCode0
Identify Speakers in Cocktail Parties with End-to-End AttentionCode0
Singing Voice Separation with Deep U-Net Convolutional NetworksCode0
Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech SeparationCode0
Unsupervised Deep Clustering for Source Separation: Direct Learning from Mixtures using Spatial InformationCode0
Analyzing the impact of speaker localization errors on speech separation for automatic speech recognitionCode0
Deep Karaoke: Extracting Vocals from Musical Mixtures Using a Convolutional Deep Neural NetworkCode0
CasNet: Investigating Channel Robustness for Speech SeparationCode0
Beyond Speaker Identity: Text Guided Target Speech ExtractionCode0
Filterbank design for end-to-end speech separationCode0
Show:102550
← PrevPage 7 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (L) + DMSI-SDRi25.1—Unverified
2SepReformer-LSI-SDRi25.1—Unverified
3TF-Locoformer (M) + DMSI-SDRi24.6—Unverified
4TF-Locoformer (L)SI-SDRi24.2—Unverified
5MossFormer2 (L)SI-SDRi24.1—Unverified
6SepTDA (L=12)SI-SDRi24—Unverified
7Separate And DiffuseSI-SDRi23.9—Unverified
8TF-Locoformer (M)SI-SDRi23.6—Unverified
9MossFormer (L) + DMSI-SDRi22.8—Unverified
10TF-Locoformer (S) + DMSI-SDRi22.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (M)SI-SDRi18.5—Unverified
2TF-Locoformer (S)SI-SDRi17.4—Unverified
3SepReformer-L + DMSI-SDRi17.1—Unverified
4MossFormer2SI-SDRi17—Unverified
5MossFormer (L) + DMSI-SDRi16.3—Unverified
6TD-Conformer (XL) + DMSI-SDRi14.6—Unverified
7Improved Sudo rm -rf (U=36)SI-SDRi13.5—Unverified
8TD-Conformer (L) + DMSI-SDRi13.4—Unverified
9WavesplitSI-SDRi13.2—Unverified
10DPTNET - SRSSNSI-SDRi12.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2 (w speed perturb)SI-SDRi22.2—Unverified
2TF-Locoformer (M)SI-SDRi22.1—Unverified
3MossFormer2 (w/o DM)SI-SDRi21.7—Unverified
4Separate And DiffuseSI-SDRi21.5—Unverified
5WHYVSI-SDRi17.5—Unverified
6TDANet LargeSI-SDRi17.4—Unverified
7TDANetSI-SDRi16.9—Unverified
8Conv-Tasnet (Libri1Mix speech enhancement pre-trained)SI-SDRi14.1—Unverified
9Conv-Tasnet (Libri1Mix speech enhancement multi-task)SI-SDRi13.7—Unverified
10Conv-TasnetSI-SDRi13.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi23.7—Unverified
2MossFormer2SI-SDRi22.2—Unverified
3MossFormer (L) + DMSI-SDRi21.2—Unverified
4Separate And DiffuseSI-SDRi20.9—Unverified
5MossFormer (M) + DMSI-SDRi20.8—Unverified
6SepItSI-SDRi20.1—Unverified
7SepFormerSI-SDRi19.5—Unverified
8SandglassetSI-SDRi17.1—Unverified
9Gated DualPathRNNSI-SDRi16.85—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi16.4—Unverified
2TDFNet-largeSI-SNRi15.8—Unverified
3TDFNet (MHSA + Shared)SI-SNRi15—Unverified
4RTFS-Net-12SI-SNRi14.9—Unverified
5RTFS-Net-6SI-SNRi14.6—Unverified
6CTCNetSI-SNRi14.3—Unverified
7RTFS-Net-4SI-SNRi14.1—Unverified
8TDFNet-smallSI-SNRi13.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SepReformer-L + DMSI-SDRi18.4—Unverified
2MossFormer2SI-SDRi18.1—Unverified
3MossFormer (L) + DMSI-SDRi17.3—Unverified
4TDANet LargeSI-SDRi15.2—Unverified
5TDANetSI-SDRi14.8—Unverified
6WHYVSI-SDRi12.96—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi21—Unverified
2Hungarian PITSI-SDRi13.22—Unverified
3Conditional TasNetSI-SDRi11.7—Unverified
4TasTasSI-SDRi11.14—Unverified
5Gated DualPathRNNSI-SDRi10.56—Unverified
6Multi-Decoder DPRNNSI-SDRi5.9—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi18.3—Unverified
2RTFS-Net-12SI-SNRi17.5—Unverified
3CTCNetSI-SNRi17.4—Unverified
4RTFS-Net-6SI-SNRi16.9—Unverified
5RTFS-Net-4SI-SNRi15.5—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi14—Unverified
2RTFS-Net-12SI-SNRi12.4—Unverified
3CTCNetSI-SNRi11.9—Unverified
4RTFS-Net-6SI-SNRi11.8—Unverified
5RTFS-Net-4SI-SNRi11.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi22—Unverified
2Gated DualPathRNNSI-SDRi12.88—Unverified
3Conditional TasNetSI-SDRi12.5—Unverified
4OR-PITSI-SDRi10.2—Unverified
5Multi-Decoder DPRNNSI-SDRi9.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi14.2—Unverified
2SepItSI-SDRi13.7—Unverified
3OCDSI-SDRi13.4—Unverified
4Hungarian PITSI-SDRi12.72—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi9—Unverified
2SepItSI-SDRi8.2—Unverified
3Hungarian PITSI-SDRi7.78—Unverified
#ModelMetricClaimedVerifiedStatus
1SDR9.6—Unverified
2Audio-Visual concat-refSDR8.05—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi5.2—Unverified
2Hungarian PITSI-SDRi4.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer (base)0S5.6—Unverified
2Conformer (large)0S5.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Hungarian PITSI-SDRi5.66—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refSDR10.55—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2SI-SDRi20.5—Unverified