SOTAVerified

Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Showing 51–100 of 359 papers

TitleStatusHype
MESH2IR: Neural Acoustic Impulse Response Generator for Complex 3D ScenesCode1
USEF-TSE: Universal Speaker Embedding Free Target Speaker ExtractionCode1
WaveCRN: An Efficient Convolutional Recurrent Neural Network for End-to-end Speech EnhancementCode1
SepMamba: State-space models for speaker separation using MambaCode1
Group Communication with Context Codec for Lightweight Source SeparationCode1
The Cone of Silence: Speech Separation by LocalizationCode1
Attention is All You Need in Speech SeparationCode1
End-to-end Microphone Permutation and Number Invariant Multi-channel Speech SeparationCode1
A cappella: Audio-visual Singing Voice SeparationCode1
Dual-path RNN: efficient long sequence modeling for time-domain single-channel speech separationCode1
MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-AttentionsCode1
Continuous speech separation: dataset and analysisCode1
Towards Audio Codec-based Speech SeparationCode1
An Overview of Deep-Learning-Based Audio-Visual Speech Enhancement and SeparationCode1
Continuous Speech Separation with ConformerCode1
Effective Low-Cost Time-Domain Audio Separation Using Globally Attentive Locally Recurrent NetworksCode1
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical CircuitsCode1
Enhanced Reverberation as Supervision for Unsupervised Speech SeparationCode1
Graph-PIT: Generalized permutation invariant training for continuous separation of arbitrary numbers of speakersCode1
GEV Beamforming Supported by DOA-based Masks Generated on Pairs of MicrophonesCode1
Papez: Resource-Efficient Speech Separation with Auditory Working MemoryCode1
Improving speaker discrimination of target speech extraction with time-domain SpeakerBeamCode1
Unifying Speech Enhancement and Separation with Gradient Modulation for End-to-End Noise-Robust Speech SeparationCode1
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion PriorCode1
TasNet: time-domain audio separation network for real-time, single-channel speech separationCode0
Complementing Handcrafted Features with Raw Waveform Using a Light-weight Auxiliary ModelCode0
Analysis of impact of emotions on target speech extraction and speech separationCode0
SPGM: Prioritizing Local Features for enhanced speech separation performanceCode0
Speaker Extraction with Co-Speech Gestures CueCode0
CasNet: Investigating Channel Robustness for Speech SeparationCode0
ADL-MVDR: All deep learning MVDR beamformer for target speech separationCode0
Speech Separation with Pretrained Frontend to Minimize Domain MismatchCode0
A Multi-Phase Gammatone Filterbank for Speech Separation via TasNetCode0
Singing Voice Separation with Deep U-Net Convolutional NetworksCode0
Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker SeparationCode0
Beyond Speaker Identity: Text Guided Target Speech ExtractionCode0
CSLNSpeech: solving extended speech separation problem with the help of Chinese sign languageCode0
Disentangling the Impacts of Language and Channel Variability on Speech Separation NetworksCode0
Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech SeparationCode0
REAL-M: Towards Speech Separation on Real MixturesCode0
Semi-Supervised Monaural Singing Voice Separation With a Masking Network Trained on Synthetic MixturesCode0
Deep Recurrent NMF for Speech Separation by Unfolding Iterative ThresholdingCode0
An enhanced Conv-TasNet model for speech separation using a speaker distance-based loss functionCode0
Onssen: an open-source speech separation and enhancement libraryCode0
Multi-Decoder DPRNN: High Accuracy Source Counting and SeparationCode0
Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural NetworksCode0
Deep learning for monaural speech separationCode0
Deep Karaoke: Extracting Vocals from Musical Mixtures Using a Convolutional Deep Neural NetworkCode0
Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech SeparationCode0
Deep attractor network for single-microphone speaker separationCode0
Show:102550
← PrevPage 2 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (L) + DMSI-SDRi25.1—Unverified
2SepReformer-LSI-SDRi25.1—Unverified
3TF-Locoformer (M) + DMSI-SDRi24.6—Unverified
4TF-Locoformer (L)SI-SDRi24.2—Unverified
5MossFormer2 (L)SI-SDRi24.1—Unverified
6SepTDA (L=12)SI-SDRi24—Unverified
7Separate And DiffuseSI-SDRi23.9—Unverified
8TF-Locoformer (M)SI-SDRi23.6—Unverified
9MossFormer (L) + DMSI-SDRi22.8—Unverified
10TF-Locoformer (S) + DMSI-SDRi22.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (M)SI-SDRi18.5—Unverified
2TF-Locoformer (S)SI-SDRi17.4—Unverified
3SepReformer-L + DMSI-SDRi17.1—Unverified
4MossFormer2SI-SDRi17—Unverified
5MossFormer (L) + DMSI-SDRi16.3—Unverified
6TD-Conformer (XL) + DMSI-SDRi14.6—Unverified
7Improved Sudo rm -rf (U=36)SI-SDRi13.5—Unverified
8TD-Conformer (L) + DMSI-SDRi13.4—Unverified
9WavesplitSI-SDRi13.2—Unverified
10DPTNET - SRSSNSI-SDRi12.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2 (w speed perturb)SI-SDRi22.2—Unverified
2TF-Locoformer (M)SI-SDRi22.1—Unverified
3MossFormer2 (w/o DM)SI-SDRi21.7—Unverified
4Separate And DiffuseSI-SDRi21.5—Unverified
5WHYVSI-SDRi17.5—Unverified
6TDANet LargeSI-SDRi17.4—Unverified
7TDANetSI-SDRi16.9—Unverified
8Conv-Tasnet (Libri1Mix speech enhancement pre-trained)SI-SDRi14.1—Unverified
9Conv-Tasnet (Libri1Mix speech enhancement multi-task)SI-SDRi13.7—Unverified
10Conv-TasnetSI-SDRi13.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi23.7—Unverified
2MossFormer2SI-SDRi22.2—Unverified
3MossFormer (L) + DMSI-SDRi21.2—Unverified
4Separate And DiffuseSI-SDRi20.9—Unverified
5MossFormer (M) + DMSI-SDRi20.8—Unverified
6SepItSI-SDRi20.1—Unverified
7SepFormerSI-SDRi19.5—Unverified
8SandglassetSI-SDRi17.1—Unverified
9Gated DualPathRNNSI-SDRi16.85—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi16.4—Unverified
2TDFNet-largeSI-SNRi15.8—Unverified
3TDFNet (MHSA + Shared)SI-SNRi15—Unverified
4RTFS-Net-12SI-SNRi14.9—Unverified
5RTFS-Net-6SI-SNRi14.6—Unverified
6CTCNetSI-SNRi14.3—Unverified
7RTFS-Net-4SI-SNRi14.1—Unverified
8TDFNet-smallSI-SNRi13.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SepReformer-L + DMSI-SDRi18.4—Unverified
2MossFormer2SI-SDRi18.1—Unverified
3MossFormer (L) + DMSI-SDRi17.3—Unverified
4TDANet LargeSI-SDRi15.2—Unverified
5TDANetSI-SDRi14.8—Unverified
6WHYVSI-SDRi12.96—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi21—Unverified
2Hungarian PITSI-SDRi13.22—Unverified
3Conditional TasNetSI-SDRi11.7—Unverified
4TasTasSI-SDRi11.14—Unverified
5Gated DualPathRNNSI-SDRi10.56—Unverified
6Multi-Decoder DPRNNSI-SDRi5.9—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi18.3—Unverified
2RTFS-Net-12SI-SNRi17.5—Unverified
3CTCNetSI-SNRi17.4—Unverified
4RTFS-Net-6SI-SNRi16.9—Unverified
5RTFS-Net-4SI-SNRi15.5—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi14—Unverified
2RTFS-Net-12SI-SNRi12.4—Unverified
3CTCNetSI-SNRi11.9—Unverified
4RTFS-Net-6SI-SNRi11.8—Unverified
5RTFS-Net-4SI-SNRi11.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi22—Unverified
2Gated DualPathRNNSI-SDRi12.88—Unverified
3Conditional TasNetSI-SDRi12.5—Unverified
4OR-PITSI-SDRi10.2—Unverified
5Multi-Decoder DPRNNSI-SDRi9.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi14.2—Unverified
2SepItSI-SDRi13.7—Unverified
3OCDSI-SDRi13.4—Unverified
4Hungarian PITSI-SDRi12.72—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi9—Unverified
2SepItSI-SDRi8.2—Unverified
3Hungarian PITSI-SDRi7.78—Unverified
#ModelMetricClaimedVerifiedStatus
1SDR9.6—Unverified
2Audio-Visual concat-refSDR8.05—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi5.2—Unverified
2Hungarian PITSI-SDRi4.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer (base)0S5.6—Unverified
2Conformer (large)0S5.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Hungarian PITSI-SDRi5.66—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refSDR10.55—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2SI-SDRi20.5—Unverified