SOTAVerified

Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Showing 201–250 of 359 papers

TitleStatusHype
Audio-Visual Speech Separation Using Cross-Modal Correspondence Loss—0
Audio-visual Speech Separation with Adversarially Disentangled Visual Representation—0
Audio-Visual Target Speaker Enhancement on Multi-Talker Environment using Event-Driven Cameras—0
A Unified Framework for Speech Separation—0
BERT for Joint Multichannel Speech Dereverberation with Spatial-aware Tasks—0
Block-Online Guided Source Separation—0
Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor—0
Handling Trade-Offs in Speech Separation with Sparsely-Gated Mixture of Experts—0
Building Corpora for Single-Channel Speech Separation Across Multiple Domains—0
Causal Self-supervised Pretrained Frontend with Predictive Code for Speech Separation—0
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings—0
Coarse-to-Fine Recursive Speech Separation for Unknown Number of Speakers—0
Cocktail Party Processing via Structured Prediction—0
Configurable Privacy-Preserving Automatic Speech Recognition—0
Continuous Speech Separation Using Speaker Inventory for Long Multi-talker Recording—0
Continuous Speech Separation with Ad Hoc Microphone Arrays—0
Continuous Speech Separation with Recurrent Selective Attention Network—0
Continuous Streaming Multi-Talker ASR with Dual-path Transducers—0
Conversational Speech Separation: an Evaluation Study for Streaming Applications—0
Conv-NILM-Net, a causal and multi-appliance model for energy source separation—0
Cross-Talk Reduction—0
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions—0
Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation—0
Deep AHS: A Deep Learning Approach to Acoustic Howling Suppression—0
Deep Attention Fusion Feature for Speech Separation with End-to-End Post-filter Method—0
Deep Clustering and Conventional Networks for Music Separation: Stronger Together—0
Deep Learning for Joint Acoustic Echo and Acoustic Howling Suppression in Hybrid Meetings—0
Deep Neural Mel-Subband Beamformer for In-car Speech Separation—0
Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair—0
Deep neural network techniques for monaural speech enhancement: state of the art analysis—0
Deep Variational Generative Models for Audio-visual Speech Separation—0
Demystifying TasNet: A Dissecting Approach—0
Diffusion-based Signal Refiner for Speech Separation—0
Directed Speech Separation for Automatic Speech Recognition of Long Form Conversational Speech—0
Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem—0
Discriminative Learning for Monaural Speech Separation Using Deep Embedding Features—0
DNN driven Speaker Independent Audio-Visual Mask Estimation for Speech Separation—0
Dual-Path Cross-Modal Attention for better Audio-Visual Speech Extraction—0
Dual-Path Filter Network: Speaker-Aware Modeling for Speech Separation—0
Dual-Path Modeling for Long Recording Speech Separation in Meetings—0
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation—0
Dynamic Slimmable Networks for Efficient Speech Separation—0
EDSep: An Effective Diffusion-Based Method for Speech Source Separation—0
EEG-informed attended speaker extraction from recorded speech mixtures with application in neuro-steered hearing prostheses—0
EEND-SS: Joint End-to-End Neural Speaker Diarization and Speech Separation for Flexible Number of Speakers—0
Effects of Dataset Sampling Rate for Noise Cancellation through Deep Learning—0
Efficient Integration of Multi-channel Information for Speaker-independent Speech Separation—0
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes—0
Speech separation with large-scale self-supervised learning—0
STCON System for the CHiME-8 Challenge—0
Show:102550
← PrevPage 5 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (L) + DMSI-SDRi25.1—Unverified
2SepReformer-LSI-SDRi25.1—Unverified
3TF-Locoformer (M) + DMSI-SDRi24.6—Unverified
4TF-Locoformer (L)SI-SDRi24.2—Unverified
5MossFormer2 (L)SI-SDRi24.1—Unverified
6SepTDA (L=12)SI-SDRi24—Unverified
7Separate And DiffuseSI-SDRi23.9—Unverified
8TF-Locoformer (M)SI-SDRi23.6—Unverified
9MossFormer (L) + DMSI-SDRi22.8—Unverified
10TF-Locoformer (S) + DMSI-SDRi22.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (M)SI-SDRi18.5—Unverified
2TF-Locoformer (S)SI-SDRi17.4—Unverified
3SepReformer-L + DMSI-SDRi17.1—Unverified
4MossFormer2SI-SDRi17—Unverified
5MossFormer (L) + DMSI-SDRi16.3—Unverified
6TD-Conformer (XL) + DMSI-SDRi14.6—Unverified
7Improved Sudo rm -rf (U=36)SI-SDRi13.5—Unverified
8TD-Conformer (L) + DMSI-SDRi13.4—Unverified
9WavesplitSI-SDRi13.2—Unverified
10DPTNET - SRSSNSI-SDRi12.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2 (w speed perturb)SI-SDRi22.2—Unverified
2TF-Locoformer (M)SI-SDRi22.1—Unverified
3MossFormer2 (w/o DM)SI-SDRi21.7—Unverified
4Separate And DiffuseSI-SDRi21.5—Unverified
5WHYVSI-SDRi17.5—Unverified
6TDANet LargeSI-SDRi17.4—Unverified
7TDANetSI-SDRi16.9—Unverified
8Conv-Tasnet (Libri1Mix speech enhancement pre-trained)SI-SDRi14.1—Unverified
9Conv-Tasnet (Libri1Mix speech enhancement multi-task)SI-SDRi13.7—Unverified
10Conv-TasnetSI-SDRi13.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi23.7—Unverified
2MossFormer2SI-SDRi22.2—Unverified
3MossFormer (L) + DMSI-SDRi21.2—Unverified
4Separate And DiffuseSI-SDRi20.9—Unverified
5MossFormer (M) + DMSI-SDRi20.8—Unverified
6SepItSI-SDRi20.1—Unverified
7SepFormerSI-SDRi19.5—Unverified
8SandglassetSI-SDRi17.1—Unverified
9Gated DualPathRNNSI-SDRi16.85—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi16.4—Unverified
2TDFNet-largeSI-SNRi15.8—Unverified
3TDFNet (MHSA + Shared)SI-SNRi15—Unverified
4RTFS-Net-12SI-SNRi14.9—Unverified
5RTFS-Net-6SI-SNRi14.6—Unverified
6CTCNetSI-SNRi14.3—Unverified
7RTFS-Net-4SI-SNRi14.1—Unverified
8TDFNet-smallSI-SNRi13.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SepReformer-L + DMSI-SDRi18.4—Unverified
2MossFormer2SI-SDRi18.1—Unverified
3MossFormer (L) + DMSI-SDRi17.3—Unverified
4TDANet LargeSI-SDRi15.2—Unverified
5TDANetSI-SDRi14.8—Unverified
6WHYVSI-SDRi12.96—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi21—Unverified
2Hungarian PITSI-SDRi13.22—Unverified
3Conditional TasNetSI-SDRi11.7—Unverified
4TasTasSI-SDRi11.14—Unverified
5Gated DualPathRNNSI-SDRi10.56—Unverified
6Multi-Decoder DPRNNSI-SDRi5.9—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi18.3—Unverified
2RTFS-Net-12SI-SNRi17.5—Unverified
3CTCNetSI-SNRi17.4—Unverified
4RTFS-Net-6SI-SNRi16.9—Unverified
5RTFS-Net-4SI-SNRi15.5—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi14—Unverified
2RTFS-Net-12SI-SNRi12.4—Unverified
3CTCNetSI-SNRi11.9—Unverified
4RTFS-Net-6SI-SNRi11.8—Unverified
5RTFS-Net-4SI-SNRi11.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi22—Unverified
2Gated DualPathRNNSI-SDRi12.88—Unverified
3Conditional TasNetSI-SDRi12.5—Unverified
4OR-PITSI-SDRi10.2—Unverified
5Multi-Decoder DPRNNSI-SDRi9.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi14.2—Unverified
2SepItSI-SDRi13.7—Unverified
3OCDSI-SDRi13.4—Unverified
4Hungarian PITSI-SDRi12.72—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi9—Unverified
2SepItSI-SDRi8.2—Unverified
3Hungarian PITSI-SDRi7.78—Unverified
#ModelMetricClaimedVerifiedStatus
1SDR9.6—Unverified
2Audio-Visual concat-refSDR8.05—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi5.2—Unverified
2Hungarian PITSI-SDRi4.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer (base)0S5.6—Unverified
2Conformer (large)0S5.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Hungarian PITSI-SDRi5.66—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refSDR10.55—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2SI-SDRi20.5—Unverified