SOTAVerified

Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Showing 1–25 of 359 papers

TitleStatusHype
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative PipelineCode3
SonicSim: A customizable simulation platform for speech processing in moving sound source scenariosCode3
Separate and Reconstruct: Asymmetric Encoder-Decoder for Speech SeparationCode3
SPMamba: State-space model is all you need in speech separationCode3
Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech SeparationCode3
Target Speaker ASR with WhisperCode2
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and EnhancementCode2
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and SynthesisCode2
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech SeparationCode2
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker RecordingsCode2
An efficient encoder-decoder architecture with top-down attention for speech separationCode2
CMGAN: Conformer-Based Metric-GAN for Monaural Speech EnhancementCode2
Voice Separation with an Unknown Number of Multiple SpeakersCode2
SepPrune: Structured Pruning for Efficient Deep Speech SeparationCode1
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion PriorCode1
VANPY: Voice Analysis FrameworkCode1
SepMamba: State-space models for speaker separation using MambaCode1
USEF-TSE: Universal Speaker Embedding Free Target Speaker ExtractionCode1
Enhanced Reverberation as Supervision for Unsupervised Speech SeparationCode1
Annealed Multiple Choice Learning: Overcoming limitations of Winner-takes-all with annealingCode1
Papez: Resource-Efficient Speech Separation with Auditory Working MemoryCode1
Text-aware Speech Separation for Multi-talker Keyword SpottingCode1
Towards Audio Codec-based Speech SeparationCode1
AV-CrossNet: an Audiovisual Complex Spectral Mapping Network for Speech Separation By Leveraging Narrow- and Cross-Band ModelingCode1
Noise-robust Speech Separation with Fast Generative CorrectionCode1
Show:102550
← PrevPage 1 of 15Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (L) + DMSI-SDRi25.1—Unverified
2SepReformer-LSI-SDRi25.1—Unverified
3TF-Locoformer (M) + DMSI-SDRi24.6—Unverified
4TF-Locoformer (L)SI-SDRi24.2—Unverified
5MossFormer2 (L)SI-SDRi24.1—Unverified
6SepTDA (L=12)SI-SDRi24—Unverified
7Separate And DiffuseSI-SDRi23.9—Unverified
8TF-Locoformer (M)SI-SDRi23.6—Unverified
9MossFormer (L) + DMSI-SDRi22.8—Unverified
10TF-Locoformer (S) + DMSI-SDRi22.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (M)SI-SDRi18.5—Unverified
2TF-Locoformer (S)SI-SDRi17.4—Unverified
3SepReformer-L + DMSI-SDRi17.1—Unverified
4MossFormer2SI-SDRi17—Unverified
5MossFormer (L) + DMSI-SDRi16.3—Unverified
6TD-Conformer (XL) + DMSI-SDRi14.6—Unverified
7Improved Sudo rm -rf (U=36)SI-SDRi13.5—Unverified
8TD-Conformer (L) + DMSI-SDRi13.4—Unverified
9WavesplitSI-SDRi13.2—Unverified
10DPTNET - SRSSNSI-SDRi12.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2 (w speed perturb)SI-SDRi22.2—Unverified
2TF-Locoformer (M)SI-SDRi22.1—Unverified
3MossFormer2 (w/o DM)SI-SDRi21.7—Unverified
4Separate And DiffuseSI-SDRi21.5—Unverified
5WHYVSI-SDRi17.5—Unverified
6TDANet LargeSI-SDRi17.4—Unverified
7TDANetSI-SDRi16.9—Unverified
8Conv-Tasnet (Libri1Mix speech enhancement pre-trained)SI-SDRi14.1—Unverified
9Conv-Tasnet (Libri1Mix speech enhancement multi-task)SI-SDRi13.7—Unverified
10Conv-TasnetSI-SDRi13.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi23.7—Unverified
2MossFormer2SI-SDRi22.2—Unverified
3MossFormer (L) + DMSI-SDRi21.2—Unverified
4Separate And DiffuseSI-SDRi20.9—Unverified
5MossFormer (M) + DMSI-SDRi20.8—Unverified
6SepItSI-SDRi20.1—Unverified
7SepFormerSI-SDRi19.5—Unverified
8SandglassetSI-SDRi17.1—Unverified
9Gated DualPathRNNSI-SDRi16.85—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi16.4—Unverified
2TDFNet-largeSI-SNRi15.8—Unverified
3TDFNet (MHSA + Shared)SI-SNRi15—Unverified
4RTFS-Net-12SI-SNRi14.9—Unverified
5RTFS-Net-6SI-SNRi14.6—Unverified
6CTCNetSI-SNRi14.3—Unverified
7RTFS-Net-4SI-SNRi14.1—Unverified
8TDFNet-smallSI-SNRi13.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SepReformer-L + DMSI-SDRi18.4—Unverified
2MossFormer2SI-SDRi18.1—Unverified
3MossFormer (L) + DMSI-SDRi17.3—Unverified
4TDANet LargeSI-SDRi15.2—Unverified
5TDANetSI-SDRi14.8—Unverified
6WHYVSI-SDRi12.96—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi21—Unverified
2Hungarian PITSI-SDRi13.22—Unverified
3Conditional TasNetSI-SDRi11.7—Unverified
4TasTasSI-SDRi11.14—Unverified
5Gated DualPathRNNSI-SDRi10.56—Unverified
6Multi-Decoder DPRNNSI-SDRi5.9—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi18.3—Unverified
2RTFS-Net-12SI-SNRi17.5—Unverified
3CTCNetSI-SNRi17.4—Unverified
4RTFS-Net-6SI-SNRi16.9—Unverified
5RTFS-Net-4SI-SNRi15.5—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi14—Unverified
2RTFS-Net-12SI-SNRi12.4—Unverified
3CTCNetSI-SNRi11.9—Unverified
4RTFS-Net-6SI-SNRi11.8—Unverified
5RTFS-Net-4SI-SNRi11.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi22—Unverified
2Gated DualPathRNNSI-SDRi12.88—Unverified
3Conditional TasNetSI-SDRi12.5—Unverified
4OR-PITSI-SDRi10.2—Unverified
5Multi-Decoder DPRNNSI-SDRi9.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi14.2—Unverified
2SepItSI-SDRi13.7—Unverified
3OCDSI-SDRi13.4—Unverified
4Hungarian PITSI-SDRi12.72—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi9—Unverified
2SepItSI-SDRi8.2—Unverified
3Hungarian PITSI-SDRi7.78—Unverified
#ModelMetricClaimedVerifiedStatus
1SDR9.6—Unverified
2Audio-Visual concat-refSDR8.05—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi5.2—Unverified
2Hungarian PITSI-SDRi4.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer (base)0S5.6—Unverified
2Conformer (large)0S5.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Hungarian PITSI-SDRi5.66—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refSDR10.55—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2SI-SDRi20.5—Unverified