SOTAVerified

Speech Separation

The task of extracting all overlapping speech sources in a given mixed speech signal refers to the Speech Separation. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to ClearerVoice-Studio.

Source: A Unified Framework for Speech Separation

Image credit: Speech Separation of A Target Speaker Based on Deep Neural Networks

Papers

Showing 201–250 of 359 papers

TitleStatusHype
Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair—0
Teacher-Student MixIT for Unsupervised and Semi-supervised Speech Separation—0
Dual-Path Filter Network: Speaker-Aware Modeling for Speech Separation—0
Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition—0
A cappella: Audio-visual Singing Voice SeparationCode1
Many-Speakers Single Channel Speech Separation with Optimal Permutation TrainingCode0
MIMO Self-attentive RNN Beamformer for Multi-speaker Speech Separation—0
Streaming Multi-talker Speech Recognition with Joint Speaker Identification—0
Configurable Privacy-Preserving Automatic Speech Recognition—0
Guided Training: A Simple Method for Single-channel Speaker Separation—0
Looking into Your Speech: Learning Cross-modal Affinity for Audio-visual Speech Separation—0
Blind Speech Separation and Dereverberation using Neural BeamformingCode1
USTC-NELSLIP System Description for DIHARD-III Challenge—0
Continuous Speech Separation with Ad Hoc Microphone Arrays—0
Compute and memory efficient universal sound source separationCode1
Tune-In: Training Under Negative Environments with Interference for Attention Networks Simulating Cocktail Party Effect—0
Audio-Visual Speech Separation Using Cross-Modal Correspondence Loss—0
Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech SeparationCode1
Integration of deep learning with expectation maximization for spatial cue based speech separation in reverberant conditions—0
Dual-Path Modeling for Long Recording Speech Separation in Meetings—0
End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend—0
Time-Domain Speech Extraction with Spatial Information and Multi Speaker Conditioning Mechanism—0
Beam-Guided TasNet: An Iterative Speech Separation Framework with Multi-Channel OutputCode1
Directional Sparse Filtering using Weighted Lehmer Mean for Blind Separation of Unbalanced Speech MixturesCode1
Effective Low-Cost Time-Domain Audio Separation Using Globally Attentive Locally Recurrent NetworksCode1
VisualVoice: Audio-Visual Speech Separation with Cross-Modal ConsistencyCode1
Multi-channel Multi-frame ADL-MVDR for Target Speech Separation—0
Continuous Speech Separation Using Speaker Inventory for Long Multi-talker Recording—0
Group Communication with Context Codec for Lightweight Source SeparationCode1
Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation—0
Audio-visual Speech Separation with Adversarially Disentangled Visual Representation—0
Multi-Decoder DPRNN: High Accuracy Source Counting and SeparationCode0
Ultra-Lightweight Speech Separation via Group Communication—0
WPD++: An Improved Neural Beamformer for Simultaneous Speech Separation and DereverberationCode0
Audio-visual Multi-channel Integration and Recognition of Overlapped Speech—0
Block-Online Guided Source Separation—0
Surrogate Source Model Learning for Determined Source Separation—0
On End-to-end Multi-channel Time Domain Speech Separation in Reverberant Environments—0
ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration—0
Integration of speech separation, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis—0
Distributed speech separation in spatially unconstrained microphone arraysCode1
Stabilizing Label Assignment for Speech Separation by Self-supervised Pre-trainingCode1
Speakerfilter-Pro: an improved target speaker extractor combines the time domain and frequency domain—0
Attention is All You Need in Speech SeparationCode1
X-TaSNet: Robust and Accurate Time-Domain Speaker Extraction Network—0
Speech enhancement aided end-to-end multi-task learning for voice activity detection—0
Don't shoot butterfly with rifles: Multi-channel Continuous Speech Separation with Early Exit TransformerCode1
Towards Listening to 10 People Simultaneously: An Efficient Permutation Invariant Training of Audio Source Separation Using Sinkhorn's Algorithm—0
BERT for Joint Multichannel Speech Dereverberation with Spatial-aware Tasks—0
The Cone of Silence: Speech Separation by LocalizationCode1
Show:102550
← PrevPage 5 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (L) + DMSI-SDRi25.1—Unverified
2SepReformer-LSI-SDRi25.1—Unverified
3TF-Locoformer (M) + DMSI-SDRi24.6—Unverified
4TF-Locoformer (L)SI-SDRi24.2—Unverified
5MossFormer2 (L)SI-SDRi24.1—Unverified
6SepTDA (L=12)SI-SDRi24—Unverified
7Separate And DiffuseSI-SDRi23.9—Unverified
8TF-Locoformer (M)SI-SDRi23.6—Unverified
9MossFormer (L) + DMSI-SDRi22.8—Unverified
10TF-Locoformer (S) + DMSI-SDRi22.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TF-Locoformer (M)SI-SDRi18.5—Unverified
2TF-Locoformer (S)SI-SDRi17.4—Unverified
3SepReformer-L + DMSI-SDRi17.1—Unverified
4MossFormer2SI-SDRi17—Unverified
5MossFormer (L) + DMSI-SDRi16.3—Unverified
6TD-Conformer (XL) + DMSI-SDRi14.6—Unverified
7Improved Sudo rm -rf (U=36)SI-SDRi13.5—Unverified
8TD-Conformer (L) + DMSI-SDRi13.4—Unverified
9WavesplitSI-SDRi13.2—Unverified
10DPTNET - SRSSNSI-SDRi12.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2 (w speed perturb)SI-SDRi22.2—Unverified
2TF-Locoformer (M)SI-SDRi22.1—Unverified
3MossFormer2 (w/o DM)SI-SDRi21.7—Unverified
4Separate And DiffuseSI-SDRi21.5—Unverified
5WHYVSI-SDRi17.5—Unverified
6TDANet LargeSI-SDRi17.4—Unverified
7TDANetSI-SDRi16.9—Unverified
8Conv-Tasnet (Libri1Mix speech enhancement pre-trained)SI-SDRi14.1—Unverified
9Conv-Tasnet (Libri1Mix speech enhancement multi-task)SI-SDRi13.7—Unverified
10Conv-TasnetSI-SDRi13.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi23.7—Unverified
2MossFormer2SI-SDRi22.2—Unverified
3MossFormer (L) + DMSI-SDRi21.2—Unverified
4Separate And DiffuseSI-SDRi20.9—Unverified
5MossFormer (M) + DMSI-SDRi20.8—Unverified
6SepItSI-SDRi20.1—Unverified
7SepFormerSI-SDRi19.5—Unverified
8SandglassetSI-SDRi17.1—Unverified
9Gated DualPathRNNSI-SDRi16.85—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi16.4—Unverified
2TDFNet-largeSI-SNRi15.8—Unverified
3TDFNet (MHSA + Shared)SI-SNRi15—Unverified
4RTFS-Net-12SI-SNRi14.9—Unverified
5RTFS-Net-6SI-SNRi14.6—Unverified
6CTCNetSI-SNRi14.3—Unverified
7RTFS-Net-4SI-SNRi14.1—Unverified
8TDFNet-smallSI-SNRi13.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SepReformer-L + DMSI-SDRi18.4—Unverified
2MossFormer2SI-SDRi18.1—Unverified
3MossFormer (L) + DMSI-SDRi17.3—Unverified
4TDANet LargeSI-SDRi15.2—Unverified
5TDANetSI-SDRi14.8—Unverified
6WHYVSI-SDRi12.96—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi21—Unverified
2Hungarian PITSI-SDRi13.22—Unverified
3Conditional TasNetSI-SDRi11.7—Unverified
4TasTasSI-SDRi11.14—Unverified
5Gated DualPathRNNSI-SDRi10.56—Unverified
6Multi-Decoder DPRNNSI-SDRi5.9—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi18.3—Unverified
2RTFS-Net-12SI-SNRi17.5—Unverified
3CTCNetSI-SNRi17.4—Unverified
4RTFS-Net-6SI-SNRi16.9—Unverified
5RTFS-Net-4SI-SNRi15.5—Unverified
#ModelMetricClaimedVerifiedStatus
1IIANetSI-SNRi14—Unverified
2RTFS-Net-12SI-SNRi12.4—Unverified
3CTCNetSI-SNRi11.9—Unverified
4RTFS-Net-6SI-SNRi11.8—Unverified
5RTFS-Net-4SI-SNRi11.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SepTDASI-SDRi22—Unverified
2Gated DualPathRNNSI-SDRi12.88—Unverified
3Conditional TasNetSI-SDRi12.5—Unverified
4OR-PITSI-SDRi10.2—Unverified
5Multi-Decoder DPRNNSI-SDRi9.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi14.2—Unverified
2SepItSI-SDRi13.7—Unverified
3OCDSI-SDRi13.4—Unverified
4Hungarian PITSI-SDRi12.72—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi9—Unverified
2SepItSI-SDRi8.2—Unverified
3Hungarian PITSI-SDRi7.78—Unverified
#ModelMetricClaimedVerifiedStatus
1SDR9.6—Unverified
2Audio-Visual concat-refSDR8.05—Unverified
#ModelMetricClaimedVerifiedStatus
1Separate And DiffuseSI-SDRi5.2—Unverified
2Hungarian PITSI-SDRi4.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer (base)0S5.6—Unverified
2Conformer (large)0S5.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Hungarian PITSI-SDRi5.66—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refSDR10.55—Unverified
#ModelMetricClaimedVerifiedStatus
1MossFormer2SI-SDRi20.5—Unverified