SOTAVerified

Music Source Separation

Music source separation is the task of decomposing music into its constitutive components, e. g., yielding separated stems for the vocals, bass, and drums.

( Image credit: SigSep )

Papers

Showing 1–25 of 107 papers

TitleStatusHype
Music Source RestorationCode1
Training-Free Multi-Step Audio Source SeparationCode2
Is MixIT Really Unsuitable for Correlated Sources? Exploring MixIT for Unsupervised Pre-training in Music Source Separation—0
Solving Copyright Infringement on Short Video Platforms: Novel Datasets and an Audio Restoration Deep Learning Pipeline—0
Score-informed Music Source Separation: Improving Synthetic-to-real Generalization in Classical MusicCode0
Separate This, and All of these Things Around It: Music Source Separation via Hyperellipsoidal Queries—0
Sanidha: A Studio Quality Multi-Modal Dataset for Carnatic Music—0
MAJL: A Model-Agnostic Joint Learning Framework for Music Source Separation and Pitch Estimation—0
Learned Compression for Compressed LearningCode0
Music Foundation Model as Generic Booster for Music Downstream Tasks—0
Task-Aware Unified Source Separation—0
An Ensemble Approach to Music Source Separation: A Comparative Analysis of Conventional and Hierarchical Stem Separation—0
SynthSOD: Developing an Heterogeneous Dataset for Orchestra Music Source SeparationCode1
Improving Real-Time Music Accompaniment Separation with MMDenseNet—0
A Stem-Agnostic Single-Decoder System for Music Source Separation Beyond Four StemsCode2
Why does music source separation benefit from cacophony?—0
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet—0
A fully differentiable model for unsupervised singing voice separationCode1
SCNet: Sparse Compression Network for Music Source SeparationCode2
Resource-constrained stereo singing voice cancellation—0
Machine Perceptual Quality: Evaluating the Impact of Severe Lossy Compression on Audio and Image ModelsCode0
Subnetwork-to-go: Elastic Neural Network with Dynamic Training and Customizable Inference—0
Pre-training Music Classification Models via Music Source SeparationCode2
Pre-trained Spatial Priors on Multichannel NMF for Music Source Separation—0
MBTFNet: Multi-Band Temporal-Frequency Neural Network For Singing Voice Enhancement—0
Show:102550
← PrevPage 1 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Sparse HT Demucs (fine tuned)SDR (avg)9.2—Unverified
2Hybrid Transformer Demucs (f.t.)SDR (avg)9—Unverified
3Band-Split RNN (semi-sup.)SDR (avg)8.97—Unverified
4TFC-TDF-UNet (v3)SDR (avg)8.34—Unverified
5Band-Split RNNSDR (avg)8.23—Unverified
6Hybrid DemucsSDR (avg)7.72—Unverified
7KUIELab-MDX-NetSDR (avg)7.54—Unverified
8CDE-HTCNSDR (avg)6.89—Unverified
9Attentive-MultiResUNetSDR (avg)6.81—Unverified
10DEMUCS (extra)SDR (avg)6.79—Unverified
#ModelMetricClaimedVerifiedStatus
1BS-RoFormer (L=12, OA)SDR (avg)11.99—Unverified
2BS-RoFormer (L=6, OA)SDR (avg)9.8—Unverified
3SCNet-largeSDR (avg)9.69—Unverified
4Sparse HT Demucs (fine tuned)SDR (avg)9.2—Unverified
5Hybrid Transformer Demucs (f.t.)SDR (avg)9—Unverified
6SCNetSDR (avg)9—Unverified
7Band-Split RNN (semi-sup.)SDR (avg)8.97—Unverified
8TFC-TDF-UNet (v3)SDR (avg)8.34—Unverified
9Band-Split RNNSDR (avg)8.24—Unverified
10Dual-Path TFC-TDF UNet (DTTNet)SDR (avg)8.15—Unverified
#ModelMetricClaimedVerifiedStatus
1DiCoSe (Deterministic)SI-SDRi (Bass)20.04—Unverified
2LQ-VAE + Scalable TransformerSDR (bass)7.42—Unverified