SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 251–300 of 982 papers

TitleStatusHype
Learning with Learned Loss Function: Speech Enhancement with Quality-Net to Improve Perceptual Evaluation of Speech QualityCode0
Lessons Learned from the URGENT 2024 Speech Enhancement ChallengeCode0
Let SSMs be ConvNets: State-space Modeling with Optimal Tensor ContractionsCode0
An Investigation into the Effectiveness of Enhancement in ASR Training and Test for CHiME-5 Dinner Party TranscriptionCode0
Language and Noise Transfer in Speech Enhancement Generative Adversarial NetworkCode0
Investigating Generative Adversarial Networks based Speech Dereverberation for Robust Speech RecognitionCode0
Investigating the effect of residual and highway connections in speech enhancement modelsCode0
A variance modeling framework based on variational autoencoders for speech enhancementCode0
Direction of Arrival Correction through Speech Quality FeedbackCode0
Improved Speech Enhancement with the Wave-U-NetCode0
How to train your ears: Auditory-model emulation for large-dynamic-range inputs and mild-to-severe hearing lossesCode0
High-Resolution Speech Restoration with Latent Diffusion ModelCode0
Aura: Privacy-preserving Augmentation to Improve Test Set Diversity in Speech EnhancementCode0
Guided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASRCode0
Feature Enhancement with Deep Feature Losses for Speaker VerificationCode0
Face Landmark-based Speaker-Independent Audio-Visual Speech Enhancement in Multi-Talker EnvironmentsCode0
PlumberNet: Fixing interference leakage after GEV beamformingCode0
Exploiting Hidden Representations from a DNN-based Speech Recogniser for Speech Intelligibility Prediction in Hearing-impaired ListenersCode0
Estimation and Restoration of Unknown Nonlinear Distortion using DiffusionCode0
End-to-End Multi-Task Denoising for joint SDR and PESQ OptimizationCode0
Exploiting Low-Rank Tensor-Train Deep Neural Networks Based on Riemannian Gradient Descent With Illustrations of Speech ProcessingCode0
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic PerturbationCode0
Deep Unfolding: Model-Based Inspiration of Novel Deep Architectures—0
Deep Time Delay Neural Network for Speech Enhancement with Full Data Learning—0
Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks—0
Deep Speech Enhancement for Reverberated and Noisy Signals using Wide Residual Networks—0
Deep Residual Echo Suppression and Noise Reduction: A Multi-Input FCRN Approach in a Hybrid Speech Enhancement System—0
Audio-Visual Speech Enhancement and Separation by Utilizing Multi-Modal Self-Supervised Embeddings—0
A network of deep neural networks for distant speech recognition—0
Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data—0
Deep Noise Suppression Maximizing Non-Differentiable PESQ Mediated by a Non-Intrusive PESQNet—0
Deep neural network techniques for monaural speech enhancement: state of the art analysis—0
Audio-visual multi-channel speech separation, dereverberation and recognition—0
An Ensemble SVM-based Approach for Voice Activity Detection—0
Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair—0
Audio-visual End-to-end Multi-channel Speech Separation, Dereverberation and Recognition—0
Deep low-latency joint speech transmission and enhancement over a gaussian channel—0
Audio Recording Device Identification Based on Deep Learning—0
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement—0
Deep learning for minimum mean-square error approaches to speech enhancement—0
Deep Learning Based Speech Beamforming—0
A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI—0
Deep-Learning-Based Audio-Visual Speech Enhancement in Presence of Lombard Effect—0
A two-step backward compatible fullband speech enhancement system—0
An Empirical Study of Visual Features for DNN based Audio-Visual Speech Enhancement in Multi-talker Environments—0
Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition—0
Acoustic Structure Inverse Design and Optimization Using Deep Learning—0
Deep Interaction between Masking and Mapping Targets for Single-Channel Speech Enhancement—0
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement—0
A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement—0
Show:102550
← PrevPage 6 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified