SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 451–500 of 982 papers

TitleStatusHype
Parallel Gated Neural Network With Attention Mechanism For Speech Enhancement—0
PCNN: A Lightweight Parallel Conformer Neural Network for Efficient Monaural Speech Enhancement—0
Perceive and predict: self-supervised speech representation based loss functions for speech enhancement—0
PercepNet+: A Phase and SNR Aware PercepNet for Real-Time Speech Enhancement—0
Perceptual audio loss function for deep learning—0
Perceptually-motivated Environment-specific Speech Enhancement—0
AeGAN: Time-Frequency Speech Denoising via Generative Adversarial Networks—0
Personalized speech enhancement combining band-split RNN and speaker attentive module—0
Personalized Speech Enhancement: New Models and Comprehensive Evaluation—0
Personalized Speech Enhancement through Self-Supervised Data Augmentation and Purification—0
Personalized Speech Enhancement Without a Separate Speaker Embedding Model—0
Phase-Aware Deep Speech Enhancement: It's All About The Frame Length—0
Phase Aware Speech Enhancement using Realisation of Complex-valued LSTM—0
Phasebook and Friends: Leveraging Discrete Representations for Source Separation—0
Phase Continuity: Learning Derivatives of Phase Spectrum for Speech Enhancement—0
Phoneme-based Distribution Regularization for Speech Enhancement—0
Phoneme-Based Ratio Mask Estimation for Reverberant Speech Enhancement in Cochlear Implant Processors—0
PLDNet: PLD-Guided Lightweight Deep Network Boosted by Efficient Attention for Handheld Dual-Microphone Speech Enhancement—0
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network—0
PoCoNet: Better Speech Enhancement with Frequency-Positional Embeddings, Semi-Supervised Conversational Data, and Biased Loss—0
Posterior sampling algorithms for unsupervised speech enhancement with recurrent variational autoencoder—0
Predicting speech intelligibility in older adults using the Gammachirp Envelope Similarity Index, GESI—0
Pre-training Feature Guided Diffusion Model for Speech Enhancement—0
Progressive Residual Extraction based Pre-training for Speech Representation Learning—0
ProSE: Diffusion Priors for Speech Enhancement—0
Psychoacoustic Challenges Of Speech Enhancement On VoIP Platforms—0
Quality-Net: An End-to-End Non-intrusive Speech Quality Assessment Model based on BLSTM—0
RadioSES: mmWave-Based Audioradio Speech Enhancement and Separation System—0
aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio—0
Raw Waveform-based Speech Enhancement by Fully Convolutional Networks—0
Real-time Audio Video Enhancement \ a Microphone Array and Headphones—0
Real-Time Audio-Visual End-to-End Speech Enhancement—0
Real-Time Joint Personalized Speech Enhancement and Acoustic Echo Cancellation—0
Real-time Monaural Speech Enhancement With Short-time Discrete Cosine Transform—0
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios—0
Real-time Speech Enhancement and Separation with a Unified Deep Neural Network for Single/Dual Talker Scenarios—0
Real-Time Speech Enhancement Using Spectral Subtraction with Minimum Statistics and Spectral Floor—0
Real-time speech enhancement with dynamic attention span—0
Real-time Stereo Speech Enhancement with Spatial-Cue Preservation based on Dual-Path Structure—0
Real-time Streaming Wave-U-Net with Temporal Convolutions for Multichannel Speech Enhancement—0
Recent Progresses in Deep Learning based Acoustic Models (Updated)—0
Recurrent Models for Auditory Attention in Multi-Microphone Distance Speech Recognition—0
Reduction of Subjective Listening Effort for TV Broadcast Signals with Recurrent Neural Networks—0
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement—0
Refining DNN-based Mask Estimation using CGMM-based EM Algorithm for Multi-channel Noise Reduction—0
Reinforcement Learning Based Speech Enhancement for Robust Speech Recognition—0
Reinforcement Learning To Adapt Speech Enhancement to Instantaneous Input Signal Quality—0
Relative Transfer Function Estimation Exploiting Spatially Separated Microphones in a Diffuse Noise Field—0
RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement—0
Rep2wav: Noise Robust text-to-speech Using self-supervised representations—0
Show:102550
← PrevPage 10 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified