SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 301–350 of 982 papers

TitleStatusHype
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration—0
A Two-Stage Deep Representation Learning-Based Speech Enhancement Method Using Variational Autoencoder and Adversarial Training—0
Deep Complex U-Net with Conformer for Audio-Visual Speech Enhancement—0
Deep Beamforming for Speech Enhancement and Speaker Localization with an Array Response-Aware Loss Function—0
A Two-stage Complex Network using Cycle-consistent Generative Adversarial Networks for Speech Enhancement—0
An Analysis of the Variance of Diffusion-based Speech Enhancement—0
Adversarial Feature-Mapping for Speech Enhancement—0
Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation—0
Attention-Driven Multichannel Speech Enhancement in Moving Sound Source Scenarios—0
DDS: A new device-degraded speech dataset for speech enhancement—0
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions—0
Attention-based Speech Enhancement Using Human Quality Perception Modelling—0
Analyzing Upper Bounds on Mean Absolute Errors for Deep Neural Network Based Vector-to-Vector Regression—0
DCCRN-KWS: an audio bias based model for noise robust small-footprint keyword spotting—0
DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement—0
DCCRGAN: Deep Complex Convolution Recurrent Generator Adversarial Network for Speech Enhancement—0
Dataset of Spatial Room Impulse Responses in a Variable Acoustics Room for Six Degrees-of-Freedom Rendering and Analysis—0
Analysis of Noisy-target Training for DNN-based speech enhancement—0
Adversarial Feature Learning and Unsupervised Clustering based Speech Synthesis for Found Data with Acoustic and Textual Noise—0
Acoustics-guided evaluation (AGE): a new measure for estimating performance of speech enhancement algorithms for robust ASR—0
DASB -- Discrete Audio and Speech Benchmark—0
AMFFCN: Attentional Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement—0
D²Net: A Denoising and Dereverberation Network Based on Two-branch Encoder and Dual-path Transformer—0
Cycle-Consistent Speech Enhancement—0
A Training Framework for Stereo-Aware Speech Enhancement using Deep Neural Networks—0
Analysis of DNN Speech Signal Enhancement for Robust Speaker Recognition—0
ctPuLSE: Close-Talk, and Pseudo-Label Based Far-Field, Speech Enhancement—0
Cross-domain Single-channel Speech Enhancement Model with Bi-projection Fusion Module for Noise-robust ASR—0
A time-domain nearfield frequency-invariant beamforming method—0
Cross-Attention is all you need: Real-Time Streaming Transformers for Personalised Speech Enhancement—0
Cross-attention conformer for context modeling in speech enhancement for ASR—0
Analysing Diffusion-based Generative Approaches versus Discriminative Approaches for Speech Restoration—0
AdVerb: Visually Guided Audio Dereverberation—0
Correlating Subword Articulation with Lip Shapes for Embedding Aware Audio-Visual Speech Enhancement—0
Cooperative Dual Attention for Audio-Visual Speech Enhancement with Facial Cues—0
ConvS2S-VC: Fully convolutional sequence-to-sequence voice conversion—0
Convolutional-Recurrent Neural Networks for Speech Enhancement—0
A Survey of Deep Learning for Complex Speech Spectrograms—0
A Multiscale Autoencoder (MSAE) Framework for End-to-End Neural Network Speech Enhancement—0
Convolutional Neural Network-based Speech Enhancement for Cochlear Implant Recipients—0
Convoifilter: A case study of doing cocktail party speech recognition—0
A study on speech enhancement using exponent-only floating point quantized neural network (EOFP-QNN)—0
Controlling the Perceived Sound Quality for Dialogue Enhancement with Deep Learning—0
Continuous Modeling of the Denoising Process for Speech Enhancement Based on Deep Learning—0
Multimodal Audio-Visual Information Fusion using Canonical-Correlated Graph Neural Network for Energy-Efficient Speech Enhancement—0
Advances in Microphone Array Processing and Multichannel Speech Enhancement—0
Acoustic echo suppression using a learning-based multi-frame minimum variance distortionless response filter—0
Contextual Audio-Visual Switching For Speech Enhancement in Real-World Environments—0
A Study of Incorporating Articulatory Movement Information in Speech Enhancement—0
Constrained Convolutional-Recurrent Networks to Improve Speech Quality with Low Impact on Recognition Accuracy—0
Show:102550
← PrevPage 7 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified