Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 351–400 of 982 papers

Title	Date	Tasks	Status
Can We Trust Deep Speech Prior?	Nov 4, 2020	Speech Enhancement	—Unverified
Exploring Length Generalization For Transformer-based Speech Enhancement	Jun 7, 2025	Speech Enhancement	—Unverified
Evaluating Speech Enhancement Systems Through Listening Effort	May 13, 2024	Speech Enhancement	—Unverified
Exploring Speech Enhancement for Low-resource Speech Synthesis	Sep 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Exploring Speech Enhancement with Generative Adversarial Networks for Robust Speech Recognition	Nov 15, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Exploring the Best Loss Function for DNN-Based Low-latency Speech Enhancement with Temporal Convolutional Networks	Aug 20, 2020	Speech Enhancement	—Unverified
Exploring the Potential of Data-Driven Spatial Audio Enhancement Using a Single-Channel Model	Apr 22, 2024	Direction of Arrival EstimationSpeech Enhancement	—Unverified
Exploring WavLM on Speech Enhancement	Nov 18, 2022	Self-Supervised LearningSpeech Enhancement	—Unverified
Expression-preserving face frontalization improves visually assisted speech processing	Apr 6, 2022	Face ModelLip Reading	—Unverified
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings	Apr 20, 2020	speaker-diarizationSpeaker Diarization	—Unverified
Can we steal your vocal identity from the Internet?: Initial investigation of cloning Obama's voice using GAN, WaveNet and low-quality found data	Mar 2, 2018	Generative Adversarial NetworkSpeech Enhancement	—Unverified
FADI-AEC: Fast Score Based Diffusion Model Guided by Far-end Signal for Acoustic Echo Cancellation	Jan 8, 2024	Acoustic echo cancellationSpeech Enhancement	—Unverified
A Preliminary Study of the Application of Discrete Wavelet Transform Features in Conv-TasNet Speech Enhancement Model	Nov 1, 2022	Speech Enhancement	—Unverified
ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding	Jul 19, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Fast and efficient speech enhancement with variational autoencoders	Nov 2, 2022	Computational EfficiencySpeech Enhancement	—Unverified
ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration	Nov 7, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Canonical Cortical Graph Neural Networks and its Application for Speech Enhancement in Audio-Visual Hearing Aids	Jun 6, 2022	BIG-bench Machine LearningSpeech Enhancement	—Unverified
EPG2S: Speech Generation and Speech Enhancement based on Electropalatography and Audio Signals using Multimodal Learning	Jun 16, 2022	Speech Enhancement	—Unverified
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures	Feb 25, 2025	Speech Enhancement	—Unverified
FB-MSTCN: A Full-Band Single-Channel Speech Enhancement Method Based on Multi-Scale Temporal Convolutional Network	Mar 15, 2022	DenoisingSpeech Denoising	—Unverified
Feature Normalization for Fine-tuning Self-Supervised Models in Speech Enhancement	Jun 14, 2023	Self-Supervised LearningSpeech Enhancement	—Unverified
FFC-SE: Fast Fourier Convolution for Speech Enhancement	Apr 6, 2022	Speech Enhancement	—Unverified
Building state-of-the-art distant speech recognition using the CHiME-4 challenge with a setup of speech enhancement baseline	Mar 27, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend	Jun 6, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Deep Representation Learning-based Speech Enhancement Method Using Complex Convolution Recurrent Variational Autoencoder	Dec 15, 2023	Representation LearningSpeech Enhancement	—Unverified
Enhancement of Spatial Clustering-Based Time-Frequency Masks using LSTM Neural Networks	Dec 2, 2020	ClusteringSpeech Enhancement	—Unverified
Enhancement of Noisy Speech with Low Speech Distortion Based on Probabilistic Geometric Spectral Subtraction	Feb 13, 2018	Noise EstimationSpeech Enhancement	—Unverified
Building a Luganda Text-to-Speech Model From Crowdsourced Data	May 16, 2024	Speech Enhancementtext-to-speech	—Unverified
Enhancement of Noisy Speech Exploiting an Exponential Model Based Threshold and a Custom Thresholding Function in Perceptual Wavelet Packet Domain	Feb 15, 2018	Speech Enhancement	—Unverified
Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition	Apr 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Frequency Gating: Improved Convolutional Neural Networks for Speech Enhancement in the Time-Frequency Domain	Nov 8, 2020	Speech Enhancement	—Unverified
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement	Jun 23, 2025	Speech Enhancement	—Unverified
Enhancement and Recognition of Reverberant and Noisy Speech by Extending Its Coherence	Sep 2, 2015	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks	Sep 12, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End-to-End Neural Speech Coding for Real-Time Communications	Jan 24, 2022	DecoderPacket Loss Concealment	—Unverified
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning	Oct 17, 2024	Generative Adversarial NetworkSpeech Enhancement	—Unverified
Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition	Nov 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Generalized Fast Multichannel Nonnegative Matrix Factorization Based on Gaussian Scale Mixtures for Blind Source Separation	May 11, 2022	blind source separationSpeech Enhancement	—Unverified
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement	Jan 23, 2025	Data AugmentationSpeech Enhancement	—Unverified
End-to-End Model for Speech Enhancement by Consistent Spectrogram Masking	Jan 2, 2019	Speech Enhancement	—Unverified
Generative Speech Enhancement Based on Cloned Networks	Sep 10, 2019	Speech Enhancement	—Unverified
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling	Feb 5, 2025	Language ModelingLanguage Modelling	—Unverified
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement	Sep 19, 2024	channel selectionEEG	—Unverified
GhostRNN: Reducing State Redundancy in RNN with Cheap Operations	Nov 20, 2024	Keyword SpottingSpeech Enhancement	—Unverified
GIST-AiTeR System for the Diarization Task of the 2022 VoxCeleb Speaker Recognition Challenge	Sep 21, 2022	Action DetectionActivity Detection	—Unverified
GLD-Net: Improving Monaural Speech Enhancement by Learning Global and Local Dependency Features with GLD Block	Jun 30, 2022	DecoderSpeech Enhancement	—Unverified
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement	Jan 23, 2025	Audio Signal ProcessingSpeech Enhancement	—Unverified
A Novel Frame Structure for Cloud-Based Audio-Visual Speech Enhancement in Multimodal Hearing-aids	Oct 24, 2022	Lip ReadingSpeech Enhancement	—Unverified
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement	May 30, 2025	DenoisingSpeech Enhancement	—Unverified

Show:10 25 50

← PrevPage 8 of 20Next →

All datasets VoiceBank + DEMAND Deep Noise Suppression (DNS) Challenge CHiME-3 EARS-WHAM EasyCom DNS Challenge VB-DemandEx WHAMR!WSJ0 + DEMAND + RNNoise RealMAN VoiceBank+DEMAND DEMAND

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ROSE-CD(PESQ)	PESQ (wb)	3.99	—	Unverified
2	PESQetarian	PESQ (wb)	3.82	—	Unverified
3	Mamba-SEUNet L (+PCS)	PESQ (wb)	3.73	—	Unverified
4	Schrödinger bridge (PESQ loss)	PESQ (wb)	3.7	—	Unverified
5	SEMamba (+PCS)	PESQ (wb)	3.69	—	Unverified
6	ZipEnhancer (S, \lamba_6 = 0)	PESQ (wb)	3.63	—	Unverified
7	PrimeK-Net	PESQ (wb)	3.61	—	Unverified
8	ZipEnhancer (S, \lamba_6 = 0.2)	PESQ (wb)	3.61	—	Unverified
9	MP-SENet	PESQ (wb)	3.6	—	Unverified
10	PCS_CS_WAVLM	PESQ (wb)	3.54	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BSRNN-S + MGD	SI-SDR-WB	21.4	—	Unverified
2	DTLN	SI-SDR-WB	16.34	—	Unverified
3	Non-Real-Time MultiScale+	SI-SDR-WB	16.22	—	Unverified
4	ZipEnhancer (M)	PESQ-WB	3.81	—	Unverified
5	TF-Locoformer (M)	PESQ-WB	3.72	—	Unverified
6	ZipEnhancer (S)	PESQ-WB	3.69	—	Unverified
7	MambAttention	PESQ-WB	3.67	—	Unverified
8	MP-SENet	PESQ-WB	3.62	—	Unverified
9	xLSTM-SENet	PESQ-WB	3.59	—	Unverified
10	BSRNN-S + MRSD	PESQ-WB	3.53	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Inter-Channel Conv-TasNet	SDR	19.67	—	Unverified
2	CA Dense U-Net (Complex)	SDR	18.64	—	Unverified
3	Dense U-Net (Complex)	SDR	18.4	—	Unverified
4	Dense U-Net (Real)	SDR	16.86	—	Unverified
5	U-Net (Real)	SDR	15.97	—	Unverified
6	Noisy/unprocessed	SDR	6.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Schrödinger Bridge (PESQ loss)	PESQ-WB	3.09	—	Unverified
2	SGMSE+	PESQ-WB	2.5	—	Unverified
3	Demucs v4	PESQ-WB	2.37	—	Unverified
4	Schrödinger Bridge	PESQ-WB	2.33	—	Unverified
5	Conv-TasNet	PESQ-WB	2.31	—	Unverified
6	CDiffuSE	PESQ-WB	1.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ReVISE (ch2)	Audio Quality MOS	4.19	—	Unverified
2	ReVISE (bf)	Audio Quality MOS	4.11	—	Unverified
3	Demucs (ch2)	Audio Quality MOS	2.95	—	Unverified
4	Demucs (bf)	Audio Quality MOS	2.39	—	Unverified
5	MaxDI (Baseline)	PESQ	1.17	—	Unverified
6	DAJA (MVDR,HMA,1000) (Overlapped Speech)	SDR	-4.76	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ZipEnhancer (M)	PESQ-NB	4.08	—	Unverified
2	DCCRN-MC	PESQ-NB	3.21	—	Unverified
3	DCCRN-M	PESQ-NB	3.15	—	Unverified
4	DCCRN	PESQ-NB	3.04	—	Unverified
5	RNN-Modulation	PESQ-WB	2.75	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MambAttention	ESTOI	0.8	—	Unverified
2	SEMamba	ESTOI	0.8	—	Unverified
3	xLSTM-SENet	ESTOI	0.8	—	Unverified
4	MP-SENet	ESTOI	0.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	2.84	—	Unverified
2	DTLN	PESQ	2.23	—	Unverified
3	Unprocessed	PESQ	1.83	—	Unverified
4	Non-Real-Time MultiScale+	PESQ	1.52	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DCUNet-MC	PESQ-NB	3.44	—	Unverified
2	DCCRN-M	PESQ-NB	3.28	—	Unverified
3	DCUNet	PESQ-NB	3.25	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	CleanMel-L-map	DNSMOS	3.82	—	Unverified
2	SpatialNet	DNSMOS BAK	3.43	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	rose_cd(PESQ )	PESQ	3.99	—	Unverified
2	ROSE-CD	PESQ	3.49	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Wave-U-Net	CBAK	3.24	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	2.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SE-MelGAN	Audio Quality MOS	3.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DeFT-AN	PESQ	3.01	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	3.03	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	3.07	—	Unverified