Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 801–850 of 982 papers

Title	Date	Tasks	Status
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement	Jun 1, 2025	Speech Enhancement	—Unverified
A two-step backward compatible fullband speech enhancement system	Jan 26, 2022	Speech EnhancementVocal Bursts Valence Prediction	—Unverified
A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI	Mar 23, 2023	Speech EnhancementSpeech Synthesis	—Unverified
Audio Recording Device Identification Based on Deep Learning	Feb 18, 2016	Deep LearningSpeech Enhancement	—Unverified
Audio-visual End-to-end Multi-channel Speech Separation, Dereverberation and Recognition	Jul 6, 2023	Speech DereverberationSpeech Enhancement	—Unverified
Audio-visual multi-channel speech separation, dereverberation and recognition	Apr 5, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Audio-Visual Speech Enhancement and Separation by Utilizing Multi-Modal Self-Supervised Embeddings	Oct 31, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks	Sep 1, 2017	DecoderMulti-Task Learning	—Unverified
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues	Feb 26, 2024	DecoderSpeech Enhancement	—Unverified
Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks	Mar 30, 2017	DecoderMulti-Task Learning	—Unverified
Audio-visual Speech Enhancement Using Conditional Variational Auto-Encoders	Aug 7, 2019	Speech Enhancement	—Unverified
Audio-Visual Speech Enhancement Using Self-supervised Learning to Improve Speech Intelligibility in Cochlear Implant Simulations	Jul 15, 2023	Self-Supervised LearningSpeech Enhancement	—Unverified
Audio-Visual Speech Enhancement With Selective Off-Screen Speech Extraction	Jun 10, 2023	Computational EfficiencySpeech Enhancement	—Unverified
Audio-visual speech enhancement with a deep Kalman filter generative model	Nov 2, 2022	Speech Enhancement	—Unverified
Audio-Visual Speech Enhancement with Score-Based Generative Models	Jun 2, 2023	Automatic Speech RecognitionLipreading	—Unverified
A Unified Deep Learning Framework for Short-Duration Speaker Verification in Adverse Environments	Oct 6, 2020	Action DetectionActivity Detection	—Unverified
A unified multichannel far-field speech recognition system: combining neural beamforming with attention based end-to-end model	Jan 5, 2024	Speech Enhancementspeech-recognition	—Unverified
A Universally-Deployable ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement, and Voice Separation	Sep 14, 2022	Acoustic echo cancellationAutomatic Speech Recognition	—Unverified
AutoPrep: An Automatic Preprocessing Framework for In-the-Wild Speech Data	Sep 25, 2023	Automatic Speech RecognitionSpeech Enhancement	—Unverified
Autoregressive Speech Enhancement via Acoustic Tokens	Jul 17, 2025	Speech Enhancement	—Unverified
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement	Sep 14, 2023	ResynthesisSpeech Enhancement	—Unverified
AV Speech Enhancement Challenge using a Real Noisy Corpus	Sep 30, 2019	Speech Enhancement	—Unverified
Batch-normalized joint training for DNN-based distant speech recognition	Mar 24, 2017	Distant Speech RecognitionSpeech Enhancement	—Unverified
BERT for Joint Multichannel Speech Dereverberation with Spatial-aware Tasks	Oct 21, 2020	Speech DereverberationSpeech Enhancement	—Unverified
Binaural Speech Enhancement Using STOI-Optimal Masks	Sep 30, 2022	Speech Enhancement	—Unverified
Blind Acoustic Room Parameter Estimation Using Phase Features	Mar 13, 2023	parameter estimationSpeech Enhancement	—Unverified
Blind Mask to Improve Intelligibility of Non-Stationary Noisy Speech	Aug 20, 2020	Noise EstimationSpeech Enhancement	—Unverified
Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training	May 2, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting Objective Scores of a Speech Enhancement Model by MetricGAN Post-processing	Jun 18, 2020	Speech Enhancement	—Unverified
Breaking the trade-off in personalized speech enhancement with cross-task knowledge distillation	Nov 5, 2022	Knowledge DistillationSpeech Enhancement	—Unverified
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement	Jan 23, 2025	Audio Signal ProcessingSpeech Enhancement	—Unverified
Building a Luganda Text-to-Speech Model From Crowdsourced Data	May 16, 2024	Speech Enhancementtext-to-speech	—Unverified
Building state-of-the-art distant speech recognition using the CHiME-4 challenge with a setup of speech enhancement baseline	Mar 27, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Canonical Cortical Graph Neural Networks and its Application for Speech Enhancement in Audio-Visual Hearing Aids	Jun 6, 2022	BIG-bench Machine LearningSpeech Enhancement	—Unverified
Can we steal your vocal identity from the Internet?: Initial investigation of cloning Obama's voice using GAN, WaveNet and low-quality found data	Mar 2, 2018	Generative Adversarial NetworkSpeech Enhancement	—Unverified
Can We Trust Deep Speech Prior?	Nov 4, 2020	Speech Enhancement	—Unverified
Causal Signal-Based DCCRN with Overlapped-Frame Prediction for Online Speech Enhancement	Sep 7, 2023	Speech Enhancement	—Unverified
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features	Dec 26, 2024	Multi-Task LearningQuantization	—Unverified
Cellular Network Speech Enhancement: Removing Background and Transmission Noise	Jan 22, 2023	Speech Enhancement	—Unverified
Challenges and Opportunities in Multi-device Speech Processing	Jun 27, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Characterizing Speech Adversarial Examples Using Self-Attention U-Net Enhancement	Mar 31, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CheapNET: Improving Light-weight speech enhancement network by projected loss function	Nov 27, 2023	Speech Enhancement	—Unverified
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings	Apr 20, 2020	speaker-diarizationSpeaker Diarization	—Unverified
CLCNet: Deep learning-based Noise Reduction for Hearing Aids using Complex Linear Coding	Jan 28, 2020	Speech Enhancement	—Unverified
CleanUNet 2: A Hybrid Speech Denoising Model on Waveform and Spectrogram	Sep 12, 2023	DenoisingSpeech Denoising	—Unverified
Closing the Gap Between Time-Domain Multi-Channel Speech Enhancement on Real and Simulation Conditions	Oct 27, 2021	Speech Enhancementspeech-recognition	—Unverified
Coarse-to-fine Optimization for Speech Enhancement	Aug 21, 2019	Generative Adversarial NetworkSpeech Enhancement	—Unverified
Cold Diffusion for Speech Enhancement	Nov 4, 2022	Speech Enhancement	—Unverified
Collaborative Deep Learning for Speech Enhancement: A Run-Time Model Selection Method Using Autoencoders	May 29, 2017	Model SelectionSpeech Enhancement	—Unverified

Show:10 25 50

← PrevPage 17 of 20Next →

All datasets VoiceBank + DEMAND Deep Noise Suppression (DNS) Challenge CHiME-3 EARS-WHAM EasyCom DNS Challenge VB-DemandEx WHAMR!WSJ0 + DEMAND + RNNoise RealMAN VoiceBank+DEMAND DEMAND

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ROSE-CD(PESQ)	PESQ (wb)	3.99	—	Unverified
2	PESQetarian	PESQ (wb)	3.82	—	Unverified
3	Mamba-SEUNet L (+PCS)	PESQ (wb)	3.73	—	Unverified
4	Schrödinger bridge (PESQ loss)	PESQ (wb)	3.7	—	Unverified
5	SEMamba (+PCS)	PESQ (wb)	3.69	—	Unverified
6	ZipEnhancer (S, \lamba_6 = 0)	PESQ (wb)	3.63	—	Unverified
7	PrimeK-Net	PESQ (wb)	3.61	—	Unverified
8	ZipEnhancer (S, \lamba_6 = 0.2)	PESQ (wb)	3.61	—	Unverified
9	MP-SENet	PESQ (wb)	3.6	—	Unverified
10	PCS_CS_WAVLM	PESQ (wb)	3.54	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BSRNN-S + MGD	SI-SDR-WB	21.4	—	Unverified
2	DTLN	SI-SDR-WB	16.34	—	Unverified
3	Non-Real-Time MultiScale+	SI-SDR-WB	16.22	—	Unverified
4	ZipEnhancer (M)	PESQ-WB	3.81	—	Unverified
5	TF-Locoformer (M)	PESQ-WB	3.72	—	Unverified
6	ZipEnhancer (S)	PESQ-WB	3.69	—	Unverified
7	MambAttention	PESQ-WB	3.67	—	Unverified
8	MP-SENet	PESQ-WB	3.62	—	Unverified
9	xLSTM-SENet	PESQ-WB	3.59	—	Unverified
10	BSRNN-S + MRSD	PESQ-WB	3.53	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Inter-Channel Conv-TasNet	SDR	19.67	—	Unverified
2	CA Dense U-Net (Complex)	SDR	18.64	—	Unverified
3	Dense U-Net (Complex)	SDR	18.4	—	Unverified
4	Dense U-Net (Real)	SDR	16.86	—	Unverified
5	U-Net (Real)	SDR	15.97	—	Unverified
6	Noisy/unprocessed	SDR	6.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Schrödinger Bridge (PESQ loss)	PESQ-WB	3.09	—	Unverified
2	SGMSE+	PESQ-WB	2.5	—	Unverified
3	Demucs v4	PESQ-WB	2.37	—	Unverified
4	Schrödinger Bridge	PESQ-WB	2.33	—	Unverified
5	Conv-TasNet	PESQ-WB	2.31	—	Unverified
6	CDiffuSE	PESQ-WB	1.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ReVISE (ch2)	Audio Quality MOS	4.19	—	Unverified
2	ReVISE (bf)	Audio Quality MOS	4.11	—	Unverified
3	Demucs (ch2)	Audio Quality MOS	2.95	—	Unverified
4	Demucs (bf)	Audio Quality MOS	2.39	—	Unverified
5	MaxDI (Baseline)	PESQ	1.17	—	Unverified
6	DAJA (MVDR,HMA,1000) (Overlapped Speech)	SDR	-4.76	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ZipEnhancer (M)	PESQ-NB	4.08	—	Unverified
2	DCCRN-MC	PESQ-NB	3.21	—	Unverified
3	DCCRN-M	PESQ-NB	3.15	—	Unverified
4	DCCRN	PESQ-NB	3.04	—	Unverified
5	RNN-Modulation	PESQ-WB	2.75	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MambAttention	ESTOI	0.8	—	Unverified
2	SEMamba	ESTOI	0.8	—	Unverified
3	xLSTM-SENet	ESTOI	0.8	—	Unverified
4	MP-SENet	ESTOI	0.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	2.84	—	Unverified
2	DTLN	PESQ	2.23	—	Unverified
3	Unprocessed	PESQ	1.83	—	Unverified
4	Non-Real-Time MultiScale+	PESQ	1.52	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DCUNet-MC	PESQ-NB	3.44	—	Unverified
2	DCCRN-M	PESQ-NB	3.28	—	Unverified
3	DCUNet	PESQ-NB	3.25	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	CleanMel-L-map	DNSMOS	3.82	—	Unverified
2	SpatialNet	DNSMOS BAK	3.43	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	rose_cd(PESQ )	PESQ	3.99	—	Unverified
2	ROSE-CD	PESQ	3.49	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Wave-U-Net	CBAK	3.24	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	2.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SE-MelGAN	Audio Quality MOS	3.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DeFT-AN	PESQ	3.01	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	3.03	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	3.07	—	Unverified