Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 401–450 of 982 papers

Title	Date	Tasks	Status
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Group-Sparse Signal Denoising: Non-Convex Regularization, Convex Optimization	Aug 23, 2013	DenoisingSpeech Enhancement	—Unverified
Guided Speech Enhancement Network	Mar 13, 2023	DenoisingSpeech Enhancement	—Unverified
Guided Variational Autoencoder for Speech Enhancement With a Supervised Classifier	Feb 12, 2021	Speech Enhancement	—Unverified
Harmonic and non-Harmonic Based Noisy Reverberant Speech Enhancement in Time Domain	Dec 9, 2021	Speech Enhancement	—Unverified
Harmonic enhancement using learnable comb filter for light-weight full-band speech enhancement model	Jun 1, 2023	RetrievalSpeech Enhancement	—Unverified
End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks	Sep 12, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Helsinki Speech Challenge 2024	Jun 6, 2024	Speech Enhancementspeech-recognition	—Unverified
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement	Aug 13, 2024	Self-Supervised LearningSpeech Enhancement	—Unverified
End-to-End Neural Speech Coding for Real-Time Communications	Jan 24, 2022	DecoderPacket Loss Concealment	—Unverified
Hidden-Markov-Model Based Speech Enhancement	Jul 4, 2017	modelSpeech Enhancement	—Unverified
End-to-End Model for Speech Enhancement by Consistent Spectrogram Masking	Jan 2, 2019	Speech Enhancement	—Unverified
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement	Jan 23, 2025	Audio Signal ProcessingSpeech Enhancement	—Unverified
A Novel Frame Structure for Cloud-Based Audio-Visual Speech Enhancement in Multimodal Hearing-aids	Oct 24, 2022	Lip ReadingSpeech Enhancement	—Unverified
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement	May 30, 2025	DenoisingSpeech Enhancement	—Unverified
End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation	Apr 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
High-quality Speech Synthesis Using Super-resolution Mel-Spectrogram	Dec 3, 2019	Image-to-Image TranslationSpeech Enhancement	—Unverified
Controlling the Perceived Sound Quality for Dialogue Enhancement with Deep Learning	Jul 22, 2021	Speech Enhancement	—Unverified
End-to-End Complex-Valued Multidilated Convolutional Neural Network for Joint Acoustic Echo Cancellation and Noise Suppression	Oct 2, 2021	Acoustic echo cancellationSpeech Enhancement	—Unverified
How Bad Are Artifacts?: Analyzing the Impact of Speech Enhancement Errors on ASR	Jan 18, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How does end-to-end speech recognition training impact speech enhancement artifacts?	Nov 20, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How much to Dereverberate? Low-Latency Single-Channel Speech Enhancement in Distant Microphone Scenarios	May 2, 2025	Speech Enhancement	—Unverified
Convolutional-Recurrent Neural Networks for Speech Enhancement	May 2, 2018	Speech Enhancement	—Unverified
Human Listening and Live Captioning: Multi-Task Training for Speech Enhancement	Jun 5, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Employing low-pass filtered temporal speech features for the training of ideal ratio mask in speech enhancement	Oct 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
EMGSE: Acoustic/EMG Fusion for Multimodal Speech Enhancement	Feb 14, 2022	Electromyography (EMG)Speech Enhancement	—Unverified
Breaking the trade-off in personalized speech enhancement with cross-task knowledge distillation	Nov 5, 2022	Knowledge DistillationSpeech Enhancement	—Unverified
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams	Oct 23, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Egocentric Audio-Visual Noise Suppression	Nov 7, 2022	Action ClassificationEvent Detection	—Unverified
Improved Normalizing Flow-Based Speech Enhancement using an All-pole Gammatone Filterbank for Conditional Input Representation	Oct 21, 2022	AllSpeech Enhancement	—Unverified
Cross-attention conformer for context modeling in speech enhancement for ASR	Oct 30, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improved Speech Enhancement with the Wave-U-Net	Oct 22, 2018	Audio Source SeparationSpeech Enhancement	—Unverified
Improving Character Error Rate Is Not Equal to Having Clean Speech: Speech Enhancement for ASR Systems with Black-box Acoustic Models	Oct 12, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving Design of Input Condition Invariant Speech Enhancement	Jan 25, 2024	Speech Enhancement	—Unverified
Improving Dual-Microphone Speech Enhancement by Learning Cross-Channel Features with Multi-Head Attention	May 3, 2022	DecoderMulti-Task Learning	—Unverified
Boosting Objective Scores of a Speech Enhancement Model by MetricGAN Post-processing	Jun 18, 2020	Speech Enhancement	—Unverified
Improving noise robust automatic speech recognition with single-channel time-domain enhancement network	Mar 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction	Oct 28, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising	May 20, 2025	DecoderDenoising	—Unverified
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes	Jun 23, 2022	Speech EnhancementSpeech Separation	—Unverified
Improving Perceptual Quality, Intelligibility, and Acoustics on VoIP Platforms	Mar 16, 2023	Multi-Task LearningSpeech Enhancement	—Unverified
Improving spatial cues for hearables using a parameterized binaural CDR estimator	Jul 17, 2022	Speech Enhancement	—Unverified
Efficient Trainable Front-Ends for Neural Speech Enhancement	Feb 20, 2020	Speech Enhancement	—Unverified
Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training	May 2, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving the Intent Classification accuracy in Noisy Environment	Mar 12, 2023	Automatic Speech RecognitionClassification	—Unverified
Improving Visual Speech Enhancement Network by Learning Audio-visual Affinity with Multi-head Attention	Jun 30, 2022	DecoderSpeech Enhancement	—Unverified
A Novel Speech Intelligibility Enhancement Model based on CanonicalCorrelation and Deep Learning	Feb 11, 2022	Speech Enhancement	—Unverified
Incorporating Multi-Target in Multi-Stage Speech Enhancement Model for Better Generalization	Jul 9, 2021	DenoisingSpeech Denoising	—Unverified
Incorporating Real-world Noisy Speech in Neural-network-based Speech Enhancement Systems	Sep 11, 2021	Speech EnhancementTriplet	—Unverified
A Bayesian Permutation training deep representation learning method for speech enhancement with variational autoencoder	Jan 24, 2022	Representation LearningSpeech Enhancement	—Unverified

Show:10 25 50

← PrevPage 9 of 20Next →

All datasets VoiceBank + DEMAND Deep Noise Suppression (DNS) Challenge CHiME-3 EARS-WHAM EasyCom DNS Challenge VB-DemandEx WHAMR!WSJ0 + DEMAND + RNNoise RealMAN VoiceBank+DEMAND DEMAND

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ROSE-CD(PESQ)	PESQ (wb)	3.99	—	Unverified
2	PESQetarian	PESQ (wb)	3.82	—	Unverified
3	Mamba-SEUNet L (+PCS)	PESQ (wb)	3.73	—	Unverified
4	Schrödinger bridge (PESQ loss)	PESQ (wb)	3.7	—	Unverified
5	SEMamba (+PCS)	PESQ (wb)	3.69	—	Unverified
6	ZipEnhancer (S, \lamba_6 = 0)	PESQ (wb)	3.63	—	Unverified
7	PrimeK-Net	PESQ (wb)	3.61	—	Unverified
8	ZipEnhancer (S, \lamba_6 = 0.2)	PESQ (wb)	3.61	—	Unverified
9	MP-SENet	PESQ (wb)	3.6	—	Unverified
10	PCS_CS_WAVLM	PESQ (wb)	3.54	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BSRNN-S + MGD	SI-SDR-WB	21.4	—	Unverified
2	DTLN	SI-SDR-WB	16.34	—	Unverified
3	Non-Real-Time MultiScale+	SI-SDR-WB	16.22	—	Unverified
4	ZipEnhancer (M)	PESQ-WB	3.81	—	Unverified
5	TF-Locoformer (M)	PESQ-WB	3.72	—	Unverified
6	ZipEnhancer (S)	PESQ-WB	3.69	—	Unverified
7	MambAttention	PESQ-WB	3.67	—	Unverified
8	MP-SENet	PESQ-WB	3.62	—	Unverified
9	xLSTM-SENet	PESQ-WB	3.59	—	Unverified
10	BSRNN-S + MRSD	PESQ-WB	3.53	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Inter-Channel Conv-TasNet	SDR	19.67	—	Unverified
2	CA Dense U-Net (Complex)	SDR	18.64	—	Unverified
3	Dense U-Net (Complex)	SDR	18.4	—	Unverified
4	Dense U-Net (Real)	SDR	16.86	—	Unverified
5	U-Net (Real)	SDR	15.97	—	Unverified
6	Noisy/unprocessed	SDR	6.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Schrödinger Bridge (PESQ loss)	PESQ-WB	3.09	—	Unverified
2	SGMSE+	PESQ-WB	2.5	—	Unverified
3	Demucs v4	PESQ-WB	2.37	—	Unverified
4	Schrödinger Bridge	PESQ-WB	2.33	—	Unverified
5	Conv-TasNet	PESQ-WB	2.31	—	Unverified
6	CDiffuSE	PESQ-WB	1.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ReVISE (ch2)	Audio Quality MOS	4.19	—	Unverified
2	ReVISE (bf)	Audio Quality MOS	4.11	—	Unverified
3	Demucs (ch2)	Audio Quality MOS	2.95	—	Unverified
4	Demucs (bf)	Audio Quality MOS	2.39	—	Unverified
5	MaxDI (Baseline)	PESQ	1.17	—	Unverified
6	DAJA (MVDR,HMA,1000) (Overlapped Speech)	SDR	-4.76	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ZipEnhancer (M)	PESQ-NB	4.08	—	Unverified
2	DCCRN-MC	PESQ-NB	3.21	—	Unverified
3	DCCRN-M	PESQ-NB	3.15	—	Unverified
4	DCCRN	PESQ-NB	3.04	—	Unverified
5	RNN-Modulation	PESQ-WB	2.75	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MambAttention	ESTOI	0.8	—	Unverified
2	SEMamba	ESTOI	0.8	—	Unverified
3	xLSTM-SENet	ESTOI	0.8	—	Unverified
4	MP-SENet	ESTOI	0.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	2.84	—	Unverified
2	DTLN	PESQ	2.23	—	Unverified
3	Unprocessed	PESQ	1.83	—	Unverified
4	Non-Real-Time MultiScale+	PESQ	1.52	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DCUNet-MC	PESQ-NB	3.44	—	Unverified
2	DCCRN-M	PESQ-NB	3.28	—	Unverified
3	DCUNet	PESQ-NB	3.25	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	CleanMel-L-map	DNSMOS	3.82	—	Unverified
2	SpatialNet	DNSMOS BAK	3.43	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	rose_cd(PESQ )	PESQ	3.99	—	Unverified
2	ROSE-CD	PESQ	3.49	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Wave-U-Net	CBAK	3.24	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	2.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SE-MelGAN	Audio Quality MOS	3.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DeFT-AN	PESQ	3.01	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Audio-Visual concat-ref	PESQ	3.03	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SepFormer	PESQ	3.07	—	Unverified