SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 701–750 of 982 papers

TitleStatusHype
Nonlinear Spatial Filtering in Multichannel Speech Enhancement—0
Comparison of remote experiments using crowdsourcing and laboratory experiments on speech intelligibility—0
Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network for Speech Enhancement—0
The NTNU Taiwanese ASR System for Formosa Speech Recognition Challenge 2020—0
Phoneme-based Distribution Regularization for Speech Enhancement—0
Real-time Streaming Wave-U-Net with Temporal Convolutions for Multichannel Speech Enhancement—0
Efficient Personalized Speech Enhancement through Self-Supervised Learning—0
Personalized Speech Enhancement through Self-Supervised Data Augmentation and Purification—0
Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition—0
Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data—0
Time-domain Speech Enhancement with Generative Adversarial LearningCode0
TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain—0
Towards Robust Speaker Verification with Target Speaker Enhancement—0
Transformers with Competitive Ensembles of Independent Mechanisms—0
Speech Enhancement Using Multi-Stage Self-Attentive Temporal Convolutional Networks—0
A Robust Maximum Likelihood Distortionless Response Beamformer based on a Complex Generalized Gaussian Distribution—0
Variational Autoencoder for Speech Enhancement with a Noise-Aware Encoder—0
Guided Variational Autoencoder for Speech Enhancement With a Supervised Classifier—0
Speech enhancement with mixture-of-deep-experts with clean clustering pre-training—0
Real-time Monaural Speech Enhancement With Short-time Discrete Cosine Transform—0
Switching Variational Auto-Encoders for Noise-Agnostic Audio-visual Speech Enhancement—0
VSEGAN: Visual Speech Enhancement Generative Adversarial Network—0
High Fidelity Speech Regeneration with Application to Speech Enhancement—0
Acoustic Structure Inverse Design and Optimization Using Deep Learning—0
Speech Enhancement for Wake-Up-Word detection in Voice Assistants—0
Towards efficient models for real-time deep noise suppression—0
Noisy-target Training: A Training Strategy for DNN-based Speech Enhancement without Clean Speech—0
Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement—0
AMFFCN: Attentional Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement—0
Neural Network-based Virtual Microphone Estimator—0
Attention-based multi-task learning for speech-enhancement and speaker-identification in multi-speaker dialogue scenarioCode0
DCCRGAN: Deep Complex Convolution Recurrent Generator Adversarial Network for Speech Enhancement—0
Speech Enhancement with Zero-Shot Model SelectionCode0
Interactive Speech and Noise Modeling for Speech Enhancement—0
Towards speech enhancement using a variational U-Net architecture—0
Speaker Recognition Based on Deep Learning: An Overview—0
Combining Spatial Clustering with LSTM Speech Models for Multichannel Speech Enhancement—0
Enhancement of Spatial Clustering-Based Time-Frequency Masks using LSTM Neural Networks—0
Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation—0
Deep Multi-Frame MVDR Filtering for Single-Microphone Speech EnhancementCode0
Ultra-Lightweight Speech Separation via Group Communication—0
Multi-task single channel speech enhancement using speech presence probability as a secondary task training target—0
Improving Speech Enhancement Performance by Leveraging Contextual Broad Phonetic Class Information—0
Evaluating the Intelligibility Benefits of Neural Speech Enrichment for Listeners with Normal Hearing and Hearing Impairment using the Greek Harvard Corpus—0
Deep Time Delay Neural Network for Speech Enhancement with Full Data Learning—0
An Empirical Study of Visual Features for DNN based Audio-Visual Speech Enhancement in Multi-talker Environments—0
Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition—0
Frequency Gating: Improved Convolutional Neural Networks for Speech Enhancement in the Time-Frequency Domain—0
ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration—0
Self-Supervised Learning from Contrastive Mixtures for Personalized Speech EnhancementCode0
Show:102550
← PrevPage 15 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified