SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 851–900 of 982 papers

TitleStatusHype
Combining Spatial Clustering with LSTM Speech Models for Multichannel Speech Enhancement—0
Comparative Analysis of Personalized Voice Activity Detection Systems: Assessing Real-World Effectiveness—0
Comparative Study between Adversarial Networks and Classical Techniques for Speech Enhancement—0
Comparison of remote experiments using crowdsourcing and laboratory experiments on speech intelligibility—0
Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network for Speech Enhancement—0
Complex spectrogram enhancement by convolutional neural network with multi-metrics learning—0
Conditional Generative Adversarial Networks for Speech Enhancement and Noise-Robust Speaker Verification—0
Consistency-aware multi-channel speech enhancement using deep neural networks—0
Constrained Convolutional-Recurrent Networks to Improve Speech Quality with Low Impact on Recognition Accuracy—0
Contextual Audio-Visual Switching For Speech Enhancement in Real-World Environments—0
Continuous Modeling of the Denoising Process for Speech Enhancement Based on Deep Learning—0
Controlling the Perceived Sound Quality for Dialogue Enhancement with Deep Learning—0
Convoifilter: A case study of doing cocktail party speech recognition—0
Convolutional Neural Network-based Speech Enhancement for Cochlear Implant Recipients—0
Convolutional-Recurrent Neural Networks for Speech Enhancement—0
ConvS2S-VC: Fully convolutional sequence-to-sequence voice conversion—0
Cooperative Dual Attention for Audio-Visual Speech Enhancement with Facial Cues—0
Correlating Subword Articulation with Lip Shapes for Embedding Aware Audio-Visual Speech Enhancement—0
Cross-attention conformer for context modeling in speech enhancement for ASR—0
Cross-Attention is all you need: Real-Time Streaming Transformers for Personalised Speech Enhancement—0
Cross-domain Single-channel Speech Enhancement Model with Bi-projection Fusion Module for Noise-robust ASR—0
ctPuLSE: Close-Talk, and Pseudo-Label Based Far-Field, Speech Enhancement—0
Cycle-Consistent Speech Enhancement—0
D²Net: A Denoising and Dereverberation Network Based on Two-branch Encoder and Dual-path Transformer—0
DASB -- Discrete Audio and Speech Benchmark—0
Dataset of Spatial Room Impulse Responses in a Variable Acoustics Room for Six Degrees-of-Freedom Rendering and Analysis—0
DCCRGAN: Deep Complex Convolution Recurrent Generator Adversarial Network for Speech Enhancement—0
DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement—0
DCCRN-KWS: an audio bias based model for noise robust small-footprint keyword spotting—0
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions—0
DDS: A new device-degraded speech dataset for speech enhancement—0
Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation—0
Deep Beamforming for Speech Enhancement and Speaker Localization with an Array Response-Aware Loss Function—0
Deep Complex U-Net with Conformer for Audio-Visual Speech Enhancement—0
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration—0
Deep Interaction between Masking and Mapping Targets for Single-Channel Speech Enhancement—0
Deep-Learning-Based Audio-Visual Speech Enhancement in Presence of Lombard Effect—0
Deep Learning Based Speech Beamforming—0
Deep learning for minimum mean-square error approaches to speech enhancement—0
Deep low-latency joint speech transmission and enhancement over a gaussian channel—0
Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair—0
Deep neural network techniques for monaural speech enhancement: state of the art analysis—0
Deep Noise Suppression Maximizing Non-Differentiable PESQ Mediated by a Non-Intrusive PESQNet—0
Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data—0
Deep Residual Echo Suppression and Noise Reduction: A Multi-Input FCRN Approach in a Hybrid Speech Enhancement System—0
Deep Speech Enhancement for Reverberated and Noisy Signals using Wide Residual Networks—0
Deep Time Delay Neural Network for Speech Enhancement with Full Data Learning—0
Deep Unfolding: Model-Based Inspiration of Novel Deep Architectures—0
Deep Xi as a Front-End for Robust Automatic Speech Recognition—0
Dense CNN with Self-Attention for Time-Domain Speech Enhancement—0
Show:102550
← PrevPage 18 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified