SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 351–400 of 982 papers

TitleStatusHype
Can We Trust Deep Speech Prior?—0
Exploring Length Generalization For Transformer-based Speech Enhancement—0
Evaluating Speech Enhancement Systems Through Listening Effort—0
Exploring Speech Enhancement for Low-resource Speech Synthesis—0
Exploring Speech Enhancement with Generative Adversarial Networks for Robust Speech Recognition—0
Exploring the Best Loss Function for DNN-Based Low-latency Speech Enhancement with Temporal Convolutional Networks—0
Exploring the Potential of Data-Driven Spatial Audio Enhancement Using a Single-Channel Model—0
Exploring WavLM on Speech Enhancement—0
Expression-preserving face frontalization improves visually assisted speech processing—0
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings—0
Can we steal your vocal identity from the Internet?: Initial investigation of cloning Obama's voice using GAN, WaveNet and low-quality found data—0
FADI-AEC: Fast Score Based Diffusion Model Guided by Far-end Signal for Acoustic Echo Cancellation—0
A Preliminary Study of the Application of Discrete Wavelet Transform Features in Conv-TasNet Speech Enhancement Model—0
ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding—0
Fast and efficient speech enhancement with variational autoencoders—0
ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration—0
Canonical Cortical Graph Neural Networks and its Application for Speech Enhancement in Audio-Visual Hearing Aids—0
EPG2S: Speech Generation and Speech Enhancement based on Electropalatography and Audio Signals using Multimodal Learning—0
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures—0
FB-MSTCN: A Full-Band Single-Channel Speech Enhancement Method Based on Multi-Scale Temporal Convolutional Network—0
Feature Normalization for Fine-tuning Self-Supervised Models in Speech Enhancement—0
FFC-SE: Fast Fourier Convolution for Speech Enhancement—0
Building state-of-the-art distant speech recognition using the CHiME-4 challenge with a setup of speech enhancement baseline—0
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend—0
A Deep Representation Learning-based Speech Enhancement Method Using Complex Convolution Recurrent Variational Autoencoder—0
Enhancement of Spatial Clustering-Based Time-Frequency Masks using LSTM Neural Networks—0
Enhancement of Noisy Speech with Low Speech Distortion Based on Probabilistic Geometric Spectral Subtraction—0
Building a Luganda Text-to-Speech Model From Crowdsourced Data—0
Enhancement of Noisy Speech Exploiting an Exponential Model Based Threshold and a Custom Thresholding Function in Perceptual Wavelet Packet Domain—0
Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition—0
Frequency Gating: Improved Convolutional Neural Networks for Speech Enhancement in the Time-Frequency Domain—0
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement—0
Enhancement and Recognition of Reverberant and Noisy Speech by Extending Its Coherence—0
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling—0
End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks—0
End-to-End Neural Speech Coding for Real-Time Communications—0
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning—0
Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition—0
Generalized Fast Multichannel Nonnegative Matrix Factorization Based on Gaussian Scale Mixtures for Blind Source Separation—0
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement—0
End-to-End Model for Speech Enhancement by Consistent Spectrogram Masking—0
Generative Speech Enhancement Based on Cloned Networks—0
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling—0
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement—0
GhostRNN: Reducing State Redundancy in RNN with Cheap Operations—0
GIST-AiTeR System for the Diarization Task of the 2022 VoxCeleb Speaker Recognition Challenge—0
GLD-Net: Improving Monaural Speech Enhancement by Learning Global and Local Dependency Features with GLD Block—0
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement—0
A Novel Frame Structure for Cloud-Based Audio-Visual Speech Enhancement in Multimodal Hearing-aids—0
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement—0
Show:102550
← PrevPage 8 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified