SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 351–400 of 982 papers

TitleStatusHype
A Study of Enhancement, Augmentation, and Autoencoder Methods for Domain Adaptation in Distant Speech Recognition—0
Consistency-aware multi-channel speech enhancement using deep neural networks—0
Conditional Generative Adversarial Networks for Speech Enhancement and Noise-Robust Speaker Verification—0
A Statistically Principled and Computationally Efficient Approach to Speech Enhancement using Variational Autoencoders—0
Assessing the Generalization Gap of Learning-Based Speech Enhancement Systems in Noisy and Reverberant Environments—0
A Monaural Speech Enhancement Method for Robust Small-Footprint Keyword Spotting—0
Advanced Clustering Techniques for Speech Signal Enhancement: A Review and Metanalysis of Fuzzy C-Means, K-Means, and Kernel Fuzzy C-Means Methods—0
Complex spectrogram enhancement by convolutional neural network with multi-metrics learning—0
Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network for Speech Enhancement—0
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations—0
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling—0
Generative Pre-training for Speech with Flow Matching—0
Comparison of remote experiments using crowdsourcing and laboratory experiments on speech intelligibility—0
A Speech Intelligibility Enhancement Model based on Canonical Correlation and Deep Learning for Hearing-Assistive Technologies—0
Comparative Study between Adversarial Networks and Classical Techniques for Speech Enhancement—0
Comparative Analysis of Personalized Voice Activity Detection Systems: Assessing Real-World Effectiveness—0
語音增強基於小腦模型控制器(A Speech Enhancement System Based on Cerebellar Model Articulation Controller) [In Chinese]—0
Combining Spatial Clustering with LSTM Speech Models for Multichannel Speech Enhancement—0
Full Attention Bidirectional Deep Learning Structure for Single Channel Speech Enhancement—0
Collaborative Deep Learning for Speech Enhancement: A Run-Time Model Selection Method Using Autoencoders—0
A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, and Extraction—0
A Model Compression Method with Matrix Product Operators for Speech Enhancement—0
Artificial Intelligence for Cochlear Implants: Review of Strategies, Challenges, and Perspectives—0
A consolidated view of loss functions for supervised deep learning-based speech enhancement—0
Accelerating RNN-based Speech Enhancement on a Multi-Core MCU with Mixed FP16-INT8 Post-Training Quantization—0
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement—0
Frequency Gating: Improved Convolutional Neural Networks for Speech Enhancement in the Time-Frequency Domain—0
Cold Diffusion for Speech Enhancement—0
Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition—0
French Listening Tests for the Assessment of Intelligibility, Quality, and Identity of Body-Conducted Speech Enhancement—0
A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model—0
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching—0
Coarse-to-fine Optimization for Speech Enhancement—0
A scalable noisy speech dataset and online subjective test framework—0
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend—0
FINALLY: fast and universal speech enhancement with studio-like quality—0
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning—0
Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition—0
Generalized Fast Multichannel Nonnegative Matrix Factorization Based on Gaussian Scale Mixtures for Blind Source Separation—0
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement—0
FFC-SE: Fast Fourier Convolution for Speech Enhancement—0
Generative Speech Enhancement Based on Cloned Networks—0
Feature Normalization for Fine-tuning Self-Supervised Models in Speech Enhancement—0
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement—0
GhostRNN: Reducing State Redundancy in RNN with Cheap Operations—0
GIST-AiTeR System for the Diarization Task of the 2022 VoxCeleb Speaker Recognition Challenge—0
GLD-Net: Improving Monaural Speech Enhancement by Learning Global and Local Dependency Features with GLD Block—0
Closing the Gap Between Time-Domain Multi-Channel Speech Enhancement on Real and Simulation Conditions—0
Artifact-free Sound Quality in DNN-based Closed-loop Systems for Audio Processing—0
FB-MSTCN: A Full-Band Single-Channel Speech Enhancement Method Based on Multi-Scale Temporal Convolutional Network—0
Show:102550
← PrevPage 8 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified