SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 501–550 of 982 papers

TitleStatusHype
Resource-Efficient Speech Mask Estimation for Multi-Channel Speech Enhancement—0
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules—0
Rethinking complex-valued deep neural networks for monaural speech enhancement—0
Rethinking Mamba in Speech Processing by Self-Supervised Models—0
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance—0
ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement—0
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing—0
Robust Multi-channel Speech Recognition using Frequency Aligned Network—0
Robustness of Voice Conversion Techniques Under Mismatched Conditions—0
Robust Speaker Recognition Using Speech Enhancement And Attention Model—0
ROBUST SPEECH COMMAND RECOGNITION USING LABEL-DRIVEN TIME-FREQUENCY MASKING—0
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement—0
Robust Unsupervised Audio-visual Speech Enhancement Using a Mixture of Variational Autoencoders—0
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations—0
Royalflush Speaker Diarization System for ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge—0
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement—0
Run-Time Adaptation of Neural Beamforming for Robust Speech Dereverberation and Denoising—0
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation—0
SAMbA: Speech enhancement with Asynchronous ad-hoc Microphone Arrays—0
SAQAM: Spatial Audio Quality Assessment Metric—0
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model—0
Scalable Speech Enhancement with Dynamic Channel Pruning—0
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling—0
Scaling Speech Enhancement in Unseen Environments with Noise Embeddings—0
SCA: Streaming Cross-attention Alignment for Echo Cancellation—0
Scenario-Aware Audio-Visual TF-GridNet for Target Speech Extraction—0
Schrödinger Bridge for Generative Speech Enhancement—0
SCP-GAN: Self-Correcting Discriminator Optimization for Training Consistency Preserving Metric GAN on Speech Enhancement Tasks—0
S-DCCRN: Super Wide Band DCCRN with learnable complex feature for speech enhancement—0
SE-Bridge: Speech Enhancement with Consistent Brownian Bridge—0
SECP: A Speech Enhancement-Based Curation Pipeline For Scalable Acquisition Of Clean Speech—0
SEFGAN: Harvesting the Power of Normalizing Flows and GANs for Efficient High-Quality Speech Enhancement—0
Selective State Space Model for Monaural Speech Enhancement—0
Selector-Enhancer: Learning Dynamic Selection of Local and Non-local Attention Operation for Speech Enhancement—0
Self-Supervised Audio-Visual Soundscape Stylization—0
Efficient Personalized Speech Enhancement through Self-Supervised Learning—0
On the Role of Visual Cues in Audiovisual Speech Enhancement—0
Task-aware Warping Factors in Mask-based Speech Enhancement—0
Universal Sound Separation—0
CochleaNet: A Robust Language-independent Audio-Visual Model for Speech Enhancement—0
A Bayesian Permutation training deep representation learning method for speech enhancement with variational autoencoder—0
Accelerating RNN-based Speech Enhancement on a Multi-Core MCU with Mixed FP16-INT8 Post-Training Quantization—0
A Closer Look at Wav2Vec2 Embeddings for On-Device Single-Channel Speech Enhancement—0
A Comparative Evaluation of Deep Learning Models for Speech Enhancement in Real-World Noisy Environments—0
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement—0
A Conformer-based ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement and Speech Separation—0
A consolidated view of loss functions for supervised deep learning-based speech enhancement—0
Acoustic echo suppression using a learning-based multi-frame minimum variance distortionless response filter—0
Acoustics-guided evaluation (AGE): a new measure for estimating performance of speech enhancement algorithms for robust ASR—0
Acoustic Structure Inverse Design and Optimization Using Deep Learning—0
Show:102550
← PrevPage 11 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified