SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 551–600 of 982 papers

TitleStatusHype
LeVoice ASR Systems for the ISCSLP 2022 Intelligent Cockpit Speech Recognition Challenge—0
Binaural Speech Enhancement Using STOI-Optimal Masks—0
Speech Enhancement Using Self-Supervised Pre-Trained Model and Vector Quantization—0
Speech Enhancement with Perceptually-motivated Optimization and Dual Transformations—0
GIST-AiTeR System for the Diarization Task of the 2022 VoxCeleb Speaker Recognition Challenge—0
A Universally-Deployable ASR Frontend for Joint Acoustic Echo Cancellation, Speech Enhancement, and Voice Separation—0
Multimodal Speech Enhancement Using Burst Propagation—0
Multi-View Attention Transfer for Efficient Speech Enhancement—0
Speech Enhancement and Dereverberation with Diffusion-based Generative Models—0
DNN-Free Low-Latency Adaptive Speech Enhancement Based on Frame-Online Beamforming Powered by Block-Online FastMNMF—0
ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding—0
Multi-channel target speech enhancement based on ERB-scaled spatial coherence features—0
Improving spatial cues for hearables using a parameterized binaural CDR estimator—0
Direction-Aware Joint Adaptation of Neural Speech Enhancement and Recognition in Real Multiparty Conversational Environments—0
Improving Visual Speech Enhancement Network by Learning Audio-visual Affinity with Multi-head Attention—0
GLD-Net: Improving Monaural Speech Enhancement by Learning Global and Local Dependency Features with GLD Block—0
Challenges and Opportunities in Multi-device Speech Processing—0
SAQAM: Spatial Audio Quality Assessment Metric—0
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes—0
Multi-channel end-to-end neural network for speech enhancement, source localization, and voice activity detection—0
0/1 Deep Neural Networks via Block Coordinate Descent—0
NASTAR: Noise Adaptive Speech Enhancement with Target-Conditional Resampling—0
EPG2S: Speech Generation and Speech Enhancement based on Electropalatography and Audio Signals using Multimodal Learning—0
Adversarial Privacy Protection on Speech EnhancementCode0
To Dereverb Or Not to Dereverb? Perceptual Studies On Real-Time Dereverberation Targets—0
Canonical Cortical Graph Neural Networks and its Application for Speech Enhancement in Audio-Visual Hearing Aids—0
Far-Field Speaker Recognition Benchmark Derived From The DiPCo Corpus—0
Joint Training of Speech Enhancement and Self-supervised Model for Noise-robust ASR—0
NeuralEcho: A Self-Attentive Recurrent Neural Network For Unified Acoustic Echo Suppression And Speech Enhancement—0
Dictionary-Based Fusion of Contact and Acoustic Microphones for Wind Noise Reduction—0
Streaming Noise Context Aware Enhancement For Automatic Speech Recognition in Multi-Talker Environments—0
Task splitting for DNN-based acoustic echo and noise removal—0
A deep representation learning speech enhancement method using β-VAE—0
Generalized Fast Multichannel Nonnegative Matrix Factorization Based on Gaussian Scale Mixtures for Blind Source Separation—0
Speaker Reinforcement Using Target Source Extraction for Robust Automatic Speech Recognition—0
Acoustic echo suppression using a learning-based multi-frame minimum variance distortionless response filter—0
On monoaural speech enhancement for automatic recognition of real noisy speech using mixture invariant training—0
Improving Dual-Microphone Speech Enhancement by Learning Cross-Channel Features with Multi-Head Attention—0
A Meeting Transcription System for an Ad-Hoc Acoustic Sensor Network—0
Improved far-field speech recognition using Joint Variational Autoencoder—0
RadioSES: mmWave-Based Audioradio Speech Enhancement and Separation System—0
Receptive Field Analysis of Temporal Convolutional Networks for Monaural Speech DereverberationCode0
Listen only to me! How well can target speech extraction handle false alarms?—0
Exploiting Hidden Representations from a DNN-based Speech Recogniser for Speech Intelligibility Prediction in Hearing-impaired ListenersCode0
FFC-SE: Fast Fourier Convolution for Speech Enhancement—0
Expression-preserving face frontalization improves visually assisted speech processing—0
Complex Recurrent Variational Autoencoder with Application to Speech EnhancementCode0
Audio-visual multi-channel speech separation, dereverberation and recognition—0
Fast Real-time Personalized Speech Enhancement: End-to-End Enhancement Network (E3Net) and Knowledge Distillation—0
End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation—0
Show:102550
← PrevPage 12 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified