SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 901–950 of 982 papers

TitleStatusHype
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement—0
Design and Optimization of a Speech Recognition Front-End for Distant-Talking Control of a Music Playback Device—0
DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing—0
DF-Conformer: Integrated architecture of Conv-TasNet and Conformer using linear complexity self-attention for speech enhancement—0
DFingerNet: Noise-Adaptive Speech Enhancement for Hearing Aids—0
DFSNet: A Steerable Neural Beamformer Invariant to Microphone Array Configuration for Real-Time, Low-Latency Speech Enhancement—0
Dictionary-Based Fusion of Contact and Acoustic Microphones for Wind Noise Reduction—0
Dictionary Update for NMF-based Voice Conversion Using an Encoder-Decoder Network—0
DiffPhase: Generative Diffusion-based STFT Phase Retrieval—0
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement—0
Diffusion-based Signal Refiner for Speech Separation—0
Diffusion-Based Speech Enhancement in Matched and Mismatched Conditions Using a Heun-Based Sampler—0
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule—0
Diffusion-based speech enhancement with a weighted generative-supervised learning loss—0
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders—0
Diffusion-based Unsupervised Audio-visual Speech Enhancement—0
Diffusion Buffer: Online Diffusion-based Speech Enhancement with Sub-Second Latency—0
DDTSE: Discriminative Diffusion Model for Target Speech Extraction—0
Diffusion Models for Audio Restoration—0
Dilated U-net based approach for multichannel speech enhancement from First-Order Ambisonics recordings—0
Direction-Aware Joint Adaptation of Neural Speech Enhancement and Recognition in Real Multiparty Conversational Environments—0
Distributed Microphone Speech Enhancement based on Deep Learning—0
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers—0
DNN-Based Distributed Multichannel Mask Estimation for Speech Enhancement in Microphone Arrays—0
DNN-Based Speech Presence Probability Estimation for Multi-Frame Single-Microphone Speech Enhancement—0
DNN-Free Low-Latency Adaptive Speech Enhancement Based on Frame-Online Beamforming Powered by Block-Online FastMNMF—0
Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study—0
Does Speech enhancement of publicly available data help build robust Speech Recognition Systems?—0
Downstream Task Agnostic Speech Enhancement with Self-Supervised Representation Loss—0
DPATD: Dual-Phase Audio Transformer for Denoising—0
DPSNN: Spiking Neural Network for Low-Latency Streaming Speech Enhancement—0
An Investigation of End-to-End Multichannel Speech Recognition for Reverberant and Mismatch Conditions—0
Dual-Stage Low-Complexity Reconfigurable Speech Enhancement—0
Dynamic Acoustic Compensation and Adaptive Focal Training for Personalized Speech Enhancement—0
Dynamic Gated Recurrent Neural Network for Compute-efficient Speech Enhancement—0
Dynamic Kernels and Channel Attention for Low Resource Speaker Verification—0
EDNet: A Distortion-Agnostic Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training—0
非負矩陣分解法於語音調變頻譜強化之研究(A study of enhancing the modulation spectrum of speech signals via nonnegative matrix factorization)[In Chinese]—0
EffCRN: An Efficient Convolutional Recurrent Network for High-Performance Speech Enhancement—0
Effect of noise suppression losses on speech distortion and ASR performance—0
Effects of Lombard Reflex on the Performance of Deep-Learning-Based Audio-Visual Speech Enhancement Systems—0
A Dual-Staged Context Aggregation Method Towards Efficient End-To-End Speech Enhancement—0
Efficient Encoder-Decoder and Dual-Path Conformer for Comprehensive Feature Learning in Speech Enhancement—0
Efficient High-Performance Bark-Scale Neural Network for Residual Echo and Noise Suppression—0
Efficient Low-Latency Speech Enhancement with Mobile Audio Streaming Networks—0
Efficient Monaural Speech Enhancement using Spectrum Attention Fusion—0
Efficient Trainable Front-Ends for Neural Speech Enhancement—0
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes—0
Egocentric Audio-Visual Noise Suppression—0
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams—0
Show:102550
← PrevPage 19 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified