SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 651–700 of 982 papers

TitleStatusHype
Reduction of Subjective Listening Effort for TV Broadcast Signals with Recurrent Neural Networks—0
SNRi Target Training for Joint Speech Enhancement and Recognition—0
Cross-attention conformer for context modeling in speech enhancement for ASR—0
Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction—0
Closing the Gap Between Time-Domain Multi-Channel Speech Enhancement on Real and Simulation Conditions—0
One model to enhance them all: array geometry agnostic multi-channel personalized speech enhancement—0
Speech Enhancement Based on Cyclegan with Noise-informed Training—0
Speech Enhancement-assisted Voice Conversion in Noisy Environments—0
Personalized Speech Enhancement: New Models and Comprehensive Evaluation—0
Similarity-and-Independence-Aware Beamformer with Iterative Casting and Boost Start for Target Source Extraction Using Reference—0
Improving Character Error Rate Is Not Equal to Having Clean Speech: Speech Enhancement for ASR Systems with Black-box Acoustic Models—0
Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs for Robust Speech Recognition—0
Aura: Privacy-preserving Augmentation to Improve Test Set Diversity in Speech EnhancementCode0
Lightweight Speech Enhancement in Unseen Noisy and Reverberant Conditions using KISS-GEV Beamforming—0
PL-EESR: Perceptual Loss Based END-TO-END Robust Speaker Representation ExtractionCode0
End-to-End Complex-Valued Multidilated Convolutional Neural Network for Joint Acoustic Echo Cancellation and Noise Suppression—0
Employing low-pass filtered temporal speech features for the training of ideal ratio mask in speech enhancement—0
Speech-MLP: a simple MLP architecture for speech processing—0
Masks Fusion with Multi-Target Learning For Speech EnhancementCode0
DDS: A new device-degraded speech dataset for speech enhancement—0
Incorporating Real-world Noisy Speech in Neural-network-based Speech Enhancement Systems—0
Time Alignment using Lip Images for Frame-based Electrolaryngeal Voice Conversion—0
Machine Learning: Challenges, Limitations, and Compatibility for Audio Restoration Processes—0
A Two-stage Complex Network using Cycle-consistent Generative Adversarial Networks for Speech Enhancement—0
Task-aware Warping Factors in Mask-based Speech Enhancement—0
Full Attention Bidirectional Deep Learning Structure for Single Channel Speech Enhancement—0
Cross-domain Single-channel Speech Enhancement Model with Bi-projection Fusion Module for Noise-robust ASR—0
Deep Residual Echo Suppression and Noise Reduction: A Multi-Input FCRN Approach in a Hybrid Speech Enhancement System—0
Inplace Gated Convolutional Recurrent Neural Network For Dual-channel Speech Enhancement—0
Controlling the Perceived Sound Quality for Dialogue Enhancement with Deep Learning—0
Multitask-Based Joint Learning Approach To Robust ASR For Radio Communication Speech—0
Incorporating Multi-Target in Multi-Stage Speech Enhancement Model for Better Generalization—0
DF-Conformer: Integrated architecture of Conv-TasNet and Conformer using linear complexity self-attention for speech enhancement—0
SRIB-LEAP submission to Far-field Multi-Channel Speech Enhancement Challenge for Video Conferencing—0
Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair—0
DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement—0
A Flow-Based Neural Network for Time Domain Speech Enhancement—0
Deep Interaction between Masking and Mapping Targets for Single-Channel Speech Enhancement—0
Human Listening and Live Captioning: Multi-Task Training for Speech Enhancement—0
Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition—0
A Neural Acoustic Echo Canceller Optimized Using An Automatic Speech Recognizer And Large Scale Synthetic Data—0
Phoneme-Based Ratio Mask Estimation for Reverberant Speech Enhancement in Cochlear Implant Processors—0
An Improved Measure of Musical Noise Based on Spectral Kurtosis—0
Training Speech Enhancement Systems with Noisy Speech Datasets—0
Disentanglement Learning for Variational Autoencoders Applied to Audio-Visual Speech EnhancementCode0
A time-domain nearfield frequency-invariant beamforming method—0
Dual-Stage Low-Complexity Reconfigurable Speech Enhancement—0
Zero-Shot Personalized Speech Enhancement through Speaker-Informed Model Selection—0
Test-Time Adaptation Toward Personalized Speech Enhancement: Zero-Shot Learning with Knowledge Distillation—0
Speech Enhancement using Separable Polling Attention and Global Layer Normalization followed with PReLU—0
Show:102550
← PrevPage 14 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified