SOTAVerified

Speech Enhancement

Speech Enhancement is a signal processing task that involves improving the quality of speech signals captured under noisy or degraded conditions. The goal of speech enhancement is to make speech signals clearer, more intelligible, and more pleasant to listen to, which can be used for various applications such as voice recognition, teleconferencing, and hearing aids. A representative Github project with online demo : ClearerVoice-Studio.

( Image credit: A Fully Convolutional Neural Network For Speech Enhancement )

Papers

Showing 401–450 of 982 papers

TitleStatusHype
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling—0
Group-Sparse Signal Denoising: Non-Convex Regularization, Convex Optimization—0
Guided Speech Enhancement Network—0
Guided Variational Autoencoder for Speech Enhancement With a Supervised Classifier—0
Harmonic and non-Harmonic Based Noisy Reverberant Speech Enhancement in Time Domain—0
Harmonic enhancement using learnable comb filter for light-weight full-band speech enhancement model—0
End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks—0
Helsinki Speech Challenge 2024—0
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement—0
End-to-End Neural Speech Coding for Real-Time Communications—0
Hidden-Markov-Model Based Speech Enhancement—0
End-to-End Model for Speech Enhancement by Consistent Spectrogram Masking—0
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement—0
A Novel Frame Structure for Cloud-Based Audio-Visual Speech Enhancement in Multimodal Hearing-aids—0
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement—0
End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation—0
High-quality Speech Synthesis Using Super-resolution Mel-Spectrogram—0
Controlling the Perceived Sound Quality for Dialogue Enhancement with Deep Learning—0
End-to-End Complex-Valued Multidilated Convolutional Neural Network for Joint Acoustic Echo Cancellation and Noise Suppression—0
How Bad Are Artifacts?: Analyzing the Impact of Speech Enhancement Errors on ASR—0
How does end-to-end speech recognition training impact speech enhancement artifacts?—0
How much to Dereverberate? Low-Latency Single-Channel Speech Enhancement in Distant Microphone Scenarios—0
Convolutional-Recurrent Neural Networks for Speech Enhancement—0
Human Listening and Live Captioning: Multi-Task Training for Speech Enhancement—0
Employing low-pass filtered temporal speech features for the training of ideal ratio mask in speech enhancement—0
EMGSE: Acoustic/EMG Fusion for Multimodal Speech Enhancement—0
Breaking the trade-off in personalized speech enhancement with cross-task knowledge distillation—0
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams—0
Egocentric Audio-Visual Noise Suppression—0
Improved Normalizing Flow-Based Speech Enhancement using an All-pole Gammatone Filterbank for Conditional Input Representation—0
Cross-attention conformer for context modeling in speech enhancement for ASR—0
Improved Speech Enhancement with the Wave-U-Net—0
Improving Character Error Rate Is Not Equal to Having Clean Speech: Speech Enhancement for ASR Systems with Black-box Acoustic Models—0
Improving Design of Input Condition Invariant Speech Enhancement—0
Improving Dual-Microphone Speech Enhancement by Learning Cross-Channel Features with Multi-Head Attention—0
Boosting Objective Scores of a Speech Enhancement Model by MetricGAN Post-processing—0
Improving noise robust automatic speech recognition with single-channel time-domain enhancement network—0
Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction—0
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising—0
Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes—0
Improving Perceptual Quality, Intelligibility, and Acoustics on VoIP Platforms—0
Improving spatial cues for hearables using a parameterized binaural CDR estimator—0
Efficient Trainable Front-Ends for Neural Speech Enhancement—0
Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training—0
Improving the Intent Classification accuracy in Noisy Environment—0
Improving Visual Speech Enhancement Network by Learning Audio-visual Affinity with Multi-head Attention—0
A Novel Speech Intelligibility Enhancement Model based on CanonicalCorrelation and Deep Learning—0
Incorporating Multi-Target in Multi-Stage Speech Enhancement Model for Better Generalization—0
Incorporating Real-world Noisy Speech in Neural-network-based Speech Enhancement Systems—0
A Bayesian Permutation training deep representation learning method for speech enhancement with variational autoencoder—0
Show:102550
← PrevPage 9 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ROSE-CD(PESQ)PESQ (wb)3.99—Unverified
2PESQetarianPESQ (wb)3.82—Unverified
3Mamba-SEUNet L (+PCS)PESQ (wb)3.73—Unverified
4Schrödinger bridge (PESQ loss)PESQ (wb)3.7—Unverified
5SEMamba (+PCS)PESQ (wb)3.69—Unverified
6ZipEnhancer (S, \lamba_6 = 0)PESQ (wb)3.63—Unverified
7PrimeK-NetPESQ (wb)3.61—Unverified
8ZipEnhancer (S, \lamba_6 = 0.2)PESQ (wb)3.61—Unverified
9MP-SENetPESQ (wb)3.6—Unverified
10PCS_CS_WAVLMPESQ (wb)3.54—Unverified
#ModelMetricClaimedVerifiedStatus
1BSRNN-S + MGDSI-SDR-WB21.4—Unverified
2DTLNSI-SDR-WB16.34—Unverified
3Non-Real-Time MultiScale+SI-SDR-WB16.22—Unverified
4ZipEnhancer (M)PESQ-WB3.81—Unverified
5TF-Locoformer (M)PESQ-WB3.72—Unverified
6ZipEnhancer (S)PESQ-WB3.69—Unverified
7MambAttentionPESQ-WB3.67—Unverified
8MP-SENetPESQ-WB3.62—Unverified
9xLSTM-SENetPESQ-WB3.59—Unverified
10BSRNN-S + MRSDPESQ-WB3.53—Unverified
#ModelMetricClaimedVerifiedStatus
1Inter-Channel Conv-TasNetSDR19.67—Unverified
2CA Dense U-Net (Complex)SDR18.64—Unverified
3Dense U-Net (Complex)SDR18.4—Unverified
4Dense U-Net (Real)SDR16.86—Unverified
5U-Net (Real)SDR15.97—Unverified
6Noisy/unprocessedSDR6.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Schrödinger Bridge (PESQ loss)PESQ-WB3.09—Unverified
2SGMSE+PESQ-WB2.5—Unverified
3Demucs v4PESQ-WB2.37—Unverified
4Schrödinger BridgePESQ-WB2.33—Unverified
5Conv-TasNetPESQ-WB2.31—Unverified
6CDiffuSEPESQ-WB1.6—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVISE (ch2)Audio Quality MOS4.19—Unverified
2ReVISE (bf)Audio Quality MOS4.11—Unverified
3Demucs (ch2)Audio Quality MOS2.95—Unverified
4Demucs (bf)Audio Quality MOS2.39—Unverified
5MaxDI (Baseline)PESQ1.17—Unverified
6DAJA (MVDR,HMA,1000) (Overlapped Speech)SDR-4.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ZipEnhancer (M)PESQ-NB4.08—Unverified
2DCCRN-MCPESQ-NB3.21—Unverified
3DCCRN-MPESQ-NB3.15—Unverified
4DCCRNPESQ-NB3.04—Unverified
5RNN-ModulationPESQ-WB2.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MambAttentionESTOI0.8—Unverified
2SEMambaESTOI0.8—Unverified
3xLSTM-SENetESTOI0.8—Unverified
4MP-SENetESTOI0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ2.84—Unverified
2DTLNPESQ2.23—Unverified
3UnprocessedPESQ1.83—Unverified
4Non-Real-Time MultiScale+PESQ1.52—Unverified
#ModelMetricClaimedVerifiedStatus
1DCUNet-MCPESQ-NB3.44—Unverified
2DCCRN-MPESQ-NB3.28—Unverified
3DCUNetPESQ-NB3.25—Unverified
#ModelMetricClaimedVerifiedStatus
1CleanMel-L-mapDNSMOS3.82—Unverified
2SpatialNetDNSMOS BAK3.43—Unverified
#ModelMetricClaimedVerifiedStatus
1rose_cd(PESQ )PESQ3.99—Unverified
2ROSE-CDPESQ3.49—Unverified
#ModelMetricClaimedVerifiedStatus
1Wave-U-NetCBAK3.24—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ2.7—Unverified
#ModelMetricClaimedVerifiedStatus
1SE-MelGANAudio Quality MOS3.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeFT-ANPESQ3.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Audio-Visual concat-refPESQ3.03—Unverified
#ModelMetricClaimedVerifiedStatus
1SepFormerPESQ3.07—Unverified