SOTAVerified

Audio Generation

Audio generation (synthesis) is the task of generating raw audio such as speech.

( Image credit: MelNet )

Papers

Showing 201–250 of 270 papers

TitleStatusHype
Learning Source Disentanglement in Neural Audio Codec—0
Leveraging AI to Generate Audio for User-generated Content in Video Games—0
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study—0
LiLAC: A Lightweight Latent ControlNet for Musical Audio Generation—0
LM-VC: Zero-shot Voice Conversion via Speech Generation based on Language Models—0
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens—0
Masked Audio Generation using a Single Non-Autoregressive Transformer—0
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation—0
MEDIC: Zero-shot Music Editing with Disentangled Inversion Control—0
MetaBGM: Dynamic Soundtrack Transformation For Continuous Multi-Scene Experiences With Ambient Awareness And Personalization—0
MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation—0
Modeling and Driving Human Body Soundfields through Acoustic Primitives—0
Music Source Separation in the Waveform Domain—0
Music Style Transfer With Diffusion Model—0
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization—0
Neural Granular Sound Synthesis—0
Nonparametric estimation of a factorizable density using diffusion models—0
NU-GAN: High resolution neural upsampling with GAN—0
On Target Representation in Continuous-output Neural Machine Translation—0
On the Design of Diffusion-based Neural Speech Codecs—0
On The Open Prompt Challenge In Conditional Audio Generation—0
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation—0
Text-to-Audio Generation Synchronized with Videos—0
The NPU-HWC System for the ISCSLP 2024 Inspirational and Convincing Audio Generation Challenge—0
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation—0
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models—0
Towards efficient quantum algorithms for diffusion probability models—0
Transferring neural speech waveform synthesizers to musical instrument sounds generation—0
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control—0
Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio—0
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation—0
(Un)paired signal-to-signal translation with 1D conditional GANs—0
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound—0
Video-Guided Foley Sound Generation with Multimodal Controls—0
Video-to-Audio Generation with Fine-grained Temporal Semantics—0
Video-to-Audio Generation with Hidden Alignment—0
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation—0
ViSAGe: Video-to-Spatial Audio Generation—0
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation—0
Visually Informed Binaural Audio Generation without Binaural Audios—0
Voice command generation using Progressive Wavegans—0
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis—0
Wasserstein Convergence of Score-based Generative Models under Semiconvexity and Discontinuous Gradients—0
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition—0
Synthetic training set generation using text-to-audio models for environmental sound classification—0
Audio Deepfake Attribution: An Initial Dataset and Investigation—0
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining—0
TA-V2A: Textually Assisted Video-to-Audio Generation—0
Stochastic Diffusion: A Diffusion Probabilistic Model for Stochastic Time Series ForecastingCode0
Conditional Diffusion Models with Classifier-Free Gibbs-like GuidanceCode0
Show:102550
← PrevPage 5 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1AudioGenFD_openl3185.53—Unverified
2AudioLDM2-largeFD_openl3158.04—Unverified
3Stable Audio 2.0FD_openl3110.62—Unverified
4Stable AudioFD_openl3103.66—Unverified
5ETTAFD_openl380.13—Unverified
6TangoFlux-baseFD_openl379.7—Unverified
7Stable Audio OpenFD_openl378.24—Unverified
8TangoFluxFD_openl375.1—Unverified
9ETTA-FT-AC-100kFD_openl361.79—Unverified
10DiffsoundFAD7.75—Unverified
#ModelMetricClaimedVerifiedStatus
1VAB-Encodec (Ours)Bits per byte40—Unverified
2Sparse Transformer 152M (strided)Bits per byte1.97—Unverified
#ModelMetricClaimedVerifiedStatus
1SymphonyNet Human listening average results3.5—Unverified