SOTAVerified

Audio Classification

Audio Classification is a machine learning task that involves identifying and tagging audio signals into different classes or categories. The goal of audio classification is to enable machines to automatically recognize and distinguish between different types of audio, such as music, speech, and environmental sounds.

Papers

Showing 1–50 of 361 papers

TitleStatusHype
InternVideo2: Scaling Foundation Models for Multimodal Video UnderstandingCode7
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic AlignmentCode4
Leveraging tropical reef, bird and unrelated sounds for superior transfer learning in marine bioacousticsCode3
EAT: Self-Supervised Pre-Training with Efficient Audio TransformerCode3
Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language ModelsCode3
ONE-PEACE: Exploring One General Representation Model Toward Unlimited ModalitiesCode3
CMKD: CNN/Transformer-Based Cross-Model Knowledge Distillation for Audio ClassificationCode3
Audio Mamba: Bidirectional State Space Model for Audio Representation LearningCode2
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space ModelCode2
Benchmarking Representations for Speech, Music, and Acoustic EventsCode2
BirdSet: A Large-Scale Dataset for Audio Classification in Avian BioacousticsCode2
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music AudioCode2
Oceanship: A Large-Scale Dataset for Underwater Audio Target RecognitionCode2
Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio ModelsCode2
Global birdsong embeddings enable superior transfer learning for bioacoustic classificationCode2
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal ModelsCode2
Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge DistillationCode2
Contrastive Audio-Visual Masked AutoencoderCode2
HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and DetectionCode2
SSAST: Self-Supervised Audio Spectrogram TransformerCode2
AST: Audio Spectrogram TransformerCode2
Adaptive Differential Denoising for Respiratory Sounds ClassificationCode1
Masked Latent Prediction and Classification for Self-Supervised Audio Representation LearningCode1
CycleGuardian: A Framework for Automatic RespiratorySound classification Based on Improved Deep clustering and Contrastive LearningCode1
TaxaBind: A Unified Embedding Space for Ecological ApplicationsCode1
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic DataCode1
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and GenerationCode1
ReCLAP: Improving Zero Shot Audio Classification by Describing SoundsCode1
ElasticAST: An Audio Spectrogram Transformer for All Length and ResolutionsCode1
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable LearnersCode1
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative ConditionsCode1
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound ClassificationCode1
animal2vec and MeerKAT: A self-supervised transformer for rare-event raw audio input and a large-scale reference dataset for bioacousticsCode1
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation LearningCode1
Scalable Event-by-event Processing of Neuromorphic Sensory Signals With Deep State-Space ModelsCode1
MAX-AST: COMBINING CONVOLUTION, LOCAL AND GLOBAL SELF-ATTENTIONS FOR AUDIO EVENT CLASSIFICATIONCode1
Audio-Visual Generalized Zero-Shot Learning using Pre-Trained Large Multi-Modal ModelsCode1
DTF-AT: Decoupled Time-Frequency Audio Transformer for Event ClassificationCode1
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive LearningCode1
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio ClassificationCode1
Stethoscope-guided Supervised Contrastive Learning for Cross-domain Adaptation on Respiratory Sound ClassificationCode1
Parameter-Efficient Transfer Learning of Audio Spectrogram TransformersCode1
Acoustic Prompt Tuning: Empowering Large Language Models with Audition CapabilitiesCode1
Adversarial Fine-tuning using Generated Respiratory Sound to Address Class ImbalanceCode1
CLARA: Multilingual Contrastive Learning for Audio Representation AcquisitionCode1
Audio classification with Dilated Convolution with Learnable SpacingsCode1
RDLINet: A Novel Lightweight Inception Network for Respiratory Disease Classification Using Lung SoundsCode1
Learning Delays in Spiking Neural Networks using Dilated Convolutions with Learnable SpacingsCode1
Audio Tagging on an Embedded Hardware PlatformCode1
Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level TasksCode1
Show:102550
← PrevPage 1 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OmniVec2Test mAP0.56—Unverified
2OmniVecTest mAP0.55—Unverified
3EquiAVTest mAP0.55—Unverified
4MAViL (Audio-Visual, single)Test mAP0.53—Unverified
5Audiovisual Masked Autoencoder (Audiovisual, Single)Test mAP0.52—Unverified
6CAV-MAE (Audio-Visual)Test mAP0.51—Unverified
7BEATs (Audio-only, Ensemble)Test mAP0.51—Unverified
8UAVM (Audio + Video)Test mAP0.5—Unverified
9SSLAM (Audio-Only, Single)Test mAP0.5—Unverified
10mn40_as (Ensemble)Test mAP0.5—Unverified
#ModelMetricClaimedVerifiedStatus
1OmniVec2Top-1 Accuracy99.1—Unverified
2InternVideo2Top-1 Accuracy98.6—Unverified
3M2D2 AS+Top-1 Accuracy98.5—Unverified
4OmniVecTop-1 Accuracy98.4—Unverified
5BEATsTop-1 Accuracy98.1—Unverified
6mn40_asTop-1 Accuracy97.45—Unverified
7M2D-CLAP/0.7Top-1 Accuracy97.4—Unverified
8DyMN-LTop-1 Accuracy97.4—Unverified
9M2D-AS/0.7Top-1 Accuracy97.2—Unverified
10HTS-ATTop-1 Accuracy97—Unverified
#ModelMetricClaimedVerifiedStatus
1ADDICBHI Score65.53—Unverified
2BEATs (PAFA)ICBHI Score64.84—Unverified
3BTSICBHI Score63.54—Unverified
4BEATs (CE)ICBHI Score63.49—Unverified
5M2D-X/0.7 (η=0.3)ICBHI Score63.29—Unverified
6CycleGuardianICBHI Score63.26—Unverified
7M2D/0.7 (e=0.3)ICBHI Score62.73—Unverified
8Audio-CLAPICBHI Score62.56—Unverified
9AST (Patch-Mix CL)ICBHI Score62.37—Unverified
10AFT on Mixed-500ICBHI Score61.79—Unverified
#ModelMetricClaimedVerifiedStatus
1MBT (AV)Top 5 Accuracy85.6—Unverified
2Mirasol3BTop 1 Accuracy69.8—Unverified
3CA2ST(B/16)Top 1 Accuracy68.3—Unverified
4ONE-PEACE (Audio-Visual)Top 1 Accuracy68.2—Unverified
5CAVA(B/16)Top 1 Accuracy68.2—Unverified
6EquiAVTop 1 Accuracy67.1—Unverified
7MAViLTop 1 Accuracy67.1—Unverified
8MMT (Audio-Visual)Top 1 Accuracy66.2—Unverified
9CAV-MAE (Audio-Visual)Top 1 Accuracy65.9—Unverified
10UAVM (Audio + Video)Top 1 Accuracy65.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMPercentage correct95.9—Unverified
2SNN with Dilated Convolution with Learnable SpacingsPercentage correct95.1—Unverified
3SNN featuring learnable axonal delays with adaptively delay capsPercentage correct92.45—Unverified
4CNNPercentage correct92.4—Unverified
5SNN with spatio-temporal filters and attentionPercentage correct92.4—Unverified
6SNN with temporal-wise attentionPercentage correct91.1—Unverified
7SNNPercentage correct87—Unverified
8Recurrent convolutional SNNPercentage correct83.5—Unverified
9Recurrent SNNPercentage correct83.2—Unverified
10Sparse Spiking Gradient DescentPercentage correct77.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ONE-PEACEmAP69.7—Unverified
2MNmAP65.6—Unverified
3PaSST-SmAP65.55—Unverified
4DyMN-LmAP65.5—Unverified
5PaSST-N-SmAP64.2—Unverified
6LHGNNMean AP59—Unverified
7PSLAmAP56.71—Unverified
8MATPAC (SSL Model)mAP55.2—Unverified
9Temporal Knowledge Distillation for On-device Audio ClassificationmAP54.8—Unverified
10Large 6-Layer Transformer with PoolingmAP53.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EquiAVMean AP42.4—Unverified
2SSLAMMean AP40.9—Unverified
3EATMean AP40.3—Unverified
4BEATsMean AP38.9—Unverified
5Base (ours)Mean AP37.4—Unverified
6SSAST-PATCHMean AP31—Unverified
7SSAST-FRAMEMean AP29.2—Unverified
8ConformerMean AP27.6—Unverified
#ModelMetricClaimedVerifiedStatus
1PDCAccuracy97.8—Unverified
2ASM-RHAccuracy96.51—Unverified
3EfficientLEAFAccuracy95.2—Unverified
4melspectAccuracy95.1—Unverified
5LEAFAccuracy95.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMAccuracy88.4—Unverified
2SNN with Dilated Convolution with Learnable SpacingsAccuracy80.69—Unverified
3RadLIFAccuracy77.4—Unverified
4SpikGRUAccuracy77—Unverified
5Adaptive SRNNAccuracy74.2—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAF (8s)Accuracy72.2—Unverified
2EfficientLEAFAccuracy42.9—Unverified
3LEAFAccuracy42.3—Unverified
4melspectAccuracy39.9—Unverified
#ModelMetricClaimedVerifiedStatus
1CrissCross (AudioSet)Top-1 Accuracy97—Unverified
2CrissCross (Kinetics-400)Top-1 Accuracy96—Unverified
3XDCTop-1 Accuracy95—Unverified
4CrissCross (Kinetics-Sound)Top-1 Accuracy93—Unverified
#ModelMetricClaimedVerifiedStatus
1Audiovisual Masked Autoencoder (Audiovisual, Single)Top-1 Action46—Unverified
2Audiovisual Masked Autoencoder (Video-only, Single)Top-1 Action45.8—Unverified
3Audiovisual Masked Autoencoder (Audio-only, Single)Top-1 Action19.7—Unverified
4PlayItBackX3Top-1 Action15.9—Unverified
#ModelMetricClaimedVerifiedStatus
1M2D-AS/0.7Mean AP48.5—Unverified
2LHGNNMean AP46.6—Unverified
3VAB-Encodec (Ours)Mean AP38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAFAccuracy60.2—Unverified
2melspectAccuracy58.8—Unverified
3LEAFAccuracy50.2—Unverified
#ModelMetricClaimedVerifiedStatus
1AUCO ResNetAUC0.82—Unverified
2DenseNet 201AUC0.6—Unverified
3Inception ResNet V2AUC0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy78.2—Unverified
2CA2ST(B/16)Accuracy61—Unverified
3CAVA(B/16)Accuracy60.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ASM-RH-ATop-1 Accuracy75.4—Unverified
2ERANN-0-4Top-1 Accuracy74.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Qwen-AudioAccuracy 92.89—Unverified
2VocalSound BaselineAccuracy 90.5—Unverified
#ModelMetricClaimedVerifiedStatus
1XGBoost (330)Accuracy (10-fold)99.3—Unverified
#ModelMetricClaimedVerifiedStatus
1animal2vecAP0.91—Unverified
#ModelMetricClaimedVerifiedStatus
1AudioAccuracy (%)64.5—Unverified
#ModelMetricClaimedVerifiedStatus
1CDILFruitFlies97.09—Unverified