SOTAVerified

Audio Classification

Audio Classification is a machine learning task that involves identifying and tagging audio signals into different classes or categories. The goal of audio classification is to enable machines to automatically recognize and distinguish between different types of audio, such as music, speech, and environmental sounds.

Papers

Showing 1–25 of 361 papers

TitleStatusHype
InternVideo2: Scaling Foundation Models for Multimodal Video UnderstandingCode7
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic AlignmentCode4
EAT: Self-Supervised Pre-Training with Efficient Audio TransformerCode3
CMKD: CNN/Transformer-Based Cross-Model Knowledge Distillation for Audio ClassificationCode3
ONE-PEACE: Exploring One General Representation Model Toward Unlimited ModalitiesCode3
Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language ModelsCode3
Leveraging tropical reef, bird and unrelated sounds for superior transfer learning in marine bioacousticsCode3
SSAST: Self-Supervised Audio Spectrogram TransformerCode2
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space ModelCode2
Benchmarking Representations for Speech, Music, and Acoustic EventsCode2
Audio Mamba: Bidirectional State Space Model for Audio Representation LearningCode2
BirdSet: A Large-Scale Dataset for Audio Classification in Avian BioacousticsCode2
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music AudioCode2
Oceanship: A Large-Scale Dataset for Underwater Audio Target RecognitionCode2
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal ModelsCode2
Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge DistillationCode2
Global birdsong embeddings enable superior transfer learning for bioacoustic classificationCode2
AST: Audio Spectrogram TransformerCode2
Contrastive Audio-Visual Masked AutoencoderCode2
Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio ModelsCode2
HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and DetectionCode2
CLARA: Multilingual Contrastive Learning for Audio Representation AcquisitionCode1
Audio classification with Dilated Convolution with Learnable SpacingsCode1
Classification of Long Sequential Data using Circular Dilated Convolutional Neural NetworksCode1
Adaptive Differential Denoising for Respiratory Sounds ClassificationCode1
Show:102550
← PrevPage 1 of 15Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OmniVec2Test mAP0.56—Unverified
2OmniVecTest mAP0.55—Unverified
3EquiAVTest mAP0.55—Unverified
4MAViL (Audio-Visual, single)Test mAP0.53—Unverified
5Audiovisual Masked Autoencoder (Audiovisual, Single)Test mAP0.52—Unverified
6CAV-MAE (Audio-Visual)Test mAP0.51—Unverified
7BEATs (Audio-only, Ensemble)Test mAP0.51—Unverified
8UAVM (Audio + Video)Test mAP0.5—Unverified
9SSLAM (Audio-Only, Single)Test mAP0.5—Unverified
10mn40_as (Ensemble)Test mAP0.5—Unverified
#ModelMetricClaimedVerifiedStatus
1OmniVec2Top-1 Accuracy99.1—Unverified
2InternVideo2Top-1 Accuracy98.6—Unverified
3M2D2 AS+Top-1 Accuracy98.5—Unverified
4OmniVecTop-1 Accuracy98.4—Unverified
5BEATsTop-1 Accuracy98.1—Unverified
6mn40_asTop-1 Accuracy97.45—Unverified
7M2D-CLAP/0.7Top-1 Accuracy97.4—Unverified
8DyMN-LTop-1 Accuracy97.4—Unverified
9M2D-AS/0.7Top-1 Accuracy97.2—Unverified
10HTS-ATTop-1 Accuracy97—Unverified
#ModelMetricClaimedVerifiedStatus
1ADDICBHI Score65.53—Unverified
2BEATs (PAFA)ICBHI Score64.84—Unverified
3BTSICBHI Score63.54—Unverified
4BEATs (CE)ICBHI Score63.49—Unverified
5M2D-X/0.7 (η=0.3)ICBHI Score63.29—Unverified
6CycleGuardianICBHI Score63.26—Unverified
7M2D/0.7 (e=0.3)ICBHI Score62.73—Unverified
8Audio-CLAPICBHI Score62.56—Unverified
9AST (Patch-Mix CL)ICBHI Score62.37—Unverified
10AFT on Mixed-500ICBHI Score61.79—Unverified
#ModelMetricClaimedVerifiedStatus
1MBT (AV)Top 5 Accuracy85.6—Unverified
2Mirasol3BTop 1 Accuracy69.8—Unverified
3CA2ST(B/16)Top 1 Accuracy68.3—Unverified
4ONE-PEACE (Audio-Visual)Top 1 Accuracy68.2—Unverified
5CAVA(B/16)Top 1 Accuracy68.2—Unverified
6EquiAVTop 1 Accuracy67.1—Unverified
7MAViLTop 1 Accuracy67.1—Unverified
8MMT (Audio-Visual)Top 1 Accuracy66.2—Unverified
9CAV-MAE (Audio-Visual)Top 1 Accuracy65.9—Unverified
10UAVM (Audio + Video)Top 1 Accuracy65.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMPercentage correct95.9—Unverified
2SNN with Dilated Convolution with Learnable SpacingsPercentage correct95.1—Unverified
3SNN featuring learnable axonal delays with adaptively delay capsPercentage correct92.45—Unverified
4CNNPercentage correct92.4—Unverified
5SNN with spatio-temporal filters and attentionPercentage correct92.4—Unverified
6SNN with temporal-wise attentionPercentage correct91.1—Unverified
7SNNPercentage correct87—Unverified
8Recurrent convolutional SNNPercentage correct83.5—Unverified
9Recurrent SNNPercentage correct83.2—Unverified
10Sparse Spiking Gradient DescentPercentage correct77.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ONE-PEACEmAP69.7—Unverified
2MNmAP65.6—Unverified
3PaSST-SmAP65.55—Unverified
4DyMN-LmAP65.5—Unverified
5PaSST-N-SmAP64.2—Unverified
6LHGNNMean AP59—Unverified
7PSLAmAP56.71—Unverified
8MATPAC (SSL Model)mAP55.2—Unverified
9Temporal Knowledge Distillation for On-device Audio ClassificationmAP54.8—Unverified
10Large 6-Layer Transformer with PoolingmAP53.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EquiAVMean AP42.4—Unverified
2SSLAMMean AP40.9—Unverified
3EATMean AP40.3—Unverified
4BEATsMean AP38.9—Unverified
5Base (ours)Mean AP37.4—Unverified
6SSAST-PATCHMean AP31—Unverified
7SSAST-FRAMEMean AP29.2—Unverified
8ConformerMean AP27.6—Unverified
#ModelMetricClaimedVerifiedStatus
1PDCAccuracy97.8—Unverified
2ASM-RHAccuracy96.51—Unverified
3EfficientLEAFAccuracy95.2—Unverified
4melspectAccuracy95.1—Unverified
5LEAFAccuracy95.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMAccuracy88.4—Unverified
2SNN with Dilated Convolution with Learnable SpacingsAccuracy80.69—Unverified
3RadLIFAccuracy77.4—Unverified
4SpikGRUAccuracy77—Unverified
5Adaptive SRNNAccuracy74.2—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAF (8s)Accuracy72.2—Unverified
2EfficientLEAFAccuracy42.9—Unverified
3LEAFAccuracy42.3—Unverified
4melspectAccuracy39.9—Unverified
#ModelMetricClaimedVerifiedStatus
1CrissCross (AudioSet)Top-1 Accuracy97—Unverified
2CrissCross (Kinetics-400)Top-1 Accuracy96—Unverified
3XDCTop-1 Accuracy95—Unverified
4CrissCross (Kinetics-Sound)Top-1 Accuracy93—Unverified
#ModelMetricClaimedVerifiedStatus
1Audiovisual Masked Autoencoder (Audiovisual, Single)Top-1 Action46—Unverified
2Audiovisual Masked Autoencoder (Video-only, Single)Top-1 Action45.8—Unverified
3Audiovisual Masked Autoencoder (Audio-only, Single)Top-1 Action19.7—Unverified
4PlayItBackX3Top-1 Action15.9—Unverified
#ModelMetricClaimedVerifiedStatus
1M2D-AS/0.7Mean AP48.5—Unverified
2LHGNNMean AP46.6—Unverified
3VAB-Encodec (Ours)Mean AP38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAFAccuracy60.2—Unverified
2melspectAccuracy58.8—Unverified
3LEAFAccuracy50.2—Unverified
#ModelMetricClaimedVerifiedStatus
1AUCO ResNetAUC0.82—Unverified
2DenseNet 201AUC0.6—Unverified
3Inception ResNet V2AUC0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy78.2—Unverified
2CA2ST(B/16)Accuracy61—Unverified
3CAVA(B/16)Accuracy60.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ASM-RH-ATop-1 Accuracy75.4—Unverified
2ERANN-0-4Top-1 Accuracy74.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Qwen-AudioAccuracy 92.89—Unverified
2VocalSound BaselineAccuracy 90.5—Unverified
#ModelMetricClaimedVerifiedStatus
1XGBoost (330)Accuracy (10-fold)99.3—Unverified
#ModelMetricClaimedVerifiedStatus
1animal2vecAP0.91—Unverified
#ModelMetricClaimedVerifiedStatus
1AudioAccuracy (%)64.5—Unverified
#ModelMetricClaimedVerifiedStatus
1CDILFruitFlies97.09—Unverified