SOTAVerified

Audio Classification

Audio Classification is a machine learning task that involves identifying and tagging audio signals into different classes or categories. The goal of audio classification is to enable machines to automatically recognize and distinguish between different types of audio, such as music, speech, and environmental sounds.

Papers

Showing 301–350 of 361 papers

TitleStatusHype
Masked Modeling Duo: Learning Representations by Encouraging Both Networks to Model the Input—0
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework—0
Microphone Array Based Surveillance Audio Classification—0
Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities—0
Mixer is more than just a model—0
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation—0
Multi-Format Contrastive Learning of Audio Representations—0
Multi-label Zero-Shot Audio Classification with Temporal Attention—0
Multi-modal Self-Supervision from Generalized Data Transformations—0
Multiscale Audio Spectrogram Transformer for Efficient Audio Classification—0
Multiscale Multimodal Transformer for Multimodal Action Recognition—0
MUPAX: Multidimensional Problem Agnostic eXplainable AI—0
Neural Architecture Search for Energy Efficient Always-on Audio Models—0
Neuromorphic Wireless Split Computing with Resonate-and-Fire Neurons—0
OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning—0
OmniVec: Learning robust representations with cross modal sharing—0
On fine-tuning of Autoencoders for Fuzzy rule classifiers—0
On Negative Sampling for Audio-Visual Contrastive Learning from Movies—0
On the choice of the optimal temporal support for audio classification with Pre-trained embeddings—0
On the performance of residual block design alternatives in convolutional neural networks for end-to-end audio classification—0
Over-Parameterization and Generalization in Audio Classification—0
Pex: Memory-efficient Microcontroller Deep Learning through Partial Execution—0
PolyViT: Co-training Vision Transformers on Images, Videos and Audio—0
Private Speech Classification with Secure Multiparty Computation—0
Progressive Rock Music Classification—0
Pruning random resistive memory for optimizing analogue AI—0
Raw Audio Classification with Cosine Convolutional Neural Network (CosCovNN)—0
Raw Waveform-based Audio Classification Using Sample-level CNN Architectures—0
Real-time Detection of AI-Generated Speech for DeepFake Voice Conversion—0
Representations of Sound in Deep Learning of Audio Features from Music—0
"Seeing Sound": Audio Classification with the Wigner-Wille Distribution and Convolutional Neural Networks—0
Segment Relevance Estimation for Audio Analysis and Weakly-Labelled Classification—0
Self-paced ensemble learning for speech and audio classification—0
SemanticAC: Semantics-Assisted Framework for Audio Classification—0
Semi Supervised Learning For Few-shot Audio Classification By Episodic Triplet Mining—0
Simultaneously Learning Architectures and Features of Deep Neural Networks—0
Single-Layer Vision Transformers for More Accurate Early Exits with Less Overhead—0
Sparse Filtering—0
Spectral and Rhythm Features for Audio Classification with Deep Convolutional Neural Networks—0
SpectroBank: A filter-bank convolutional layer for CNN-based audio applications—0
SpliceOut: A Simple and Efficient Audio Augmentation Method—0
STREAM: A Universal State-Space Model for Sparse Geometric Data—0
Symbolic Audio Classification via Modal Decision Tree Learning—0
Tackling Interpretability in Audio Classification Networks with Non-negative Matrix Factorization—0
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine—0
Temporal Knowledge Distillation for On-device Audio Classification—0
Temporal-wise Attention Spiking Neural Networks for Event Streams Classification—0
The Heidelberg spiking datasets for the systematic evaluation of spiking neural networks—0
Towards Robust Few-shot Class Incremental Learning in Audio Classification using Contrastive Representation—0
Transformer-based Sequence Labeling for Audio Classification based on MFCCs—0
Show:102550
← PrevPage 7 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OmniVec2Test mAP0.56—Unverified
2OmniVecTest mAP0.55—Unverified
3EquiAVTest mAP0.55—Unverified
4MAViL (Audio-Visual, single)Test mAP0.53—Unverified
5Audiovisual Masked Autoencoder (Audiovisual, Single)Test mAP0.52—Unverified
6CAV-MAE (Audio-Visual)Test mAP0.51—Unverified
7BEATs (Audio-only, Ensemble)Test mAP0.51—Unverified
8UAVM (Audio + Video)Test mAP0.5—Unverified
9SSLAM (Audio-Only, Single)Test mAP0.5—Unverified
10mn40_as (Ensemble)Test mAP0.5—Unverified
#ModelMetricClaimedVerifiedStatus
1OmniVec2Top-1 Accuracy99.1—Unverified
2InternVideo2Top-1 Accuracy98.6—Unverified
3M2D2 AS+Top-1 Accuracy98.5—Unverified
4OmniVecTop-1 Accuracy98.4—Unverified
5BEATsTop-1 Accuracy98.1—Unverified
6mn40_asTop-1 Accuracy97.45—Unverified
7M2D-CLAP/0.7Top-1 Accuracy97.4—Unverified
8DyMN-LTop-1 Accuracy97.4—Unverified
9M2D-AS/0.7Top-1 Accuracy97.2—Unverified
10HTS-ATTop-1 Accuracy97—Unverified
#ModelMetricClaimedVerifiedStatus
1ADDICBHI Score65.53—Unverified
2BEATs (PAFA)ICBHI Score64.84—Unverified
3BTSICBHI Score63.54—Unverified
4BEATs (CE)ICBHI Score63.49—Unverified
5M2D-X/0.7 (η=0.3)ICBHI Score63.29—Unverified
6CycleGuardianICBHI Score63.26—Unverified
7M2D/0.7 (e=0.3)ICBHI Score62.73—Unverified
8Audio-CLAPICBHI Score62.56—Unverified
9AST (Patch-Mix CL)ICBHI Score62.37—Unverified
10AFT on Mixed-500ICBHI Score61.79—Unverified
#ModelMetricClaimedVerifiedStatus
1MBT (AV)Top 5 Accuracy85.6—Unverified
2Mirasol3BTop 1 Accuracy69.8—Unverified
3CA2ST(B/16)Top 1 Accuracy68.3—Unverified
4ONE-PEACE (Audio-Visual)Top 1 Accuracy68.2—Unverified
5CAVA(B/16)Top 1 Accuracy68.2—Unverified
6EquiAVTop 1 Accuracy67.1—Unverified
7MAViLTop 1 Accuracy67.1—Unverified
8MMT (Audio-Visual)Top 1 Accuracy66.2—Unverified
9CAV-MAE (Audio-Visual)Top 1 Accuracy65.9—Unverified
10UAVM (Audio + Video)Top 1 Accuracy65.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMPercentage correct95.9—Unverified
2SNN with Dilated Convolution with Learnable SpacingsPercentage correct95.1—Unverified
3SNN featuring learnable axonal delays with adaptively delay capsPercentage correct92.45—Unverified
4CNNPercentage correct92.4—Unverified
5SNN with spatio-temporal filters and attentionPercentage correct92.4—Unverified
6SNN with temporal-wise attentionPercentage correct91.1—Unverified
7SNNPercentage correct87—Unverified
8Recurrent convolutional SNNPercentage correct83.5—Unverified
9Recurrent SNNPercentage correct83.2—Unverified
10Sparse Spiking Gradient DescentPercentage correct77.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ONE-PEACEmAP69.7—Unverified
2MNmAP65.6—Unverified
3PaSST-SmAP65.55—Unverified
4DyMN-LmAP65.5—Unverified
5PaSST-N-SmAP64.2—Unverified
6LHGNNMean AP59—Unverified
7PSLAmAP56.71—Unverified
8MATPAC (SSL Model)mAP55.2—Unverified
9Temporal Knowledge Distillation for On-device Audio ClassificationmAP54.8—Unverified
10Large 6-Layer Transformer with PoolingmAP53.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EquiAVMean AP42.4—Unverified
2SSLAMMean AP40.9—Unverified
3EATMean AP40.3—Unverified
4BEATsMean AP38.9—Unverified
5Base (ours)Mean AP37.4—Unverified
6SSAST-PATCHMean AP31—Unverified
7SSAST-FRAMEMean AP29.2—Unverified
8ConformerMean AP27.6—Unverified
#ModelMetricClaimedVerifiedStatus
1PDCAccuracy97.8—Unverified
2ASM-RHAccuracy96.51—Unverified
3EfficientLEAFAccuracy95.2—Unverified
4melspectAccuracy95.1—Unverified
5LEAFAccuracy95.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Event-SSMAccuracy88.4—Unverified
2SNN with Dilated Convolution with Learnable SpacingsAccuracy80.69—Unverified
3RadLIFAccuracy77.4—Unverified
4SpikGRUAccuracy77—Unverified
5Adaptive SRNNAccuracy74.2—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAF (8s)Accuracy72.2—Unverified
2EfficientLEAFAccuracy42.9—Unverified
3LEAFAccuracy42.3—Unverified
4melspectAccuracy39.9—Unverified
#ModelMetricClaimedVerifiedStatus
1CrissCross (AudioSet)Top-1 Accuracy97—Unverified
2CrissCross (Kinetics-400)Top-1 Accuracy96—Unverified
3XDCTop-1 Accuracy95—Unverified
4CrissCross (Kinetics-Sound)Top-1 Accuracy93—Unverified
#ModelMetricClaimedVerifiedStatus
1Audiovisual Masked Autoencoder (Audiovisual, Single)Top-1 Action46—Unverified
2Audiovisual Masked Autoencoder (Video-only, Single)Top-1 Action45.8—Unverified
3Audiovisual Masked Autoencoder (Audio-only, Single)Top-1 Action19.7—Unverified
4PlayItBackX3Top-1 Action15.9—Unverified
#ModelMetricClaimedVerifiedStatus
1M2D-AS/0.7Mean AP48.5—Unverified
2LHGNNMean AP46.6—Unverified
3VAB-Encodec (Ours)Mean AP38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EfficientLEAFAccuracy60.2—Unverified
2melspectAccuracy58.8—Unverified
3LEAFAccuracy50.2—Unverified
#ModelMetricClaimedVerifiedStatus
1AUCO ResNetAUC0.82—Unverified
2DenseNet 201AUC0.6—Unverified
3Inception ResNet V2AUC0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy78.2—Unverified
2CA2ST(B/16)Accuracy61—Unverified
3CAVA(B/16)Accuracy60.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ASM-RH-ATop-1 Accuracy75.4—Unverified
2ERANN-0-4Top-1 Accuracy74.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Qwen-AudioAccuracy 92.89—Unverified
2VocalSound BaselineAccuracy 90.5—Unverified
#ModelMetricClaimedVerifiedStatus
1XGBoost (330)Accuracy (10-fold)99.3—Unverified
#ModelMetricClaimedVerifiedStatus
1animal2vecAP0.91—Unverified
#ModelMetricClaimedVerifiedStatus
1AudioAccuracy (%)64.5—Unverified
#ModelMetricClaimedVerifiedStatus
1CDILFruitFlies97.09—Unverified