SOTAVerified

Speech Emotion Recognition

Speech Emotion Recognition is a task of speech processing and computational paralinguistics that aims to recognize and categorize the emotions expressed in spoken language. The goal is to determine the emotional state of a speaker, such as happiness, anger, sadness, or frustration, from their speech patterns, such as prosody, pitch, and rhythm.

For multimodal emotion recognition, please upload your result to Multimodal Emotion Recognition on IEMOCAP

Papers

Showing 151–200 of 431 papers

TitleStatusHype
Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion RecognitionCode0
Iterative Feature Boosting for Explainable Speech Emotion RecognitionCode0
1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem—0
Crossmodal ASR Error Correction with Discrete Speech UnitsCode0
Adapting WavLM for Speech Emotion Recognition—0
Fine-grained Speech Sentiment Analysis in Chinese Psychological Support Hotlines Based on Large-scale Pre-trained ModelCode0
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition—0
Toward end-to-end interpretable convolutional neural networks for waveform signals—0
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model—0
Active Learning with Task Adaptation Pre-training for Speech Emotion RecognitionCode0
A Systematic Evaluation of Adversarial Attacks against Speech Emotion Recognition ModelsCode0
Usefulness of Emotional Prosody in Neural Machine Translation—0
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention—0
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition—0
nEMO: Dataset of Emotional Speech in PolishCode0
Automated Assessment of Encouragement and Warmth in Classrooms Leveraging Multimodal Emotional Features and ChatGPT—0
Unlocking the Emotional States of High-Risk Suicide Callers through Speech AnalysisCode0
The NeurIPS 2023 Machine Learning for Audio Workshop: Affective Audio Benchmarks and Novel Data—0
EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life SpeechCode0
SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech—0
Mixer is more than just a model—0
Filter-based multi-task cross-corpus feature learning for speech emotion recognitionCode0
Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation—0
Persian Speech Emotion Recognition by Fine-Tuning Transformers—0
CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion RecognitionCode0
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition—0
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?—0
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition—0
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction—0
Speech Swin-Transformer: Exploring a Hierarchical Transformer with Shifted Windows for Speech Emotion Recognition—0
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition—0
Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation—0
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis—0
TemporalAugmenter: An Ensemble Recurrent Based Deep Learning Approach for Signal Classification—0
A Multi-Task, Multi-Modal Approach for Predicting Categorical and Dimensional Emotions—0
DSNet: Disentangled Siamese Network with Neutral Calibration for Speech Emotion Recognition—0
Leveraged Mel spectrograms using Harmonic and Percussive Components in Speech Emotion RecognitionCode0
An Extended Variational Mode Decomposition Algorithm Developed Speech Emotion Recognition PerformanceCode0
Investigating salient representations and label Variance in Dimensional Speech Emotion Analysis—0
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models—0
Speech and Text-Based Emotion Recognizer—0
Churn Prediction via Multimodal Fusion Learning:Integrating Customer Financial Literacy, Voice, and Behavioral Data—0
SER_AMPEL: a multi-source dataset for speech emotion recognition of Italian older adults—0
End-to-end transfer learning for speaker-independent cross-language and cross-corpus speech emotion recognition—0
Utilizing Speech Emotion Recognition and Recommender Systems for Negative Emotion Handling in Therapy Chatbots—0
On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition—0
An analysis of large speech models-based representations for speech emotion recognition—0
Pre-trained Speech Processing Models Contain Human-Like Biases that Propagate to Speech Emotion RecognitionCode0
EmoDiarize: Speaker Diarization and Emotion Identification from Speech Signals using Convolutional Neural Networks—0
Integrating Contrastive Learning into a Multitask Transformer Model for Effective Domain Adaptation—0
Show:102550
← PrevPage 4 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Vertically long patch ViTAccuracy94.07—Unverified
2ConformerXL-PAccuracy88.2—Unverified
3CoordViTAccuracy82.96—Unverified
4SepTr + LeRaCAccuracy70.95—Unverified
5SepTrAccuracy70.47—Unverified
6ResNet-18 + SPELAccuracy68.12—Unverified
7ViTAccuracy67.81—Unverified
8ResNet-18 + PyNADAAccuracy65.15—Unverified
9GRUAccuracy55.01—Unverified
#ModelMetricClaimedVerifiedStatus
1SER with MTLUA CV0.78—Unverified
2emoDARTSUA CV0.77—Unverified
3LSTM+FCWA0.76—Unverified
4TAPWA CV0.74—Unverified
5SYSCOMB: BLSTMATT with CSA (session5)UA0.74—Unverified
6Partially Fine-tuned HuBERT LargeWA CV0.73—Unverified
7CNN - DARTSUA0.7—Unverified
8CNN+LSTMUA0.65—Unverified
#ModelMetricClaimedVerifiedStatus
1VQ-MAE-S-12 (Frame) + Query2EmoAccuracy84.1—Unverified
2CNN-X (Shallow CNN)Accuracy82.99—Unverified
3xlsr-Wav2Vec2.0(FineTuning)Accuracy81.82—Unverified
4CNN-14 (Fine-Tuning)Accuracy76.58—Unverified
5AlexNet (FineTuning)Accuracy61.67—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.76—Unverified
2wavlmCCC0.75—Unverified
3w2v2-L-robust-12CCC0.75—Unverified
4preCPCCCC0.71—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.68—Unverified
2wavlmCCC0.67—Unverified
3w2v2-L-robust-12CCC0.66—Unverified
4preCPCCCC0.64—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.68—Unverified
2wavlmCCC0.65—Unverified
3w2v2-L-robust-12CCC0.64—Unverified
4preCPCCCC0.38—Unverified
#ModelMetricClaimedVerifiedStatus
1DAWN-hidden-SVMUnweighted Accuracy (UA)32.1—Unverified
2Wav2Small-VAD-SVMUnweighted Accuracy (UA)23.3—Unverified
3Speechbrain Wav2Vec2Unweighted Accuracy (UA)20.7—Unverified
#ModelMetricClaimedVerifiedStatus
1emotion2vec+baseWeighted Accuracy (WA)79.4—Unverified
2emotion2vec+largeWeighted Accuracy (WA)69.5—Unverified
3emotion2vecWeighted Accuracy (WA)64.75—Unverified
#ModelMetricClaimedVerifiedStatus
1Dusha baselineMacro F10.77—Unverified
#ModelMetricClaimedVerifiedStatus
1Dusha baselineMacro F10.54—Unverified
#ModelMetricClaimedVerifiedStatus
1VGG-optiVMD1:1 Accuracy96.09—Unverified
#ModelMetricClaimedVerifiedStatus
1VQ-MAE-S-12 (Frame) + Query2EmoAccuracy90.2—Unverified
#ModelMetricClaimedVerifiedStatus
1PyResNetUnweighted Accuracy (UA)0.43—Unverified
#ModelMetricClaimedVerifiedStatus
1emoDARTSUA0.66—Unverified
#ModelMetricClaimedVerifiedStatus
1LSTMCCC (Arousal)0.76—Unverified
#ModelMetricClaimedVerifiedStatus
1CNN (1D)Unweighted Accuracy65.2—Unverified