SOTAVerified

Speech Emotion Recognition

Speech Emotion Recognition is a task of speech processing and computational paralinguistics that aims to recognize and categorize the emotions expressed in spoken language. The goal is to determine the emotional state of a speaker, such as happiness, anger, sadness, or frustration, from their speech patterns, such as prosody, pitch, and rhythm.

For multimodal emotion recognition, please upload your result to Multimodal Emotion Recognition on IEMOCAP

Papers

Showing 401–431 of 431 papers

TitleStatusHype
Adversarial Machine Learning And Speech Emotion Recognition: Utilizing Generative Adversarial Networks For Robustness—0
Multimodal Speech Emotion Recognition Using Audio and TextCode0
Emotion Recognition in Speech using Cross-Modal Transfer in the Wild—0
Normalization Before Shaking Toward Learning Symmetrically Distributed Representation Without Margin in Speech Emotion Recognition—0
The Emotional Voices Database: Towards Controlling the Emotion Dimension in Voice Generation SystemsCode0
Evaluating Gammatone Frequency Cepstral Coefficients with Neural Networks for Emotion Recognition from SpeechCode0
On Enhancing Speech Emotion Recognition using Generative Adversarial Networks—0
Attention Based Fully Convolutional Network for Speech Emotion RecognitionCode0
Curriculum Learning for Speech Emotion Recognition from Crowdsourced Labels—0
Domain Adversarial for Acoustic Emotion Recognition—0
On the Robustness of Speech Emotion Recognition for Human-Robot Interaction with Deep Neural Networks—0
Speech Emotion Recognition Considering Local Dynamic Features—0
Cross-lingual and Multilingual Speech Emotion Recognition on English and French—0
CNN+LSTM Architecture for Speech Emotion Recognition with Data Augmentation—0
Transfer Learning for Improving Speech Emotion Classification AccuracyCode0
Variational Autoencoders for Learning Latent Representations of Speech Emotion: A Preliminary Study—0
Learning Spontaneity to Improve Emotion Recognition In Speech—0
Forewords—0
A Novel Trajectory-based Spatial-Temporal Spectral Features for Speech Emotion Recognition—0
Research on several key technologies in practical speech emotion recognition—0
Learning spectro-temporal features with 3D CNNs for speech emotion recognition—0
Towards Speech Emotion Recognition "in the wild" using Aggregated Corpora and Deep Multi-Task Learning—0
A breakthrough in Speech emotion recognition using Deep Retinal Convolution Neural Networks—0
Characterizing Types of Convolution in Deep Convolutional Recurrent Neural Networks for Robust Speech Emotion Recognition—0
Attentive Convolutional Neural Network based Speech Emotion Recognition: A Study on the Impact of Input Features, Signal Length, and Acted Speech—0
Study on Feature Subspace of Archetypal Emotions for Speech Emotion Recognition—0
標記對於類神經語音情緒辨識系統辨識效果之影響(Effects of Label in Neural Speech Emotion Recognition System)[In Chinese]—0
Support Super-Vector Machines in Automatic Speech Emotion Recognition—0
結合非線性動態特徵之語音情緒辨識(Speech Emotion Recognition via Nonlinear Dynamical Features)[In Chinese]—0
Improved Frame Level Features and SVM Supervectors Approach for the Recogniton of Emotional States from Speech: Application to categorical and dimensional states—0
EMOVO Corpus: an Italian Emotional Speech Database—0
Show:102550
← PrevPage 9 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Vertically long patch ViTAccuracy94.07—Unverified
2ConformerXL-PAccuracy88.2—Unverified
3CoordViTAccuracy82.96—Unverified
4SepTr + LeRaCAccuracy70.95—Unverified
5SepTrAccuracy70.47—Unverified
6ResNet-18 + SPELAccuracy68.12—Unverified
7ViTAccuracy67.81—Unverified
8ResNet-18 + PyNADAAccuracy65.15—Unverified
9GRUAccuracy55.01—Unverified
#ModelMetricClaimedVerifiedStatus
1SER with MTLUA CV0.78—Unverified
2emoDARTSUA CV0.77—Unverified
3LSTM+FCWA0.76—Unverified
4TAPWA CV0.74—Unverified
5SYSCOMB: BLSTMATT with CSA (session5)UA0.74—Unverified
6Partially Fine-tuned HuBERT LargeWA CV0.73—Unverified
7CNN - DARTSUA0.7—Unverified
8CNN+LSTMUA0.65—Unverified
#ModelMetricClaimedVerifiedStatus
1VQ-MAE-S-12 (Frame) + Query2EmoAccuracy84.1—Unverified
2CNN-X (Shallow CNN)Accuracy82.99—Unverified
3xlsr-Wav2Vec2.0(FineTuning)Accuracy81.82—Unverified
4CNN-14 (Fine-Tuning)Accuracy76.58—Unverified
5AlexNet (FineTuning)Accuracy61.67—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.76—Unverified
2wavlmCCC0.75—Unverified
3w2v2-L-robust-12CCC0.75—Unverified
4preCPCCCC0.71—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.68—Unverified
2wavlmCCC0.67—Unverified
3w2v2-L-robust-12CCC0.66—Unverified
4preCPCCCC0.64—Unverified
#ModelMetricClaimedVerifiedStatus
1wav2small-TeacherCCC0.68—Unverified
2wavlmCCC0.65—Unverified
3w2v2-L-robust-12CCC0.64—Unverified
4preCPCCCC0.38—Unverified
#ModelMetricClaimedVerifiedStatus
1DAWN-hidden-SVMUnweighted Accuracy (UA)32.1—Unverified
2Wav2Small-VAD-SVMUnweighted Accuracy (UA)23.3—Unverified
3Speechbrain Wav2Vec2Unweighted Accuracy (UA)20.7—Unverified
#ModelMetricClaimedVerifiedStatus
1emotion2vec+baseWeighted Accuracy (WA)79.4—Unverified
2emotion2vec+largeWeighted Accuracy (WA)69.5—Unverified
3emotion2vecWeighted Accuracy (WA)64.75—Unverified
#ModelMetricClaimedVerifiedStatus
1Dusha baselineMacro F10.77—Unverified
#ModelMetricClaimedVerifiedStatus
1Dusha baselineMacro F10.54—Unverified
#ModelMetricClaimedVerifiedStatus
1VGG-optiVMD1:1 Accuracy96.09—Unverified
#ModelMetricClaimedVerifiedStatus
1VQ-MAE-S-12 (Frame) + Query2EmoAccuracy90.2—Unverified
#ModelMetricClaimedVerifiedStatus
1PyResNetUnweighted Accuracy (UA)0.43—Unverified
#ModelMetricClaimedVerifiedStatus
1emoDARTSUA0.66—Unverified
#ModelMetricClaimedVerifiedStatus
1LSTMCCC (Arousal)0.76—Unverified
#ModelMetricClaimedVerifiedStatus
1CNN (1D)Unweighted Accuracy65.2—Unverified