SOTAVerified

Hate Speech Detection

Hate speech detection is the task of detecting if communication such as text, audio, and so on contains hatred and or encourages violence towards a person or a group of people. This is usually based on prejudice against 'protected characteristics' such as their ethnicity, gender, sexual orientation, religion, age et al. Some example benchmarks are ETHOS and HateXplain. Models can be evaluated with metrics like the F-score or F-measure.

Papers

Showing 251–275 of 507 papers

TitleStatusHype
Assessing the impact of contextual information in hate speech detection—0
Analyzing the Real Vulnerability of Hate Speech Detection Systems against Targeted Intentional Noise—0
SOS: Systematic Offensive Stereotyping Bias in Word Embeddings—0
俄语网络仇恨言论语料库研究与构建(An Russian Internet Corpus for Hate Speech Detection)—0
The Role of Context in Detecting the Target of Hate Speech—0
An Attention Matrix for Every Decision: Faithfulness-based Arbitration Among Multiple Attention-Based Interpretations of Transformers in Text Classification—0
Domain Classification-based Source-specific Term Penalization for Domain Adaptation in Hate-speech Detection—0
BERT-based Ensemble Approaches for Hate Speech Detection—0
A Review of Challenges in Machine Learning based Automated Hate Speech Detection—0
Power of Explanations: Towards automatic debiasing in hate speech detectionCode0
Combating high variance in Data-Scarce Implicit Hate Speech Classification—0
Generalizing Hate Speech Detection Using Multi-Task Learning: A Case Study of Political Public Figures—0
Exploring Hate Speech Detection with HateXplain and BERTCode0
ferret: a Framework for Benchmarking Explainers on TransformersCode0
Features or Spurious Artifacts? Data-centric Baselines for Fair and Robust Hate Speech DetectionCode0
Free speech or Free Hate Speech? Analyzing the Proliferation of Hate Speech in Parler—0
Resources for Multilingual Hate Speech Detection—0
An Interactive Exploratory Tool for the Task of Hate Speech Detection—0
HATE-ITA: New Baselines for Hate Speech Detection in ItalianCode0
Improving Generalization of Hate Speech Detection Systems to Novel Target Groups via Domain Adaptation—0
Accounting for Offensive Speech as a Practice of Resistance—0
Targeted Identity Group Prediction in Hate Speech CorporaCode0
Explainable and High-Performance Hate and Offensive Speech Detection—0
Improved two-stage hate speech classification for twitter based on Deep Neural Networks—0
Tâches Auxiliaires Multilingues pour le Transfert de Modèles de Détection de Discours Haineux (Multilingual Auxiliary Tasks for Zero-Shot Cross-Lingual Transfer of Hate Speech Detection)—0
Show:102550
← PrevPage 11 of 21Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1BiLSTM + static BEF1-score0.8—Unverified
2BERTF1-score0.79—Unverified
3BiLSTM+Attention+FTF1-score0.77—Unverified
4OPT-175B (few-shot)F1-score0.76—Unverified
5CNN+Attention+FT+GVF1-score0.74—Unverified
6OPT-175B (one-shot)F1-score0.71—Unverified
7OPT-175B (zero-shot)F1-score0.67—Unverified
8SVMF1-score0.66—Unverified
9Random ForestsF1-score0.64—Unverified
10Davinci (zero-shot)F1-score0.63—Unverified
#ModelMetricClaimedVerifiedStatus
1BERT-MRPAUROC0.86—Unverified
2BERT-RPAUROC0.85—Unverified
3BERT-HateXplain [LIME]AUROC0.85—Unverified
4BERT-HateXplain [Attn]AUROC0.85—Unverified
5BERT [Attn]AUROC0.84—Unverified
6BiRNN-HateXplain [Attn]AUROC0.81—Unverified
7BiRNN-Attn [Attn]AUROC0.8—Unverified
8CNN-GRU [LIME]AUROC0.79—Unverified
9BiRNN [LIME]AUROC0.77—Unverified
10XG-HSI-BERTAccuracy0.75—Unverified
#ModelMetricClaimedVerifiedStatus
1MLARAMHamming Loss0.29—Unverified
2MLkNNHamming Loss0.16—Unverified
3Binary RelevanceHamming Loss0.14—Unverified
4Neural Classifier ChainsHamming Loss0.13—Unverified
5Neural Binary RelevanceHamming Loss0.11—Unverified
#ModelMetricClaimedVerifiedStatus
1Mozafari et al., 2019AAA50.94—Unverified
2SVMAAA46.51—Unverified
3Kennedy et al., 2020AAA45.5—Unverified
#ModelMetricClaimedVerifiedStatus
1HateBERTMacro F10.74—Unverified
2BERTMacro F10.72—Unverified
#ModelMetricClaimedVerifiedStatus
1mBertAccuracy0.83—Unverified
2Logistic RegressionAccuracy0.7—Unverified
#ModelMetricClaimedVerifiedStatus
1HXP + CLAP + CLIPTEST F1 (macro)0.85—Unverified
2BERT + ViT + MFCCTEST F1 (macro)0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1HateBERTMacro F10.49—Unverified
2BERTMacro F10.48—Unverified
#ModelMetricClaimedVerifiedStatus
1HateBERTMacro F10.81—Unverified
2BERTMacro F10.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Multilingual BERTF1-score0.75—Unverified
2AutoMLF1-score0.74—Unverified
#ModelMetricClaimedVerifiedStatus
1AOM mBERTF10.85—Unverified
#ModelMetricClaimedVerifiedStatus
1BaselineF10.7—Unverified
#ModelMetricClaimedVerifiedStatus
1RoBERTa-large-STMacro F180.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Baseline BERT (task A)F10.77—Unverified