SOTAVerified

Explanation Generation

Papers

Showing 1–25 of 235 papers

TitleStatusHype
Hierarchical Interaction Summarization and Contrastive Prompting for Explainable Recommendations—0
The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems—0
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-CheckingCode0
LiTEx: A Linguistic Taxonomy of Explanations for Understanding Within-Label Variation in Natural Language InferenceCode0
Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning DistillationCode0
Multimodal RAG-driven Anomaly Detection and Classification in Laser Powder Bed Fusion using Large Language Models—0
SNAPE-PM: Building and Utilizing Dynamic Partner Models for Adaptive Explanation GenerationCode0
Towards Budget-Friendly Model-Agnostic Explanation Generation for Large Language Models—0
Generating Skyline Explanations for Graph Neural Networks—0
Harnessing LLMs Explanations to Boost Surrogate Models in Tabular Data Classification—0
ChartQA-X: Generating Explanations for Charts—0
TathyaNyaya and FactLegalLlama: Advancing Factual Judgment Prediction and Explanation in the Indian Legal Context—0
Rubrik's Cube: Testing a New Rubric for Evaluating Explanations on the CUBE dataset—0
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face DetectorCode2
Explainable Synthetic Image Detection through Diffusion Timestep Ensembling—0
EXCLAIM: An Explainable Cross-Modal Agentic System for Misinformation Detection with Hierarchical Retrieval—0
MemeIntel: Explainable Detection of Propagandistic and Hateful Memes—0
Reasoning About Persuasion: Can LLMs Enable Explainable Propaganda Detection?—0
Coherency Improved Explainable Recommendation via Large Language Model—0
Accelerating Anchors via Specialization and Feature Transformation—0
Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation GenerationCode0
Self-Rationalization in the Wild: A Large Scale Out-of-Distribution Evaluation on NLI-related tasksCode0
Boosting Knowledge Graph-based Recommendations through Confidence-Aware Augmentation with Large Language Models—0
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation—0
Quantifying Relational Exploration in Cultural Heritage Knowledge Graphs with LLMs: A Neuro-Symbolic Approach—0
Show:102550
← PrevPage 1 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VLIS (Lynx)Accuracy80—Unverified
2VLIS (LLaVA)Accuracy73—Unverified
3Ground-truth Caption -> GPT3 (Oracle)Human (%)68—Unverified
4Predicted Caption -> GPT3Human (%)33—Unverified
5BLIP2 FlanT5-XXL (Fine-tuned)Human (%)27—Unverified
6BLIP2 FlanT5-XL (Fine-tuned)Human (%)15—Unverified
7BLIP2 FlanT5-XXL (Zero-shot)Human (%)0—Unverified
#ModelMetricClaimedVerifiedStatus
1PJ-XB487.4—Unverified
2FMB478.8—Unverified
#ModelMetricClaimedVerifiedStatus
1OFA-XHuman Explanation Rating85.7—Unverified
2OFA-X-MTHuman Explanation Rating80.4—Unverified
#ModelMetricClaimedVerifiedStatus
1OFA-X-MTHuman Explanation Rating77.3—Unverified
2OFA-XHuman Explanation Rating68.9—Unverified
#ModelMetricClaimedVerifiedStatus
1OFA-XHuman Explanation Rating89.5—Unverified
2OFA-X-MTHuman Explanation Rating87.8—Unverified