Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 901–939 of 939 papers

Title	Date	Tasks	Status
IPPON: Common Sense Guided Informative Path Planning for Object Goal Navigation	Oct 25, 2024	Common Sense ReasoningLanguage Modeling	—Unverified
Irony Detection for Dutch: a Venture into the Implicit	May 1, 2022	Common Sense Reasoning	—Unverified
Is a 204 cm Man Tall or Small ? Acquisition of Numerical Common Sense from the Web	Aug 1, 2013	Common Sense ReasoningNatural Language Inference	—Unverified
Is “My Favorite New Movie” My Favorite Movie? Probing the Understanding of Recursive Noun Phrases	Jul 1, 2022	Common Sense ReasoningNatural Language Inference	—Unverified
Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models	Nov 17, 2022	Common Sense Reasoning	—Unverified
ITCMA: A Generative Agent Based on a Computational Consciousness Structure	Mar 29, 2024	Action GenerationCommon Sense Reasoning	—Unverified
It’s Commonsense, isn’t it? Demystifying Human Evaluations in Commonsense-Enhanced NLG Systems	Apr 1, 2021	Common Sense ReasoningText Generation	—Unverified
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents	Aug 28, 2022	Action GenerationCommon Sense Reasoning	—Unverified
JEPA4Rec: Learning Effective Language Representations for Sequential Recommendation via Joint Embedding Predictive Architecture	Apr 10, 2025	Common Sense ReasoningDescriptive	—Unverified
JFCKB: Japanese Feature Change Knowledge Base	May 1, 2018	Common Sense Reasoning	—Unverified
KARGEN: Knowledge-enhanced Automated Radiology Report Generation Using Large Language Models	Sep 9, 2024	Common Sense ReasoningLogical Reasoning	—Unverified
KARNA at COIN Shared Task 1: Bidirectional Encoder Representations from Transformers with relational knowledge for machine comprehension with common sense	Nov 1, 2019	Common Sense ReasoningReading Comprehension	—Unverified
Kernel Choice Matters for Boundary Inference Using Local Polynomial Density: With Application to Manipulation Testing	Jun 13, 2023	Common Sense Reasoning	—Unverified
Knowledge Acquisition Strategies for Goal-Oriented Dialog Systems	Jun 1, 2014	Common Sense ReasoningGoal-Oriented Dialog	—Unverified
Knowledge-Aware Conversation Derailment Forecasting Using Graph Convolutional Networks	Aug 24, 2024	Common Sense ReasoningGraph Neural Network	—Unverified
Knowledge Aware Semantic Concept Expansion for Image-Text Matching	Aug 10, 2019	Common Sense ReasoningContent-Based Image Retrieval	—Unverified
Knowledge Bases in Support of Large Language Models for Processing Web News	Nov 13, 2024	Common Sense Reasoning	—Unverified
0/1 Deep Neural Networks via Block Coordinate Descent	Jun 19, 2022	10-shot image generation	—Unverified
Knowledge-Guided Recurrent Neural Network Learning for Task-Oriented Action Prediction	Jul 15, 2017	Common Sense Reasoningvalid	—Unverified
Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models	Oct 28, 2022	Common Sense ReasoningCoreference Resolution	—Unverified
KnowRA: Knowledge Retrieval Augmented Method for Document-level Relation Extraction with Comprehensive Reasoning Abilities	Dec 31, 2024	Common Sense ReasoningDocument-level Relation Extraction	—Unverified
Know your exceptions: Towards an Ontology of Exceptions in Knowledge Representation	Mar 1, 2024	Common Sense Reasoningvalid	—Unverified
KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge	Feb 18, 2020	Common Sense Reasoningcontinuous-control	—Unverified
K-VQG: Knowledge-aware Visual Question Generation for Common-sense Acquisition	Mar 15, 2022	Common Sense ReasoningQuestion Generation	—Unverified
K-XLNet: A General Method for Combining Explicit Knowledge with Language Model Pretraining	Mar 25, 2021	Common Sense ReasoningLanguage Modeling	—Unverified
Language Models as Fact Checkers?	Jun 7, 2020	Common Sense ReasoningLanguage Modeling	—Unverified
Large Language Models are Effective Priors for Causal Graph Discovery	May 22, 2024	Common Sense Reasoning	—Unverified
Large Language Models are Zero-Shot Recognizers for Activities of Daily Living	Jul 1, 2024	Common Sense Reasoningenergy management	—Unverified
Large Language Models as Common-Sense Heuristics	Jan 31, 2025	Common Sense Reasoning	—Unverified
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection	Jan 26, 2025	Common Sense Reasoningcounterfactual	—Unverified
Large Language Models Can Self-Improve	Oct 20, 2022	Arithmetic ReasoningCommon Sense Reasoning	—Unverified
Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks	Feb 16, 2023	Common Sense Reasoning	—Unverified
Large-Scale Acquisition of Commonsense Knowledge via a Quiz Game on a Dialogue System	Dec 1, 2016	Common Sense ReasoningQuestion Answering	—Unverified
Latest News in Computational Argumentation: Surfing on the Deep Learning Wave, Scuba Diving in the Abyss of Fundamental Questions	Sep 1, 2017	Common Sense Reasoning	—Unverified
LC-LLM: Explainable Lane-Change Intention and Trajectory Predictions with Large Language Models	Mar 27, 2024	Autonomous VehiclesCommon Sense Reasoning	—Unverified
Learning-based Practical Smartphone Eavesdropping with Built-in Accelerometer	Feb 26, 2020	Common Sense Reasoning	—Unverified
Learning Common Sense Through Visual Abstraction	Dec 1, 2015	Common Sense Reasoning	—Unverified
Learning Continuous 3D Reconstructions for Geometrically Aware Grasping	Oct 2, 2019	3D geometry3D Reconstruction	—Unverified
Learning Fine-Grained Knowledge about Contingent Relations between Everyday Events	Aug 30, 2017	Common Sense ReasoningQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 19 of 19Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified