Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 826–850 of 939 papers

Title	Date	Tasks	Status
Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-based Decision-Making Systems	May 27, 2024	Autonomous DrivingCommon Sense Reasoning	—Unverified
Exploring Unsupervised Pretraining and Sentence Structure Modelling for Winograd Schema Challenge	Apr 22, 2019	Common Sense ReasoningSentence	—Unverified
Extended HowNet 2.0 -- An Entity-Relation Common-Sense Representation Model	May 1, 2018	Common Sense ReasoningInformation Retrieval	—Unverified
Extracting Zero-shot Common Sense from Large Language Models for Robot 3D Scene Understanding	Jun 9, 2022	Common Sense ReasoningScene Understanding	—Unverified
Extraction of Common-Sense Relations from Procedural Task Instructions using BERT	Jan 1, 2021	Common Sense Reasoning	—Unverified
Features of Verb Complements in Co-composition: A case study of Chinese baking verb using Weibo corpus	Sep 1, 2013	Common Sense ReasoningWord Sense Disambiguation	—Unverified
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering	May 22, 2024	Common Sense ReasoningGraph Question Answering	—Unverified
Fine-grained evaluation of Quality Estimation for Machine translation based on a linguistically motivated Test Suite	Mar 1, 2018	Automatic Post-EditingCommon Sense Reasoning	—Unverified
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement	Jan 1, 2025	3D geometryCommon Sense Reasoning	—Unverified
Forecasting Social Navigation in Crowded Complex Scenes	Jan 5, 2016	Common Sense ReasoningNavigate	—Unverified
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models	Apr 29, 2024	Common Sense ReasoningMultiple-choice	—Unverified
Fractional trends and cycles in macroeconomic time series	May 23, 2020	Common Sense ReasoningTime Series	—Unverified
Framework for Certification of AI-Based Systems	Feb 21, 2023	Common Sense Reasoning	—Unverified
Free Will Belief as a consequence of Model-based Reinforcement Learning	Nov 14, 2021	Common Sense ReasoningDecision Making	—Unverified
FRIDA to the Rescue! Analyzing Synthetic Data Effectiveness in Object-Based Common Sense Reasoning for Disaster Response	Feb 25, 2025	Common Sense ReasoningDisaster Response	—Unverified
From Blind Solvers to Logical Thinkers: Benchmarking LLMs' Logical Integrity on Faulty Mathematical Problems	Oct 24, 2024	BenchmarkingCommon Sense Reasoning	—Unverified
From Common Sense Reasoning to Neural Network Models through Multiple Preferences: an overview	Jul 10, 2021	Common Sense Reasoning	—Unverified
Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs	Oct 9, 2024	Common Sense ReasoningMixture-of-Experts	—Unverified
FusionSense: Bridging Common Sense, Vision, and Touch for Robust Sparse-View Reconstruction	Oct 10, 2024	3D ReconstructionCommon Sense Reasoning	—Unverified
FVQA 2.0: Introducing Adversarial Samples into Fact-based Visual Question Answering	Mar 19, 2023	Common Sense ReasoningInformation Retrieval	—Unverified
FVQA: Fact-based Visual Question Answering	Jun 17, 2016	Common Sense ReasoningQuestion Answering	—Unverified
Gaze-Enabled Egocentric Video Summarization via Constrained Submodular Maximization	Jun 1, 2015	Combinatorial OptimizationCommon Sense Reasoning	—Unverified
Generating Interactive Worlds with Text	Nov 20, 2019	BIG-bench Machine LearningCommon Sense Reasoning	—Unverified
Generating Natural Questions from Images for Multimodal Assistants	Nov 17, 2020	Common Sense ReasoningNatural Questions	—Unverified
Generating Out-Of-Distribution Scenarios Using Language Models	Nov 25, 2024	Autonomous DrivingAutonomous Vehicles	—Unverified

Show:10 25 50

← PrevPage 34 of 38Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified