Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 601–650 of 939 papers

Title	Date	Tasks	Status
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning	Feb 19, 2025	Common Sense ReasoningLanguage Modeling	—Unverified
Vision Language Pre-training by Contrastive Learning with Cross-Modal Similarity Regulation	May 8, 2023	Common Sense ReasoningContrastive Learning	—Unverified
Vision-Language Models Provide Promptable Representations for Reinforcement Learning	Feb 5, 2024	Common Sense ReasoningInstruction Following	—Unverified
VisualBackProp for learning using privileged information with CNNs	May 24, 2018	Autonomous DrivingBIG-bench Machine Learning	—Unverified
Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning	Oct 4, 2024	Common Sense Reasoning	—Unverified
Visual Question Answering as Reading Comprehension	Nov 29, 2018	Common Sense ReasoningGeneral Knowledge	—Unverified
Visual Relationship Detection Based on Guided Proposals and Semantic Knowledge Distillation	May 28, 2018	Common Sense ReasoningKnowledge Distillation	—Unverified
Visual search and recognition for robot task execution and monitoring	Feb 7, 2019	Common Sense ReasoningDeep Reinforcement Learning	—Unverified
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks	Dec 24, 2024	Common Sense ReasoningTransfer Learning	—Unverified
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model	Oct 11, 2024	Common Sense ReasoningLanguage Modeling	—Unverified
Vocab-Expander: A System for Creating Domain-Specific Vocabularies Based on Word Embeddings	Aug 7, 2023	Common Sense ReasoningInformation Retrieval	—Unverified
We Usually Don't Like Going to the Dentist: Using Common Sense to Detect Irony on Twitter	Dec 1, 2018	Common Sense ReasoningGeneral Classification	—Unverified
What does the Failure to Reason with "Respectively" in Zero/Few-Shot Settings Tell Us about Language Models?	May 31, 2023	Common Sense ReasoningFew-Shot Learning	—Unverified
What Is Near?: Room Locality Learning for Enhanced Robot Vision-Language-Navigation in Indoor Living Environments	Sep 10, 2023	Common Sense ReasoningDecision Making	—Unverified
When Large Language Models Meet Personalization: Perspectives of Challenges and Opportunities	Jul 31, 2023	Common Sense Reasoning	—Unverified
Whispering Experts: Neural Interventions for Toxicity Mitigation in Language Models	Jul 2, 2024	Common Sense Reasoning	—Unverified
Why Does the VQA Model Answer No?: Improving Reasoning through Visual and Linguistic Inference	Sep 25, 2019	Common Sense ReasoningQuestion Answering	—Unverified
Why Do Masked Neural Language Models Still Need Common Sense Knowledge?	Nov 8, 2019	Common Sense ReasoningQuestion Answering	—Unverified
Wikipedia-based Semantic Interpretation for Natural Language Processing	Jan 15, 2014	Common Sense ReasoningText Categorization	—Unverified
Winograd Schema - Knowledge Extraction Using Narrative Chains	Jan 8, 2018	Common Sense ReasoningSentence	—Unverified
WinoWhat: A Parallel Corpus of Paraphrased WinoGrande Sentences with Common Sense Categorization	Mar 31, 2025	Common Sense ReasoningMemorization	—Unverified
Witscript 2: A System for Generating Improvised Jokes Without Wordplay	Feb 3, 2023	ChatbotCommon Sense Reasoning	—Unverified
Witscript 3: A Hybrid AI System for Improvising Jokes in a Conversation	Jan 6, 2023	ChatbotCommon Sense Reasoning	—Unverified
Zero-Shot Calibration of Fisheye Cameras	Nov 30, 2020	Camera CalibrationCommon Sense Reasoning	—Unverified
Zero-Shot Learning with Common Sense Knowledge Graphs	Sep 28, 2020	Common Sense ReasoningEntity Typing	—Unverified
0/1 Deep Neural Networks via Block Coordinate Descent	Jun 19, 2022	10-shot image generation	—Unverified
Large Language Models are Zero-Shot Recognizers for Activities of Daily Living	Jul 1, 2024	Common Sense Reasoningenergy management	—Unverified
Large Language Models as Common-Sense Heuristics	Jan 31, 2025	Common Sense Reasoning	—Unverified
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection	Jan 26, 2025	Common Sense Reasoningcounterfactual	—Unverified
Large Language Models Can Self-Improve	Oct 20, 2022	Arithmetic ReasoningCommon Sense Reasoning	—Unverified
Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks	Feb 16, 2023	Common Sense Reasoning	—Unverified
Large-Scale Acquisition of Commonsense Knowledge via a Quiz Game on a Dialogue System	Dec 1, 2016	Common Sense ReasoningQuestion Answering	—Unverified
Latest News in Computational Argumentation: Surfing on the Deep Learning Wave, Scuba Diving in the Abyss of Fundamental Questions	Sep 1, 2017	Common Sense Reasoning	—Unverified
LC-LLM: Explainable Lane-Change Intention and Trajectory Predictions with Large Language Models	Mar 27, 2024	Autonomous VehiclesCommon Sense Reasoning	—Unverified
Learning-based Practical Smartphone Eavesdropping with Built-in Accelerometer	Feb 26, 2020	Common Sense Reasoning	—Unverified
Learning Common Sense Through Visual Abstraction	Dec 1, 2015	Common Sense Reasoning	—Unverified
Learning Continuous 3D Reconstructions for Geometrically Aware Grasping	Oct 2, 2019	3D geometry3D Reconstruction	—Unverified
Learning Fine-Grained Knowledge about Contingent Relations between Everyday Events	Aug 30, 2017	Common Sense ReasoningQuestion Answering	—Unverified
Learning from Maps: Visual Common Sense for Autonomous Driving	Nov 25, 2016	Autonomous DrivingAutonomous Vehicles	—Unverified
Learning Object Placement by Inpainting for Compositional Data Augmentation	Aug 1, 2020	Common Sense ReasoningData Augmentation	—Unverified
Learning Open Information Extraction of Implicit Relations from Reading Comprehension Datasets	May 15, 2019	Common Sense ReasoningImplicit Relations	—Unverified
Learning Physical Common Sense as Knowledge Graph Completion via BERT Data Augmentation and Constrained Tucker Factorization	Nov 1, 2020	Common Sense ReasoningData Augmentation	—Unverified
Learning Prototypical Event Structure from Photo Albums	Aug 1, 2016	ClusteringCommon Sense Reasoning	—Unverified
Learning Semantic Script Knowledge with Event Embeddings	Dec 18, 2013	Common Sense Reasoning	—Unverified
Learning Spatial Common Sense with Geometry-Aware Recurrent Networks	Dec 31, 2018	Common Sense ReasoningRepresentation Learning	—Unverified
Learning Spatial Knowledge for Text to 3D Scene Generation	Oct 1, 2014	Common Sense ReasoningScene Generation	—Unverified
Learning the Impact and Behavior of Syntactic Structure: A Case Study in Semantic Textual Similarity	Sep 1, 2015	Common Sense ReasoningSemantic Textual Similarity	—Unverified
Learning to Rank Semantic Coherence for Topic Segmentation	Sep 1, 2017	Common Sense ReasoningDiscourse Parsing	—Unverified
Learning to ``Read Between the Lines'' using Bayesian Logic Programs	Jul 1, 2012	Common Sense ReasoningReading Comprehension	—Unverified
Legal Prompting: Teaching a Language Model to Think Like a Lawyer	Dec 2, 2022	Common Sense ReasoningLanguage Modeling	—Unverified

Show:10 25 50

← PrevPage 13 of 19Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified