Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 351–400 of 939 papers

Title	Date	Tasks	Status	Hype
Vision Language Pre-training by Contrastive Learning with Cross-Modal Similarity Regulation	May 8, 2023	Common Sense ReasoningContrastive Learning	—Unverified	0
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality	Apr 28, 2023	Causal DiscoveryCommon Sense Reasoning	CodeCode Available	2
LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions	Apr 27, 2023	Common Sense ReasoningCoreference Resolution	CodeCode Available	2
Cluster Flow: how a hierarchical clustering layer make allows deep-NNs more resilient to hacking, more human-like and easily implements relational reasoning	Apr 27, 2023	Common Sense ReasoningOdd One Out	—Unverified	0
Reporting delays: a widely neglected impact factor in COVID-19 forecasts	Apr 24, 2023	Common Sense Reasoning	—Unverified	0
Boosting Theory-of-Mind Performance in Large Language Models via Prompting	Apr 22, 2023	Common Sense ReasoningIn-Context Learning	CodeCode Available	1
A Group-Specific Approach to NLP for Hate Speech Detection	Apr 21, 2023	Common Sense ReasoningEthics	CodeCode Available	0
Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling	Apr 3, 2023	Common Sense ReasoningCoreference Resolution	CodeCode Available	6
Humans in Humans Out: On GPT Converging Toward Common Sense in both Success and Failure	Mar 30, 2023	Common Sense ReasoningDecision Making	—Unverified	0
BloombergGPT: A Large Language Model for Finance	Mar 30, 2023	Causal JudgmentCommon Sense Reasoning	CodeCode Available	0
TaskMatrix.AI: Completing Tasks by Connecting Foundation Models with Millions of APIs	Mar 29, 2023	Code GenerationCommon Sense Reasoning	—Unverified	0
Converging Measures and an Emergent Model: A Meta-Analysis of Human-Automation Trust Questionnaires	Mar 24, 2023	Common Sense ReasoningSurvey	—Unverified	0
GrapeQA: GRaph Augmentation and Pruning to Enhance Question-Answering	Mar 22, 2023	Common Sense ReasoningKnowledge Graphs	—Unverified	0
Mind meets machine: Unravelling GPT-4's cognitive psychology	Mar 20, 2023	Common Sense ReasoningDecision Making	—Unverified	0
FVQA 2.0: Introducing Adversarial Samples into Fact-based Visual Question Answering	Mar 19, 2023	Common Sense ReasoningInformation Retrieval	—Unverified	0
GPT-4 Technical Report	Mar 15, 2023	answerability predictionArithmetic Reasoning	CodeCode Available	6
Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images	Mar 13, 2023	Common Sense ReasoningExplanation Generation	—Unverified	0
LUKE-Graph: A Transformer-based Approach with Gated Relational Graph Attention for Cloze-style Reading Comprehension	Mar 12, 2023	Common Sense ReasoningGraph Attention	—Unverified	0
A primer on getting neologisms from foreign languages to under-resourced languages	Mar 7, 2023	Common Sense Reasoning	—Unverified	0
A Vision for Semantically Enriched Data Science	Mar 2, 2023	Common Sense ReasoningData Augmentation	—Unverified	0
Do Machine Learning Models Learn Statistical Rules Inferred from Data?	Mar 2, 2023	Common Sense ReasoningImputation	CodeCode Available	0
LLaMA: Open and Efficient Foundation Language Models	Feb 27, 2023	Arithmetic ReasoningCode Generation	CodeCode Available	7
HL Dataset: Visually-grounded Description of Scenes, Actions and Rationales	Feb 23, 2023	Common Sense ReasoningVocal Bursts Intensity Prediction	CodeCode Available	0
Framework for Certification of AI-Based Systems	Feb 21, 2023	Common Sense Reasoning	—Unverified	0
Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks	Feb 16, 2023	Common Sense Reasoning	—Unverified	0
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training	Feb 14, 2023	Common Sense Reasoning	—Unverified	0
Guiding Pretraining in Reinforcement Learning with Large Language Models	Feb 13, 2023	Common Sense ReasoningLanguage Modeling	CodeCode Available	1
Benchmarks for Automated Commonsense Reasoning: A Survey	Feb 9, 2023	Common Sense ReasoningSurvey	—Unverified	0
Exploring the Benefits of Training Expert Language Models over Instruction Tuning	Feb 7, 2023	Common Sense ReasoningCoreference Resolution	CodeCode Available	1
Witscript 2: A System for Generating Improvised Jokes Without Wordplay	Feb 3, 2023	ChatbotCommon Sense Reasoning	—Unverified	0
Planning Automated Driving with Accident Experience Referencing and Common-sense Inferencing	Jan 26, 2023	Common Sense ReasoningDecision Making	—Unverified	0
Mathematics, word problems, common sense, and artificial intelligence	Jan 23, 2023	Common Sense Reasoning	—Unverified	0
Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation	Jan 22, 2023	Common Sense ReasoningImage Captioning	—Unverified	0
Witscript 3: A Hybrid AI System for Improvising Jokes in a Conversation	Jan 6, 2023	ChatbotCommon Sense Reasoning	—Unverified	0
A Theory of Human-Like Few-Shot Learning	Jan 3, 2023	Common Sense ReasoningFew-Shot Learning	—Unverified	0
SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot	Jan 2, 2023	Common Sense ReasoningLanguage Modelling	CodeCode Available	4
CHORUS : Learning Canonicalized 3D Human-Object Spatial Relations from Unbounded Synthesized Images	Jan 1, 2023	Common Sense ReasoningDiversity	—Unverified	0
Reasoning with Language Model Prompting: A Survey	Dec 19, 2022	Arithmetic ReasoningCommon Sense Reasoning	CodeCode Available	3
Large Language Models are Better Reasoners with Self-Verification	Dec 19, 2022	Arithmetic ReasoningCommon Sense Reasoning	CodeCode Available	1
Despite "super-human" performance, current LLMs are unsuited for decisions about ethics and safety	Dec 13, 2022	Common Sense ReasoningEthics	—Unverified	0
VASR: Visual Analogies of Situation Recognition	Dec 8, 2022	Common Sense ReasoningTriplet	CodeCode Available	0
Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE	Dec 4, 2022	Common Sense Reasoningcoreference-resolution	—Unverified	0
SimpleMind adds thinking to deep neural networks	Dec 2, 2022	Common Sense ReasoningDecision Making	CodeCode Available	0
Legal Prompting: Teaching a Language Model to Think Like a Lawyer	Dec 2, 2022	Common Sense ReasoningLanguage Modeling	—Unverified	0
On Utilizing Relationships for Transferable Few-Shot Fine-Grained Object Detection	Dec 1, 2022	Common Sense ReasoningObject	—Unverified	0
Exploiting Proximity-Aware Tasks for Embodied Social Navigation	Dec 1, 2022	Common Sense ReasoningNavigate	—Unverified	0
Layout-aware Dreamer for Embodied Referring Expression Grounding	Nov 30, 2022	Common Sense ReasoningNavigate	CodeCode Available	1
DiffG-RL: Leveraging Difference between State and Common Sense	Nov 29, 2022	Common Sense Reasoningtext-based games	CodeCode Available	0
A mathematical theory of super-resolution and two-point resolution	Nov 28, 2022	Common Sense ReasoningSuper-Resolution	—Unverified	0
A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset	Nov 19, 2022	Common Sense ReasoningGraph Embedding	—Unverified	0

Show:10 25 50

← PrevPage 8 of 19Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified