Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 401–450 of 939 papers

Title	Date	Tasks	Status	Hype
Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models	Nov 17, 2022	Common Sense Reasoning	—Unverified	0
CAPE: Corrective Actions from Precondition Errors using Large Language Models	Nov 17, 2022	Common Sense ReasoningLanguage Modeling	—Unverified	0
Galactica: A Large Language Model for Science	Nov 16, 2022	AnachronismsBias Detection	CodeCode Available	4
Eliciting Knowledge from Large Pre-Trained Models for Unsupervised Knowledge-Grounded Conversation	Nov 3, 2022	Common Sense ReasoningDialogue Generation	CodeCode Available	0
Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models	Oct 28, 2022	Common Sense ReasoningCoreference Resolution	—Unverified	0
GradSkip: Communication-Accelerated Local Gradient Methods with Better Computational Complexity	Oct 28, 2022	Common Sense ReasoningDistributed Optimization	CodeCode Available	0
LMPriors: Pre-Trained Language Models as Task-Specific Priors	Oct 22, 2022	Causal InferenceCommon Sense Reasoning	—Unverified	0
Large Language Models Can Self-Improve	Oct 20, 2022	Arithmetic ReasoningCommon Sense Reasoning	—Unverified	0
Commonsense Knowledge from Scene Graphs for Textual Environments	Oct 19, 2022	Common Sense Reasoningtext-based games	—Unverified	0
Deep Bidirectional Language-Knowledge Graph Pretraining	Oct 17, 2022	Common Sense ReasoningKnowledge Graphs	CodeCode Available	2
Behavior Cloned Transformers are Neurosymbolic Reasoners	Oct 13, 2022	Common Sense Reasoning	CodeCode Available	1
Task Compass: Scaling Multi-task Pre-training with Task Prefix	Oct 12, 2022	Common Sense ReasoningData Augmentation	CodeCode Available	1
Perplexity from PLM Is Unreliable for Evaluating Text Quality	Oct 12, 2022	Common Sense Reasoning	—Unverified	0
A survey of Identification and mitigation of Machine Learning algorithmic biases in Image Analysis	Oct 10, 2022	Common Sense ReasoningFairness	—Unverified	0
Guess the Instruction! Flipped Learning Makes Language Models Stronger Zero-Shot Learners	Oct 6, 2022	Common Sense ReasoningCoreference Resolution	CodeCode Available	1
Large Language Models are Pretty Good Zero-Shot Video Game Bug Detectors	Oct 5, 2022	Common Sense ReasoningLanguage Modelling	CodeCode Available	1
Robot Task Planning and Situation Handling in Open Worlds	Oct 4, 2022	Common Sense ReasoningRobot Task Planning	—Unverified	0
Modular Approach to Machine Reading Comprehension: Mixture of Task-Aware Experts	Oct 4, 2022	Common Sense ReasoningMachine Reading Comprehension	—Unverified	0
KC-ISA: An Implicit Sentiment Analysis Model Combining Knowledge Enhancement and Context Features	Oct 1, 2022	Common Sense ReasoningSentiment Analysis	CodeCode Available	0
COMMA-DEER: COmmon-sense Aware Multimodal Multitask Approach for Detection of Emotion and Emotional Reasoning in Conversations	Oct 1, 2022	Common Sense Reasoning	—Unverified	0
Do ever larger octopi still amplify reporting biases? Evidence from judgments of typical colour	Sep 26, 2022	Common Sense ReasoningPhysical Commonsense Reasoning	—Unverified	0
Decentralized Vehicle Coordination: The Berkeley DeepDrive Drone Dataset and Consensus-Based Models	Sep 19, 2022	Collision AvoidanceCommon Sense Reasoning	—Unverified	0
ERNIE-mmLayout: Multi-grained MultiModal Transformer for Document Understanding	Sep 18, 2022	Common Sense Reasoningdocument understanding	—Unverified	0
Assessment of cognitive characteristics in intelligent systems and predictive ability	Sep 16, 2022	Common Sense Reasoning	—Unverified	0
The Embeddings World and Artificial General Intelligence	Sep 14, 2022	Common Sense Reasoning	—Unverified	0
Leveraging Large (Visual) Language Models for Robot 3D Scene Understanding	Sep 12, 2022	Common Sense ReasoningScene Classification	CodeCode Available	1
Elaboration-Generating Commonsense Question Answering at Scale	Sep 2, 2022	Common Sense ReasoningQuestion Answering	CodeCode Available	0
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents	Aug 28, 2022	Action GenerationCommon Sense Reasoning	—Unverified	0
On Reality and the Limits of Language Data: Aligning LLMs with Human Norms	Aug 25, 2022	Common Sense Reasoning	—Unverified	0
Exploiting Sentiment and Common Sense for Zero-shot Stance Detection	Aug 18, 2022	Common Sense ReasoningStance Detection	CodeCode Available	0
Intrinsically Motivated Learning of Causal World Models	Aug 9, 2022	Common Sense Reasoningreinforcement-learning	—Unverified	0
AlexaTM 20B: Few-Shot Learning Using a Large-Scale Multilingual Seq2Seq Model	Aug 2, 2022	Causal Language ModelingCommon Sense Reasoning	CodeCode Available	2
TextWorldExpress: Simulating Text Games at One Million Steps Per Second	Aug 1, 2022	Common Sense Reasoningtext-based games	CodeCode Available	1
PASTA: A Dataset for Modeling Participant States in Narratives	Jul 31, 2022	BenchmarkingCommon Sense Reasoning	—Unverified	0
Neuro-Symbolic Learning: Principles and Applications in Ophthalmology	Jul 31, 2022	Common Sense ReasoningImage Captioning	—Unverified	0
WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models	Jul 25, 2022	Common Sense ReasoningGeneral Knowledge	CodeCode Available	0
V-Coder: Adaptive AutoEncoder for Semantic Disclosure in Knowledge Graphs	Jul 22, 2022	Common Sense ReasoningDisentanglement	—Unverified	0
Rethinking Alignment in Video Super-Resolution Transformers	Jul 18, 2022	Common Sense ReasoningSuper-Resolution	CodeCode Available	1
Reasoning about Actions over Visual and Linguistic Modalities: A Survey	Jul 15, 2022	Common Sense ReasoningSurvey	—Unverified	0
N-Grammer: Augmenting Transformers with latent n-grams	Jul 13, 2022	Common Sense ReasoningCoreference Resolution	CodeCode Available	4
Multi-label Classification with High-rank and High-order Label Correlations	Jul 9, 2022	Common Sense ReasoningMulti-Label Classification	CodeCode Available	1
Ask Me What You Need: Product Retrieval using Knowledge from GPT-3	Jul 6, 2022	Common Sense ReasoningQuestion Answering	—Unverified	0
Is “My Favorite New Movie” My Favorite Movie? Probing the Understanding of Recursive Noun Phrases	Jul 1, 2022	Common Sense ReasoningNatural Language Inference	—Unverified	0
A Systematic Survey of Text Worlds as Embodied Natural Language Environments	Jul 1, 2022	Common Sense ReasoningKnowledge Graphs	—Unverified	0
PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change	Jun 21, 2022	Common Sense ReasoningDiversity	CodeCode Available	2
0/1 Deep Neural Networks via Block Coordinate Descent	Jun 19, 2022	10-shot image generation	—Unverified	0
Symbolic image detection using scene and knowledge graphs	Jun 10, 2022	Common Sense ReasoningKnowledge Graphs	CodeCode Available	0
Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models	Jun 9, 2022	Common Sense ReasoningMath	CodeCode Available	4
Extracting Zero-shot Common Sense from Large Language Models for Robot 3D Scene Understanding	Jun 9, 2022	Common Sense ReasoningScene Understanding	—Unverified	0
RELATE: Generating a linguistically inspired Knowledge Graph for fine-grained emotion classification	Jun 1, 2022	Common Sense ReasoningEmotion Classification	—Unverified	0

Show:10 25 50

← PrevPage 9 of 19Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified