Common Sense Reasoning

Common sense reasoning tasks are intended to require the model to go beyond pattern recognition. Instead, the model should use "common sense" or world knowledge to make inferences.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 476–500 of 939 papers

Title	Date	Tasks	Status
Witscript 3: A Hybrid AI System for Improvising Jokes in a Conversation	Jan 6, 2023	ChatbotCommon Sense Reasoning	—Unverified
A Theory of Human-Like Few-Shot Learning	Jan 3, 2023	Common Sense ReasoningFew-Shot Learning	—Unverified
CHORUS : Learning Canonicalized 3D Human-Object Spatial Relations from Unbounded Synthesized Images	Jan 1, 2023	Common Sense ReasoningDiversity	—Unverified
Despite "super-human" performance, current LLMs are unsuited for decisions about ethics and safety	Dec 13, 2022	Common Sense ReasoningEthics	—Unverified
VASR: Visual Analogies of Situation Recognition	Dec 8, 2022	Common Sense ReasoningTriplet	CodeCode Available
Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE	Dec 4, 2022	Common Sense Reasoningcoreference-resolution	—Unverified
Legal Prompting: Teaching a Language Model to Think Like a Lawyer	Dec 2, 2022	Common Sense ReasoningLanguage Modeling	—Unverified
SimpleMind adds thinking to deep neural networks	Dec 2, 2022	Common Sense ReasoningDecision Making	CodeCode Available
Exploiting Proximity-Aware Tasks for Embodied Social Navigation	Dec 1, 2022	Common Sense ReasoningNavigate	—Unverified
On Utilizing Relationships for Transferable Few-Shot Fine-Grained Object Detection	Dec 1, 2022	Common Sense ReasoningObject	—Unverified
DiffG-RL: Leveraging Difference between State and Common Sense	Nov 29, 2022	Common Sense Reasoningtext-based games	CodeCode Available
A mathematical theory of super-resolution and two-point resolution	Nov 28, 2022	Common Sense ReasoningSuper-Resolution	—Unverified
A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset	Nov 19, 2022	Common Sense ReasoningGraph Embedding	—Unverified
Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models	Nov 17, 2022	Common Sense Reasoning	—Unverified
CAPE: Corrective Actions from Precondition Errors using Large Language Models	Nov 17, 2022	Common Sense ReasoningLanguage Modeling	—Unverified
Eliciting Knowledge from Large Pre-Trained Models for Unsupervised Knowledge-Grounded Conversation	Nov 3, 2022	Common Sense ReasoningDialogue Generation	CodeCode Available
Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models	Oct 28, 2022	Common Sense ReasoningCoreference Resolution	—Unverified
GradSkip: Communication-Accelerated Local Gradient Methods with Better Computational Complexity	Oct 28, 2022	Common Sense ReasoningDistributed Optimization	CodeCode Available
LMPriors: Pre-Trained Language Models as Task-Specific Priors	Oct 22, 2022	Causal InferenceCommon Sense Reasoning	—Unverified
Large Language Models Can Self-Improve	Oct 20, 2022	Arithmetic ReasoningCommon Sense Reasoning	—Unverified
Commonsense Knowledge from Scene Graphs for Textual Environments	Oct 19, 2022	Common Sense Reasoningtext-based games	—Unverified
Perplexity from PLM Is Unreliable for Evaluating Text Quality	Oct 12, 2022	Common Sense Reasoning	—Unverified
A survey of Identification and mitigation of Machine Learning algorithmic biases in Image Analysis	Oct 10, 2022	Common Sense ReasoningFairness	—Unverified
Modular Approach to Machine Reading Comprehension: Mixture of Task-Aware Experts	Oct 4, 2022	Common Sense ReasoningMachine Reading Comprehension	—Unverified
Robot Task Planning and Situation Handling in Open Worlds	Oct 4, 2022	Common Sense ReasoningRobot Task Planning	—Unverified

Show:10 25 50

← PrevPage 20 of 38Next →

All datasets WinoGrande arc_challenge arc_easy ReCoRD CommonsenseQA PARus RuCoS RWSD BIG-bench (Causal Judgment)BIG-bench (Date Understanding)BIG-bench (Disambiguation QA)BIG-bench (Sports Understanding)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	96.1	—	Unverified
2	Unicorn 11B (fine-tuned)	Accuracy	91.3	—	Unverified
3	CompassMTL 567M with Tailor	Accuracy	90.5	—	Unverified
4	CompassMTL 567M	Accuracy	89.6	—	Unverified
5	UnifiedQA 11B (fine-tuned)	Accuracy	89.4	—	Unverified
6	Claude 3 Opus (5-shot)	Accuracy	88.5	—	Unverified
7	GPT-4 (5-shot)	Accuracy	87.5	—	Unverified
8	ExDeBERTa 567M	Accuracy	87	—	Unverified
9	LLaMA-2 13B + MixLoRA	Accuracy	86.3	—	Unverified
10	LLaMA3 8B+MoSLoRA	Accuracy	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	GPT-4 (few-shot, k=25)	Accuracy	96.4	—	Unverified
2	PaLM 2 (few-shot, CoT, SC)	Accuracy	95.1	—	Unverified
3	Shivaay (4B, few-shot, k=8)	Accuracy	91.04	—	Unverified
4	StupidLLM	Accuracy	91.03	—	Unverified
5	Claude 2 (few-shot, k=5)	Accuracy	91	—	Unverified
6	Claude 1.3 (few-shot, k=5)	Accuracy	90	—	Unverified
7	PaLM 540B (Self Improvement, Self Consistency)	Accuracy	89.8	—	Unverified
8	PaLM 540B (Self Consistency)	Accuracy	88.7	—	Unverified
9	PaLM 540B (Self Improvement, CoT Prompting)	Accuracy	88.3	—	Unverified
10	PaLM 540B (Self Improvement, Standard-Prompting)	Accuracy	87.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ST-MoE-32B 269B (fine-tuned)	Accuracy	95.2	—	Unverified
2	LLaMA 3 8B+MoSLoRA (fine-tuned)	Accuracy	90.5	—	Unverified
3	PaLM 2-L (1-shot)	Accuracy	89.7	—	Unverified
4	PaLM 2-M (1-shot)	Accuracy	88	—	Unverified
5	LLaMA-3 8B + MixLoRA	Accuracy	86.5	—	Unverified
6	Camelidae-8×34B	Accuracy	86.2	—	Unverified
7	PaLM 2-S (1-shot)	Accuracy	85.6	—	Unverified
8	LLaMA 65B + CFG (0-shot)	Accuracy	84.2	—	Unverified
9	GAL 120B (0-shot)	Accuracy	83.8	—	Unverified
10	LLaMA-2 13B + MixLoRA	Accuracy	83.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Turing NLR v5 XXL 5.4B (fine-tuned)	EM	95.9	—	Unverified
2	ST-MoE-32B 269B (fine-tuned)	EM	95.1	—	Unverified
3	T5-11B	F1	94.1	—	Unverified
4	DeBERTa-1.5B	EM	94.1	—	Unverified
5	PaLM 540B (finetuned)	EM	94	—	Unverified
6	Vega v2 6B (fine-tuned)	EM	93.9	—	Unverified
7	PaLM 2-L (one-shot)	F1	93.8	—	Unverified
8	T5-XXL 11B (fine-tuned)	EM	93.4	—	Unverified
9	PaLM 2-M (one-shot)	F1	92.4	—	Unverified
10	PaLM 2-S (one-shot)	F1	92.1	—	Unverified